祝贺实验室团队博士生檀璇一篇论文Mask-guided Asymmetric Contrastive and Semantic Alignment for Unsupervised Person Re-Identification被IEEE TIP录用。
无监督行人重识别(ReID)旨在不依赖人工标注的前提下学习具备身份区分能力的特征表示。但该任务存在诸多难点:伪标签噪声干扰、背景杂乱干扰、行人外观差异幅度大。现有研究证实,挖掘细粒度局部特征线索,是提升无监督行人重识别模型鲁棒性的关键。在此研究背景下,随机掩码策略成为一种无需标注、操作简便的手段,能够引导模型聚焦图像中富含判别信息的区域。然而,现有基于掩码的无监督行人重识别方法仍存在两大缺陷:掩码视图利用不充分:掩码图像仅被当作质量受损的辅助样本,未能将其作为细粒度监督信号充分挖掘;跨视图对齐能力薄弱:特征对齐仅局限于小批次样本配对,缺少跨聚类、掩码视图与原始视图之间显式的全局对齐约束。针对上述问题,本文提出掩码引导的非对称对比与语义对齐框架。具体而言,我们设计非对称对比学习模块,搭配双记忆库机制,对掩码特征与原始无掩码特征进行独立编码,让掩码视图成为富含判别信息的有效监督源。与此同时,语义对齐学习(SAL)模块通过对齐聚类级原型与随机采样的实例级特征,实现多粒度分布对齐,在保证语义一致性的同时保留聚类内部样本的特征多样性。此外,为在含噪声伪标签条件下为语义对齐学习提供更可靠的语义锚点,本文引入渐进式优化模块:该模块借助指数移动平均算法迭代优化原型与样本特征,使语义对齐过程更加稳定。大量对比实验验证了本文方法的优越性能,其效果甚至优于部分有监督行人重识别算法。

祝贺实验室团队硕士生王雨滨一篇论文ActPrompt: In-Domain Feature Adaptation via Action Cues for Video Temporal Grounding被IEEE TIP录用。
本文提出 ActPrompt,一种基于动作线索注入的时域提示学习方法,用于视频时域定位任务中的域内特征适配。针对现有视觉-语言模型(VLM)在视频时域定位任务中因图像预训练导致的对动作敏感模式识别不足的问题,本文设计了一种高效的域内微调策略,通过两项预文本任务(时刻-查询对排序与对比学习)引导模型挖掘时域信息。进一步,提出动作线索注入模块(ACI),将视频编码器和文本编码器生成的动作线索以提示形式注入图像编码器,增强其对动作相关区域的关注;同时引入上下文感知时域提示学习模块(CTPL),通过选择连续帧中动作敏感区域并建模其时序上下文,提升模型对动作信息的建模能力。实验结果表明,ActPrompt可作为即插即用模块集成至多种现有方法中,在QVHighlights、Charades-STA、TACoS和YouTube Highlights等数据集上均取得显著性能提升。

祝贺实验室团队硕士生顾文涛一篇论文Federated Parameter-Efficient Selective Fine-Tuning for Vision-Language Models via Global-Local Masking被ACMMM 2026录用。
现有参数高效微调方法虽然在已见类别和本地域上表现良好,但往往难以同时兼顾未见类别的泛化能力以及不同客户端之间的性能平衡。为此,本文提出个性化联邦选择式参数高效微调框架。该方法利用二值掩码选择少量参数进行更新,在降低通信和训练开销的同时,最大程度保留模型的先验知识,从而提升对未见类别的泛化能力。此外,同时设计全局共享掩码和客户端本地掩码,使模型既能学习跨客户端的共性知识,又能适应各客户端的数据分布差异。实验结果表明,该方法在已见和未见类别上均优于现有框架。
