基于在线个性化能量缓存的测试时适应用于细粒度视频表情识别
视频中的面部表情识别(FER)面临挑战,因为模型需要识别细微且随时间变化的个体差异情感状态。虽然视觉语言模型提供可转移的视觉语义表示,但基于独立主体训练的模型在推理时常因主体特异性分布差异而性能下降。现有测试时适应(TTA)方法通常在推理阶段更新模型参数,增加计算成本和延迟。基于缓存的方法避开参数更新,但早期适应或罕见类别由于目标样本不足难以形成可靠类原型。本文提出基于能量的缓存个性化(EB-CaP),一种面向视频FER的主体在线TTA方法,通过轻量级能量模型从当前无标签视频中采样个性化类原型,无需大量目标数据或存储多样的源原型。其能量函数基于预训练CLIP模型,利用目标视频嵌入与类别文本嵌入的相似度引导采样。同时设置正负缓存存储可靠与不确定目标嵌入,采用自适应熵门控控制缓存更新,并使用多样性门限制冗余样本。最终预测结合缓存分数和当前CLIP分数。实验证明EB-CaP在BioVid、StressID和BAH数据集上优于现有TTA方法,且保持低计算和内存开销。代码公开。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。