TraceCLIP:从Patch到CLS贡献恢复局部语义
密集视觉语言理解任务如物体定位、区域识别和开放词汇语义分割,需要将语言概念与空间定位的视觉区域关联起来。CLIP通过大规模对比预训练学习共享的图文嵌入空间,为这些任务提供了坚实基础,但其图像级别的目标仅对全局CLS向量进行文本对齐,局部语义对应关系间接受限。现有方法依赖额外监督、外部模型或任务特化,而训练免费方法多从已有patch特征恢复密集响应,未探索CLIP内部局部语义的来源。本文提出TraceCLIP,一种训练免费框架,通过隔离CLS注意力输出中patch特定贡献项,恢复潜在的patch级语义证据,并将其转为语义测地拓扑门控以校准末层patch亲和度,实现密集特征重建。实验显示贡献特征具备强局部语义区分和文本条件空间对齐能力。在八个零-shot语义分割基准上,TraceCLIP较最强的训练免费方法提高1.3至4.5点mIoU,无需额外训练或外部视觉基础模型,验证了全局对齐表示内部仍蕴含空间局部语义。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。