用于更快更鲁棒的视觉语言模型的聚类与令牌去噪方法
近期视觉语言模型(VLMs)通过在预训练大语言模型(LLMs)中加入视觉令牌显著提升能力,诸如LLaVA展现出优异性能。但处理多达576或729个视觉令牌带来的计算负担,限制了边缘设备的部署。现有令牌剪枝方法多需重训练,而一些无训练需求的方法虽便于架构调整,却难保证性能。本文提出ClustRS,一种无训练的双阶段令牌剪枝算法,包括基于注意力加权的聚类选取语义代表令牌和一次性残差缩减的去噪步骤。该轻量流程提升LLaVA对多种图像噪声的鲁棒性,使其适应真实世界数据。在ScienceQA-IMG与MM-VET等基准测试中,ClustRS在极端噪声和令牌条件下比基于注意力和多样性的剪枝方法好20%,在LLaVA 1.5 7b上令牌数量减少97%至16个;对LLaVA-OneVision于轻度噪声下,用不到三分之一令牌达到基线性能。研究表明,该简单高效方法为计算高效且抗噪的VLM部署提供了新思路。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。