TokenSwap:多模态大语言模型中的模态差异基准测试及缩小方法
多模态大语言模型(MLLMs)在语义等价的跨模态输入下应生成一致响应,但实际预测存在系统性差异。本文定义模态差异为文本与多模态输入下模型性能的差异。提出TokenSwap方法,通过将文本概念替换为语义对齐的图像,生成文本与视觉标记交织的序列。基于此,将文本基准如MMLU转换为含图像的新基准TokenSwap-Bench。研究发现42个MLLM中普遍存在模态差异,性能从文本到图文输入平均下降19.6%。推理模型模态差异较小,约10.1%,非推理模型达25.5%。提示策略和仅增加训练计算量难以消除差异,加入TokenSwap训练有效减小模态差异,同时保持文本和视觉语言表现。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
