保持一致性!通过一致性约束增强大型视觉语言模型的鲁棒视觉推理能力
大型视觉语言模型(LVLMs)虽具备强大的感知能力,但在视觉推理任务中仍存在弱点。现有基准测试多侧重符号数学、科学问题及简单视觉任务,难以评估复杂视觉推理与逻辑一致性。我们提出ConVBench基准测试,包含六类配对逻辑等价问题,涵盖动作与状态、复杂计数、空间推理、因果与意图理解、常识推理及时间感知。结合此测试,设计逻辑一致性和鲁棒准确度两项指标,共同评估答案的正确性与一致性。我们进一步研发ConVLM,采用基于集团相对策略优化(GRPO)的强化学习,融入一致性奖励,利用自动生成的逻辑等价问答对及准确率与一致性双重激励,推动模型回答保持一致。该框架可在有无严格答案监督条件下有效运行。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。