合规性、能力与冲突:系统消息下多模态大型语言模型的基准测试
本文介绍了VSysBench,一个基于MMVet-v2的多模态大型语言模型(MLLM)系统消息合规性基准测试工具。该工具涵盖5大类22小类约束,结合文本与视觉指令,通过联合满意率(JSR)和跨约束敏感度(CCS)评价模型回答的合规性与正确性。测试16款MLLM发现,系统消息的强制执行显著降低了基础任务准确率;开源模型在用户冲突情况下合规性大跌,而顶级专有模型表现稳定;视觉指令为所有模型的最大挑战。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。