LaViSA:语言与视觉结构歧义基准
结构歧义指单句因句法结构可有多种有效解读,语言理解面临根本挑战。视觉场景作为有效线索,有助解析此类歧义。LaViSA基准设计用于评估视觉与语言模型(VLMs)利用视觉信息解决结构歧义的能力。其包含多类别歧义句子、消歧句及对应图像。评测显示,尽管现有VLMs某种程度上能利用视觉场景消除结构歧义,但在处理某些歧义类型和细微语义区分时仍存在困难,表明此能力尚有提升空间。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。