基于实体识别的知识库视觉问答方法“先识别后排序”
知识库视觉问答(KB-VQA)需要将视觉查询与图片中无法直接观察到的外部知识关联。现有多模态大语言模型在KB-VQA中对细粒度实体和证据的识别能力不足。本文提出了一种无需训练的“先识别后排序”(IBA)框架,先通过大语言模型从候选实体中选择高置信度实体,再用文本重排序器完成证据选择。该方法在Encyclopedic-VQA和InfoSeek任务上优于多模态重排序的微调基线,且降低了训练和推理复杂度。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。