评估大型语言模型在会议中的称呼对象、换话时机及下一个发言者预测能力
本文研究了多模态多人对话中的轮次切换,构建了称呼对象检测、换话预测和下一个发言者预测三个任务的评估框架。实验基于AMI语料库,比较了监督模型、纯文本大型语言模型、多模态大型语言模型(MM-LLM)以及人类表现。结果显示,虽然未在目标领域训练且未使用音频视频信息,LLM在下一个发言者预测上超越了监督模型和人类。MM-LLM在称呼对象和换话预测上优于纯文本LLM,但仍不及人类,表明利用原始音视频信号存在挑战。消融实验表明会话上下文尤其对下一个发言者预测至关重要,且人类与LLM的预测规律相似。频繁换话的时段对双方均难以精准预测。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。