KnowSim:使用学习型用户模拟器评估大语言模型助手中的信息校准
为了帮助大语言模型(LLM)更有效地与用户协作完成高知识密集型任务,KnowSim提出了一种基于用户知识状态的模拟评价框架。该框架通过维护显式的知识图谱结构和遵循学习理论的更新规则,模拟用户知识随交互演进的过程。KnowSim基于知识增长、信息传递校准和认知过载三项指标,准确反映信息校准的核心机制,并在705个真实人机交互中验证了其评估结果与人类判断高度一致,优于现有方法。应用于9个LLM模型,KnowSim还能揭示不同用户知识水平下模型表现的差异,发现标准评价难以察觉的能力-适应性互动。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。