语言模型的期望对齐以满足真实用户期望
大型语言模型(LLMs)在标准基准测试中表现出色,但是否真正满足用户期望尚未充分探索。现有评估方法依赖模型启发、专家评分或用户模拟,难以捕捉真实人类期望的多样性与细微差别,导致模型看似合格却与用户实际需求不符。本文首次系统研究真实用户期望,提出提取语义丰富期望的原则方法,并引入基于真实用户期望的ExpectBench基准。分析显示当前模型难以满足和预判用户期望,体现根本性错位。为此,作者提出轻量潜在期望感知响应生成框架LENS,使模型内化用户期望,提升对齐度和期望满足,强调明确建模用户期望对于人机现实对齐的重要性。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。