是什么驱动了反馈中的交互式提升?
本文研究了自然语言反馈在多轮语言代理设置中如何带来超过仅重复尝试的改进。通过在多个任务集和模型中引入受控的师生协议,比较外部反馈、自我反馈和无指导自我优化,结果表明多轮改进通常并不能证明有效反馈的作用。自生成反馈较无指导自我优化改进有限,而最强的外部教师带来显著反馈特定提升,说明有用反馈需提供超越简单重试的引导。学生使用反馈的能力比教师身份更决定交互收益,但教师选择对于固定学生仍很重要。研究建议评价基于反馈的代理时应与重复尝试基线对比,反馈的可用性不如反馈的可操作性关键。我们公开了受控的师生评估框架。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。