视野鸿沟:长远视角大型语言模型智能体的规划、记忆、执行、训练与评估
本文探讨了当前前沿语言模型在解决多小时长任务时遇到的“视野鸿沟”问题,即模型在任务过程中容易丢失先前决策、草率结束工作或偏离目标。通过系统收集与分析2024至2026年间1547篇arXiv论文,本文明确区分了长视距任务、长上下文容量和长时记忆三种常被混淆的概念,并将相关研究按规划、记忆、执行、训练、评估及基础/安全六个类别进行分类。研究指出,随着任务视距变长,仅靠结果信号已不足以指导模型,领域内通过密集的步骤信号(如过程奖励模型、信用分配、轨迹诊断)来应对此挑战。文中强调批判性与诊断性文献的整合,提出了分辨模型能力与外部辅助区别、处理训练与评估中过程性信号偏差关联等开放的测量问题,展望构建长视距可靠性的一般预测理论。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。