AgentOdyssey:用于测试时持续学习代理的开放式长时域文本游戏生成
为了使代理能够在测试时持续地通过与世界的交互学习,它们必须有效探索、获取新知识与技能、保留相关经历并进行长时域规划。AgentOdyssey提出了一种新颖评估框架,程序化生成包含丰富实体和世界动态的开放式长时域文本游戏。此框架打破传统机器学习测试时不学习的假设,将学习与推理交错进行。评估方法不仅测量游戏进展,还涵盖世界知识获取、情节记忆、探索及动作多样性等诊断测试。实验显示代理存在关键能力限制,尽管性能随基础模型增强提升,但仍远低于人类水平。短期记忆被证明是多种代理范式的重要测试时训练组成部分。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。