AgentLens:面向代码代理评估的生产级轨迹审查
我们介绍了AgentLens,这是一种用于交互式代码代理的生产级基准测试。现有大多数代码代理基准只关注任务是否通过的单一结果,而AgentLens评估的是整个执行轨迹,包括代理如何执行指令、使用工具、自我验证、纠错及与用户的互动。它结合了形式化验证和由大语言模型撰写的轨迹评论及对比,生成易读的评分解释。AgentLens不仅可用于模型排名,还可用于行为诊断、版本比较及产品回归检测。该基准以开源形式发布。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
