引入无奖励判分规则以减少代理评估中的过度加分
本文提出RubricForge,一种基于少量带标签轨迹,通过反思进化生成的文本判分规则,用于无奖励环境下自动评估语言模型代理。相较于现有手写或微调的判分器,RubricForge更忠实于真实环境奖励,显著减少了对失败轨迹的过度加分,在tau-bench和WebShop数据集上表现出更低的假通过率和更佳的排序一致性。其判分规则为人类可读文本,便于追踪判决依据。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。