基准测试饱和后的生活:CORE-Bench案例分析
本文探讨了在基准测试准确率达到饱和时,通常被淘汰并替换为更具挑战性的版本的做法。研究指出,这种方法过分关注准确率,忽视了代理性能的六个关键维度,包括构建有效性问题(如捷径)、分布外泛化能力、效率、可靠性、模型与框架的重要性比以及人机协作提升。以计算科学代码复现的CORE-Bench Hard为例,文章展示了即使准确率饱和,从这些维度衡量代理仍能提供有意义的性能洞察。文章提出了改进的基准CORE-Bench v1.1和分布外任务套件CORE-Bench OOD,证实准确率饱和后,基准仍能有效测量效率、可靠性等。此外,实验证明人机协作实现了接近两倍的速度提升, highlighting 了替代以准确率为中心的评价范式的可能。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。