AI代理能综合科学结论吗?
本文介绍了SciConBench,一个包含9110个问题和专家撰写结论的大规模实时基准,用于评估开放领域科学结论综合能力。研究发现,在控制环境下,领先AI模型的事实准确率较低,最佳模型的事实F1仅为0.337。通过引入SciConHarness的‘无泄露’评估框架,证明过去的性能评估存在数据泄露问题,夸大了模型的实际能力。对消费者端AI代理的审计显示,即使有准确答案,它们产生的结论仍不完整甚至自相矛盾,显示可靠综合科学结论依然是重要挑战。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。