
ITBench-AA:首个面向智能企业IT任务的基准测试中,前沿模型得分低于50%——来自Artificial Analysis和IBM
Artificial Analysis和IBM发布了ITBench-AA,这是首个专注于智能企业IT任务的基准测试。测试结果显示,当前前沿模型在这些任务上的表现均未超过50%,表明现有模型在企业IT自动化方面仍有较大提升空间。
这条 研究论文 信号说明,来自 Hugging Face Blog 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。