评估结合SageMath的LLM代理在计算与实验数学中的应用
本文提出了一种结合大型语言模型(LLM)推理与SageMath可验证反馈的ReAct风格代理框架,并利用Context7获取最新文档。该方法在模拟计算数学研究循环的RealMath基准测试中评估,显著提升了模型解决研究级数学问题的能力。作者改进了RealMath基准,加入了多步后处理和多阶段验证,提升了问题集质量。实验显示,接入SageMath使所有模型平均性能提升9.7百分点,加强了开源和闭源模型间的差距缩小,Qwen 3.7-Max获益最大,而GPT-5.5在启用工具配置下达到了75.2%的最高解题率与最低令牌消耗。研究表明,结合计算机代数系统的智能体是辅助数学计算探索的有前景方向,本工作推动自动猜想发现的发展。项目代码已公开。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
