返回今日信号
图片
研究论文2026年8月4日 04:00

SciToolAgent-Evo:面向开放世界科学工具获取的本体感知自我进化智能体

大型语言模型(LLM)智能体在科学研究中被广泛用于组织和调用专业计算工具,但其依赖于静态语义的预定义工具空间,限制了其在动态变化的开放世界科学工作流程中的应用。本文提出SciToolAgent-Evo,一种本体感知的自我进化智能体,能够适应开放世界中的科学工具获取。该智能体通过进化的技能与经验记忆和本体化工具图,提取通用知识,并在推理过程中利用LinUCB基于的策略动态平衡探索与利用。一旦获得新工具,在线完成其科学本体整合入已知图谱。此外,引入包含900个任务的OpenSciToolBench基准,覆盖四个难度等级。实验证明SciToolAgent-Evo实现了最先进的性能,验证了其鲁棒性与泛化能力。

AI Signal Takeaway

这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。

发生了什么

arXiv cs.AI 发布了这条关于 研究论文 的更新:大型语言模型(LLM)智能体在科学研究中被广泛用于组织和调用专业计算工具,但其依赖于静态语义的预定义工具空间,限制了其在动态变化的开放世界科学工作流程中的应用。本文提出SciToolAgent-Evo,一种本体感知的自我进化智能体,能够适应开放世界中的科学工具获取。该智能体通过进化的技能与经验记忆和本体化工具图,提取通用知识,并在推理过程中利用LinUCB基于的策略动态平衡探索与利用。一旦获得新工具,在线完成其科学本体整合入已知图谱。此外,引入包含900个任务的OpenSciToolBench基准,覆盖四个难度等级。实验证明SciToolAgent-Evo实现了最先进的性能,验证了其鲁棒性与泛化能力。

为什么重要

SciToolAgent-Evo突破了传统LLM智能体依赖静态工具集的局限,适应了开放世界中工具不断变化的需求,提升了科学工作流程的灵活性和智能水平。

谁应该关注

研究员、模型团队和技术战略负责人 应该重点关注这条信号,尤其是正在跟踪 research、papers、agents 的团队。

下一步看什么

接下来观察这条信号是否出现开发者采用、竞品回应、研究复现、企业部署或政策/平台层面的后续动作。

相关信号

[ 2026年8月4日 ]
研究论文
NVIDIA Newsroom/2026年8月4日

英伟达加入美国国家科学基金会州级和区域人工智能基础设施中心计划

英伟达参与美国国家科学基金会(NSF)启动的州级和区域人工智能基础设施中心计划,旨在扩大对先进计算、数据、软件及专业知识的访问,推动人工智能研究与教育。

研究论文
arXiv cs.CV/2026年8月4日

ELECTRIC:通过迭代校正增强证据学习的CT重建方法

本文介绍了ELECTRIC,一种物理指导的贝叶斯框架。证据神经网络提供图像建议和误差预测的不确定性替代模型,该模型被转换为自适应精度场并应用于泊松加权MAP更新。此闭环将先验置信度视为迭代重建的学习状态变量。通过对AAPM Mayo Clinic低剂量CT数据集切片的仿真实验,验证了机制并展示了基于训练的Normal-Inverse-Gamma证据网络驱动的闭环效果。该方法在未见患者数据上,相较于滤波反投影减少了约70%的重建误差,预测不确定性能够支持选择性信任,物理指导的更新恢复测量一致性,自适应精度重建表现优于固定先验且更稳健。

研究论文
arXiv cs.AI/2026年8月4日

NeSyFS:面向部分可观测LLM智能体的神经符号快速-慢速思维框架

最近大型语言模型(LLM)越来越多地被用作自主智能体,应用于自我反思、检索增强生成和科学发现等领域。在这些应用中,智能体只能基于有限观察而非完整环境状态进行决策,导致部分可观测性问题。本文提出NeSyFS框架,通过使用知识图表示信念状态,以神经符号结合的快速-慢速思维模块应对信念推断、任务目标错配和不确定性规划等挑战。快速思维模块负责反应动作,慢速思维模块结合扭曲序贯蒙特卡洛算法实现不确定性规划,反思模块用于纠正动作并在失败时切换思维模式。实验在ALFWorld、Webshop和ScienceWorld三个基准上表现优异。