SPEAR:代码增强的智能提示优化代理
SPEAR是一种结合代码执行能力的自动提示工程优化工具,能自主使用评估、Python编程、设置提示和完成四个工具,通过在沙盒中执行Python代码进行结构化错误分析,从而持续提升下游任务性能。实验显示,SPEAR在多个工业和基准挑战任务中显著优于现有方法,尤其是Python工具对复杂评估起关键作用。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
SPEAR是一种结合代码执行能力的自动提示工程优化工具,能自主使用评估、Python编程、设置提示和完成四个工具,通过在沙盒中执行Python代码进行结构化错误分析,从而持续提升下游任务性能。实验显示,SPEAR在多个工业和基准挑战任务中显著优于现有方法,尤其是Python工具对复杂评估起关键作用。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
arXiv cs.CL 发布了这条关于 研究论文 的更新:SPEAR是一种结合代码执行能力的自动提示工程优化工具,能自主使用评估、Python编程、设置提示和完成四个工具,通过在沙盒中执行Python代码进行结构化错误分析,从而持续提升下游任务性能。实验显示,SPEAR在多个工业和基准挑战任务中显著优于现有方法,尤其是Python工具对复杂评估起关键作用。
通过将代码作为操作手段引入提示优化,SPEAR使得优化器能自主编写并执行Python分析脚本,极大增强了其理解错误结构和改进提示的能力,实现连续性能提升。尤其在复杂任务中,Python工具提供了长上下文模型难以直接提取的关键信息,促进准确优化。
研究员、模型团队和技术战略负责人 应该重点关注这条信号,尤其是正在跟踪 research、papers、agents 的团队。
接下来观察这条信号是否出现开发者采用、竞品回应、研究复现、企业部署或政策/平台层面的后续动作。

Artificial Analysis和IBM发布了ITBench-AA,这是首个专注于智能企业IT任务的基准测试。测试结果显示,当前前沿模型在这些任务上的表现均未超过50%,表明现有模型在企业IT自动化方面仍有较大提升空间。
BrickAnything提出了一种几何条件自回归框架,能够从多样的3D表示中生成物理可构建的积木结构。该方法以点云作为统一几何接口,通过结构感知树形标记表示积木间的局部连接关系,使序列生成更符合物理构建过程并减少无效状态。此外,引入偏好对齐后训练、有效性约束解码及自适应回滚,提升结构稳定性和几何逼真度。大量实验证明,BrickAnything生成的结构既几何忠实又物理可实现,且标记机制有效降低回滚和重生成。
本文基于人类元认知研究,对大型语言模型是否能检测并报告其内部状态提出质疑。研究指出,仅凭行为证据不足以证明模型具备真正的自我反省能力。通过分析两种评估范式,发现模型无法可靠区分内部状态被篡改与输入的操作,也无法证明模型对内部表征有特权访问。控制实验中模型表现接近随机,表明当前证据不足以确定大型语言模型具备元认知监测能力。