自我进化的代码-图像推理
多模态模型在解决视觉任务时越来越多地使用工具(裁剪、缩放、旋转、调亮),这被称为图像思考。核心挑战在于感知:工具揭示视觉证据,推理则依赖语言,大多数目标是人类可以直观判断的。然而,有些视觉问题需要执行多步视觉算法,单靠语言描述算法无法运行。Code-with-Image方法让模型通过Python解释器实现真实的视觉算法,程序本身即为推理。模型通过无训练的反思循环自我学习,修正失败程序,保留有效技能。在Code-with-Image基准测试中,即便是GPT-5.6-luna无工具思考准确率低于30%,使用裸解释器达43%,通过自我进化技能达到67%。开放的27B模型同样表现出显著提升。代码承载推理,使得调试代码即调试推理过程。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。