MindGames Arena泛化赛道:In2AI方案中的延迟逐步奖励归因
本文提出了一种针对多智能体战略交互训练语言模型代理的延迟逐步奖励归因方法。通过仅在回合结束时计算奖励,并根据任务语义反向传播至相应步骤,同时排除无效步骤,实现了在多智能体环境中的稳定、高效强化学习训练。结合vLLM异步样本生成、课程式对手采样及多级分层批处理,该方法在NeurIPS 2025 MindGames Arena基准测试中表现优异,使用单一8亿参数开源模型击败了包括GPT-5在内的更大规模专有系统,荣获开放和高效赛道冠军。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。