掩码扩散语言模型:强大且可引导的基于文本的世界模型用于智能强化学习
本文提出将基于文本的世界建模形式化为可引导的转移动力学问题,结合初始状态、任务上下文、工具模式、领域规则和引导指令。通过对比自回归语言模型(AR LMs)和掩码扩散语言模型(MDLMs),发现MDLMs在保持推理延迟相当的情况下,凭借双向锚定感知的去噪能力,在连贯性、基础性和多样性上显著优于参数量是其4倍的LLMs。使用239,403条跨九个开源环境和多个模型家族的状态-动作轨迹进行训练,并通过零样本迁移实验展示在三个超出分布环境中,对不同规模代理骨干实现最高47%的性能提升。研究还分析了对抗场景下的失败模式,并通过人类评估验证了模型输出的真实性和实用性。该工作已开源,旨在促使相关方向研究进展。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。