当推理限制了行动选择:大型语言模型游戏玩法中的多样性坍塌
本文探讨监督微调(SFT)对大型语言模型在序列决策任务中行为多样性的影响,基于井字棋变体的确定性棋盘游戏进行实验,发现推理模式常抑制动作多样性且并非总提高动作准确率。标准SFT虽然提升准确率,却引发过早的多样性坍塌。通过动作增强训练,即对每状态所有最优动作进行训练,可部分缓解该问题。研究指出模仿学习中狭窄支持度是策略坍塌源头,强调在SFT中保持动作多样性对探索行为的重要性。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
