当不合理的词元被强化:用于大语言模型强化学习的尾部感知信用校准
强化学习显著提升了大语言模型的推理能力,但常用的无审稿者强化学习方法均匀分配信用,导致罕见且错误的尾部词元获得与合理词元相同的正面信用,称为正信用污染问题。本文提出尾部感知信用校准(TACO)方法,计算每个词元的尾部风险分数,调整其正面信用,从而降低噪声影响并保留有用罕见模式。实验证明TACO在三个大语言模型和八个基准上优于GRPO基线,提升了训练稳定性和长期强化学习表现。源码公开于Github。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。