通过混合模式优势正则化减轻大型推理模型中的事实幻觉问题
大型推理模型通过生成显式思维路径提升语言模型能力,尤其在事实导向的问答中帮助恢复相关知识和优化答案。不过,显式思维有时会推翻原本正确的非思维答案,引发所谓的“思维诱发幻觉”,导致事实错误。该研究提出将显式思维视为模型直接回答倾向上的一个思维残差,可能带来缺失知识的补充或引入无支持的关联。基于此,提出了MARGO——一种利用非思维路径作为同模型参考的强化学习框架,通过混合思维和非思维的轨迹组评估显式思维是否增加事实价值,从而抑制幻觉风险同时保持思维的正面作用。多基准实验证明,MARGO在提升事实可靠性方面优于强基线,且在数学推理中保持了良好的推理能力。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。