通过一致性驱动的强化学习提升跨语言事实回忆能力
本论文介绍了PolyFact,一个包含12种语言、10万条基于Wikidata事实的多语种平行问答数据集,旨在研究大型语言模型在非英语语言中的事实表达不一致问题。研究比较了轻量持续预训练、监督微调和基于Group Relative Policy Optimization (GRPO)的强化学习方法,发现在Qwen-2.5-7B和OLMo-2-1124-7B模型上,GRPO在跨语言一致性和对未见语言的泛化能力上均优于其他方法。此外,机制分析表明GRPO通过减弱多层感知机和注意力头中的语言特化,提高了共享的跨语言表示。研究团队将公开代码、模型和数据集。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。