通过一致性驱动的强化学习提升跨语言事实回忆能力
本文介绍了PolyFact数据集,一个包含12种语言、基于维基数据的大规模多语言事实问答数据集,包含10万个事实。基于该数据集,研究者比较了轻量持续预训练(CPT)、监督微调(SFT)和通过群体相对策略优化(GRPO)的强化学习方法在提升Qwen-2.5-7B和OLMo-2-1124-7B模型跨语言事实回忆能力上的表现。结果显示,GRPO在提升跨语言一致性和对未见语言的泛化能力方面均优于SFT,而在并行数据上的CPT增益有限。机理分析表明,GRPO通过减少多层感知机层和注意力头中的语言特化,促进了更多共享的跨语言表示。研究者同时发布了相关代码、模型及数据集。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。