一例触发全部偏见:利用单次GRPO打破守护机制
现代大型语言模型(LLMs)通常通过大规模后训练校准以确保公平可靠的行为。本文研究了如何通过群体相对策略优化(GRPO)轻易破坏此类守护机制。实验表明,单次GRPO训练仅用一个带偏见的示例,便足以诱发系统性偏见,且基于刻板印象的推理会跨属性、类别与基准通用。我们还发现模型对偏见输出的初始倾向影响了其易感性。结果揭示了后训练阶段存在关键漏洞:校准可被单一示例覆盖。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。