公平性崩溃现象:基于合成数据训练的语言模型中的偏见放大
近期一项研究揭示,当语言模型在合成数据上反复训练时,会出现“公平性崩溃”现象,即模型中的社会偏见被不断放大。这种偏见加剧甚至早于传统语言模型性能指标的显著下降,提示合成数据的使用可能悄然加剧偏见问题。研究基于Bias in Bios数据集,通过控制训练实验发现,尽管性能指标尚未明显下降,偏见却已明显恶化,这对利用公开数据继续训练语言模型提出了严重警示。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。