RLHF偏好数据中的评分者状态偏差:审计框架
本文识别出强化学习中基于人类反馈(RLHF)中的一种结构性混淆:评分者的偏好标签不仅反映输出比较,也可能反映评分者在注释时的状态。持续的压力或困扰条件下,评分者的偏好会随时间变化,导致偏好数据同时编码评分者状态和质量判断。这种状态相关偏差可跨评分者共享,并通过奖励建模和策略优化传播。文章提出了评分者状态偏差的假设和审计框架,定义了相关概念,提出可测量指标并提供审计协议及试点方案,旨在公开模型中检测这种结构性偏差。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。