建设性对齐:人机交互中的偏好动态调控
传统的AI对齐方法将人类偏好视为固定目标进行推断和优化,但实证研究表明偏好是分层、动态且通过与适应性技术互动建构的。随着AI系统日益个性化和社会化,它们影响人们的关注点、价值观和认同。本文提出“建设性对齐”范式,将对齐视为对不断演变的人类偏好轨迹的控制问题,利用控制理论模型描述AI系统如何共同影响世界状态与人类评价状态。对齐旨在规范AI对人类价值形成的影响,确保价值轨迹连贯、反思认可、知识基础扎实、防范操纵且在不确定下赋能。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。