通过注意力头干预实现大型语言模型的个性化隐私控制
随着智能代理型AI的发展,大型语言模型(LLMs)能够访问多样的用户数据,带来了重要的隐私问题。此前的研究关注上下文隐私,探讨模型是否能根据情境规范调节信息披露,但同一情境下不同用户的可接受披露边界可能不同。本文提出了“个性化隐私”理念,纳入用户特定的披露偏好以进行隐私控制。并推出了P3Bench(个性化隐私保护基准),在上下文隐私策略基础上扩展个性化披露策略。实验表明,基于提示的策略难以稳定执行个性化隐私政策,Qwen2.5-7B和Gemma3-4B的政策忽视率分别高达51.25%和74.28%。为此,作者提出了Repair方法,一种推理阶段的注意力头干预技术,有效调整模型披露行为,使响应更符合策略要求,从而显著提升模型遵守用户隐私偏好的能力。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。