返回今日信号
图片
研究论文2026年8月24日 04:00

通过注意力头干预实现大型语言模型的个性化隐私控制

随着智能代理型AI的发展,大型语言模型(LLMs)能够访问多样的用户数据,带来了重要的隐私问题。此前的研究关注上下文隐私,探讨模型是否能根据情境规范调节信息披露,但同一情境下不同用户的可接受披露边界可能不同。本文提出了“个性化隐私”理念,纳入用户特定的披露偏好以进行隐私控制。并推出了P3Bench(个性化隐私保护基准),在上下文隐私策略基础上扩展个性化披露策略。实验表明,基于提示的策略难以稳定执行个性化隐私政策,Qwen2.5-7B和Gemma3-4B的政策忽视率分别高达51.25%和74.28%。为此,作者提出了Repair方法,一种推理阶段的注意力头干预技术,有效调整模型披露行为,使响应更符合策略要求,从而显著提升模型遵守用户隐私偏好的能力。

AI Signal Takeaway

这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。

发生了什么

arXiv cs.AI 发布了这条关于 研究论文 的更新:随着智能代理型AI的发展,大型语言模型(LLMs)能够访问多样的用户数据,带来了重要的隐私问题。此前的研究关注上下文隐私,探讨模型是否能根据情境规范调节信息披露,但同一情境下不同用户的可接受披露边界可能不同。本文提出了“个性化隐私”理念,纳入用户特定的披露偏好以进行隐私控制。并推出了P3Bench(个性化隐私保护基准),在上下文隐私策略基础上扩展个性化披露策略。实验表明,基于提示的策略难以稳定执行个性化隐私政策,Qwen2.5-7B和Gemma3-4B的政策忽视率分别高达51.25%和74.28%。为此,作者提出了Repair方法,一种推理阶段的注意力头干预技术,有效调整模型披露行为,使响应更符合策略要求,从而显著提升模型遵守用户隐私偏好的能力。

为什么重要

大型语言模型在实际应用中需处理不同用户的隐私需求,传统上下文隐私不足以区分个体间偏好差异。提出个性化隐私理念及对应基准,有助推动更细粒度、用户定制的隐私保护研究。Repair方法通过关注模型内部注意力机制,直接在推理时调整输出,提供了一种有效提升个性化隐私合规性的创新技术路径。

谁应该关注

研究员、模型团队和技术战略负责人 应该重点关注这条信号,尤其是正在跟踪 research、papers 的团队。

下一步看什么

接下来观察这条信号是否出现开发者采用、竞品回应、研究复现、企业部署或政策/平台层面的后续动作。

相关信号

[ 2026年8月24日 ]
研究论文
arXiv cs.CV/2026年8月24日

RISE:针对世界动作模型的自适应想象

世界动作模型(WAMs)通过将未来世界演变纳入动作生成来改进规划,但现有方法对每个场景分配固定的想象预算。我们提出了RISE(通过选择性展开细化想象)的系统级自适应想象框架,根据继续展开预期的规划收益做出顺序的展开/停止决策。在每一步,潜在评估器估计当前前缀揭示的风险及继续想象带来的规划改进潜力,而展开门则权衡预期收益与额外计算成本。鉴于事实驾驶日志仅暴露一种实现的未来,我们构建了包含多样结果和风险等级的反事实数据集CounterDrive,以丰富未来动态并提供局部风险监督。每个保留样本均经过专家验证及轨迹有效性、事件发生时点和因果类别的标注,为安全关键的世界建模研究提供可复用资源。在NAVSIM和nuScenes上的实验显示,RISE在减少不必要展开的同时实现了最佳整体规划性能,且转移实验支持其在不同WAM架构中的插件通用性。

研究论文
arXiv cs.CV/2026年8月24日

使用最优传输聚合视觉信息以压缩VideoLM令牌

视频语言模型将视频处理为密集的视觉令牌序列,存在大量冗余。压缩这些序列对于减轻语言模型解码过程中的视觉令牌负担至关重要。该方法通过最优传输将视频帧观察的密集经验测度映射到紧凑目标测度,从而构建压缩表示。该方法结合任务和空间维度调整压缩过程,针对问题条件优化传输成本,并在不同空间粒度上计算区域特定时间传输计划,实现对相关内容的关注。评估显示,AVIOT在多种视频理解基准上表现不逊于未压缩模型,且在高压缩率下依然保持强劲性能。

研究论文
arXiv cs.CV/2026年8月24日

作为Rollouts的注释:用于视频多模态大语言模型的高效可扩展强化学习

多模态大语言模型(MLLM)在统一视频感知领域占据主流,但在大规模多任务数据集上的后训练依然具有挑战性。现有强化学习方法即使采用计算昂贵的链式推理生成,也仅采样少量高质量的策略组。本文研究了视频MLLM强化学习后训练的样本效率与可扩展性,提出了OraRL方法。该方法将注释不仅用于评估,还作为oracle rollout直接作为正向优化目标。通过去耦优势估计器解决了“优势倒置”问题,同时采用符号平衡剪枝,只保留oracle及最强正负样本,显著提高效率。OraRL相较于基线在模型规模从0.8B到9B、数据量达到10万提示时均有提升。Video-ORA-9B解码速度从4780ms提升至130ms且无链式推理。实验中,其时间mIoU从62.5提升至66.0,追踪AO从73.0提升到78.2,分割从64.3提升到70.4,空间智能三大基准平均从51.0升至56.1,在VSI-Bench达73.1分,优于GPT-5和Gemini-3-Pro。