真相深藏:通过潜在意图验证应对语义伪装攻击
大型语言模型(LLMs)的安全对齐常依赖于生成末阶段的拒绝机制,无法消除训练阶段对有害概念的基础认知。本文揭示了语义伪装攻击,即通过包裹在无害叙述中的恶意意图,绕过标准防护机制。通过分析Phi-3、Qwen2.5和Gemma-2b三种小型语言模型在攻击下的潜在激活轨迹,发现“意图地平线”现象,即模型约15-20%层深处,其对有害意图的独特表征因情境化为“安全”叙述而崩溃。尽管后期层表示难以区分伪装攻击和安全查询,早期层却保留明显的“有害特征”。基于此,提出轻量级探测防御方法——潜在意图验证(LIV)。在PKU-SafeRLHF数据集上的实验表明,LIV较标准防护提升20%-50%检测率,有效应对零日语义攻击且无需模型重训。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。