一键越狱,多语种理解:学习语言无关的意图表示以检测多语种越狱攻击
随着大型语言模型(LLM)在全球多语种用户中的广泛应用,安全训练主要集中于主流语言,未能同步提升多语种能力,导致越狱攻击的可利用漏洞。当前的越狱防御主要针对主流语言开发和评估,受限于多语种对齐监督稀缺和语言差异引起的表示分散问题。为此,本文提出MLJailDe框架,利用多语种回译数据增强构建涵盖11种语言的数据集,并通过相对距离约束减少跨语种表示分散,使意图相似的越狱提示在多语种中形成一致聚类,同时采用不平衡感知分类目标缓解类别不平衡,提升多语种决策边界的可靠性。实验显示MLJailDe在多语种环境中性能超越最新方法,F1分数达98.5%,对未见语种平均F1为97.1%,展现出强大的效果和跨语种泛化能力。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。