通过组合界限和安全持久性实现LLM多轮鲁棒性的认证安全性
本文介绍了多轮认证鲁棒性(MTCR)框架,用于解决大语言模型(LLMs)在多轮对话中逐步遭受越狱攻击的问题。MTCR通过状态对抗马尔可夫决策过程建模对话安全性,定义了k轮认证鲁棒性为k轮对抗性操作下的最坏安全概率。该方法包括:通过嵌入空间模式分解实现组合认证,比简单乘积获得更紧的下界;引入(α,β)-安全持久性,将退化率从p的k次方提升至β的k次方;匹配的信息论上界证明其紧性;以及统一算法应用。实验证明,在六种LLM及不同攻击下,实际安全性均优于认证下界。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。