SafeGene:可复用的安全适配器,实现安全对齐的可迁移性
本文提出了SafeGene,一种可复用的安全适配器模块,针对开源大语言模型(LLM)在进行下游微调时安全对齐性减弱导致的安全恢复问题。SafeGene 把安全能力作为独立且可复用的适配器表示,从对齐与降级模型差异中获取安全向量,经过数据感知层选择优化,并通过少样本层级系数重新校准用于各个下游任务中。多模型、多任务实验证明,SafeGene有效减少有害回答率,同时保持任务性能,优于现有安全适配方法。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。