因果归因剪枝法在大型语言模型中保持推理性能
大型语言模型在多步推理方面表现出色,但推理成本较高。本文提出了一种名为因果归因剪枝(CAP)的无训练方法,通过测量注意力头对推理任务的因果影响,识别关键注意力头,指导细粒度权重剪枝。CAP基于小规模校准集,估计屏蔽每个注意力头时的性能下降,并将因果得分转化为权重的重要性值。与仅基于权重大小或激活值的方法不同,CAP的干预测量直接反映注意力头的功能贡献,在20%稀疏率下,在ARC-Challenge数据集上相较于Wanda方法获得最高61%的相对准确率提升。在GSM8K、StrategyQA和ARC-Challenge数据集上的多种模型和稀疏率(10%、20%、50%)测试中,CAP大多优于Wanda,尤其是Llama-3模型在ARC-Challenge上的表现显著提升。结果表明,基于因果归因的注意力头剪枝在保持推理性能方面胜过相关性剪枝准则,但在50%高稀疏率下受限于粗粒度的MLP归因。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。