ConSA:通过可学习分配实现混合注意力的可控稀疏性
本文提出了ConSA框架,针对混合全注意力(FA)与滑动窗口注意力(SWA)的模型架构,采用L0正则化自动学习FA和SWA的最佳分配,满足用户指定的稀疏性目标。该方法在0.6B和1.7B规模的大语言模型上优于基于规则的分配策略,KV-head级别的分配效果优于层级分配。学习到的分配模式是在底层使用SWA,中间层连续块使用FA,显示了不同于规则方法的注意力行为特征,结果跨模型规模和稀疏度均表现稳定。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。