通过基于幅值的专家屏蔽对Mixture-of-Experts模型进行层深敏感性分析
本文针对Qwen3.6-35B-A3B模型(40层MoE,每层256个专家,top-8路由)在XLCoST跨语言代码翻译基准上,采用基于幅值的专家屏蔽对各层敏感性进行系统分析。研究发现模型不同深度层对专家屏蔽的敏感性差异显著,早期(0-9层)和中期层(10-29层)对屏蔽高度敏感,而后期层(30-39层)尤其是35-39层对低幅值专家的屏蔽表现出较强容忍度。针对30%专家屏蔽,若均匀施行会显著降低性能,而集中于后期层的策略则能在屏蔽大量专家的同时保留较高质量输出。减少top-k路由宽度也带来显著的时钟周期减少且无性能损失。该工作为深度感知的MoE专家屏蔽提供了实证基础,并指明了进行权重手术、激活评分及训练恢复的路径。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。