EntropyMoE:面向无分词LLM的熵感知稀疏专家路由
近期字节级大型语言模型通过将字节动态分组为不同大小的片段,实现了无分词建模的竞争力。然而,现有字节片段架构对所有片段采用相同的密集前馈计算,无法根据片段语义和粒度变化调整模型容量。本文提出EntropyMoE,一种针对动态字节片段设计的专家混合(MoE)架构,用Top-K专家层替代全局片段Transformer中的密集前馈模块。路由器基于片段熵选择专家,利用熵与长度共同定义特征空间以调控专家专门化,达到稀疏条件计算。实验显示,EntropyMoE在保持下游任务准确率的同时,实现了匹配稠密与稀疏基线中的最低持出比特熵值,证明了基于片段熵的路由有效性,并扩展了MoE模型在无分词表示中的应用。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。