认知范畴变换器:面向语言建模的范畴理论归纳偏置
认知范畴变换器(CCT)是一种拥有3.06亿参数的架构,基于预训练的GPT-2 Small,并引入了来自范畴理论和认知科学的认知驱动组件。在WikiText-103数据集上,CCT经过匹配步数训练后,验证困惑度达到21.27,优于同条件下调优的GPT-2 Small基线的24.19,带来了12%的相对困惑度降低。消融实验表明,引入单纯形消息传递是提升性能的主要因素,贡献了84%的改进效果。该研究首次验证了在3.06亿参数规模下,单纯形消息传递能显著改善语言模型困惑度。同时,三种一致性样式的范畴先验未能带来提升,支持了“结构/一致性区分”模式,即增加拓扑结构对语言建模有益,而强制一致性则无效。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。