学习记忆:基于邻居混合归纳记忆的半参数模型可扩展持续学习
半参数语言模型在自然语言处理任务中展现了潜力,但其非参数记忆作为静态存储缺乏学习能力,限制了可扩展性和效率。本文基于语言模型解释理论,将非参数记忆$k$NN-LM重新构想为可学习的邻居混合归纳记忆(MoNIM),结合了注意力机制的归纳能力与前馈网络的记忆力。MoNIM集成于Transformer信息流中,作为类前馈网络的旁路层,有效学习新知识。大量实验表明,MoNIM在数据和模型规模上均具备良好的持续学习能力,提升了半参数语言模型的可扩展性和持续学习表现。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。