无分词器依赖的Engram模块
Deepseek的Engram是一个条件记忆模块,旨在大语言模型中平衡存储与推理能力。原有模块依赖于基于分词器的token级别$N$-gram哈希,这导致不同分词器的模型需从头训练Engram嵌入。本文提出更改哈希方法,实现不同分词器间Embeddings的兼容。通过视$N$-gram为一种从所有token的字节序列中采样的方式,替换原来的异或哈希为多项式哈希和联合嵌入空间,达到类似性能并实现对分词器无依赖性,即对字节等价token序列哈希等价。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
