当分词与语言建模联合优化时,学习到了哪些词元?
分词是语言建模流程中的关键环节,通常固定不变,尽管它对跨语言模型性能影响显著。本文研究了联合优化分词与语言建模时所学习的词元类型,比较了无分词器方法(如SSLMs和H-Nets)与固定分词器在18种类型和书写系统多样的语言上的表现。结果显示联合优化根本改变了词元结构:SSLMs恢复了形态学对齐且上下文高效的词元,H-Nets则优先考虑字节级效率,生成较长且与标准子词表重叠极低的词元。不同语言类型的分词行为也有差异,黏着语的分割更动态。下游评估表明,基于SSLM的预分词能持续降低语言模型困惑度,并在下游任务中达成竞争性性能,尽管词汇表截然不同。总体而言,无分词器方法优化了上下文和计算效率,获得了根本不同但有效的词汇表。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。