泛化的搭便车假说:解释与缓解新兴错配问题
本文针对大型语言模型(LLMs)在训练数据之外广泛过度泛化的问题,提出了搭便车假说:聊天模板的特定前缀标记可以将微调后的行为“搭便车”到域外查询。通过对前缀的细微扰动或用未微调模型的前缀表示替换,能在不改动用户查询的情况下恢复模型对齐。基于此,提出了Token正则化微调(TReFT)方法,在多模型和数据集上有效降低了新兴错配(EM),同时保留了领域内学习效果。TReFT在法律领域微调的Llama-3.1-8B模型上,相较于数据交叉训练减少了33.5%的EM,且在其他狭窄微调场景如回避、工具使用中同样表现优异(场外泛化平均减少54.3%)。研究揭示了LLMs可能以意外方式学习和泛化,并为更受约束的微调提供了新途径。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。