自我验证蒸馏:您的语言模型其实是它自己的合成数据管道
本文研究了大语言模型(LLM)能否仅利用无标签的提示,通过自我生成并过滤解答,进一步提升自身性能,无需外部教师或工具反馈。提出了自我验证蒸馏算法,模型生成多个候选答案,利用基于提示的三阶段自我验证(循环一致性、事实性和正确性)筛选答案,再用筛选后的数据自我训练。该方法在数学、科学和编码三个推理领域均带来显著性能提升,提升幅度在4B参数模型中最高达16.7个百分点。相较于需要推理时多次调用模型的基线方法,自我验证蒸馏只在测试时调用一次,效率更高。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
