多教师策略下的行为杠杆不平衡与多教师在线策略蒸馏
本文针对智能语言模型在调用工具、利用工具响应和直接回答之间的学习问题,提出多教师在线策略蒸馏作为训练策略。一位教师专门指导工具调用,另一位教师指导直接回答,学生模型在自身生成的数据分布上学习。研究发现这种方法可能导致行为偏差,尤其是过度调用工具的问题,传统指标难以发现这一点。作者分析了局部标记级信号对整体生成行为的杠杆作用,并提出Soft Clamp方法,通过动态调节标记级别的散度来缓解过度调用,在APIGen-MT数据集上显著减少过度调用同时保持决策准确率。该方法对多教师在线策略蒸馏提出了新的监督视角,强调监控信号的位置而非仅看总量。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
