SLAP:基于分层损失的在线数据高效指令调优剪枝方法
SLAP是一种新提出的批次感知数据选择框架,通过分层抽样和相对距离优化实现多样化数据覆盖,利用Hessian近似梯度进行动态批次选择,显著减少训练数据量20-40%同时提升或保持大语言模型的性能,支持多模型架构和多任务应用。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
SLAP是一种新提出的批次感知数据选择框架,通过分层抽样和相对距离优化实现多样化数据覆盖,利用Hessian近似梯度进行动态批次选择,显著减少训练数据量20-40%同时提升或保持大语言模型的性能,支持多模型架构和多任务应用。
这条 研究论文 信号说明,来自 arXiv cs.CL 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
arXiv cs.CL 发布了这条关于 研究论文 的更新:SLAP是一种新提出的批次感知数据选择框架,通过分层抽样和相对距离优化实现多样化数据覆盖,利用Hessian近似梯度进行动态批次选择,显著减少训练数据量20-40%同时提升或保持大语言模型的性能,支持多模型架构和多任务应用。
SLAP通过优化训练数据选择与使用效率,降低了大语言模型指令调优的计算成本和数据需求,是实现高效模型训练的重要进展。
研究员、模型团队和技术战略负责人 应该重点关注这条信号,尤其是正在跟踪 research、papers 的团队。
接下来观察这条信号是否出现开发者采用、竞品回应、研究复现、企业部署或政策/平台层面的后续动作。
本文介绍了利用前沿视觉语言模型(VLM)替代人类用户,复现了Picbreeder这一经典的开放性图像进化系统。研究发现,人工智能驱动的系统与历史上的人类驱动版本在生成内容上存在显著差异,论文尝试通过系统发育复杂度、视觉和语义显著性及新颖性等指标进行分析。为探究导致差异的原因,研究引入了选择过程中的探索噪声、代理行为多样性及记忆机制等因素。相关代码已开源。
本文研究了大型语言模型(LLMs)在不同任务中的置信度校准情况。预注册研究结果表明,目前的LLMs像人类一样,表现出过度自信:其置信度平均高于实际准确率。值得注意的是,这种现象受硬-易效应影响:在难度较大测试中,过度自信最为明显;而在简单测试中,则表现出明显的低估自信。我们开发了LifeEval,一种用于评估模型在不同难度水平上校准能力的测试。
本文首次大规模量化大型语言模型在复杂推理任务中的步骤冗余,发现模型在8种模型与基准测试组合中的推理步骤冗余率高达61%至93%,即大部分思考步骤可被截断而不影响最终答案的正确性。作者证明这种冗余是由基于结果奖励机制的结构性原因导致,而非模型缺陷,表明“过度思考”是当前训练方式的内在属性。