DiBS:基于扩散模型的分支选择
本文提出了一种名为DiBS的新方法,利用扩散模型指导数独问题的分支选择搜索过程,结合符号求解的完整性与扩散模型的全局引导,显著减少搜索成本,特别是在长尾搜索中表现出优势。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
本文提出了一种名为DiBS的新方法,利用扩散模型指导数独问题的分支选择搜索过程,结合符号求解的完整性与扩散模型的全局引导,显著减少搜索成本,特别是在长尾搜索中表现出优势。
这条 研究论文 信号说明,来自 arXiv cs.AI 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。
arXiv cs.AI 发布了这条关于 研究论文 的更新:本文提出了一种名为DiBS的新方法,利用扩散模型指导数独问题的分支选择搜索过程,结合符号求解的完整性与扩散模型的全局引导,显著减少搜索成本,特别是在长尾搜索中表现出优势。
DiBS结合了扩散模型的全局结构学习能力与符号求解的严格保证,克服了传统深度学习解法缺乏正确性保证及符号解法搜索时间长的问题,在复杂实例上有效降低了搜索成本。
研究员、模型团队和技术战略负责人 应该重点关注这条信号,尤其是正在跟踪 research、papers 的团队。
接下来观察这条信号是否出现开发者采用、竞品回应、研究复现、企业部署或政策/平台层面的后续动作。
在高风险社会经济环境中部署的机器学习系统经常表现出偏见。该论文将偏见形式化为一个对称破坏操作:如果在保持优点特征不变的情况下交换敏感属性后,分类器的输出保持不变,则该分类器被视为公平。通过基于损失的正则化作为对称恢复机制,在四个具有不同噪声、相关性和偏见水平的合成数据集上进行评估,该框架实现了超过90%的违规减少,准确率损失约为5%。该方法不依赖因果图知识,计算效率高,且适用于任何可定义为比特翻转的敏感属性,适合缺乏本地歧视来源的场景。
本文提出了SafeGene,一种可复用的安全适配器模块,针对开源大语言模型(LLM)在进行下游微调时安全对齐性减弱导致的安全恢复问题。SafeGene 把安全能力作为独立且可复用的适配器表示,从对齐与降级模型差异中获取安全向量,经过数据感知层选择优化,并通过少样本层级系数重新校准用于各个下游任务中。多模型、多任务实验证明,SafeGene有效减少有害回答率,同时保持任务性能,优于现有安全适配方法。
本论文介绍了PolyFact,一个包含12种语言、10万条基于Wikidata事实的多语种平行问答数据集,旨在研究大型语言模型在非英语语言中的事实表达不一致问题。研究比较了轻量持续预训练、监督微调和基于Group Relative Policy Optimization (GRPO)的强化学习方法,发现在Qwen-2.5-7B和OLMo-2-1124-7B模型上,GRPO在跨语言一致性和对未见语言的泛化能力上均优于其他方法。此外,机制分析表明GRPO通过减弱多层感知机和注意力头中的语言特化,提高了共享的跨语言表示。研究团队将公开代码、模型和数据集。