通过速度匹配扩展扩散模型的强化学习
奖励微调成为调整扩散模型以符合人类偏好和特定任务目标的重要工具,但现有方法主要借鉴了大语言模型的策略梯度机制。由于扩散模型无法为生成样本提供可解析的似然,当前方法要么基于随机去噪的转移构造轨迹似然,要么用证据下界近似端点似然,增加了计算和算法复杂度。本文提出了奖励驱动的速度匹配(RVM),一种简单且无需轨迹的更新方法,直接作用于速度场,通过强化高奖励生成方向和抑制低奖励方向来进行微调,并引入锚定项控制速度场漂移。该方法提供了一个通用框架,可以涵盖现有的RAM和DiffusionNFT微调方法。RVM在多种大规模扩散模型奖励微调任务中表现出与基于轨迹的策略梯度方法相当甚至更优的效果,同时大幅降低训练成本。对于视频生成任务,设计新的动态追踪奖励有助于提升运动质量和整体表现。研究表明,在原生速度表示下进行奖励微调优于基于似然的策略优化。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。