返回今日信号
图片
研究论文2026年7月17日 12:00

推理时概念抑制与面向视频的文本生成视频模型评估

文本生成视频(T2V)模型能合成逼真且时间连贯的视频,但如何可控地去除生成器中的目标概念仍具挑战。不同于文本生成图像的概念抹除,T2V去学习需在保留非目标对象、动作、场景及时间结构的同时,抑制跨帧持续存在的目标概念。本文提出了\textbf{SIRUS},一种无需训练的推理阶段概念级T2V去学习框架。通过目标概念的文本别名,SIRUS定位并抑制采样过程中的相关表达,无需更新文本编码器或去噪网络。同时,设计了视频导向的评估框架,从目标遗忘、非目标保留、视频质量、安全性及效率等多维度评估去学习效果。在CogVideoX数据集上的五种安全、对象和风格概念实验中,SIRUS实现了70.4%的遗忘成功率和25.7%的帧命中率,优于当下VideoEraser方法,且视频质量下降更小,展现了最佳的遗忘与质量权衡。迁移实验也验证了方法对不同T2V骨干的泛化能力。

AI Signal Takeaway

这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。

发生了什么

arXiv cs.CV 发布了这条关于 研究论文 的更新:文本生成视频(T2V)模型能合成逼真且时间连贯的视频,但如何可控地去除生成器中的目标概念仍具挑战。不同于文本生成图像的概念抹除,T2V去学习需在保留非目标对象、动作、场景及时间结构的同时,抑制跨帧持续存在的目标概念。本文提出了\textbf{SIRUS},一种无需训练的推理阶段概念级T2V去学习框架。通过目标概念的文本别名,SIRUS定位并抑制采样过程中的相关表达,无需更新文本编码器或去噪网络。同时,设计了视频导向的评估框架,从目标遗忘、非目标保留、视频质量、安全性及效率等多维度评估去学习效果。在CogVideoX数据集上的五种安全、对象和风格概念实验中,SIRUS实现了70.4%的遗忘成功率和25.7%的帧命中率,优于当下VideoEraser方法,且视频质量下降更小,展现了最佳的遗忘与质量权衡。迁移实验也验证了方法对不同T2V骨干的泛化能力。

为什么重要

当前文本生成视频模型难以高效且可控地消除特定概念,尤其需保持视频连贯性及非目标内容。SIRUS创新地在推理阶段通过文本别名定位抑制目标概念,无需模型更新,提升了实用性与效率。同时提出综合视频级评估标准,使去学习效果更全面有效。该方法显著提升遗忘成功率并减少质量损失,为文本生成视频的概念抑制提供了强有力的技术路径。

谁应该关注

研究员、模型团队和技术战略负责人 应该重点关注这条信号,尤其是正在跟踪 research、papers、models 的团队。

下一步看什么

接下来观察这条信号是否出现开发者采用、竞品回应、研究复现、企业部署或政策/平台层面的后续动作。

相关信号

[ 2026年7月17日 ]
研究论文
arXiv cs.CV/2026年7月17日

MultiRef-Compass:迈向多参考音视频生成的全面评估

多参考音视频(MR2AV)生成旨在基于多个参考和文本指令生成连贯的音视频内容。现有基准多关注文本驱动生成、单参考主体保留或音视频单独对齐,缺少对MR2AV这一新兴设定的探索。MR2AV需模型联合推理多个参考,生成同步的视听内容,既忠实保留各参考,也正确绑定并组合多实体成连贯事件。为此,本文引入MultiRef-Compass,一个统一的MR2AV基准,包含350个通过可控资源组合管线精心构建的样本,涵盖多视角主体保留、多实体绑定及人-物-场景组合。MultiRef-Compass定义包括基础质量、参考一致性、视听一致性和指令遵循四维指标及14个子指标,结合自动指标与重判增强的大语言模型评审框架,实现对感知质量和参考条件组合的可扩展且可审计评估。八个典型MR2AV系统的实验揭示多维度尚有大幅提升空间,彰显全面基准的必要性,并奠定MultiRef-Compass作为未来MR2AV研究基础。

研究论文
arXiv cs.AI/2026年7月17日

将人工智能对齐于动态的人机协作流程

当前的对齐方法通常聚焦于使用静态的人类偏好表示来模拟人类行为,忽视了现实人机交互中偏好的动态和情境依赖性。本文主张从静态模仿转向互动互补的对齐模式,在该模式下,偏好通过交互逐渐形成,对齐不再仅仅是满足偏好。作者通过将现有对齐与人类和模型行为随时间共同演化的轨迹视角对比,形式化了这一差距。基于跨学科研讨会的见解,结合社会科学关于人类协作的研究,指出人机系统放大了这些动态,带来了新的不确定性推理和协调挑战,并提出了融合机器学习与社会决策科学的研究纲领,以推动互动式人机对齐系统的发展。

研究论文
arXiv cs.AI/2026年7月17日

控制预算:示例优于旋钮

本文提出生成模型的属性调控存在一个“预算”,由训练数据预先设定。旋钮(如提示词、指导尺度、属性标签)只能调控到预算的一部分,而更大且不同的部分则需通过示例进行引导。示例由模型已有知识组合而成,能够跨越旋钮无法覆盖的范围,实现更广泛且更具体的属性表达。本文针对图像和晶体结构生成验证了该理论,并提出了检测和构建示例集的方法。