推理时概念抑制与面向视频的文本生成视频模型评估
文本生成视频(T2V)模型能合成逼真且时间连贯的视频,但如何可控地去除生成器中的目标概念仍具挑战。不同于文本生成图像的概念抹除,T2V去学习需在保留非目标对象、动作、场景及时间结构的同时,抑制跨帧持续存在的目标概念。本文提出了\textbf{SIRUS},一种无需训练的推理阶段概念级T2V去学习框架。通过目标概念的文本别名,SIRUS定位并抑制采样过程中的相关表达,无需更新文本编码器或去噪网络。同时,设计了视频导向的评估框架,从目标遗忘、非目标保留、视频质量、安全性及效率等多维度评估去学习效果。在CogVideoX数据集上的五种安全、对象和风格概念实验中,SIRUS实现了70.4%的遗忘成功率和25.7%的帧命中率,优于当下VideoEraser方法,且视频质量下降更小,展现了最佳的遗忘与质量权衡。迁移实验也验证了方法对不同T2V骨干的泛化能力。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。