重新思考读出机制:解锁视频骨干网络以检测AI生成视频
AI生成视频通常包含跨帧不一致引起的微妙时间伪影。捕捉这些伪影的检测器应受益于视频预训练骨干网络,而非仅用图像预训练网络。但实际上,采用标准全局读出的视频骨干网络未必能超越强大的图像预训练探针。主要原因在于读出中过度的时空聚合,将每帧压缩成单个全局描述符,抑制了局部补丁级时间动态,丢失了重要的补丁间关系。基于此,作者提出Velocity Gated Patch Velocity Profiling (V-PVP),一种轻量级读出模块,通过双流处理补丁速度场,仅增加约0.5M参数。V-PVP作为即插即用模块,在多种视频骨干和训练设置下均能稳定提升性能。该方法在完全冻结骨干情况下,在AIGVDBench上达到了95.28的AUC,证明替换聚合层激活了视频骨干的时间潜力,恢复其在AI生成视频检测上的优势。代码已公开。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。