MultiRef-Compass:迈向多参考音视频生成的全面评估
多参考音视频(MR2AV)生成旨在基于多个参考和文本指令生成连贯的音视频内容。现有基准多关注文本驱动生成、单参考主体保留或音视频单独对齐,缺少对MR2AV这一新兴设定的探索。MR2AV需模型联合推理多个参考,生成同步的视听内容,既忠实保留各参考,也正确绑定并组合多实体成连贯事件。为此,本文引入MultiRef-Compass,一个统一的MR2AV基准,包含350个通过可控资源组合管线精心构建的样本,涵盖多视角主体保留、多实体绑定及人-物-场景组合。MultiRef-Compass定义包括基础质量、参考一致性、视听一致性和指令遵循四维指标及14个子指标,结合自动指标与重判增强的大语言模型评审框架,实现对感知质量和参考条件组合的可扩展且可审计评估。八个典型MR2AV系统的实验揭示多维度尚有大幅提升空间,彰显全面基准的必要性,并奠定MultiRef-Compass作为未来MR2AV研究基础。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。