Xemo-Talker:显式解锁音频驱动的情感控制说话人像合成
现有的音频驱动说话人像系统在情感控制方面依赖隐式调节,导致控制间接且不足。本文发现,将判别监督集中于运动空间中的次要成分能更好地平衡情感表达与准确的唇动同步。基于此,Xemo-Talker先学习中性语音到动作的映射以保证稳定的唇动同步,再通过轻量级情感分支和三重损失设计实现细粒度的情感控制。该方法在保持竞争性唇动同步的同时,达到了先进的情感分类准确率且推理效率高,性能接近真实数据。源代码已公开。
这条 研究论文 信号说明,来自 arXiv cs.CV 的信息已经不只是单点新闻,而是值得放进产品、研究和行业判断里的趋势线索。