Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model
研究者提出一种从静态面部图像合成语音的框架,使用轻量级Face Adapter和软微调将面部识别特征对齐到StyleTTS 2模型的风格空间,在LRS3数据集上合成语音的UTMOS评分达到3.7-4.0,超过真实语音的3.61,且无需重新训练即可生成西班牙语语音。
发展脉络
- 首次出现Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS ModelarXiv cs.AI
- 当前判断该工作将TTS的输入模态从音频扩展到视觉,可能降低语音合成对参考音频的依赖,尤其适用于历史人物、游戏角色等仅有图像的场景。但当前仅基于LRS3数据集(英语TED演讲),真实场景的泛化性(如不同光照、表情、年龄)尚未验证。若技术成熟,可能推动虚拟数字人、无障碍通信等应用。Agent Pulse · 分析
该研究提出了一种零样本人脸到语音合成框架,通过轻量级Face Adapter和面部编码器上层软微调,将面部识别特征与冻结的StyleTTS 2模型的风格空间对齐。在LRS3数据集上,合成语音的自然度(UTMOS 3.7-4.0)匹配或超过真实语音(3.61),且面部到语音的检索一致性高于随机水平。此外,英语训练的适配器无需重新训练即可生成流畅的西班牙语语音,表明人脸到风格的映射是语言无关的。
该方法的核心创新在于利用预训练的面部识别模型和TTS模型,通过轻量级适配器实现跨模态对齐,避免了从头训练大规模多模态模型。软微调面部编码器上层而非全部参数,保留了底层通用特征,降低了过拟合风险。语言无关性表明面部特征可能编码了与语言无关的声学属性(如音色、基频),为多语言TTS提供了新思路。下一步可验证该适配器在更多语言和噪声环境下的鲁棒性。
该工作将TTS的输入模态从音频扩展到视觉,可能降低语音合成对参考音频的依赖,尤其适用于历史人物、游戏角色等仅有图像的场景。但当前仅基于LRS3数据集(英语TED演讲),真实场景的泛化性(如不同光照、表情、年龄)尚未验证。若技术成熟,可能推动虚拟数字人、无障碍通信等应用。
该技术可降低语音合成对音频数据的依赖,为游戏、影视、虚拟助手等场景提供新方案。例如,游戏角色可根据面部模型自动生成语音,减少配音成本。但当前仅处于研究阶段,距离产品化还需解决真实场景的鲁棒性和个性化控制问题。
未来可探索将人脸特征与更多声学属性(如情感、语速)解耦,或结合视频帧序列生成动态语音。此外,该框架的轻量级特性使其易于部署在边缘设备,但需评估计算开销。语言无关性提示可构建统一的多语言语音合成系统,但需验证在非英语语言上的表现。