GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model
GROW 是一种用于自回归-扩散文本到语音模型的组相对优势加权在线强化学习方法。它直接作用于标准流匹配目标,对每组提示采样一组在线话语,分别标准化可懂度和说话人相似度奖励,并组合它们以重新加权流匹配回归。Wasserstein-2 速度惩罚将更新后的模型锚定到冻结的预训练参考。在 DiTAR 上实例化,并在 LibriSpeech 和 Seed-TTS EN/ZH 上评估,GROW 将平均 WER 从 2.016 降至 1.558,并将说话人相似度从 0.676 提升。
发展脉络
- 首次出现GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech modelarXiv cs.CL
- 当前判断GROW 展示了强化学习在 TTS 领域的潜力,通过显著降低 WER 和提升说话人相似度,可能推动更高质量的语音合成应用。该方法在多个数据集上的验证表明其通用性,可能被集成到商业 TTS 系统中,提升用户体验。Agent Pulse · 分析
GROW 论文提出了一种新的强化学习方法,用于训练自回归-扩散文本到语音(TTS)模型。该方法解决了流匹配 TTS 中确定性 ODE 采样带来的挑战,避免了将 ODE 转换为 SDE 并跟踪每步似然比的复杂性。GROW 直接优化流匹配目标,通过组相对优势加权,对每个提示采样一组在线话语,分别标准化可懂度和说话人相似度奖励,并组合它们来重新加权回归损失。引入 Wasserstein-2 速度惩罚以保持与预训练参考模型的接近。论文还发现,对于奖励集中的强预训练模型,正指数加权会被奖励无关的自模仿主导,而零均值符号优势能保持有效的组内信用分配。在 DiTAR 上实例化,并在 LibriSpeech 和 Seed-TTS EN/ZH 上评估,GROW 将平均 WER 从 2.016 降至 1.558,并将说话人相似度从 0.676 提升。
GROW 的核心技术贡献在于将强化学习直接应用于流匹配目标,避免了传统轨迹级策略梯度方法中的随机扰动和额外开销。通过组内标准化奖励和优势加权,它实现了有效的信用分配,并解决了强预训练模型中奖励集中导致的奖励无关自模仿问题。Wasserstein-2 速度惩罚作为正则化项,防止模型偏离预训练参考。这一方法可能对扩散模型和流匹配模型的强化学习训练产生广泛影响。
GROW 展示了强化学习在 TTS 领域的潜力,通过显著降低 WER 和提升说话人相似度,可能推动更高质量的语音合成应用。该方法在多个数据集上的验证表明其通用性,可能被集成到商业 TTS 系统中,提升用户体验。
GROW 通过降低 WER 和提升说话人相似度,可能提升 TTS 产品的质量,从而增强用户满意度和产品竞争力。对于提供语音合成服务的公司,采用 GROW 可能带来更自然、更准确的语音输出,减少人工干预,降低成本。
未来,GROW 可能扩展到其他生成任务,如音乐生成或语音转换。其组相对优势加权方法可能被应用于更广泛的扩散模型强化学习场景。可验证的下一信号包括:在更大规模数据集上的应用、与其他 TTS 模型的集成,以及开源代码的发布。