Gemini 3.1 Flash TTS: the next generation of expressive AI speech
Google DeepMind 于 2026 年 4 月 15 日发布 Gemini 3.1 Flash TTS,引入粒度音频标签以精确控制 AI 语音表达。此前于 2026 年 3 月 26 日发布 Gemini 3.1 Flash Live,提升语音模型的精度并降低延迟。
发展脉络
- 首次出现Gemini 3.1 Flash Live: Making audio AI more natural and reliableGoogle DeepMind
- 行业反馈Gemini 3.1 Flash TTS: the next generation of expressive AI speechGoogle DeepMind
- 当前判断Google 连续发布语音模型,表明语音交互正成为 AI 竞争的关键领域。粒度音频标签可能成为语音合成的新标准,推动更多应用采用 AI 语音。同时,低延迟和高精度的改进将提升实时语音交互的体验,可能加速语音助手、客服等场景的落地。Agent Pulse · 分析
Google DeepMind 于 2026 年 4 月 15 日发布 Gemini 3.1 Flash TTS,该音频模型引入粒度音频标签,允许用户精确控制 AI 语音的生成,实现更具表现力的音频输出。此前,3 月 26 日发布的 Gemini 3.1 Flash Live 改进了语音模型的精度和延迟,使语音交互更流畅、自然和精确。这两个模型共同代表了 Google 在语音 AI 领域的持续进展,专注于提升语音合成的表现力和交互的自然度。
粒度音频标签的引入可能允许对语音的韵律、情感、语速等特征进行细粒度控制,这类似于文本生成中的控制标记,但应用于音频域。这暗示模型可能采用了条件生成机制,将标签作为输入的一部分,从而引导生成过程。对于开发者而言,这意味着可以通过简单的标签实现复杂的语音风格控制,而无需训练专用模型。
Google 连续发布语音模型,表明语音交互正成为 AI 竞争的关键领域。粒度音频标签可能成为语音合成的新标准,推动更多应用采用 AI 语音。同时,低延迟和高精度的改进将提升实时语音交互的体验,可能加速语音助手、客服等场景的落地。
对于使用语音交互的企业,这些模型可以降低开发成本,快速生成高质量语音内容,提升用户体验。对于开发者平台,提供这些模型作为 API 可以吸引开发者,形成生态。此外,低延迟特性适合实时应用,如语音助手、游戏角色配音等,可能创造新的商业机会。
未来,粒度音频标签可能扩展到更多语言和方言,并与其他模态(如情感识别)结合,实现更自然的交互。此外,这些模型可能集成到 Google 的云服务中,供开发者使用。可验证的信号包括:API 的发布、文档更新、以及第三方应用采用这些标签的案例。