Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers
Apple 在 2026 年 7 月 28 日发表研究,提出一种内存高效的音频合成架构,用于 Siri Expressive Voices 功能。该架构将语义音频令牌转换为残差向量量化表示,并在 Apple Matrix Coprocessor 上实时运行。
Development
- First ReportMemory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion TransformersApple Machine Learning Research
- Current AssessmentApple 将设备端实时音频合成能力集成到 Siri,表明端侧生成式 AI 正从文本扩展到语音。下一可验证信号:其他厂商是否跟进设备端实时语音合成,或 Apple 是否开放该能力给第三方应用。Agent Pulse · analysis
Apple 在 2026 年 7 月 28 日发表研究,介绍了一种内存高效的音频合成架构,用于驱动 Siri Expressive Voices 功能。该架构是一个去令牌化器,将基础模型发出的语义音频令牌转换为高保真音频,并在 Apple Matrix Coprocessor 的严格计算和内存预算内实时运行。设计采用三组件结构,将语义音频令牌转换为残差向量量化表示。
该架构通过解耦时间深度扩散 Transformer 实现内存高效音频合成,关键创新在于将语义令牌转换为 RVQ 表示,并针对 AMX 协处理器优化。下一可验证信号:Apple 是否在后续设备中集成该架构,以及其音频质量与延迟指标。
Apple 将设备端实时音频合成能力集成到 Siri,表明端侧生成式 AI 正从文本扩展到语音。下一可验证信号:其他厂商是否跟进设备端实时语音合成,或 Apple 是否开放该能力给第三方应用。
设备端实时音频合成可降低云端推理成本,提升隐私性和响应速度,增强 Siri 竞争力。下一可验证信号:Apple 是否在财报中提及 Siri 使用率提升或相关收入。
该技术可能推动设备端语音助手体验升级,减少对云端依赖。下一可验证信号:Apple 是否在下一代 iPhone 或 HomePod 中部署该功能,以及用户反馈。