AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月27日 · AWS

Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2

发生了什么

AWS 机器学习博客于 2026-08-27 发布文章,介绍使用 NVIDIA CUDA Multi-Process Service (MPS) 与 NVIDIA Triton Inference Server 在 Amazon EC2 GPU 实例上服务 ASR 模型,可将 GPU 基础设施成本降低 75%,同时保持亚秒级延迟,每 GPU 每秒处理 92.1 个请求。

EVENT STORY

发展脉络

  1. 首次出现Reduce ASR inference costs by 75% with NVIDIA MPS on Amazon EC2AWS Machine Learning Blog
  2. 当前判断该案例表明,推理成本优化正从硬件升级转向软件层面的资源调度优化。NVIDIA MPS 与 Triton 的组合为 ASR 等小请求场景提供了可复用的成本削减方案,可能推动更多企业采用类似技术来降低 AI 服务成本,尤其是在语音交互等大规模应用场景中。Agent Pulse · 分析
改变了什么

AWS 机器学习博客发布文章,展示如何通过 NVIDIA CUDA Multi-Process Service (MPS) 与 NVIDIA Triton Inference Server 在 Amazon EC2 GPU 实例上降低自动语音识别 (ASR) 模型的推理成本。文章指出,当每个请求仅使用 GPU 的一小部分时,大规模服务 ASR 模型成本高昂。通过采用 MPS,可以将 GPU 基础设施成本削减 75%,同时保持亚秒级延迟,达到每 GPU 每秒 92.1 个请求的吞吐量。

能力边界怎么变了

该方案利用 NVIDIA MPS 提高 GPU 利用率,使多个推理请求能够共享 GPU 资源,从而减少所需 GPU 数量。结合 Triton Inference Server 的并发处理能力,在保持低延迟的同时提升吞吐量。这提示我们,对于小请求占用的推理负载,通过软件层面的并发优化可以显著降低成本,而无需升级硬件。

为什么重要

该案例表明,推理成本优化正从硬件升级转向软件层面的资源调度优化。NVIDIA MPS 与 Triton 的组合为 ASR 等小请求场景提供了可复用的成本削减方案,可能推动更多企业采用类似技术来降低 AI 服务成本,尤其是在语音交互等大规模应用场景中。

对谁有影响

对于提供 ASR 服务的公司,该方案可显著降低 GPU 基础设施支出,提升毛利率。同时,成本降低可能促使更多企业采用语音交互功能,扩大市场。对于云服务商,此类优化案例有助于吸引成本敏感型客户,增强竞争力。

接下来观察

未来,类似 MPS 的 GPU 共享技术可能进一步普及,并与其他优化技术(如模型量化、蒸馏)结合,进一步降低推理成本。可关注 AWS 或 NVIDIA 是否发布更多关于 MPS 在不同模型类型上的性能基准,以及是否有其他云服务商提供类似优化方案。