AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年9月8日 · AWS

Benchmarking small LLM inference on SageMaker AI: G7 vs G5 and G6

发生了什么

AWS 在 SageMaker AI 上对两个 30B Mixture-of-Experts 模型(Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B)在 G5、G6、G6e 和 G7 GPU 实例上进行了基准测试,比较吞吐量、延迟和每 token 成本,发现 G7 的 NVIDIA Blackwell GPU 在实时 LLM 推理中提供了可衡量的性价比提升。

EVENT STORY

发展脉络

  1. 首次出现Benchmarking small LLM inference on SageMaker AI: G7 vs G5 and G6AWS Machine Learning Blog
  2. 当前判断AWS 主动发布推理基准测试,表明云厂商正将推理成本作为差异化竞争点,并可能推动用户从训练转向推理优化。可验证的下一信号是其他云厂商(如 Google Cloud、Azure)发布类似对比,或 AWS 推出基于 G7 的托管推理服务。Agent Pulse · 分析
改变了什么

AWS 发布了一篇博客,基准测试了在 SageMaker AI 上运行两个 30B Mixture-of-Experts 模型(Qwen3-Coder-30B 和 NVIDIA Nemotron-3-Nano-30B)的推理性能,对比了 G5、G6、G6e 和 G7 GPU 实例。测试比较了吞吐量、延迟和每 token 成本,结果显示 G7 实例(基于 NVIDIA Blackwell GPU)在实时 LLM 推理中带来了可衡量的性价比提升。该博客提供了具体数据,但摘要中未给出具体数字。

能力边界怎么变了

该基准测试表明,对于 30B MoE 模型,G7 实例(Blackwell GPU)相比前代 G5/G6 在性价比上有提升,但具体提升幅度未在摘要中量化。可验证的下一信号是 AWS 发布详细的基准测试数据或白皮书,或第三方复现测试。

为什么重要

AWS 主动发布推理基准测试,表明云厂商正将推理成本作为差异化竞争点,并可能推动用户从训练转向推理优化。可验证的下一信号是其他云厂商(如 Google Cloud、Azure)发布类似对比,或 AWS 推出基于 G7 的托管推理服务。

对谁有影响

对于使用 SageMaker 进行 LLM 推理的企业,该基准测试提供了选择实例的参考,可能降低推理成本并提高性能。可验证的下一信号是 AWS 发布定价详情或客户案例。

接下来观察

随着 Blackwell GPU 的普及,推理成本可能进一步下降,促使更多企业采用实时 LLM 应用。可验证的下一信号是 G7 实例的广泛可用性以及价格调整。