Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPod
AWS 博客于 2026-09-04 发布文章,介绍如何在 Amazon SageMaker HyperPod(基于 Amazon EKS)上构建持续运行的 Physical AI 模型工厂,使用 NVIDIA Cosmos 3 进行合成数据生成、后训练和闭环评估,并以 GPU goodput 作为关键指标。
发展脉络
- 首次出现Build a Physical AI model factory with NVIDIA Cosmos 3 on SageMaker HyperPodAWS Machine Learning Blog
- 当前判断云厂商与芯片厂商合作加深,AWS 与 NVIDIA 联合推出面向 Physical AI 的解决方案,将模型工厂概念产品化。这表明 Physical AI 领域的基础设施竞争已从单一训练转向全生命周期支持。Agent Pulse · 分析
AWS 机器学习博客发布文章,阐述构建 Physical AI 系统需要持续流水线而非单次训练任务。文章展示了如何在 Amazon SageMaker HyperPod 集群(基于 Amazon EKS)上运行模型工厂,包括使用 NVIDIA Cosmos 3 进行合成数据生成、后训练和闭环评估,并强调 GPU goodput 是衡量系统效率的核心指标。
Physical AI 开发正从单次训练转向持续流水线,SageMaker HyperPod 提供持久集群支持合成数据生成、后训练和评估的闭环。GPU goodput 作为关键指标,反映集群在持续运行中的有效利用率,而非仅关注单次训练性能。
云厂商与芯片厂商合作加深,AWS 与 NVIDIA 联合推出面向 Physical AI 的解决方案,将模型工厂概念产品化。这表明 Physical AI 领域的基础设施竞争已从单一训练转向全生命周期支持。
对 AWS 而言,该方案强化了 SageMaker HyperPod 在 Physical AI 领域的吸引力,可能带动云服务消费。对 NVIDIA,Cosmos 3 通过 AWS 渠道扩大生态影响力,双方在 Physical AI 基础设施上形成协同。
后续可关注该方案的实际采用案例、GPU goodput 的基准数据,以及是否有更多 Physical AI 模型工厂的参考架构发布。