Deploying Qwen3.8-2.4T-A95B on Amazon SageMaker HyperPod with vLLM
AWS 发布博客,介绍如何在 Amazon SageMaker HyperPod 上使用 vLLM 部署 Qwen3.8-2.4T-A95B,一个 2.4 万亿参数的开源权重模型。部署流程涵盖集群配置、NVFP4 量化,以及提供内置推理、工具调用和原生 MTP 投机解码的 OpenAI 兼容端点。
Development
- First ReportQwen3.8-27B-Uncensored-Genesis-V1-GGUFReddit r/LocalLLaMA
- Industry ResponseDeploying Qwen3.8-2.4T-A95B on Amazon SageMaker HyperPod with vLLMAWS Machine Learning Blog
- Industry ResponseQwen3.8 27B with embeddingsReddit r/LocalLLaMA
- Industry ResponseQwen3.8 Flash on 12GB VRAM - 15 tokens/sReddit r/LocalLLaMA
- Industry ResponseQwen3.8-27B: >70 tok/s (>160 tok/s concurrent), 10k tok/s prefill, full context on 2x3090 (or and 48GB or larger on ampere or higher), vanilla vllmReddit r/LocalLLaMA
- Industry ResponseQwen3.8 27b practical modeling for 3d printingReddit r/LocalLLaMA
- Industry ResponseCachyOS Qwen 3.8 27b on 2x 5090 vLLMReddit r/LocalLLaMA
- Industry ResponseQwen3.8-27B Q4_K_M on 2x3060Reddit r/LocalLLaMA
- Current AssessmentAWS 提供针对 Qwen 超大规模模型的官方部署指南,反映了云服务商对开源大模型生态的重视,以及将前沿模型能力转化为可消费云服务的趋势。此举可能推动更多企业采用超大规模开源模型,并影响模型部署与推理服务的市场竞争格局。Agent Pulse · analysis
AWS 官方博客于 2026 年 9 月 9 日发布指南,详细说明在 Amazon SageMaker HyperPod 上部署 Qwen3.8-2.4T-A95B 的步骤。该模型拥有 2.4 万亿参数,属于开源权重模型。指南内容包括集群配置、NVFP4 量化技术,以及如何设置一个兼容 OpenAI 的端点,该端点支持内置推理、工具调用和原生 MTP 投机解码。这标志着大型开源模型在云平台上的可部署性进一步提升,为企业和开发者提供了在托管基础设施上运行超大规模模型的参考路径。
该部署指南展示了在云环境中运行 2.4 万亿参数模型的可行方案,结合了 NVFP4 量化以降低内存占用,并利用 MTP 投机解码提升推理速度。这表明针对超大规模模型的推理优化已从理论走向实践,通过量化与解码加速技术的结合,使得在受限资源下部署超大模型成为可能。
AWS 提供针对 Qwen 超大规模模型的官方部署指南,反映了云服务商对开源大模型生态的重视,以及将前沿模型能力转化为可消费云服务的趋势。此举可能推动更多企业采用超大规模开源模型,并影响模型部署与推理服务的市场竞争格局。
对于企业而言,该指南降低了部署超大规模模型的技术门槛,使得利用 Qwen3.8-2.4T-A95B 等模型构建应用成为可能。这有助于企业快速采用先进 AI 能力,加速产品创新,并可能降低长期推理成本。
未来,可预见更多云平台将提供针对超大规模模型的优化部署方案,量化与投机解码等技术将成为标准配置。同时,模型推理成本可能进一步下降,使得更大规模的模型在更多应用场景中得以落地。