AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年9月22日 · CUTLASS

CUTLASS 4.8.0

发生了什么

NVIDIA 发布 CUTLASS 4.8.0,新增 CuTe DSL 与 CuTe 扩展,并加入对 Rubin 的初步支持以加速稠密 GEMM。该版本支持更高吞吐的 FP8(MMA_K=64)与 FP4(MMA_K=128)Tensor Core MMA 指令、B collector 复用、TMEM 容量从 512 COL 扩展到 576 COL、更大共享内存分配(328KB)、增强的 FP8/FP4 混合精度吞吐,以及 softmax 加速相关特性。CuTe DSL 扩展还加入 CTA-V map 自动推断、异步原子 TMA reduce-store 与稀疏 MMA、可复用 GEMM mainloop 与 TMA epilogue helper、可选 TMEM 累加器缓冲规划。

EVENT STORY

发展脉络

  1. 首次出现CUTLASS 4.8.0NVIDIA CUTLASS Releases
  2. 当前判断CUTLASS 是 NVIDIA 生态中面向 kernel 作者的基础库,其版本节奏通常与新一代硬件能力同步。此次在发布说明中直接标注 Rubin 初步支持,说明软件栈正提前为后续平台铺路;FP4 与 2:4 稀疏、FP8 高吞吐 MMA 的组合,也延续了低精度推理与训练路径的供给方向。判断依据仅限该发布说明,尚不能推断硬件发布时间或客户采用情况。可验证下一信号:后续版本是否把 Rubin 支持从 initial 提升为完整覆盖。Agent Pulse · 分析
改变了什么

NVIDIA 在 GitHub 发布 CUTLASS 4.8.0,核心变化是引入 CuTe DSL 与 CuTe 扩展,并给出对 Rubin 的初步支持,用于加速稠密 GEMM。硬件相关能力包括更高吞吐的 FP8(MMA_K=64)与 FP4(MMA_K=128)Tensor Core MMA 指令、B collector 复用、TMEM 从 512 COL 扩到 576 COL、共享内存上限提升到 328KB,以及 FP8/FP4 混合精度吞吐增强和 softmax 加速特性。CuTe DSL 扩展侧新增 CTA-V map 自动推断(显式覆盖仍支持)、异步原子 TMA reduce-store 与稀疏 MMA、可复用 GEMM mainloop 与 TMA epilogue helper、可选 TMEM 累加器缓冲规划(含容量受限 kernel 的 ping-pong 重叠存储),并支持 FP4 的 2:4 稀疏。

能力边界怎么变了

从发布说明看,这一版把优化重心放在数据搬运与片上存储:B collector 复用、TMEM 扩容、328KB 共享内存与 TMA reduce-store 都指向减少重复加载与同步开销;CTA-V map 自动推断和可复用 mainloop/epilogue helper 则降低手写 kernel 的样板成本。这些是发布说明层面的能力声明,实际收益需在具体形状与精度组合下复测。可验证下一信号:官方或第三方给出 FP8/FP4 与上一版本在相同 GEMM 形状上的吞吐对比。

为什么重要

CUTLASS 是 NVIDIA 生态中面向 kernel 作者的基础库,其版本节奏通常与新一代硬件能力同步。此次在发布说明中直接标注 Rubin 初步支持,说明软件栈正提前为后续平台铺路;FP4 与 2:4 稀疏、FP8 高吞吐 MMA 的组合,也延续了低精度推理与训练路径的供给方向。判断依据仅限该发布说明,尚不能推断硬件发布时间或客户采用情况。可验证下一信号:后续版本是否把 Rubin 支持从 initial 提升为完整覆盖。

对谁有影响

对使用 NVIDIA GPU 做训练或推理的团队,这一版本提供了低精度吞吐与片上存储利用率的潜在改进路径,可能影响单位算力成本与 kernel 维护人力投入。但发布说明未给出性能数字,采购或迁移决策前应自行基准测试。可验证下一信号:在自有负载上对比 4.8.0 与前版本的端到端吞吐与显存占用。

接下来观察

若 CuTe DSL 与自动 CTA-V map 推断按说明落地,kernel 开发的门槛与维护成本可能下降,更多团队会尝试自研低精度 GEMM 与 attention 相关 kernel。需要观察的是文档、示例与向后兼容性是否同步跟上。可验证下一信号:官方文档与示例中 CuTe DSL 的覆盖范围,以及社区是否出现基于该版本的公开 kernel 实现。