To Infinity and Beyond: ThunderKittens Now on NVIDIA Vera Rubin NVL72!
Together AI 发布博客称,已将 ThunderKittens 移植到 NVIDIA Vera Rubin NVL72,并围绕新硬件重写 NVFP4 GEMM,使其从 roofline 的 42% 提升到超过 22 PFLOPS,性能与 cuBLAS 和 CuTe DSL 相当。博客还表示会说明 ISA 的变化以及团队如何利用这些变化。
Development
- First ReportTo Infinity and Beyond: ThunderKittens Now on NVIDIA Vera Rubin NVL72!Together AI
- Current Assessment若该结果可复现,意味着第三方团队能在 NVIDIA 最新平台上用自研 kernel 逼近官方库性能,降低对闭源 cuBLAS 的单一依赖,对推理与训练成本结构有边际影响。但单一博客声明不足以证明格局变化,需观察是否有独立复现或客户采用。Agent Pulse · analysis
Together AI 在官方博客中宣布,ThunderKittens 已完成对 NVIDIA Vera Rubin NVL72 的移植,并针对该硬件重写了 NVFP4 GEMM 实现。据其描述,该实现从 roofline 的 42% 提升至超过 22 PFLOPS,达到与 cuBLAS、CuTe DSL 竞争的水平。博客同时承诺解释 ISA 层面的变化以及团队如何利用这些新指令。证据仅来自这一篇一手来源,未提供基准测试方法、矩阵规模、功耗或第三方复现信息。
从 42% roofline 到 22 PFLOPS 的跃升,指向 NVFP4 低精度路径与新一代 ISA 特性被真正用上,而非简单调参;但 roofline 百分比与绝对 FLOPS 的换算依赖具体峰值假设,需看博客正文的 ISA 细节与 GEMM 形状才能判断可迁移性。可验证下一信号:是否公开 kernel 代码、基准脚本与 cuBLAS 对比的完整配置。
若该结果可复现,意味着第三方团队能在 NVIDIA 最新平台上用自研 kernel 逼近官方库性能,降低对闭源 cuBLAS 的单一依赖,对推理与训练成本结构有边际影响。但单一博客声明不足以证明格局变化,需观察是否有独立复现或客户采用。
对使用 NVIDIA 新平台做低精度推理的团队,这类 kernel 进展可能转化为单位 token 成本下降与供应商议价空间;但当前证据只有厂商自述,采购或架构决策前应等待可复现基准与代码可用性。
后续值得关注三点:ThunderKittens 是否开源 Vera Rubin 后端、NVFP4 GEMM 在真实模型推理中的端到端收益、以及 cuBLAS/CuTe DSL 是否在同期更新拉开差距。任一缺失都会削弱该声明的实际权重。