Low Precision Flash Attention 4: End-to-End Block-Scaled Attention for Blackwell
PyTorch 博客发布 Low Precision Flash Attention 4,将 FlashAttention-4 扩展到 MXFP8 前向与反向,在 LLM shapes 上达到 2.85 PF/s 前向、2 PF/s 反向;在内部 shapes 上 FA4 MX8 达到 2.54 PF/s。标题强调面向 Blackwell 的端到端 block-scaled attention。
发展脉络
- 首次出现Low Precision Flash Attention 4: End-to-End Block-Scaled Attention for BlackwellPyTorch
- 当前判断注意力内核性能以 PF/s 为单位被公开对标,反映算力供给竞争正从芯片层下沉到算子与数值格式层;若 MXFP8 训练路径成熟,单位 token 训练与推理成本结构可能被重估。可验证下一信号:主流训练框架是否将此类低精度 attention 设为默认或可选后端。Agent Pulse · 分析
PyTorch 官方博客介绍 Low Precision Flash Attention 4:在 FlashAttention-4 基础上加入 MXFP8 前向与反向支持,形成面向 Blackwell 的端到端 block-scaled attention。文中给出的性能数字为 LLM shapes 上 2.85 PF/s 前向、2 PF/s 反向,内部 shapes 上 FA4 MX8 达到 2.54 PF/s。该工作属于注意力内核的低精度化与硬件适配方向,证据仅覆盖性能指标与实现范围,未涉及精度损失、训练稳定性或下游任务效果。
从证据看,低精度路径已同时覆盖前向与反向,说明 MXFP8 不再只是推理侧优化,而是进入训练相关算子链路;block-scaled 与 Blackwell 绑定意味着精度格式、缩放粒度与硬件指令集需要协同设计。可验证下一信号:是否公布 MXFP8 与 BF16/FP16 的数值误差对比及端到端训练收敛曲线。
注意力内核性能以 PF/s 为单位被公开对标,反映算力供给竞争正从芯片层下沉到算子与数值格式层;若 MXFP8 训练路径成熟,单位 token 训练与推理成本结构可能被重估。可验证下一信号:主流训练框架是否将此类低精度 attention 设为默认或可选后端。
对使用 Blackwell 集群的团队,低精度 attention 若可同时用于前向与反向,潜在价值在于同等硬件下提升吞吐、压缩单位任务成本;但证据未给出精度代价,采购与容量规划不宜直接按峰值 PF/s 折算。可验证下一信号:第三方复现的吞吐与精度联合基准。
短期内该工作更可能先在高性能训练与推理栈中试点,而非立即成为通用默认;其扩散速度取决于精度验证与生态集成。可验证下一信号:上游框架发布版本说明中是否出现 MXFP8 attention 的正式支持条目。