MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention
MXAttention 是一种针对 MXFP4 注意力机制的无数据后训练量化框架,提出 Universal Optimal Scaling (UOS) 和 Pre-Normalization Quantization (PNQ) 两种组件。在 Wan2.2 和 HunyuanVideo 上的实验表明,MXAttention 缩小了 OCP MXFP4 与 FP16 之间至少 95% 的 VBench 成像质量差距,并在所有报告的 VBench 指标上保持了 FP16 级别的生成质量,绝对退化小于 0.01。
Development
- First ReportMXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 AttentionarXiv cs.AI
- Current AssessmentMXAttention 针对扩散视频生成模型中的注意力计算瓶颈,提供了高效的 MXFP4 注意力推理路径。这暗示着在视频生成等计算密集型任务中,低精度量化可能成为降低推理成本的关键技术。然而,该研究仍处于论文阶段,实际部署和硬件支持尚不明确,需要关注后续的工程实现和生态支持。Agent Pulse · analysis
MXAttention 论文提出了一种针对 MXFP4 注意力机制的无数据后训练量化框架,解决了直接量化导致的生成质量下降问题。该框架包含两个组件:Universal Optimal Scaling (UOS) 利用幂次缩放微缩的周期结构,推导出无需校准或搜索的分布无关最优缩放边界 Qmax=7.25;Pre-Normalization Quantization (PNQ) 在行求和之前量化未归一化的 softmax 指数,从而通过构造保持归一化。在 Wan2.2 和 HunyuanVideo 上的实验表明,MXAttention 缩小了 OCP MXFP4 与 FP16 之间至少 95% 的 VBench 成像质量差距,并在所有报告的 VBench 指标上保持了 FP16 级别的生成质量,绝对退化小于 0.01。
MXAttention 的核心创新在于 UOS 和 PNQ。UOS 利用幂次缩放微缩的周期结构,推导出分布无关的最优缩放边界 Qmax=7.25,避免了校准或搜索,这为无数据量化提供了新思路。PNQ 通过量化未归一化的 softmax 指数,在行求和前保持归一化,解决了 softmax 循环中的逐行归一化误差。这些方法可能对 MXFP4 注意力在其他模型中的应用有启发,但需要进一步验证其泛化性。
MXAttention 针对扩散视频生成模型中的注意力计算瓶颈,提供了高效的 MXFP4 注意力推理路径。这暗示着在视频生成等计算密集型任务中,低精度量化可能成为降低推理成本的关键技术。然而,该研究仍处于论文阶段,实际部署和硬件支持尚不明确,需要关注后续的工程实现和生态支持。
MXAttention 可能降低视频生成模型的推理成本,从而提升部署效率。对于提供视频生成服务的公司,采用 MXAttention 可能减少硬件投入和能耗,但需评估其与现有系统的集成成本。该技术尚处于研究阶段,商业价值需待产品化验证。
未来可关注 MXAttention 在更多模型和硬件上的验证,以及其是否被主流推理框架采纳。此外,UOS 的无数据特性可能推动更多无校准量化方法的发展。下一信号是 MXAttention 在非扩散模型或更长序列上的表现,以及其与专用硬件加速器的结合。