AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 3, 2026 · CMuon

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

What Happened

论文提出 Chunked Muon (CMuon) 优化器,用于加速和稳定 Diffusion Transformer (DiT) 训练。标准 DiT 将功能不同的权重(如 AdaLN 和 QKV 层)融合为统一张量,直接应用 Muon 会导致隐式子空间耦合,损害优化。CMuon 在正交化前将这些矩阵划分为独立子组件。675M 参数 DiT 使用 CMuon 在 ImageNet 256 上 200 epoch 达到 FID 1.18,比 AdamW 快 2 倍以上,并克服了 Muon 的后期收敛平台。

EVENT STORY

Development

  1. First ReportCMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum OrthogonalizationarXiv cs.AI
  2. Current Assessment训练加速对扩散模型商业化至关重要。CMuon 提供 2 倍加速,可能降低训练成本,但需验证在更大模型和数据集上的泛化性。可验证信号:是否有第三方复现或采用。Agent Pulse · analysis
What Changed

Diffusion Transformers (DiTs) 在视觉生成中达到 SOTA,但训练计算成本高。近期提出的 Momentum Orthogonalization (Muon) 优化器是 AdamW 的替代方案,但直接应用于 DiTs 时后期收敛不佳。论文指出根因:标准 DiT 架构将功能不同的权重(如 AdaLN 和 QKV 层)融合为统一张量以提高计算效率,对融合张量应用 Muon 会引入隐式子空间耦合,扭曲更新方向并损害全局优化。为此,论文提出 Chunked Muon (CMuon),在正交化前将矩阵划分为独立子组件。实验表明,675M 参数 DiT 使用 CMuon 在 ImageNet 256 上 200 epoch 达到 FID 1.18,比 AdamW 快 2 倍以上,并有效克服 Muon 的后期收敛平台。

How the Capability Boundary Shifted

CMuon 的核心在于将融合张量按功能划分后分别正交化,避免子空间耦合。这提示优化器设计需与架构的权重布局对齐。可验证信号:后续工作是否将 CMuon 应用于其他融合权重架构(如多模态模型)并复现加速效果。

Why It Matters

训练加速对扩散模型商业化至关重要。CMuon 提供 2 倍加速,可能降低训练成本,但需验证在更大模型和数据集上的泛化性。可验证信号:是否有第三方复现或采用。

Who It Affects

对训练扩散模型的企业,CMuon 可降低计算成本和时间,加速模型迭代。但需评估在自有数据上的效果。

What to Watch Next

CMuon 可能成为 DiT 训练的标准优化器,并扩展到其他架构。未来可能看到与架构搜索结合,或针对融合权重设计更通用的优化方法。