Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers
Muon 优化器在模加法任务上比 AdamW 更快 grok,但其解不稳定:所有九种配置在 (a+b) mod 113 上 grok 后均失去泛化能力,五个种子中四个 AdamW 参考低于阈值,最低 27.59%。失败源于表示-读出接口,梯度降至 1e-6 后优化器响应不同:Muon 步长弹性 -0.03,AdamW +1.5,Muon 组每参数移动快 8 倍。冻结嵌入/读出可防止失败,移除 Muon 归一化会崩溃。
Development
- First ReportPost-Grokking Collapse at the Representation-Readout Interface in Muon-Trained TransformersarXiv cs.AI
- Current Assessment该发现表明优化器选择不仅影响训练速度,还影响泛化稳定性,对依赖 Muon 等优化器的训练流程构成风险,可能需要在训练后冻结部分参数或调整优化器策略。Agent Pulse · analysis
arXiv 论文报告 Muon 优化器在模加法任务上 grok 更快但解不稳定,所有配置 grok 后均失去泛化。失败源于表示-读出接口,梯度降至 1e-6 后优化器响应不同,Muon 步长弹性为负且移动更快。冻结嵌入/读出可防止失败,移除归一化会崩溃。
Muon 优化器在 grok 后梯度降至 1e-6 时,其步长弹性为负(-0.03),而 AdamW 为正(+1.5),且 Muon 组每参数移动快 8 倍,导致表示-读出接口在损失未选择的方向上漂移,引发泛化崩溃。冻结嵌入/读出可稳定训练,提示优化器与接口的交互是关键。
该发现表明优化器选择不仅影响训练速度,还影响泛化稳定性,对依赖 Muon 等优化器的训练流程构成风险,可能需要在训练后冻结部分参数或调整优化器策略。
对使用 Muon 优化器的团队,需评估训练稳定性风险,可能增加验证成本;对优化器研究,提示需关注接口稳定性。
后续可验证信号包括:其他任务上 Muon 是否同样不稳定,以及冻结嵌入/读出是否成为标准实践。