ART-Optimized Megatron (AOM): 12x higher training throughput
CoreWeave 发布博客称,ART-Optimized Megatron (AOM) 将 RL 训练吞吐提升最高 12 倍。其手段包括 shared-prefix training、优化注意力、sequence packing 以及针对 ART 工作负载调优的并行策略。
发展脉络
- 首次出现ART-Optimized Megatron (AOM): 12x higher training throughputCoreWeave
- 当前判断若该优化可复现,RL 后训练的单位算力成本将下降,强化学习训练环节对算力供给方的议价结构可能变化;但单一厂商博客不足以证明行业级成本曲线移动。Agent Pulse · 分析
CoreWeave 在官方博客中介绍 ART-Optimized Megatron (AOM):面向 ART 工作负载的 RL 训练优化方案,宣称吞吐最高提升 12 倍。证据列出的优化方向为 shared-prefix training、优化注意力、sequence packing 与调优并行策略。除上述定性描述与 12x 倍数外,证据未给出基准配置、硬件型号、模型规模或对比基线细节。
从列出的手段看,收益更可能来自减少重复前缀计算与提升序列打包效率,而非单一算子突破;但缺少基线、硬件与模型规模,12x 目前只能视为特定 ART 工作负载下的宣称值,不能外推到通用训练。
若该优化可复现,RL 后训练的单位算力成本将下降,强化学习训练环节对算力供给方的议价结构可能变化;但单一厂商博客不足以证明行业级成本曲线移动。
对使用 RL 后训练的团队,若吞吐提升可复现,同等预算下可增加实验轮次或缩短迭代周期;采购决策前应先要求可复现的基准数据,而非直接按 12x 估算成本节省。
可验证下一信号:CoreWeave 或第三方公布可复现基准,含硬件型号、模型规模、基线配置与端到端耗时对比。