Miles v0.1: Production-Level Post-Training
Miles v0.1 是一个面向前沿后训练的全栈生产级系统,基于 slime 设计,强调组件可验证、干净和可定制。系统支持 SGLang 的 rollout 引擎、NVIDIA Megatron-LM 和 PyTorch FSDP 两种训练后端、三种权重同步传输方式,并支持 LoRA RL、on-policy 蒸馏、监督微调和真正的 on-policy rollout-training 对齐,同时扩展到扩散模型。案例研究展示了在 64 块 NVIDIA GB300 GPU 上对 GLM-5.2 744B-A40B 模型进行异步 agentic RL 训练,前 30 步中位步时 263 秒。代码已在 GitHub 开源。
Development
- First ReportMiles v0.1: Production-Level Post-TrainingHugging Face Daily Papers
- Industry ResponseMiles v0.1: Production-Level Post-TrainingarXiv cs.CL
- Current AssessmentMiles 的开源可能推动后训练工具链的标准化,类似 slime 的延续。其生产级定位可能吸引企业采用,但竞争激烈,需与现有框架如 NVIDIA NeMo 等比较。Agent Pulse · analysis
Miles v0.1 是一个生产级后训练系统,旨在使前沿规模的强化学习对研究者和企业更易用。系统围绕准确性、效率、可靠性和可扩展性设计,提供多种组件选择,包括基于 SGLang 的 rollout 引擎、Megatron-LM 或 FSDP 训练后端,以及三种权重同步传输方式。除全参数 RL 外,还支持 LoRA RL、on-policy 蒸馏、监督微调,并扩展到扩散模型。案例研究展示了在 64 块 GB300 GPU 上对 GLM-5.2 744B-A40B 模型进行异步 agentic RL 训练,中位步时 263 秒。系统已开源。
Miles 将 RL 训练循环的每个阶段设计为可验证、干净和可定制,这暗示了模块化设计可能降低定制和调试成本。支持多种后端和传输方式,可能提高部署灵活性。案例中 263 秒的中位步时表明在 64 块 GPU 上异步 RL 训练具有可行性,但未提供收敛质量或吞吐量对比,需进一步验证。
Miles 的开源可能推动后训练工具链的标准化,类似 slime 的延续。其生产级定位可能吸引企业采用,但竞争激烈,需与现有框架如 NVIDIA NeMo 等比较。
Miles 降低了前沿 RL 的准入门槛,可能使中小企业和研究机构能够进行大规模后训练,从而加速模型定制和 agent 开发。开源策略可能通过生态建设创造商业价值。
后续可关注 Miles 在更大规模集群上的性能报告、社区采用率、以及是否支持更多模型架构。若其异步 RL 效率得到验证,可能成为 agentic 训练的主流选择。