AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Sep 8, 2026 · Miles

Miles v0.1: Production-Level Post-Training

What Happened

Miles v0.1 是一个面向前沿后训练的全栈生产级系统,基于 slime 设计,强调组件可验证、干净和可定制。系统支持 SGLang 的 rollout 引擎、NVIDIA Megatron-LM 和 PyTorch FSDP 两种训练后端、三种权重同步传输方式,并支持 LoRA RL、on-policy 蒸馏、监督微调和真正的 on-policy rollout-training 对齐,同时扩展到扩散模型。案例研究展示了在 64 块 NVIDIA GB300 GPU 上对 GLM-5.2 744B-A40B 模型进行异步 agentic RL 训练,前 30 步中位步时 263 秒。代码已在 GitHub 开源。

EVENT STORY

Development

  1. First ReportMiles v0.1: Production-Level Post-TrainingHugging Face Daily Papers
  2. Industry ResponseMiles v0.1: Production-Level Post-TrainingarXiv cs.CL
  3. Current AssessmentMiles 的开源可能推动后训练工具链的标准化,类似 slime 的延续。其生产级定位可能吸引企业采用,但竞争激烈,需与现有框架如 NVIDIA NeMo 等比较。Agent Pulse · analysis
What Changed

Miles v0.1 是一个生产级后训练系统,旨在使前沿规模的强化学习对研究者和企业更易用。系统围绕准确性、效率、可靠性和可扩展性设计,提供多种组件选择,包括基于 SGLang 的 rollout 引擎、Megatron-LM 或 FSDP 训练后端,以及三种权重同步传输方式。除全参数 RL 外,还支持 LoRA RL、on-policy 蒸馏、监督微调,并扩展到扩散模型。案例研究展示了在 64 块 GB300 GPU 上对 GLM-5.2 744B-A40B 模型进行异步 agentic RL 训练,中位步时 263 秒。系统已开源。

How the Capability Boundary Shifted

Miles 将 RL 训练循环的每个阶段设计为可验证、干净和可定制,这暗示了模块化设计可能降低定制和调试成本。支持多种后端和传输方式,可能提高部署灵活性。案例中 263 秒的中位步时表明在 64 块 GPU 上异步 RL 训练具有可行性,但未提供收敛质量或吞吐量对比,需进一步验证。

Why It Matters

Miles 的开源可能推动后训练工具链的标准化,类似 slime 的延续。其生产级定位可能吸引企业采用,但竞争激烈,需与现有框架如 NVIDIA NeMo 等比较。

Who It Affects

Miles 降低了前沿 RL 的准入门槛,可能使中小企业和研究机构能够进行大规模后训练,从而加速模型定制和 agent 开发。开源策略可能通过生态建设创造商业价值。

What to Watch Next

后续可关注 Miles 在更大规模集群上的性能报告、社区采用率、以及是否支持更多模型架构。若其异步 RL 效率得到验证,可能成为 agentic 训练的主流选择。