AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Sep 21, 2026 · VeRL

relaykit/v0.2.1

What Happened

VeRL 发布 v0.9.1,引入 Unified V1 trainer 的 separate_async 能力:训练器在提交某一步的 prompts 后,可将空闲 GPU 副本切换到 rollout 模式,直到 replay buffer 中积累足够可采样的 group,由自适应饥饿阈值驱动;该功能由 trainer.v1.separate_async.enable_switch 控制,默认关闭(#7373)。同时为 V1 async trainer 提供 V0 风格全异步语义(#7884),并修正动态 micro-batch packing 对 max_token_len 的约束(#7553)、DAPO group filtering 的奖励读取与默认指标(#7792)。

EVENT STORY

Development

  1. First Reportv0.9.1VeRL Releases
  2. Industry Responserelaykit/v0.2.1New API
  3. Industry Responsev0.5.0llama.cpp
  4. Current Assessment开源 RL 训练框架正在把异步调度、off-policy 控制与批处理约束做成可配置项,而非固定实现。这意味着后训练阶段的工程门槛从写训练循环转向调参和资源编排,对自建 RL 流水线的团队是能力分化点。Agent Pulse · analysis
What Changed

VeRL v0.9.1 的核心变化是把训练与生成之间的资源边界做成可切换的:在 separate_async 下,训练器提交一步 prompts 后不再空等,而是让自身副本进入 rollout 模式,直到 replay buffer 有足够可采样 group,阈值自适应调整。该开关默认关闭,属于 opt-in。配套改动包括 V0 风格全异步语义(hybrid_engine=False、分数 num_warmup_batches、max_off_policy_threshold=null、__num_turns__ 指标)、动态 micro-batch packing 严格按 max_token_len 约束,以及 DAPO group filtering 改用 rm_scores 中的 pre-KL reward 且默认指标为 reward。

How the Capability Boundary Shifted

这组改动指向 RL 训练中 GPU 利用率与 off-policy 程度之间的显式权衡:separate_async 让 trainer 在等待生成时借出算力,但代价是样本可能来自更旧的策略版本,因此需要 max_off_policy_threshold 与自适应饥饿阈值共同约束。可验证的下一信号是官方文档或后续 release 是否给出该开关开启后的吞吐与样本新鲜度对比数据。

Why It Matters

开源 RL 训练框架正在把异步调度、off-policy 控制与批处理约束做成可配置项,而非固定实现。这意味着后训练阶段的工程门槛从写训练循环转向调参和资源编排,对自建 RL 流水线的团队是能力分化点。

Who It Affects

对使用 VeRL 做后训练的组织,该版本提供了在不增加 GPU 的前提下提升 rollout 吞吐的选项,但需要评估 off-policy 程度对最终模型质量的影响;建议先在小规模任务上对比开关前后的收敛曲线,再决定是否纳入生产流水线。

What to Watch Next

若 separate_async 在后续版本中从默认关闭转为推荐配置,并出现配套的稳定性与吞吐基准,异步 RL 训练可能成为开源框架的默认形态;反之若长期停留在 opt-in,说明样本陈旧带来的收益损失仍未被普遍接受。