AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月26日 · TRL

v1.9.1

发生了什么

TRL 发布 v1.9.1,修复 vLLM server-mode 通信器初始化、AsyncGRPOTrainer 队列等待时间指标、Liger kernel 在 pre-Ampere GPU 上的崩溃、prepare_deepspeed 与 CPU offload optimizer 的崩溃,新增 Gemma4 响应模板,并修正 DAPO/CISPO/VESPO 损失归一化。

EVENT STORY

发展脉络

  1. 首次出现v1.9.1TRL Releases
  2. 行业反馈v1.0.0AG2
  3. 行业反馈v1.2.2Llama Stack
  4. 行业反馈v1.9.2TRL Releases
  5. 行业反馈v1.7.0OpenHands
  6. 行业反馈v1.7.1OpenHands
  7. 行业反馈v1.7.2OpenHands
  8. 行业反馈v1.3.1Genesis
  9. 当前判断TRL 作为 Hugging Face 的强化学习训练库,其频繁的补丁更新反映了开源 RL 训练工具链的快速迭代。修复涉及 vLLM、DeepSpeed 等关键组件,表明生态正在整合不同框架,以提供更稳定的训练体验。Agent Pulse · 分析
改变了什么

Hugging Face 的 TRL 库发布 v1.9.1 补丁版本,包含多项修复:修复 vLLM server-mode 通信器初始化以使用当前 A...;修复 AsyncGRPOTrainer 的队列等待时间指标;临时固定 liger-kernel 版本以修复 CI;修复在 pre-Ampere GPU 上使用 Liger kernel 训练时的崩溃;修复 prepare_deepspeed 与 CPU offload optimizer 的崩溃;新增 Gemma4 响应模板;修复 GRPO 中 DAPO/CISPO/VESPO 损失归一化在 steps_per_generation 不等于 gradient_accumulation_steps 时的问题。

能力边界怎么变了

该版本聚焦于训练稳定性和兼容性修复,特别是针对 vLLM 集成、Liger kernel 在旧 GPU 上的支持、DeepSpeed CPU offload 以及 GRPO 损失归一化。这些修复表明 TRL 正在积极解决分布式训练和 RL 训练中的实际问题,可能提升训练稳定性和效率。

为什么重要

TRL 作为 Hugging Face 的强化学习训练库,其频繁的补丁更新反映了开源 RL 训练工具链的快速迭代。修复涉及 vLLM、DeepSpeed 等关键组件,表明生态正在整合不同框架,以提供更稳定的训练体验。

对谁有影响

对于使用 TRL 进行 RL 训练的团队,此版本修复了多个可能导致训练崩溃或结果错误的问题,有助于降低训练成本和时间。特别是对使用旧 GPU 或 CPU offload 的用户,稳定性提升可减少调试时间。

接下来观察

未来可关注 TRL 是否继续扩展对 Gemma4 等新模型的支持,以及是否进一步优化 GRPO 等 RL 算法的实现。同时,vLLM 和 DeepSpeed 的集成改进可能预示更紧密的生态合作。