AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 26, 2026 · TRL

v1.9.1

What Happened

TRL 发布 v1.9.1,修复 vLLM server-mode 通信器初始化、AsyncGRPOTrainer 队列等待时间指标、Liger kernel 在 pre-Ampere GPU 上的崩溃、prepare_deepspeed 与 CPU offload optimizer 的崩溃,新增 Gemma4 响应模板,并修正 DAPO/CISPO/VESPO 损失归一化。

EVENT STORY

Development

  1. First Reportv1.9.1TRL Releases
  2. Industry Responsev1.0.0AG2
  3. Industry Responsev1.2.2Llama Stack
  4. Industry Responsev1.9.2TRL Releases
  5. Industry Responsev1.7.0OpenHands
  6. Industry Responsev1.7.1OpenHands
  7. Industry Responsev1.7.2OpenHands
  8. Industry Responsev1.3.1Genesis
  9. Current AssessmentTRL 作为 Hugging Face 的强化学习训练库,其频繁的补丁更新反映了开源 RL 训练工具链的快速迭代。修复涉及 vLLM、DeepSpeed 等关键组件,表明生态正在整合不同框架,以提供更稳定的训练体验。Agent Pulse · analysis
What Changed

Hugging Face 的 TRL 库发布 v1.9.1 补丁版本,包含多项修复:修复 vLLM server-mode 通信器初始化以使用当前 A...;修复 AsyncGRPOTrainer 的队列等待时间指标;临时固定 liger-kernel 版本以修复 CI;修复在 pre-Ampere GPU 上使用 Liger kernel 训练时的崩溃;修复 prepare_deepspeed 与 CPU offload optimizer 的崩溃;新增 Gemma4 响应模板;修复 GRPO 中 DAPO/CISPO/VESPO 损失归一化在 steps_per_generation 不等于 gradient_accumulation_steps 时的问题。

How the Capability Boundary Shifted

该版本聚焦于训练稳定性和兼容性修复,特别是针对 vLLM 集成、Liger kernel 在旧 GPU 上的支持、DeepSpeed CPU offload 以及 GRPO 损失归一化。这些修复表明 TRL 正在积极解决分布式训练和 RL 训练中的实际问题,可能提升训练稳定性和效率。

Why It Matters

TRL 作为 Hugging Face 的强化学习训练库,其频繁的补丁更新反映了开源 RL 训练工具链的快速迭代。修复涉及 vLLM、DeepSpeed 等关键组件,表明生态正在整合不同框架,以提供更稳定的训练体验。

Who It Affects

对于使用 TRL 进行 RL 训练的团队,此版本修复了多个可能导致训练崩溃或结果错误的问题,有助于降低训练成本和时间。特别是对使用旧 GPU 或 CPU offload 的用户,稳定性提升可减少调试时间。

What to Watch Next

未来可关注 TRL 是否继续扩展对 Gemma4 等新模型的支持,以及是否进一步优化 GRPO 等 RL 算法的实现。同时,vLLM 和 DeepSpeed 的集成改进可能预示更紧密的生态合作。