AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 27, 2026 · Understanding Evolution Strategies for LLM Reasoning

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

What Happened

一篇 arXiv 论文(2608.27351)系统研究了进化策略(ES)在 LLM 推理后训练中的优化行为,发现 ES 相比 GRPO 能带来更广泛的推理覆盖,理论上证明 verifier-projected Jensen-Shannon diversity 有助于提高 Pass@K,实验显示 ES 在提升 Pass@1 的同时获得比 GRPO 更高的 Pass@K,而 GRPO 出现熵坍缩。论文还提出顺序 GRPO-ES 训练策略,并发现 ES 的性能提升仅由稀疏的大幅更新子集贡献。

EVENT STORY

Development

  1. First ReportUnderstanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPOHugging Face Daily Papers
  2. Industry ResponseUnderstanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPOarXiv cs.LG
  3. Current Assessment该研究为 LLM 后训练提供了新选项,可能影响推理模型的训练范式。ES 的内存效率优势可能降低训练成本,但实际应用仍需验证。Agent Pulse · analysis
What Changed

该论文首次系统研究进化策略(ES)在 LLM 推理后训练中的优化行为,并与主流方法 GRPO 对比。理论上,作者证明 verifier-projected Jensen-Shannon diversity 与更高 Pass@K 相关;实验上,ES 在提升 Pass@1 的同时获得比 GRPO 更高的 Pass@K,而 GRPO 出现熵坍缩。论文提出顺序 GRPO-ES 训练策略,结合 GRPO 的 Pass@1 优势和 ES 的 Pass@K 增益。此外,尽管整体参数漂移显著,ES 的性能提升仅由稀疏的大幅更新子集贡献,暗示功能稀疏性。

How the Capability Boundary Shifted

ES 通过维持种群多样性避免熵坍缩,从而在推理任务中实现更广的覆盖,这为后训练提供了新思路。顺序 GRPO-ES 策略表明两种方法可以互补。功能稀疏性提示参数更新可能集中在关键子集,未来可研究稀疏更新机制以提升效率。

Why It Matters

该研究为 LLM 后训练提供了新选项,可能影响推理模型的训练范式。ES 的内存效率优势可能降低训练成本,但实际应用仍需验证。

Who It Affects

对于训练推理模型的团队,ES 可能提供一种内存高效且覆盖更广的替代方案,但需权衡 Pass@1 与 Pass@K 的取舍。

What to Watch Next

后续可关注 ES 在更大模型和更多任务上的验证,以及 GRPO-ES 策略的实际部署效果。