AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月29日 · ReCo

ReCo: Reweighting GRPO Against Distributional Concentration

发生了什么

ReCo 是一种针对 GRPO 的重新加权方法,旨在解决 GRPO 在语言模型后训练中导致推理路径覆盖减少的问题。实验在 Qwen2.5-Math-1.5B/7B 和 Llama-3.1-8B-Instruct 上进行,在五个数学推理基准上评估。

EVENT STORY

发展脉络

  1. 首次出现ReCo: Reweighting GRPO Against Distributional ConcentrationarXiv cs.AI
  2. 当前判断该研究揭示了 GRPO 在推理任务中的潜在缺陷,可能影响依赖 GRPO 进行后训练的模型供应商。下一信号:是否有主流模型(如 Qwen 或 Llama)采用 ReCo 或类似方法。Agent Pulse · 分析
改变了什么

Group Relative Policy Optimization (GRPO) 已成为语言模型后训练的标准强化学习方法。近期工作表明,GRPO 会降低基础模型的推理能力,并在 k 较大时在 Pass@k 上表现更差,表明推理路径覆盖减少。研究发现,这种减少与 GRPO 集中在基础模型已高概率生成的响应上有关。GRPO 更新中的两种机制导致了这种集中:在响应层面,高概率响应通过重复出现主导组梯度;在 token 层面,GRPO 的重要性比率缩放梯度,进一步强化在当前策略下变得更可能的 token。ReCo 通过两种方式解决:响应贡献按其在该 rollout 组中的期望出现次数归一化,token 级重要性比率被替换为基于方差的比率,为未饱和的决策点提供更大的更新尺度。实验在 Qwen2.5-Math-1.5B/7B 和 Llama-3.1-8B-Instruct 上进行,在五个数学推理基准上评估。

能力边界怎么变了

GRPO 的分布集中问题源于响应级和 token 级的梯度放大机制。ReCo 通过响应归一化和方差比率替换来缓解,但未提供与其他 RL 方法(如 PPO)的对比。下一信号:ReCo 是否能在更大模型(如 70B)或非数学任务上保持优势。

为什么重要

该研究揭示了 GRPO 在推理任务中的潜在缺陷,可能影响依赖 GRPO 进行后训练的模型供应商。下一信号:是否有主流模型(如 Qwen 或 Llama)采用 ReCo 或类似方法。

对谁有影响

对于使用 GRPO 进行模型后训练的公司,ReCo 可能提升模型推理质量,减少 Pass@k 退化,从而改善产品性能。下一信号:是否有商业模型集成 ReCo。

接下来观察

ReCo 可能成为 GRPO 的改进标准,但需更多跨任务和跨模型验证。下一信号:ReCo 在代码生成或通用推理任务上的表现。