AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月17日 · ClawGym II

ClawGym II: Exploring Black-Box RL on Agent Harness

发生了什么

ClawGym II 论文提出一个统一的黑盒强化学习框架,用于通过复杂 agent harness 优化通用 agent。该框架构建基于沙盒的执行基础设施,将任务环境和 harness 隔离在临时沙盒中以进行大规模并发 rollout;在模型边界放置服务代理以捕获模型调用;将捕获的调用组织成前缀树,并适配 PPO 和 GRPO 优化树结构;保持训练-推理一致性;引入混合 harness 训练,使单个模型由异构 harness 联合优化。

EVENT STORY

发展脉络

  1. 首次出现ClawGym II: Exploring Black-Box RL on Agent HarnessHugging Face Daily Papers
  2. 行业反馈ClawGym II: Exploring Black-Box RL on Agent HarnessarXiv cs.AI
  3. 当前判断该研究探索了通过复杂 harness 进行强化学习的未充分开发领域,可能为 agent 训练提供新的方向。Agent Pulse · 分析
改变了什么

ClawGym II 论文提出一个统一的黑盒强化学习框架,用于通过复杂 agent harness 优化通用 agent。该框架构建基于沙盒的执行基础设施,将任务环境和 harness 隔离在临时沙盒中以进行大规模并发 rollout;在模型边界放置服务代理以捕获模型调用;将捕获的调用组织成前缀树,并适配 PPO 和 GRPO 优化树结构;保持训练-推理一致性;引入混合 harness 训练,使单个模型由异构 harness 联合优化。

能力边界怎么变了

该框架的关键创新在于将策略优化与不透明的 harness 执行解耦,通过在模型边界放置服务代理捕获模型调用,并将调用组织成前缀树来重建多轮轨迹,从而适配 PPO 和 GRPO 优化。这种设计使得强化学习可以应用于复杂 harness,同时保持训练-推理一致性。

为什么重要

该研究探索了通过复杂 harness 进行强化学习的未充分开发领域,可能为 agent 训练提供新的方向。

对谁有影响

该框架可能降低 agent 训练的成本和复杂性,提高训练效率,对 agent 开发公司具有潜在价值。

接下来观察

未来可能看到更多关于黑盒 RL 在 agent harness 上的应用,以及混合 harness 训练的进一步发展。