Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
Harness-R1 是一种新方法,通过在线强化学习后训练一个专门的 9B 工程师模型,将目标 Agent 的失败轨迹转换为可执行的运行时补丁,并在 WebShop、ALFWorld 和 DBBench 上将 vanilla Qwen3.5-9B 的成功率从 44.3% 提升至 53.6%(+9.3 个百分点)。
发展脉络
- 首次出现Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure TrajectoriesarXiv cs.AI
- 当前判断Harness-R1 表明 Agent 的改进不仅限于模型权重更新,还可以通过自动编辑运行时 harness 来实现。这为 Agent 部署后的持续优化提供了新路径,可能减少对人工干预的依赖。该方法在多个基准上的提升表明其具有一定的通用性,可能推动 Agent 系统向自我改进方向发展。Agent Pulse · 分析
Harness-R1 是首个将现有可执行运行时(harness)的失败条件化、生命周期级编辑作为学习能力的方法。它通过在线强化学习后训练一个专门的 9B 工程师模型,将目标 Agent 的失败轨迹批量转换为经过验证的可执行补丁,并通过冻结目标 Agent 的重新运行结果作为奖励信号,仅更新工程师模型。冷启动监督微调初始化编辑策略,随后使用组相对策略优化进行在线训练。在 WebShop、ALFWorld 和 DBBench 基准上,Harness-R1 将 vanilla Qwen3.5-9B 的成功率从 44.3% 提升至 53.6%(+9.3 个百分点)。
Harness-R1 的核心创新在于将运行时编辑视为可学习的策略,并通过在线强化学习优化编辑对任务成功率的直接影响。这不同于传统的固定编辑器或仅依赖监督微调的方法。其训练流程包括冷启动 SFT 和 GRPO 在线训练,奖励信号来自冻结目标 Agent 的重新运行结果,确保编辑的有效性。9B 工程师模型的大小表明该方法在资源上可行。
Harness-R1 表明 Agent 的改进不仅限于模型权重更新,还可以通过自动编辑运行时 harness 来实现。这为 Agent 部署后的持续优化提供了新路径,可能减少对人工干预的依赖。该方法在多个基准上的提升表明其具有一定的通用性,可能推动 Agent 系统向自我改进方向发展。
Harness-R1 可能降低 Agent 系统的维护成本,通过自动修复失败轨迹提升任务成功率,从而增强产品竞争力。对于提供 Agent 服务的公司,该方法可提升客户满意度和留存率。同时,它可能创造新的商业模式,如提供运行时编辑服务或工具。
未来可验证的信号包括:Harness-R1 在更多基准或真实场景中的应用,以及其编辑策略的泛化能力。此外,工程师模型的大小、训练成本以及编辑补丁的稳定性将是关键观察点。如果该方法被广泛采用,可能催生新的工具链或平台。