Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement
arXiv 论文 2609.01481 提出 Harness-of-Harness (HoH) 框架,使编码 agent 在自主软件开发中持续改进。HoH 在现有编码 agent harness 上运行,组织迭代规划-编码-测试循环。在 GameCraft-Bench、FrontierSWE 和 ProgramBench 上,三对 harness-model(Codex with GPT-5.5、OpenCode with DeepSeek-V4-Pro、Pi with MiniMax-M3)相比独立 harness 平均相对提升 52.25%。
Development
- First ReportHarness-of-Harness: Multi-Day Autonomous Software Development with Continual ImprovementHugging Face Daily Papers
- Industry ResponseHarness-of-Harness: Multi-Day Autonomous Software Development with Continual ImprovementarXiv cs.AI
- Current AssessmentHoH 表明通过改进 harness 而非模型本身,可显著提升 agent 性能,可能降低对模型能力的依赖,使中小团队也能构建高效 agent。这或推动 agent 框架竞争,从模型能力转向工程化设计。Agent Pulse · analysis
该论文研究自主软件开发,LLM 编码 agent 无需人工干预将高级需求转化为完整软件。HoH 框架在现有 harness 上运行,组织迭代规划-编码-测试循环,通过平衡修复与能力增长、将开发分解为可验证增量、分离实现测试与独立评估、约束可验证输出而非规定工作流,逐步暴露交付物、角色特定工具和技能,鼓励复用,维护版本化项目历史。在三个基准上,HoH 一致优于独立 harness,平均相对提升 52.25%。
HoH 的关键设计是分离实现时测试与独立评估,避免 agent 自欺;约束可验证输出而非规定工作流,保持灵活性;渐进暴露工具和技能,促进能力增长。这些设计原则可能成为未来 agent 框架的通用模式。下一步可观察 HoH 是否在更长周期任务或更多模型组合上保持增益。
HoH 表明通过改进 harness 而非模型本身,可显著提升 agent 性能,可能降低对模型能力的依赖,使中小团队也能构建高效 agent。这或推动 agent 框架竞争,从模型能力转向工程化设计。
对软件开发和 AI 公司,HoH 可提升编码 agent 的自主性和可靠性,减少人工干预,降低开发成本,加速交付。对 agent 平台提供商,采用 HoH 原则可增强产品竞争力。
未来可能看到更多基于 HoH 原则的框架出现,并集成到主流开发工具中。可验证信号包括 HoH 在真实项目中的采用、基准扩展至更长任务,以及与其他框架的对比评测。