AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 27, 2026 · Looping Is Not Reliability

Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair

What Happened

Generate-test-revise 循环是编码 Agent 的常见模式,但重复本身不提供可靠性保证。一项密封五种子研究对 30 个 HumanEval 修复任务产生 900 条三次修订轨迹。在强制修订下,使用当前轨迹的正确率从一次修订后的 0.820 降至两次后的 0.673,而 ever-correct 升至 0.847。两项共同状态研究使用 2,430 个分支消除治疗后风险集偏差。在预设的 14B 复制中,陈旧轨迹损害 34/135 个正确起点,而当前轨迹为 4/135,增加 22.2 个百分点(任务簇 95% CI [8.9,37.0],精确 Holm p=0.0337)。前瞻性 540 次 rollout 策略消除了观察到的正确起点损害,但减少了错误起点修复并未通过联合标准。仓库实验覆盖 24 个 bug 和四个编码器栈,显示地板效应和组件异质性,无 Holm 显著效应。研究分离了准入、保留、接地认证、能力和活性,并推导出证据绑定类型化循环契约。

EVENT STORY

Development

  1. First ReportLooping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code RepairarXiv cs.AI
  2. Current Assessment该研究对依赖 Agent 自动修复代码的行业实践提出警示:简单增加迭代次数并不提升可靠性,反而可能因轨迹陈旧引入风险。这推动行业从追求循环次数转向设计有证据约束的修订契约,可能影响编码 Agent 工具的设计哲学和评估标准。Agent Pulse · analysis
What Changed

该研究质疑编码 Agent 中常见的 generate-test-revise 循环的可靠性,指出重复尝试并不保证正确性。通过密封研究、共同状态研究和预设复制,发现陈旧轨迹会显著损害正确修复的保留,而当前轨迹表现更好。前瞻性策略虽消除正确起点损害但牺牲错误起点修复。仓库实验显示地板效应和异质性。研究提出分离准入、保留、接地认证、能力和活性,并引入证据绑定类型化循环契约,为 Agent 修复流程提供更严谨的可靠性框架。

How the Capability Boundary Shifted

研究揭示编码 Agent 的修订循环中,轨迹新鲜度是关键变量:陈旧轨迹导致正确起点修复率显著下降(34/135 vs 4/135)。证据绑定类型化循环契约将准入、保留、接地认证、能力和活性分离,为设计更可靠的 Agent 循环提供结构化方法。前瞻性策略的权衡表明,消除正确起点损害可能以牺牲错误起点修复为代价,需谨慎设计策略。

Why It Matters

该研究对依赖 Agent 自动修复代码的行业实践提出警示:简单增加迭代次数并不提升可靠性,反而可能因轨迹陈旧引入风险。这推动行业从追求循环次数转向设计有证据约束的修订契约,可能影响编码 Agent 工具的设计哲学和评估标准。

Who It Affects

对依赖编码 Agent 的企业,该研究提示需关注 Agent 修订过程的可靠性保障,而非仅看最终正确率。证据绑定契约可能成为产品差异化点,提升 Agent 工具的可信度和企业采用意愿。

What to Watch Next

未来可验证信号包括:更多研究在更大规模基准上复现轨迹新鲜度效应;编码 Agent 工具引入证据绑定契约或轨迹管理机制;评估标准从 ever-correct 转向保留和认证正确性。