AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 3, 2026 · SWE-Touch

SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

What Happened

SWE-Touch 是一个用于测试编码代理在共享工作区中响应用户代码修改能力的基准框架。它通过从多个修复轨迹中挖掘任务关键区域,使用独立的用户补丁生成器构造与任务完成冲突的合理编辑(Counter-Edits),并在代理到达相关代码时注入上下文用户消息。在 SWE-bench Verified 上评估了九个编码模型,Counter-Edit 使平均解决率下降 7.7 个百分点,在 SWE-Bench Pro 和 DeepSWE 的长时程任务上也观察到性能下降。轨迹分析表明,失败与代理对不断变化的工作区的意识有限有关,例如保留冲突代码或重新生成。

EVENT STORY

Development

  1. First ReportSWE-Touch: Benchmarking Coding Agents When Users Touch the CodearXiv cs.CL
  2. Current AssessmentSWE-Touch 的发布反映了 AI 编码代理评估从孤立任务向协作场景的转变,这可能会推动代理设计更注重实时环境感知和用户交互。该基准的引入可能促使模型开发者和工具提供商重视代理在共享工作区中的可靠性,从而影响下一代编码代理的架构和训练策略。此外,该基准的公开可能成为行业标准,用于衡量代理在真实开发环境中的实用性。Agent Pulse · analysis
What Changed

SWE-Touch 是一个新基准,用于评估编码代理在用户可能检查和修改代码的共享工作区中的表现。现有基准通常让代理单独工作或仅通过消息限制用户参与,而 SWE-Touch 通过验证过的 Counter-Edits 模拟用户对任务相关代码的合理修改,这些修改与任务完成相冲突。该框架从多个修复轨迹中挖掘任务关键区域,使用独立的用户补丁生成器构造编辑,并在代理到达相关代码时注入上下文用户消息。在 SWE-bench Verified 上评估了九个编码模型,Counter-Edit 使平均解决率下降 7.7 个百分点,在 SWE-Bench Pro 和 DeepSWE 的长时程任务上也观察到性能下降。轨迹分析表明,失败与代理对不断变化的工作区的意识有限有关,例如保留冲突代码或重新生成。

How the Capability Boundary Shifted

SWE-Touch 引入了一种新的评估范式,通过 Counter-Edits 模拟用户对代码的实时修改,这比静态基准更贴近真实协作场景。其方法包括从多个修复轨迹中挖掘任务关键区域,并使用独立的用户补丁生成器构造合理编辑,这要求代理具备对工作区变化的持续感知能力。实验显示,Counter-Edit 导致解决率显著下降,表明现有代理在动态环境中存在鲁棒性缺陷。未来的改进方向可能包括增强代理对代码变更的监控和适应机制,例如通过更有效的状态跟踪或冲突检测。

Why It Matters

SWE-Touch 的发布反映了 AI 编码代理评估从孤立任务向协作场景的转变,这可能会推动代理设计更注重实时环境感知和用户交互。该基准的引入可能促使模型开发者和工具提供商重视代理在共享工作区中的可靠性,从而影响下一代编码代理的架构和训练策略。此外,该基准的公开可能成为行业标准,用于衡量代理在真实开发环境中的实用性。

Who It Affects

对于开发编码代理的公司,SWE-Touch 提供了一个关键评估工具,以衡量产品在真实协作场景中的表现,从而指导产品改进和差异化。对于企业用户,该基准有助于选择更可靠的编码代理,减少因代码冲突导致的返工和错误。对于开发者工具平台,集成此类评估可能提升平台的可信度和吸引力。

What to Watch Next

未来,SWE-Touch 可能会扩展到更多基准和任务类型,以全面评估代理的协作能力。随着代理对工作区变化的感知能力提升,我们可能看到解决率在 Counter-Edits 下的恢复,甚至超越当前水平。此外,该基准可能催生新的训练方法,如通过模拟用户编辑来增强代理的鲁棒性。