SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
SWE-bench Science 是一个面向科学软件工程的仓库级基准,包含来自 98 个 GitHub 仓库、覆盖 20 个科学领域的 119 个任务,任务分为 Issue-driven、Expert-exploratory 和 Engineering-integration 三种范式。最佳 agent(Claude Code with Opus-5 max)的 pass@1 低于 50%。研究识别出四种失败机制:科学知识或抽象不足、误导性探索或表面修复、修复覆盖或系统集成不完整、以及无法将科学知识泛化到观察案例之外。
发展脉络
- 首次出现SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?Hugging Face Daily Papers
- 行业反馈SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?arXiv cs.CL
- 当前判断科学软件工程基准的引入表明,编码 agent 的评估正从通用任务转向领域特定任务,这可能会推动 agent 在科学计算领域的专业化发展。Agent Pulse · 分析
SWE-bench Science 基准发布,包含 119 个任务,来自 98 个 GitHub 仓库,覆盖 20 个科学领域。任务分为三种范式:Issue-driven、Expert-exploratory 和 Engineering-integration。最佳 agent(Claude Code with Opus-5 max)的 pass@1 低于 50%,表明科学软件工程对编码 agent 构成重大挑战。研究识别出四种失败机制:科学知识或抽象不足、误导性探索或表面修复、修复覆盖或系统集成不完整、以及无法将科学知识泛化到观察案例之外。
该基准将科学软件工程任务分为三种范式,并识别出四种失败机制,为评估编码 agent 在科学领域的表现提供了结构化框架。最佳 agent 的 pass@1 低于 50%,表明现有 agent 在科学软件修复上存在明显短板,尤其是在需要领域知识和系统集成方面。
科学软件工程基准的引入表明,编码 agent 的评估正从通用任务转向领域特定任务,这可能会推动 agent 在科学计算领域的专业化发展。
对于依赖科学软件的研究机构和企业,该基准提供了评估和选择编码 agent 的参考,可能影响相关工具的投资决策。
未来可能看到更多针对科学领域的编码 agent 基准和专用模型,以及 agent 在科学软件修复上的能力提升。