PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks
PAIChecker 论文系统研究 SWE-bench Verified 实例,发现 13.6% 存在 PR-Issue 错位,涵盖五种模式、十一个细粒度场景。论文提出多智能体系统 PAIChecker,采用三阶段设计:特定模式识别、跨智能体标签合成、代码级验证。在 SWE-Gym 和 SWE-bench Multilingual 上,PAIChecker 取得最佳性能。
Development
- First ReportPAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like BenchmarksarXiv cs.AI
- Current AssessmentSWE-bench 类基准的错位问题可能影响 LLM 编码能力的评估准确性,PAIChecker 提供了一种系统化检测方法。这或促使基准构建者采用更严格的验证流程,提升评测可信度。对依赖此类基准进行模型选型或能力对比的团队,错位修正可能改变既有结论。Agent Pulse · analysis
SWE-bench 类基准广泛用于评估 LLM 的问题解决能力,其构建流程通常将 PR 与其关联 issue 配对,以 issue 描述作为问题陈述,PR 补丁作为测试预言。然而,大型仓库的复杂性导致 PR-Issue 配对常出现错位。论文系统研究 SWE-bench Verified 实例,发现 13.6% 存在错位,涵盖五种模式、十一个细粒度场景。为可靠、可扩展地构建此类基准,论文提出 PAIChecker,一个多智能体系统,用于检查 SWE-bench 类基准中的 PR-Issue 错位。PAIChecker 采用三阶段设计,结合特定模式识别、跨智能体标签合成和代码级验证,实现更准确、可泛化且逐步验证的检测。在 SWE-Gym 和 SWE-bench Multilingual 上的实验表明,PAIChecker 达到最佳性能。
PAIChecker 的三阶段设计将模式识别、多智能体标签合成与代码级验证结合,可能提升基准构建的可靠性。其跨智能体标签合成机制或可减少单一模型偏差,代码级验证则提供可执行依据。未来可关注其在不同规模仓库上的泛化能力,以及错位检测对模型评估结果的具体影响。
SWE-bench 类基准的错位问题可能影响 LLM 编码能力的评估准确性,PAIChecker 提供了一种系统化检测方法。这或促使基准构建者采用更严格的验证流程,提升评测可信度。对依赖此类基准进行模型选型或能力对比的团队,错位修正可能改变既有结论。
对依赖 SWE-bench 类基准评估模型能力的团队,PAIChecker 可提升评测准确性,减少因错位导致的误判。对基准构建方,它提供可扩展的质量控制手段,降低人工审查成本。对 LLM 开发者,更可靠的基准有助于精准定位模型短板,优化训练方向。
PAIChecker 可能成为基准构建的标准工具,推动更可靠的评测体系。未来可观察其是否被集成到主流基准构建流程,以及错位检测是否扩展到更多语言和仓库类型。此外,多智能体协作模式或为其他数据质量任务提供参考。