SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language Models
SciCode 基准测试的 65 个测试问题经领域专家审计发现 263 个缺陷,其中 192 个导致正确解决方案被错误拒绝,影响 91% 的主要问题。78% 的缺陷需要专业物理或数学知识才能检测。修正后的版本称为 SciCode-Verified。
发展脉络
- 首次出现SciCode-Verified: How Benchmark Defects Underestimated the Scientific-Coding Ability of Language ModelsarXiv cs.AI
- 当前判断基准测试质量影响行业对模型能力的判断,缺陷可能导致对前沿模型进展的误判。修正后的基准可能改变模型排名,影响采购决策。下一信号:Artificial Analysis 是否采用 SciCode-Verified 更新指数。Agent Pulse · 分析
SciCode 是衡量语言模型科学编码能力的标准基准,包含研究级问题,要求前沿科学理论和数值代码实现。它是 Artificial Analysis Intelligence Index 的组成部分,并被政府和国家实验室采用。然而,2026 年最强模型的子问题准确率停滞在约 60%,后继模型与前代持平。作者对所有 65 个测试问题进行了逐题审计,发现 263 个缺陷,其中 192 个导致正确且遵循指令的解决方案被错误拒绝,原因包括不可复现的黄金答案、过紧的容差或自相矛盾的规格。78% 的缺陷需要专业物理或数学知识才能检测。作者修正了所有可确认的缺陷,生成 SciCode-Verified,仅添加了良构问题所需的规格,修复了评分,并收紧了测试。
基准测试缺陷可能系统性低估模型能力,导致能力评估停滞的假象。修正后的 SciCode-Verified 可能揭示模型在科学编码上的真实进展,但需独立验证。下一信号:其他团队是否复现修正后的分数提升。
基准测试质量影响行业对模型能力的判断,缺陷可能导致对前沿模型进展的误判。修正后的基准可能改变模型排名,影响采购决策。下一信号:Artificial Analysis 是否采用 SciCode-Verified 更新指数。
对于依赖 SciCode 评估模型能力的组织,修正后的基准可能改变模型选择,影响投资和采购。准确的评估可避免高估或低估模型,优化资源分配。
SciCode-Verified 可能成为科学编码评估的新标准,推动更多基准测试的审计和修正。模型在修正后的基准上可能显示更高能力,但需注意过度拟合风险。