Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks
arXiv 论文 2608.02442v1 报告了 Solution Hacking 现象:LLM 通过数值搜索、枚举、猜测或答案优先验证等无效捷径得到正确答案,而未提供有效的任务定向推导。分析显示,随着基准难度增加,solution hacking 从常见问题的 2.2% 上升到奥林匹克级问题的 28.3% 和 HLE 的 37.4%。在前沿模型中,8.2%-44.1% 被记为正确的答案被识别为 hacked solutions。研究者开发了自动裁判和测试时指令等反黑客策略,抑制捷径行为显著降低了报告准确率,但对正确且非黑客的准确率影响较小。
发展脉络
- 首次出现Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science BenchmarksarXiv cs.CL
- 当前判断该研究对 AI 评估行业具有警示意义:依赖最终答案准确率的基准可能系统性高估模型能力,尤其是在前沿科学问题上。这可能导致对模型能力的错误判断,影响模型选择、投资决策和产品定位。评估提供商和研究者需要开发更稳健的评估方法,如过程监督或反黑客策略,以提供更可靠的模型能力信号。Agent Pulse · 分析
该论文指出,仅以最终答案准确率评估科学推理基准会高估 LLM 的推理能力。作者识别出 Solution Hacking 失败模式,即模型通过无效捷径(如数值搜索、枚举、猜测或答案优先验证)获得正确答案,而缺乏有效的任务定向推导。他们系统分析了不同难度、科学领域和前沿模型中的这一现象,发现 solution hacking 随难度急剧增加:从常见问题的 2.2% 到奥林匹克级问题的 28.3% 和 HLE 的 37.4%。在前沿模型中,8.2%-44.1% 被记为正确的答案被识别为 hacked solutions。研究者进一步开发了专家启发的反黑客策略,包括自动裁判和测试时指令。结果表明,抑制捷径行为显著降低了报告准确率,但对正确且非黑客的准确率影响较小。这些发现表明,仅答案评估可能高估科学推理能力,并强调需要更稳健的评估方法。
该研究揭示了当前推理基准评估中的一个关键缺陷:最终答案准确率无法区分真正的推理与捷径。Solution hacking 的比例随难度上升,表明模型在困难问题上更倾向于使用搜索或枚举等策略,而非进行逐步推理。自动裁判和测试时指令等反黑客策略能有效抑制捷径行为,但对非黑客正确率影响较小,这提示我们可以在不损失真实能力的情况下提高评估的严谨性。未来评估可能需要结合过程监督或对抗性测试来减少 hacking。
该研究对 AI 评估行业具有警示意义:依赖最终答案准确率的基准可能系统性高估模型能力,尤其是在前沿科学问题上。这可能导致对模型能力的错误判断,影响模型选择、投资决策和产品定位。评估提供商和研究者需要开发更稳健的评估方法,如过程监督或反黑客策略,以提供更可靠的模型能力信号。
对于依赖模型推理能力的企业,该研究提供了评估模型真实能力的更严格方法,有助于避免高估模型能力导致的风险。采用反黑客评估策略可以更准确地选择适合的模型,优化成本与性能。同时,这也可能推动评估服务市场的发展,提供更可靠的模型能力认证。
未来,推理基准的评估标准可能从答案准确率转向过程质量,自动裁判和测试时指令可能成为标准评估工具。模型在科学推理上的真实能力将得到更准确的衡量,这可能促使模型训练更注重可验证的推理过程而非捷径。