Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains
arXiv 论文 2608.03219v1 提出问题级审计方法,区分 LLM 基准提升中'可达'与'实现'的差异。在 43 个模型和任务设置中,随机层路由在匹配预算下匹配或超过结构化搜索;答案盲程序几乎不保留增益。在 0.5B 到 31B 的六个案例中,静默一个 MLP 块修复了 68% 到 92% 的预定义失败集。在五次匹配评估中,部署性能上升而可达性未变。
发展脉络
- 首次出现Reachability Is Not Realization: Tracing the Sources of LLM Benchmark GainsarXiv cs.CL
- 当前判断该研究对 LLM 评估实践提出警示:基准分数提升可能被高估为能力增强,实际可能只是实现层面的改进。这影响模型比较和发布决策,因为分数提升可能不反映真实能力扩展。研究建议采用问题级审计来区分可达性和实现,可能成为未来评估标准。Agent Pulse · 分析
该论文挑战了将基准分数提升等同于模型能力增强的常见假设。作者提出,相同的分数提升可能源于模型行为的不同变化:模型可能达到新的答案,或只是产生原本就可达的答案。他们建立了问题级审计,在固定预算、温度和答案格式下,区分'实现'(默认部署产生正确答案)和'可达'(指定探针在预算内找到答案)。实验发现,在匹配预算下,随机层路由在 43 个设置中匹配或超过结构化搜索,且答案盲程序几乎不保留增益,表明增益依赖于访问正确答案。此外,静默一个 MLP 块可修复 68% 至 92% 的失败案例,提示特定组件对实现可达答案至关重要。训练实验显示,在五次匹配评估中,部署性能提升而可达性未变,表明训练可能通过改变实现而非扩展可达性来提升分数。
该研究揭示基准分数提升可能源于'实现'而非'可达性'的改善,即模型可能已经能够产生正确答案,但默认解码未能触发。随机层路由在匹配预算下匹配或超过结构化搜索,暗示推理时路由的收益可能来自随机性而非结构化搜索。静默单个 MLP 块可修复大部分失败案例,表明特定 MLP 块对答案实现至关重要,可能作为关键路径。训练实验显示部署性能提升而可达性未变,提示训练可能通过调整解码偏好而非扩展能力来提升分数。
该研究对 LLM 评估实践提出警示:基准分数提升可能被高估为能力增强,实际可能只是实现层面的改进。这影响模型比较和发布决策,因为分数提升可能不反映真实能力扩展。研究建议采用问题级审计来区分可达性和实现,可能成为未来评估标准。
对于依赖基准分数评估模型能力的团队,该研究提供更严格的评估方法,避免高估模型能力。通过识别实现瓶颈,可指导模型微调和推理优化,提升实际部署性能。问题级审计可帮助选择更合适的模型,降低部署风险。
未来可能发展出更精细的审计工具,用于区分模型能力与实现差异。训练方法可能针对实现改进进行优化,而非仅追求分数提升。推理时路由和 MLP 块静默技术可能被用于调试和修复模型失败。