AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 7, 2026 · SA-PPG

Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination

What Happened

arXiv 论文 2608.07341v1 提出 SA-PPG(分层每问题概率差距聚合)方法,用于评估基准污染缓解策略。论文指出现有 G-AP 指标存在缺陷,并提出 RailCap 方法在生成过程中判断污染。

EVENT STORY

Development

  1. First ReportZero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark ContaminationHugging Face Daily Papers
  2. Industry ResponseZero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark ContaminationarXiv cs.AI
  3. Current Assessment基准污染问题日益严重,该研究反映了社区对评测可信度的关注。SA-PPG 和 RailCap 可能成为新的评测标准,影响模型发布时的评估流程。可关注后续是否有主流基准采用类似方法。Agent Pulse · analysis
What Changed

该论文指出公共基准测试数据不可避免地泄漏到预训练语料中,一旦被记忆就会虚增评估分数。污染缓解评估通过干预解码过程来抑制记忆并恢复模型真实能力,但现有指标 G-AP(聚合性能差距)存在缺陷:离散的正确/错误读数无法刻画每问题性能,先平均再差分会导致过度抑制和欠抑制相互抵消,统一的每问题权重会促使策略将求解概率推向干净模型的高频值。为此,论文提出 SA-PPG(分层每问题概率差距聚合):通过采样估计每个问题的求解概率,与干净模型逐问题差分,并按干净模型的求解概率分组聚合。论文还指出现有缓解策略先估计污染位置再操作,因此准确性受限于估计;而 RailCap 方法在生成过程中直接判断污染。

How the Capability Boundary Shifted

SA-PPG 的核心改进在于用每问题概率替代离散正确/错误标签,并采用分层聚合以避免过度抑制和欠抑制的抵消。这提示评测指标的设计需要更细粒度的信号,未来可关注该方法在更多基准上的验证,以及 RailCap 在生成时判断污染的具体机制。

Why It Matters

基准污染问题日益严重,该研究反映了社区对评测可信度的关注。SA-PPG 和 RailCap 可能成为新的评测标准,影响模型发布时的评估流程。可关注后续是否有主流基准采用类似方法。

Who It Affects

对于模型提供商,采用更严格的污染评估可提升模型评测的可信度,增强客户信任。对于评测平台,提供此类工具可能成为差异化优势。

What to Watch Next

未来可能出现更多基于概率的评测指标,以及更鲁棒的污染缓解方法。可关注 SA-PPG 是否被广泛采用,以及 RailCap 的进一步实验。