AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月5日 · NAVSIM

When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis Audit

发生了什么

NAVSIM v2.2 原始场景单阶段评分中,在受影响的文档化栈条件下,route-blind Ignore-All 探针和 route-aware actor-blind 探针在完整 12,146-token navtest 分割上排名高于人类回放和 PDM-Closed。全新安装按公开规范复现了固定 32-token 诊断集上的 rollout 分歧。同源依赖栈控制和精确输入诊断将依赖敏感的数值行为隔离在共享速度重拟合中。在 450-token 控制池上,仅替换求解器消除了 rollout 分歧并恢复盲排最后顺序,同时保持宽恕启用。

EVENT STORY

发展脉络

  1. 首次出现When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis AuditarXiv cs.AI
  2. 当前判断该发现对自动驾驶评估基准的可信度提出警示:若共享 rollout 和宽恕机制处理不当,基准可能奖励不观察环境的策略,误导模型开发方向。基准维护者需审计数值依赖和评分逻辑,确保区分真实能力与伪影。Agent Pulse · 分析
改变了什么

该论文审计了 NAVSIM v2.2 原始场景单阶段评分中共享 rollout 失败的风险。防御性驾驶分数仅在保留观察周围行动者与不观察策略之间差异时才有用。重模拟基准可能使用参考条件宽恕,当代理和参考共享不稳定的 rollout 变换时,此规则可将共享参考失败传播为广泛合规信用。在受影响的文档化栈条件下,route-blind Ignore-All 探针和 route-aware actor-blind 探针在完整 12,146-token navtest 分割上排名高于人类回放和 PDM-Closed。全新安装按公开规范复现了固定 32-token 诊断集上的 rollout 分歧。同源依赖栈控制和精确输入诊断将依赖敏感的数值行为隔离在共享速度重拟合中。在 450-token 控制池上,仅替换求解器消除了 rollout 分歧并恢复盲排最后顺序,同时保持宽恕启用。

能力边界怎么变了

该审计表明,在共享 rollout 变换下,参考条件宽恕可能将参考失败传播为代理信用,导致盲探针排名虚高。数值后端中的依赖敏感行为(如速度重拟合中的求解器)可导致 rollout 分歧,影响评分一致性。仅替换求解器即可消除分歧并恢复预期排序,提示数值稳定性对基准可靠性的关键作用。

为什么重要

该发现对自动驾驶评估基准的可信度提出警示:若共享 rollout 和宽恕机制处理不当,基准可能奖励不观察环境的策略,误导模型开发方向。基准维护者需审计数值依赖和评分逻辑,确保区分真实能力与伪影。

对谁有影响

对依赖 NAVSIM 等基准评估自动驾驶模型的团队,该发现直接影响模型选型和迭代决策。若基准分数不可靠,可能导致资源错配。修复评分逻辑可提升评估可信度,降低开发风险。

接下来观察

后续可验证信号包括:NAVSIM 或类似基准是否更新评分规范以隔离共享 rollout 失败;其他重模拟基准是否采用类似审计方法;以及求解器替换是否成为标准修复手段。