AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月30日 · ORCA-bench

ORCA-bench: How Ready Are Language Model Agents for Oncall?

发生了什么

ORCA-bench 是一个新基准,将通用编码智能体置于生产保真度的值班(oncall)环境中,使用实时 OpenTelemetry 插桩的微服务系统,通过 Prometheus、Jaeger 和 OpenSearch(经 Grafana)暴露六天的指标、日志和追踪,并提供完整源代码访问。它包含 1,079 个 RCA 任务,系统性地变化报告特异性、检测时间和共现故障场景。真实症状由专家 SRE 策划并签署,LLM 评判器由人类独立重新评分(Cohen's κ_w=0.90)。在五个前沿智能体中,最佳 RCA 准确率在中等难度任务(现实输入设置)上为 25.3%,在困难任务上为 10.0%,即使使用 Claude Fable 5 也存在差距。最弱的模型在 40% 的 incident 报告中产生不合理的根因幻觉,移除源代码访问会降低所有指标。

EVENT STORY

发展脉络

  1. 首次出现ORCA-bench: How Ready Are Language Model Agents for Oncall?arXiv cs.AI
  2. 当前判断ORCA-bench 揭示了前沿语言模型智能体在值班根因分析方面的显著不足,即使是最佳智能体在现实输入下准确率也仅为 25.3%。这表明当前智能体在需要长期推理、嘈杂信号和模糊用户报告的复杂运维场景中尚未准备好。基准的专家 SRE 策划和人类重新评分(κ_w=0.90)提供了可信的评估,可能成为该领域未来进展的标准。Agent Pulse · 分析
改变了什么

ORCA-bench 是一个新基准,用于评估语言模型智能体在值班(oncall)场景中的根因分析(RCA)能力。它使用一个实时 OpenTelemetry 插桩的微服务系统,通过真实遥测接口(Prometheus、Jaeger、OpenSearch 经 Grafana)暴露六天的指标、日志和追踪,并提供完整源代码访问。基准包含 1,079 个 RCA 任务,系统性地变化报告特异性、检测时间和共现故障场景。真实症状由专家 SRE 策划并签署,LLM 评判器由人类独立重新评分(Cohen's κ_w=0.90)。在五个前沿智能体中,最佳 RCA 准确率在中等难度任务(现实输入设置)上为 25.3%,在困难任务上为 10.0%,即使使用 Claude Fable 5 也存在差距。最弱的模型在 40% 的 incident 报告中产生不合理的根因幻觉,移除源代码访问会降低所有指标。

能力边界怎么变了

ORCA-bench 将通用编码智能体置于生产保真度的值班环境中,要求它们从嘈杂的指标、日志、追踪和源代码中推理,从模糊的用户报告开始,通常在事件开始数小时后。基准设计强调现实输入设置(中等难度)与理想化设置之间的差距,最佳智能体在中等难度上仅达到 25.3% 的准确率,在困难任务上为 10.0%。移除源代码访问会降低所有指标,表明源代码推理是 RCA 的关键能力。最弱模型在 40% 的报告中产生不合理的根因幻觉,凸显了可靠性差距。

为什么重要

ORCA-bench 揭示了前沿语言模型智能体在值班根因分析方面的显著不足,即使是最佳智能体在现实输入下准确率也仅为 25.3%。这表明当前智能体在需要长期推理、嘈杂信号和模糊用户报告的复杂运维场景中尚未准备好。基准的专家 SRE 策划和人类重新评分(κ_w=0.90)提供了可信的评估,可能成为该领域未来进展的标准。

对谁有影响

对于依赖可靠运维的企业,ORCA-bench 强调了当前智能体在值班场景中的局限性,意味着自动化 RCA 尚未成熟。这为开发专门针对运维的智能体或增强现有工具提供了机会。同时,基准可能成为评估和选择智能体供应商的标准,推动更可靠的运维自动化。

接下来观察

ORCA-bench 可能推动针对值班 RCA 的专门智能体开发,结合更好的遥测推理和源代码理解。随着智能体改进,我们可能看到在中等难度任务上准确率的提升,但困难任务可能需要新的方法。基准的公开可用性可能促进社区参与和迭代。