Real-Time Detection and Repair of LLM Agent Failures
arXiv 论文 2608.02464v1 提出用单类回声状态网络集成加 CUSUM 告警,仅基于步骤遥测实时检测 LLM Agent 故障。在 2,823 个 episode、三个框架、三个本地模型(qwen2.5 7b/3b, llama3.1 8b)和 gemini-2.5-flash 上,5% 误报预算下检测率 0.71,AUROC 0.872。跨语料库迁移无需重训(AFTraj-2K 0.745, ATBench 0.779),但冷启动 AUROC 0.527,重校准后 0.885。
Development
- First ReportReal-Time Detection and Repair of LLM Agent FailuresarXiv cs.LG
- Current AssessmentAgent 可靠性监控正从昂贵的 LLM 评判转向轻量级遥测分析,这可能降低生产环境中 agent 监控的成本。但健康数据依赖和误报率仍是部署障碍,需要结合确定性验证。Agent Pulse · analysis
LLM agents 在任务执行中常出现循环、工具错误级联、目标漂移、结果伪造等问题。传统方法用第二个 LLM 逐步评判,成本高于 agent 本身。该论文探索仅从可观测的步骤遥测(微秒级监控)检测故障,监控器仅在健康运行上训练。在 2,823 个 episode 上,单类回声状态网络集成加 CUSUM 告警在 5% 误报预算下检测 0.71 的故障,AUROC 0.872。优势随故障后时间单调增加(+0.09 at =9),并在 AFTraj-2K 上样本外预测自身失效区域。排名无需重训即可迁移到其他组语料库(AFTraj-2K 0.745, ATBench 0.779)。但监控器有两个负担:每个部署需要健康空模型(冷启动 AUROC 0.527 vs 重校准 0.885)和残余误报率。论文增加确定性验证层,重新计算运行的总和,以消除这些负担。
该工作表明,基于步骤遥测的轻量级监控器(微秒级)可以以较低误报率检测 agent 故障,但需要每个部署的健康数据校准,冷启动性能差。跨语料库排名迁移表明监控器学到通用故障模式,但绝对性能依赖校准。确定性验证作为无监督补充,可减少误报。
Agent 可靠性监控正从昂贵的 LLM 评判转向轻量级遥测分析,这可能降低生产环境中 agent 监控的成本。但健康数据依赖和误报率仍是部署障碍,需要结合确定性验证。
该技术可降低 agent 监控成本,提高可靠性,对 agent 平台和 To B 服务有商业价值。但需评估部署成本与收益。
未来可能看到更多基于遥测的监控器与确定性验证结合,用于实时 agent 故障检测。跨语料库迁移能力提示通用监控器可能,但需解决冷启动问题。