TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
TRAJDEBUG 论文提出 TrajDebug 框架,用于在长轨迹 Agent 中定位导致最终失败的关键错误步骤。论文还构建了 TrajErrBench 基准,包含 486 条来自 Tau2Bench 和 SWE-Bench Pro 的人工标注失败轨迹。
Development
- First ReportTRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent TrajectoriesarXiv cs.AI
- Current Assessment该研究反映了 Agent 调试工具链的兴起,类似于传统软件工程中的调试器,但针对 LLM Agent 的独特挑战。TrajErrBench 基准的构建表明社区正在建立标准化的 Agent 失败评估集,可能推动 Agent 可靠性研究。Agent Pulse · analysis
TRAJDEBUG 论文针对 LLM 驱动的 Agent 系统在长轨迹任务中错误级联和调试困难的问题,提出 TrajDebug 框架。该框架通过多粒度历史压缩和基于证据的错误识别,解决长轨迹中错误证据分散的问题,并通过追踪每个错误的解决状态和最终影响,实现关键错误归因。论文还构建了 TrajErrBench 基准,包含 486 条人工标注的失败轨迹,覆盖真实工具使用和编码场景。实验在多个 Agent 基准上验证了方法的有效性。
TrajDebug 的核心创新在于错误生命周期追踪,将错误识别从静态步骤判断转向动态过程追踪。多粒度历史压缩可能采用分层摘要或检索机制,以在长上下文中保留关键证据。基于证据的错误识别可能利用模型对指令、观察和上下文的交叉验证。关键归因通过追踪错误的解决状态和终端影响,区分局部错误与最终失败原因。
该研究反映了 Agent 调试工具链的兴起,类似于传统软件工程中的调试器,但针对 LLM Agent 的独特挑战。TrajErrBench 基准的构建表明社区正在建立标准化的 Agent 失败评估集,可能推动 Agent 可靠性研究。
对于构建 Agent 产品的公司,TrajDebug 可降低调试成本,加速开发周期,提高 Agent 可靠性,从而提升产品竞争力。TrajErrBench 可作为评估 Agent 质量的基准,用于产品选型或内部测试。
未来可能看到 TrajDebug 方法被集成到 Agent 开发框架中,作为调试工具。TrajErrBench 可能成为 Agent 评估的标准基准之一。进一步研究可能探索自动化错误修复,而不仅仅是检测。