ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents
ClawTrack 是一个双评估基准,同时衡量任务得分和过程得分,包含 8 个领域的 320 个任务和 25 个以上的确定性模拟服务。过程评分器根据 12,541 个任务特定评分项,从目标对齐、效率、信息利用和结果验证四个维度对每个推理步骤进行评分。评估了 21 个模型,超过 16,000 次试验,发现过程得分能归因成功与失败,结果验证是系统性瓶颈,框架对评估器选择具有鲁棒性,基于过程的轨迹过滤提高了性能。
发展脉络
- 首次出现ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous AgentsarXiv cs.LG
- 当前判断该基准的出现表明,随着 LLM 代理部署到复杂工作流中,评估标准正从结果导向转向过程导向,这反映了行业对代理可靠性和可解释性的需求。过程评分可能成为代理开发中的标准实践,推动代理在推理透明度和自我验证方面的改进。Agent Pulse · 分析
ClawTrack 是一个用于真实世界自主代理的轨迹级评估基准,旨在解决现有基准仅评估最终结果、无法区分可靠推理与偶然成功、难以归因失败的问题。它采用双评估方法,同时测量任务得分(代理实现目标的程度)和过程得分(代理如何实现目标)。该基准包含 8 个领域的 320 个任务,使用 25 个以上的确定性模拟服务,过程评分器根据 12,541 个任务特定评分项,从目标对齐、效率、信息利用和结果验证四个维度对每个推理步骤进行评分。在 21 个模型和 16,000 多次试验的评估中,发现过程得分能有效归因成功与失败,过滤掉仅凭结果评估无法发现的幸运通过;四个维度互补,结果验证是系统性瓶颈;框架对不同的评判 LLM 具有鲁棒性;基于过程的轨迹过滤提高了性能。
ClawTrack 引入过程评分,将代理的推理步骤分解为四个维度进行细粒度评估,这比仅评估最终结果更能揭示代理的推理质量。结果验证被确定为系统性瓶颈,表明代理在验证自身输出方面存在普遍不足。基于过程的轨迹过滤可能用于改进训练数据或推理时选择,从而提升代理性能。
该基准的出现表明,随着 LLM 代理部署到复杂工作流中,评估标准正从结果导向转向过程导向,这反映了行业对代理可靠性和可解释性的需求。过程评分可能成为代理开发中的标准实践,推动代理在推理透明度和自我验证方面的改进。
对于开发自主代理的企业,ClawTrack 提供了一种更精确的评估工具,有助于识别代理在推理过程中的具体缺陷,从而指导优化,减少部署中的失败成本。它也可能成为代理评估服务的商业机会。
未来,ClawTrack 可能扩展到更多领域和更复杂的任务,过程评分可能被整合到代理的训练和推理流程中,以提升其鲁棒性。此外,基于过程的轨迹过滤可能成为提升代理性能的通用技术。