How Benchmarks Mis-Score Computer-Use Agents
arXiv 论文《How Benchmarks Mis-Score Computer-Use Agents》审计了五个 web、企业工作流和桌面控制基准中的 150 条公开失败评分轨迹,发现 15.3% 的 FAIL 判定错误,其中 10.7% 是评估器假阴性,4.7% 是任务损坏。论文提出涵盖任务构建、轨迹观察、评分和报告四个阶段的可靠性框架,并给出三层次诊断分类。
发展脉络
- 首次出现How Benchmarks Mis-Score Computer-Use AgentsarXiv cs.AI
- 当前判断CUA 基准的不可靠性直接影响行业对代理能力的判断。15.3% 的错误 FAIL 判定意味着许多实际成功的代理被错误标记为失败,可能导致对模型能力的低估。评估器假阴性占主导,说明现有评估方法需要改进,以接受更多有效解决方案。这促使行业重新审视基准设计,推动更稳健的评估框架,尤其是在长时程任务中。Agent Pulse · 分析
arXiv 论文《How Benchmarks Mis-Score Computer-Use Agents》指出,计算机使用代理(CUA)的基准分数常由脆弱的脚本化评估器产生,存在任务过时、轨迹缺失关键视觉证据、评估器拒绝有效替代方案、聚合报告掩盖失败原因等问题。作者提出一个涵盖任务构建、轨迹观察、评分和报告的可靠性框架,并审计了五个基准(web、企业工作流、桌面控制)中的 150 条公开失败评分轨迹,发现 15.3% 的 FAIL 判定错误:10.7% 为评估器假阴性,4.7% 为任务损坏。对于真实失败,三层次诊断分类显示验证/反馈和规划错误占主导,而执行/接地错误较少,单一标量成功率无法解释失败原因。论文将这些发现与更新的长时程 CUA 基准联系起来,并推导出各阶段的 CUA 评估设计规则。
CUA 基准的可靠性问题被系统化分为四个阶段:任务构建、轨迹观察、评分和报告。审计发现 15.3% 的 FAIL 判定错误,其中评估器假阴性(10.7%)是主要来源,表明当前评估器对有效替代方案过于严格。三层次诊断分类显示验证/反馈和规划错误占主导,而非执行/接地错误,这意味着 CUA 的主要瓶颈在于高层决策而非低层操作。单一标量成功率无法解释失败原因,需要更细粒度的诊断。
CUA 基准的不可靠性直接影响行业对代理能力的判断。15.3% 的错误 FAIL 判定意味着许多实际成功的代理被错误标记为失败,可能导致对模型能力的低估。评估器假阴性占主导,说明现有评估方法需要改进,以接受更多有效解决方案。这促使行业重新审视基准设计,推动更稳健的评估框架,尤其是在长时程任务中。
对于开发 CUA 产品的公司,可靠的评估是产品迭代和客户信任的基础。15.3% 的错误 FAIL 率意味着当前基准可能误导产品决策,导致资源浪费在错误的方向上。改进评估框架可降低开发成本,加速产品落地,并提升客户对代理能力的信心。
未来 CUA 评估将更注重阶段特定的设计规则,减少评估器假阴性和任务损坏。长时程基准将采用更细粒度的诊断分类,而非单一成功率。可验证的下一信号是:新基准是否报告错误 FAIL 率,以及是否采用多阶段可靠性框架。