Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?
Desktop-Delta Bench (DDB) 是一个离线步骤级基准,包含 2,013 个人工验证实例,来自约 15 个应用和 50 个任务域的多应用 Linux 轨迹。DDB 通过两个互补任务评估模型:463 个三帧时序排序实例(含 105 个跨轨迹干扰项)和 1,550 个前后对比对(标注 5 种动作及其负载)。评估了 8 个闭源和开源模型家族。
发展脉络
- 首次出现Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?arXiv cs.AI
- 当前判断该基准的发布表明,计算机使用代理的评估正从端到端任务成功转向细粒度步骤级推理能力,这可能会推动模型在状态跟踪和错误恢复方面的改进。Agent Pulse · 分析
Desktop-Delta Bench (DDB) 是一个用于评估计算机使用模型(CUA)理解桌面 GUI 状态转换能力的离线步骤级基准。现有基准主要衡量最终任务成功或单帧定位,无法隔离模型是否能够重建动作产生的因果、任务相关的转换——这对于拒绝过时观察、验证进度和从失败中恢复至关重要。DDB 包含 2,013 个人工验证实例,来自约 15 个应用和 50 个任务域的多应用 Linux 轨迹,针对状态验证、源跟踪和上下文感知控制三个失败维度,通过 463 个三帧时序排序实例(含 105 个跨轨迹干扰项)和 1,550 个前后对比对(标注 5 种动作及其负载)进行评估。评估了 8 个闭源和开源模型家族。
DDB 揭示了当前 CUA 模型在理解 GUI 状态转换方面的关键缺陷:模型可能将延迟、遮挡或无关的观察误判为进度,从而影响后续规划。该基准通过时序排序和前后对比任务,系统性地测试模型对动作因果效应的理解,而非仅依赖最终结果。
该基准的发布表明,计算机使用代理的评估正从端到端任务成功转向细粒度步骤级推理能力,这可能会推动模型在状态跟踪和错误恢复方面的改进。
对于开发桌面自动化代理的公司,DDB 提供了评估模型在复杂 GUI 环境中可靠性的工具,有助于减少因状态误判导致的任务失败,提升产品稳定性。
未来可能出现更多针对 GUI 转换理解的基准,并推动模型在异步环境下的鲁棒性提升。可验证信号:是否有模型在 DDB 上达到人类水平,或是否有新方法专门针对状态转换建模。