OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
OSReward 是一个用于评估 VLM 作为 CUA 轨迹评判者的基准,包含来自多种 agent 骨干、经人工验证指令和严格标注的轨迹。它衍生出 OSReward-Hard 和 OSReward-Multi,评估发现最先进的 VLM 评判者存在系统性宽松偏差,未达到理想评判者水平。
发展脉络
- 首次出现OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward ModelsarXiv cs.AI
- 当前判断随着 CUA 发展,自动评估成为关键瓶颈。OSReward 揭示了 VLM 评判者的不足,可能推动更可靠的自动评估方法发展,影响 CUA 训练和部署。Agent Pulse · 分析
OSReward 基准系统评估了视觉语言模型作为计算机使用代理轨迹评判者的可靠性。该基准包含来自多种代理骨干、执行人工验证指令的轨迹,并通过多阶段人工标注获得真实标签。OSReward-Hard 聚焦困难案例,OSReward-Multi 用于细粒度效率和一致性评分。评估发现,即使最先进的 VLM 评判者也存在系统性宽松偏差,未能达到理想评判者标准。
VLM 评判者在评估 CUA 轨迹时存在系统性宽松偏差,可能高估代理任务完成度。OSReward 提供了标准化评估框架,可量化评判者可靠性,为改进评判模型提供基准。
随着 CUA 发展,自动评估成为关键瓶颈。OSReward 揭示了 VLM 评判者的不足,可能推动更可靠的自动评估方法发展,影响 CUA 训练和部署。
可靠的自动评判可降低 CUA 评估成本,加速数据筛选和强化学习,提升代理产品质量,对 AI 公司有直接商业价值。
未来可能出现针对评判者偏差的改进方法,如对抗训练或校准技术。OSReward 基准可能成为标准评估工具,推动评判模型迭代。