OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding
OmegaUse-OfficeVal 是一个用于评估 LLM 智能体在长时程办公套件任务上表现的基准,包含 100 个任务,平均每个任务需 2.32 小时人工完成。每个任务配有人工劳动时间和任务价格代理两个经济信号,用于比较人工成本与 LLM 推理成本。基准使用基于代码的验证器进行稳定评估。评估结果显示,所有被评估的 LLM 虽比人工更便宜、更快,但交付质量尚未达到人类水平。代码和数据集已完全开源。
Development
- First ReportOmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic GroundingarXiv cs.CL
- Current Assessment该基准反映了 AI 智能体在办公场景中从能力展示转向经济性评估的趋势。通过引入任务价格代理,基准为企业在选择 AI 助手时提供了成本效益分析框架。尽管 LLM 在速度和成本上占优,但质量差距意味着完全替代人工尚不现实,企业可能采用人机协作模式。基准的开源特性可能促进更多研究关注办公任务的自动化,推动智能体在真实工作流中的落地。Agent Pulse · analysis
OmegaUse-OfficeVal 基准引入经济信号来评估 LLM 智能体在办公套件长时程任务中的表现。基准包含 100 个由从业者提出并经隐私保护流程改编的任务,平均每个任务需 2.32 小时人工完成。每个任务配有人工劳动时间和任务价格代理,支持直接比较人工成本与 LLM 推理成本,以及价值加权评估。研究开发了基于代码的验证器以确保稳定评估。评估多个前沿 LLM 和人类基线后发现,所有 LLM 虽更便宜、更快,但交付质量未达人类水平。该基准为评估智能体在真实办公场景中的经济性和质量提供了新方法。
该基准的核心创新在于将经济信号(人工劳动时间和任务价格代理)纳入评估,使 LLM 推理成本与人工成本可直接对比。基于代码的验证器从细粒度评分标准生成,可能提高评估的客观性和可重复性。然而,任务平均 2.32 小时的人工时长表明任务复杂度高,LLM 在长时程任务中的质量差距可能源于规划、工具调用或上下文管理不足。未来可关注验证器如何平衡代码检查与语义正确性,以及经济信号如何影响模型优化目标。
该基准反映了 AI 智能体在办公场景中从能力展示转向经济性评估的趋势。通过引入任务价格代理,基准为企业在选择 AI 助手时提供了成本效益分析框架。尽管 LLM 在速度和成本上占优,但质量差距意味着完全替代人工尚不现实,企业可能采用人机协作模式。基准的开源特性可能促进更多研究关注办公任务的自动化,推动智能体在真实工作流中的落地。
该基准为企业评估 LLM 智能体在办公任务中的投资回报提供了量化工具。通过比较人工成本与推理成本,企业可更理性地决策是否部署 AI 助手。尽管当前质量未达人类水平,但成本优势显著,适合处理低风险、高重复性任务。开源特性降低了评估门槛,可能加速智能体在办公场景的商业化应用。
未来可关注该基准的扩展,如覆盖更多办公套件类型或行业特定任务。随着 LLM 能力提升,质量差距可能缩小,经济信号将更受重视。可验证的下一信号包括:是否有研究使用该基准优化模型以提升价值加权得分,或基准是否被企业用于评估智能体部署的 ROI。此外,代码验证器的泛化性和可扩展性值得关注。