AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 6, 2026 · EcoAgent-Bench

EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents

What Happened

EcoAgent-Bench 是一个新的基准,用于评估预算受限的 LLM 代理的经济决策能力。它包含 304 个真实衍生任务,涵盖五个任务族,改编自 GAIA、HotpotQA 和 MuSiQue。基准测试了四种决策:避免不必要的升级、在本地证据不足时升级、选择模型层级以及基于不支持的前提停止。在工具 API 和 workspace-CLI 设置中评估了七个 LLM 代理和四个 oracle 脚本控制。工具 API 代理的微平均严格成功率仅为 3.9-24.0%,经济一致性得分最高为 7.3%。

EVENT STORY

Development

  1. First ReportEcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM AgentsarXiv cs.CL
  2. Current Assessment该基准的引入表明,AI 代理的评估正在从单纯的任务完成转向经济效率,这反映了行业对代理部署成本效益的关注。Agent Pulse · analysis
What Changed

EcoAgent-Bench 引入了一个新的基准,用于评估 LLM 代理在预算约束下的经济决策能力。与仅衡量任务完成度的传统基准不同,该基准将资源使用视为任务的一部分,要求代理在本地查找、广泛搜索、复合研究工具、更强模型或人工升级之间做出选择。基准包含 304 个真实衍生任务,改编自 GAIA、HotpotQA 和 MuSiQue,涵盖五个任务族,并测试四种决策:避免不必要的升级、在本地证据不足时升级、选择模型层级以及基于不支持的前提停止。评估了七个 LLM 代理和四个 oracle 脚本控制,在工具 API 和 workspace-CLI 设置中。结果显示,工具 API 代理的微平均严格成功率仅为 3.9-24.0%,经济一致性得分最高为 7.3%,表明代理经常在需要升级时过早停止,或在简单任务上过度支出。

How the Capability Boundary Shifted

EcoAgent-Bench 引入了一种新的评估指标——经济一致性得分,它取升级导向和节省导向任务组准确率的较差值,以暴露单向策略的失败。这种指标设计可能成为未来代理评估的标准,推动代理在资源使用和任务成功之间取得平衡。

Why It Matters

该基准的引入表明,AI 代理的评估正在从单纯的任务完成转向经济效率,这反映了行业对代理部署成本效益的关注。

Who It Affects

对于构建代理产品的公司,该基准提供了评估代理经济效率的方法,有助于优化成本并提高客户满意度。

What to Watch Next

未来,代理可能需要内置经济决策能力,以在预算约束下优化资源使用,这可能导致新的模型训练目标和评估标准。