AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月17日 · R^3-Bench

R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets

发生了什么

R^3-Bench 是一个新基准,用于在共享预算下评估六个问题套件的资源理性推理,涵盖数学、竞争性编程和抽象推理,在无工具和智能体设置中进行。在六个模型的 72 个主表单元中,离线经验预言机的均值在所有单元中匹配或超过竞赛均值,并在 71 个单元中严格更高。在中等无工具压力下,对六个模型中的四个,均等分配重放也超过了竞赛表现。轨迹诊断显示策略更新有限和压力依赖的失败模式。在三模型诊断中,在强智能体压力下,至少一个固定调度器在九个单元中的六个中超过竞赛均值,但没有策略在所有领域占优。

EVENT STORY

发展脉络

  1. 首次出现R^3-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared BudgetsHugging Face Daily Papers
  2. 行业反馈$R^3$-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared BudgetsarXiv cs.CL
  3. 当前判断该基准揭示了当前 LLM 在资源受限场景下的系统性不足,可能影响需要多任务调度的实际应用,如 Agent 工作流和推理服务。Agent Pulse · 分析
改变了什么

R^3-Bench 引入了一个新基准,用于评估语言模型在共享预算下的资源理性推理,即如何分配有限计算以最大化期望价值。与大多数使用独立每任务预算的基准不同,R^3-Bench 评估六问题套件,涵盖数学、竞争性编程和抽象推理,在无工具和智能体设置中。通过匹配单问题响应曲线定义离线经验预言机,研究发现,在六个模型的 72 个主表单元中,预言机均值在所有单元中匹配或超过竞赛均值,并在 71 个单元中严格更高。在中等无工具压力下,对六个模型中的四个,均等分配重放也超过了竞赛表现。轨迹诊断显示策略更新有限和压力依赖的失败模式。在三模型诊断中,在强智能体压力下,至少一个固定调度器在九个单元中的六个中超过竞赛均值,但没有策略在所有领域占优。这些结果揭示了模型展示的能力与实际在共享预算下的表现之间存在持续差距。

能力边界怎么变了

R^3-Bench 的离线经验预言机通过匹配单问题响应曲线定义,表明模型在单问题上的能力可以预测套件性能的上限,但实际表现远低于此。轨迹诊断显示模型在共享预算下策略更新有限,且失败模式随压力变化,暗示当前模型缺乏动态资源分配的能力。

为什么重要

该基准揭示了当前 LLM 在资源受限场景下的系统性不足,可能影响需要多任务调度的实际应用,如 Agent 工作流和推理服务。

对谁有影响

对于构建多任务 Agent 或推理服务的公司,该基准提供了评估模型在共享预算下表现的指标,有助于优化资源分配和成本控制。

接下来观察

未来可能看到更多针对资源理性推理的基准和训练方法,以及模型在共享预算下策略调整能力的改进。