Predicting Task Difficulty Without Rollouts
arXiv 论文 2608.05797v1 研究无需 rollout 的 agent 任务难度预测,覆盖 17 个 agentic benchmark,涉及编码、数学、机器学习、网页导航、函数调用等领域。论文指出 AUC 可能掩盖难度估计缺陷,token 级熵是有用预测信号,残差可暴露环境缺陷如污染和不可行性。
发展脉络
- 首次出现Predicting Task Difficulty Without RolloutsarXiv cs.CL
- 当前判断该研究为 agent 评估和训练课程设计提供新方法,可能影响 benchmark 构建和训练数据筛选。随着 agent 进入长时程领域,无 rollout 预测可降低评估成本,推动更高效的 agent 开发。Agent Pulse · 分析
该论文提出在无 rollout 情况下预测 agent 任务难度,即直接从任务描述预测成功概率,避免在状态化环境中执行昂贵模拟。研究覆盖 17 个 agentic benchmark,包括编码、数学、机器学习、网页导航、函数调用等。论文发现 AUC 可能掩盖难度估计的缺陷,token 级熵是有用的预测信号,并展示期望与观测难度之间的残差可暴露隐藏环境缺陷如污染和不可行性。
论文强调 AUC 在难度预测中的局限性,可能掩盖估计误差,提示评估指标需更细粒度。token 级熵作为预测信号,可能反映任务描述的复杂度或不确定性。残差分析可用于检测 benchmark 污染或不可行任务,为环境设计提供诊断工具。
该研究为 agent 评估和训练课程设计提供新方法,可能影响 benchmark 构建和训练数据筛选。随着 agent 进入长时程领域,无 rollout 预测可降低评估成本,推动更高效的 agent 开发。
对构建 agent 评估平台或训练基础设施的公司,该方法可降低评估成本,加速模型迭代。对依赖 benchmark 的团队,残差分析有助于识别数据质量问题,提升训练效率。
后续可验证信号:该方法在更多真实世界 agent 任务上的泛化能力,以及是否被用于自动生成渐进式训练课程或检测 benchmark 污染。