EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
EarlyEval 论文提出早期结果预测方法,训练 LightGBM 成功/失败分类器,在代理运行达到置信阈值时提前停止。在 SWE-bench Verified、TerminalBench 和 Toolathlon 上,可消除 13%-26% 的代理步骤,最多节省 44.1% 输入 token 和 29.4% 输出 token,预测准确率为 89%-97%。
Development
- First ReportEarlyEval: Cheaper Agent Evaluation via Early Outcome PredictionHugging Face Daily Papers
- Industry ResponseEarlyEval: Cheaper Agent Evaluation via Early Outcome PredictionarXiv cs.CL
- Current Assessment代理评估成本已成为迭代开发的瓶颈,EarlyEval 提供了一种互补的降本思路,可能推动评估基础设施的优化。未来,评估工具可能集成类似早期停止机制,以降低开发成本。Agent Pulse · analysis
EarlyEval 论文针对 LLM 代理评估成本高昂的问题,提出早期结果预测方法。该方法训练 LightGBM 分类器,利用行为、文本和参考解特征,在代理运行早期预测最终结果,一旦置信度超过阈值即停止运行。在三个基准测试中,该方法可消除 13%-26% 的代理步骤,节省最多 44.1% 输入 token 和 29.4% 输出 token,预测准确率为 89%-97%。
EarlyEval 的核心创新在于将评估成本优化从任务级(如基准蒸馏)转向任务内,通过早期停止机制减少每个任务的执行成本。使用 LightGBM 等轻量级分类器,在每一步添加可忽略的开销,实现实时预测。该方法在多个基准上验证了有效性,表明代理的中间行为包含足够的信号来预测最终结果。
代理评估成本已成为迭代开发的瓶颈,EarlyEval 提供了一种互补的降本思路,可能推动评估基础设施的优化。未来,评估工具可能集成类似早期停止机制,以降低开发成本。
对于依赖代理评估的团队,EarlyEval 可显著降低评估成本,加速迭代周期。对于评估工具提供商,集成此类技术可提升产品竞争力。
下一步可验证的信号包括:EarlyEval 在更多基准和真实场景中的泛化能力,以及其与基准蒸馏结合的效果。