LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow Tasks
LongWoF-Bench 是一个包含 778 个机器可验证任务的基准,涵盖代码生成、智能体环境合成、数学推理和规则遵循。在 252 个具有验证器确认的 Opus 轨迹的任务上,进化得到的 EvoMap Gene 在所有七个评估模型上比 Skill 高出 8.7-15.5 个百分点,优势扩展到不同模型系列的消费级模型。参考蒸馏的 Gene 没有表现出同样的优势。
发展脉络
- 首次出现LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow TasksHugging Face Daily Papers
- 行业反馈LongWoF-Bench: Evaluating EvoMap Genes for Verifiable Long-Workflow TasksarXiv cs.CL
- 当前判断该基准的引入表明,长工作流任务的评估正从单一任务转向多步骤、可验证的端到端场景。EvoMap Gene 在消费级模型上的优势可能推动模型供应商和工具链开发者关注经验复用机制,以提升复杂任务执行能力。Agent Pulse · 分析
LongWoF-Bench 引入了一个新的基准,用于评估将验证器确认的执行轨迹外部化为结构化 Gene 的方法。该基准包含 778 个机器可验证任务,覆盖代码生成、智能体环境合成、数学推理和规则遵循。在 252 个具有验证器确认的 Opus 轨迹的任务上,进化得到的 EvoMap Gene 在所有七个评估模型上比 Skill 高出 8.7-15.5 个百分点,优势扩展到不同模型系列的消费级模型。相比之下,参考蒸馏的 Gene 没有表现出同样的优势,表明紧凑表示本身不足,Gene 的效用与验证经验密切相关。
EvoMap Gene 通过进化过程从验证器确认的轨迹中提取,优于 Skill 和参考蒸馏的 Gene,表明验证经验是 Gene 效用的关键。这暗示了将执行经验外部化为可复用结构(如 Gene)可能提升模型在长工作流任务上的表现,但需要验证器确认的轨迹作为基础。
该基准的引入表明,长工作流任务的评估正从单一任务转向多步骤、可验证的端到端场景。EvoMap Gene 在消费级模型上的优势可能推动模型供应商和工具链开发者关注经验复用机制,以提升复杂任务执行能力。
对于构建智能体工作流的企业,EvoMap Gene 可能提供一种提升模型在长任务上表现的方法,而无需重新训练模型。这可以降低部署成本并提高任务成功率,尤其在代码生成和规则遵循等场景中。
未来可能看到更多基于验证轨迹的经验复用方法出现,以及 LongWoF-Bench 成为长工作流任务的标准评估基准。可验证的下一信号是其他研究团队在 LongWoF-Bench 上复现 EvoMap Gene 的结果,或将其应用于更多模型和任务类型。