GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
GDPevo 是一个用于评估 Agent 自我进化的基准,基于 GDP 相关的企业工作流。其核心机制是规则杂交,将工作流分解为原子业务规则,分配到训练任务中,并在测试任务中重组。V1 包含 120 个任务,分为 12 组,每组 5 个训练和 5 个测试任务。V2 计划扩展到 240 个任务,分为 24 组,可在两天内生成。覆盖 CRM、ERP、金融、医疗、法律和数据中心工作流。
发展脉络
- 首次出现GDPevo: Evaluating Agent Self-Evolution on Real Business TasksarXiv cs.AI
- 当前判断GDPevo 覆盖 CRM、ERP、金融、医疗、法律等企业工作流,表明 Agent 自我进化评估正从通用任务转向经济价值高的领域。这反映了行业对 Agent 在真实业务场景中持续改进能力的关注,可能推动企业级 Agent 的落地。Agent Pulse · 分析
GDPevo 是一个新的基准,用于评估 Agent 的自我进化能力,即从先前经验更新持久状态并复用以解决相关任务。现有基准在覆盖经济价值高的任务领域方面有限,且难以将测试时的性能提升归因于训练经验,并易受数据污染影响。GDPevo 通过规则杂交机制解决这些问题:将企业工作流分解为原子业务规则,在训练任务中分配子集,并在测试任务中重组,从而确保测试时的提升可归因。V1 包含 120 个任务,覆盖 CRM、ERP、金融、医疗、法律和数据中心工作流。全自动数据管道可在两天内扩展到 240 个任务(V2),以应对污染。论文评估了四种 Agent 方法,但具体结果未在摘要中给出。
GDPevo 的规则杂交机制为评估 Agent 自我进化提供了可归因的测试设计,通过将工作流分解为原子规则并重组,确保测试时的性能提升可归因于训练经验。这种设计可能成为未来 Agent 评估基准的范式,但需要验证其在不同任务域上的泛化能力。
GDPevo 覆盖 CRM、ERP、金融、医疗、法律等企业工作流,表明 Agent 自我进化评估正从通用任务转向经济价值高的领域。这反映了行业对 Agent 在真实业务场景中持续改进能力的关注,可能推动企业级 Agent 的落地。
GDPevo 为企业评估 Agent 在真实业务工作流中的自我进化能力提供了工具,有助于选择能持续改进的 Agent 方案,降低长期维护成本,提升自动化效率。
GDPevo 的 V2 扩展计划表明其数据管道可快速生成新任务,以应对数据污染。未来可能成为 Agent 自我进化评估的标准基准,但需要更多独立验证和跨领域测试。