AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月31日 · SESA

Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and Remember

发生了什么

SESA(Self-Evolving Skill-Augmented Agent)是一种自进化搜索智能体,通过自我对弈生成训练问题,并将失败经验蒸馏为可复用技能写入外部记忆,使任务生成与技能记忆共同进化。在七个开放域和多跳问答基准上进行了评估。

EVENT STORY

发展脉络

  1. 首次出现Self-Play Meets Skill Evolution: Self-Evolving Search Agents that Pose, Solve, and RememberarXiv cs.AI
  2. 当前判断SESA 展示了自我对弈智能体在无需目标基准问题的情况下,通过内部生成问题与技能记忆的协同进化来提升性能。这可能推动搜索智能体从依赖静态训练数据向动态自进化范式转变,对开放域问答和多跳推理任务有潜在影响。Agent Pulse · 分析
改变了什么

SESA 将程序性记忆作为工具增强搜索自我对弈的进化状态。挑战者提出问题,独立参数化的求解器仅检索技能。信息性失败被蒸馏为可复用技能并写回记忆,更新后的记忆改变求解器行为与成功率,进而改变挑战者的奖励和未来问题分布,产生的新失败再次重写记忆,形成双向循环。检索到的技能塑造在线训练轨迹,其益处可进入模型参数,也可保留在外部记忆库中,支持无记忆部署和可选的推理时检索。在七个开放域和多跳问答基准上进行了评估。

能力边界怎么变了

SESA 的核心创新在于将技能记忆作为自我对弈中可进化的状态,而非固定任务分布中学习的静态库。挑战者与求解器的分离参数化,以及失败到技能的蒸馏回路,使任务生成与技能记忆协同演化。这暗示技能记忆的持续更新可能比静态预训练更有效地提升智能体在开放域问答中的泛化能力。

为什么重要

SESA 展示了自我对弈智能体在无需目标基准问题的情况下,通过内部生成问题与技能记忆的协同进化来提升性能。这可能推动搜索智能体从依赖静态训练数据向动态自进化范式转变,对开放域问答和多跳推理任务有潜在影响。

对谁有影响

SESA 可能降低搜索智能体对人工标注训练数据的依赖,通过自我对弈与技能记忆进化提升问答系统的自适应能力,对构建可扩展的开放域问答产品有潜在价值。

接下来观察

后续可验证信号包括:SESA 在更大规模基准上的性能对比、技能记忆更新频率与模型参数更新的耦合方式、以及无记忆部署与推理时检索在不同任务上的效果差异。