Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
Recuris 是一种递归经验-工作记忆架构,用于长时程智能体任务。在四个基准和十个模型上,35/37 个模型-基准对的任务成功率提升,tau-bench 上 GPT-5.6 Sol +17.8,Claude Opus 5 +15.6 至 87.9%,SkillFlow 上 Qwen3.6-27B/35B +16.6/+13.5。最长任务上优势扩大至 +32.2。
发展脉络
- 首次出现Recursive Experiential-Working Memory Evolution for Long-Horizon Agent HarnessesHugging Face Daily Papers
- 行业反馈Recursive Experiential-Working Memory Evolution for Long-Horizon Agent HarnessesarXiv cs.AI
- 当前判断Recuris 在多个基准和模型上的一致提升表明,长时程智能体任务的成功率可以通过记忆架构的改进而非单纯扩大模型规模来显著提升。这暗示了智能体系统设计中记忆管理的重要性,可能推动行业从依赖更大模型转向更高效的记忆和技能组织。Agent Pulse · 分析
Recuris 是一种递归经验-工作记忆架构,用于长时程智能体任务。它通过工作记忆跟踪任务进度并指导从经验记忆中选择技能,将技能使用基于当前需求而非完整历史。执行过程转化为结构化证据,定位失败到特定记忆组件。固定元智能体将证据转化为局部、验证门控的技能记忆更新,形成有界的递归记忆进化循环。在四个长时程基准和十个模型上,Recuris 在 37 个完成的模型-基准对中提升了 35 个的任务成功率,将前沿模型带到 SOTA 水平:tau-bench 上 GPT-5.6 Sol +17.8,Claude Opus 5 +15.6 至 87.9%,SkillFlow 上 Qwen3.6-27B/35B +16.6/+13.5。优势随交互时程增长而扩大,最长任务上 +32.2。
Recuris 的核心创新在于将工作记忆与经验记忆耦合,使技能选择基于当前任务进度而非完整历史,从而缓解长时程任务中的状态混淆。执行过程被转化为结构化证据,用于定位失败到特定记忆组件,并通过固定元智能体进行验证门控的技能记忆更新,形成有界的递归进化循环。这种设计避免了无界递归自我改进的不可控性,同时实现了局部、可验证的改进。
Recuris 在多个基准和模型上的一致提升表明,长时程智能体任务的成功率可以通过记忆架构的改进而非单纯扩大模型规模来显著提升。这暗示了智能体系统设计中记忆管理的重要性,可能推动行业从依赖更大模型转向更高效的记忆和技能组织。
Recuris 在长时程任务上的显著提升(如 tau-bench 上 +17.8 点)意味着更可靠的智能体,可降低任务失败成本,提升自动化效率。对于依赖长时程自主操作的行业(如客户服务、软件开发),这可能带来直接的生产力提升。
Recuris 的递归记忆进化循环可能为长时程智能体提供持续改进的机制。未来可观察其在不同任务类型和更大模型上的泛化能力,以及验证门控机制是否能防止有害更新。