CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
CAFE (Coupled Agent--Feedback Evolution) 是一个框架,其中共享参数模型在搜索代理和评论家角色之间交替。它初始化基于基础代理自身失败的反馈条件恢复,然后耦合在线和离线优化。在线 RL 使用比较反馈估计和反馈感知优势塑造,离线使用从匹配的成功和不成功轨迹中得出的偏好优化。在七个智能体搜索基准上,CAFE 优于评估的基于 RL 的搜索代理。
发展脉络
- 首次出现CAFE: Self-Improving Search Agents Need Co-Evolving FeedbackHugging Face Daily Papers
- 行业反馈CAFE: Self-Improving Search Agents Need Co-Evolving FeedbackarXiv cs.AI
- 当前判断CAFE 表明,搜索代理的自我改进不仅依赖于更好的奖励模型,还依赖于代理与反馈机制的协同进化。这可能导致更鲁棒的智能体训练范式,减少对密集人工反馈的依赖。对于构建智能体系统的团队,CAFE 提供了一种在轨迹级别注入纠正信号的方法,可能提高长任务执行的成功率。可验证的下一信号:是否有其他团队采用类似耦合反馈方法,或在生产环境中看到 CAFE 风格训练的代理。Agent Pulse · 分析
CAFE 框架解决了结果监督搜索代理中终端奖励无法定位中间错误或重定向进行中轨迹的问题。CAFE 将纠正性反馈视为学习到的轨迹内干预,耦合了代理和评论家的角色。共享参数模型交替作为搜索代理和评论家,初始化基于自身失败的反馈条件恢复,并耦合在线和离线优化。在线 RL 使用提示级调用-跳过成功差距来塑造请求回报,以及反馈感知优势塑造来重新加权反馈前后的 token 优势。离线使用从匹配的成功和不成功轨迹中得出的偏好优化。在七个智能体搜索基准上,CAFE 优于评估的基于 RL 的搜索代理。
CAFE 的核心创新在于将反馈生成和使用耦合到同一模型中,通过共享参数交替角色,使代理学会何时请求反馈,评论家学会从结果混淆的轨迹中推断纠正。在线 RL 中的比较反馈估计利用提示级调用-跳过成功差距,而反馈感知优势塑造重新加权 token 优势,这可能是提高样本效率的关键。离线偏好优化从匹配轨迹中学习,可能减少对人工标注的依赖。可验证的下一信号:CAFE 是否在更长轨迹或更复杂工具环境中保持优势,以及其反馈机制是否可迁移到其他代理任务。
CAFE 表明,搜索代理的自我改进不仅依赖于更好的奖励模型,还依赖于代理与反馈机制的协同进化。这可能导致更鲁棒的智能体训练范式,减少对密集人工反馈的依赖。对于构建智能体系统的团队,CAFE 提供了一种在轨迹级别注入纠正信号的方法,可能提高长任务执行的成功率。可验证的下一信号:是否有其他团队采用类似耦合反馈方法,或在生产环境中看到 CAFE 风格训练的代理。
对于构建搜索或信息检索代理的公司,CAFE 提供了一种提高代理性能的方法,可能降低人工反馈成本并提升用户体验。对于 AI 基础设施提供商,CAFE 的训练范式可能成为新工具或服务的卖点。可验证的下一信号:是否有商业产品采用 CAFE 或类似方法,以及其性能提升是否转化为商业指标。
CAFE 可能推动搜索代理向更自主的自我改进方向发展,减少人工干预。未来可能看到反馈机制与代理策略共同进化,形成更通用的智能体训练框架。可验证的下一信号:CAFE 是否在更多基准或实际应用中复现,以及其是否被整合到主流 RL 库中。