CRISP: Critical Step Perception for Training Efficient Deep Search Agents
CRISP 是一个用于训练高效深度搜索智能体的框架,通过关键步骤感知来区分收集必要证据的交互与冗余交互,并塑造训练奖励以保留前者、剪除后者。CRISP 首先通过 Backward Evidence Induction 构建关键步骤标签:从最终答案开始,一个强模型沿完成的搜索轨迹向后遍历。该论文发表于 arXiv(cs.CL),编号 2608.01867v1。
Development
- First ReportCRISP: Critical Step Perception for Training Efficient Deep Search AgentsarXiv cs.CL
- Current Assessment该研究针对深度搜索智能体的成本与效率痛点,提出细粒度的步骤级奖励塑造方法。若有效,可能推动搜索智能体在真实场景中的部署,降低单位任务成本。可验证的下一信号是该方法是否被集成到主流智能体框架或商业搜索产品中。Agent Pulse · analysis
大型语言模型正被扩展为深度搜索智能体,通过多步与外部搜索和浏览工具交互来解决复杂问题。然而,现有智能体常产生冗长轨迹,包含冗余查询、低效探索和无关观察,导致高昂的计算和交互成本。现有面向效率的方法通常鼓励智能体减少工具使用,但将所有工具交互一视同仁地惩罚,可能抑制收集必要证据的步骤。CRISP 框架通过关键步骤感知来训练高效深度搜索智能体,区分收集必要证据的交互与冗余交互,并塑造训练奖励以保留前者、剪除后者,从而在不牺牲正确答案所需证据的前提下提升效率。CRISP 首先通过 Backward Evidence Induction 构建关键步骤标签:从最终答案开始,一个强模型沿完成的搜索轨迹向后遍历。
CRISP 的核心创新在于将工具交互分为必要证据收集与冗余两类,并通过 Backward Evidence Induction 从最终答案反向遍历轨迹来标注关键步骤,以此塑造奖励信号。这与以往统一惩罚工具使用的效率方法形成对比,可能更精准地平衡效率与证据完整性。可验证的下一信号是论文中是否报告了在标准深度搜索基准(如 WebArena 或类似任务)上的效率与准确率对比数据。
该研究针对深度搜索智能体的成本与效率痛点,提出细粒度的步骤级奖励塑造方法。若有效,可能推动搜索智能体在真实场景中的部署,降低单位任务成本。可验证的下一信号是该方法是否被集成到主流智能体框架或商业搜索产品中。
对构建深度搜索智能体的团队,该方法可能降低推理与交互成本,提升单位任务的经济性。可验证的下一信号是是否有第三方复现或采用该框架的基准结果。
CRISP 可能启发更多针对长轨迹智能体的细粒度效率优化方法,从步骤级别而非整体层面控制成本。未来可观察该方法在更复杂、多跳推理任务上的泛化能力,以及是否与推理时计算缩放技术结合。