AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月1日 · Deep Research Pretraining (DRP)

Deep Research Pretraining via Predictive Navigation

发生了什么

Deep Research Pretraining (DRP) 是一个离线框架,从带引文或超链接的段落中构建代理研究目标,恢复链接证据和图相关替代方案,并将其转换为搜索-打开-写入轨迹,无需实时检索环境或执行策略回滚。DRP 在学术引文图(DRP-Paper)和维基百科超链接(DRP-Web)上实例化,分别在 1B token 上持续预训练 Qwen3-14B-Base 模型,并在 13K 代理轨迹的受控分数上进行微调。在五个独立采样的低数据预算子集上,两种变体在 DeepResearch Bench 上始终优于匹配的无 DRP 模型。使用四分之一 SFT 数据,DRP-Web 甚至超过了固定的无 DRP 全数据检查点,收益可转移。

EVENT STORY

发展脉络

  1. 首次出现Deep Research Pretraining via Predictive NavigationarXiv cs.CL
  2. 当前判断DRP 展示了利用现有知识图谱(如引文图、维基百科)进行预训练的有效性,可能降低 deep research agent 的训练成本。这暗示未来 agent 训练可能更多依赖离线数据合成,而非实时环境交互,从而加速迭代并降低成本。Agent Pulse · 分析
改变了什么

Deep research agents 通常需要昂贵的、环境接地工具使用轨迹进行训练,涉及重复检索、文档检查和报告评估。DRP 引入离线框架,从自然发生的证据结构(如引文或超链接)中派生预测性导航监督,构建代理研究目标并转换为搜索-打开-写入轨迹,教导模型搜索什么、检查哪些文档以及如何综合证据,无需实时检索环境或执行策略回滚。DRP 在学术引文图(DRP-Paper)和维基百科超链接(DRP-Web)上实例化,持续预训练 Qwen3-14B-Base 模型 1B token,并在 13K 代理轨迹的受控分数上微调。在五个独立采样的低数据预算子集上,两种变体在 DeepResearch Bench 上始终优于匹配的无 DRP 模型。使用四分之一 SFT 数据,DRP-Web 甚至超过固定的无 DRP 全数据检查点,收益可转移。

能力边界怎么变了

DRP 的核心创新在于利用自然证据结构(引文、超链接)生成训练信号,避免了实时检索环境的高成本。通过构建代理研究目标并转换为搜索-打开-写入轨迹,模型学习预测性导航,即知道搜索什么、检查哪些文档以及如何综合。这种方法在低数据预算下显著提升性能,表明离线预训练信号可以部分替代昂贵的在线轨迹数据。

为什么重要

DRP 展示了利用现有知识图谱(如引文图、维基百科)进行预训练的有效性,可能降低 deep research agent 的训练成本。这暗示未来 agent 训练可能更多依赖离线数据合成,而非实时环境交互,从而加速迭代并降低成本。

对谁有影响

DRP 可能降低 deep research agent 的训练成本,使更多团队能够构建高性能 agent,而无需大量实时环境交互数据。这有助于加速 agent 产品化,尤其在需要深度研究能力的领域(如法律、医疗、金融)。

接下来观察

DRP 的收益可转移性表明,离线预训练信号可能在不同任务和领域间泛化。未来可能看到更多利用结构化知识源(如学术数据库、企业文档)进行预训练的 agent 模型,进一步减少对昂贵轨迹数据的依赖。