AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月3日 · Yuanbao

Cross-Domain Hybrid OPD for Generalizable Search Agents

发生了什么

arXiv 论文 2608.02101v1 提出 Yuanbao 搜索智能体的训练框架,基于 Hunyuan3 架构,结合 agentic RL 与跨领域专家 On-Policy Distillation (OPD) 流水线,以缓解搜索专业化带来的对齐税。实验表明该混合训练策略在提升搜索性能的同时保持通用能力。

EVENT STORY

发展脉络

  1. 首次出现Cross-Domain Hybrid OPD for Generalizable Search AgentsarXiv cs.CL
  2. 当前判断该工作表明,搜索智能体的专业化训练不必以牺牲通用能力为代价,这可能会影响行业对专用 Agent 的训练策略。Yuanbao 作为腾讯的 AI 助手,其搜索智能体的成功可能推动其他厂商采用类似的混合训练方法,以在垂直场景中保持竞争力。可验证的下一信号是:腾讯是否会将此框架应用于其他产品线,或发布相关技术细节。Agent Pulse · 分析
改变了什么

该技术报告介绍了 Yuanbao 搜索智能体的训练框架,旨在实现搜索专业化而不牺牲通用智能。框架基于 Hunyuan3 架构,结合 agentic 强化学习与跨领域专家 On-Policy Distillation (OPD) 流水线。专家模型在互补的通用领域进行蒸馏,以恢复和增强搜索专用学生的广泛能力。混合训练策略联合优化专业化和通用能力,有效缓解对齐税。实验证明该方法在搜索任务上表现优异,同时保持通用能力。

能力边界怎么变了

该框架的核心创新是跨领域专家 On-Policy Distillation (OPD) 流水线,通过将互补通用领域的专家知识蒸馏到搜索专用学生模型中,以抵消 RL 带来的对齐税。这暗示了一种新的训练范式:将专业化和通用能力视为可联合优化的目标,而非对立。可验证的下一信号是:后续工作是否会公开 OPD 的具体蒸馏损失函数或专家选择策略,以及该方法在更大规模模型上的扩展性。

为什么重要

该工作表明,搜索智能体的专业化训练不必以牺牲通用能力为代价,这可能会影响行业对专用 Agent 的训练策略。Yuanbao 作为腾讯的 AI 助手,其搜索智能体的成功可能推动其他厂商采用类似的混合训练方法,以在垂直场景中保持竞争力。可验证的下一信号是:腾讯是否会将此框架应用于其他产品线,或发布相关技术细节。

对谁有影响

对于腾讯而言,Yuanbao 搜索智能体的成功可能提升其搜索产品的竞争力,吸引更多用户。该训练框架可能降低开发专用 Agent 的成本,因为无需在通用能力和专业化之间取舍。可验证的下一信号是:Yuanbao 搜索智能体的用户留存或搜索任务成功率是否提升。

接下来观察

未来,搜索智能体可能通过类似 OPD 的混合训练方法,在保持通用能力的同时实现高度专业化。这可能导致更通用的助手在搜索等垂直任务上表现更好,减少对专用模型的依赖。可验证的下一信号是:该框架是否会被其他团队复现,以及是否会出现基于 OPD 的通用训练工具。