Comparative Approaches to Agent Retrieval over Large Skill Libraries
arXiv 论文 2608.06196v1 研究大型技能库上的 Agent 检索,比较混合排序器(词法与稠密嵌入)与类型化知识图谱。在 690 个技能、117 个查询上,混合排序器 top-5 准确率 73.5%±8.0;图谱在匹配 token 预算下显著更差(-11.2 点,p=0.0007),73% 的未命中查询无法通过图谱到达,98.6% 的边来自同一嵌入邻域。
发展脉络
- 首次出现Comparative Approaches to Agent Retrieval over Large Skill LibrariesarXiv cs.AI
- 当前判断该研究对 Agent 技能库的工程实践有直接参考价值:在构建技能检索系统时,简单的混合排序器可能优于复杂知识图谱,且图谱构建需注意避免与嵌入检索冗余。对于依赖大型技能库的 Agent 平台,该结果提示应优先优化检索器的召回率,而非盲目引入图谱结构。Agent Pulse · 分析
该论文针对大型技能库的 Agent 检索问题,对比了两种方法:混合排序器(结合词法与稠密嵌入)和类型化知识图谱(编码前置条件、数据流等关系)。在 690 个技能、117 个真实查询上,混合排序器 top-5 准确率为 73.5%±8.0,但约四分之一查询未命中。图谱在匹配 token 预算下显著更差(-11.2 点,p=0.0007),其 LLM 生成的边层没有带来额外收益,且 73% 的未命中查询无法通过图谱到达。作者将原因归为预过滤拓扑限制:图谱候选边来自排序器已搜索的嵌入邻域,98.6% 的类型化边冗余。
该结果提示,在技能检索场景中,基于嵌入邻域的图谱构建可能受限于预过滤拓扑,导致无法覆盖排序器未命中的查询。混合排序器在 top-5 上达到 73.5% 的准确率,但仍有约 25% 的查询未被服务,表明当前检索方法存在明显瓶颈。图谱方法在匹配 token 预算下显著更差,说明其边层未提供额外信息,可能因为边来自同一嵌入邻域。未来可探索更丰富的图谱构建方式或混合策略,以提升未命中查询的覆盖率。
该研究对 Agent 技能库的工程实践有直接参考价值:在构建技能检索系统时,简单的混合排序器可能优于复杂知识图谱,且图谱构建需注意避免与嵌入检索冗余。对于依赖大型技能库的 Agent 平台,该结果提示应优先优化检索器的召回率,而非盲目引入图谱结构。
对于构建 Agent 技能库的公司,该研究提供了成本效益证据:混合排序器在检索准确率上优于知识图谱,且实现更简单。企业可据此调整技术路线,避免在低效图谱上过度投资,将资源集中于提升检索覆盖率。
后续可关注:1) 混合排序器在更大技能库上的扩展性;2) 改进图谱构建以覆盖排序器未命中的查询;3) 结合强化学习或用户反馈优化检索排序。