AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月29日 · Which RAG Paradigm Wins at Scale?

Which RAG Paradigm Wins at Scale? A Scaling Study of Retrieval-Augmented Generation Paradigms

发生了什么

一项受控语料规模研究比较了四种 RAG 范式(BM25、密集检索、图索引、Agentic 搜索),使用 28 个严格嵌套的层级,从约 1,000 到 512,000 篇文档。结果显示 BM25 在低成本端定义帕累托前沿,并在中规模以上领先准确率。文件系统 Agent 在最小规模匹配或略超 BM25,但查询 token 多 39 倍,全规模落后近 20 分。将检索替换为 BM25 后,Agent+BM25 在全规模得 69.4 分,而原始文件 Agent 为 36.9,原生 BM25 为 54.8。

EVENT STORY

发展脉络

  1. 首次出现Which RAG Paradigm Wins at Scale? A Scaling Study of Retrieval-Augmented Generation ParadigmsarXiv cs.CL
  2. 当前判断该研究为 RAG 系统设计提供了实证依据,表明在扩展时简单方法可能优于复杂 Agent 方法。Agent 与 BM25 的组合优于纯 Agent,提示混合架构可能成为趋势。成本与准确率的权衡将影响生产系统选择。Agent Pulse · 分析
改变了什么

该研究在受控条件下比较了四种 RAG 范式(BM25、密集检索、图索引、Agentic 搜索)的扩展行为。使用 28 个严格嵌套的语料库层级(从约 1,000 到 512,000 篇文档),保持问题和固定相关/对抗文档不变,在统一 reader 和评判协议下测量准确率、构建/查询 token 和延迟。结果显示 BM25 在低成本端定义帕累托前沿,并在中规模以上领先准确率,无需基于 LLM 的构建。文件系统 Agent 在最小规模匹配或略超 BM25,但查询 token 多 39 倍,全规模落后近 20 分。将检索替换为 BM25 后,Agent+BM25 在全规模得 69.4 分,而原始文件 Agent 为 36.9,原生 BM25 为 54.8。这表明 Agentic 搜索的收益可能被低效检索掩盖,混合方法可能更优。

能力边界怎么变了

BM25 在受控扩展中表现最佳,表明简单词汇检索在规模上仍具竞争力。Agentic 搜索的失败可能源于检索质量而非推理能力,因为替换为 BM25 后性能大幅提升。查询 token 成本差异显著,文件系统 Agent 使用 39 倍查询 token,暗示 token 效率是扩展的关键瓶颈。

为什么重要

该研究为 RAG 系统设计提供了实证依据,表明在扩展时简单方法可能优于复杂 Agent 方法。Agent 与 BM25 的组合优于纯 Agent,提示混合架构可能成为趋势。成本与准确率的权衡将影响生产系统选择。

对谁有影响

对 RAG 系统开发者,该研究提供成本-准确率权衡的量化数据,指导架构选择。BM25 的低成本优势可降低推理成本,而 Agent+BM25 的高准确率可能提升产品竞争力。

接下来观察

后续可验证信号包括:更多研究探索 Agent 与 BM25 混合的扩展行为;生产系统报告类似 token 成本对比;基准测试纳入多规模评估。