Which RAG Paradigm Wins at Scale? A Scaling Study of Retrieval-Augmented Generation Paradigms
一项受控语料规模研究比较了四种 RAG 范式(BM25、密集检索、图索引、Agentic 搜索),使用 28 个严格嵌套的层级,从约 1,000 到 512,000 篇文档。结果显示 BM25 在低成本端定义帕累托前沿,并在中规模以上领先准确率。文件系统 Agent 在最小规模匹配或略超 BM25,但查询 token 多 39 倍,全规模落后近 20 分。将检索替换为 BM25 后,Agent+BM25 在全规模得 69.4 分,而原始文件 Agent 为 36.9,原生 BM25 为 54.8。
Development
- First ReportWhich RAG Paradigm Wins at Scale? A Scaling Study of Retrieval-Augmented Generation ParadigmsarXiv cs.CL
- Current Assessment该研究为 RAG 系统设计提供了实证依据,表明在扩展时简单方法可能优于复杂 Agent 方法。Agent 与 BM25 的组合优于纯 Agent,提示混合架构可能成为趋势。成本与准确率的权衡将影响生产系统选择。Agent Pulse · analysis
该研究在受控条件下比较了四种 RAG 范式(BM25、密集检索、图索引、Agentic 搜索)的扩展行为。使用 28 个严格嵌套的语料库层级(从约 1,000 到 512,000 篇文档),保持问题和固定相关/对抗文档不变,在统一 reader 和评判协议下测量准确率、构建/查询 token 和延迟。结果显示 BM25 在低成本端定义帕累托前沿,并在中规模以上领先准确率,无需基于 LLM 的构建。文件系统 Agent 在最小规模匹配或略超 BM25,但查询 token 多 39 倍,全规模落后近 20 分。将检索替换为 BM25 后,Agent+BM25 在全规模得 69.4 分,而原始文件 Agent 为 36.9,原生 BM25 为 54.8。这表明 Agentic 搜索的收益可能被低效检索掩盖,混合方法可能更优。
BM25 在受控扩展中表现最佳,表明简单词汇检索在规模上仍具竞争力。Agentic 搜索的失败可能源于检索质量而非推理能力,因为替换为 BM25 后性能大幅提升。查询 token 成本差异显著,文件系统 Agent 使用 39 倍查询 token,暗示 token 效率是扩展的关键瓶颈。
该研究为 RAG 系统设计提供了实证依据,表明在扩展时简单方法可能优于复杂 Agent 方法。Agent 与 BM25 的组合优于纯 Agent,提示混合架构可能成为趋势。成本与准确率的权衡将影响生产系统选择。
对 RAG 系统开发者,该研究提供成本-准确率权衡的量化数据,指导架构选择。BM25 的低成本优势可降低推理成本,而 Agent+BM25 的高准确率可能提升产品竞争力。
后续可验证信号包括:更多研究探索 Agent 与 BM25 混合的扩展行为;生产系统报告类似 token 成本对比;基准测试纳入多规模评估。