- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年7月29日 05:46
- 状态
- 单一信源
发生了什么
一篇arXiv论文通过受控语料缩放实验(从约1000到512000文档),系统比较了词法检索、密集检索、图索引和智能体搜索四种RAG范式。结果显示BM25在所有规模下定义了成本最低的帕累托前沿,从中等规模起准确率领先;文件系统智能体在小规模可匹敌BM25但查询token多39倍,大规模落后近20分;通过检索交换(Agent+BM25)可恢复性能。图RAG遭遇构建瓶颈,最重构建器使用高达24.6倍生成式token每索引词,仅能处理完整语料库的2%。
为什么重要
此前RAG评估多基于单一体量,缺乏跨规模行为理解。该研究首次揭示不同范式随语料库增长的准确性-成本权衡,表明简单词法检索BM25在扩展性上优于复杂LLM方法,挑战了“复杂方法必然更好”的直觉,对系统选型有直接指导意义。
底层逻辑
BM25基于词频统计,无需LLM构建索引,构建成本恒定且查询开销低,在大规模下依然保持竞争力。文件系统智能体依赖LLM递归探索文档,查询token随规模激增,易偏离相关文档。图RAG构建成本随图大小超线性增长,且受限于LLM处理能力,容易达到构建墙。
产品与商业机会
RAG产品可优先采用BM25作为基线,尤其在中大规模语料下可以低成本获得高准确率。需避免在中小规模外使用纯文件系统智能体或图RAG;若需更高精度,可探索Agent+BM25组合。图RAG应关注构建成本与规模限制,设置预警机制。
- 对中小规模知识库(<512k文档)优先集成BM25检索,降低LLM调用成本
- 在BM25基础上叠加轻量级智能体(如Agent+BM25)以提高大规模准确率
- 在图RAG建设中设置构建强度上限,避免资源浪费于超线性增长阶段
- 探索BM25与密集检索混合方案,平衡召回率与成本
仍待确认
- 不同数据领域(如代码、多模态)中此缩放结论是否一致?
- BM25在更大语料(超过512k文档)上的表现如何?
- 密集检索变体(如ColBERT)是否在特定查询类型上优于BM25?
- Agent+BM25的实现开销和延迟在实际产品中是否可接受?