一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。
论文
·HuggingFace Daily Papers(社区热门论文)
BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究
— BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms