Reranker 指南 2026:不重训模型就提升 RAG 检索的升级
Top-k 检索把对的文档排在第九位。Reranker 重新排序候选,让正确答案进得了上下文窗口——一个下午就能加上,看这篇。
💡 你将学到
Top-k 检索把对的文档排在第九位。Reranker 重新排序候选,让正确答案进得了上下文窗口——一个下午就能加上,看这篇。
检索瓶颈
嵌入搜索有已知天花板:它能找到语义相似的文档,但相似不等于有用。关于退款的提问可能把术语表定义排在退款政策前面。Reranker 正是为此而生——把前 20-50 个候选拿出来,用一个理解查询-文档配对(而不只是查询)的模型重新打分。(star 数 2026-08-13 实测)
为什么两阶段胜过一阶段
第一阶段(双编码器嵌入)便宜而宽广:能扫一百万分块。第二阶段(交叉编码器 reranker)昂贵而精准:把每个候选和查询放在一起打分,捕捉嵌入模型漏掉的词级交互。标准模式——嵌入检索 50 个,rerank 到前 5——用一小部分成本拿到纯交叉编码器搜索的大部分质量。
模型
BGE Reranker 家族(FlagEmbedding,12,000 stars):开源默认。bge-reranker-v2-m3 支持多语言,直接给查询-文档对打分,合理批大小下 CPU 就能跑。
Cohere Rerank:托管 API。零基础设施、质量稳、按查询计费。不想跑模型的团队的参考。
Jina 和基于 LLM 的 reranker:新入场者;LLM 类的用小型模型判断相关性,慢一些但能捕捉细微差别(查询-文档相关,不只是相似)。
向量数据库内置:Qdrant(34,000 stars)等现在自带 rerank API,小场景可以省掉独立服务。
集成模式
上面这段 Python 就是全部改动:嵌入检索 50 个 → FlagReranker 打分 → 排序取前 5 喂上下文。
什么时候真的有效
- 领域词汇:法律、医疗、产品术语,嵌入模型处理得很松散
- 嵌入匹配模糊的长尾查询
- 你已怀疑正确分块被检索到但排太低的任何 RAG
成本现实
GPU 上对每个查询 rerank 50 个候选只需几毫秒到几十毫秒。对比检索质量的提升和替代方案(更大的嵌入模型、更多分块)——这是 2026 年能买到的最便宜的检索升级。
