指南

从「什么是 reranker?」到混合检索、评测与自托管 —— 选一个起点,或从头到尾读完。

什么是 reranker?

两阶段检索、排序为何重要、何时值得加重排序。

基础约 7 分钟

Cross-encoder vs bi-encoder

速度 vs 精度 —— 生产环境为何两者都用。

架构约 8 分钟

如何为 RAG 加重排序

宽召回、紧重排 —— 含 Python、LangChain 与延迟建议。

实战约 10 分钟

混合检索 + 重排序

结合 BM25 与向量检索,再由 reranker 修正合并结果。

生产约 9 分钟

如何评测 reranker

NDCG、MRR、标注查询与领域回归测试。

评测约 8 分钟

自托管 reranker

sentence-transformers、GPU 选型与最小 FastAPI 服务。

生产约 10 分钟

按场景选型

RAG / 客服 / 法律 / 代码 —— 哪种模型适合你的场景。

决策约 8 分钟

Late-interaction(ColBERT)

ColBERT 何时胜过 bi-encoder,何时仍需要 cross-encoder rerank。

架构约 9 分钟

指令跟随 rerank

改变「相关」含义的任务指令 —— 对比经典 cross-encoder。

新兴约 7 分钟

重排序没起作用

看不到提升的七个原因 —— 召回、候选池大小、截断 —— 以及如何判断你属于哪一种。

排障约 9 分钟

在向量数据库上做重排序

把重排序这一步接到 pgvector、Qdrant 或 Elasticsearch 上,含代码。

实战约 10 分钟

重排序成本计算器

按次计费还是按 token 计费?在你的量级下哪个 rerank API 更便宜。

交互工具

浏览器在线 Demo

观看 cross-encoder 重排段落 —— 含 bi-encoder 代理对比。

交互