外观
BM25、向量检索与混合检索怎么选?
3 分钟速学卡
30 秒口述: 我会把 BM25 用于词面精确、编号和专有名词匹配,把 Dense 向量检索用于表达不同但语义相近的查询,生产基线通常是两路候选的混合检索。两路原始分数尺度不同,不能未经校准直接相加,我会先用 RRF(Reciprocal Rank Fusion)做秩融合,再按标注集决定是否学习权重。最终选择取决于查询类型、语料、延迟、过滤能力和受控评测,而不是宣称某一路普遍更强。
- 本质: BM25 守住词面精确性,Dense 补充语义近邻,混合检索用受控融合把两者变成互补候选。
- 核心机制: 专有名词与编号优先验证稀疏检索;语义改写与同义表达发挥 Dense 优势。
- 关键判断: 异构原始分数不能直接相加;选型必须由查询分桶和统一评测决定。
- 项目落地: 示例项目:产品手册问答将 Query 分成编号型、自然语言型和混合型,比较 BM25、Dense、RRF 三个基线的 Recall@K、MRR、P95 延迟与空召回率。没有本项目实测数据时,只能说“计划验证”,不能声称混合检索已提升多少。
- 边界与坑: “向量检索一定比关键词先进。” 编号、精确术语和可解释性场景下 BM25 可能更合适;“两路分数各乘 0.5 相加。” 原始尺度通常不可比,需秩融合或校准。
目录
面试官为什么问
这道题考察稀疏与稠密检索的机制差异、异构分数融合、专有名词边界,以及候选人是否有真实评测意识。
小白先看懂
客服查“故障码 E104”时,按字面索引能立即命中;用户问“机器总是突然停下来”时,语义检索可能找到“设备异常关机”。前者像按准确书名找书,后者像向馆员描述内容;两位馆员各给一份排行,再合并名次更稳妥。
| 场景 | 技术映射 |
|---|---|
| 按书名、编号找书 | BM25/倒排索引 |
| 描述意思找相近内容 | Dense Embedding |
| 合并两位馆员排行 | RRF/混合检索 |
| 复核前排候选 | Reranker |
类比解释互补召回,但忽略了分词、Embedding 域适配、ACL 和索引延迟等生产约束。
主题教学图片
图:教学图片|BM25、向量检索与混合检索怎么选?
替代文本: 围绕“BM25、向量检索与混合检索怎么选?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

读图结论: 用图中关系理解“BM25、向量检索与混合检索怎么选?”的机制与边界。
这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。
图片生成记录: model=gpt-image-2,generated=2026-07-15,prompt_version=v1,reviewed=2026-07-16,review_basis=user-confirmed;查看生成 Prompt。
图:技术调用流程|稀疏与稠密候选的秩融合
替代文本: 同一查询分别进入 BM25 和 Dense 检索,两路独立排序后用 RRF 融合,再进行重排与上下文选择;任一路超时可降级到另一路。
图表加载中…
读图结论: 混合检索的价值是候选互补,融合应处理排名而不是盲目相加不可比分数。
两路召回应分别记录候选数、延迟、命中查询类型和版本。RRF 是稳健基线,不代表永远最优;有校准分数和标注集时才考虑学习融合。
核心原理
BM25 基于词项频率、逆文档频率与长度归一化,具有词面可解释性;Dense 把 Query 和文档编码到向量空间,通过近邻搜索寻找语义相似项,但可能弱化精确编号或罕见实体。
RRF 常写作 score(d)=Σ 1/(c+rank_i(d)),只依赖每路排名,避开原始分数尺度差异。业务硬过滤如租户和 ACL 不应伪装成软 Boost。
项目和生产视角
示例项目: 产品手册问答将 Query 分成编号型、自然语言型和混合型,比较 BM25、Dense、RRF 三个基线的 Recall@K、MRR、P95 延迟与空召回率。没有本项目实测数据时,只能说“计划验证”,不能声称混合检索已提升多少。
生产风险包括分词词典滞后、Embedding 版本漂移、一路超时拖累总延迟。应按通道设超时、保留单路降级,并监控融合前后正确证据排名变化。
常见错误回答
- “向量检索一定比关键词先进。” 编号、精确术语和可解释性场景下 BM25 可能更合适。
- “两路分数各乘 0.5 相加。” 原始尺度通常不可比,需秩融合或校准。
- “混合检索就是把结果拼起来。” 还需要去重、融合、重排和上下文预算。
递进追问
- BM25 为什么对罕见词和编号更敏感?
- RRF 中常数
c的作用是什么? - 什么条件下可以学习加权融合?
- 如何定位正确证据是在哪一路召回的?
- 一路超时时怎样降级并保持可观测性?
关联阅读
总结
一句话记忆: BM25 守住词面精确性,Dense 补充语义近邻,混合检索用受控融合把两者变成互补候选。
- 专有名词与编号优先验证稀疏检索;
- 语义改写与同义表达发挥 Dense 优势;
- 异构原始分数不能直接相加;
- 选型必须由查询分桶和统一评测决定。