Skip to content

如何设计一个企业级 RAG 知识库?

3 分钟速学卡

30 秒口述: 我设计企业级 RAG 时,不会只做“文档向量化后接 LLM”,而会拆成两条受治理链路:离线完成文档解析、结构恢复、切片、版本化索引和发布门禁,在线完成身份与 ACL、Query 改写、混合召回、融合重排、上下文构造和带引用回答。实时业务真值应由受控 SQL/API 提供,知识文档只提供规则和解释,所有候选、过滤、版本、上下文和答案进入 Trace。验收要分层评估数据与索引、召回排序、上下文、答案引用、系统成本和安全,并演练删除、撤权、旧版本与缓存失效。

  • 本质: 企业 RAG 的核心是受治理知识、受权限检索、受证据约束的生成和可回滚发布。
  • 核心机制: 离线治理与在线问答是两条独立但关联的链路;ACL、有效期和实时业务真值必须在确定性层控制。
  • 关键判断: 混合召回、重排和上下文选择分阶段评测;删除、撤权、版本与缓存一致性必须可演练。
  • 项目落地: 故障演练:新制度已发布但回答仍引用旧规则。先固定身份、Query 和业务状态,检查有效期过滤、Index Manifest、候选列表、final_context 和缓存版本。
  • 边界与坑: “把所有文档放进向量库”:忽略数据质量、结构、权限、版本和删除传播;“Top-k 调大就能提高效果”:可能增加噪声、Token 和延迟,且无法补救错误 ACL。

目录

面试官为什么问

这道题综合考察数据治理、检索、权限、一致性、评测和系统可靠性。面试官会关注你是否能解释离线与在线边界,而不是只会背向量数据库产品名。

小白先看懂

把它想成受权限管理的企业档案馆:入库前要整理目录、拆分卷宗、盖版本章;查阅时先验身份,再同时查目录和语义线索,由复核员挑出最适用材料,最后引用原件回答。档案对应文档,卷宗对应 Chunk,目录检索对应 BM25,语义线索对应 Dense,复核员对应 Reranker。

回到专业机制,检索结果只是证据候选,LLM 不拥有事实真值。类比没有覆盖向量近似误差、Prompt Injection 与 Token 截断,因此还需要权限过滤、上下文预算、引用验证与安全门禁。

主题图与核心原理

图:教学图片|如何设计一个企业级 RAG 知识库?

替代文本: 围绕“如何设计一个企业级 RAG 知识库?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

如何设计一个企业级 RAG 知识库?教学图片

读图结论: 向量库只是组件;权限、版本、引用和评测决定能否生产使用。

这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:企业级 RAG 的离线发布与在线问答双链路

替代文本: 离线链路从权威文档经过解析、切片、索引和评测后原子发布;在线链路从身份与问题经过 ACL、混合召回、重排和上下文构造生成带引用答案。

图表加载中…

读图结论: 离线链路保证“什么知识可查”,在线链路保证“谁能查、查到什么、如何有证据地回答”。

核心数据实体至少包括 DocumentVersionChunkIndexManifestQueryTraceEvalCase。检索阶段显式区分 k_recall > k_rerank >= k_context;Reranker 只能调整已召回候选,不能补回漏召回证据。

项目和生产视角

证据边界: 当前仓库已验证的是 Markdown 知识治理、目录、模板和版本化文档;在线检索 API、向量数据库、Reranker 和业务指标属于演进设计,不能描述为已经上线。

故障演练: 新制度已发布但回答仍引用旧规则。先固定身份、Query 和业务状态,检查有效期过滤、Index Manifest、候选列表、final_context 和缓存版本;临时回滚健康索引并清理受影响缓存,长期用 Tombstone、候选索引、原子别名和版本化缓存键修复。

常见错误回答

  • “把所有文档放进向量库”:忽略数据质量、结构、权限、版本和删除传播。
  • “Top-k 调大就能提高效果”:可能增加噪声、Token 和延迟,且无法补救错误 ACL。
  • “LLM 可以判断实时状态”:实时订单、库存和权限必须走受控业务接口。

递进追问

  1. Chunk Size、Overlap 和父子块怎样选择?
  2. BM25、Dense 与 Reranker 各负责什么?
  3. 删除文档和撤权后如何保证全链路收敛?
  4. 如何区分召回错、上下文错和生成错?
  5. 企业多租户缓存如何避免越权?

关联阅读

总结

一句话记忆: 企业 RAG 的核心是受治理知识、受权限检索、受证据约束的生成和可回滚发布。

  • 离线治理与在线问答是两条独立但关联的链路。
  • ACL、有效期和实时业务真值必须在确定性层控制。
  • 混合召回、重排和上下文选择分阶段评测。
  • 删除、撤权、版本与缓存一致性必须可演练。