外观
RAG 基础链路 极简一问一答
定位|
RAG 基础链路一分钟速答页。每章固定 10 题,只保留结论、机制、边界与验证关键词;单个回答控制在 10~60 秒。
1. 怎么使用
本页重点| L1 概念 → L2 边界 → L3 原理 → L4 实现 → L5 工程 → L6 架构 → L7 复盘 → 误区、验证、证据强化。不会展开时,再进入正式主题或专项题库。
- 正式主题: 01-RAG基础链路 / 01-RAG基础链路-数据准备与切片篇
- 深度题库: RAG 基础链路专项面试题
- 阅读方式: 先遮住答案口述;答不出机制、边界或证据,再进入深度材料。
图:RAG 基础链路 十题极简脑图
替代文本: RAG 基础链路从 L1 概念和 L2 边界,依次进入 L3 原理、L4 实现、L5 工程、L6 架构与 L7 项目复盘,再用误区、最小自测和证据边界三题强化。
图表加载中…
读图结论: 掌握 RAG 基础链路 不能停在定义;先顺着七层链路说清机制与工程,再用误区、自测和证据边界确认没有虚假掌握。
2. 极简一问一答
Q001|什么是 RAG,为什么不能把它等同于向量数据库?
Retrieval-Augmented Generation(检索增强生成,RAG)是在生成前从外部知识源取回证据,并把问题与证据共同交给模型。离线侧负责解析、切块、Embedding、索引和版本治理,在线侧负责身份解析、检索、授权、上下文组装、生成与引用;向量库只是其中一个检索组件,RAG 也不能保证消除幻觉。
Q002|RAG、微调、长上下文和确定性工具如何选择?
动态私有事实、引用和独立更新适合 RAG;行为风格与特定任务能力可用 Prompt 或微调;权威实时状态、计算和交易应调用数据库或确定性工具;小而稳定的资料可评估长上下文或缓存。它们不是互斥方案,选择取决于事实来源、更新频率、审计、风险、延迟和成本。
Q003|Chunk、Embedding、Top-k 与上下文预算如何共同影响效果?
Chunk 太大容易混合主题并占用上下文,太小会丢失条件和跨段关系;Embedding 将查询与 Chunk 映射到兼容向量空间,Top-k 决定候选覆盖与噪声,上下文预算再决定哪些证据真正进入模型。最佳取值依赖文档结构、答案跨度、模型 Token 预算、检索器和标注集,不存在通用固定 Chunk、overlap 或 Top-k。
Q004|如何实现一个权限安全的 RAG 在线查询链路?
服务端先从认证上下文计算 tenant、用户组、项目和文档 ACL,将条件推入关键词与向量等每一路检索,再对候选二次授权、去重、核对原文版本并按 Token 预算组装上下文。先全库 Top-k 再过滤会让未授权文档挤占候选,且分数、缓存或正文可能越过权限边界;召回后授权是二次防线,不能替代检索前或检索内过滤。
Q005|线上 RAG 突然查不到或答错,如何按证据排障?
我会固定 request_id、身份和版本,依次检查权威语料、解析/Chunk、索引、查询处理、ACL 前后候选、final_context 和生成。偶发空召回先对比节点、索引别名、缓存、超时与 candidate_count,稳定空召回再查切片粒度、Analyzer、Embedding 相似度和 ANN;回答跑偏先看正确证据是否进入 final_context,没进入查排序与 Token 预算,已进入才查 Prompt 窗口、冲突证据和模型忠实度。修复后重放原请求并把样本与断言加入门禁。
Q006|生产 RAG 如何管理摄取、索引版本、删除和回滚?
我会把 corpus、parser、chunker、embedding、index、retriever 和 prompt/model 绑定为可重放版本;新文档先进入暂存索引,完成完整性、抽样查询和权限测试后原子切换读别名,旧版保留回滚。删除和撤权产生可审计事件,原文、Chunk、索引与缓存共同失效;查询只允许访问兼容向量空间,并在检索与缓存命中后重新授权。
Q007|如何设计一个企业内部运维知识助手?
这是源文档中的示例设计:离线对 Markdown、PDF 和工单做版本识别、类型化解析、结构切块、批量 Embedding、暂存索引质检与原子切换;在线由网关传入可信身份,执行带 ACL 的混合召回、二次授权、原文核对、上下文预算、引用式生成和拒答。难点是解析质量、版本一致性和权限隔离,代表性风险是旧制度残留、未授权缓存和检索正确但上下文被截断;应以新增/修改/删除/撤权回归、分层 Trace 和固定证据集验收。仓库没有真实运行与评测结果,因此不能声称 QPS、Recall、延迟或业务收益。
Q008|这个专题最常见的误区是什么?
常见误区有三类:回答成“Embedding 加向量库”,或承诺用了 RAG 就没有幻觉;从用户 Prompt 读取 tenant/role,或只在生成后隐藏敏感文本;把新旧 Embedding 混写同一索引,或只删原文不删向量与缓存。
Q009|怎样做最小自测?
最小自测分三步:不看文档画出 RAG 的离线摄取与在线查询双链路;用三类文档比较不同 Chunk/Top-k,并解释为何不能照搬固定数值;设计同租户同角色但不同文档权限的越权回归。
Q010|回答这个专题时,证据边界是什么?
Chunk、overlap、Top-k、阈值和 ANN 参数没有通用固定值,必须由目标语料、标注集、预算和实测确定。
3. 总结
一句话记忆: Retrieval-Augmented Generation(检索增强生成,RAG)是在生成前从外部知识源取回证据,并把问题与证据共同交给模型。
- Retrieval-Augmented Generation(检索增强生成,RAG)是在生成前从外部知识源取回证据,并把问题与证据共同交给模型。
- 我会固定 request_id、身份和版本,依次检查权威语料、解析/Chunk、索引、查询处理、ACL 前后候选、final_context 和生成。
- 常见误区有三类:回答成“Embedding 加向量库”,或承诺用了 RAG 就没有幻觉。
- Chunk、overlap、Top-k、阈值和 ANN 参数没有通用固定值,必须由目标语料、标注集、预算和实测确定。