外观
RAG 评测与生产工程 极简一问一答
定位|
RAG 评测与生产工程一分钟速答页。每章固定 10 题,只保留结论、机制、边界与验证关键词;单个回答控制在 10~60 秒。
1. 怎么使用
本页重点| L1 概念 → L2 边界 → L3 原理 → L4 实现 → L5 工程 → L6 架构 → L7 复盘 → 误区、验证、证据强化。不会展开时,再进入正式主题或专项题库。
- 正式主题: 03-RAG评测与生产工程 / 03-RAG评测与生产工程-多模态监控篇
- 深度题库: RAG 评测与生产工程专项面试题
- 阅读方式: 先遮住答案口述;答不出机制、边界或证据,再进入深度材料。
图:RAG 评测与生产工程 十题极简脑图
替代文本: RAG 评测与生产工程从 L1 概念和 L2 边界,依次进入 L3 原理、L4 实现、L5 工程、L6 架构与 L7 项目复盘,再用误区、最小自测和证据边界三题强化。
图表加载中…
读图结论: 掌握 RAG 评测与生产工程 不能停在定义;先顺着七层链路说清机制与工程,再用误区、自测和证据边界确认没有虚假掌握。
2. 极简一问一答
Q001|为什么 RAG 不能只用一个端到端准确率或总分评测?
生产 RAG 应分为语料、解析、索引、检索、上下文、生成、系统和业务八层评测,因为一个错答可能来自事实不存在、解析丢失、索引陈旧、召回失败、上下文截断、生成不忠实、服务超时或业务任务未完成。单一总分会掩盖根因和长尾分桶,无法指导修复与回滚。
Q002|Correctness、Groundedness、引用、拒答和 LLM Judge 有何边界?
Correctness 判断答案是否符合权威事实,Groundedness 判断本次答案主张是否受给定证据支持;引用还要检查 claim 是否由当前、有权版本真正支持,拒答需同时评估误拒与漏拒。模型可能脱离证据猜对,也可能忠实复述错误旧文档;LLM Judge 只能作为经人工校准、固定版本和分项 rubric 的辅助裁判,不是绝对真值。
Q003|一条合格的 RAG 评测样本应包含什么,Recall、MRR 与 nDCG 各测什么?
样本至少包含 query_id、answerable、必要证据 ID、参考事实、allowed_scope、as_of_time/corpus_version、查询分桶与风险标签。Recall@k 衡量必要证据覆盖,MRR 强调第一个相关结果位置,nDCG@k 适合分级相关性排序;多跳题只命中一个证据时,MRR 可能很高但答案仍不完整。相近改写应按来源、意图簇或时间隔离,避免调参与最终测试泄漏。
Q004|如何设计可重放 Trace 和 RAG 版本矩阵?
Trace 应关联 request_id、脱敏身份、raw/normalized/rewrite query、corpus/parser/chunker、embedding/index/retriever/reranker、每路候选、过滤理由、final_context、model/prompt、引用、拒答、分阶段耗时、用量、缓存与降级状态。发布单元应绑定不可变版本矩阵而非只记 model 名;高基数 ID 放 Trace/日志,敏感原文按最小化、脱敏、加密、访问审计和保留期治理。
Q005|线上 RAG 质量或稳定性突然下降,如何止损、定位和防复发?
先停止扩量并按风险回滚或降级,固定失败 request_id、身份和完整版本矩阵,再从语料、Chunk、索引、查询、候选/过滤、融合/重排、final_context 到生成寻找第一个偏离点。偶发空召回应对比节点、别名、缓存、超时和各层 candidate_count;回答跑偏则先判断正确证据是否进入 final_context,再区分检索、窗口截断与生成忠实度。修复后用原请求和相邻分桶做离线重放、影子/灰度验证,并把样本、指标、告警和 Runbook 加入发布门禁。
Q006|如何建立 RAG 的持续评测、灰度和回滚门禁?
候选版本先经过确定性单测、语料/解析/索引完整性、检索指标、生成正确性/忠实度/引用/拒答、性能和安全测试,再在冻结门禁集与分桶上对比基线;通过后进入影子与小流量灰度,按版本监控质量、p95/p99、成本、新鲜度和安全事件。指标越界要能原子回滚版本与缓存命名空间,线上失败经脱敏、人工复核和根因标注后进入滚动集与下一轮门禁。
Q007|如何把内部运维 RAG 原型升级为生产服务?
这是源文档中的示例设计:为语料、解析、索引、检索、上下文、生成和服务建立稳定 ID、版本与分层 Trace,用冻结门禁集、影子/灰度、权限感知缓存和原子回滚控制发布。难点是跨组件归因、版本组合和质量/延迟/成本/安全权衡;亮点必须由控制变量重放、撤权测试和回滚演练验证。代表性风险是旧索引、Reranker 长尾、无答案强答和跨用户缓存泄露,均要闭环为回归样本。仓库没有真实运行证据,因此不能报告准确率、SLO、成本或业务收益。
Q008|这个专题最常见的误区是什么?
常见误区有三类:只看答案准确率、RAGAS 总分或几个成功 Demo;只记模型名或最终答案,或把 user_id/run_id 当无界 Metric 标签;只做一次离线总分,或把未经复核的用户点赞直接当真值。
Q009|怎样做最小自测?
最小自测分三步:为一个小知识库定义八层评测对象和每层至少一个证据字段;构造“答对但不忠实”和“忠实但错误”的样本并说明判定;实现 Recall@k、MRR、nDCG、引用和拒答指标的边界测试。
Q010|回答这个专题时,证据边界是什么?
不使用单一总分代替根因分析,LLM-as-a-Judge 不是绝对真值,门禁阈值与效果数字必须由项目实测。
3. 总结
一句话记忆: 生产 RAG 应分为语料、解析、索引、检索、上下文、生成、系统和业务八层评测,因为一个错答可能来自事实不存在、解析丢失、索引陈旧、召回失败、上下文截断、生成不忠实、服务超时或业务任务未完成。
- 生产 RAG 应分为语料、解析、索引、检索、上下文、生成、系统和业务八层评测,因为一个错答可能来自事实不存在、解析丢失、索引陈旧、召回失败、上下文截断、生成不忠实、服务超时或业务任务未完成。
- 先停止扩量并按风险回滚或降级,固定失败 request_id、身份和完整版本矩阵,再从语料、Chunk、索引、查询、候选/过滤、融合/重排、final_context 到生成寻找第一个偏离点。
- 常见误区有三类:只看答案准确率、RAGAS 总分或几个成功 Demo。
- 不使用单一总分代替根因分析,LLM-as-a-Judge 不是绝对真值,门禁阈值与效果数字必须由项目实测。