Skip to content

如何评估一个 RAG 系统?

3 分钟速学卡

30 秒口述: 我不会只测最终答案,而会把 RAG 评测拆成数据/索引、候选召回、重排、最终上下文、生成/引用和系统/成本六层。离线用带证据标注的问题集测 Recall@K、MRR/NDCG、上下文 Precision、答案正确性和引用支持率,线上再看空召回、延迟、降级、成本与人工反馈。评测集要按租户、查询类型、难度和版本分桶,并固定回放,才能知道一次改动把正确证据改善或破坏在了哪一层。

  • 本质: 好的 RAG 评测能同时判断结果好不好,并指出正确证据在哪一层消失。
  • 核心机制: 端到端指标与分阶段指标缺一不可;黄金集要包含问题、答案和证据标注。
  • 关键判断: LLM Judge 必须经过人工校准;质量、延迟、成本、安全和版本共同构成发布门禁。
  • 项目落地: 示例方案:建立包含标准问题、可接受答案、必要证据 Chunk ID、租户和难度的黄金集;每次索引或模型变更都重放并比较质量、P95 延迟与成本。
  • 边界与坑: “看回答准确率就够了。” 无法区分检索、上下文还是生成失败;“用一个大模型打分即可。” Judge 也有偏差,需要人工校准。

目录

面试官为什么问

这道题考察指标定义、分层归因、数据集治理和上线闭环。只报“准确率”通常暴露口径不清。

小白先看懂

评估快递服务不能只问“包裹到了吗”:还要检查仓库是否有货、分拣是否选对、路线是否合理、派送是否准时、签收证据是否可信以及成本是否可接受。

快递环节RAG 评测层
仓库货物完整数据与索引新鲜度
分拣选到正确包裹Recall@K
排序优先级正确MRR/NDCG
送到正确地址答案正确性
签收单可核验引用支持率
时间与费用延迟、可用性、成本

专业上需要端到端指标和分阶段诊断指标并存。类比忽略了问题可能多答案、证据冲突以及人工标注不一致。

主题教学图片

图:教学图片|如何评估一个 RAG 系统?

替代文本: 围绕“如何评估一个 RAG 系统?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

如何评估一个 RAG 系统?教学图片

读图结论: 分层评测,才能找到正确证据首次消失的位置。

这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:架构|RAG 六层评测看板

替代文本: 从数据索引、召回排序、上下文、答案引用到系统成本形成分层看板,统一由版本化问题集和线上反馈驱动。

图表加载中…

读图结论: RAG 评测不是一个总分,而是一组能定位证据在哪层丢失的指标体系。

图中离线标注集负责可重复比较,线上反馈负责发现分布外问题;二者不能互相替代。发布门禁应绑定模型、语料、索引、检索和 Prompt 版本。

核心原理

先定义相关证据集合,再计算 Recall@K=前K个候选覆盖的相关证据数/全部相关证据数。MRR 关注第一个正确证据的位置,NDCG 适合多级相关性;答案层需区分正确性、忠实性与引用支持。

LLM-as-a-Judge 可扩大评测规模,但必须用人工标注抽检其偏差、位置敏感和版本漂移。业务关键问题应保留确定性规则与人工复核。

项目和生产视角

示例方案: 建立包含标准问题、可接受答案、必要证据 Chunk ID、租户和难度的黄金集;每次索引或模型变更都重放并比较质量、P95 延迟与成本。线上采样低置信、无引用和用户点踩案例回灌,但先去重并审查隐私。

没有真实数据时应写“设计评测方案”,不能虚构 Recall 或业务提升。生产监控还应覆盖撤权传播延迟、版本混用和正确证据首次消失层。

常见错误回答

  • “看回答准确率就够了。” 无法区分检索、上下文还是生成失败。
  • “用一个大模型打分即可。” Judge 也有偏差,需要人工校准。
  • “离线提升就可以上线。” 还要验证线上延迟、成本、降级和真实分布。

递进追问

  1. Recall@K 和 Precision@K 分别反映什么?
  2. 如何构造不会数据泄漏的黄金问题集?
  3. 多个证据都可回答时怎样标注?
  4. 如何校准 LLM-as-a-Judge?
  5. 索引升级的发布门禁应包含哪些指标?

关联阅读

总结

一句话记忆: 好的 RAG 评测能同时判断结果好不好,并指出正确证据在哪一层消失。

  • 端到端指标与分阶段指标缺一不可;
  • 黄金集要包含问题、答案和证据标注;
  • LLM Judge 必须经过人工校准;
  • 质量、延迟、成本、安全和版本共同构成发布门禁。