Skip to content

离线评测、在线评测和人工评审有什么区别?

3 分钟速学卡

30 秒口述: 我会用离线评测在固定数据集上快速比较候选版本,用在线评测观察真实流量下的用户与业务影响,再用人工评审校准主观质量、高风险内容和自动指标。三者不是互相替代,而是“离线阻断明显退化、灰度验证真实影响、人工解释难判样本”的组合。评测前必须定义任务、Rubric、分母、切片和统计窗口,并把模型、Prompt、数据与评测器版本全部固定。

  • 本质: 离线可重复、在线看真实、人工校准难判,三者共同构成发布证据。
  • 核心机制: 先定义任务、Rubric、分母、切片和统计窗口;离线门禁阻断明显退化,不能替代线上验证。
  • 关键判断: 在线实验必须有护栏、停止条件和回滚;人工评审和自动 Judge 都需要一致性校准。
  • 项目落地: 示例发布流程:用固定版本集比较基线与候选,先做离线质量、安全和性能门禁;通过后只给受控流量,设置最小样本量、停止条件与回滚。
  • 边界与坑: “离线分数高就能上线”:离线集可能不代表真实分布和业务行为;“A/B 提升说明模型更好”:还要排除流量、产品改版和统计波动。

目录

面试官为什么问

这道题考察你是否能把“感觉不错”变成可重复的质量证据,并理解代理指标、业务指标与人类判断之间的偏差。

小白先看懂

新菜上市前,厨师先用固定食材在试吃室比较配方;之后在少量门店观察真实顾客是否购买和退单;争议口味再由评审团盲评。试吃室是离线评测,门店灰度是在线评测,评审团是人工评审。

技术上,离线集保证可重复比较,在线实验捕获真实分布和行为,人工评审校准“什么叫好”。类比忽略了用户实验风险,因此高风险变更还要有安全护栏、停止规则和回滚。

主题图与核心原理

图:教学图片|离线评测、在线评测和人工评审有什么区别?

替代文本: 围绕“离线评测、在线评测和人工评审有什么区别?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

离线评测、在线评测和人工评审有什么区别?教学图片

读图结论: 三者互补,任何单一分数都不能证明上线价值。

这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:从候选版本到线上证据的评测闭环

替代文本: 候选版本先经过固定集离线门禁,再进入小流量在线实验;人工评审校准争议样本,失败样本回流固定回归集。

图表加载中…

读图结论: 离线负责可重复比较,在线负责真实影响,人工负责校准难判质量,失败样本让三者闭环。

离线指标按任务选择,例如检索 Recall@K、引用支持率或结构化准确率;在线观察完成率、采纳、转人工、延迟、成本和业务护栏;人工评审要定义 Rubric、盲评、重复样本和评审一致性,LLM-as-a-Judge 也必须经人工校准。

项目和生产视角

示例发布流程: 用固定版本集比较基线与候选,先做离线质量、安全和性能门禁;通过后只给受控流量,设置最小样本量、停止条件与回滚;对自动指标分歧和高风险切片进行人工复核。

若没有真实在线数据,只能说已设计离线与灰度方案,不能声称业务提升。评测报告应保留样本版本、Rubric、评审器、统计区间和置信区间或不确定性说明。

常见错误回答

  • “离线分数高就能上线”:离线集可能不代表真实分布和业务行为。
  • “A/B 提升说明模型更好”:还要排除流量、产品改版和统计波动。
  • “人工评审最准确”:评审员也有偏差,需要 Rubric、盲评和一致性检查。

递进追问

  1. 如何构建不会数据泄漏的固定评测集?
  2. LLM-as-a-Judge 怎样做偏差校准?
  3. 在线实验应该设置哪些护栏和停止条件?
  4. 人工评审一致性差时如何处理?
  5. 失败样本如何进入回归集又不污染测试集?

关联阅读

总结

一句话记忆: 离线可重复、在线看真实、人工校准难判,三者共同构成发布证据。

  • 先定义任务、Rubric、分母、切片和统计窗口。
  • 离线门禁阻断明显退化,不能替代线上验证。
  • 在线实验必须有护栏、停止条件和回滚。
  • 人工评审和自动 Judge 都需要一致性校准。