外观
离线评测、在线评测和人工评审有什么区别?
3 分钟速学卡
30 秒口述: 我会用离线评测在固定数据集上快速比较候选版本,用在线评测观察真实流量下的用户与业务影响,再用人工评审校准主观质量、高风险内容和自动指标。三者不是互相替代,而是“离线阻断明显退化、灰度验证真实影响、人工解释难判样本”的组合。评测前必须定义任务、Rubric、分母、切片和统计窗口,并把模型、Prompt、数据与评测器版本全部固定。
- 本质: 离线可重复、在线看真实、人工校准难判,三者共同构成发布证据。
- 核心机制: 先定义任务、Rubric、分母、切片和统计窗口;离线门禁阻断明显退化,不能替代线上验证。
- 关键判断: 在线实验必须有护栏、停止条件和回滚;人工评审和自动 Judge 都需要一致性校准。
- 项目落地: 示例发布流程:用固定版本集比较基线与候选,先做离线质量、安全和性能门禁;通过后只给受控流量,设置最小样本量、停止条件与回滚。
- 边界与坑: “离线分数高就能上线”:离线集可能不代表真实分布和业务行为;“A/B 提升说明模型更好”:还要排除流量、产品改版和统计波动。
目录
面试官为什么问
这道题考察你是否能把“感觉不错”变成可重复的质量证据,并理解代理指标、业务指标与人类判断之间的偏差。
小白先看懂
新菜上市前,厨师先用固定食材在试吃室比较配方;之后在少量门店观察真实顾客是否购买和退单;争议口味再由评审团盲评。试吃室是离线评测,门店灰度是在线评测,评审团是人工评审。
技术上,离线集保证可重复比较,在线实验捕获真实分布和行为,人工评审校准“什么叫好”。类比忽略了用户实验风险,因此高风险变更还要有安全护栏、停止规则和回滚。
主题图与核心原理
图:教学图片|离线评测、在线评测和人工评审有什么区别?
替代文本: 围绕“离线评测、在线评测和人工评审有什么区别?”组织的中文教学图,通过分区、箭头和标签解释核心机制。

读图结论: 三者互补,任何单一分数都不能证明上线价值。
这张图片用于建立主题机制的直觉。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。
图片生成记录: model=gpt-image-2,generated=2026-07-15,prompt_version=v1,reviewed=2026-07-16,review_basis=user-confirmed;查看生成 Prompt。
图:从候选版本到线上证据的评测闭环
替代文本: 候选版本先经过固定集离线门禁,再进入小流量在线实验;人工评审校准争议样本,失败样本回流固定回归集。
图表加载中…
读图结论: 离线负责可重复比较,在线负责真实影响,人工负责校准难判质量,失败样本让三者闭环。
离线指标按任务选择,例如检索 Recall@K、引用支持率或结构化准确率;在线观察完成率、采纳、转人工、延迟、成本和业务护栏;人工评审要定义 Rubric、盲评、重复样本和评审一致性,LLM-as-a-Judge 也必须经人工校准。
项目和生产视角
示例发布流程: 用固定版本集比较基线与候选,先做离线质量、安全和性能门禁;通过后只给受控流量,设置最小样本量、停止条件与回滚;对自动指标分歧和高风险切片进行人工复核。
若没有真实在线数据,只能说已设计离线与灰度方案,不能声称业务提升。评测报告应保留样本版本、Rubric、评审器、统计区间和置信区间或不确定性说明。
常见错误回答
- “离线分数高就能上线”:离线集可能不代表真实分布和业务行为。
- “A/B 提升说明模型更好”:还要排除流量、产品改版和统计波动。
- “人工评审最准确”:评审员也有偏差,需要 Rubric、盲评和一致性检查。
递进追问
- 如何构建不会数据泄漏的固定评测集?
- LLM-as-a-Judge 怎样做偏差校准?
- 在线实验应该设置哪些护栏和停止条件?
- 人工评审一致性差时如何处理?
- 失败样本如何进入回归集又不污染测试集?
关联阅读
总结
一句话记忆: 离线可重复、在线看真实、人工校准难判,三者共同构成发布证据。
- 先定义任务、Rubric、分母、切片和统计窗口。
- 离线门禁阻断明显退化,不能替代线上验证。
- 在线实验必须有护栏、停止条件和回滚。
- 人工评审和自动 Judge 都需要一致性校准。