Skip to content

Accuracy、Precision、Recall、F1 和 AUC 怎么选?

3 分钟速学卡

30 秒口述: 我不会脱离业务代价选指标:类别较均衡且错判代价接近时可看 Accuracy;误报昂贵时重点看 Precision,漏报昂贵时重点看 Recall。F1 是 Precision 与 Recall 的调和平均,适合需要单值平衡但不表达概率校准和真实成本;ROC-AUC 衡量跨阈值排序,极不平衡时还要看 PR-AUC。最终阈值应在验证集按成本和容量选择,并在独立测试集报告混淆矩阵、切片指标和校准。

  • 本质: 先定义错判代价和使用阈值,再选能回答业务问题的指标组合。
  • 核心机制: Accuracy 适合类别和错误成本相对均衡的概览;Precision 管误报,Recall 管漏报,F1 做对称折中。
  • 关键判断: AUC 看排序,不替代阈值与概率校准;必须报告混淆矩阵、切片表现和样本基率。
  • 项目落地: 示例项目:风险审核先定义漏放和误杀成本、人工审核容量及合规底线,在验证集扫描阈值,找到满足最低 Recall 的方案中 Precision 较高者。测试集按渠道、地区和新老用户切片,并同时报告样本量与置信区间。
  • 边界与坑: “类别不平衡就不能用 Accuracy”:不是绝对不能用,而是不能单独使用;“F1 越高业务越好”:F1 默认等权,可能不符合错误成本。

目录

面试官为什么问

面试官真正想看的是候选人能否把指标连接到混淆矩阵、阈值、类别基率和业务损失,而不是背公式。

小白先看懂

机场安检要找违禁品:Recall 高意味着尽量不漏掉危险物;Precision 高意味着被拦下的人大多确有问题,减少无辜旅客成本;Accuracy 是全部判断中正确的比例,但危险品极少时“全部放行”也可能看起来很高。F1 在查全和查准间折中,AUC 则看系统能否把高风险旅客整体排在前面。

类比没有给出不同错误的货币、合规和容量成本,也没有表达概率是否可信;实际阈值必须由业务约束决定。

图:教学图片|Accuracy、Precision、Recall、F1 和 AUC 怎么选?

替代文本: 16:9 中文教学信息图,左侧机场安检形成 TP、FP、FN、TN 四格,右侧是按业务风险选择指标的清晰分区。

Accuracy、Precision、Recall、F1 和 AUC 怎么选?教学图片

读图结论: 误报贵看 Precision,漏报贵看 Recall。AUC 不替代部署阈值。

这张图片用于用安检场景解释分类指标与业务代价。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:从混淆矩阵到指标选择

替代文本: 真实正负与预测正负形成 TP、FP、FN、TN;误报成本指向 Precision,漏报成本指向 Recall,整体正确指向 Accuracy,排序能力指向 AUC。

图表加载中…

读图结论: 指标由错误成本和使用方式决定;同一个模型在不同阈值下会得到不同 Precision 和 Recall。

核心原理

Accuracy=TP+TNTP+FP+FN+TNPrecision=TPTP+FP,Recall=TPTP+FNF1=2PrecisionRecallPrecision+Recall

ROC-AUC 可理解为随机抽取一对正负样本时,正样本得分高于负样本的概率;PR-AUC 对少数正类的查准—查全变化更敏感。AUC 不给出部署阈值,也不保证概率校准。

项目和生产视角

示例项目: 风险审核先定义漏放和误杀成本、人工审核容量及合规底线,在验证集扫描阈值,找到满足最低 Recall 的方案中 Precision 较高者。测试集按渠道、地区和新老用户切片,并同时报告样本量与置信区间。

上线后监控基率、阈值、混淆矩阵代理指标和校准漂移。本文没有真实业务代价或指标数据,不声称某指标普遍最优。

常见错误回答

  • “类别不平衡就不能用 Accuracy”:不是绝对不能用,而是不能单独使用。
  • “F1 越高业务越好”:F1 默认等权,可能不符合错误成本。
  • “AUC 高就能上线”:还需阈值、校准、切片、延迟和容量验证。
  • “Precision 和 Recall 可以同时任意提高”:固定模型下通常受阈值权衡约束。

递进追问

  1. 为什么极不平衡任务更关注 PR 曲线?
  2. F1 与 Fβ 的选择依据是什么?
  3. AUC 高但线上效果差可能有哪些原因?
  4. 如何在人工审核容量固定时选阈值?
  5. 多分类任务的 micro、macro 和 weighted 平均有什么区别?

关联阅读

总结

一句话记忆: 先定义错判代价和使用阈值,再选能回答业务问题的指标组合。

  • Accuracy 适合类别和错误成本相对均衡的概览。
  • Precision 管误报,Recall 管漏报,F1 做对称折中。
  • AUC 看排序,不替代阈值与概率校准。
  • 必须报告混淆矩阵、切片表现和样本基率。