Skip to content

传统机器学习与评测 极简一问一答

定位| 传统机器学习与评测 一分钟速答页。每章固定 10 题,只保留结论、机制、边界与验证关键词;单个回答控制在 10~60 秒。

1. 怎么使用

本页重点| L1 概念 → L2 边界 → L3 原理 → L4 实现 → L5 工程 → L6 架构 → L7 复盘 → 误区、验证、证据强化。不会展开时,再进入正式主题或专项题库。

图:传统机器学习与评测 十题极简脑图

替代文本: 传统机器学习与评测从 L1 概念和 L2 边界,依次进入 L3 原理、L4 实现、L5 工程、L6 架构与 L7 项目复盘,再用误区、最小自测和证据边界三题强化。

图表加载中…

读图结论: 掌握 传统机器学习与评测 不能停在定义;先顺着七层链路说清机制与工程,再用误区、自测和证据边界确认没有虚假掌握。

2. 极简一问一答

Q001|传统机器学习为什么仍然重要?

传统机器学习包含线性、核方法、树与集成等归纳偏置不同的模型,并不等于“过时模型”。在小样本、强表格结构或特征已有业务语义时,它们往往能提供更高效的基线;线性模型和受限浅树通常较易解释,部署成本仍取决于模型规模、特征流水线与延迟约束。

Q002|逻辑回归为什么用于分类,它真正线性的是什么?

逻辑回归假设正类对数几率 log(p/(1-p))=wᵀx+b 对输入线性,经 Sigmoid 将线性得分映射为 (0,1) 概率,再由业务阈值转成动作。线性的是 Log-odds 和原始特征空间中的决策边界,不是概率本身;阈值也不是模型固定真理。

Q003|决策树、Bagging、随机森林和 Boosting 的本质区别是什么?

决策树用特征划分递归降低节点不纯度,深树通常偏差较低但方差较高;Bagging 对不同 Bootstrap 样本训练基学习器并聚合,在模型具有足够多样性时主要降低方差;随机森林再随机选择候选特征以降低树间相关性。梯度 Boosting 串行拟合当前损失对模型输出的负梯度,通常逐步降低拟合偏差,但最终偏差与方差仍受树深、学习率、轮数、子采样、正则化和噪声共同影响。

Q004|如何实现类别不平衡分类的训练评测流水线?

先按上线时间或实体边界切分数据;缺失处理、编码、缩放、类别权重和重采样只在训练集拟合。验证集依据混淆矩阵计算 Precision=TP/(TP+FP)Recall=TP/(TP+FN) 和 F1,并结合容量或成本选阈值;方案冻结后由测试集终评。验证和测试通常应反映部署先验;若因稀有正类采用抽样评测,必须使用抽样权重或先验校正,并保留代表真实流量的独立验收集。

Q005|AUC 很高但线上效果差,如何定位?

AUC 主要反映排序,不能证明概率校准、业务阈值或容量约束正确。我会先核对正类、标签窗口、阈值和业务动作,再比对离在线特征的值、顺序、单位、缺失与版本,随后检查校准、先验/输入漂移和错误切片,最后才评估模型本身。

Q006|如何设计可发布、可回滚的分类系统?

我会让缺失处理、编码、缩放、模型、校准器、标签映射和阈值形成不可分割的版本制品,训练内拟合、验证集选方案、测试集终评。发布通过黄金样本核对离在线一致性,再影子或灰度;线上按数据、模型、决策和系统四层监控,并保留旧制品与一键回退。

Q007|AI 视频风险分流项目应如何选择模型并验收?

这是源文档中的示例项目:先用逻辑回归验证特征和标签是否有信号,再根据非线性残差比较限制深度的树、随机森林或 Boosting;验证集按人工容量和误判代价选阈值,测试集报告混淆矩阵、校准和时间/创作者/语言切片。仓库没有真实实现与数据,不能声称任何效果提升。

Q008|这个专题最常见的误区是什么?

常见误区有三类:按模型新旧排名,或认为传统模型必然比深度学习差;只换成 F1 就认为问题解决,或对验证/测试抽样后不做校正便宣称代表真实流量;只保存模型文件,或模型升级后继续使用旧阈值和旧校准器。

Q009|怎样做最小自测?

最小自测分三步:手写逻辑回归 Log-odds、Sigmoid、交叉熵和梯度的关系;画出决策树、Bagging、随机森林和 Boosting 的因果区别;用一份不平衡混淆矩阵解释 Accuracy、Precision、Recall 和阈值。

Q010|回答这个专题时,证据边界是什么?

不把某个模型说成普遍最优,不用单一 AUC/F1 代替完整评测,不编造示例项目指标。

3. 总结

一句话记忆: 传统机器学习包含线性、核方法、树与集成等归纳偏置不同的模型,并不等于“过时模型”。

  • 传统机器学习包含线性、核方法、树与集成等归纳偏置不同的模型,并不等于“过时模型”。
  • AUC 主要反映排序,不能证明概率校准、业务阈值或容量约束正确。
  • 常见误区有三类:按模型新旧排名,或认为传统模型必然比深度学习差。
  • 不把某个模型说成普遍最优,不用单一 AUC/F1 代替完整评测,不编造示例项目指标。