外观
传统机器学习与评测专项面试题
目录
1. 使用说明
- 对应知识主题:传统机器学习与评测;
- 角色:资深面试官从模型归纳偏置追问到生产评测,高级技术应聘者负责连接算法、指标和业务决策;
- 回答顺序:先给 1~3 句专业短答,再用生活化解释,公式和项目内容按需补充边界;
事实红线| 不把某个模型说成普遍最优,不用单一 AUC/F1 代替完整评测,不编造示例项目指标;
- 题目数量:7 题,严格覆盖 L1~L7。
阅读图例|
L1~L2概念与边界 ·L3~L4原理与实现 ·L5工程 ·L6架构 ·L7项目复盘答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问
2. 递进路线
图:传统机器学习与评测 L1~L7 递进路线
替代文本: L1 传统模型的价值 → L2 逻辑回归概率边界 → L3 树与集成原理 → L4 指标、阈值和类别不平衡 → L5 排查离线/线上退化 → L6 设计可发布分类系统 → L7 示例项目复盘。
图表加载中…
读图结论: 蓝色阶段建立概念与边界,紫色阶段进入原理与实现,橙色和青色阶段验证工程与架构能力,绿色阶段用项目证据完成复盘。
题链先检查候选人能否根据数据和约束选择基线,再要求解释概率、树和集成机制,最终落到阈值、校准、版本和线上故障。
图:从 FP/FN 业务代价选择指标与阈值
替代文本: 先定义正类、实际动作、FP 与 FN 的业务代价、类别先验和处置容量;漏报更昂贵时侧重 Recall 或偏 Recall 的 Fβ 并设 Precision 下限,误报更昂贵时侧重 Precision 或偏 Precision 的 Fβ 并设 Recall 下限,两类代价可量化时直接比较期望成本。正类稀少时补充 PR-AUC,概率参与风险或定价时检查校准,最后统一在验证集选阈值并在隔离测试集终评。
图表加载中…
读图结论: 指标选择从错误代价和业务约束出发,阈值在验证集按这些约束确定;Accuracy、F1 或 AUC 都不能脱离正类定义、先验、成本和校准单独决定上线动作。
图中 Recall、Precision、PR-AUC 和校准指标回答的是不同问题:前两者描述某个阈值下的错误结构,PR-AUC 描述跨阈值排序权衡,校准描述概率是否可信。最终决策仍应回到 FP/FN 成本、处置容量和隔离测试证据。
3. 一问一答
第 1 题|L1 概念|传统机器学习为什么仍然重要?
核心考察点|归纳偏置、数据形态和模型选择
面试官提问
在深度学习和大模型普及后,什么场景仍应优先考虑传统机器学习?
30 秒专业短答
传统机器学习包含线性、核方法、树与集成等归纳偏置不同的模型,并不等于“过时模型”。在小样本、强表格结构或特征已有业务语义时,它们往往能提供更高效的基线;线性模型和受限浅树通常较易解释,部署成本仍取决于模型规模、特征流水线与延迟约束。
小白解释
不是所有运输都要用火箭:城市送货时小货车更便宜、好维修、路线也清楚。模型选择同样要看货物、距离和成本,而不是只看技术是否新。
- 合格线| 说明传统模型在表格、小数据、解释和低成本场景的价值;
- 加分项| 提出“预训练 Embedding + 传统分类头”作为高维非结构化数据的基线;
- 高频误区| 按模型新旧排名,或认为传统模型必然比深度学习差;
- 下一问| 建立基线价值后,先深入最常见的概率分类基线——逻辑回归。
第 2 题|L2 边界|逻辑回归为什么用于分类,它真正线性的是什么?
核心考察点|逻辑回归概率建模与决策层边界
面试官提问
请解释 Logit、Sigmoid、概率和业务阈值之间的关系。
30 秒专业短答
逻辑回归假设正类对数几率
log(p/(1-p))=wᵀx+b对输入线性,经 Sigmoid 将线性得分映射为(0,1)概率,再由业务阈值转成动作。线性的是 Log-odds 和原始特征空间中的决策边界,不是概率本身;阈值也不是模型固定真理。
小白解释
模型先像秤一样把多项因素加权得到风险分,再用一条平滑刻度把分数换成概率;是否拦截还要看业务能承受多少误报,就像安检门灵敏度不是秤本身决定的。
- 合格线| Log-odds 线性、Sigmoid 概率、阈值由验证和业务代价选择;
- 加分项| 写出二元交叉熵与
Xᵀ(p-y)/n梯度,并区分排序与概率校准; - 高频误区| 说逻辑回归先做线性回归再硬截断,或默认 0.5 永远最优;
- 下一问| 线性边界表达不足时,需要理解决策树与集成学习如何引入非线性。
第 3 题|L3 原理|决策树、Bagging、随机森林和 Boosting 的本质区别是什么?
核心考察点|树模型机制、相关性、偏差与方差
面试官提问
请从划分机制、偏差—方差和训练依赖解释,而不是只说“很多棵树”。
30 秒专业短答
决策树用特征划分递归降低节点不纯度,深树通常偏差较低但方差较高;Bagging 对不同 Bootstrap 样本训练基学习器并聚合,在模型具有足够多样性时主要降低方差;随机森林再随机选择候选特征以降低树间相关性。梯度 Boosting 串行拟合当前损失对模型输出的负梯度,通常逐步降低拟合偏差,但最终偏差与方差仍受树深、学习率、轮数、子采样、正则化和噪声共同影响。
小白解释
单棵树像一位容易受样本影响的评委;Bagging 让多位看过不同抽样材料、意见不完全相同但仍可能相关的评委共同投票,随机森林还让他们关注不同证据;Boosting 则像一位老师逐轮针对当前整体扣分方向改进。
- 合格线| 树递归划分;Bagging 并行平均;随机特征去相关;Boosting 串行修正负梯度;
- 加分项| 说明增加树数只能降低不相关方差,Boosting 仍会对噪声过拟合;
- 高频误区| 认为随机森林一定不过拟合,或说 Boosting 每轮只拟合“错误标签”;
- 下一问| 模型能输出分数后,必须用正确指标和阈值把分数转成业务决策。
第 4 题|L4 实现|如何实现类别不平衡分类的训练评测流水线?
核心考察点|训练—验证—测试流水线、混淆矩阵、抽样校正与决策阈值
面试官提问
说明数据切分、重采样、指标计算、阈值选择和测试终评分别在哪一步完成。
30 秒专业短答
先按上线时间或实体边界切分数据;缺失处理、编码、缩放、类别权重和重采样只在训练集拟合。验证集依据混淆矩阵计算
Precision=TP/(TP+FP)、Recall=TP/(TP+FN)和 F1,并结合容量或成本选阈值;方案冻结后由测试集终评。验证和测试通常应反映部署先验;若因稀有正类采用抽样评测,必须使用抽样权重或先验校正,并保留代表真实流量的独立验收集。
小白解释
一千封邮件只有十封诈骗,全部判安全也有 99% 准确率,但十封全漏了。给少数类加权像训练时更重视诈骗样本,调整阈值像上线后改变报警灵敏度,两者不是一件事。
- 合格线| 训练内拟合/采样;验证集计算指标并选阈值;测试集终评;抽样评测需校正并保留代表性验收集;
- 加分项| 根据人工容量使用
Recall @ Precision≥目标或成本矩阵,并报告 Log Loss/Brier 与分概率桶校准; - 高频误区| 只换成 F1 就认为问题解决,或对验证/测试抽样后不做校正便宣称代表真实流量;
- 下一问| 即使离线指标和阈值设计合理,线上仍可能因校准、漂移或服务链路失败。
第 5 题|L5 工程|AUC 很高但线上效果差,如何定位?
核心考察点|从离线排序指标到线上决策的完整链路
面试官提问
请区分排序、校准、阈值、数据和服务问题,并给出排查顺序。
30 秒专业短答
AUC 主要反映排序,不能证明概率校准、业务阈值或容量约束正确。我会先核对正类、标签窗口、阈值和业务动作,再比对离在线特征的值、顺序、单位、缺失与版本,随后检查校准、先验/输入漂移和错误切片,最后才评估模型本身。
小白解释
排队顺序大致正确,不代表每个人的风险分值准确,也不代表入口只放多少人合适;如果线上证件读取错了,排序算法再好也会做错决定。
- 合格线| 口径、阈值、特征一致性、校准、漂移和切片逐层检查;
- 加分项| 区分 ROC-AUC 与 PR-AUC,查看概率桶、回退比例、反馈回路和模型/阈值共同版本;
- 高频误区| 继续追求更高 AUC,或不看线上 Pipeline 便直接换模型;
- 下一问| 要稳定发布,需要把预处理、模型、校准、阈值和监控打包成一个可回滚系统。
第 6 题|L6 架构|如何设计可发布、可回滚的分类系统?
核心考察点|训练/服务一致性、制品化、门禁与观测
面试官提问
从训练 Pipeline 到线上决策层,你会如何管理版本和质量门禁?
30 秒专业短答
我会让缺失处理、编码、缩放、模型、校准器、标签映射和阈值形成不可分割的版本制品,训练内拟合、验证集选方案、测试集终评。发布通过黄金样本核对离在线一致性,再影子或灰度;线上按数据、模型、决策和系统四层监控,并保留旧制品与一键回退。
小白解释
像把秤、砝码、单位换算表和报警线装成一个整套仪器,不能只换秤芯却沿用旧刻度;出厂前用标准砝码校验,灰度使用有问题就整套切回旧版本。
- 合格线| 完整 Pipeline 共同版本化,黄金样本、灰度、分层监控和回滚;
- 加分项| 加入特征契约、标签快照、按语言/来源/时间切片、阈值容量回归和失败样本入库;
- 高频误区| 只保存模型文件,或模型升级后继续使用旧阈值和旧校准器;
- 下一问| 最后用源文档示例说明从基线选择到发布验证,并明确不能声称的结果。
第 7 题|L7 项目复盘|AI 视频风险分流项目应如何选择模型并验收?
核心考察点|基线、错误分析、模型升级与证据边界
面试官提问
假设正类稀少、漏审和误拦成本不同,你会怎样从基线演进?当前仓库能证明什么?
30 秒专业短答
这是源文档中的示例项目:先用逻辑回归验证特征和标签是否有信号,再根据非线性残差比较限制深度的树、随机森林或 Boosting;验证集按人工容量和误判代价选阈值,测试集报告混淆矩阵、校准和时间/创作者/语言切片。仓库没有真实实现与数据,不能声称任何效果提升。
小白解释
先用一把透明的直尺检查数据方向是否合理,弯曲关系明显时再换更灵活的尺子;最终不是比哪把尺子名字高级,而是看固定考卷、误拦成本和不同人群上是否可靠。
- 合格线| 逻辑回归基线、非线性残差、阈值/校准、真实先验和分切片验收;
- 加分项| 补充标签版本、同源/时间切分、未知类别、生成模型版本漂移和旧模型回退;
- 高频误区| 不做基线直接上复杂模型,或把示例中的架构和指标说成已上线成果;
- 下一问| 本组题结束;应通过同一冻结切分比较模型,并记录错误类型而不是只看排名。
4. 自测与评分
- [ ] 手写逻辑回归 Log-odds、Sigmoid、交叉熵和梯度的关系;
- [ ] 画出决策树、Bagging、随机森林和 Boosting 的因果区别;
- [ ] 用一份不平衡混淆矩阵解释 Accuracy、Precision、Recall 和阈值;
- [ ] 对“AUC 高但线上差”写出逐层证据清单;
- [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
- [ ] 第 7 题不得把示例方案写成真实经历或虚构效果。
5. 事实边界与参考资料
- 单一事实源:传统机器学习与评测;
- 源文档依据包括 scikit-learn Linear Models、Decision Trees、Ensembles、Metrics、Calibration,以及 Random Forest、Gradient Boosting 和 XGBoost 原始论文;
- 模型与阈值不存在脱离数据、标签和业务代价的通用最优选择;
当前无法确认| 示例视频风险分流的代码、数据、模型效果、线上校准、延迟、成本和业务收益。
6. 总结
一句话记忆: 传统机器学习的核心是让模型归纳偏置、数据边界、概率质量和业务决策彼此对齐。
- 逻辑回归学习线性 Log-odds,树递归划分,Bagging 降方差,Boosting 逐步修正损失;
- Accuracy、AUC 和 F1 都不是万能指标,阈值必须回到业务代价;
- 采样和预处理只能在训练数据中拟合,验证选方案,测试做终评;
- 线上退化要查口径、特征、校准、漂移、版本和服务;
- 项目选型必须从简单基线与错误证据出发,不能编造效果。