Skip to content

AI 学习框架与数据集划分 极简一问一答

定位| AI 学习框架与数据集划分 一分钟速答页。每章固定 10 题,只保留结论、机制、边界与验证关键词;单个回答控制在 10~60 秒。

1. 怎么使用

本页重点| L1 概念 → L2 边界 → L3 原理 → L4 实现 → L5 工程 → L6 架构 → L7 复盘 → 误区、验证、证据强化。不会展开时,再进入正式主题或专项题库。

图:AI 学习框架与数据集划分 十题极简脑图

替代文本: AI 学习框架与数据集划分从 L1 概念和 L2 边界,依次进入 L3 原理、L4 实现、L5 工程、L6 架构与 L7 项目复盘,再用误区、最小自测和证据边界三题强化。

图表加载中…

读图结论: 掌握 AI 学习框架与数据集划分 不能停在定义;先顺着七层链路说清机制与工程,再用误区、自测和证据边界确认没有虚假掌握。

2. 极简一问一答

Q001|AI、ML、DL、LLM、RAG 和 Agent 是什么关系?

人工智能(Artificial Intelligence,AI)是总称,机器学习(Machine Learning,ML)是从数据学习规律的一类方法,深度学习(Deep Learning,DL)是以多层神经网络为核心的 ML 子类,LLM 是 DL 模型。RAG 通过外部检索向模型提供证据,Agent 则在模型外增加状态、工具和受控循环,它们主要是系统组织方式。

Q002|训练集、验证集和测试集为什么不能混用?

训练集拟合模型参数和预处理统计量,验证集选择模型、超参数、阈值和早停轮次,测试集只在方案冻结后做独立终评。反复根据测试结果修改方案,会让方案间接适配测试集,使其不再能可信估计未见数据表现。

Q003|什么时候不能使用普通随机切分?

普通随机切分依赖样本近似独立同分布;同一用户、患者、设备或视频族内样本高度相关时应保护组边界,预测未来时应保护时间因果。类别分层只能维持标签比例,不能修复实体或时间泄漏;多约束并存时优先保护最接近上线的独立单位。

Q004|如何实现可复现的三路切分并防止泄漏?

我会先按上线目标确定时间或实体硬边界;仅在近似 i.i.d. 分类任务中,才按标签分桶、用固定随机状态打乱,并通过明确的取整规则把每桶分配到三组。输出不可变 sample_id 清单,检查互斥、全集覆盖、组完整、时间顺序和小类别空集,再只用训练集 fit 预处理器;桶式分配通常为 O(n),若先全局排序则包含 O(n log n)

Q005|离线指标很好、线上效果明显下降,如何排查?

我会依次核对线上标签、阈值和过滤口径,检查特征值、单位、时间窗口与版本,再审计泄漏、输入/标签漂移和离在线服务一致性,最后才判断模型容量或优化不足。每一步都用固定失败样本和版本证据验证,而不是凭总体分数猜根因。

Q006|如何设计可追溯的机器学习实验与发布体系?

我会用一个不可变实验清单绑定原始数据快照、标签版本、特征定义、切分清单、预处理器、代码/依赖、随机状态、模型、阈值和评测报告;发布制品再绑定同一清单并记录线上版本。新数据进入下一版训练,不回头修改当前隔离测试集。

Q007|如何为 AI 视频内容风险分类设计可信评测?

这是源文档中的示例项目:应先定义评测目标。评估新创作者泛化时,创作者组必须在所有集合间互斥;评估未来内容时按时间前推,但同一原视频族仍不能跨集合,冲突样本需整组归属或从一侧剔除。输入只允许预测时刻可见的特征;当前仓库没有实现和实测,不能声称任何准确率、召回率或业务收益。

Q008|这个专题最常见的误区是什么?

常见误区有三类:把所有 AI 等同于 LLM,或把 RAG、Agent 当成模型架构;为了标签比例破坏时间或组边界,在全量数据上标准化,或认为随机种子足以复现全部流水线;只版本化模型权重,或用同一实验名覆盖不同数据内容。

Q009|怎样做最小自测?

最小自测分三步:只看七个面试官问题,每题先在 30 秒内给出结论;检查是否能区分模型层与系统层,并准确说出训练、验证、测试职责;为一个同时含时间与实体关联的任务画出切分方案,并证明集合互斥。

Q010|回答这个专题时,证据边界是什么?

数据比例、模型效果和项目指标没有证据时不猜;第 7 题只能作为示例项目方案。

3. 总结

一句话记忆: 人工智能(Artificial Intelligence,AI)是总称,机器学习(Machine Learning,ML)是从数据学习规律的一类方法,深度学习(Deep Learning,DL)是以多层神经网络为核心的 ML 子类,LLM 是 DL 模型。

  • 人工智能(Artificial Intelligence,AI)是总称,机器学习(Machine Learning,ML)是从数据学习规律的一类方法,深度学习(Deep Learning,DL)是以多层神经网络为核心的 ML 子类,LLM 是 DL 模型。
  • 我会依次核对线上标签、阈值和过滤口径,检查特征值、单位、时间窗口与版本,再审计泄漏、输入/标签漂移和离在线服务一致性,最后才判断模型容量或优化不足。
  • 常见误区有三类:把所有 AI 等同于 LLM,或把 RAG、Agent 当成模型架构。
  • 数据比例、模型效果和项目指标没有证据时不猜。