外观
LLM 预训练、微调与对齐专项面试题
目录
1. 使用说明
- 对应知识主题:LLM 预训练、微调与对齐;
- 角色:资深面试官从训练阶段追问到偏好、安全与发布,高级技术应聘者负责说明目标函数、数据和显存边界;
- 回答顺序:先给 1~3 句专业短答,再用生活化解释;选型题必须先判断是在补知识、改行为还是调偏好;
事实红线| LoRA 只减少可训练参数相关状态,不能按参数比例推断总显存;训练 Loss 下降不能代替独立质量和安全评测;
- 题目数量:7 题,严格覆盖 L1~L7。
阅读图例|
L1~L2概念与边界 ·L3~L4原理与实现 ·L5工程 ·L6架构 ·L7项目复盘答案层级| 必答结论 · 小白解释 · 加分项 · 高频误区 · 下一问
2. 递进路线
图:LLM 预训练、微调与对齐 L1~L7 递进路线
替代文本: L1 预训练/SFT/偏好对齐 → L2 Prompt/RAG/继续预训练/微调边界 → L3 CLM 与 SFT Mask → L4 LoRA 低秩实现与显存 → L5 RLHF/DPO 偏好工程 → L6 数据、评测和发布体系 → L7 示例客服项目复盘。
图表加载中…
读图结论: 蓝色阶段建立概念与边界,紫色阶段进入原理与实现,橙色和青色阶段验证工程与架构能力,绿色阶段用项目证据完成复盘。
题链先判断不同阶段“学什么”,再推导训练目标与 LoRA,随后进入偏好数据、遗忘、安全回归和可回滚发布,避免只会背方法名称。
图:权重内训练阶段与模型外 RAG 增强的职责边界
替代文本: 常见权重内路线由通用语料驱动预训练形成 Base Model,再由指令示范驱动 SFT 形成任务遵循能力,最后用偏好数据经 DPO 或 RLHF 调整相对偏好;运行时的用户问题则在模型外经过 RAG 检索和 Prompt/Schema 上下文组装,再交给已发布模型推理,检索证据不会自动写入模型权重。
图表加载中…
读图结论: 预训练、SFT 和偏好对齐改变的是权重中的能力或行为倾向;RAG 在推理时提供可更新、可引用的外部证据,两类方案可以组合,但不能互相冒充。
图中的训练顺序表示常见工程路径,不代表所有项目都必须完整执行三阶段;是否继续预训练、做 SFT 或偏好对齐要由数据、目标和独立评测决定。RAG 位于模型权重之外,因此知识库更新可即时影响后续检索上下文,却不会永久改写模型参数,也仍需权限、引用和业务校验。
3. 一问一答
第 1 题|L1 概念|预训练、SFT 和偏好对齐分别让模型学什么?
核心考察点|训练阶段、数据与行为目标
面试官提问
请从数据、目标和主要改变三个维度区分。
30 秒专业短答
预训练用大规模语料和自监督目标学习通用语言建模能力;监督微调(Supervised Fine-Tuning,SFT)用“指令—回答”示范学习任务遵循和输出行为;偏好对齐用 chosen/rejected 或奖励信号调整相对偏好、安全与帮助性。三者监督信号不同,后两个阶段都不自动保证事实正确或绝对安全。
小白解释
预训练像长期阅读建立语言和常识底座,SFT 像老师示范“遇到这种题应该怎样答”,偏好对齐像在两个都能答的版本里告诉学生哪一个更符合要求。
- 合格线| 三阶段的数据和目标分开,不把所有训练都叫微调;
- 加分项| 指出继续预训练仍常用自监督目标,SFT 模仿示范,偏好目标可能冲突且分布外会失败;
- 高频误区| 把 SFT 等同偏好对齐,或说对齐完成后模型绝对安全;
- 下一问| 知道各阶段作用后,继续判断 Prompt、RAG、继续预训练和微调应如何选。
第 2 题|L2 边界|Prompt、RAG、继续预训练、LoRA 和全量微调如何选择?
核心考察点|知识、行为、数据与成本的选型边界
面试官提问
企业知识每天更新但输出格式要稳定,你会怎样组合方案?
30 秒专业短答
临时任务说明先用 Prompt/Few-shot;严格机器格式优先 Structured Outputs、JSON Schema、Tool Schema 与运行时校验;动态且需引用的事实优先 RAG;大量无标注领域语料可评估继续预训练;稳定行为、语气或任务映射可采用 SFT,再根据容量、预算和部署方式选择全参数更新或 LoRA/QLoRA 等参数高效微调(PEFT)。企业知识每日变化时由 RAG 管事实和引用,格式由确定性 Schema 管边界;只有行为基线仍不足且已有可靠数据与评测时,再考虑采用 LoRA 的 SFT。
小白解释
临时要求像当天工作便签,最新制度要去资料库查,长期接触领域材料像进修,统一客服说法像专项培训;不能每天因为制度更新就把员工重新训练一遍。
- 合格线| 动态事实用 RAG,稳定行为用 SFT/PEFT,继续预训练与全量微调有不同成本;
- 加分项| 补充权限、引用、删除、数据许可、延迟、回滚和 Prompt 基线;
- 高频误区| 用微调承载频繁变化事实,或把 RAG 与微调说成互斥二选一;
- 下一问| 方案选对后,继续检查因果语言模型和 SFT 的实际损失如何计算。
第 3 题|L3 原理|因果语言模型和 SFT 的 Loss 如何构造?
核心考察点|自回归目标、Label Shift、Padding 与回答 Mask
面试官提问
为什么 Labels 要 Shift,SFT 为什么通常 Mask Prompt Token?
30 秒专业短答
因果语言模型分解为
p(x1:T)=∏t p(xt|x<t),用前缀预测下一个 Token,因此位置t的 Logit 与后一个标签对齐,并用有效 Token Mask 排除 Padding。SFT 仍常用交叉熵,但通常把 System/User Prompt 对应标签设为ignore_index,只让 Assistant 回答 Token 贡献损失。
小白解释
学生每次看到前面文字后猜下一个字;做客服示范训练时,题目只是条件,真正要评分的是学生写的答案,不应要求他把题干也复述一遍。
- 合格线| 下一 Token 条件概率、Shift、有效 Token 和 Prompt Mask 语义正确;
- 加分项| 指出 Chat Template、特殊 Token 和 EOS 错误会造成角色串线、复述 Prompt 或不会停止;
- 高频误区| 把当前位置 Logit 与当前位置输入当同一预测目标,或让 Padding/全部 Prompt 贡献 Loss;
- 下一问| 训练目标明确后,进一步推导 LoRA 怎样限制权重更新以及它真正节省什么。
第 4 题|L4 实现|LoRA 与 QLoRA 如何工作,分别节省哪些训练资源?
核心考察点|低秩公式、QLoRA 基座存储、参数量、梯度流与显存构成
面试官提问
写出低秩矩阵形状和参数量,并区分可训练状态、基座权重、激活和 Attention 显存。
30 秒专业短答
对
W0∈R^{d_out×d_in},标准 LoRA 冻结基座并学习ΔW=(α/r)BA,其中A∈R^{r×d_in}、B∈R^{d_out×r},可训练参数为r(d_in+d_out)。QLoRA 进一步以低位表示存放冻结基座,并在计算时按实现进行反量化或混合精度运算,LoRA Adapter 通常保持较高训练精度。LoRA 主要减少基座梯度和优化器状态,QLoRA 还减少基座驻留内存;二者都不会消除完整前向、必要激活、序列 Attention 和临时工作区,实际显存与速度必须按目标架构、量化格式、算子和硬件实测。
小白解释
不重造整面墙,而是用两块窄模板组合成一层小改动,确实少改很多砖;但施工现场、脚手架、材料运输和原墙本身仍要占空间,不能说改动只有 1%,总场地就只剩 1%。
- 合格线| 矩阵形状、秩上界、参数量、冻结基座及 QLoRA 额外量化边界正确;
- 加分项| 说明目标模块、rank、序列长度、batch、精度与 Activation Checkpointing 共同决定显存和效果;
- 高频误区| 把 LoRA 当量化,或用可训练参数减少比例直接推算显存和速度;
- 下一问| SFT(可采用 LoRA 等 PEFT 参数化)学会模仿示范后,继续比较经典 RLHF 与 DPO 如何学习偏好。
第 5 题|L5 工程|经典 RLHF 与 DPO 有何区别,偏好训练有哪些风险?
核心考察点|偏好优化流程、参考约束和失败模式
面试官提问
请说明奖励模型、参考策略、chosen/rejected 和长度偏差。
30 秒专业短答
经典 InstructGPT 风格 RLHF 通常先训练奖励模型,再用 PPO 等方法结合参考策略 KL 约束优化。标准 DPO 对同一 Prompt 的 chosen
y_w与 rejectedy_l定义:序列 Log Probability 应按实现只聚合有效回答 Token,并明确求和、平均及长度处理。DPO 省去显式奖励模型和在线 RL 采样,但仍依赖参考策略、偏好数据、
β、长度分布和独立评测;交换 chosen/rejected、错误 Mask 或长度偏差都会把目标训反或诱发投机。
小白解释
RLHF 像先训练一位裁判,再让选手根据裁判分数反复训练;DPO 像直接给选手成对样例,告诉他两个答案哪个更好。省掉裁判不等于省掉高质量比较数据和赛后检查。
- 合格线| RM+PPO 与直接偏好目标的区别,DPO 仍使用参考策略;
- 加分项| 分长度切片、检查 chosen/rejected 顺序和序列 LogP 聚合,并将通用能力、安全和拒答分别评测;
- 高频误区| 说 DPO 没有参考约束或零成本,或把离线胜率上升直接当真实质量提升;
- 下一问| 训练方法明确后,需要用数据治理、独立评测和可回滚制品阻止遗忘与安全回归。
第 6 题|L6 架构|如何设计可追溯、可回滚的 LLM 训练与发布体系?
核心考察点|数据谱系、制品版本、分层评测和发布治理
面试官提问
从数据、模板、Checkpoint、评测和灰度说明完整证据链。
30 秒专业短答
我会绑定基座、Tokenizer、聊天模板、特殊 Token、数据清单/哈希、切分、Label Mask、代码、随机状态、目标模块、Checkpoint 和训练配置,并分别建立能力、领域、事实、安全与历史回归集。候选先离线门禁,再影子/灰度,服务记录基座、Adapter、Prompt、索引与策略版本,任何退化都能切回旧组合。
小白解释
像每次培训都保存教材版本、学员名单、课程安排、考试卷和结业证书;新培训班先小范围试讲,如果专业能力或安全规范退步,就恢复上一版课程。
- 合格线| 数据/Tokenizer/模板/权重/Adapter/评测共同版本化,离线门禁、灰度、回滚;
- 加分项| 近重复泄漏审计、隐私删除路径、合并前后 Logit 对照、训练—服务精度一致和安全红队集;
- 高频误区| 只保存 Adapter 文件,用训练 Loss 作为上线门禁,或不保留旧基座与路由;
- 下一问| 最后用源文档中的企业客服示例说明 RAG、SFT 与偏好对齐怎样组合。
第 7 题|L7 项目复盘|企业客服助手应如何组合 RAG、LoRA 和偏好优化?
核心考察点|知识、行为、偏好和安全边界的组合设计
面试官提问
产品知识每天变化,格式与语气要稳定,敏感问题要遵循政策;请给出方案和证据边界。
30 秒专业短答
这是源文档中的示例项目:产品事实由版本化 RAG 提供并附引用;结构化回复与工具参数由 Schema、Tool Calling 和业务校验保证;稳定语气和任务行为可评估采用 LoRA 的 SFT;只有存在可靠 chosen/rejected 标注时才评估 DPO。权限、敏感信息和人工升级仍由应用层控制;仓库没有训练或线上数据,不能声称准确率、胜率、成本或业务提升。
小白解释
客服每天查最新产品手册,用专项培训统一答复格式,再通过成对示例学习哪种语气更合适;但退款权限和敏感操作仍由公司系统审批,不能交给培训后的员工自行决定。
- 合格线| RAG 管动态事实,确定性 Schema 管结构边界,采用 LoRA 的 SFT 适配稳定行为,DPO 需要可比较的偏好数据,应用层保留权限与安全控制;
- 加分项| 按会话/时间切分,保留拒答与转人工正例,监控引用、格式、拒答和通用能力回归;
- 高频误区| 把所有事实写进 Adapter,或把对齐权重当权限和安全系统;
- 下一问| 本组题结束;后续应通过 Label Mask、LoRA 合并和偏好对故障注入验证掌握。
4. 自测与评分
- [ ] 用一分钟说明预训练、SFT 和偏好对齐的不同监督信号;
- [ ] 构造一条 Chat 样本并标出 Shift、Padding Mask 和 Prompt Mask;
- [ ] 给定
d_in、d_out、r计算 LoRA 参数量并列出其余显存项; - [ ] 交换 chosen/rejected 或删除 EOS,说明预期故障和检测方式;
- [ ] 按准确性、原理深度、工程意识、项目表达、沟通结构各 0~5 分评分;
- [ ] 若声称 LoRA 总显存按参数同比下降,准确性不得判为优秀。
5. 事实边界与参考资料
- 单一事实源:LLM 预训练、微调与对齐;
- 源文档依据包括 LoRA、QLoRA、InstructGPT/RLHF、DPO 原始论文和 Hugging Face PEFT、TRL SFT/DPO 官方文档;
- 具体目标模块、rank、显存、训练效果和 DPO 超参数必须基于目标架构、实现与固定评测实测;
当前无法确认| 示例客服系统的训练数据、模型、Adapter、质量、安全、延迟、成本和业务收益。
6. 总结
一句话记忆: 预训练学通用分布,SFT 学示范行为,偏好优化学相对取舍,RAG 则在推理时提供动态事实。
- CLM 预测下一个 Token,SFT 通常只让回答 Token 贡献 Loss;
- LoRA 用低秩增量减少可训练状态,但不会同比消除基座与激活显存;
- RLHF 和 DPO 流程不同,都依赖高质量偏好数据与独立评测;
- 动态知识、稳定行为和偏好目标应使用不同手段组合;
- 发布必须覆盖能力、安全、版本、灰度和回滚证据。