外观
LLM 预训练、微调与对齐 极简一问一答
定位|
LLM 预训练、微调与对齐一分钟速答页。每章固定 10 题,只保留结论、机制、边界与验证关键词;单个回答控制在 10~60 秒。
1. 怎么使用
本页重点| L1 概念 → L2 边界 → L3 原理 → L4 实现 → L5 工程 → L6 架构 → L7 复盘 → 误区、验证、证据强化。不会展开时,再进入正式主题或专项题库。
- 正式主题: 03-LLM预训练微调与对齐
- 深度题库: LLM 预训练、微调与对齐专项面试题
- 阅读方式: 先遮住答案口述;答不出机制、边界或证据,再进入深度材料。
图:LLM 预训练、微调与对齐 十题极简脑图
替代文本: LLM 预训练、微调与对齐从 L1 概念和 L2 边界,依次进入 L3 原理、L4 实现、L5 工程、L6 架构与 L7 项目复盘,再用误区、最小自测和证据边界三题强化。
图表加载中…
读图结论: 掌握 LLM 预训练、微调与对齐 不能停在定义;先顺着七层链路说清机制与工程,再用误区、自测和证据边界确认没有虚假掌握。
2. 极简一问一答
Q001|预训练、SFT 和偏好对齐分别让模型学什么?
预训练用大规模语料和自监督目标学习通用语言建模能力;监督微调(Supervised Fine-Tuning,SFT)用“指令—回答”示范学习任务遵循和输出行为;偏好对齐用 chosen/rejected 或奖励信号调整相对偏好、安全与帮助性。三者监督信号不同,后两个阶段都不自动保证事实正确或绝对安全。
Q002|Prompt、RAG、继续预训练、LoRA 和全量微调如何选择?
临时任务说明先用 Prompt/Few-shot;严格机器格式优先 Structured Outputs、JSON Schema、Tool Schema 与运行时校验;动态且需引用的事实优先 RAG;大量无标注领域语料可评估继续预训练;稳定行为、语气或任务映射可采用 SFT,再根据容量、预算和部署方式选择全参数更新或 LoRA/QLoRA 等参数高效微调(PEFT)。企业知识每日变化时由 RAG 管事实和引用,格式由确定性 Schema 管边界;只有行为基线仍不足且已有可靠数据与评测时,再考虑采用 LoRA 的 SFT。
Q003|因果语言模型和 SFT 的 Loss 如何构造?
因果语言模型分解为
p(x1:T)=∏t p(xt|x<t),用前缀预测下一个 Token,因此位置t的 Logit 与后一个标签对齐,并用有效 Token Mask 排除 Padding。SFT 仍常用交叉熵,但通常把 System/User Prompt 对应标签设为ignore_index,只让 Assistant 回答 Token 贡献损失。
Q004|LoRA 与 QLoRA 如何工作,分别节省哪些训练资源?
对
W0∈R^{d_out×d_in},标准 LoRA 冻结基座并学习ΔW=(α/r)BA,其中A∈R^{r×d_in}、B∈R^{d_out×r},可训练参数为r(d_in+d_out)。QLoRA 进一步以低位表示存放冻结基座,并在计算时按实现进行反量化或混合精度运算,LoRA Adapter 通常保持较高训练精度。LoRA 主要减少基座梯度和优化器状态,QLoRA 还减少基座驻留内存;二者都不会消除完整前向、必要激活、序列 Attention 和临时工作区,实际显存与速度必须按目标架构、量化格式、算子和硬件实测。
Q005|经典 RLHF 与 DPO 有何区别,偏好训练有哪些风险?
经典 InstructGPT 风格 RLHF 通常先训练奖励模型,再用 PPO 等方法结合参考策略 KL 约束优化。标准 DPO 对同一 Prompt 的 chosen
y_w与 rejectedy_l定义:序列 Log Probability 应按实现只聚合有效回答 Token,并明确求和、平均及长度处理。DPO 省去显式奖励模型和在线 RL 采样,但仍依赖参考策略、偏好数据、
β、长度分布和独立评测;交换 chosen/rejected、错误 Mask 或长度偏差都会把目标训反或诱发投机。
Q006|如何设计可追溯、可回滚的 LLM 训练与发布体系?
我会绑定基座、Tokenizer、聊天模板、特殊 Token、数据清单/哈希、切分、Label Mask、代码、随机状态、目标模块、Checkpoint 和训练配置,并分别建立能力、领域、事实、安全与历史回归集。候选先离线门禁,再影子/灰度,服务记录基座、Adapter、Prompt、索引与策略版本,任何退化都能切回旧组合。
Q007|企业客服助手应如何组合 RAG、LoRA 和偏好优化?
这是源文档中的示例项目:产品事实由版本化 RAG 提供并附引用;结构化回复与工具参数由 Schema、Tool Calling 和业务校验保证;稳定语气和任务行为可评估采用 LoRA 的 SFT;只有存在可靠 chosen/rejected 标注时才评估 DPO。权限、敏感信息和人工升级仍由应用层控制;仓库没有训练或线上数据,不能声称准确率、胜率、成本或业务提升。
Q008|这个专题最常见的误区是什么?
常见误区有三类:把 SFT 等同偏好对齐,或说对齐完成后模型绝对安全;把 LoRA 当量化,或用可训练参数减少比例直接推算显存和速度;只保存 Adapter 文件,用训练 Loss 作为上线门禁,或不保留旧基座与路由。
Q009|怎样做最小自测?
最小自测分三步:用一分钟说明预训练、SFT 和偏好对齐的不同监督信号;构造一条 Chat 样本并标出 Shift、Padding Mask 和 Prompt Mask;给定
d_in、d_out、r计算 LoRA 参数量并列出其余显存项。
Q010|回答这个专题时,证据边界是什么?
LoRA 只减少可训练参数相关状态,不能按参数比例推断总显存;训练 Loss 下降不能代替独立质量和安全评测。
3. 总结
一句话记忆: 预训练用大规模语料和自监督目标学习通用语言建模能力。
- 预训练用大规模语料和自监督目标学习通用语言建模能力。
- 经典 InstructGPT 风格 RLHF 通常先训练奖励模型,再用 PPO 等方法结合参考策略 KL 约束优化。
- 常见误区有三类:把 SFT 等同偏好对齐,或说对齐完成后模型绝对安全。
- LoRA 只减少可训练参数相关状态,不能按参数比例推断总显存。