Skip to content

LLM 预训练、微调与对齐 极简一问一答

定位| LLM 预训练、微调与对齐 一分钟速答页。每章固定 10 题,只保留结论、机制、边界与验证关键词;单个回答控制在 10~60 秒。

1. 怎么使用

本页重点| L1 概念 → L2 边界 → L3 原理 → L4 实现 → L5 工程 → L6 架构 → L7 复盘 → 误区、验证、证据强化。不会展开时,再进入正式主题或专项题库。

图:LLM 预训练、微调与对齐 十题极简脑图

替代文本: LLM 预训练、微调与对齐从 L1 概念和 L2 边界,依次进入 L3 原理、L4 实现、L5 工程、L6 架构与 L7 项目复盘,再用误区、最小自测和证据边界三题强化。

图表加载中…

读图结论: 掌握 LLM 预训练、微调与对齐 不能停在定义;先顺着七层链路说清机制与工程,再用误区、自测和证据边界确认没有虚假掌握。

2. 极简一问一答

Q001|预训练、SFT 和偏好对齐分别让模型学什么?

预训练用大规模语料和自监督目标学习通用语言建模能力;监督微调(Supervised Fine-Tuning,SFT)用“指令—回答”示范学习任务遵循和输出行为;偏好对齐用 chosen/rejected 或奖励信号调整相对偏好、安全与帮助性。三者监督信号不同,后两个阶段都不自动保证事实正确或绝对安全。

Q002|Prompt、RAG、继续预训练、LoRA 和全量微调如何选择?

临时任务说明先用 Prompt/Few-shot;严格机器格式优先 Structured Outputs、JSON Schema、Tool Schema 与运行时校验;动态且需引用的事实优先 RAG;大量无标注领域语料可评估继续预训练;稳定行为、语气或任务映射可采用 SFT,再根据容量、预算和部署方式选择全参数更新或 LoRA/QLoRA 等参数高效微调(PEFT)。企业知识每日变化时由 RAG 管事实和引用,格式由确定性 Schema 管边界;只有行为基线仍不足且已有可靠数据与评测时,再考虑采用 LoRA 的 SFT。

Q003|因果语言模型和 SFT 的 Loss 如何构造?

因果语言模型分解为 p(x1:T)=∏t p(xt|x<t),用前缀预测下一个 Token,因此位置 t 的 Logit 与后一个标签对齐,并用有效 Token Mask 排除 Padding。SFT 仍常用交叉熵,但通常把 System/User Prompt 对应标签设为 ignore_index,只让 Assistant 回答 Token 贡献损失。

Q004|LoRA 与 QLoRA 如何工作,分别节省哪些训练资源?

W0∈R^{d_out×d_in},标准 LoRA 冻结基座并学习 ΔW=(α/r)BA,其中 A∈R^{r×d_in}B∈R^{d_out×r},可训练参数为 r(d_in+d_out)。QLoRA 进一步以低位表示存放冻结基座,并在计算时按实现进行反量化或混合精度运算,LoRA Adapter 通常保持较高训练精度。LoRA 主要减少基座梯度和优化器状态,QLoRA 还减少基座驻留内存;二者都不会消除完整前向、必要激活、序列 Attention 和临时工作区,实际显存与速度必须按目标架构、量化格式、算子和硬件实测。

Q005|经典 RLHF 与 DPO 有何区别,偏好训练有哪些风险?

经典 InstructGPT 风格 RLHF 通常先训练奖励模型,再用 PPO 等方法结合参考策略 KL 约束优化。标准 DPO 对同一 Prompt 的 chosen y_w 与 rejected y_l 定义:

Δ=[logπθ(yw|x)logπref(yw|x)][logπθ(yl|x)logπref(yl|x)],L=logσ(βΔ).

序列 Log Probability 应按实现只聚合有效回答 Token,并明确求和、平均及长度处理。DPO 省去显式奖励模型和在线 RL 采样,但仍依赖参考策略、偏好数据、β、长度分布和独立评测;交换 chosen/rejected、错误 Mask 或长度偏差都会把目标训反或诱发投机。

Q006|如何设计可追溯、可回滚的 LLM 训练与发布体系?

我会绑定基座、Tokenizer、聊天模板、特殊 Token、数据清单/哈希、切分、Label Mask、代码、随机状态、目标模块、Checkpoint 和训练配置,并分别建立能力、领域、事实、安全与历史回归集。候选先离线门禁,再影子/灰度,服务记录基座、Adapter、Prompt、索引与策略版本,任何退化都能切回旧组合。

Q007|企业客服助手应如何组合 RAG、LoRA 和偏好优化?

这是源文档中的示例项目:产品事实由版本化 RAG 提供并附引用;结构化回复与工具参数由 Schema、Tool Calling 和业务校验保证;稳定语气和任务行为可评估采用 LoRA 的 SFT;只有存在可靠 chosen/rejected 标注时才评估 DPO。权限、敏感信息和人工升级仍由应用层控制;仓库没有训练或线上数据,不能声称准确率、胜率、成本或业务提升。

Q008|这个专题最常见的误区是什么?

常见误区有三类:把 SFT 等同偏好对齐,或说对齐完成后模型绝对安全;把 LoRA 当量化,或用可训练参数减少比例直接推算显存和速度;只保存 Adapter 文件,用训练 Loss 作为上线门禁,或不保留旧基座与路由。

Q009|怎样做最小自测?

最小自测分三步:用一分钟说明预训练、SFT 和偏好对齐的不同监督信号;构造一条 Chat 样本并标出 Shift、Padding Mask 和 Prompt Mask;给定 d_ind_outr 计算 LoRA 参数量并列出其余显存项。

Q010|回答这个专题时,证据边界是什么?

LoRA 只减少可训练参数相关状态,不能按参数比例推断总显存;训练 Loss 下降不能代替独立质量和安全评测。

3. 总结

一句话记忆: 预训练用大规模语料和自监督目标学习通用语言建模能力。

  • 预训练用大规模语料和自监督目标学习通用语言建模能力。
  • 经典 InstructGPT 风格 RLHF 通常先训练奖励模型,再用 PPO 等方法结合参考策略 KL 约束优化。
  • 常见误区有三类:把 SFT 等同偏好对齐,或说对齐完成后模型绝对安全。
  • LoRA 只减少可训练参数相关状态,不能按参数比例推断总显存。