Skip to content

预训练、SFT、RLHF、PPO 和 DPO 有什么区别?

3 分钟速学卡

30 秒口述: 预训练用海量语料学习通用语言分布和能力,SFT 用指令—回答样本教模型按任务格式响应。RLHF 是利用人类偏好进行对齐的一类流程,经典实现先训练奖励模型,再用 PPO 等强化学习算法优化策略;DPO 则直接用偏好对构造分类式目标,省去显式奖励模型与在线 RL 循环。它们解决的阶段和成本不同,最终选型应看数据质量、基础设施、稳定性、安全评测和可回滚性。

  • 本质: 预训练学通用分布,SFT 学任务响应,RLHF 用偏好对齐,PPO 与 DPO 是不同优化路径。
  • 核心机制: 五个概念不在同一抽象层级;RLHF 是流程,PPO 是算法。
  • 关键判断: DPO 简化训练链,但不消除数据和退化风险;选型必须用任务、安全、成本和回滚证据验证。
  • 项目落地: 示例项目:若只是固定格式和领域术语,可先用 Prompt 基线,再比较 SFT/LoRA;若目标是复杂主观偏好,才评估偏好优化。
  • 边界与坑: “RLHF 就是 PPO”:PPO 只是经典 RLHF 中的一种优化算法;“SFT 用来给模型注入所有最新知识”:动态事实更适合受控检索或工具。

目录

面试官为什么问

面试官在看候选人能否区分训练阶段、数据形态、优化目标和工程复杂度,并知道 RLHF 不等于 PPO、DPO 也不是无代价的“更优替代”。

小白先看懂

培养客服新人:先阅读大量通用资料形成语言基础,像预训练;再跟标准问答学会岗位规范,像 SFT;主管比较两份回复更喜欢哪份,形成偏好数据,像 RLHF 数据;PPO 像用评分员反复给新回复打分并调教;DPO 像直接从“优选与落选回复对”学习偏好。

映射没有体现 Token 级损失、奖励建模、KL 约束和策略采样;主管偏好也可能有偏差,不能等同于客观真理。

图:教学图片|预训练、SFT、RLHF、PPO 和 DPO 有什么区别?

替代文本: 16:9 中文教学路线图,以客服新人培养为生活场景,上半部对应训练管线;两条偏好优化路径清晰分叉后汇入评测。

预训练、SFT、RLHF、PPO 和 DPO 有什么区别?教学图片

读图结论: RLHF 是流程,PPO 是算法。DPO 简化链路但不消除偏好风险。

这张图片用于解释 LLM 从预训练到偏好对齐的阶段和分叉路径。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:从通用能力到偏好对齐的训练阶段

替代文本: 预训练模型经过 SFT 形成指令模型;偏好数据可走奖励模型加 PPO 的经典 RLHF 路径,也可走 DPO 直接偏好优化路径;两路最终都进入安全和任务评测。

图表加载中…

读图结论: RLHF 是对齐流程,PPO 是其中一种策略优化算法;DPO 用偏好对直接优化,但仍依赖参考策略和高质量数据。

核心原理

  • 预训练:通常最小化下一 Token 负对数似然,学习广泛统计规律。
  • SFT:在高质量指令数据上做监督学习,常只对回答 Token 计算损失。
  • RLHF:收集偏好 → 奖励建模 → 策略优化 → 安全评测,是流程集合。
  • PPO:用裁剪目标限制策略更新,并常加 KL 约束避免偏离参考模型过远。
  • DPO:根据偏好对直接提高 chosen 相对 rejected 的对数概率优势,工程链更短,但仍可能过拟合偏好和退化通用能力。

项目和生产视角

示例项目: 若只是固定格式和领域术语,可先用 Prompt 基线,再比较 SFT/LoRA;若目标是复杂主观偏好,才评估偏好优化。发布门禁应覆盖域内任务、域外能力、安全、长度偏差和拒答,不只看平均偏好胜率。

训练制品要绑定底座、Tokenizer、数据、代码、超参数与评测版本,支持回滚。本文不声称 PPO 或 DPO 在所有数据上更好。

常见错误回答

  • “RLHF 就是 PPO”:PPO 只是经典 RLHF 中的一种优化算法。
  • “SFT 用来给模型注入所有最新知识”:动态事实更适合受控检索或工具。
  • “DPO 不需要奖励信号”:偏好对本身就是监督信号。
  • “偏好胜率高就完成对齐”:还要查安全、事实、长尾和能力退化。

递进追问

  1. SFT 为什么通常只对回答部分计算损失?
  2. PPO 中 KL 约束解决什么风险?
  3. 奖励模型可能出现哪些偏差?
  4. DPO 相比 PPO 简化了哪些基础设施?
  5. 如何发现偏好优化后的能力退化?

关联阅读

总结

一句话记忆: 预训练学通用分布,SFT 学任务响应,RLHF 用偏好对齐,PPO 与 DPO 是不同优化路径。

  • 五个概念不在同一抽象层级。
  • RLHF 是流程,PPO 是算法。
  • DPO 简化训练链,但不消除数据和退化风险。
  • 选型必须用任务、安全、成本和回滚证据验证。