Skip to content

LoRA、QLoRA 和全量微调有什么区别?

3 分钟速学卡

30 秒口述: 全量微调更新模型大部分或全部参数,表达空间最大,但训练显存、制品存储和发布成本高。LoRA 冻结底座,只训练注入权重层的低秩增量矩阵;QLoRA 再把冻结底座以低比特量化形式加载,进一步降低训练显存,同时通常保留较高精度的适配器和优化状态。三者没有无条件优劣,应在同一数据、底座、预算和评测集上比较质量、显存、吞吐、合并部署、遗忘与版本兼容。

  • 本质: 全量微调改底座,LoRA 训练低秩增量,QLoRA 再量化冻结底座以节省训练内存。
  • 核心机制: 可训练参数、训练显存和推理成本要分开讨论;QLoRA 不代表所有计算都在低比特完成。
  • 关键判断: Adapter 必须与底座和 Tokenizer 严格绑定;选型依赖同条件质量、成本和部署基准。
  • 项目落地: 示例项目:先用 Prompt 基线判断是否真的需要训练,再在固定数据上比较 LoRA、QLoRA 与可承担规模的全量微调。记录峰值显存、训练时间、域内/域外质量、安全、适配器大小以及合并前后输出差异。
  • 边界与坑: “LoRA 一定和全量微调效果一样”:取决于任务、底座、数据和秩约束;“QLoRA 全程都是 4 bit”:适配器、计算和优化状态未必同精度。

目录

面试官为什么问

这道题考参数高效微调(PEFT)的数学直觉与工程落地。中高级回答要能区分可训练参数少、训练显存低、推理成本低这三个不同结论。

小白先看懂

改造一栋大楼:全量微调像拆改整栋楼;LoRA 像保留主体结构,只安装一组可拆卸功能模块;QLoRA 像先把主体压缩存放,再训练同样的功能模块。模块更省改造成本,但承重、兼容和最终使用效果仍要验收。

大楼对应底座模型,模块对应低秩适配器,压缩主体对应量化加载。类比没有体现反向传播、量化误差、目标层选择和 Adapter 合并。

图:教学图片|LoRA、QLoRA 和全量微调有什么区别?

替代文本: 16:9 中文教学对比图,三栋相同大楼分别“整栋改造”“安装可拆模块”“压缩主体后安装模块”,下方映射模型训练。

LoRA、QLoRA 和全量微调有什么区别?教学图片

读图结论: LoRA 减少可训练参数,QLoRA 进一步降低底座内存。效果必须实测。

这张图片用于比较三种微调方法改变底座的范围和资源边界。精确公式、参数、失败分支和事实边界仍以正文与 Mermaid 为准。

图片生成记录: model=gpt-image-2generated=2026-07-15prompt_version=v1reviewed=2026-07-16review_basis=user-confirmed查看生成 Prompt

图:三种微调路径的可训练参数边界

替代文本: 全量微调更新整个底座权重;LoRA 冻结高精度底座,仅训练低秩适配器;QLoRA 冻结量化底座,同样训练适配器,三路进入统一质量与部署评测。

图表加载中…

读图结论: QLoRA 主要降低训练时底座内存,LoRA 主要减少可训练参数;是否满足质量和部署目标必须实测。

核心原理

LoRA 将权重更新约束为低秩分解:

W=W+ΔW,ΔW=BA,rank(A,B)=rd

底座 (W) 冻结,只优化 (A,B)。QLoRA 通常让前向使用量化后的冻结底座,并通过反量化参与计算,梯度更新适配器;“4-bit 训练”不等于所有计算和状态都以 4 bit 完成。

全量微调更灵活,也更容易发生遗忘和高成本;LoRA/QLoRA 的效果受秩、目标模块、学习率、数据和底座能力限制。

项目和生产视角

示例项目: 先用 Prompt 基线判断是否真的需要训练,再在固定数据上比较 LoRA、QLoRA 与可承担规模的全量微调。记录峰值显存、训练时间、域内/域外质量、安全、适配器大小以及合并前后输出差异。

发布制品应绑定 base_model_hash、Tokenizer、Adapter 配置、量化方案和评测报告;加载错底座时应拒绝启动。本文没有真实基准数据。

常见错误回答

  • “LoRA 一定和全量微调效果一样”:取决于任务、底座、数据和秩约束。
  • “QLoRA 全程都是 4 bit”:适配器、计算和优化状态未必同精度。
  • “参数少就一定推理更快”:动态 Adapter 仍可能有调度和算子代价。
  • “Adapter 可以加载到任意底座”:形状、层名和版本必须匹配。

递进追问

  1. 低秩假设为什么可能成立?
  2. LoRA 的秩和目标层怎样选择?
  3. QLoRA 的量化误差如何评估?
  4. Adapter 合并与动态加载各有什么代价?
  5. 如何检测灾难性遗忘和版本错配?

关联阅读

总结

一句话记忆: 全量微调改底座,LoRA 训练低秩增量,QLoRA 再量化冻结底座以节省训练内存。

  • 可训练参数、训练显存和推理成本要分开讨论。
  • QLoRA 不代表所有计算都在低比特完成。
  • Adapter 必须与底座和 Tokenizer 严格绑定。
  • 选型依赖同条件质量、成本和部署基准。