知识域 · 大模型训练与对齐
LoRA / QLoRA
面试官怎么问全参数微调一个 7B 模型要多少显存?LoRA 为什么能把它降下来、它到底在训练什么?rank(秩)你会怎么设?QLoRA 又多做了一件什么事?
大白话版把大模型想成一本写满知识的百科全书。全参数微调=整本书重写一遍,又慢又占地方(7B 全量微调常要几十 GB 显存,个人显卡扛不住)。LoRA(低秩适配)=原书一个字不改(冻结原权重),只在旁边贴一叠很薄的便利贴,记「针对你的任务该微调哪一点点」,训练时只更新这叠便利贴,参数量可能只有原来百分之一。QLoRA 再进一步:先把厚书压成 4-bit 精简版(量化)放着,再贴便利贴训练——于是一张消费级显卡也能微调很大的模型。
进阶版(面试里能加分的深度)
- 原理:假设「微调带来的权重变化量 ΔW 是低秩的」,用两个小矩阵 A、B 的乘积 BA 近似 ΔW,只训 A、B,原权重 W 冻结;前向 = Wx + BAx。
- rank r 怎么选:r 越大表达力越强但参数/过拟合风险越大。简单任务 r=8/16 常够,复杂任务上 32/64;缩放系数 alpha 一般设成 r 的 1~2 倍,先小后大看效果。
- QLoRA 关键:4-bit NormalFloat 量化 + 双重量化 + 分页优化器,核心是「基座量化到 4-bit 后仍能近乎无损做 LoRA」,让单卡微调大模型成真。
- 常被追问的坑:LoRA 冻结原权重 → 不会灾难性遗忘;推理时可把 BA 合并回 W → 不增加推理延迟。这两点是高频加分点。
🧷 记忆钩子:LoRA=原书不动、只贴便利贴;QLoRA=先把书压成 4-bit 精简版再贴便利贴——所以游戏显卡也能微调大模型。(本条为考点提炼)