它解决的是哪个问题
一致性是 AI 图像工作里最难满足的要求。用提示词描述一个角色,你得到的是家族相似,不是同一个人;八个镜头连起来看就像八个演员。种子只能锁住一张图,锁不住一个身份。
LoRA 把这个约束搬进了模型内部。你拿二十来张目标图训一遍,之后这个主体就成了模型认识的一个概念,用触发词点名、用权重控制强度。从那以后,身份不再是每条提示词都要重打一遍的仗。
所以它的意义远不止于爱好者互相分享模型。一个反复出场的主角、一件必须和实物完全一致的产品、一百张素材要统一的品牌插画风格,这些都是一致性问题,而低秩适配是目前最现实的答案。
低秩适配的原理,一段讲完
全量微调要更新数十亿个权重,硬件门槛高,产出文件还和原模型一样大。低秩适配利用的是这样一个事实:教会模型一个概念所需的那份「修正量」,远比模型本身简单。所以它不去学完整的权重更新,而是学两个很窄的矩阵,用它们的乘积去逼近这份修正,并注入到注意力层里。
秩(rank)就是「有多窄」。低秩(4 到 16)足以高效地拿下一种风格或一张脸;高秩(32 到 128)容量更大,能装更复杂或多部件的概念,代价是体积和更强的过拟合倾向。这也是底模为什么如此重要:适配文件本质是一份差值,只在它训练时对应的那一族底模上才成立。
和其他手段的对比
| 手段 | 改动了什么 | 体积 | 适合 |
|---|---|---|---|
| 底模 checkpoint | 整个模型 | 2 到 12 GB | 整体能力与审美 |
| 低秩适配 | 注意力权重差值 | 10 到 300 MB | 一个角色、风格或物件 |
| 文本嵌入 | 一个 token 的含义 | 不到 1 MB | 一个很窄的风格线索 |
| 参考图 / IP-Adapter | 什么都不改,只加条件 | 无 | 一次性的相似,不用训练 |
选择标准基本就是「复用几次」。这个主体只出现在一张图里,用参考图更快也不花训练成本;要在三个月内出现在五十张图里,花一个下午训一份就很值。
训练的实操要点
先管素材,再管超参。 大部分失败都是素材失败。角度、距离、光线、背景都要杂,只让目标本身保持不变。二十张好素材胜过同一次拍摄里的两百张近似图。
该保持可变的东西,要写进标注。 把图与图之间会变的(姿势、服装、场景)描述出来,不该变的用一个生僻的触发词代表。你没标注的东西倾向于融进概念本体,这就是为什么有些角色模型练完永远只穿那一件外套。
盯住中间存档。 每几百步存一次,横向对比。最好的那一版往往不是最后一版,而是「灵活性刚要崩掉」之前的那一版。
用的时候从最低可用权重起步。 一上手就拉满是常见反射动作,通常是错的,因为它会把构图和色调一起拽过来。从 0.7 开始,只有在相似度不够时才往上加。
有些事这类适配文件确实帮不上:运动质量、物理合理性、清晰的文字。它教的是「长什么样」。如果你的问题是运镜在扭曲而不是脸不稳,那就拿错工具了。