模型与参数

LoRA 是什么:风格与角色一致性的解法

又称 lora, lora 模型, 低秩适配, lora 训练, 罗拉模型

LoRA(低秩适配)是一个小体积的外挂文件,它把基础模型的行为往某个特定主体、风格或概念上偏移,而不用重训模型本身。它通常只有十几到几百 MB,而底模有好几个 GB,是让一个反复出现的角色或一套统一风格贯穿多个镜头的标准做法。

它解决的是哪个问题

一致性是 AI 图像工作里最难满足的要求。用提示词描述一个角色,你得到的是家族相似,不是同一个人;八个镜头连起来看就像八个演员。种子只能锁住一张图,锁不住一个身份。

LoRA 把这个约束搬进了模型内部。你拿二十来张目标图训一遍,之后这个主体就成了模型认识的一个概念,用触发词点名、用权重控制强度。从那以后,身份不再是每条提示词都要重打一遍的仗。

所以它的意义远不止于爱好者互相分享模型。一个反复出场的主角、一件必须和实物完全一致的产品、一百张素材要统一的品牌插画风格,这些都是一致性问题,而低秩适配是目前最现实的答案。

低秩适配的原理,一段讲完

全量微调要更新数十亿个权重,硬件门槛高,产出文件还和原模型一样大。低秩适配利用的是这样一个事实:教会模型一个概念所需的那份「修正量」,远比模型本身简单。所以它不去学完整的权重更新,而是学两个很窄的矩阵,用它们的乘积去逼近这份修正,并注入到注意力层里。

秩(rank)就是「有多窄」。低秩(4 到 16)足以高效地拿下一种风格或一张脸;高秩(32 到 128)容量更大,能装更复杂或多部件的概念,代价是体积和更强的过拟合倾向。这也是底模为什么如此重要:适配文件本质是一份差值,只在它训练时对应的那一族底模上才成立。

和其他手段的对比

手段改动了什么体积适合
底模 checkpoint整个模型2 到 12 GB整体能力与审美
低秩适配注意力权重差值10 到 300 MB一个角色、风格或物件
文本嵌入一个 token 的含义不到 1 MB一个很窄的风格线索
参考图 / IP-Adapter什么都不改,只加条件一次性的相似,不用训练

选择标准基本就是「复用几次」。这个主体只出现在一张图里,用参考图更快也不花训练成本;要在三个月内出现在五十张图里,花一个下午训一份就很值。

训练的实操要点

先管素材,再管超参。 大部分失败都是素材失败。角度、距离、光线、背景都要杂,只让目标本身保持不变。二十张好素材胜过同一次拍摄里的两百张近似图。

该保持可变的东西,要写进标注。 把图与图之间会变的(姿势、服装、场景)描述出来,不该变的用一个生僻的触发词代表。你没标注的东西倾向于融进概念本体,这就是为什么有些角色模型练完永远只穿那一件外套。

盯住中间存档。 每几百步存一次,横向对比。最好的那一版往往不是最后一版,而是「灵活性刚要崩掉」之前的那一版。

用的时候从最低可用权重起步。 一上手就拉满是常见反射动作,通常是错的,因为它会把构图和色调一起拽过来。从 0.7 开始,只有在相似度不够时才往上加。

有些事这类适配文件确实帮不上:运动质量、物理合理性、清晰的文字。它教的是「长什么样」。如果你的问题是运镜在扭曲而不是脸不稳,那就拿错工具了。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Portrait of <subject> seated by a rain-streaked window, side light, 85mm, muted editorial grade

试一下:LoRA

打开生成器,参数已经预填好。

常见问题

LoRA 用一句话说是什么?
一个给大模型打的小补丁。要让模型学会一张脸或一种风格,不必换一个好几 GB 的新底模,只要一个很小的权重修正文件,加载时叠在底模上就行。
它和底模(checkpoint)有什么区别?
底模是整个模型,决定了它整体的能力和审美取向;适配文件是叠在上面的修饰层,体积小、可随时换、还能叠加。做法是先按「这个模型擅长出什么样的图」选底模,再按项目需要挂具体的适配文件。
训练需要准备多少张图?
单个角色一般 15 到 30 张就够,要求是角度、距离、光线都不同而身份一致;一种风格则要 30 到 100 张。多样性远比数量重要,因为重复的背景或反复出现的同一件衣服会被当成这个概念的一部分学进去。
怎么判断训过拟合了?
三个信号:不管怎么写提示词都反复出现同一个姿势或背景;根本没提触发词,那个主体也自己冒出来;毫不相干的提示词也开始继承训练集的色调。解法是减步数、降学习率,或者换一套更杂的素材。
可以同时挂多个吗?
通常可以,但要降权重。两个都拉满会打架,最先崩的是脸。各挂 0.6 到 0.8 是常见起点,而且「一个角色 + 一种风格」比「两种风格」或「两个角色」好合得多。
视频模型上能用吗?
越来越能,但生态比图像那边小得多。视频侧的适配文件更难训,学到的多是运动或观感而不是身份。角色类需求目前更稳的路子仍是:先在静帧上把身份定死,再把这张图当首帧送进视频模型。

相关术语