AI 生成任务

角色参考图:怎么让同一个主体跨镜头保持一致

又称 主体参考, 角色一致性, character reference, cref, 参考图

角色参考图是随提示词一起提交的一张或几张图,让模型复现那个特定的人、生物或物件,而不是重新编一个。它约束的是身份而不是构图,这也正是跨多次独立生成还能保持角色一致性的前提。

它约束什么,不约束什么

「同一个东西拍出不止一个镜头」之所以难,几乎全部来自一个事实:每次生成都是从零开始的。用文字描述一个角色,同样的提示词跑两遍,你会得到两个都符合描述、但不是同一个人的人。角色参考图的存在就是为了打破这一点 —— 交给模型的是像素,不是形容词。

它约束的是身份:脸部结构、头发、辨识性特征,通常还包括服装和颜色。它有意不约束的是这个镜头本身:姿势、构图、机位、光线、环境都还在提示词手里,而这正是重点。如果参考图连构图一起管了,你就没法把同一个人放进一个新场景。

这条分界也是大部分失败的来源。给模型一张风格化油画当角色参考,它会把笔触一起带过来,因为它无法判断你指的是这张图的哪些属性。给它一张硬侧光拍的照片,那道阴影就成了身份的一部分。

参考图怎么挑

规则都不性感,但它们比措辞重要得多。

  • 中性、均匀的光。 平光正面或者柔和的窗光。阴影会被当成特征烤进去。
  • 多个角度。 正面、四分之三侧、正侧。三到五张胜过一张,因为这时模型对一个脑袋的侧面是有真实信息的,不是在猜。
  • 整组里的主体要一致。 同一个发型、同一个年龄段,如果服装重要就同一套服装。一组自相矛盾的参考图会被平均成第四个人。
  • 背景干净。 画面里出现别人的脸,是最稳定地拿到「混血」结果的方式。
  • 分辨率和锐度。 参考图的细节量就是输出细节量的上限。

对于反复出场的主体,参考图组只建一次,留在项目里,之后每个镜头都复用它。一组镜头之间的一致性来自参考图组是固定的,而不是来自某一次生成特别好。

配套的提示词怎么写

挂上参考图之后,提示词的职责变了:停止描述主体,开始描述除主体之外的一切。

把场景、景别和光线完整写出来,然后指名参考图而不是重述它的内容:the woman from the reference image, standing at a bus stop in the rain at night。在已经有参考图的情况下再补一句 dark hair, green eyes, mid thirties,并不会加强身份 —— 它引入了第二份更弱的描述,去和像素竞争,把脸拉向两者的平均值。

然后把必须保住的属性钉住:keep her face, hair length and jacket exactly as in the reference。模型对服装的态度比对脸松得多,所以服装的连续性通常需要专门点名。

条件允许时,让主体在画面里的比例和参考图接近。身份在中景到中近景之间保持得很好,在大远景里迅速崩掉 —— 那时一张脸只有几十个像素,根本没有可供约束的东西。

什么时候该换成 LoRA

角色参考图适合几个镜头、一次提案、一次性的需求。它不花额外的钱、不用训练、立刻就能用。

它有天花板。身份是被「暗示」而不是被「学会」的,所以在不寻常的姿势、参考图没覆盖到的正侧转身、以及较长的视频片段上都会松掉。如果同一个角色要跨几十个镜头出场,用二三十张图训练一个 LoRA,能在任何参考图组都覆盖不到的角度和表情上把相似度撑住,并且彻底消掉逐镜头的漂移。切换的实际信号是重复劳动:当你已经在因为「脸变了」而重摇镜头时,训练一次比继续重摇更便宜。

支持该效果的模型

取自 ZOOOP 实时模型目录,新模型上架后自动出现在这里。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

The woman from the reference image, standing at a bus stop in the rain at night, wet coat, neon reflections on the pavement, medium shot at eye level, keep her face, hair length and jacket exactly as in the reference

试一下:角色参考图

打开生成器,参数已经预填好。

常见问题

角色参考图和风格参考图有什么区别?
角色参考说的是画面里是谁或者是什么;风格参考说的是这个画面该长什么样:色调、渲染方式、质感、年代感。在多数模型上它们是两条独立的条件通道。拿一张风格化插画当角色参考是最经典的错误,因为模型会把渲染方式和身份一起抄走。
应该给几张参考图?
一张干净的正面图足够拿到大致相似的样貌。三到五张、覆盖正面、四分之三侧和正侧、光线一致,才是角色一致性变得可靠的量级,因为这时模型对提示词将要转过来的那些部位有了真实信息,而不是靠猜。
为什么一组镜头拍下来脸会漂?
因为每次生成都是独立的。参考图约束身份但钉不死它,所以每个镜头都落在稍微不同的位置上,把一组镜头连起来看,这些小偏移就累积起来了。把漂掉的那几个镜头拿同一套参考图重摇,比试图用文字把脸描述得更精确有效得多。
角色参考图和训练 LoRA 是一回事吗?
不是。参考图是在推理时约束单次生成,不额外花钱;LoRA 是用一组图训练去改模型权重,把身份锁得紧得多,还能撑过参考图里从没出现过的姿势和角度。几个镜头用参考图,反复出场的角色用 LoRA。
视频里也能用角色参考图吗?
能,而且价值主要就在这儿。接受参考图的视频模型可以把一个主体带进它从没被拍摄过的镜头里,而这本来是建立连续性最难的一环。主体在画面里的比例和参考图接近时,身份保持得最好。
什么样的参考图是坏参考图?
脸上压着重阴影、超广角畸变、戴墨镜或帽子、有运动模糊、背景杂乱还带着别人的脸、以及分辨率太低。任何需要模型去猜的东西,出来的时候都会变成它自由发挥的东西。

相关术语