AI 模型与参数术语
底层的机器:模型架构,以及生成时真正会去调的那些参数。
AI 幻觉
AI 幻觉指模型自信地给出、但其实是错的或凭空编造的输出。在文本里它表现为编造事实;在图像和视频里,它表现为六根手指的手、招牌上无法辨认的文字、不成立的物理,以及放大工具补出来的、源图里根本不存在的细节。
ai hallucination · hallucination · 幻觉 · 模型幻觉
CFG Scale
CFG scale 是无分类器引导(classifier free guidance)的强度,它决定模型被朝着你的提示词推多远、离「不给提示词时它本来会画的东西」多远。数值低画面松软发灰,数值高画面死板高反差,而每个模型家族都有自己的合理区间。
what is cfg scale · guidance scale · classifier free guidance · 提示词引导强度 · cfg 值
CLIP 模型
CLIP 模型是一对编码器,一个读文字、一个读图像,训练目标是让一句描述和它对应的图落在同一个共享嵌入空间里的同一个位置。图像生成模型用的是它的文本编码器,把提示词变成能操纵生成过程的一串数字。
clip · text encoder · 文本编码器 · clip score · t5 编码器
ControlNet
ControlNet 是挂在扩散模型上的一个附加网络,它用从参考图里提取出的结构图(骨架、深度图、边缘线等)作为额外条件。风格和内容仍由提示词决定,但画面的布局被你给的那张结构图钉死。
what is controlnet · ip adapter · 控制网 · openpose · 深度图控制
GAN
GAN(生成对抗网络)是一对互相对打训练出来的神经网络,生成器产出候选图像,判别器判断它像不像真的。这场竞赛让单次前向推理就能出高质量结果,所以即便开放式生成已经被扩散模型接管,放大和人脸修复这类任务至今仍以 GAN 为主。
gan · gans · 生成对抗网络 · esrgan · stylegan
LoRA
LoRA(低秩适配)是一个小体积的外挂文件,它把基础模型的行为往某个特定主体、风格或概念上偏移,而不用重训模型本身。它通常只有十几到几百 MB,而底模有好几个 GB,是让一个反复出现的角色或一套统一风格贯穿多个镜头的标准做法。
lora · lora 模型 · 低秩适配 · lora 训练 · 罗拉模型
Transformer 模型
Transformer 模型是一种把输入切成 token、再用注意力机制决定「谁影响谁」的神经网络。大语言模型跑在它上面,自从主流图像与视频模型换成扩散 Transformer(DiT)之后,你在用的生成模型基本也跑在它上面。
attention mechanism · 注意力机制 · 自注意力 · DiT · 扩散 Transformer
UNet
UNet 是扩散模型里负责「这一步该去掉多少噪声」的网络:一条卷积下采样路径、一条上采样路径,同分辨率之间用跳连接对接。它是 2022 到 2024 年图像生成的标准主干,LoRA 和 ControlNet 之所以长成今天这个样子,也是被它的结构决定的。
unet · u-net · unet architecture · 去噪主干 · 卷积主干
VAE(变分自编码器)
VAE(变分自编码器)是扩散模型两端的压缩器:编码器把像素压成一张很小的潜空间网格,模型只在这张网格上做去噪;解码器再把结果还原成图像或视频帧。你放大到 100% 才看见的那些细节瑕疵,多数是这一步造成的,而不是生成主干的问题。
vae · vae stable diffusion · variational autoencoder · 变分自编码器 · 潜空间编码器
一致性模型(Consistency Model)
一致性模型的训练方式是让噪声到成图这条轨迹上的任意一点都直接映射到同一个终点,于是它一到四步就能出成品,而不需要几十步。目录里各种 fast、turbo、flash、lightning 档位,背后基本都是这套蒸馏技术。
consistency model · model distillation · lcm · 模型蒸馏 · 步数蒸馏
分词器
分词器(tokenizer)负责把文本切成模型能处理的离散单元,再把每个单元映射成一个 id、进而查成向量(embedding)。它决定了你的提示词到底有多少内容真被读进去,也决定了生僻词会被切成什么碎片,这就是为什么冷门名字经常生成出毫不相干的东西。
tokenizer · embedding ai · token · 词元 · 文本编码器
去噪强度
去噪强度决定你的输入图被推回噪声多深,再由扩散模型从那里重新去噪,也就等于决定了原图还剩多少。采样步数决定这次重建走多少步。图生图的所有调参,基本都是在这两个数之间做取舍。
denoise · denoising strength · sampling steps · 重绘幅度 · 采样步数
反向提示词
反向提示词是另一段文字,模型会被朝着它的反方向推,和正向提示词正好镜像。它压制风格、材质和反复出现的瑕疵很有效,但要把某个具体物体从画面某个具体位置抹掉,它基本不灵。
negative prompt · negative prompting · negative prompt examples · 负面提示词 · 排除词
基础模型(Foundation Model)
基础模型指的是在广泛数据上预训练一次、再被适配到很多下游任务的大模型,而不是为某一个任务单独训出来的模型。在生成式媒体里,它就是整个生态挂靠的那个底座:微调、LoRA、控制适配器、蒸馏出来的快速版本、各种任务变体,全部都是针对某一个具体底座做的。
foundation model · base model · 底座模型 · 预训练模型
多模态 AI
多模态 AI 指的是能读入或产出多种数据类型的模型,通常是文字、图像、视频、音频的某种组合,并且这些信号共享同一套内部表示。在创作工具里,它就是你能同时递给模型一张参考帧和一句修改要求、而模型同时看懂两者的原因。
multimodal ai · multimodal model · 多模态模型 · omni 模型 · 视觉语言模型
微调(Fine-Tuning)
模型微调是在一个预训练模型上继续训练,用你自己的图教它一个它原本不认识的人、风格或产品。它真的改动了权重,这是它和写提示词、给参考图的根本区别,也是它应该排在最后而不是最前的原因。
dreambooth · textual inversion · checkpoint model · stable diffusion checkpoint · 底模
扩散 Transformer(DiT)
扩散 Transformer 指的是把扩散模型的去噪主干从卷积 UNet 换成 Transformer:潜空间被切成小块,每一块变成一个 token,每一层里每个 token 都能看到其他所有 token。正是这一个改动,让现在的模型能写出可读的字、能吃下长提示词,也让视频从「几帧」变成「以秒计」。
dit · diffusion transformer · mmdit · 扩散 transformer · Transformer 主干
扩散模型
扩散模型的生成方式是从一片随机噪声出发,每一步去掉一点噪声,在提示词引导下预测「噪声更少时这张图该是什么样」。它训练时学的是把一个逐步加噪的过程反过来走,而这种一步一步的结构,正是它可被引导的原因。
diffusion model · 潜扩散 · latent diffusion · 视频扩散 · 去噪扩散
提示词工程
提示词工程是有意识地组织模型输入、让结果落在你想要的位置上的方法。对图像和视频模型来说,它主要关乎用词顺序、具体程度和权重,因为这类模型并不像对话模型那样执行指令,它做的是把一段描述和图像对上。
prompt engineering · 提示词 · 咒语 · 提示词模板 · 提示词权重 · 系统提示词
流匹配(Flow Matching)
流匹配是一种训练目标:让模型学会一个速度场,把噪声沿着接近直线的路径搬到数据。整流流(rectified flow)就是其中路径取直线的那个版本,现在主流的图像和视频家族都建在它上面。因为路径是直的,采样只需要经典扩散调度的几分之一步数就能到同样的画质。
flow matching · rectified flow · 整流流 · 修正流 · 速度预测
潜空间
潜空间是生成模型真正干活的那个压缩坐标系,在里面一张图是几千个数字而不是几百万个像素。生成的过程就是在这个空间里走一条路径,最后再解码回像素。这解释了为什么固定种子能复现,也解释了为什么相邻两点看起来像亲戚。
latent space · latent · 隐空间 · 潜在空间 · 潜变量
生成式 AI
生成式 AI 指的是通过「从训练中学到的概率分布里抽样」来产出新内容(图像、视频、音频、文本)的模型,而不是检索或修改一份已有文件。因为每次运行都重新抽一次样,所以输入没变,结果也会变。
generative ai · gen ai · 生成式人工智能 · AIGC
种子(Seed)
随机种子是一个整数,扩散模型从它生成的那团随机噪声出发开画。种子和其余设置全部不变,你就能拿到完全相同的输出,这一步让生成从摇老虎机变成一次「每次只动一个变量」的受控实验。
seed · image seed · random seed · 种子值 · 固定种子
自回归模型
自回归模型每次只产出一个元素,而且每一个新元素都以已经产出的全部内容为条件。语言模型就是这么工作的,越来越多的图像和视频模型也是:它们按顺序预测画面 token 或者视频帧,而不是并行地对整张画布做去噪。
autoregressive model · ar model · 自回归 · 下一个 token 预测