模型与参数

扩散模型怎么工作,每个参数又在动什么

又称 diffusion model, 潜扩散, latent diffusion, 视频扩散, 去噪扩散

扩散模型的生成方式是从一片随机噪声出发,每一步去掉一点噪声,在提示词引导下预测「噪声更少时这张图该是什么样」。它训练时学的是把一个逐步加噪的过程反过来走,而这种一步一步的结构,正是它可被引导的原因。

核心思路,按发生顺序讲

训练是正着跑的。拿一张真图,加一点噪声,再加一点,一直加到只剩雪花。在每个噪声档位上,网络看到这张带噪图,被要求预测「加进去的噪声是什么」。整个训练目标就这么简单,而它比对抗博弈好优化得多,这也是这条路线能扩展到几十亿张图的原因。

生成就是把这架梯子倒着爬:

  1. 从一片随机噪声出发,由种子固定。
  2. 结合提示词的条件,问网络「你看到的噪声是什么」。
  3. 减掉这份预测的一部分,落到一个稍微干净些的状态。
  4. 按你设定的步数重复。
  5. 从潜空间解码回像素。

有两个后果在日常使用里最要紧。第一,画面在很早就定了:构图和主体在前几步内基本落定,后面的步数主要在处理纹理。所以构图不对,加步数是救不回来的。第二,正因为步数很多,可插手的时机也很多,你手上所有的控制手段都来自这里。

每个参数究竟在动什么

参数作用常用范围
步数去噪迭代多少次20 到 40;蒸馏模型 1 到 8
引导强度 CFG每一步提示词的拉力多数图像模型 4 到 8
种子起始噪声场需要复现就固定它
重绘幅度输入图被推回噪声多远做变体 0.2 到 0.4,重造 0.6 以上
调度器步长分布与噪声重注入方式跟模型走

最常见的两个误解,都来自把步数和引导当成「画质滑块」。步数是收敛预算,不是画质档位:图已经收敛之后,再加步数只会得到一张一样的图和一份更高的账单。引导是一个取舍,不是强度:往上拉换来的是跟随度,付出的是对比度、饱和度和硬边缘。

视频扩散是另一道题

视频扩散模型要去噪的是一叠互相自洽的帧。逐帧独立去噪会得到闪烁,所以这些模型要么加时序层,要么在自编码器里把时间当成第三个压缩轴,要么用能跨帧做注意力的 Transformer 主干。

这解释了视频生成为什么贵得多、单次时长为什么被压在几秒内,也解释了为什么一段片子靠后的帧比靠前的帧漂移更严重。同时它也点明了最锋利的那个控制手段:给一张首帧,等于把「长什么样」这个决定整个从模型手里拿走,只留给它解运动。

怎么把这些落到实操上

参数跟着模型走,不要跟着经验值走。 一个 turbo 版在 30 步、CFG 8 下的表现,会比它自己在 6 步、CFG 2 下更差。模型说明页存在是有原因的。

先诊断,再重摇。 发糊、没画完,是步数不够;烧焦、过饱和,是引导太高;跑题,是引导太低或提示词长过了文本编码器的上限;构图不对,问题在种子或缺少控制图,而不在参数。

一次只改一个变量,并且固定种子。 种子放开的情况下,每次对比都掺进了一片新噪声,这是得出关于某个参数的错误结论的最快方式。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

A greenhouse at night lit only by a hanging work lamp, condensation on the glass, 35mm, slow push in

试一下:扩散模型

打开生成器,参数已经预填好。

常见问题

扩散模型的原理用一句话说是什么?
训练时,图像被一层层加噪,网络学着预测「刚才加进去的是什么噪声」。生成时把这个过程倒着跑:从纯噪声出发,一步步减掉预测出来的噪声,每一步都由提示词引导,直到一张图浮现出来。
步数该设多少?
多数模型在 20 到 40 步之间收敛,超过 50 步肉眼基本看不出差别。蒸馏版和 turbo 版是为 1 到 8 步训练的,硬拉高反而更差。画面发糊、像没画完,就加步数;已经好了,多加的步数只是在多花钱。
引导强度 CFG 是干什么的?
它决定每一步里提示词把结果从「无条件预测」上拽开多远。太低会跑题,太高会出现过饱和、边缘发硬、像烧焦的画面。多数图像模型的舒适区在 4 到 8,而且新模型普遍比老模型需要更低的值。
潜扩散是什么?
就是把扩散过程放在压缩后的潜空间里跑,而不是在原始像素上跑,进出由一个自编码器负责换算。它把算力成本降到了让高分辨率生成变得可行的程度,现在几乎所有在跑的图像模型都是这么做的。
扩散模型和 GAN 有什么区别?
GAN 一次前向就出图,快但难引导;扩散是多步精修,所以你能在步与步之间用引导、蒙版、控制图插手。这就是为什么在提示词驱动的生成上是扩散胜出,而放大和修复仍留给 GAN。
调度器重要吗?
有一定影响。调度器决定每一步去噪的步长有多大、以及随机性怎么重新注入。换调度器改变的更多是纹理和收敛速度,而不是内容;而且在 20 步下合适的那个,到 8 步下往往要换设置。

相关术语