它解决的是什么问题
经典的去噪扩散模型,训练方式是按一个方差调度往图上加高斯噪声,然后学着一次撤销一个增量;采样就是把这条链反着走一遍。这条轨迹既有随机性又是弯的,所以每一步必须走得很小,画质要到几十甚至上百次网络前向之后才出来。这个设计还拖着一堆互相牵扯的选择:beta 调度怎么定、网络预测噪声还是速度还是干净图、哪个采样器配哪个调度。
流匹配把同一个目标重新表述了一遍。先在噪声分布和数据分布之间挑一条路径,再训练网络输出「沿这条路径移动样本」的速度。推理时你不再是在反演一个加噪过程,而是在从噪声到成图解一个常微分方程。
最简单的路径就是直线:把噪声和真实样本线性混合,训练目标取两者之差。这个具体版本就是整流流,它的好处完全是几何上的。直的轨迹可以一大步跨过去而不偏离路径,同样的求解器在弯路上会冲出去,在直路上却依然准确。
你能感觉到的变化
近两年的前沿图像和视频家族基本都坐在这个目标上:SD3、Flux、Wan 视频系列、Hunyuan Video、Qwen-Image、LTX,以及 2024 年之后上线的大多数模型。用户能直接感知的后果很具体。
步数塌下来了。 从五十到一百步变成二十到三十步。在视频上,一次生成动辄几万个 token,这个差别就是「产品能做」和「算不起」之间的距离。
蒸馏变容易了。 直路径压成寥寥几步要简单得多,所以现在几乎每个家族都配一个四步或者一步的兄弟版本。托管目录里的快速档,通常就是同一个流匹配底座的蒸馏版。
高分辨率更稳了。 这类表述会按要生成的 token 数量去平移调度,因为大画布需要把更多轨迹花在高噪声段。正是这个平移,让同一个模型在 2K 上还能守住构图,而上一代到这个尺寸就散了。
引导系数的含义变了。 这条最容易踩坑。有几个模型暴露出来的 guidance 根本不是无分类器引导,它在蒸馏时被固化进去,现在只是一个条件值。老模型的习惯搬过来会出事,症状是对比度压死、颜色出现色带。
具体怎么用
一份从最有用往下排的清单:
- 从模型自己的推荐步数和推荐引导值起步。这两个数是按调度调出来的,不能跨家族搬。
- 高分辨率下画面发灰发平,那是调度的问题不是提示词的问题。先回到模型的原生分辨率试一次,再考虑改字。
- 把快速版本当草稿工具。在蒸馏版上探构图,锁定之后用同样的种子和提示词在完整模型上出正式的那一条。
- 别指望加步数补细节。细节上限由潜空间编解码器决定,多加的步数补不出压缩已经丢掉的信息。
- 比较两个模型时,各自用各自的默认步数和引导值,而不是把数字调成一样。不同调度上数字对齐并不公平,这也是模型横评最常出错的地方。