模型与参数

流匹配与整流流:现在的模型为什么只要二十几步

又称 flow matching, rectified flow, 整流流, 修正流, 速度预测

流匹配是一种训练目标:让模型学会一个速度场,把噪声沿着接近直线的路径搬到数据。整流流(rectified flow)就是其中路径取直线的那个版本,现在主流的图像和视频家族都建在它上面。因为路径是直的,采样只需要经典扩散调度的几分之一步数就能到同样的画质。

它解决的是什么问题

经典的去噪扩散模型,训练方式是按一个方差调度往图上加高斯噪声,然后学着一次撤销一个增量;采样就是把这条链反着走一遍。这条轨迹既有随机性又是弯的,所以每一步必须走得很小,画质要到几十甚至上百次网络前向之后才出来。这个设计还拖着一堆互相牵扯的选择:beta 调度怎么定、网络预测噪声还是速度还是干净图、哪个采样器配哪个调度。

流匹配把同一个目标重新表述了一遍。先在噪声分布和数据分布之间挑一条路径,再训练网络输出「沿这条路径移动样本」的速度。推理时你不再是在反演一个加噪过程,而是在从噪声到成图解一个常微分方程。

最简单的路径就是直线:把噪声和真实样本线性混合,训练目标取两者之差。这个具体版本就是整流流,它的好处完全是几何上的。直的轨迹可以一大步跨过去而不偏离路径,同样的求解器在弯路上会冲出去,在直路上却依然准确。

你能感觉到的变化

近两年的前沿图像和视频家族基本都坐在这个目标上:SD3、Flux、Wan 视频系列、Hunyuan Video、Qwen-Image、LTX,以及 2024 年之后上线的大多数模型。用户能直接感知的后果很具体。

步数塌下来了。 从五十到一百步变成二十到三十步。在视频上,一次生成动辄几万个 token,这个差别就是「产品能做」和「算不起」之间的距离。

蒸馏变容易了。 直路径压成寥寥几步要简单得多,所以现在几乎每个家族都配一个四步或者一步的兄弟版本。托管目录里的快速档,通常就是同一个流匹配底座的蒸馏版。

高分辨率更稳了。 这类表述会按要生成的 token 数量去平移调度,因为大画布需要把更多轨迹花在高噪声段。正是这个平移,让同一个模型在 2K 上还能守住构图,而上一代到这个尺寸就散了。

引导系数的含义变了。 这条最容易踩坑。有几个模型暴露出来的 guidance 根本不是无分类器引导,它在蒸馏时被固化进去,现在只是一个条件值。老模型的习惯搬过来会出事,症状是对比度压死、颜色出现色带。

具体怎么用

一份从最有用往下排的清单:

  1. 从模型自己的推荐步数和推荐引导值起步。这两个数是按调度调出来的,不能跨家族搬。
  2. 高分辨率下画面发灰发平,那是调度的问题不是提示词的问题。先回到模型的原生分辨率试一次,再考虑改字。
  3. 把快速版本当草稿工具。在蒸馏版上探构图,锁定之后用同样的种子和提示词在完整模型上出正式的那一条。
  4. 别指望加步数补细节。细节上限由潜空间编解码器决定,多加的步数补不出压缩已经丢掉的信息。
  5. 比较两个模型时,各自用各自的默认步数和引导值,而不是把数字调成一样。不同调度上数字对齐并不公平,这也是模型横评最常出错的地方。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Overhead shot of a marble kitchen counter, morning light through a window, a single ripe peach and a paring knife, soft shadows

试一下:流匹配(Flow Matching)

打开生成器,参数已经预填好。

常见问题

它和扩散模型的区别是什么?
经典扩散学的是把一个加噪调度一小步一小步地反过来走,这条反向路径是弯的、带随机性的,所以步数必须多。流匹配训练模型预测沿噪声到数据的直线插值上的速度,求解器于是能一大步一大步走而不冲出路径。仍然是同一类生成模型,只是两端之间换了条路。
整流流和流匹配是一回事吗?
整流流是其中一个具体情形:噪声到数据之间的路径取直线,训练目标就是数据减噪声。流匹配是允许其他路径的通用框架。实际上现在的模型说自己用流匹配,几乎都是指取直线的这一版。
采样步数该设多少?
完整模型一般 20 到 30 步,而且收益很早就平掉了。从 30 加到 60 通常什么也换不到,还可能让细节略微发软。模型自带的推荐值是针对它自己的调度调出来的,比从老家族搬过来的数字靠谱得多。
为什么把引导系数调高会把画面搞坏?
因为其中一部分模型是引导蒸馏过的,那个叫 guidance 的数字不是 CFG 倍率,而是一个条件输入。在这类模型上 2.5 到 4 才是正常范围,习惯性填 7.5 的结果是对比度烧掉、颜色断层。推之前先确认这个参数在这个模型里到底是什么。
它提升的是画质还是速度?
两者都有,但都是间接的。直接收益是同等画质下步数更少,快速档位能存在全靠这一点。间接收益是高分辨率下训练更稳,表现为大画布上少见畸变。它不改变提示词理解能力和细节上限,那两件事归主干和编解码器管。

相关术语