预训练一次,适配很多次
基础模型这个词来自学术界对建模方式转变的描述:不再为每个任务单独训一个网络,而是在广泛数据上预训练一个大模型,然后去适配它。下游的一切都是适配。
在生成式媒体里这个模式格外看得见,因为那些适配你都叫得出名字。一个图像或视频底座会被做成风格 LoRA、全参微调、深度或姿态的控制适配器、多一个掩膜通道的局部重绘版本、首尾帧版本、四步蒸馏的兄弟版本,以及一堆产品功能。它们全部指回同一套预训练权重。
所以选基础模型这件事,比「这一个镜头用哪个模型」重得多。你同时在选:能用哪一套适配器生态、能在什么上面接着做微调、以及接下来整个项目要绕开哪些毛病。
底座决定上限
生成模型里一切像「智能」的东西,都来自预训练:
- 提示词理解。 长提示词能活下来几条从句,空间关系是被执行还是被平均。
- 世界知识。 它知不知道 Bolex 摄影机长什么样、燕尾榫怎么咬合、七十年代东京街牌上写什么。
- 物理合理性。 视频里布料、水、头发、重量是否成立。这是最难蒙的一项,也是弱底座最快露馅的地方。
- 文字渲染。 几乎完全是预训练属性。
- 分辨率和时长范围。 由它被训练去输出什么决定。
适配能挪动的是风格、题材、审美,挪不动上面任何一条。这个不对称是这个词最有用的部分,因为它告诉你什么时候该换模型而不是继续改提示词:问题是观感就适配,问题是能力就换底座。
押上去之前怎么评测
看官方作品集判断底座没有意义,那是筛过的输出。自己建一组固定探针,在每个候选上原样跑一遍,各自用各自的推荐参数。八条提示词就够,前提是每条都挑着往痛处打:
- 四个不同物体,各自指定颜色和位置,测数量和版式。
- 一句必须拼对的短语,要出现在画面里。
- 手在做一件具体的事:握工具、打绳结。
- 一种你真的要用的具名审美,不是泛泛的风格词。
- 单一实体光源的暗场,测噪声处理和调性。
- 一条长提示词,把关键要求埋在中段,测遵循度衰减。
- 视频的话,加一个真物理镜头:倒水、风里的布、一个人坐下。
- 你自己最常做的那个题材。
把结果留档。探针组的价值在下一个版本发布时才兑现:你能看见到底变了什么,而不是只能相信宣传口径。
这个词不承诺什么
预训练得广,不等于在你的活上好用。通用能力很宽的模型,在某一种具体插画风格上照样输给窄微调;一个很大的视频底座,做说话人头像照样输给专门的口型同步模型。这个词描述的是权重从哪来,不是结果好不好,把它当质量分级用,工作流就会标准化在错误的权重上。