模型与参数

多模态 AI:它改变了图像和视频创作的什么

又称 multimodal ai, multimodal model, 多模态模型, omni 模型, 视觉语言模型

多模态 AI 指的是能读入或产出多种数据类型的模型,通常是文字、图像、视频、音频的某种组合,并且这些信号共享同一套内部表示。在创作工具里,它就是你能同时递给模型一张参考帧和一句修改要求、而模型同时看懂两者的原因。

联合理解,不是接力赛

判断一个系统算不算多模态 AI,要紧的区别不在架构图上有几个方框,而在于信号有没有真的碰面。

接力式管道先把参考图描述成文字,把文字交给生成器,然后把像素丢掉。描述里没提的一切就此消失:那张具体的脸、那件外套的织纹、那盏实体光落下来的方式。你能在成图里感觉到这件事:主题对了,具体全错。

联合建模两样都留着。图像 token 和文字 token 坐在同一个注意力操作里,于是一条指令可以指向画面里的某个东西。这是指令式编辑的全部基础,也是一组图里角色能一直是同一个人、以及参考图组合里每张图各司其职的基础。

你在哪儿会真的碰到它

在理解侧,多模态 AI 安静地待在生成周边的大部分工具里。提示词增强会先读你的参考图再改写提示词;自动打标在造训练和检索数据;内容审核看的是生成出来的画面而不只是你写的字;评测框架用视觉模型给「输出是否符合要求」打分,大规模横评能做起来全靠这一点。

在生成侧,它明摆着出现在四个地方:

  • 图 + 指令进,图出。对话式编辑,以及角色一致性不再需要训练任何东西的原因。
  • 多张参考图各带角色分工:身份来自第一张,服装来自第二张,光来自第三张。
  • 图 + 文字进,视频出。参考图锁住了外观,提示词就可以整条都花在运动上。
  • 自带同步音频的视频:人声、音效、房间声是和画面一起生成的,不是事后拼上去的。

给一个「看得见」的模型写提示词

一旦挂上参考图,提示词就不再是描述,而是指令。这个转变值得刻意去做,因为大多数人挂了图还在写描述,然后奇怪为什么什么都没变。

  • 先写什么变,再写什么不许变。「同一张脸、同一件外套、同样的取景」是有实际作用的。
  • 一次只改一件事。同时提两个修改,等来的是第三个你没要的修改。
  • 别再描述参考图已经呈现的东西。那些字会和像素争夺权重,通常输,更糟的是赢一半。
  • 用文字给每张参考图派活。没标注的参考图堆在一起会被混合,而混合很少是你想要的。
  • 如果某个属性总是从参考图里漏进来,把它裁掉。删掉像素比让模型「忽略它」可靠得多。

在信任它之前怎么测

信息量最大的实验只要两分钟:挂一张参考图,然后给一条和它矛盾的指令。参考图里外套是蓝的,你要红的。模型怎么处理,就告诉了你它的模态权重,也就告诉了你该怎么给它写字。

接着检查三种只有多模态 AI 才会有的失败。一是模态失衡,一路输入压倒另一路,另一路变装饰。二是参考图渗漏,你没要的属性跟着过来了:背景色、颗粒、画幅、一个 logo。三是长视频里的跨模态漂移,声音和画面开头对得上、结尾分开了,最明显的是几秒之后的口型。

这三种都不会在单模态测试里露面,而它们恰好决定了这个模型能不能干你心里想的那个活。

这个效果的提示词

一条能稳定出效果的起点。主体和场景可以换,技术性的那几句留着。

Keep the person and wardrobe from the reference image, change the season to late autumn, add low sun raking from camera left, same lens and framing

试一下:多模态 AI

打开生成器,参数已经预填好。

常见问题

用最直白的话说,它是什么?
一个模型能处理不止一种类型的输入或输出。纯文本模型读字写字;多模态模型可以一起读一张图和一句话,或者产出一段自带同步声音的视频,因为这些信号都活在同一套内部表示里。
它和把几个工具串起来有什么区别?
串联管道会先把图描述成文字,再把文字传下去,于是描述没提到的一切都丢了。联合建模是在读你的指令时直接看真实像素,所以它能保住某一张具体的脸、某一件具体的外套、某一种镜头味,这些都不是文字描述能带过去的。
为什么挂了参考图之后,模型开始不听我的文字?
因为模态权重是真实存在而且不均衡的。当指令和参考图冲突时,多数模型站在图那边,毕竟像素是比一句从句密得多的信号。写清楚什么要改、并且明确点名什么要保持不变,一次只提一个改动要求。
视频模型自带声音之后,流程有什么变化?
台词、音效、环境声生成出来就是和画面对齐的,直接省掉一整轮对轨和混音,这也是为什么现在台词写在提示词里。代价是可控性:你拿到的通常是一条混好的音轨而不是分轨,所以要换配乐或者改台词时机,就得规划成「先出静音版,再单独走一遍音频」。
多模态和多任务是一回事吗?
不是。多任务说的是一个模型能干几种活,这几种活可以都在同一个媒介里。多模态说的是跨过模型边界的数据类型有几种。一个模型可以只是其中之一,只不过现在的大系统往往两者都是。

相关术语