联合理解,不是接力赛
判断一个系统算不算多模态 AI,要紧的区别不在架构图上有几个方框,而在于信号有没有真的碰面。
接力式管道先把参考图描述成文字,把文字交给生成器,然后把像素丢掉。描述里没提的一切就此消失:那张具体的脸、那件外套的织纹、那盏实体光落下来的方式。你能在成图里感觉到这件事:主题对了,具体全错。
联合建模两样都留着。图像 token 和文字 token 坐在同一个注意力操作里,于是一条指令可以指向画面里的某个东西。这是指令式编辑的全部基础,也是一组图里角色能一直是同一个人、以及参考图组合里每张图各司其职的基础。
你在哪儿会真的碰到它
在理解侧,多模态 AI 安静地待在生成周边的大部分工具里。提示词增强会先读你的参考图再改写提示词;自动打标在造训练和检索数据;内容审核看的是生成出来的画面而不只是你写的字;评测框架用视觉模型给「输出是否符合要求」打分,大规模横评能做起来全靠这一点。
在生成侧,它明摆着出现在四个地方:
- 图 + 指令进,图出。对话式编辑,以及角色一致性不再需要训练任何东西的原因。
- 多张参考图各带角色分工:身份来自第一张,服装来自第二张,光来自第三张。
- 图 + 文字进,视频出。参考图锁住了外观,提示词就可以整条都花在运动上。
- 自带同步音频的视频:人声、音效、房间声是和画面一起生成的,不是事后拼上去的。
给一个「看得见」的模型写提示词
一旦挂上参考图,提示词就不再是描述,而是指令。这个转变值得刻意去做,因为大多数人挂了图还在写描述,然后奇怪为什么什么都没变。
- 先写什么变,再写什么不许变。「同一张脸、同一件外套、同样的取景」是有实际作用的。
- 一次只改一件事。同时提两个修改,等来的是第三个你没要的修改。
- 别再描述参考图已经呈现的东西。那些字会和像素争夺权重,通常输,更糟的是赢一半。
- 用文字给每张参考图派活。没标注的参考图堆在一起会被混合,而混合很少是你想要的。
- 如果某个属性总是从参考图里漏进来,把它裁掉。删掉像素比让模型「忽略它」可靠得多。
在信任它之前怎么测
信息量最大的实验只要两分钟:挂一张参考图,然后给一条和它矛盾的指令。参考图里外套是蓝的,你要红的。模型怎么处理,就告诉了你它的模态权重,也就告诉了你该怎么给它写字。
接着检查三种只有多模态 AI 才会有的失败。一是模态失衡,一路输入压倒另一路,另一路变装饰。二是参考图渗漏,你没要的属性跟着过来了:背景色、颗粒、画幅、一个 logo。三是长视频里的跨模态漂移,声音和画面开头对得上、结尾分开了,最明显的是几秒之后的口型。
这三种都不会在单模态测试里露面,而它们恰好决定了这个模型能不能干你心里想的那个活。