Seedream 5.0 Pro 实测:它和 Nano Banana Pro 的差距,就在这三件事上

Seedream 5.0 Pro 实测:它和 Nano Banana Pro 的差距,就在这三件事上

洞察发布于

Seedream 5.0 放出来之后,问得最多的一句是"要不要从 Nano Banana Pro 换过去"。这个问题看官方样图是回答不了的——样图都是挑过的。所以我把两个模型摆在一起跑了三组,每组的提示词一个字都没动,只换模型。

结论先摆着:谁更强这个问法本身不太成立。这两个 AI 图像模型听话的地方不一样,而且不一样得很稳定。

Seedream 5.0 Pro 是什么,和 Lite 差在哪

Seedream 5 是字节这一代的 AI 图像模型,在 ZOOOP 上有 Pro 和 Lite 两个版本。Pro 走的是"给它一段复杂描述、它尽量都做到"的路子;Lite 便宜、快,适合先出一堆草图挑构图。这次全程用 Pro,因为要比的就是理解复杂指令的能力。

一个容易踩的差别:Seedream 5.0 Pro 目前最高出到 2k,Nano Banana Pro 可以到 4k。如果你的成品要印刷或者要大幅裁切,这一条可能比后面三组测试都重要。两者单张成本很接近,Seedream 5.0 Pro 略便宜一点,谈不上谁划算。

测法:同一批提示词,只换模型

三组测试,每组一条提示词,两个模型各跑一次,比例统一 16:9(人像那组 3:2),分辨率统一 2k。没有反复重抽挑好的那张——挑过的图看不出模型的脾气。

三组分别打的是三种最常翻车的能力:一个画面里塞多个主体、同一张脸换场景、让模型在画面里写字。做 AI 图像生成 的人基本都在这三处栽过。

第一件事:一个画面里塞四个主体

提示词写了雨夜的路边面摊,四个主体各有各的位置:老板在柜台后擦碗,穿黄色雨衣的女生坐最左边的凳子上看手机,快递员站在右侧门口、头盔夹在腋下,一只橘猫蹲在最右边的木箱堆上。灯光要暖色灯笼加湿地面反光。

多主体场景,同一条提示词,Seedream 5.0 Pro 与 Nano Banana Pro

四个主体,两个模型都画齐了,位置也都对——AI 图像生成一年前还经常直接漏掉一个。分歧在别的地方。

Seedream 5.0 Pro 把"头盔夹在腋下"这个小动作做对了,招牌上的 RAMEN 拼写也没错。它的画面像一张排过版的海报:主体之间留白清楚,谁在哪一眼就能看出来。Nano Banana Pro 给的更像一张街拍——巷子真的往里延伸,远处有个撑伞的路人,灯笼上的日文可读。代价是快递员把头盔端在身前而不是夹着,木箱上那几个小字是乱码。

第二件事:同一张脸,换两个场景

人物一致性大概是 AI 图像里最费钱的一课。先用 GPT Image 2 出一张干净的基准图:正面、灰底、均匀光、素颜,像试镜照。然后把这张图当参考喂给两个模型,让同一个人分别出现在黄昏天台和白天图书馆。

基准参考图

人物一致性:同一张参考图,两个场景,两个模型

脸都保住了,这一关两个都算过。往细看就有意思了。

Seedream 5.0 Pro 的脸型最贴基准图,眉骨、鼻梁、唇形几乎是复制过去的。但它两次都给了正面平光——我在提示词里明确要了"三分之三侧面"和"左侧低角度侧光",它当没看见。Nano Banana Pro 反过来:侧面角度和光的方向都照做了,图书馆那张还自己补了背景里的另一个读者和摊开的书,骨相有点轻微漂移,可还是同一个人。皮肤上多出来一些雀斑,基准图上没有。

这里有个两个模型都会犯的事,值得单独记一笔:它们都自动继承了基准图上那件黑色背心。参考图带走的不只是脸,还有服装、发型长度、甚至体态。不想要就得在提示词里明说换掉。想拿参考图做定向修改的话,AI 图像编辑 比重新描述一遍更省事。

第三件事:让它在画面里写字

这一组是我最想验的。提示词要求面包店门口的黑板菜单上"恰好三行字",内容逐字给定:SOURDOUGH 4.50 / CROISSANT 3.20 / CLOSED MONDAYS。

画面文字:三行指定文案,两个模型的结果

两个都把字拼对了。一个字母都没错。"AI 图像模型写不出可读文字"这条老经验,至少在英文短句上已经不成立了。

但版式是另一回事。Seedream 5.0 Pro 三行就是三行,品名和价格在同一行,照做。Nano Banana Pro 字全对,却把每一项拆成了两行——三行变五行,小数点还写成了居中点。如果这张图是要直接当卡片或者缩略图用,版式错了就得重出。

什么时候用哪个

三组测下来,选哪个 AI 图像模型的分界线其实很清楚。

要一张"看起来是设计过的图"——海报、封面、缩略图、带文案的版面——用 Seedream 5.0 Pro。它对文字内容、行数、主体摆位这类结构性指令更当真。要一张"看起来是真拍的照片"——机位、光位、环境纵深、背景里的生活细节——用 Nano Banana Pro,它在这块的表现更像相机而不是插画笔。

另外两条实用建议。人物一致性的活,两个都可以,但要先花一张的成本做一张干净的正面基准图,后面每张都拿它当参考,这比每次靠提示词描述长相靠谱得多。要 4k 成品的话没得选,只有 Nano Banana Pro。

真要做决定,最省事的办法是在 生成式画布 上把同一条提示词丢给两个模型并排跑一遍,两张图摆在一起看,比读任何评测都快。ZOOOP 上还有 Nano Banana 2、Seedream 5.0 Lite、GPT Image 2、Flux 2……不同活换不同模型是常态。

我没测出来的部分

得说清楚这次的边界。AI 图像生成这块迭代太快,这篇的有效期大概也就几个月。每组只跑了一次,没做多轮采样,所以"这次赢"不等于"每次都赢"。没测的还有:连续多轮编辑同一张图的稳定性、产品和建筑这类非人类主体的一致性、画面里的中文字(英文过了不代表中文过),以及极端长宽比。

Seedream 5.0 Pro 和 Nano Banana Pro 都还在往前跑。如果你手上正好有这几类需求,别照搬我的结论,用自己的素材在 工具总览 里挑两个模型各跑一次——一条提示词的成本,换一个不用猜的答案。

分享