
Seedream 5.0 Pro 實測:它和 Nano Banana Pro 的差距,就在這三件事上
Seedream 5.0 放出來之後,問得最多的一句是「要不要從 Nano Banana Pro 換過去」。這個問題看官方範例圖是回答不了的——範例圖都是挑過的。所以我把兩個模型擺在一起跑了三組,每組的提示詞一個字都沒動,只換模型。
結論先擺著:誰更強這個問法本身不太成立。這兩個 AI 影像模型聽話的地方不一樣,而且不一樣得很穩定。
Seedream 5.0 Pro 是什麼,和 Lite 差在哪
Seedream 5 是字節跳動這一代的 AI 影像模型,在 ZOOOP 上有 Pro 和 Lite 兩個版本。Pro 走的是「給它一段複雜描述、它盡量都做到」的路子;Lite 便宜、快,適合先出一堆草圖挑構圖。這次全程用 Pro,因為要比的就是理解複雜指令的能力。
一個容易踩的差別:Seedream 5.0 Pro 目前最高出到 2k,Nano Banana Pro 可以到 4k。如果你的成品要印刷或者要大幅裁切,這一條可能比後面三組測試都重要。兩者單張成本很接近,Seedream 5.0 Pro 略便宜一點,談不上誰划算。
測法:同一批提示詞,只換模型
三組測試,每組一條提示詞,兩個模型各跑一次,比例統一 16:9(人像那組 3:2),解析度統一 2k。沒有反覆重抽挑好的那張——挑過的圖看不出模型的脾氣。
三組分別打的是三種最常翻車的能力:一個畫面裡塞多個主體、同一張臉換場景、讓模型在畫面裡寫字。做 AI 影像生成 的人基本都在這三處栽過。
第一件事:一個畫面裡塞四個主體
提示詞寫了雨夜的路邊麵攤,四個主體各有各的位置:老闆在櫃檯後擦碗,穿黃色雨衣的女生坐最左邊的凳子上看手機,快遞員站在右側門口、頭盔夾在腋下,一隻橘貓蹲在最右邊的木箱堆上。燈光要暖色燈籠加濕地面反光。

四個主體,兩個模型都畫齊了,位置也都對——AI 影像生成一年前還經常直接漏掉一個。分歧在別的地方。
Seedream 5.0 Pro 把「頭盔夾在腋下」這個小動作做對了,招牌上的 RAMEN 拼寫也沒錯。它的畫面像一張排過版的海報:主體之間留白清楚,誰在哪一眼就能看出來。Nano Banana Pro 給的更像一張街拍——巷子真的往裡延伸,遠處有個撐傘的路人,燈籠上的日文可讀。代價是快遞員把頭盔端在身前而不是夾著,木箱上那幾個小字是亂碼。
第二件事:同一張臉,換兩個場景
人物一致性大概是 AI 影像裡最費錢的一課。先用 GPT Image 2 出一張乾淨的基準圖:正面、灰底、均勻光、素顏,像試鏡照。然後把這張圖當參考餵給兩個模型,讓同一個人分別出現在黃昏天台和白天圖書館。


臉都保住了,這一關兩個都算過。往細看就有意思了。
Seedream 5.0 Pro 的臉型最貼基準圖,眉骨、鼻梁、唇形幾乎是複製過去的。但它兩次都給了正面平光——我在提示詞裡明確要了「三分之三側面」和「左側低角度側光」,它當沒看見。Nano Banana Pro 反過來:側面角度和光的方向都照做了,圖書館那張還自己補了背景裡的另一個讀者和攤開的書,骨相有點輕微漂移,可還是同一個人。皮膚上多出來一些雀斑,基準圖上沒有。
這裡有個兩個模型都會犯的事,值得單獨記一筆:它們都自動繼承了基準圖上那件黑色背心。參考圖帶走的不只是臉,還有服裝、髮型長度、甚至體態。不想要就得在提示詞裡明說換掉。想拿參考圖做定向修改的話,AI 影像編輯 比重新描述一遍更省事。
第三件事:讓它在畫面裡寫字
這一組是我最想驗的。提示詞要求麵包店門口的黑板菜單上「恰好三行字」,內容逐字給定:SOURDOUGH 4.50 / CROISSANT 3.20 / CLOSED MONDAYS。

兩個都把字拼對了。一個字母都沒錯。「AI 影像模型寫不出可讀文字」這條老經驗,至少在英文短句上已經不成立了。
但版式是另一回事。Seedream 5.0 Pro 三行就是三行,品名和價格在同一行,照做。Nano Banana Pro 字全對,卻把每一項拆成了兩行——三行變五行,小數點還寫成了居中點。如果這張圖是要直接當卡片或者縮圖用,版式錯了就得重出。
什麼時候用哪個
三組測下來,選哪個 AI 影像模型的分界線其實很清楚。
要一張「看起來是設計過的圖」——海報、封面、縮圖、帶文案的版面——用 Seedream 5.0 Pro。它對文字內容、行數、主體擺位這類結構性指令更當真。要一張「看起來是真拍的照片」——機位、光位、環境縱深、背景裡的生活細節——用 Nano Banana Pro,它在這塊的表現更像相機而不是插畫筆。
另外兩條實用建議。人物一致性的活,兩個都可以,但要先花一張的成本做一張乾淨的正面基準圖,後面每張都拿它當參考,這比每次靠提示詞描述長相靠譜得多。要 4k 成品的話沒得選,只有 Nano Banana Pro。
真要做決定,最省事的辦法是在 生成式畫布 上把同一條提示詞丟給兩個模型並排跑一遍,兩張圖擺在一起看,比讀任何評測都快。ZOOOP 上還有 Nano Banana 2、Seedream 5.0 Lite、GPT Image 2、Flux 2……不同活換不同模型是常態。
我沒測出來的部分
得說清楚這次的邊界。AI 影像生成這塊迭代太快,這篇的有效期大概也就幾個月。每組只跑了一次,沒做多輪取樣,所以「這次贏」不等於「每次都贏」。沒測的還有:連續多輪編輯同一張圖的穩定性、產品和建築這類非人類主體的一致性、畫面裡的中文字(英文過了不代表中文過),以及極端長寬比。
Seedream 5.0 Pro 和 Nano Banana Pro 都還在往前跑。如果你手上正好有這幾類需求,別照搬我的結論,用自己的素材在 工具總覽 裡挑兩個模型各跑一次——一條提示詞的成本,換一個不用猜的答案。