我用 AI 做了 8 張 YouTube 縮圖:尺寸、構圖,以及被我推翻重做的四張
一支影片能不能被點開,縮圖佔的比重比大多數人以為的高。我花了一個下午,用 AI 圖像生成做了一整套 8 張 YouTube 縮圖。中間四張被推翻重做,撞見一個跟通行經驗相反的結果,還犯了一個更根本的錯 —— 那個錯值得單獨說。
先把規格量清楚,再動手
YouTube 縮圖的建議尺寸是 1280×720,也就是 16:9。這個數字很多人知道,但真正決定成品好壞的是另外兩件事。
一是右下角會被影片時長的角標蓋住一塊。換算到 1280×720 上大約是 132×36 那麼大,擺在那兒的東西會被壓掉一半。
二是更容易被忽略的:縮圖在列表裡根本不以原始尺寸顯示。桌機首頁大約 360px 寬,手機推薦流常常只有 168px 上下。我把同一張 YouTube 縮圖按這三檔縮下來並排放,差別一眼就出來 —— 360px 時道具和表情都還讀得到,到 168px 時能辨認的只剩一團顏色和一個人影。
![]()
所以我先給自己定了兩條規矩:主體和關鍵資訊全部收進四周留 6% 的中心安全區,右下角空出來不放東西。另外在畫面裡留一塊乾淨區域,給後加的標題。
先出一張「試鏡照」,它才是整套的地基
八張 YouTube 縮圖裡的人必須是同一個人,這是整件事最難的部分。
我的做法是先用 AI 圖像生成 出一張乾淨的基準圖:正面、平視、素顏、無表情、灰底、均勻光,像試鏡照那樣。這張圖本身一點都不好看,也不打算發出去 —— 它唯一的用途是給後面每一張當參考。
![]()
接下來就是我犯的那個錯。
第一版我把構圖也寫死了:人在畫面左三分之一、沿人形描一圈白邊、腦後鋪一組放射光、右半留一片純色。每張只讓表情和底色變。八張跑完,臉確實一點沒飄,可擺在一起像一張情緒對照表,不像八張縮圖 —— 換個臉色、換個底色,僅此而已。
原因其實很簡單:真實的縮圖是圍繞「這集影片講什麼」設計出來的,而我給模型的變數只有一張臉的表情。它沒有可設計的東西,只能把我的範本重複八遍。
改法是把設計權交回去。固定塊只鎖住必須鎖的:同一個人、臉要打亮不被遮擋、上半身入鏡。場景、道具、圖形元素、配色、打光、縱深、構圖,全部交給模型自己定。變數塊換成一句話 —— 這集影片講什麼。
八條變數是這樣的:辭職做全職、三十塊的麥克風比三百塊的好、卡在兩百觀看、一週剪一百支、連續一個月凌晨三點發、全套設備不如一支手機、五個該停用的調色預設、十二分鐘寫完腳本。
出來的東西跟第一版完全不是一個層級:一支紅色麥克風和一支電容麥之間橫著一個黃色箭頭、螢幕上一條摔下去的紅線配紅叉、一整排預設縮圖被逐個打叉、凌晨三點的城市夜景配一只掛鐘。這些圖形語言全是 AI 圖像模型自己想的,我一個字都沒提。
![]()
我以為它寫不出字,結果它寫對了
關於 AI 圖像生成有一條流傳很廣的經驗:模型寫不出可讀文字,圖裡的「字」一定是亂碼。我一直照這條辦,提示詞裡都加了一句「圖裡不要出現任何文字」。
收尾時我順手驗了一下,讓它直接把標題寫進留白處。
寫對了。一個字母沒錯,字形乾淨、字重合適、三行斷行也合理。這條老經驗放在今天的 AI 圖像模型上已經不太成立。
但我沒因此改主意,因為緊接著的第二次測試暴露了真正的問題。我把標題裡的 200 改成 500,別的一個詞沒動,重跑 —— 字依然寫對,整個畫面卻被重新調度了:她從側身坐姿變成正面置中,那塊螢幕從最左邊挪到了她背後,文字的大小和位置也跟著換。兩張放一起,完全不像一套。
![]()
所以結論沒變,理由變了。問題不在於它寫不出字,而在於排版不可複現。要做一整套 YouTube 縮圖、以後還要換標題、還要 A/B 測試,那圖裡就只留畫面,文字另外疊上去。只做一張、也不打算再改,讓它順手寫掉反而省一步。
被我推翻重做的四張
把設計權交給 AI 圖像模型,代價是它會順手往畫面裡塞你沒要的東西。四張返工,三種錯法。
真實品牌。「辭職做全職」那張,它給她配了一支側面印著真實廠商名的麥克風;「一週剪一百支」那張,桌上擺了兩罐一眼就認得出的能量飲料。這兩樣都不能出現在要發布的圖裡。
主體被複製。補上禁品牌的條款重跑「辭職」,畫面裡冒出了兩個她 —— 一個坐在工位上敲電腦,另一個抱著紙箱站在旁邊。模型把「離開辦公室」理解成了需要兩個人才能演的戲。
畫面裡冒出文字。「全套設備不如一支手機」那張,紙箱上被端端正正寫了兩個英文單字。這條尤其要命:配圖是 21 個語種共用同一份,畫面裡出現任何一種語言的文字,對其餘二十個語種的讀者都是雜訊。
![]()
這三條後來都進了固定塊,而且必須寫得具體。「不要文字」不夠,得寫成「螢幕、包裝、標籤、器材、招牌上都不許有字」;「只要一個人」也不夠,得把「不許出現她的第二個身影、倒影或背景裡的畫像」一併堵上。
一套能直接抄的提示詞結構
固定塊每張原樣複製,大意是這樣:
使用參考圖裡的同一個人,同樣的髮型;她必須一眼認得出是同一個人,臉要打亮、不被遮擋、大致朝向鏡頭,上半身入鏡。你是美術指導,要設計一張在 168 像素寬也能騙到點擊的 YouTube 縮圖 —— 除了她的長相,場景、道具、圖形元素、配色、打光、縱深、構圖全部由你決定;做得大膽、對比強、貼著這集的選題走,不要一張純色底上的普通人像。在畫面裡留一塊乾淨區域,給後加的標題。嚴禁任何文字、字母、數字,螢幕、包裝、標籤、器材、招牌上都不許有;不許出現任何品牌 logo 或可辨認的商標,道具一律無標識;畫面裡只能有一個人。
變數塊只有一句 —— 這集影片講什麼。
後面那三條禁令都是翻車之後補的,一條對應一次返工。這套固定塊加變數塊的結構換到別的 AI 圖像模型上照樣能用,變的只是措辭習慣。
同一張縮圖還能再用一次
八張定稿之後,AI 圖像出的靜幀還能再用一次 —— 我拿凌晨三點那張當首幀,用 首尾幀生成影片 生了一段五秒片頭。
![]()
這裡也有個真實的坑:生成出來的片段把畫面重新構了圖,原本留給標題的那塊乾淨區域被吃掉大半。做片頭這不算事,當片尾卡片用就得重新排版。
要一次跑一整組 YouTube 縮圖,在 生成式畫布 上把八條 AI 圖像任務並排鋪開比一張張來順手,改哪張、留哪張一眼看得到。不想從零寫提示詞,模板庫 裡有現成的人像風格可以套。
一個下午,八張成品
整套 YouTube 縮圖從第一次提交到八張定稿,隔了一個下午,廢掉四張。最花時間的既不是生成也不是修圖,是想明白該把什麼交給模型 —— 我一開始攥得太緊,把構圖釘死,結果拿到八張長得一樣的東西。
真要複刻,順序是:先量清楚安全區和三檔顯示尺寸,再出一張不好看但乾淨的基準圖,固定塊只鎖住人和那幾條禁令,把每張的選題當成唯一的變數。文字這件事,做一套就後加,做一張就讓它寫。