我用 AI 做了 8 张 YouTube 封面图:尺寸、构图,以及被我推翻重做的四张

我用 AI 做了 8 张 YouTube 封面图:尺寸、构图,以及被我推翻重做的四张

案例研究发布于

一条视频能不能被点开,封面占的比重比大多数人以为的高。我花了一个下午,用 AI 图像生成做了一整套 8 张 YouTube 封面图。中间四张被推翻重做,撞见一个跟通行经验相反的结果,还犯了一个更根本的错 —— 那个错值得单说。

先把规格量清楚,再动手

YouTube 封面图的推荐尺寸是 1280×720,也就是 16:9。这个数字很多人知道,但真正决定成片好坏的是另外两件事。

一是右下角会被视频时长的角标盖住一块。换算到 1280×720 上大约是 132×36 那么大,搁在那儿的东西会被压掉一半。

二是更容易被忽略的:封面在列表里根本不以原始尺寸显示。桌面端首页大约 360px 宽,手机推荐流常常只有 168px 上下。我把同一张 YouTube 封面按这三档缩下来并排放,差别一眼就出来 —— 360px 时道具和表情都还读得到,到 168px 时能识别的只剩一团颜色和一个人影。

YouTube 封面图的安全区与三档实际显示尺寸

所以我先给自己定了两条规矩:主体和关键信息全部收进四周留 6% 的中心安全区,右下角空出来不放东西。另外在画面里留一块干净区域,给后加的标题。

先出一张"试镜照",它才是整套的地基

八张 YouTube 封面里的人必须是同一个人,这是整件事最难的部分。

我的做法是先用 AI 图像生成 出一张干净的基准图:正面、平视、素颜、无表情、灰底、均匀光,像试镜照那样。这张图本身一点都不好看,也不打算发出去 —— 它唯一的用途是给后面每一张当参考。

用作参考的人物基准图:正面、素颜、均匀光

接下来就是我犯的那个错。

第一版我把构图也写死了:人在画面左三分之一、沿人形描一圈白边、脑后铺一组放射光、右半留一片纯色。每张只让表情和底色变。八张跑完,脸确实一点没飘,可摆在一起像一张情绪对照表,不像八个封面 —— 换个脸色、换个底色,仅此而已。

原因其实很简单:真实的封面是围绕"这期视频讲什么"设计出来的,而我给模型的变量只有一张脸的表情。它没有可设计的东西,只能把我的模板重复八遍。

改法是把设计权交回去。固定块只锁住必须锁的:同一个人、脸要打亮不被遮挡、上半身入镜。场景、道具、图形元素、配色、打光、纵深、构图,全部交给模型自己定。变量块换成一句话 —— 这期视频讲什么。

八条变量是这样的:辞职做全职、三十块的麦克风比三百块的好、卡在两百播放、一周剪一百条、连续一个月凌晨三点发、全套设备不如一部手机、五个该停用的调色预设、十二分钟写完脚本。

出来的东西跟第一版完全不是一个层级:一支红色麦克风和一支电容麦之间横着一个黄色箭头、屏幕上一条摔下去的红线配红叉、一整排预设缩略图被逐个打叉、凌晨三点的城市夜景配一只挂钟。这些图形语言全是 AI 图像模型自己想的,我一个字都没提。

八张成套的 YouTube 封面图

我以为它写不出字,结果它写对了

关于 AI 图像生成有一条流传很广的经验:模型写不出可读文字,图里的"字"一定是乱码。我一直照这条办,提示词里都加了一句"图里不要出现任何文字"。

收尾时我顺手验了一下,让它直接把标题写进留白处。

写对了。一个字母没错,字形干净、字重合适、三行断行也合理。这条老经验放在今天的 AI 图像模型上已经不太成立。

但我没因此改主意,因为紧接着的第二次测试暴露了真正的问题。我把标题里的 200 改成 500,别的一个词没动,重跑 —— 字依然写对,整个画面却被重新调度了:她从侧身坐姿变成正面居中,那块屏幕从最左边挪到了她背后,文字的大小和位置也跟着换。两张放一起,完全不像一套。

同一条提示词只改一个数字,整个画面重新调度

所以结论没变,理由变了。问题不在于它写不出字,而在于排版不可复现。要做一整套 YouTube 封面、以后还要换标题、还要 A/B 测试,那图里就只留画面,文字另外叠上去。只做一张、也不打算再改,让它顺手写掉反而省一步。

被我推翻重做的四张

把设计权交给 AI 图像模型,代价是它会顺手往画面里塞你没要的东西。四张返工,三种错法。

真实品牌。"辞职做全职"那张,它给她配了一支侧面印着真实厂商名的麦克风;"一周剪一百条"那张,桌上摆了两罐一眼就认得出的能量饮料。这两样都不能出现在要发布的图里。

主体被复制。补上禁品牌的条款重跑"辞职",画面里冒出了两个她 —— 一个坐在工位上敲电脑,另一个抱着纸箱站在旁边。模型把"离开办公室"理解成了需要两个人才能演的戏。

画面里冒出文字。"全套设备不如一部手机"那张,纸箱上被端端正正写了两个英文单词。这条尤其要命:配图是 21 个语种共用同一份,画面里出现任何一种语言的文字,对其余二十个语种的读者都是噪音。

三种翻车:真实品牌、主体被复制、画面里冒出文字

这三条后来都进了固定块,而且必须写得具体。"不要文字"不够,得写成"屏幕、包装、标签、器材、招牌上都不许有字";"只要一个人"也不够,得把"不许出现她的第二个身影、倒影或背景里的画像"一并堵上。

一套能直接抄的提示词结构

固定块每张原样复制,大意是这样:

使用参考图里的同一个人,同样的发型;她必须一眼认得出是同一个人,脸要打亮、不被遮挡、大致朝向镜头,上半身入镜。你是美术指导,要设计一张在 168 像素宽也能骗到点击的 YouTube 封面 —— 除了她的长相,场景、道具、图形元素、配色、打光、纵深、构图全部由你决定;做得大胆、对比强、贴着这期的选题走,不要一张纯色底上的普通人像。在画面里留一块干净区域,给后加的标题。严禁任何文字、字母、数字,屏幕、包装、标签、器材、招牌上都不许有;不许出现任何品牌 logo 或可辨认的商标,道具一律无标识;画面里只能有一个人。

变量块只有一句 —— 这期视频讲什么。

后面那三条禁令都是翻车之后补的,一条对应一次返工。这套固定块加变量块的结构换到别的 AI 图像模型上照样能用,变的只是措辞习惯。

同一张封面还能再用一次

八张定稿之后,AI 图像出的静帧还能再用一次 —— 我拿凌晨三点那张当首帧,用 首尾帧生成视频 生了一段五秒片头。

由 YouTube 封面图生成的片头动态

这里也有个真实的坑:生成出来的片段把画面重新构了图,原本留给标题的那块干净区域被吃掉大半。做片头这不算事,当片尾卡片用就得重新排版。

要一次跑一整组 YouTube 封面,在 生成式画布 上把八条 AI 图像任务并排铺开比一张张来顺手,改哪张、留哪张一眼看得到。不想从零写提示词,模板库 里有现成的人像风格可以套。

一个下午,八张成片

整套 YouTube 封面图从第一次提交到八张定稿,隔了一个下午,废掉四张。最花时间的既不是生成也不是修图,是想明白该把什么交给模型 —— 我一开始攥得太紧,把构图钉死,结果拿到八张长得一样的东西。

真要复刻,顺序是:先量清楚安全区和三档显示尺寸,再出一张不好看但干净的基准图,固定块只锁住人和那几条禁令,把每张的选题当成唯一的变量。文字这件事,做一套就后加,做一张就让它写。

整套 YouTube 封面图只用到两个 AI 图像工具,AI 图像生成AI 图像编辑

分享