
一个人能不能拍一支 AI 短片?分镜、角色一致性、镜头衔接的实操答案
能。但不是所有部分都能。
我用一个极简故事试了一遍:一个男人在旧外套口袋里摸到一张字条。8 个镜头,一个人,从一句话写到能连起来看的成片。下面把每一步的做法、卡住的地方和确切的代价都写出来。
一个人能拍完哪些部分,哪些拍不完
先说结论,免得你抱着错的期待往下读。
现在一个人能独立完成的:分镜、角色形象和角色一致性、每个镜头的画面、镜头之间的衔接、配音和口型。这些以前需要摄影、灯光、美术、演员,现在确实能一个人在桌面上做完。
现在还完成不了的:超过 5 秒的连续复杂动作、需要精确对上台词节奏的表演、画面里出现可读文字的镜头(后面会讲为什么)、以及任何需要真实场地和真人反应的内容。
所以 AI 短片目前最适合的长度是 30 秒到 2 分钟,由若干个短镜头拼起来。想一镜到底拍三分钟长镜头,现在别试 —— 这不是提示词写得不够好,是 AI 短片这条路径当下的物理上限。
怎么把一段文字变成分镜?
分镜是整支 AI 短片里最该先做、也最省钱的一步 —— 它便宜、快,而且能在你花大钱出成片之前就暴露故事的问题。
做法很直接:把故事拆成一句一个镜头,每句写清三件事 —— 景别、动作、光。然后用 AI 图像生成 出一版铅笔感的缩略图。

我这 8 格是这么拆的:全景交代房间 → 中景取下外套 → 特写手伸进口袋 → 特写掌心里的字条 → 中景抬头看窗外 → 全景穿外套走向门 → 门推开进晨光 → 远景背影走进街道。
AI 分镜阶段有个反常识的建议:别追求画得好。这一步只验三件事 —— 故事说不说得通、景别有没有变化、有没有多余的镜头。画得越糙,你越容易舍得删。我第一版有 11 格,删到 8 格之后节奏才对。
怎么让同一个角色在每个镜头都不变脸?
角色一致性是 AI 短片最容易崩的地方,也是我花时间最多的一步。
答案是:先做一张角色卡,后面每个镜头都拿它当参考,不要靠提示词描述人脸。角色一致性靠的是同一张参考图反复使用,不是靠把描述写得更细。

我先出一张干净的正面定妆照 —— 灰底、均匀光、素颜、不带情绪,就像试镜照。然后以它为参考补出四分之三侧、全侧和背面。这四张就是这支短片的"演员",后面每一个镜头都喂这张卡。
三条实操经验:
别用文字描述脸。「三十多岁、短黑发、有胡茬」这种描述能生成一百个不同的人。脸交给参考图,提示词只写这一镜要改的东西。
**背面和侧面要提前出。**等你拍到背影那一镜才去生成,大概率和正面不是同一个人。
**衣服写进每一条提示词。**角色一致性不只是脸,外套的颜色和款式一漂,观众照样看出接不上。这三条做到了,一支 AI 短片的角色一致性基本就稳了。
镜头之间怎么衔接才不跳?
最省力的办法是让上一镜的末帧直接当下一镜的首帧。

上面这两帧是同一个动作的前后半段:左边是他低头看字条,右边是他抬起头看向窗外。构图没动、光的方向没动、色调没动,只有头的角度和眼神变了 —— 剪在一起就是一个连贯的反应镜头。
用 首尾帧生成视频 把这两帧作为起点和终点,中间的过渡由模型补。这比让模型自己"演"一段完整动作稳得多,角色一致性也更容易保住 —— 两头都是你定好的画面,模型只负责中间。
衔接还有两个细节容易被忽略:光的方向必须一致。上一镜光从左边来,下一镜就不能从右边来,否则观众说不出哪里怪但就是觉得不对。色调要统一。我这 8 个镜头统一写了「清晨冷调」,写在每一条提示词里,不指望后期救。
怎么一次看完所有镜头,只改坏的那几个?
单张点开看会骗人 —— 每一张单独看都不错,连起来才发现第三镜的脸偏了。
我的做法是把 8 个镜头全铺在 生成式画布 上,按顺序排成一行,退远了看。角色一致性的问题在一行里最好抓 —— 哪一镜的脸飘了、哪一镜的光不对,横着一扫就出来了。不满意的单独重跑那一格,不用推倒整条。

这是我最后的 8 个镜头。第 3 镜的手重跑过两次,第 7 镜的逆光调过一次曝光。
声音怎么办?
画面到这一步就完了,但没有声音的 AI 短片撑不住 30 秒以上。
我这支是无台词的,所以只用了环境声。有台词的话顺序是:先用 AI 配音 出人声,或者用 声音克隆 复刻一个固定音色,再走 口型对齐 把嘴型贴上去。
顺序别倒过来 —— 先出画面再配音,你会发现嘴型和台词长度对不上;先定音频长度,画面按音频时长生成,返工少得多。
让画面动起来的边界在哪?

这 5 秒是从上面那一镜生成的:呼吸、一次眨眼、视线移开一点、眉头轻微收紧。
我试过让他"转身走向门口",连着做了三次都变形 —— 走两步之后脸就不是他了,角色一致性在动态里比在静帧里脆弱得多。所以边界很清楚:让人物在原地有细微反应,可靠;让人物完成一段位移或复杂动作,现在还不行。需要走动的镜头,我改成先出末帧,再用首尾帧过渡,而不是让模型自己演。
三处翻车,如实记录
画面里的字是假的。 我那张字条特写,放大看纸上的"字"全是乱码 —— 生成模型写不出可读文本。要么别拍清楚(虚焦、遮住一半),要么后期自己贴真字。这是目前最硬的限制之一。
手仍然要挨个查。 第 3 镜手伸进口袋那一格,第一版有一根手指的关节位置不对,重跑两次才拿到能用的。凡是手进画面的镜头都得放大看一遍。
连续动作会掉脸。 上面说过,超过两三秒的位移基本必崩,角色一致性是第一个失守的。
一份可抄的 8 镜头清单
按这个顺序做,基本不返工:
- 故事拆成一句一镜,每句写清景别、动作、光
- 出一版粗糙分镜,删到只剩必要的镜头
- 做角色卡锁死角色一致性:正面定妆 + 四分之三侧 + 全侧 + 背面
- 按分镜逐镜出图,每镜都喂角色卡,统一写死色调
- 需要衔接的地方,先出末帧再出首帧
- 全部铺在画布上横向比对,只重跑坏的
- 定音频长度,再让画面对齐音频
- 逐镜放大查手、耳朵、画面里的文字
整支 8 镜头的 AI 短片我用了约三小时,绝大部分时间在写提示词和挑片,生成本身很快。角色一致性和镜头衔接这两件事,做熟了之后每镜大概能省一半时间。
这个水平做片头、概念片、提案用的样片已经够了;要交付给客户的正片,我还是会用真实拍摄加 AI 补镜头的混合做法。想自己走一遍 AI 短片的流程,从 AI 视频生成 开始就行,起点只需要一句话。