一個人能不能拍一支 AI 短片?分鏡、角色一致性、鏡頭銜接的實操答案

一個人能不能拍一支 AI 短片?分鏡、角色一致性、鏡頭銜接的實操答案

教學發佈於

能。但不是所有部分都能。

我用一個極簡故事試了一遍:一個男人在舊外套口袋裡摸到一張字條。8 個鏡頭,一個人,從一句話寫到能連起來看的成片。下面把每一步的做法、卡住的地方和確切的代價都寫出來。

一個人能拍完哪些部分,哪些拍不完

先說結論,免得你抱著錯的期待往下讀。

現在一個人能獨立完成的:分鏡、角色形象和角色一致性、每個鏡頭的畫面、鏡頭之間的銜接、配音和口型。這些以前需要攝影、燈光、美術、演員,現在確實能一個人在桌面上做完。

現在還完成不了的:超過 5 秒的連續複雜動作、需要精確對上台詞節奏的表演、畫面裡出現可讀文字的鏡頭(後面會講為什麼)、以及任何需要真實場地和真人反應的內容。

所以 AI 短片目前最適合的長度是 30 秒到 2 分鐘,由若干個短鏡頭拼起來。想一鏡到底拍三分鐘長鏡頭,現在別試 —— 這不是提示詞寫得不夠好,是 AI 短片這條路徑當下的物理上限。

怎麼把一段文字變成分鏡?

分鏡是整支 AI 短片裡最該先做、也最省錢的一步 —— 它便宜、快,而且能在你花大錢出成片之前就暴露故事的問題。

做法很直接:把故事拆成一句一個鏡頭,每句寫清三件事 —— 景別、動作、光。然後用 AI 圖片生成 出一版鉛筆感的縮略圖。

一支 AI 短片的 8 格分鏡表,鉛筆縮略圖風格

我這 8 格是這麼拆的:全景交代房間 → 中景取下外套 → 特寫手伸進口袋 → 特寫掌心裡的字條 → 中景抬頭看窗外 → 全景穿外套走向門 → 門推開進晨光 → 遠景背影走進街道。

分鏡階段有個反常識的建議:別追求畫得好。這一步只驗三件事 —— 故事說不說得通、景別有沒有變化、有沒有多餘的鏡頭。畫得越糙,你越容易捨得刪。我第一版有 11 格,刪到 8 格之後節奏才對。

怎麼讓同一個角色在每個鏡頭都不變臉?

角色一致性是 AI 短片最容易崩的地方,也是我花時間最多的一步。

答案是:先做一張角色卡,後面每個鏡頭都拿它當參考,不要靠提示詞描述人臉。角色一致性靠的是同一張參考圖反覆使用,不是靠把描述寫得更細。

AI 短片的角色卡:同一個人的正面、四分之三側、全側、背面四個角度

我先出一張乾淨的正面定妝照 —— 灰底、均勻光、素顏、不帶情緒,就像試鏡照。然後以它為參考補出四分之三側、全側和背面。這四張就是這支短片的「演員」,後面每一個鏡頭都餵這張卡。

三條實操經驗:

別用文字描述臉。「三十多歲、短黑髮、有鬍渣」這種描述能生成一百個不同的人。臉交給參考圖,提示詞只寫這一鏡要改的東西。

**背面和側面要提前出。**等你拍到背影那一鏡才去生成,大概率和正面不是同一個人。

**衣服寫進每一條提示詞。**角色一致性不只是臉,外套的顏色和款式一漂,觀眾照樣看出接不上。這三條做到了,一支 AI 短片的角色一致性基本就穩了。

鏡頭之間怎麼銜接才不跳?

最省力的辦法是讓上一鏡的末幀直接當下一鏡的首幀

上一鏡末幀作為下一鏡首幀的銜接示意:兩幀構圖、光線、色調完全延續

上面這兩幀是同一個動作的前後半段:左邊是他低頭看字條,右邊是他抬起頭看向窗外。構圖沒動、光的方向沒動、色調沒動,只有頭的角度和眼神變了 —— 剪在一起就是一個連貫的反應鏡頭。

首尾幀生成影片 把這兩幀作為起點和終點,中間的過渡由模型補。這比讓模型自己「演」一段完整動作穩得多,角色一致性也更容易保住 —— 兩頭都是你定好的畫面,模型只負責中間。

銜接還有兩個細節容易被忽略:光的方向必須一致。上一鏡光從左邊來,下一鏡就不能從右邊來,否則觀眾說不出哪裡怪但就是覺得不對。色調要統一。我這 8 個鏡頭統一寫了「清晨冷調」,寫在每一條提示詞裡,不指望後期救。

怎麼一次看完所有鏡頭,只改壞的那幾個?

單張點開看會騙人 —— 每一張單獨看都不錯,連起來才發現第三鏡的臉偏了。

我的做法是把 8 個鏡頭全鋪在 生成式畫布 上,按順序排成一行,退遠了看。角色一致性的問題在一行裡最好抓 —— 哪一鏡的臉飄了、哪一鏡的光不對,橫著一掃就出來了。不滿意的單獨重跑那一格,不用推倒整條。

一支 AI 短片的 8 個成片鏡頭,統一清晨冷調

這是我最後的 8 個鏡頭。第 3 鏡的手重跑過兩次,第 7 鏡的逆光調過一次曝光。

聲音怎麼辦?

畫面到這一步就完了,但沒有聲音的 AI 短片撐不住 30 秒以上。

我這支是無台詞的,所以只用了環境聲。有台詞的話順序是:先用 AI 配音 出人聲,或者用 聲音複製 複刻一個固定音色,再走 口型對齊 把嘴型貼上去。

順序別倒過來 —— 先出畫面再配音,你會發現嘴型和台詞長度對不上;先定音訊長度,畫面按音訊時長生成,返工少得多。

讓畫面動起來的邊界在哪?

由一個鏡頭生成的 5 秒動態:他握著字條,眨眼,視線沿窗外移開

這 5 秒是從上面那一鏡生成的:呼吸、一次眨眼、視線移開一點、眉頭輕微收緊。

我試過讓他「轉身走向門口」,連著做了三次都變形 —— 走兩步之後臉就不是他了,角色一致性在動態裡比在靜幀裡脆弱得多。所以邊界很清楚:讓人物在原地有細微反應,可靠;讓人物完成一段位移或複雜動作,現在還不行。需要走動的鏡頭,我改成先出末幀,再用首尾幀過渡,而不是讓模型自己演。

三處翻車,如實記錄

畫面裡的字是假的。 我那張字條特寫,放大看紙上的「字」全是亂碼 —— 生成模型寫不出可讀文本。要麼別拍清楚(虛焦、遮住一半),要麼後期自己貼真字。這是目前最硬的限制之一。

手仍然要挨個查。 第 3 鏡手伸進口袋那一格,第一版有一根手指的關節位置不對,重跑兩次才拿到能用的。凡是手進畫面的鏡頭都得放大看一遍。

連續動作會掉臉。 上面說過,超過兩三秒的位移基本必崩,角色一致性是第一個失守的。

一份可抄的 8 鏡頭清單

按這個順序做,基本不返工:

  1. 故事拆成一句一鏡,每句寫清景別、動作、光
  2. 出一版粗糙分鏡,刪到只剩必要的鏡頭
  3. 做角色卡鎖死角色一致性:正面定妝 + 四分之三側 + 全側 + 背面
  4. 按分鏡逐鏡出圖,每鏡都餵角色卡,統一寫死色調
  5. 需要銜接的地方,先出末幀再出首幀
  6. 全部鋪在畫布上橫向比對,只重跑壞的
  7. 定音訊長度,再讓畫面對齊音訊
  8. 逐鏡放大查手、耳朵、畫面裡的文字

整支 8 鏡頭的 AI 短片我用了約三小時,絕大部分時間在寫提示詞和挑片,生成本身很快。角色一致性和鏡頭銜接這兩件事,做熟了之後每鏡大概能省一半時間。

這個水平做片頭、概念片、提案用的樣片已經夠了;要交付給客戶的正片,我還是會用真實拍攝加 AI 補鏡頭的混合做法。想自己走一遍 AI 短片的流程,從 AI 影片生成 開始就行,起點只需要一句話。

分享