我做了一次 AI 寫真:從一張自拍到 15 張成品的完整過程

我做了一次 AI 寫真:從一張自拍到 15 張成品的完整過程

教學發佈於

去攝影棚拍一套形象照,約時間、化妝、通勤、等修圖,一週就過去了。我這次換了個做法:找了一張最普通的手機自拍當起點,全程在 ZOOOP 上做 AI 寫真,最後拿到 15 張能直接用的成品 —— 商務形象照、生日、旅行、咖啡館生活感各一組。

這篇把過程完整寫一遍,包括中間翻車的地方。

為什麼現在真的不用去攝影棚了

一年前我不會寫這篇。那時候的模型換件衣服就換張臉,同一個人在三張圖裡像三胞胎,拿去當形象照根本不敢用。

現在變了的是「同一張臉」這件事。你給模型一張參考圖,它能在換裝、換光、換城市之後還保住原來的骨相和皮膚質感 —— 身份一致性一直是 AI 人像最難的一關,過了這關,AI 寫真才從玩具變成能用的東西。攝影棚給你的是燈光和場地,而這兩樣恰好是模型現在最擅長模擬的。

真人攝影師仍然有不可替代的部分:現場溝通、抓你自己都不知道的表情、以及那些必須真實存在的場合照。這篇不打算說 AI 寫真能取代拍照,只說它能替你省掉哪一類的拍照。

起點素材:一張普通自拍就夠

我用的起點是這張,沒有任何加工:

用來做 AI 寫真的起點素材:一張普通手機自拍,自然光偏暗、沒化妝、沒修圖

光線難看、構圖隨意、皮膚紋理和瑕疵都在 —— 這恰好是好素材。AI 人像最怕的起點反而是那種已經磨過皮、開過美顏的照片:模型會把濾鏡當成你的皮膚本來的樣子,後面每一張都帶著一層塑膠感。

AI 人像對起點素材的要求其實只有三條:臉朝正前方或接近正面、五官沒被頭髮和眼鏡遮住、解析度別太低。滿足這三條,手機隨手拍的就夠。真需要重拍的情況其實很少:嚴重側臉、逆光只剩剪影、或者整張臉都在陰影裡。

如果你想更穩一點,可以多拍兩三張不同角度的一起餵進去 —— 參考圖越多,模型對你的臉的判斷越不容易跑偏。

換裝、換髮型、換妝容:三步鎖住同一張臉

第一步換衣服。我把上面那張自拍當參考圖,讓它在同一片灰底和同一盞光下換三套:白襯衫、燕麥色針織、深灰風衣。

同一個人在同一光線下換三套衣服的 AI 寫真三聯圖

三張的臉是同一張,這是這一步唯一要驗的事。衣服的褶皺和材質對不對是次要的 —— AI 人像裡臉一變,後面做得再好也白做。

第二步換髮型和妝容,從素顏一路推到濃一點的:

從素顏到日常妝、到濃妝、再到短髮鮑伯頭的 AI 人像四格對比

這一步我踩了個坑:一開始把「換髮型」和「換場景」寫在同一句提示詞裡,結果模型顧此失彼,髮型對了臉就飄。後來拆成兩次做,一次只改一件事,成功率立刻上去了。這是我這次最有用的一條經驗 —— 每次只動一個變數。

AI 圖片生成 出這一批的時候,提示詞裡我固定寫死三樣:同一個人、同一個機位、同一種光。剩下的才寫這次要改什麼。

換場景:同一張臉放進不同城市和光線

場景是 AI 寫真最划算的一步 —— 真去拍,這三張要跑三個地方、等三種光。

同一個人在窗邊柔光、街頭黃昏、攝影棚黑背景三種光線下的 AI 寫真

左邊是窗邊柔光,光包著臉走,陰影過渡很軟;中間是街頭黃昏,低角度的太陽擦著顴骨過去;右邊是攝影棚黑底加單側硬光,另半邊臉直接壓進暗部。

寫提示詞的時候,場景要連著光一起寫。只寫「在街上」模型只會給你一條街,寫「黃昏低角度側光、背景店鋪燈光散焦」才會給你這張。光的方向、硬軟、色溫,這三個詞對 AI 人像的影響比景物本身大得多。

四種常見場景的提示詞範本

我按最常被要的四種場合各做了一張,可以直接照著改:

商務形象照、生日、旅行、咖啡館四種場景的 AI 寫真四格

商務形象照:淺灰純色背景、正面均勻柔光、深色西裝外套、閉嘴微笑、齊胸構圖。別加環境元素,越乾淨越像正經證件照 —— 這也是最容易一次成的一類 AI 人像。

生日:暖色串燈做背景散焦、手裡端蛋糕蠟燭、光源來自蛋糕本身(自下往上的暖光)、大笑。關鍵是把「蠟燭是主光」寫出來,否則整張會平。

旅行:亞麻襯衫、日曬的石板街、風吹起頭髮、背景建築過曝一點。這類圖不要追求皮膚完美,一點粗糙感反而真。

咖啡館生活感:靠窗側光、雙手捧杯、清晨的冷調白光、放鬆的半側臉。別寫「看鏡頭」,視線略偏更自然。

情侶和孕期這兩類也能做,思路一樣 —— 前者要在參考圖裡同時給兩個人的臉,後者把體態和衣著寫清楚。不管做哪種 AI 寫真,改的還是那三件事:衣服、光、場景。

翻車合集:放大後才看得見的地方

100% 看沒問題,放大到 200% 就是另一回事了。我把三個最容易出事的地方圈出來:

AI 寫真最容易出問題的三處細節:手指、耳朵與眼鏡腿、髮際線邊緣

。左邊這張就是現成的反面教材 —— 手指的數量和關節位置一眼看著還行,細看會發現有兩根黏在一起了。凡是構圖裡出現手,一定放大查。

耳朵、耳飾、眼鏡腿。這三樣經常互相穿模:眼鏡腿從耳朵中間穿過去、耳釘長在耳廓上、兩隻耳朵不對稱。戴眼鏡的人做 AI 人像,這裡的翻車率最高。

髮際線和邊緣。頭髮和背景交界處容易糊成一片或者出現硬邊,黑髮配淺背景時最明顯 —— 這是 AI 人像最常被一眼認出來的地方。

三個地方都能救:圈出問題區域走一次 AI 圖片編輯 局部重修,比整張重生成便宜也快。如果只是不夠清晰,直接放大補細節就行,不用重跑。

我這次 15 張裡有 3 張需要局部返工,大概是五分之一的返工率 —— 比我預期的低,但不是零。

讓寫真動起來

最後加了一步:把定稿那張送去 AI 影片生成,用 MiniMax H3 做了 5 秒。

由一張 AI 寫真生成的 5 秒動態片段:頭髮被風吹動、人物轉頭微笑

風吹起頭髮、眨一次眼、轉頭帶出一個笑 —— 頭像頁和社群主頁放這個比放靜態圖抓人。要注意的是別寫複雜動作:讓一張 AI 人像「站著呼吸」比讓它「走過來揮手」穩得多,動作一複雜,臉就開始變形。

一個人的完整清單

按順序走,不會返工:

  1. 挑起點自拍 —— 正面、五官沒遮擋、沒磨皮
  2. 先換衣服,驗證臉沒變
  3. 再換髮型和妝容,一次只改一樣
  4. 最後加場景和光,場景和光寫在一起
  5. 放大查手、耳朵眼鏡、髮際線
  6. 有問題的局部重修,不清晰的放大
  7. 挑一張做成動態

批量做的時候,我習慣把同一個人的所有 AI 人像版本鋪在 生成式畫布 上並排比,哪一張臉飄了一眼就看出來 —— 一張張點開看很容易被單張騙過去。

這次全程約兩小時,大部分時間花在寫提示詞和挑片上,生成本身很快。AI 寫真現在的水平,做形象照和社群素材已經夠用;要交給客戶的商業硬照,我還是會去找攝影師。想自己走一遍這個流程,從 AI 圖片生成 開始就行,起點只需要一張自拍。

分享