
我用一張手機隨手拍,做出了一整套 AI 商品圖和一條 10 秒商品影片
桌上有一瓶沒牌子的琥珀色玻璃噴霧,是之前拿來裝分裝香氛的。我用手機隨手拍了一張,想試試只靠這一張圖,能不能做出一套掛得上商品頁的 AI 商品圖,順帶做一條 AI 商品影片。
沒有攝影棚,沒有柔光箱,沒有請攝影師。下面是完整過程,包括兩處沒做成的地方。
一張隨手拍,離能上架還差什麼

木桌、纏成一團的充電線、半杯冷掉的咖啡、頂燈壓下來的一道硬影,整張畫面還泛著一層黃綠。這就是大多數小賣家手上真實的起點。
它離能上架差的不是清晰度,而是三件事:背景不乾淨、光沒有方向、跟別的商品圖放在一起時比例對不上。這三件恰好是 AI 商品圖現在做得最穩的部分。
對起點素材的要求也就三條:主體完整、別糊、別整個陷在陰影裡。滿足這三條,手機隨手拍的就夠。
第一步不是生成,是把它去乾淨
先說結論,去背景是整個流程裡最不用操心的一環。

左邊原圖,中間是去背結果,右邊把玻璃邊緣放大到能看見像素。透明外蓋被完整留了下來,邊緣既沒有白圈也沒有毛邊 —— 玻璃和透明塑膠一向是去背最容易翻車的材質,這次一遍就過。這一步走的是 去背景。
放大之後倒是暴露了另一個問題:原圖那層黃綠色偏,原封不動地跟著去背走了。去背只負責把主體從背景裡分開,不負責校色。所以這張透明底圖不是成品,它是後面每一張 AI 商品圖的基準。
換背景:把光寫死,比把場景寫死更管用
有了基準圖,我用 AI 圖像生成 出了四種商品頁最常見的場景。

左上是純白主圖,平光加右側補光,瓶底一小片接觸陰影,平台主圖基本都長這樣;右上米色石台配低角度側逆光,影子拖得很長,玻璃右緣掛了一道金邊;左下深色背景加單側硬光,左半邊直接壓進暗部;右下是浴室大理石檯面加幾枝尤加利,走生活場景那一路。
這一步最有用的經驗是:場景要連著光一起寫。只寫「放在石頭檯面上」,模型會給你一個檯面和一片沒有方向的光;寫「暖色低角度側逆光從右上來、影子拖向左邊、玻璃右緣一道金邊」,才會給你上面那張。光的方向、軟硬、色溫,對 AI 商品圖的影響比背景裡擺了什麼大得多。
不過光位這類指令也不是每次都聽。我另外試了一張黑色壓克力鏡面台,要求光從左邊來、影子落在右邊,結果鏡面倒影做得挺漂亮,地面的亮區卻還在左邊,影子幾乎看不見。那張直接棄了。
讓手進畫面
商品頁上總要有一張「拿在手裡多大」的圖,而帶手的 AI 商品圖也是最容易露餡的一類 —— AI 圖像裡手指黏連、多長一根、指節反關節都是常事。

這張我特意放大數了一遍:五根手指,關節走向正常,指甲長度一致,虎口的皮膚褶皺也在。一次過,沒重跑。
翻車記錄:字過關了,瓶蓋沒過
生圖模型寫不出可讀文字,這條我一直當常識用。這次順手驗了一下。

英文「LAVENDER MIST / 50 ml」拼寫全對;換成中文「薰衣草喷雾 / 净含量 50 毫升」,九個漢字也一個沒錯,筆畫都站得住。至少在短標籤這個量級上,這條經驗已經過期了。
真正翻車的是另一件事,而且我差點沒發現。

最左邊是原圖的瓶蓋:方肩、直筒、頂是平的。右邊四張是四種背景下的成品。四個蓋子全變成了圓頂,彼此之間高矮寬窄還各不相同,裡面那顆噴頭的形狀也每張都在變。
背景、光線、玻璃顏色、標籤位置這些「大」的部分,模型守得很好;偏偏是這種結構細節,每重畫一次就漂一點。對商品來說這挺致命 —— 買家收到實物跟主圖對不上,就是一條負評。
辦法很笨但有效:先挑一張瓶蓋最接近實物的當定稿,再拿它當唯一基準重出其餘幾張 AI 商品圖,而不是每張都從頭生成一遍。
從靜圖到 10 秒 AI 商品影片
定稿幀我選了石台那張,丟進 首尾幀生成影片,出了一條 10 秒的 AI 商品影片。

提示詞裡我寫了兩件事:很慢地推近,以及讓側光從右往左掃過去、影子隨之變短。只兌現了前一件。推鏡非常穩,瓶身形狀、標籤比例、玻璃顏色在兩百多幀裡一次都沒飄;光則基本是靜止的,影子從頭到尾一樣長。
這個結果我反而接受 —— AI 商品影片最怕的就是主體在運動過程中變形,寧可鏡頭老實一點。真需要更多鏡頭,再拿同一張定稿幀多出幾條 AI 商品影片,拼起來就是一組。
一套下來,花了多少
從隨手拍到素材全部落地,實際四十分鐘出頭,其中一多半時間在等生成和挑圖。重試只發生在兩處:黑色鏡面台那張光位不對,重出一次還是不對,放棄;瓶蓋漂移是全部出完才發現的,四張背景圖等於白跑一輪 —— 如果一開始就先定稿再擴展,這一輪本來可以省掉。
值得一提的是,這套 AI 商品圖流程裡真正需要「審美」的環節只有一個,就是挑哪張當定稿。剩下的都是重複勞動。
如果你手上也有一件拍不好看的商品,起點不需要比我這張隨手拍更講究。AI 圖像生成 負責出圖,AI 影片生成 負責出片;想把一件商品的十幾張圖和幾條影片攤開來一起比,就把它們全拖到 生成式畫布 上,哪張該留哪張該重跑,一眼就看出來了。