
我用一张手机随手拍,做出了一整套 AI 商品图和一条 10 秒商品视频
桌上有一瓶没牌子的琥珀色玻璃喷雾,是之前拿来装分装香氛的。我用手机随手拍了一张,想试试只靠这一张图,能不能做出一套挂得上详情页的 AI 商品图,顺带做一条 AI 商品视频。
没有影棚,没有柔光箱,没有请摄影师。下面是完整过程,包括两处没做成的地方。
一张随手拍,离能上架还差什么

木桌、缠成一团的充电线、半杯冷掉的咖啡、顶灯压下来的一道硬影,整张画面还泛着一层黄绿。这就是大多数小卖家手上真实的起点。
它离能上架差的不是清晰度,而是三件事:背景不干净、光没有方向、跟别的商品图放在一起时比例对不上。这三件恰好是 AI 商品图现在做得最稳的部分。
对起点素材的要求也就三条:主体完整、别糊、别整个陷在阴影里。满足这三条,手机随手拍的就够。
第一步不是生成,是把它抠干净
先说结论,去背景是整个流程里最不用操心的一环。

左边原图,中间是去背结果,右边把玻璃边缘放大到能看见像素。透明外盖被完整留了下来,边缘既没有白圈也没有毛刺 —— 玻璃和透明塑料一向是抠图最容易翻车的材质,这次一遍就过。这一步走的是 去背景。
放大之后倒是暴露了另一个问题:原图那层黄绿色偏,原封不动地跟着抠图走了。去背只负责把主体从背景里分开,不负责校色。所以这张透明底图不是成品,它是后面每一张 AI 商品图的基准。
换背景:把光写死,比把场景写死更管用
有了基准图,我用 AI 图像生成 出了四种详情页最常见的场景。

左上是纯白主图,平光加右侧补光,瓶底一小片接触阴影,平台主图基本都长这样;右上米色石台配低角度侧逆光,影子拖得很长,玻璃右缘挂了一道金边;左下深色背景加单侧硬光,左半边直接压进暗部;右下是浴室大理石台面加几枝尤加利,走生活场景那一路。
这一步最有用的经验是:场景要连着光一起写。只写「放在石头台面上」,模型会给你一个台面和一片没有方向的光;写「暖色低角度侧逆光从右上来、影子拖向左边、玻璃右缘一道金边」,才会给你上面那张。光的方向、软硬、色温,对 AI 商品图的影响比背景里摆了什么大得多。
不过光位这类指令也不是每次都听。我另外试了一张黑色亚克力镜面台,要求光从左边来、影子落在右边,结果镜面倒影做得挺漂亮,地面的亮区却还在左边,影子几乎看不见。那张直接弃了。
让手进画面
详情页上总要有一张「拿在手里多大」的图,而带手的 AI 商品图也是最容易露馅的一类 —— AI 图像里手指粘连、多长一根、指节反关节都是常事。

这张我特意放大数了一遍:五根手指,关节走向正常,指甲长度一致,虎口的皮肤褶皱也在。一次过,没重跑。
翻车记录:字过关了,瓶盖没过
生图模型写不出可读文字,这条我一直当常识用。这次顺手验了一下。

英文「LAVENDER MIST / 50 ml」拼写全对;换成中文「薰衣草喷雾 / 净含量 50 毫升」,九个汉字也一个没错,笔画都站得住。至少在短标签这个量级上,这条经验已经过期了。
真正翻车的是另一件事,而且我差点没发现。

最左边是原图的瓶盖:方肩、直筒、顶是平的。右边四张是四种背景下的成品。四个盖子全变成了圆顶,彼此之间高矮宽窄还各不相同,里面那颗喷头的形状也每张都在变。
背景、光线、玻璃颜色、标签位置这些「大」的部分,模型守得很好;偏偏是这种结构细节,每重画一次就漂一点。对商品来说这挺致命 —— 买家收到实物跟主图对不上,就是一条差评。
办法很笨但有效:先挑一张瓶盖最接近实物的当定稿,再拿它当唯一基准重出其余几张 AI 商品图,而不是每张都从头生成一遍。
从静图到 10 秒 AI 商品视频
定稿帧我选了石台那张,丢进 首尾帧生成视频,出了一条 10 秒的 AI 商品视频。

提示词里我写了两件事:很慢地推近,以及让侧光从右往左扫过去、影子随之变短。只兑现了前一件。推镜非常稳,瓶身形状、标签比例、玻璃颜色在两百多帧里一次都没飘;光则基本是静止的,影子从头到尾一样长。
这个结果我反而接受 —— AI 商品视频最怕的就是主体在运动过程中变形,宁可镜头老实一点。真需要更多镜头,再拿同一张定稿帧多出几条 AI 商品视频,拼起来就是一组。
一套下来,花了多少
从随手拍到素材全部落地,实际四十分钟出头,其中一多半时间在等生成和挑图。重试只发生在两处:黑色镜面台那张光位不对,重出一次还是不对,放弃;瓶盖漂移是全部出完才发现的,四张背景图等于白跑一轮 —— 如果一开始就先定稿再扩展,这一轮本来可以省掉。
值得一提的是,这套 AI 商品图流程里真正需要「审美」的环节只有一个,就是挑哪张当定稿。剩下的都是重复劳动。
如果你手上也有一件拍不好看的商品,起点不需要比我这张随手拍更讲究。AI 图像生成 负责出图,AI 视频生成 负责出片;想把一件商品的十几张图和几条视频摊开来一起比,就把它们全拖到 生成式画布 上,哪张该留哪张该重跑,一眼就看出来了。