
ИИ-фото товара из одного снимка на телефон: что получилось, а что сломалось
На столе стоит безымянный флакон-спрей из янтарного стекла — из тех, в которые отливают парфюм. Я снял его один раз на телефон и захотел выяснить, хватит ли этого единственного кадра, чтобы получить набор ИИ-фото товара, годных для карточки, и вдобавок короткое ИИ-видео товара.
Без студии, без софтбокса, никого не нанимая. Дальше — весь процесс целиком, включая две части, которые не сработали.
Чего на самом деле не хватает снимку с телефона

Деревянный стол, спутанный кабель зарядки, недопитый холодный кофе, жёсткая тень от потолочной лампы и жёлто-зелёный оттенок поверх всего. Именно с этого реально начинает большинство небольших продавцов.
Не хватает тут не резкости. Не хватает трёх других вещей: фон захламлён, у света нет направления, а кадрирование не совпадёт с остальными картинками в карточке. Эти три как раз и есть то, с чем ИИ-фото товара сегодня справляются надёжнее всего.
Требования к исходнику невелики: объект виден целиком, кадр не смазан, предмет не утонул в тени. При этих условиях снимка с телефона достаточно.
Первый шаг — не генерация, а обтравка
Сначала вывод: удаление фона оказалось самой беспроблемной частью всего прогона.

Слева оригинал, в центре обтравка, справа край стекла, увеличенный до видимых пикселей. Прозрачный колпачок сохранился целиком, край вернулся без белой каймы и без бахромы — стекло и прозрачный пластик обычно как раз то, на чём обтравка разваливается, а тут прошло с первого раза. Этот шаг выполнен через удаление фона.
Увеличение, впрочем, вскрыло другое: жёлто-зелёный оттенок оригинала перешёл сюда нетронутым. Обтравка отделяет объект от фона, но не правит цвет. Значит, этот файл с прозрачным фоном — не готовое ИИ-фото товара, а эталон, из которого рождаются все последующие.
Свет важнее декораций: описывайте свет, а не место
С эталоном на руках я через ИИ-генерацию изображений сделал четыре сцены, которые карточки товара запрашивают чаще всего.

Слева вверху — главное фото на белом: плоский свет, отражатель справа, небольшая контактная тень под донцем. Справа вверху — бежевый камень под тёплым скользящим контровым светом: тень вытягивается, по правому краю стекла бежит золотая кромка. Слева внизу — тёмный фон с одним жёстким источником, левая половина уходит в тень. Справа внизу — лайфстайл-вариант: мраморная столешница и несколько веточек эвкалипта.
Самое полезное наблюдение с этого шага: сцену и свет надо писать вместе. «На каменной поверхности» вернёт вам поверхность и бесформенную заливку светом. «Тёплый скользящий контровой свет сверху справа, тень вытянута влево, золотая кромка по правому краю стекла» вернёт кадр выше. Направление, жёсткость и цветовая температура двигают ИИ-фото товара гораздо сильнее, чем то, что вы поставили в фон.
При этом указание направления выполняется не всегда. Я попробовал ещё один кадр на чёрном акриле, попросив свет слева и тень, падающую вправо. Зеркальное отражение вышло прекрасным; светлая зона на полу осталась слева, а тени почти не было. Этот кадр отправился в корзину.
Ввести в кадр руку
Любой карточке нужен снимок «сколько это в руке», и рука — как раз то место, где ИИ-фото товара выдают себя: сросшиеся пальцы, лишний палец, сустав, сгибающийся в обратную сторону.

Я увеличил и пересчитал: пять пальцев, суставы гнутся в правильную сторону, ногти одной длины, на месте даже складка кожи у основания большого пальца. С первой попытки, без переделок.
Что сломалось: текст прошёл, а колпачок нет
Модели изображений не умеют писать читаемый текст. Я держал это за решённый вопрос — и решил проверить.

«LAVENDER MIST / 50 ml» вернулось написанным правильно. С переключением на китайский — 薰衣草喷雾 / 净含量 50 毫升 — получилось девять иероглифов, и ни одной ошибочной черты. На длине короткой этикетки это расхожее правило устарело.
А то, что действительно сломалось, я чуть не пропустил.

Крайний слева — колпачок оригинала: угловатое плечо, прямой ствол, плоский верх. Четыре справа — готовые кадры. Все колпачки стали куполообразными, ни один не совпадает с другим по высоте и ширине, а форма распылителя внутри меняется каждый раз.
Крупные вещи модель удержала хорошо: цвет стекла, положение этикетки, фон, свет. Уплывает именно такая структурная деталь — с каждой перерисовкой чуть дальше. Для реального товара это существенно: покупатель, у которого посылка не совпала с главным фото, ставит одну звезду.
Решение грубое, но рабочее: выберите кадр, чей колпачок ближе всего к настоящему предмету, зафиксируйте его как единственный эталон и пересоздайте остальные ИИ-фото товара из него, а не начинайте каждое с нуля.
От статики к 10-секундному ИИ-видео товара
Я взял кадр на камне и отправил его в видео из первого и последнего кадра, получив 10-секундное ИИ-видео товара.

В промпте я просил две вещи: очень медленный наезд и боковой свет, проходящий справа налево, чтобы тень укорачивалась. Случилось только первое. Наезд идеально устойчив — форма флакона, пропорции этикетки и цвет стекла не дрогнули за две с лишним сотни кадров, — но свет практически застыл, и тень в конце ровно той же длины, что и в начале.
На такой размен я согласен. Худшее, что может случиться в ИИ-видео товара, — это деформация предмета во время движения камеры, и послушная камера здесь дешёвая страховка. Нужны другие ракурсы — сделайте ещё несколько ИИ-видео товара из того же зафиксированного кадра и смонтируйте вместе.
Во что это обошлось по времени
Сорок с небольшим минут от снимка до готовых файлов, больше половины — ожидание генераций и выбор между вариантами. Переделок было две: кадр на чёрном акриле промахнулся мимо направления света, промахнулся снова на повторе и был заброшен; уплывший колпачок вскрылся уже после того, как всё было готово, и это списало целый круг из четырёх фонов. Если бы эталон был зафиксирован сразу, этого круга не было бы.
Стоит отметить, что вкус во всём процессе требуется ровно на одном шаге — при выборе кадра, который станет эталоном. Всё остальное — повторение.
Если у вас есть товар, который никак не получается снять прилично, ваша отправная точка не обязана быть лучше моего снимка. ИИ-генерация изображений отвечает за статику, ИИ-генерация видео — за ролик, а когда захотите разложить рядом дюжину ИИ-фото товара и несколько видео, чтобы их сравнить, перетащите всё на генеративный холст: что оставить, а что перезапустить, видно сразу.