Может ли один человек снять ИИ-короткометражку? Раскадровка, единство персонажа и склейки

Может ли один человек снять ИИ-короткометражку? Раскадровка, единство персонажа и склейки

РуководстваОпубликовано на

Может. Но не всё целиком.

Я проверил ИИ-производство в одиночку на намеренно крошечной истории: мужчина находит сложенную записку в кармане старого пальто. Восемь кадров, один человек, от одной фразы до того, что можно смотреть от начала до конца. Ниже — что сработало, где я застрял и чего это на самом деле стоило.

Что один человек может закончить, а что нет

Сначала выводы, чтобы вы не читали дальше с неверными ожиданиями.

Что один человек теперь делает сам: раскадровку, внешность персонажа и единство персонажа, картинку каждого кадра, склейки между кадрами, голос и синхронизацию губ. Работа, которая раньше требовала оператора, осветителя, художника и актёра, действительно укладывается сегодня в один рабочий стол.

Что по-прежнему не работает: непрерывное сложное действие дольше примерно пяти секунд, игра, точно уложенная в реплику, любой кадр с читаемым текстом в поле (об этом ниже) и всё, что требует реальной локации или живого человека, который реагирует.

Поэтому оптимальная длина ИИ-производства сегодня — от 30 секунд до 2 минут, собранных из нескольких коротких кадров. Не пытайтесь снять трёхминутный кадр без склеек: это не проблема формулировки промпта, это текущий потолок самого подхода.

Как превратить абзац в раскадровку?

Раскадровка — шаг, который делают первым, и самый дешёвый во всём процессе ИИ-производства. Она быстрая, почти ничего не стоит и вскрывает проблемы истории до того, как вы потратите настоящие деньги на готовые кадры.

Метод простой: разбейте историю на одно предложение на кадр и напишите в каждом предложении три вещи — масштаб, действие, свет. Затем прогоните карандашные миниатюры через генерацию изображений ИИ.

Раскадровка из восьми кадров для ИИ-короткометражки, нарисованная карандашными миниатюрами

Моя разбивка: общий план, задающий комнату → средний, пальто снимается с вешалки → крупный, рука входит в карман → крупный, записка раскрыта на ладони → средний, голова поднимается к окну → общий, пальто надето, он идёт к двери → дверь подъезда открывается в утренний свет → дальний план, его спина уходит вверх по улице.

Один контринтуитивный совет на этом этапе: не старайтесь рисовать хорошо. Вы проверяете только три вещи — держится ли история, меняются ли масштабы, нет ли лишнего кадра. Чем грубее набросок, тем легче резать. В первом варианте было 11 кадриков; ритм сложился только когда осталось восемь.

Как удержать одно лицо во всех кадрах?

Единство персонажа — то место, где ИИ-производство ломается чаще всего, и шаг, который занял у меня больше всего времени.

Ответ — лист персонажа: сделайте его один раз, а затем ссылайтесь на него в каждом кадре вместо описания лица словами. Единство берётся из повторного использования одного референса, а не из более подробного описания.

Лист персонажа для ИИ-короткометражки: тот же мужчина спереди, в три четверти, в профиль и со спины

Сначала я сгенерировал чистый фронтальный кадр — серый фон, ровный свет, без стайлинга, без выражения, по сути кастинг-фото. Затем из него построил три четверти, профиль и спину. Эти четыре изображения — «актёр» этого фильма, и каждый последующий кадр получает этот лист.

Три практических замечания:

Не описывайте лицо текстом. «Около тридцати пяти, короткие чёрные волосы, легкая небритость» сгенерирует сотню разных людей. Лицо оставьте референсу; промпт несёт только то, что меняется в этом кадре.

Спину и профиль сделайте сразу. Если дождаться кадра, где он уходит, скорее всего это будет уже не тот человек, что на фронтальном.

Одежду пишите в каждый промпт. Единство персонажа — это не только лицо: дайте цвету или крою пальто уплыть, и зритель всё равно увидит стык. Соблюдите эти три пункта, и единство персонажа в ИИ-короткометражке по сути решено.

Как склеивать кадры, чтобы не прыгало?

Самый малозатратный способ — сделать последний кадрик одного плана первым кадриком следующего.

Демонстрация склейки: последний кадрик одного плана становится первым следующего, композиция, свет и цветокоррекция продолжаются без изменений

Эти два кадрика — первая и вторая половина одного и того же такта: слева он смотрит на записку, справа голова поднялась к окну. Композиция не сдвинулась, направление света не сдвинулось, цвет не сдвинулся — изменились только угол головы и направление взгляда. Смонтированные вместе, они читаются как одна непрерывная реакция.

Подайте оба в первый и последний кадр в видео как точки начала и конца и дайте модели заполнить середину. Это гораздо устойчивее, чем просить модель «отыграть» действие целиком, и заодно защищает единство персонажа, потому что оба конца зафиксированы вами.

Две детали склейки упускают, и в ИИ-производстве они стоят дороже, чем на реальных съёмках, потому что их не исправить на площадке. Направление света должно совпадать. Если в одном кадре свет шёл слева, в следующем он не может идти справа — зритель не назовёт, что не так, но почувствует. Цвет должен совпадать. Все восемь моих кадров несут «холодный рассвет» в самом промпте; я не рассчитывал вытянуть это потом.

Как просмотреть все кадры сразу и переделать только плохие?

Открывать изображения по одному — обманываться. Каждое по отдельности выглядит нормально; только в последовательности замечаешь, что в третьем кадре лицо уплыло.

Я раскладываю все восемь на генеративном холсте, по порядку, в одну строку, и отхожу. Проблемы единства персонажа проще всего поймать в ряду — уплывшее лицо или неверный свет видны с одного взгляда. Одна эта привычка убрала большую часть переделок из моего процесса ИИ-производства: я перезапускаю только ту ячейку, что сломалась, а не собираю последовательность заново.

Восемь готовых кадров ИИ-короткометражки, с единой холодной рассветной цветокоррекцией

Это мои финальные восемь. Руку в третьем кадре перезапускал дважды; контровой свет в седьмом получил одну правку экспозиции.

Что со звуком?

Картинка на этом месте готова, но ИИ-короткометражка без звука не удержит никого дольше 30 секунд.

В моей нет диалога, так что понадобилась только атмосфера. С диалогом порядок такой: сгенерировать голос через синтез речи или клонировать фиксированный тембр через клонирование голоса, затем прогнать синхронизацию губ, чтобы подогнать рот.

Не переворачивайте этот порядок. Сделайте картинку первой — и обнаружите, что артикуляция и длина реплик не сходятся; зафиксируйте длительность аудио первой и генерируйте кадры под неё, и переделок будет намного меньше. Аудио в последнюю очередь — самая частая ошибка в порядке работ в ИИ-производстве.

Где предел того, чтобы кадр задвигался?

Пять секунд, сгенерированные из одного кадра: он держит записку, моргает, взгляд скользит вдоль окна

Эти пять секунд получены из кадра выше: дыхание, одно моргание, взгляд немного смещается, бровь слегка сходится.

Я трижды просил его «повернуться и пойти к двери», и каждый раз это деформировалось — через два шага это уже не он. Так что граница ясна: мелкие реакции на месте надёжны; просить персонажа перемещаться или выполнять сложное действие — ещё нет. Для кадров с движением я сначала генерирую конечный кадрик и интерполирую, а не даю модели это отыгрывать.

Три провала, честно

Текст в кадре — фальшивка. Приблизьте мой крупный план записки, и «почерк» на бумаге окажется абракадаброй: генеративные модели не выдают читаемый текст, что тихо вычёркивает целую категорию кадров в ИИ-производстве. Либо не снимайте это резко (расфокус, наполовину закрыто), либо подставляйте настоящий текст потом.

Руки по-прежнему проверяются по одной. В кадре с рукой в кармане в первой версии сустав стоял неправильно; понадобились два перезапуска. Любой кадр с руками в поле идёт под увеличение.

Непрерывное действие теряет лицо. Как выше — перемещение дольше двух-трёх секунд почти всегда рушится, и единство персонажа сдаётся первым.

Готовый список из восьми кадров

Работайте в этом порядке — возвращаться не придётся:

  1. Разбейте историю на одно предложение на кадр, в каждом масштаб, действие, свет
  2. Сделайте грубую раскадровку и урежьте до только необходимых кадров
  3. Соберите лист персонажа, чтобы зафиксировать единство: фронт, три четверти, профиль, спина
  4. Генерируйте кадр за кадром по раскадровке, каждый раз передавая лист, с цветом, прописанным в каждом промпте
  5. Там, где кадры склеиваются, сначала сделайте конечный кадрик, затем первый
  6. Разложите всё на холсте и сравните в ряду; перезапускайте только сломанное
  7. Зафиксируйте длительность аудио, затем подгоните кадры под аудио
  8. Приблизьте руки, уши и любой текст в кадре

Все восемь кадров заняли около трёх часов, большая часть из них — написание промптов и отбор дублей, а не ожидание генерации. Единство персонажа и склейки идут примерно вдвое быстрее, когда сделаешь их несколько раз.

Для заглавных титров, концептов и питч-материала этого уже достаточно. Для готовой коммерческой сдачи я бы всё равно снимал вживую, а ИИ использовал для достройки кадров. Хотите пройти процесс ИИ-производства сами — начните с генерации видео ИИ: одной фразы достаточно, чтобы начать.

Поделиться