Czy jedna osoba nakręci krótki film z AI? Storyboard, spójność postaci i łączenie ujęć

Czy jedna osoba nakręci krótki film z AI? Storyboard, spójność postaci i łączenie ujęć

PoradnikiOpublikowano dnia

Nakręci. Choć nie każdej części.

Sprawdziłem samodzielną produkcję z AI na celowo minimalnej historii: mężczyzna znajduje złożoną kartkę w kieszeni starego płaszcza. Osiem ujęć, jedna osoba, od jednego zdania do czegoś, co da się obejrzeć od początku do końca. Poniżej to, co się udało, gdzie się zablokowałem i ile to naprawdę kosztowało.

Co jedna osoba może skończyć, a czego nie

Najpierw wnioski, żebyś nie czytał dalej z błędnymi oczekiwaniami.

Co jedna osoba potrafi już zrobić sama: storyboard, wygląd postaci i spójność postaci, kadr każdego ujęcia, łączenia między ujęciami, głos i synchronizację ust. Praca, która wcześniej wymagała operatora, oświetleniowca, scenografii i aktora, dziś faktycznie mieści się na jednym biurku.

Co nadal nie działa: ciągła złożona akcja dłuższa niż jakieś pięć sekund, gra dokładnie zgrana z kwestią dialogową, każde ujęcie z czytelnym tekstem w kadrze (wracam do tego niżej) oraz wszystko, co wymaga prawdziwej lokacji albo prawdziwego reagującego człowieka.

Dlatego optymalna długość produkcji z AI to dziś od 30 sekund do 2 minut, złożone z kilku krótkich ujęć. Nie próbuj trzyminutowego ujęcia bez cięcia — to nie problem redakcji promptu, to obecny pułap całej metody.

Jak zamienić akapit w storyboard?

Storyboard to krok, który robi się pierwszy, i najtańszy w całym procesie produkcji z AI. Jest szybki, prawie nic nie kosztuje i obnaża problemy fabularne, zanim wydasz prawdziwe pieniądze na gotowe kadry.

Metoda jest prosta: rozbij historię na jedno zdanie na ujęcie i w każdym zdaniu zapisz trzy rzeczy — plan, akcję, światło. Potem przepuść turę ołówkowych miniatur przez generowanie obrazów AI.

Storyboard z ośmiu kadrów do krótkiego filmu z AI, narysowany jako ołówkowe miniatury

Mój podział wyszedł tak: plan ogólny ustawiający pokój → średni, płaszcz zdejmowany z wieszaka → zbliżenie, dłoń wchodząca do kieszeni → zbliżenie, kartka rozłożona na dłoni → średni, głowa podnosząca się w stronę okna → ogólny, w płaszczu, idzie do drzwi → drzwi klatki otwierają się na poranne światło → plan daleki, jego plecy idące w górę ulicy.

Jedna rada wbrew intuicji na tym etapie: nie próbuj rysować dobrze. Sprawdzasz tylko trzy rzeczy — czy historia się trzyma, czy plany się zmieniają, czy jakieś ujęcie jest zbędne. Im surowszy szkic, tym łatwiej ciąć. Pierwsza tura miała 11 kadrów; rytm zadziałał dopiero przy ośmiu.

Jak utrzymać tę samą twarz w każdym ujęciu?

Spójność postaci to miejsce, w którym produkcja z AI pęka najczęściej, i krok, który zajął mi najwięcej czasu.

Odpowiedzią jest karta postaci: zbuduj jedną, a potem odwołuj się do niej w każdym ujęciu, zamiast opisywać twarz słowami. Spójność wynika z ponownego użycia jednego obrazu referencyjnego, nie z pisania dokładniejszego opisu.

Karta postaci do krótkiego filmu z AI: ten sam mężczyzna z przodu, w trzech czwartych, z profilu i od tyłu

Najpierw wygenerowałem czyste zdjęcie na wprost — szare tło, równe światło, bez stylizacji, bez wyrazu; w zasadzie zdjęcie castingowe. Potem z niego zbudowałem trzy czwarte, profil i tył. Te cztery obrazy są „aktorem" tego filmu, a każde następne ujęcie dostaje tę kartę.

Trzy praktyczne uwagi:

Nie opisuj twarzy tekstem. „Około trzydziestu pięciu lat, krótkie czarne włosy, lekki zarost" wygeneruje sto różnych osób. Twarz zostaw obrazowi referencyjnemu; prompt nosi tylko to, co zmienia się w tym ujęciu.

Tył i profil wygeneruj od razu. Jeśli poczekasz do ujęcia, w którym odchodzi, najprawdopodobniej nie będzie to już ten sam mężczyzna co na przodzie.

Ubranie wpisz w każdy prompt. Spójność postaci to nie tylko twarz — pozwól, żeby kolor albo krój płaszcza się przesunął, i widz nadal zobaczy szew. Utrzymaj te trzy rzeczy i spójność postaci w krótkim filmie z AI jest w zasadzie rozwiązana.

Jak łączyć ujęcia, żeby nie skakało?

Najmniej pracochłonna metoda to zrobić ostatnią klatkę jednego ujęcia pierwszą klatką następnego.

Pokaz łączenia: ostatnia klatka jednego ujęcia staje się pierwszą następnego, kadr, światło i korekcja barwna trwają identycznie

Te dwie klatki to pierwsza i druga połowa tego samego taktu: po lewej patrzy na kartkę, po prawej głowa podniosła się w stronę okna. Kadr się nie ruszył, kierunek światła się nie ruszył, korekcja barwna się nie ruszyła — zmieniły się tylko kąt głowy i to, gdzie patrzy. Zmontowane razem czytają się jako jedna ciągła reakcja.

Podaj obie do pierwszej i ostatniej klatki na wideo jako punkty początkowy i końcowy i niech model wypełni lukę. To znacznie stabilniejsze niż proszenie modelu, by „zagrał" całą akcję, a przy tym chroni spójność postaci, bo oba końce ustaliłeś ty.

Dwa szczegóły łączenia są pomijane i w produkcji z AI kosztują więcej niż na prawdziwym planie, bo nie poprawisz ich na miejscu. Kierunek światła musi się zgadzać. Jeśli w jednym ujęciu światło szło z lewej, w następnym nie może iść z prawej — widz nie nazwie, co jest nie tak, ale to poczuje. Korekcja barwna musi się zgadzać. Wszystkie osiem moich ujęć nosi „zimny świt" w samym prompcie; nie liczyłem na ratowanie tego później.

Jak przejrzeć wszystkie ujęcia naraz i poprawić tylko złe?

Otwieranie obrazów po kolei cię oszuka. Każdy osobno wygląda dobrze; tylko w sekwencji widać, że w trzecim ujęciu twarz odjechała.

Rozkładam wszystkie osiem na płótnie generatywnym, w kolejności, w jednym rzędzie, i się cofam. Problemy ze spójnością postaci najłatwiej złapać w rzędzie — odjechana twarz albo złe światło rzuca się w oczy przy jednym spojrzeniu. Sam ten nawyk usunął większość poprawek z mojego procesu produkcji z AI: uruchamiam ponownie tylko zepsutą komórkę, zamiast budować sekwencję od nowa.

Osiem gotowych ujęć z krótkiego filmu z AI, w jednej zimnej porannej korekcji barwnej

To moje ostateczne osiem. Dłoń w ujęciu trzecim była powtarzana dwa razy; światło pod kontrę w ujęciu siódmym dostało jedną korektę ekspozycji.

A dźwięk?

Obraz jest w tym punkcie gotowy, ale krótki film z AI bez dźwięku nie utrzyma nikogo dłużej niż 30 sekund.

Mój nie ma dialogu, więc wystarczyło tło. Przy dialogu kolejność jest taka: wygenerować głos przez zamianę tekstu na mowę albo sklonować stałą barwę przez klonowanie głosu, a potem uruchomić synchronizację ust, żeby dopasować usta.

Nie odwracaj tej kolejności. Zrób obraz najpierw i okaże się, że ruchy ust i długości kwestii się nie zgadzają; ustal najpierw długość audio i generuj klatki pod nią, a poprawek będzie znacznie mniej. Dźwięk na końcu to najczęstszy błąd kolejności w produkcji z AI.

Gdzie jest granica ruszania kadru?

Pięć sekund wygenerowanych z jednego ujęcia: trzyma kartkę, mruga, spojrzenie przesuwa się wzdłuż okna

Te pięć sekund pochodzi z ujęcia powyżej: oddech, jedno mrugnięcie, spojrzenie przesuwające się nieco, lekkie ściągnięcie brwi.

Trzy razy prosiłem, żeby „odwrócił się i poszedł do drzwi", i za każdym razem się deformowało — dwa kroki i to już nie on. Granica jest więc jasna: małe reakcje na miejscu są niezawodne; proszenie postaci o przemieszczenie się albo złożoną akcję jeszcze nie. W ujęciach wymagających ruchu generuję najpierw klatkę końcową i interpoluję, zamiast pozwalać modelowi to zagrać.

Trzy porażki, uczciwie

Tekst w kadrze jest fałszywy. Przybliż moje zbliżenie kartki i „pismo" na papierze okaże się bełkotem — modele generatywne nie tworzą czytelnego tekstu, co po cichu wyklucza całą kategorię ujęć w produkcji z AI. Albo nie filmujesz tego ostro (nieostro, w połowie zakryte), albo wklejasz prawdziwy tekst później.

Dłonie nadal trzeba sprawdzać po kolei. W ujęciu z dłonią wchodzącą do kieszeni pierwsza wersja miała staw w złym miejscu; potrzebne były dwa powtórzenia. Każde ujęcie z dłońmi w kadrze idzie pod przybliżenie.

Ciągła akcja gubi twarz. Jak wyżej — przemieszczenie dłuższe niż dwie, trzy sekundy prawie zawsze się psuje, a spójność postaci pada pierwsza.

Gotowa lista ośmiu ujęć

Pracuj w tej kolejności i nie będziesz się cofać:

  1. Rozbij historię na jedno zdanie na ujęcie, każde z planem, akcją i światłem
  2. Wygeneruj surowy storyboard i skróć do samych potrzebnych ujęć
  3. Zbuduj kartę postaci, by zablokować spójność: przód, trzy czwarte, profil, tył
  4. Generuj ujęcie po ujęciu według storyboardu, podając kartę za każdym razem, z korekcją barwną wpisaną w każdy prompt
  5. Tam, gdzie ujęcia się łączą, zrób najpierw klatkę końcową, potem pierwszą
  6. Rozłóż wszystko na płótnie i porównaj w rzędzie; uruchom ponownie tylko to, co zepsute
  7. Ustal długość audio, a potem dopasuj klatki do audio
  8. Przybliż dłonie, uszy i każdy tekst w kadrze

Całe osiem ujęć zajęło mi około trzech godzin, w większości na pisanie promptów i wybieranie podejść, a nie na czekanie na generowanie. Spójność postaci i łączenia idą niemal dwa razy szybciej, gdy zrobisz je kilka razy.

To już wystarcza na czołówki, materiały koncepcyjne i rzeczy do prezentacji. Do gotowej realizacji komercyjnej nadal filmowałbym naprawdę, a AI używał do dopełniania ujęć. Jeśli chcesz przejść proces produkcji z AI samodzielnie, generowanie wideo AI jest miejscem na start — jedno zdanie wystarcza, żeby zacząć.

Udostępnij