
Ein Foto in Bewegung setzen
Ein Standporträt führt die Referenzbewegung aus — ganz ohne Dreh.
Geben Sie einen Referenzclip und Ihre Figur vor, und die Bewegung wird unverändert übertragen — Tanz, Geste, Mimik. Die Bewegung sitzt exakt, die Figur bleibt Ihre.
Ein Referenzclip legt die Bewegung viel präziser fest als Worte — „tanz mal" liefert die Improvisation des Modells, eine Referenz liefert genau diesen Tanz.
Die Bewegung kommt aus der Referenz, das Aussehen aus Ihrem Figurenbild. Zwei voneinander getrennte Regler.
Ein einzelnes Porträt plus eine Referenzbewegung ergibt ein Video, in dem diese Person sie ausführt.
Wenden Sie dieselbe Referenz auf verschiedene Figuren an und erhalten Sie eine Clipserie mit identischer Bewegung und unterschiedlichen Personen.

Ein Standporträt führt die Referenzbewegung aus — ganz ohne Dreh.

Referenzieren Sie einen Tanz und lassen Sie Ihre Figur ihn auf dieselben Beats ausführen.

Wenden Sie eine Bewegung auf mehrere verschiedene Figuren an und erhalten Sie eine aufeinander abgestimmte Serie.

Eine feste Figur plus aufgezeichnete Bewegung — für Content in Serie mit immer derselben Person.
Öffnen Sie KI-Motion-Control und laden Sie Ihr Figurenbild oder Ihren Clip hoch.
Laden Sie einen Referenzclip hoch, der die zu übertragende Bewegung vorgibt.
Laden Sie das Ergebnis herunter oder schicken Sie es auf die Leinwand, um weiterzuschneiden.
Schreiben Sie „tanz mal" in einen Videogenerator, bekommen Sie die Vorstellung des Modells von Tanz — vielleicht hübsch, aber nicht der Tanz, den Sie meinten. Bewegung hat schlicht zu viel Bandbreite für Text: Tempo, Amplitude und die Details einer Pose passen nicht in einen Prompt.
Motion Control ändert die Eingabe: Sie reichen einen Referenzclip ein. Die Bewegung wird aus dem Video extrahiert, das Aussehen kommt aus Ihrem Figurenbild, und beides wird getrennt gesteuert. So führt Ihre Figur genau diese Bewegung aus.
Die Bildqualität der Referenz spielt keine Rolle — sie liefert nur Bewegung, das Aussehen kommt vollständig von Ihrer Figur. Entscheidend ist, dass die Bewegung lesbar ist:
Aufeinander abstimmen sollten Sie außerdem den Bildausschnitt. Eine Ganzkörper-Tanzreferenz gegen ein Figurenbild bis zur Hüfte zwingt das Modell, die fehlende untere Hälfte zu erfinden, und die passt womöglich nicht zu Ihrer Figur. Die besten Ergebnisse entstehen, wenn beide Ausschnitte ähnlich sind.
Der Wert dieser Seite ist Bewegungssicherheit. Deshalb passt sie zu zwei Situationen: Sie haben eine Bewegung, die reproduziert werden muss (ein bestimmter Tanz, eine bestimmte Geste), oder Sie brauchen eine Serie von Clips mit verschiedenen Figuren und identischer Bewegung.
Ist die Bewegung dagegen beliebig und es reicht, dass sich überhaupt etwas bewegt, macht der Videogenerator weniger Arbeit — keine Referenz vorzubereiten, ein Satz genügt.
Bei Bild-zu-Video entscheidet das Modell über die Bewegung, und Sie steuern nur grob mit Worten gegen — „tanzend" liefert die Vorstellung des Modells von Tanz. Motion Control nutzt einen echten Clip als Bewegungsvorlage, es passiert also genau diese Bewegung. Nehmen Sie diese Seite, wenn die Bewegung exakt sein muss; Bild-zu-Video, wenn Sie die Idee des Modells sehen wollen.
Am wichtigsten sind klare Bewegung und ein vollständiges Motiv. Ganzkörperbewegung braucht den sichtbaren ganzen Körper, Gesten brauchen sichtbare Hände. Verdeckungen, sehr wenig Licht oder mehrere gleichzeitig bewegte Personen verschlechtern die Extraktion. Die Bildqualität der Referenz spielt keine Rolle — sie liefert nur Bewegung, das Aussehen kommt von Ihrer Figur.
Vom Prinzip her nicht — Bewegung aus der Referenz, Aussehen aus Ihrer Figur. Wenn sich beide aber stark im Bildausschnitt unterscheiden (Ganzkörper-Tanzreferenz gegen ein Figurenbild bis zur Hüfte), muss das Modell den fehlenden Teil erfinden, und der passt womöglich nicht exakt zu Ihrer Figur.
Sie regeln verschiedene Bereiche: Die Lippensynchronisation richtet den Mund an Audio aus, Motion Control überträgt Körperbewegung und Pose. Für eine Figur, die sich bewegt und spricht, ist die übliche Reihenfolge erst Bewegung, dann Lippensynchronisation.
Prompt
Image*
Video*