Wan AI

Wan 3.0

Alibabas All-in-one-Video-Renderer — 30 Sekunden in einem Durchgang, nativer Ton und ein Referenz-Set, das Bilder, Clips und Stimme zugleich aufnimmt.

Kein Abonnement
Kredite verfallen nie
Mehr erfahren

Zahlen Sie einmal für Credits - verwenden Sie sie für jedes Modell auf ZOOOP. · Nachfüllen, wenn es nötig ist, keine monatliche Verbrennung.

Powered by Wan AI's API on ZOOOP

Hauptmerkmale

30 Sekunden in einem Durchgang

Eine Anfrage erzeugt bis zu 30 Sekunden zusammenhängendes Video — genug für einen ganzen Erzählabschnitt, einen Walkthrough in einer Einstellung oder einen kompletten Werbetext, ohne nachträgliches Zusammenschneiden.

All-in-one-Referenz

Bis zu zehn Referenzbilder, fünf Referenzclips und fünf Referenz-Audiospuren gehen gemeinsam in eine Anfrage. Gesichter, Produkte und Stimmen bleiben über die ganze Einstellung stabil, statt von Take zu Take abzudriften.

Start- und Endframe-Steuerung

Setzen Sie das Startbild fest, optional auch das Schlussbild — Wan erzeugt die Bewegung dazwischen. Das ist der zuverlässigste Weg zu einem exakten Schlussbild für den Schnitt.

Nativer synchroner Ton

Dialog, Atmo und Musik entstehen im selben Durchgang wie das Bild und liegen der fertigen Datei als Stereospur bei. Den Ton abzuschalten kostet nichts extra.

Anwendungsfälle

30-Sekunden-Geschichten in einer Einstellung

30-Sekunden-Geschichten in einer Einstellung

Eine Generierung deckt einen vollständigen Erzählabschnitt ab — eine durchgehende Kamerafahrt, ein kompletter Werbetext, ein Walkthrough — statt drei Clips, die im Schnitt zusammenpassen müssen.

Figurenkonsistenz über die ganze Einstellung

Figurenkonsistenz über die ganze Einstellung

Bis zu zehn Referenzbilder derselben Person, desselben Kostüms oder Produkts halten die Identität über den ganzen Clip — dasselbe Gesicht bei Sekunde 2 und bei Sekunde 28.

Dialogszenen mit Stimmreferenz

Dialogszenen mit Stimmreferenz

Referenz-Audio geht in dieselbe Anfrage wie die Bildreferenzen, sodass eine Sprechszene mit der von Ihnen gelieferten Stimme landet und nicht mit einer generischen Synthesestimme.

Produkt-Reveals mit fixiertem Ende

Produkt-Reveals mit fixiertem Ende

Beginnen Sie beim Packshot, enden Sie beim Heldenbild. Die Start-/Endframe-Steuerung fixiert beide Enden, damit der Reveal sauber in den nächsten Schnitt läuft.

Hero-Material in 1440p

Hero-Material in 1440p

Die höchste Stufe rendert in 2560×1440 — für Landingpage-Heroes und große Bildschirme, wo ein 720p-Master sichtbar weich wird.

Schnelles Iterieren auf der Prime-Stufe

Schnelles Iterieren auf der Prime-Stufe

Wan 3.0 Prime ist dasselbe Modell auf der Überholspur — identische Regler, bevorzugte Generierung — für die Runde, in der die Einstellung noch nicht feststeht.

Wählen Sie das richtige Modell

Wan 3.0 ist die Wahl, wenn eine Einstellung lang laufen und zu echtem Referenzmaterial passen muss. Für andere Aufgaben wechseln Sie das Modell.

30 Sekunden in einem Durchgang mit gemischten ReferenzenWan 3.0
Offene Gewichte und anweisungsbasierte EditsWan 2.7
Multimodale Referenz mit beat-genauem TonSeedance 2.0
Bilder, Clips und Stimme in einem VideoaufrufMiniMax H3
Höchste Bildqualität und 4K-AuslieferungVeo 3.1
Günstigste schnelle Entwürfe derselben FamilieWan 2.6 Flash

Wie zu verwenden

01

Wan 3.0 über diese Seite öffnen oder im Video-Generator auswählen.

02

Prompt schreiben und, falls die Einstellung es braucht, Referenzbilder, -clips oder -audio hinzufügen.

03

Seitenverhältnis, Auflösung bis 1440p und eine Länge zwischen 2 und 30 Sekunden wählen.

04

Generieren — der fertige Clip kommt mit bereits synchroner Tonspur.

Tiefer Tauchgang

Was Wan 3.0 gut kann — und was nicht

Wan 3.0 beantwortet die Frage, um die sich jedes Videomodell herumdrückt: Was passiert, wenn die Einstellung länger als ein paar Sekunden dauern muss? Die meisten Flaggschiffe deckeln eine einzelne Generierung bei fünf bis fünfzehn Sekunden. Alles, was einer Szene ähnelt, wird also im Schnittprogramm zusammengesetzt — aus Clips, die nie ganz zusammenpassen: Das Gesicht driftet, das Licht springt, der Raum ändert am Schnitt seine Form. Wan 3.0 rendert bis zu dreißig Sekunden in einem Durchgang, und diese eine Änderung ordnet die Planung einer Einstellung neu. Eine durchgehende Kamerafahrt durch einen Raum, ein kompletter Dreißig-Sekunden-Werbetext, ein Produkt-Walkthrough in einer Einstellung: Das sind keine Schnittprobleme mehr, sondern Prompt-Probleme.

Das zweite Alleinstellungsmerkmal ist die All-in-one-Referenz. Referenzsysteme nehmen üblicherweise nur eine Art Eingabe an — manche Bilder, wenige einen Clip, ganz selten eine Stimme. Wan 3.0 nimmt alle drei in derselben Anfrage: bis zu zehn Referenzbilder, fünf Referenzclips und fünf Referenz-Audiospuren, begrenzt auf fünfzehn Sekunden Referenzvideo und fünfzehn Sekunden Referenz-Audio. In der Praxis heißt das: Ein ganzes Marken-Kit oder ein ganzes Charakterblatt geht auf einmal hinein, und die Identität hält über die Länge des Clips statt nur über die ersten Sekunden. Auf ZOOOP läuft das Routing automatisch — hängen Sie eine Referenz an, geht die Anfrage in die Referenz-Pipeline; lassen Sie sie leer, läuft dasselbe Modell als reines Text-to-Video.

Zwei weitere Fähigkeiten zählen im Alltag. Die Start- und Endframe-Steuerung fixiert beide Enden eines Clips und lässt Wan die Bewegung dazwischen erzeugen — so landen Sie ein exaktes Schlussbild, das sauber in die nächste Einstellung schneidet. Und der native synchrone Ton — Dialog, Atmo, Musik — entsteht im selben Durchgang wie das Bild und liegt der Datei als Stereospur bei, wobei der Ton-Schalter in beide Richtungen nichts kostet.

Wo es schwächer ist: Es ist nicht quelloffen. Wan 2.7 erschien unter Apache 2.0 mit veröffentlichten Gewichten, Wan 3.0 nicht — keine Gewichte, nur API. Für eine Pipeline, die Self-Hosting oder offene Herkunft braucht, ist das ein hartes Ausschlusskriterium, und die Antwort bleibt 2.7. Die 1440p-Stufe ist ein verstärktes Upscaling, kein natives Rendering — eine echte 2560×1440-Datei, gut für große Bildschirme, aber ein Modell mit nativem Hochauflösungspfad hält Details besser. Es gibt keinen negativen Prompt, Ausschlüsse müssen also über die Beschreibung des Gewünschten laufen. Und bei Image-to-Video folgt die Ausgabe dem Seitenverhältnis des Eingangsbildes — auf diesem Pfad gibt es keine Verhältnissteuerung, schneiden Sie die Quelle also vor der Generierung zu.

Eine brauchbare Faustregel: Greifen Sie zu Wan 3.0, wenn die Einstellung lang ist oder wenn die Übereinstimmung mit echtem Referenzmaterial darüber entscheidet, ob der Take brauchbar ist. Für offene Gewichte und anweisungsbasierte Edits: Wan 2.7. Für höchste Bildqualität in einer Einstellung: Veo 3.1. Für schnelle Wegwerf-Entwürfe derselben Familie: Wan 2.6 Flash. Und solange die Einstellung noch nicht feststeht, laufen Sie auf der Prime-Stufe und wechseln für das finale Rendering zurück.

Häufig gestellte Fragen

Wie lang kann ein Wan-3.0-Clip sein?+

Zwischen 2 und 30 Sekunden in einer Generierung. Das ist der zentrale Unterschied zur Vorgängergeneration: Ein 30-Sekunden-Abschnitt, für den früher drei Clips und ein Schnitt nötig waren, ist jetzt eine Anfrage.

Was darf ins Referenz-Set?+

Bis zu zehn Referenzbilder, fünf Referenzclips und fünf Referenz-Audiospuren in derselben Anfrage. Referenzvideo und Referenz-Audio sind auf jeweils 15 Sekunden Gesamtlänge begrenzt. Sobald eine Referenz dabei ist, läuft die Anfrage automatisch über die Referenz-Pipeline; ein reiner Text-Prompt läuft als Text-to-Video.

Ist Wan 3.0 wie Wan 2.7 quelloffen?+

Nein. Wan 2.7 erschien unter Apache 2.0 mit offenen Gewichten; Wan 3.0 ist reine API ohne veröffentlichte Gewichte. Wenn Self-Hosting oder offene Herkunft für Ihre Pipeline zählen, bleibt Wan 2.7 das Modell der Wahl.

Ist 1440p ein natives Rendering?+

Die Stufen 480p, 720p und 1080p sind native Renderings. Die Stufe 1440p entsteht durch ein verstärktes Upscaling eines nativen Renderings — sie liefert eine echte 2560×1440-Datei und ist die richtige Wahl für große Bildschirme, ist aber nicht dasselbe wie ein natives 1440p-Modell.

Worin unterscheiden sich Wan 3.0 und Wan 3.0 Prime?+

Gleiches Modell, gleiche Parameter, gleiche Grenzen — Prime läuft auf einer Überholspur und ist zu einem höheren Preis schneller fertig. Für finale Renderings die Standardstufe, für Iterationen, bei denen das Warten teuer ist, Prime.

Unterstützt Wan 3.0 negative Prompts?+

Nein. Wan 3.0 nimmt keinen negativen Prompt entgegen — beschreiben Sie stattdessen im positiven Prompt, was Sie wollen. Präzise Angaben zu Kamerawinkel, Licht und Bewegung bringen hier mehr als der Versuch, Dinge auszuschließen.

Weitere Modelle

Wan AI
Wan V2.7
Wan AI
ByteDance
Seedance V2.0
ByteDance
MiniMax
MiniMax H3
MiniMax
Google
Veo 3.1
Google
OpenAI
GPT Image 2.5
OpenAI
OpenAI
GPT Image 2.0
OpenAI
ByteDance
Seedance V2.0 Fast
ByteDance
ByteDance
Seedance V1.5 Pro
ByteDance
ByteDance
Seedance V1.0 Pro
ByteDance
ByteDance
Seedance V1.0 Pro Fast
ByteDance
ByteDance
Seedance V1.0 Lite
ByteDance
ByteDance
Seedream 5.0 Pro
ByteDance
ByteDance
Seedream 5.0 Lite
ByteDance
ByteDance
Seedream 4.5
ByteDance
ByteDance
Seedream 4
ByteDance
ByteDance
Dreamactor V2
ByteDance
MiniMax
Minimax Music V2.6
MiniMax
MiniMax
Minimax Music V2
MiniMax
MiniMax
Speech-2.8-HD
MiniMax
MiniMax
Speech-2.8-Turbo
MiniMax
Kling AI
Kling O3
Kling AI
Kling AI
Kling V3
Kling AI
Kling AI
Kling V3 Pro
Kling AI
Kling AI
Kling V2.6 Pro
Kling AI
Kling AI
Kling V2.6
Kling AI
Kling AI
Kling Lipsync
Kling AI
Kling AI
Kling Avatar V2
Kling AI
Kling AI
Kling O1
Kling AI
Midjourney
Midjourney V8.2
Midjourney
Midjourney
Midjourney V8.1
Midjourney
Midjourney
Midjourney
Midjourney
Alibaba
Happy Horse V1.1
Alibaba
Alibaba
Happy Horse
Alibaba
xAI
Grok Imagine V1.5
xAI
xAI
Grok Imagine
xAI
xAI
xAI TTS
xAI
Google
Veo 3.1 Fast
Google
Google
Veo 3
Google
Google
Nano Banana Pro
Google
Google
Nano Banana 2
Google
Google
Nano Banana
Google
Google
Lyria 3 Pro
Google
Google
Lyria 3
Google
Google
Lyria2
Google
Google
Gemini 3.1 Flash TTS
Google
Wan AI
Wan V2.2
Wan AI
Wan AI
Wan V2.2 Turbo
Wan AI
Wan AI
Wan V2.5
Wan AI
Wan AI
Wan V2.6
Wan AI
Wan AI
Wan V2.6 Flash
Wan AI
Pixverse AI
Pixverse V6
Pixverse AI
Pixverse AI
Pixverse V5.5
Pixverse AI
Pixverse AI
Pixverse V5
Pixverse AI
Pixverse AI
Pixverse Lipsync
Pixverse AI
Vidu AI
Vidu Q3 Pro
Vidu AI
Vidu AI
Vidu Q3
Vidu AI
Vidu AI
Vidu Q3 Turbo
Vidu AI
Vidu AI
Vidu Q2 Pro
Vidu AI
Vidu AI
Vidu Q2 Turbo
Vidu AI
Luma AI
Luma Ray 2
Luma AI
Luma AI
Luma Ray 2 Flash
Luma AI
Flux AI
Flux 2 Pro
Flux AI
Flux AI
Flux 2
Flux AI
Flux AI
Flux 2 Flash
Flux AI
ElevenLabs
Multilingual V3
ElevenLabs
ElevenLabs
Multilingual V2
ElevenLabs
ElevenLabs
Sound Effects V2
ElevenLabs
Hailuo AI
Hailuo 2.3
Hailuo AI
Hailuo AI
Hailuo 2.3 Fast
Hailuo AI
Hailuo AI
Hailuo 02
Hailuo AI
Lightricks
LTX-2.3 Pro
Lightricks
Lightricks
LTX-2.3 Fast
Lightricks
Lightricks
LTX-2.3
Lightricks
Pika AI
Pika V2.2
Pika AI
Qwen
Qwen3-TTS
Qwen
Inworld
Inworld TTS
Inworld
Bilibili Index
Index TTS 2
Bilibili Index
Resemble AI
Chatterbox TTS Multilingual
Resemble AI
Open Source
ACE-Step
Open Source
Open Source
LUX TTS
Open Source
CassetteAI
Music Generator
CassetteAI
Recraft
Text to Vector V4.1
Recraft
Recraft
Text to Vector V4.1 Pro
Recraft
Recraft
Image to Vector
Recraft