
Histoires de 30 secondes en plan-séquence
Une seule génération couvre une séquence narrative complète — un mouvement de caméra continu, une annonce entière, une visite guidée — au lieu de trois clips à raccorder au montage.
Le moteur vidéo tout-en-un d'Alibaba — 30 secondes en une seule passe, audio natif, et un jeu de références qui accepte images, clips et voix ensemble.
Payez une fois pour les crédits - utilisez-les sur tous les modèles de ZOOOP. · Rechargez quand vous en avez besoin, pas de brûlure mensuelle.
Powered by Wan AI's API on ZOOOP
Une requête produit jusqu'à 30 secondes de vidéo continue — de quoi couvrir une séquence narrative entière, une visite en plan-séquence ou une annonce complète, sans raccorder des clips après coup.
Jusqu'à dix images, cinq clips et cinq pistes audio de référence partent dans la même requête. Visages, produits et voix restent alignés sur tout le plan au lieu de dériver d'une prise à l'autre.
Fixez l'image d'ouverture, et si besoin celle de fermeture : Wan génère le mouvement qui les relie. C'est la façon la plus fiable d'obtenir la fin exacte dont le montage a besoin.
Dialogues, ambiances et musique sont générés avec l'image dans la même passe et arrivent en piste stéréo sur le fichier final. Couper l'audio ne coûte rien de plus.

Une seule génération couvre une séquence narrative complète — un mouvement de caméra continu, une annonce entière, une visite guidée — au lieu de trois clips à raccorder au montage.

Jusqu'à dix images de référence de la même personne, du même costume ou du même produit : l'identité tient sur tout le clip — le même visage à la seconde 2 et à la seconde 28.

L'audio de référence entre dans la même requête que les références visuelles : la scène parlée sort avec la voix que vous avez fournie, pas avec une synthèse générique.

Commencez sur le packshot, terminez sur l'image héroïque. Le contrôle début/fin fixe les deux extrémités pour que la révélation enchaîne proprement.

Le palier supérieur rend en 2560×1440, pour les visuels de page d'accueil et la diffusion grand écran, là où un master 720p s'adoucit visiblement.

Wan 3.0 Prime, c'est le même modèle sur une voie prioritaire — commandes identiques, génération prioritaire — pour la passe où le plan n'est pas encore arrêté.
Wan 3.0 s'impose quand un plan doit durer et rester fidèle à de vraies références. Changez de modèle si le besoin est ailleurs.
Ouvrez Wan 3.0 depuis cette page ou sélectionnez-le dans le générateur vidéo.
Écrivez le prompt, puis ajoutez images, clips ou audio de référence si le plan en a besoin.
Choisissez le format, la résolution jusqu'à 1440p et une durée entre 2 et 30 secondes.
Générez — le clip final arrive avec sa piste audio déjà synchronisée.
Wan 3.0 répond à la question que tous les modèles vidéo esquivent : que faire quand le plan doit durer plus de quelques secondes ? La plupart des modèles phares plafonnent une génération entre cinq et quinze secondes, si bien que tout ce qui ressemble à une scène finit assemblé au montage à partir de clips qui ne raccordent jamais tout à fait — le visage dérive, la lumière saute, la pièce change de forme à la coupe. Wan 3.0 rend jusqu'à trente secondes en une seule passe, et ce seul changement réorganise la façon de préparer un plan. Un mouvement de caméra continu à travers un espace, une annonce de trente secondes, une visite produit en plan-séquence : ce ne sont plus des problèmes de montage mais des problèmes de prompt.
Le deuxième atout est la référence tout-en-un. Les systèmes de référence n'acceptent en général qu'un seul type d'entrée — des images pour certains, un clip pour quelques-uns, une voix très rarement. Wan 3.0 accepte les trois dans la même requête : jusqu'à dix images, cinq clips et cinq pistes audio, avec un plafond de quinze secondes de vidéo de référence et quinze secondes d'audio de référence. En pratique, tout un kit de marque ou toute une fiche de personnage entre d'un coup, et l'identité tient sur la durée du clip et pas seulement sur les premières secondes. Sur ZOOOP, l'aiguillage est automatique : joignez une référence et la requête part vers le pipeline de référence ; laissez le champ vide et le même modèle fait du text-to-video.
Deux autres capacités comptent au quotidien. Le contrôle des images de début et de fin permet d'épingler les deux extrémités d'un clip et de laisser Wan générer le mouvement entre elles — c'est ainsi qu'on obtient une fin exacte qui enchaîne proprement. Et l'audio natif synchronisé — dialogues, ambiances, musique — est généré avec l'image dans la même passe et arrive en piste stéréo sur le fichier, l'interrupteur audio ne changeant rien au tarif.
Là où il est plus faible : il n'est pas open-weight. Wan 2.7 est sorti sous Apache 2.0 avec des poids publiés, Wan 3.0 non — aucun poids, API uniquement. Pour un pipeline qui exige l'auto-hébergement ou une provenance ouverte, c'est rédhibitoire et la réponse reste 2.7. Son palier 1440p est un upscale amélioré, pas un rendu natif — un vrai fichier 2560×1440, adapté au grand écran, mais un modèle doté d'une passe native en haute résolution retiendra mieux le détail. Il n'y a pas de prompt négatif, les exclusions passent donc par la description de ce que vous voulez. Enfin, en image-to-video la sortie suit le format de l'image d'entrée : ce chemin n'offre pas de contrôle de ratio, recadrez donc la source avant de générer.
Un repère raisonnable : prenez Wan 3.0 quand le plan est long, ou quand la fidélité à de vraies références décide si la prise est utilisable. Pour des poids ouverts et le montage par instruction, Wan 2.7. Pour la qualité maximale sur un plan unique, Veo 3.1. Pour des brouillons jetables dans la même famille, Wan 2.6 Flash. Et tant que le plan n'est pas arrêté, travaillez sur le palier Prime et revenez au standard pour le rendu final.
Entre 2 et 30 secondes en une seule génération. C'est la différence majeure avec la génération précédente : une séquence de 30 secondes qui demandait trois clips et un montage tient désormais en une requête.
Jusqu'à dix images, cinq clips et cinq pistes audio de référence dans la même requête. Les clips de référence et l'audio de référence sont chacun plafonnés à 15 secondes au total. Dès qu'une référence est présente, la requête part automatiquement vers le pipeline de référence ; un prompt purement textuel lance le text-to-video.
Non. Wan 2.7 est sorti sous Apache 2.0 avec des poids ouverts ; Wan 3.0 est uniquement accessible par API, sans poids publiés. Si l'auto-hébergement ou la provenance ouverte comptent pour votre pipeline, restez sur Wan 2.7.
Les paliers 480p, 720p et 1080p sont des rendus natifs. Le palier 1440p provient d'un upscale amélioré d'un rendu natif : il livre un vrai fichier 2560×1440 et convient à la diffusion grand écran, mais ce n'est pas un modèle 1440p natif.
Même modèle, mêmes paramètres, mêmes limites — Prime passe par une voie prioritaire, plus rapide et à un tarif plus élevé. Palier standard pour les rendus finaux, Prime quand l'attente coûte cher pendant les itérations.
Non. Wan 3.0 ne prend pas de prompt négatif — décrivez plutôt ce que vous voulez dans le prompt positif. Être précis sur l'angle de caméra, la lumière et le mouvement donne bien plus de résultats qu'essayer d'exclure des éléments.
Première et dernière image vidéoTexte et référence à la vidéo
Première et dernière image vidéoTexte et référence à la vidéo
Première et dernière image vidéoTexte et référence à la vidéo
Première et dernière image vidéoTexte et référence à la vidéo
Première et dernière image vidéoTexte et référence à la vidéo
Première et dernière image vidéoTexte et référence à la vidéo
Wan 3.0
Prompt*
Images
Vidéos
Audios
Rapport hauteur / largeur*
Résolution*
Durée*