
Vídeo guiado por referência
Adicione até 9 referências para moldar a aparência e manter sujeitos consistentes.
O texto-para-vídeo N°1 da Alibaba — até 1080p, 9 imagens de referência, 3 a 15 segundos, nove proporções incluindo 21:9.
Pague uma vez por créditos e use-os em todos os modelos em ZOOOP. · Recarregue quando precisar, sem queima mensal.
Powered by Alibaba's API on ZOOOP
Do 21:9 ultrawide ao 9:21 — incluindo 16:9, 1:1, 5:4, 4:3, 3:4 e 4:5, uma gama de enquadramento mais ampla que a versão 1.0.
Adicione até 9 imagens de referência (20 MB cada) para guiar a aparência e ancorar sujeitos ao lado do prompt.
Gere clips de 3 a 15 segundos — entre as janelas de tomada única mais longas.
Aceita prompts até 2.500 caracteres para direção de cena granular.

Adicione até 9 referências para moldar a aparência e manter sujeitos consistentes.

Enquadramento ultrawide 21:9 para sequências de estilo cinematográfico — novo na 1.1.

Até 15 segundos capturam um batimento completo ou ação contínua numa geração.

9:16, 4:5 e 9:21 para clips prontos para feed e stories.

Prompts até 2.500 caracteres permitem descrever cenas complexas com precisão.

Saída 1080p para planos de qualidade de entrega.
Escolha o modelo de vídeo certo. Os seus créditos funcionam em todo o ZOOOP.
Abra o Happy Horse V1.1 a partir desta página ou selecione-o no Gerador de Vídeo.
Escreva o prompt ; adicione até 9 imagens de referência para guiar a aparência.
Escolha a proporção de imagem (21:9 a 9:21), resolução (até 1080p) e duração (3–15s).
Gere, depois descarregue ou envie o clipe para a sua canvas.
O Happy Horse V1.1 é o modelo texto-para-vídeo da Alibaba — o sucessor classificado N°1 do original Happy Horse que subiu ao topo do leaderboard blind-test da Artificial Analysis Video Arena. Aceita um prompt mais até 9 imagens de referência e gera um clipe até 1080p. O suporte a referência permite moldar a aparência e manter sujeitos consistentes sem depender apenas do texto, e a alocação de prompt longo (até 2.500 caracteres) torna-o adequado para cenas detalhadas e precisamente descritas.
A principal melhoria em relação à 1.0 é o enquadramento: V1.1 produz nove proporções de imagem, do 21:9 ultrawide para sequências cinematográficas até ao 9:21 para vertical alto, com 16:9, 1:1, 5:4, 4:3, 3:4 e 4:5 no meio — contra cinco no original. Combinado com uma duração de clip de 3 a 15 segundos (uma das janelas de tomada única mais longas da seleção) e imagens de referência maiores de 20 MB, uma ação completa ou batimento cabe num único formato e numa única passagem.
A sua posição: é uma sólida opção geral entre os modelos de vídeo do ZOOOP. Para um equilíbrio diferente, o Kling V3 é um bandeirante geral, o Seedance V2.0 lidera em física de movimento, o Wan V2.7 é o bandeirante Wan, e o Grok Imagine é a escolha rápida e estilizada; o Pika V2.2 são os rascunhos mais baratos. O ponto forte do Happy Horse V1.1 é o texto-para-vídeo guiado por referência, mais longo, com a gama de enquadramento mais ampla, até 1080p.
Um modelo mental razoável: use o Happy Horse V1.1 por predefinição quando quer vídeo guiado por referência com uma ampla escolha de proporções de imagem e uma janela de clip mais longa em 1080p, e mude para o Seedance V2.0 ou Veo 3.1 quando o realismo de movimento ou qualidade cinematográfica é a prioridade.
V1.1 é o lançamento N°1 da Alibaba. A maior mudança prática é a cobertura de enquadramento — nove proporções de imagem de 21:9 ultrawide a 9:21, contra cinco anteriormente — mais imagens de referência maiores de 20 MB. O número de referências (9), a duração do clip (3–15s) e a saída 1080p mantêm-se.
Até 9 — para guiar a aparência e ancorar sujeitos ao lado do prompt, até 20 MB cada.
De 3 a 15 segundos — uma das janelas de tomada única mais longas disponíveis.
720p ou 1080p, em nove proporções de imagem de 21:9 a 9:21.
O Happy Horse V1.1 é uma opção texto-para-vídeo equilibrada com suporte a referência, clips longos e a gama de enquadramento mais ampla. O Kling V3 é um bandeirante geral ; o Seedance V2.0 lidera em física de movimento. Escolha conforme as suas necessidades de referência, enquadramento e duração.
Prompt*
Images
Resolução*
Proporção de Aspecto*
Duração*