
Fazer uma foto se mover
Um retrato parado executa o movimento de referência — sem precisar filmar.
Entregue um clipe de referência e o seu personagem, e o movimento é transferido intacto — dança, gesto, expressão. O movimento é exato; o personagem continua sendo o seu.
Um clipe de referência especifica o movimento com muito mais precisão do que palavras — "faça uma dança" devolve o improviso do modelo; uma referência devolve aquela dança.
O movimento vem da referência, a aparência vem da imagem do seu personagem. São dois controles separados.
Um retrato parado mais um movimento de referência entregam o vídeo daquela pessoa executando a ação.
Aplique a mesma referência a personagens diferentes e obtenha um conjunto de clipes com o mesmo movimento e pessoas distintas.

Um retrato parado executa o movimento de referência — sem precisar filmar.

Use uma dança como referência e faça seu personagem executá-la, marcando as mesmas batidas.

Aplique um mesmo movimento a vários personagens diferentes para produzir um conjunto coerente.

Um personagem fixo mais movimento gravado, para produzir conteúdo em volume com uma pessoa consistente.
Abra o Controle de Movimento com IA e envie a imagem ou o clipe do seu personagem.
Envie um clipe de movimento de referência para especificar a ação a ser transferida.
Baixe o resultado ou mande para a tela para continuar montando.
Escreva "faça uma dança" em um gerador de vídeo e você recebe a ideia que o modelo tem de dança — talvez bonita, mas não a dança que você tinha em mente. Movimento tem banda larga demais para caber em texto: andamento, amplitude e os detalhes de uma pose não entram em um prompt.
O controle de movimento troca a entrada: você entrega um clipe de referência. O movimento é extraído do vídeo, a aparência vem da imagem do seu personagem, e os dois são controlados separadamente. Assim o seu personagem executa aquele movimento específico.
A qualidade de imagem da referência não importa — ela só fornece o movimento, e a aparência vem inteiramente do seu personagem. O que importa é que o movimento seja legível:
Outra coisa que vale casar é o enquadramento. Uma referência de dança de corpo inteiro contra uma imagem de personagem da cintura para cima obriga o modelo a inventar a metade que falta, e ela pode não corresponder ao seu personagem. Os resultados mais próximos vêm quando os dois enquadramentos são parecidos.
O valor desta página é a certeza sobre o movimento. Por isso ela serve a duas situações: você tem um movimento que precisa ser reproduzido (uma dança específica, um gesto específico), ou precisa de um lote de clipes com personagens diferentes e movimento idêntico.
Em compensação, se o movimento é qualquer um e tudo o que você quer é "que se mexa", o gerador de vídeo dá menos trabalho — nenhuma referência para preparar, uma frase basta.
No imagem para vídeo o modelo decide o movimento e você só o conduz vagamente com palavras — "dançando" devolve a ideia que o modelo tem de dançar. O controle de movimento usa um clipe real como molde de movimento, então o que acontece é aquele movimento específico. Use esta página quando o movimento tem de ser exato; use o imagem para vídeo quando quiser a ideia do modelo.
Movimento claro e um corpo completo são o que mais importa. Movimento de corpo inteiro exige o corpo inteiro visível; gestos exigem mãos visíveis. Oclusão, luz muito fraca ou várias pessoas se movendo ao mesmo tempo degradam a extração. A qualidade de imagem da referência é irrelevante — ela só fornece o movimento, enquanto a aparência vem do seu personagem.
Por concepção, não — movimento da referência, aparência do seu personagem. Mas quando os dois diferem muito no enquadramento (uma referência de dança de corpo inteiro contra uma imagem de personagem da cintura para cima), o modelo precisa inventar a parte que falta, e essa parte pode não corresponder exatamente ao seu personagem.
Elas governam partes diferentes: a sincronia labial alinha a boca ao áudio; o controle de movimento transfere movimento de corpo e pose. Para um personagem que se move e fala, a ordem habitual é primeiro o movimento, depois a sincronia labial.
Prompt
Image*
Video*