Como manter a mesma pessoa em vídeos de IA
É o problema que aparece a todos ao segundo vídeo: a personagem da primeira cena está ótima, geras a segunda com a mesma descrição, e sai outra pessoa. Cabelo diferente, idade diferente, cara diferente. O vídeo fica com três atrizes a interpretar o mesmo papel — e a conta perde a única coisa que faz uma audiência reconhecer-te: uma cara constante.
Não se resolve escrevendo mais adjetivos. Resolve-se com método.
Porque é que a cara muda
Cada geração é um evento independente. A ferramenta lê o teu texto, imagina uma pessoa compatível com a descrição e produz esse resultado. Como há milhões de pessoas compatíveis com «mulher de 30 anos, cabelo escuro, camisa branca», recebes uma diferente de cada vez. O texto define a categoria; não define o indivíduo.
Para definir o indivíduo, tens de passar de texto para imagem.
Passo 1 — A ficha de personagem
Escreve uma vez, e cola sempre igual. Palavra por palavra, sem sinónimos criativos entre cenas.
O que a ficha tem de incluir
- Idade aparente — um número, não «jovem».
- Cabelo — cor, comprimento, corte, penteado concreto (por exemplo: cabelo castanho-escuro, liso, até aos ombros, apanhado num meio-cabelo).
- Olhos e tom de pele.
- Roupa — peça e cor exatas. A roupa é o que mais ajuda a leitura de continuidade.
- Acessórios — brincos, óculos, um relógio. Um detalhe fixo funciona como assinatura.
- Expressão habitual — expressão calma e confiante, por exemplo.
Nunca: nomes de pessoas reais, «parecida com [celebridade]», ou fotografias de pessoas reais como referência. Além do problema legal, o resultado fica preso a essa pessoa.
Passo 2 — O fotograma de referência
Este é o passo que resolve o problema de facto. Depois de gerares a primeira cena e ficares satisfeito:
- Exporta um fotograma nítido: rosto de frente ou em três-quartos, bem iluminado, olhos abertos, sem movimento desfocado.
- Guarda-o como a tua referência mestra da personagem.
- Nas cenas seguintes, passa esse fotograma como imagem de referência (no VEO 3 isto faz-se pelo Flow, usando o fotograma como ingrediente da cena nova).
Limita-te a três referências no máximo por cena. Com mais, as ferramentas começam a fundir características e o rosto deriva outra vez.
Passo 3 — A regra que quase ninguém cumpre
Uma cena gerada a partir de imagem de referência tem de ser escrita de forma diferente:
| Regra | Porquê |
|---|---|
| A cena de referência é muda | Com imagem de referência, a geração de áudio falha com mais frequência. Áudio só de ambiente evita o erro. |
| Não repitas a ficha completa | A imagem já define o rosto. Repetir a descrição inteira faz a ferramenta hesitar entre o texto e a imagem. |
| Uma só linha de áudio no prompt | Duas instruções de áudio contraditórias são a causa mais comum de «falha ao gerar áudio». |
| Nunca peças o formato no texto | A proporção (9:16) escolhe-se no painel da ferramenta. Escrevê-la no prompt costuma piorar o enquadramento. |
O erro que estraga tudo: rosto de frente sem fala
Se escreveres uma cena com a personagem de frente para a câmara e sem diálogo, a ferramenta vai mexer-lhe a boca de qualquer forma — e depois, quando colares a narração por cima na montagem, os lábios não batem com as palavras. O resultado lê-se imediatamente como falso.
A regra, em duas linhas
Rosto de frente = tem fala, e a narração da montagem é exatamente a mesma frase, palavra por palavra.
Cena sem voz = plano de mãos, ecrã, produto, costas, perfil ou por cima do ombro. Nunca um rosto frontal.
Se a frase não couber nas 12 palavras que cabem numa cena de 8 segundos, encurta-se a frase — nunca se escreve uma versão longa para o vídeo e uma curta para a narração.
A ação tem de cobrir os 8 segundos
As ferramentas geram um bloco de duração fixa. Se a tua cena coreografada só ocupa 3,5 segundos, sobram 4,5 segundos que a ferramenta preenche por iniciativa própria — e é assim que aparecem falas inventadas e sotaques que não pediste.
Descreve a ação em blocos de tempo que cubram o intervalo todo (o que acontece de 0 a 2 segundos, de 2 a 5, de 5 a 8) e fecha com uma instrução explícita de que depois daquela linha a personagem não diz mais nada e mantém os lábios fechados.
Cada ferramenta lê de forma diferente
| Ferramenta | Como escrever | Voz |
|---|---|---|
| VEO 3 | Prompt longo e detalhado, ação por blocos de tempo, negativos no fim. Referência de imagem pelo Flow. | Gera voz. Ancora sempre a língua e o sotaque. |
| Kling | Prompt curto e direto, mais o campo de negative prompt separado. | Não gera voz útil — narração na montagem. |
| Runway | Só afirmações positivas. Negações podem trazer o que queres evitar. | Narração na montagem. |
| Hailuo | Literal e concreto, com indicações de câmara explícitas. | Narração na montagem. |
Verifica antes de gastar créditos
A regra mais barata deste artigo: gera a cena 2, compara o rosto com a referência, e só depois gera as restantes. Descobrir a deriva à décima cena custa dez vezes mais do que descobri-la à segunda.
Quando isto vem já resolvido
Este método é o que está automatizado na Viraliza IA. Em cada cena de IA recebes o prompt já escrito no estilo da ferramenta que escolheste — com a ficha da apresentadora embutida, a ação em blocos de tempo, a linha de áudio correta para o tipo de cena e os passos de consistência no topo do plano. Depois envias os clips gerados e a montagem alinha tudo: cortes, legendas e a narração em português de Portugal por cima, com a mesma voz do princípio ao fim do vídeo. Ver os planos — os prompts entram a partir do Pro e o caminho 100% IA no Total.
Perguntas frequentes
Porque é que a cara muda de cena para cena?
Quantas palavras deve ter um prompt de vídeo?
Porque é que a IA inventa falas que eu não escrevi?
Como evito sotaque errado na fala gerada?
Vale a pena usar negativos («sem legendas», «sem logótipo»)?
Queres o plano do próximo vídeo em minutos?
Colas o link de um vídeo que rebentou. A Viraliza IA vê-o imagem a imagem, ouve o áudio e devolve o raio-X do porquê — mais três caminhos para o replicares: gravas tu com guião, modo híbrido (gravas o que consegues, a IA gera o resto) ou vídeo 100% IA. A montagem, as legendas e a copy vêm feitas.