Como manter a mesma pessoa em vídeos de IA

Atualizado em julho de 2026 Leitura: 11 min Por Equipa Viraliza IA
Para a mesma personagem aparecer igual em várias cenas de IA, não basta descrevê-la bem em cada prompt — as ferramentas geram uma pessoa nova de cada vez. O método que funciona tem três passos: (1) escreve uma ficha de personagem fixa e cola-a, palavra por palavra, em todos os prompts; (2) gera a primeira cena, guarda um fotograma nítido do rosto e usa esse fotograma como imagem de referência nas cenas seguintes; (3) mantém iluminação, cenário e roupa descritos exatamente da mesma forma. Uma cena que usa imagem de referência deve ser uma cena muda, com áudio só de ambiente — e rosto de frente exige sempre fala, porque a ferramenta mexe a boca de qualquer maneira.

É o problema que aparece a todos ao segundo vídeo: a personagem da primeira cena está ótima, geras a segunda com a mesma descrição, e sai outra pessoa. Cabelo diferente, idade diferente, cara diferente. O vídeo fica com três atrizes a interpretar o mesmo papel — e a conta perde a única coisa que faz uma audiência reconhecer-te: uma cara constante.

Não se resolve escrevendo mais adjetivos. Resolve-se com método.

Porque é que a cara muda

Cada geração é um evento independente. A ferramenta lê o teu texto, imagina uma pessoa compatível com a descrição e produz esse resultado. Como há milhões de pessoas compatíveis com «mulher de 30 anos, cabelo escuro, camisa branca», recebes uma diferente de cada vez. O texto define a categoria; não define o indivíduo.

Para definir o indivíduo, tens de passar de texto para imagem.

Passo 1 — A ficha de personagem

Escreve uma vez, e cola sempre igual. Palavra por palavra, sem sinónimos criativos entre cenas.

O que a ficha tem de incluir

  • Idade aparente — um número, não «jovem».
  • Cabelo — cor, comprimento, corte, penteado concreto (por exemplo: cabelo castanho-escuro, liso, até aos ombros, apanhado num meio-cabelo).
  • Olhos e tom de pele.
  • Roupa — peça e cor exatas. A roupa é o que mais ajuda a leitura de continuidade.
  • Acessórios — brincos, óculos, um relógio. Um detalhe fixo funciona como assinatura.
  • Expressão habitual — expressão calma e confiante, por exemplo.

Nunca: nomes de pessoas reais, «parecida com [celebridade]», ou fotografias de pessoas reais como referência. Além do problema legal, o resultado fica preso a essa pessoa.

Passo 2 — O fotograma de referência

Este é o passo que resolve o problema de facto. Depois de gerares a primeira cena e ficares satisfeito:

  1. Exporta um fotograma nítido: rosto de frente ou em três-quartos, bem iluminado, olhos abertos, sem movimento desfocado.
  2. Guarda-o como a tua referência mestra da personagem.
  3. Nas cenas seguintes, passa esse fotograma como imagem de referência (no VEO 3 isto faz-se pelo Flow, usando o fotograma como ingrediente da cena nova).

Limita-te a três referências no máximo por cena. Com mais, as ferramentas começam a fundir características e o rosto deriva outra vez.

Passo 3 — A regra que quase ninguém cumpre

Uma cena gerada a partir de imagem de referência tem de ser escrita de forma diferente:

RegraPorquê
A cena de referência é mudaCom imagem de referência, a geração de áudio falha com mais frequência. Áudio só de ambiente evita o erro.
Não repitas a ficha completaA imagem já define o rosto. Repetir a descrição inteira faz a ferramenta hesitar entre o texto e a imagem.
Uma só linha de áudio no promptDuas instruções de áudio contraditórias são a causa mais comum de «falha ao gerar áudio».
Nunca peças o formato no textoA proporção (9:16) escolhe-se no painel da ferramenta. Escrevê-la no prompt costuma piorar o enquadramento.

O erro que estraga tudo: rosto de frente sem fala

Se escreveres uma cena com a personagem de frente para a câmara e sem diálogo, a ferramenta vai mexer-lhe a boca de qualquer forma — e depois, quando colares a narração por cima na montagem, os lábios não batem com as palavras. O resultado lê-se imediatamente como falso.

A regra, em duas linhas

Rosto de frente = tem fala, e a narração da montagem é exatamente a mesma frase, palavra por palavra.

Cena sem voz = plano de mãos, ecrã, produto, costas, perfil ou por cima do ombro. Nunca um rosto frontal.

Se a frase não couber nas 12 palavras que cabem numa cena de 8 segundos, encurta-se a frase — nunca se escreve uma versão longa para o vídeo e uma curta para a narração.

A ação tem de cobrir os 8 segundos

As ferramentas geram um bloco de duração fixa. Se a tua cena coreografada só ocupa 3,5 segundos, sobram 4,5 segundos que a ferramenta preenche por iniciativa própria — e é assim que aparecem falas inventadas e sotaques que não pediste.

Descreve a ação em blocos de tempo que cubram o intervalo todo (o que acontece de 0 a 2 segundos, de 2 a 5, de 5 a 8) e fecha com uma instrução explícita de que depois daquela linha a personagem não diz mais nada e mantém os lábios fechados.

Cada ferramenta lê de forma diferente

FerramentaComo escreverVoz
VEO 3Prompt longo e detalhado, ação por blocos de tempo, negativos no fim. Referência de imagem pelo Flow.Gera voz. Ancora sempre a língua e o sotaque.
KlingPrompt curto e direto, mais o campo de negative prompt separado.Não gera voz útil — narração na montagem.
RunwaySó afirmações positivas. Negações podem trazer o que queres evitar.Narração na montagem.
HailuoLiteral e concreto, com indicações de câmara explícitas.Narração na montagem.

Verifica antes de gastar créditos

A regra mais barata deste artigo: gera a cena 2, compara o rosto com a referência, e só depois gera as restantes. Descobrir a deriva à décima cena custa dez vezes mais do que descobri-la à segunda.

Quando isto vem já resolvido

Este método é o que está automatizado na Viraliza IA. Em cada cena de IA recebes o prompt já escrito no estilo da ferramenta que escolheste — com a ficha da apresentadora embutida, a ação em blocos de tempo, a linha de áudio correta para o tipo de cena e os passos de consistência no topo do plano. Depois envias os clips gerados e a montagem alinha tudo: cortes, legendas e a narração em português de Portugal por cima, com a mesma voz do princípio ao fim do vídeo. Ver os planos — os prompts entram a partir do Pro e o caminho 100% IA no Total.

Perguntas frequentes

Porque é que a cara muda de cena para cena?
Porque cada geração é independente: a ferramenta interpreta o texto de novo e inventa uma pessoa nova compatível com a descrição. Duas descrições idênticas dão duas pessoas diferentes. A única forma fiável de fixar o rosto é dar-lhe uma imagem de referência, não mais texto.
Quantas palavras deve ter um prompt de vídeo?
Depende da cena. Com fala, entre 180 e 260 palavras; em cena muda, entre 140 e 210; num plano de ecrã ou de mãos, 90 a 150 chegam. Prompts muito curtos deixam a ferramenta improvisar — e é aí que aparecem falas inventadas e sotaques errados.
Porque é que a IA inventa falas que eu não escrevi?
Porque as ferramentas geram um bloco de duração fixa (tipicamente 8 segundos). Se a tua ação só ocupa 4, sobram 4 segundos vazios — e a ferramenta preenche-os. A solução é descrever a ação em tempos que cubram os 8 segundos todos e fechar com uma instrução explícita de que a personagem não diz mais nada.
Como evito sotaque errado na fala gerada?
Ancorando o sotaque no prompt de forma explícita (por exemplo, português europeu com sotaque de Lisboa, de Portugal e não do Brasil). Mesmo assim é uma lotaria entre gerações: a alternativa segura é gerar a cena sem depender da voz da ferramenta e pôr a narração na montagem, sintetizada na língua e sotaque certos.
Vale a pena usar negativos («sem legendas», «sem logótipo»)?
No VEO 3, sim, e devem ir no fim do prompt. Em ferramentas que ignoram negações — o Runway é o caso típico — escrever «sem X» pode trazer X. Nessas, tudo pela positiva: em vez de «sem falar», escreve «a boca mantém-se fechada».

Queres o plano do próximo vídeo em minutos?

Colas o link de um vídeo que rebentou. A Viraliza IA vê-o imagem a imagem, ouve o áudio e devolve o raio-X do porquê — mais três caminhos para o replicares: gravas tu com guião, modo híbrido (gravas o que consegues, a IA gera o resto) ou vídeo 100% IA. A montagem, as legendas e a copy vêm feitas.

Começar por 29,90 €/mês   Ver como funciona