Uma checklist de prompts para vídeo com IA que realmente funciona
Escrever prompts para vídeo com IA que gerem resultados cinematográficos e consistentes exige mais do que descrever o que você quer. Esta checklist detalha cada elemento, da composição da cena e do movimento de câmera às pistas de iluminação e ao ritmo, para que sua próxima geração de vídeo acerte na primeira tentativa.
O campo de prompt vazio diante de um modelo de texto para vídeo parece enganosamente simples. Você digita algo, clica em gerar e, dois minutos depois, tem um vídeo. Só que ele não se parece em nada com o que você imaginou.
A distância entre "eu descrevi com clareza" e "saiu certo" quase sempre é um problema de prompt. Não porque você escreveu as palavras erradas, mas porque os modelos de texto para vídeo precisam de um tipo muito específico de informação, numa ordem muito específica, e a maioria das pessoas deixa metade de fora sem perceber. Esta checklist cobre cada elemento que pertence a um prompt de vídeo com IA, organizado para que você possa revisá-lo antes de cada geração.
Por que a maioria dos prompts de vídeo com IA fica aquém
A diferença entre escrever prompts para imagem e para vídeo
Prompts de imagem descrevem um único momento congelado. Você pode ser flexível com o tempo e o movimento, porque o modelo só precisa sintetizar um quadro. Prompts de vídeo descrevem uma sequência. O modelo precisa saber o que inicia a cena, como ela muda ao longo de 5 ou 10 segundos e o que a câmera faz durante todo o tempo. Se isso ficar de fora, o modelo preenche as lacunas do jeito que quiser, normalmente com deriva aleatória da câmera, tremor do sujeito e um meio que não se parece em nada com o quadro inicial.
O que o modelo realmente precisa saber
A maioria dos modelos de vídeo com IA é treinada com milhões de clipes que já trazem convenções profissionais de cinematografia. Eles respondem bem à linguagem desse ofício: termos específicos de câmera, vocabulário de iluminação, verbos de movimento. Adjetivos vagos como "legal" ou "bonito" não dão ao modelo nada concreto para trabalhar.
Modelos como Seedance 2.0, Kling v3 Video e Veo 3.1 respondem significativamente melhor a prompts estruturados e específicos. Vamos detalhar cada seção de um deles.
A checklist da base da cena
Antes de qualquer detalhe de câmera ou movimento, um bom prompt de vídeo com IA estabelece o quem, o quê e onde. Essas três âncoras dão ao modelo um ponto de partida estável para cada quadro.
Sujeito: quem ou o quê está no quadro
Defina seu sujeito com especificidade suficiente para que um diretor de elenco conseguisse encontrá-lo. Em vez de "uma mulher", tente "uma mulher de uns 30 anos, com cabelo curto e escuro, usando uma capa de chuva cor creme". Em vez de "um carro", tente "um muscle car preto dos anos 1960, com acabamento cromado e escapamentos traseiros".
Esse nível de detalhe serve à consistência temporal. Quando o modelo recebe uma descrição precisa do sujeito, ele mantém essa descrição estável em todos os quadros, em vez de se afastar dela.
Fraco
Forte
"um homem caminhando"
"um homem barbudo de terno cinza, uns 40 e poucos anos, caminhando com as mãos nos bolsos"
"uma cidade"
"uma rua estreita de paralelepípedos numa cidade europeia chuvosa, vitrines molhadas, fim de tarde"
"cena de natureza"
"uma clareira de pinheiros ao amanhecer, névoa rente ao chão, contraluz do sol nascente"
Ambiente: onde a ação acontece
O ambiente precisa da mesma especificidade do sujeito. "Numa cafeteria" é pouco. "Dentro de uma pequena cafeteria independente, com paredes de tijolo aparente, cadeiras de madeira desencontradas, iluminação quente de lâmpadas Edison e chuva visível na janela da rua ao fundo" dá ao modelo um espaço real para preencher. Quanto mais rica a descrição do ambiente, mais estável o fundo permanece entre os quadros.
Hora do dia e clima
Esses dois parâmetros fazem mais trabalho do que quase qualquer outro elemento do seu prompt. Eles determinam a direção da luz, a temperatura de cor, a dureza das sombras e a difusão atmosférica. "Neblina do início da manhã", "sol forte do meio-dia", "tarde nublada", "crepúsculo da hora azul": cada um desses coloca em movimento um mundo visual completamente diferente. Nunca deixe a hora do dia sem especificação.
Pistas de câmera e composição
Ângulo e distância
Modelos de vídeo com IA respondem bem aos termos padrão de cinematografia para ângulo e distância. Use-os diretamente:
Ângulos: altura dos olhos, ângulo baixo, ângulo alto, vista de pássaro, inclinação holandesa, por cima do ombro
Distâncias: close extremo (ECU), close (CU), plano médio (MS), plano inteiro (FS), plano geral, plano geral extremo (EWS)
Combiná-los ("plano médio em ângulo baixo") diz ao modelo exatamente onde posicionar a câmera em relação ao sujeito.
Instruções de movimento que funcionam
O movimento de câmera é uma das alavancas mais impactantes na escrita de prompts para vídeo, e uma das mais negligenciadas. Algumas descrições de movimento confiáveis, às quais a maioria dos modelos responde bem:
"dolly-in lento": a câmera se move fisicamente em direção ao sujeito
"panorâmica suave para a direita": a câmera gira na horizontal
"tilt para cima": a câmera gira na vertical, para cima
"plano de acompanhamento": a câmera segue o sujeito em movimento
"plano estático travado": sem movimento, muito estável
"descida aérea lenta": vista de pássaro descendo
💡 Para modelos como Kling v2.6 e Kling v3 Omni Video, especificar o movimento de câmera diretamente no prompt gera resultados mais intencionais e direcionados do que deixá-lo sem definição.
Notas sobre lente e profundidade de campo
Se você sabe a distância focal que quer, inclua-a. "Lente de retrato de 85mm com profundidade de campo rasa" produz um resultado diferente de "grande-angular de 28mm, tudo em foco". Esses números não são arbitrários: eles codificam estéticas visuais específicas que aparecem de forma consistente nos dados de treinamento. Uma grande-angular de 28mm cria contexto ambiental. Uma 85mm comprime o espaço e isola o sujeito. Uma teleobjetiva de 200mm achata as camadas e cria um isolamento dramático do sujeito contra fundos movimentados.
Descrição de movimento e ação
Descrevendo o movimento com precisão
O erro mais comum na descrição de movimento é afirmar o que algo é, em vez do que ele faz.
"Uma pessoa correndo" diz ao modelo que o sujeito está em movimento. Não diz ao modelo a qualidade, a velocidade, a direção ou o detalhe físico desse movimento. "Uma mulher sprintando em alta velocidade na direção da câmera, braços balançando, cascalho espalhado atrás dos pés, expressão concentrada" diz ao modelo as cinco coisas.
Use verbos ativos e detalhes físicos observáveis: desmoronando, balançando, cintilando, inclinando, girando, ondulando, esvoaçando. Eles geram movimentos mais consistentes do que termos gerais como "movendo" ou "animado".
O problema do ritmo
Vídeos de cinco segundos precisam de um arco de ação único e claro. Vídeos de dez segundos comportam duas batidas. Geradores como Wan 2.7 T2V, LTX 2.3 Pro e Hailuo 02 produzem clipes melhores quando o prompt descreve uma ação contínua única, em vez de vários eventos separados.
Se você escreve "ela abre a porta, entra, senta e pega o telefone", está descrevendo uma cena de 30 segundos comprimida num clipe de 5 segundos. O modelo vai pular quadros ou produzir saltos desconexos. Em vez disso: "ela abre devagar a porta pesada de madeira, parando na soleira, com luz dourada entrando atrás dela".
O que consistência temporal realmente significa
Consistência temporal é a estabilidade dos elementos visuais entre os quadros: o rosto do sujeito, o fundo, a iluminação, a paleta de cores. Quando ela falha, aparecem texturas tremeluzentes, rostos que se deformam ou ambientes que mudam no meio do clipe.
Melhorá-la exige dar ao modelo âncoras estáveis. Descrições longas e específicas do sujeito ajudam. Descrições fortes de iluminação da cena ajudam. Evitar muitos elementos em movimento ao mesmo tempo ajuda. Modelos como Pixverse v6 e Gen 4.5 têm melhorias de estabilidade embutidas, mas o prompt ainda define a base.
Iluminação e atmosfera
Luz natural versus luz artificial
Descrições de luz natural carregam associações fortes nos dados de treinamento. "Contraluz da hora dourada", "luz difusa de dia nublado", "luz de rua na hora azul", "sol do meio-dia a pino projetando sombras duras": cada uma define imediatamente o contexto visual para o modelo.
A luz artificial oferece mais precisão. "Lâmpada de tungstênio única no teto", "letreiro de neon refletido no asfalto molhado", "estúdio com três pontos de luz e preenchimento suave", "fluorescente piscando num corredor": todos esses codificam climas cinematográficos específicos com alta consistência.
Clima pela temperatura de cor
A temperatura de cor afeta a leitura emocional de uma cena tanto quanto qualquer outro elemento do seu prompt. Use estes termos diretamente:
Misto: cinematográfico e dramático (por exemplo, "luz quente de interior se derramando sobre um exterior azul frio")
Evitando o problema do vídeo chapado
Vídeos chapados e subexpostos geralmente vêm de prompts sem nenhuma descrição de iluminação. O modelo recorre a uma média de cinza intermediário. Para evitar isso:
Sempre nomeie uma fonte de luz (janela, sol, abajur, poste de rua, tela)
Nomeie a direção (da esquerda, de cima, em contraluz, em luz lateral)
Nomeie a qualidade (dura, suave, difusa, direta, espalhada)
Mesmo uma única frase de descrição de iluminação ("luz quente de janela vinda da esquerda, projetando sombras suaves sobre o rosto do sujeito") muda drasticamente o resultado visual de qualquer geração.
Estilo, prompts negativos e verificações finais
Modificadores de estilo que realmente funcionam
Os melhores modificadores de estilo para vídeo com IA vêm de referências cinematográficas reais. Eles codificam sistemas visuais específicos que o modelo absorveu de filmes e fotografias de verdade:
"fotorrealista, 8K": base de realismo fotográfico
"grão de filme, Kodak Portra 400": textura analógica, calor dessaturado
"paleta Kodachrome": cor vintage saturada
"look Arri Alexa": ciência de cor de cinema profissional
"reflexos anamórficos de lente": estética de cinema widescreen
"documental em câmera na mão": tremor naturalista intencional
Evite termos de aparência sintética como "digital hiper-realista" ou "renderização 3D cinematográfica". Eles costumam puxar o modelo para estéticas de CG mesmo quando você quer filmagem com atores reais.
Prompts negativos: o que excluir
Nem todos os modelos de vídeo têm um campo separado de prompt negativo. Quando têm, use-o. Exclusões padrão que melhoram a maioria dos vídeos:
desfocado, fora de foco (a menos que seja intencional)
marca d’água, texto sobreposto, logotipo
desenho animado, ilustração, animado, anime
baixa qualidade, pixelizado, artefatos de compressão
tremor excessivo da câmera (a menos que solicitado)
várias pessoas (se sua cena precisa de um único sujeito)
O teste de leitura final
Antes de enviar qualquer prompt, leia-o de volta e responda a estas seis perguntas:
Você consegue visualizar exatamente como é o primeiro quadro?
Você sabe o que muda entre o primeiro e o último quadro?
Há uma fonte de luz nomeada?
Você nomeou o ângulo da câmera?
Você descreveu o movimento da câmera, ou deixou a câmera parada de forma explícita?
O sujeito está descrito com especificidade suficiente para se manter consistente entre os quadros?
Se você responder "não" a qualquer uma delas, preencha essa lacuna antes de gerar.
Checklist de prompts por modelo de vídeo com IA
Modelos diferentes respondem de forma diferente ao mesmo prompt. Adaptar sua linguagem às características do modelo gera resultados melhores do que uma abordagem única para todos.
Seedance 2.0 para movimento e áudio
O Seedance 2.0 produz áudio nativo junto com o vídeo, o que o torna ideal para cenas em que o som ambiente importa. Sua qualidade de movimento lida bem com sujeitos em alta velocidade. Para o Seedance, descrever o contexto sonoro no prompt melhora a trilha gerada: "ondas batendo numa praia de pedras", "zumbido do trânsito da cidade na hora do rush", "passos num caminho de cascalho".
Kling v3 para controle cinematográfico
O Kling v3 Video responde especialmente bem à linguagem específica de câmera. Nomear tipos de movimento ("push-in lento", "plano de grua subindo") gera resultados visivelmente mais controlados do que descrições genéricas. A saída em 1080p do Kling v3 o torna uma escolha forte quando a qualidade do resultado importa mais do que a velocidade de geração. O Kling v2.6 oferece um bom equilíbrio entre velocidade e controle para iterações mais rápidas.
Wan 2.7 para sequências mais longas
O Wan 2.7 T2V gera em 1080p e é uma escolha forte para clipes mais longos com boa estabilidade temporal. Sua variante de imagem para vídeo, o Wan 2.7 I2V, recebe uma imagem de referência como primeiro quadro, o que reduz bastante os problemas de consistência, já que o modelo tem um ponto de partida concreto, perfeito em nível de pixel, em vez de construir tudo apenas a partir do texto.
Veo 3.1 para conteúdo sincronizado com áudio
O Veo 3.1 gera vídeo com áudio nativo sincronizado. Para cenas de diálogo ou conteúdo guiado por música, incluir descrições de som no prompt dá mais material para a geração de áudio: "violão acústico tocando suavemente ao fundo", "diálogo num banheiro de azulejos com reverberação natural", "vento passando pelos pinheiros".
Pixverse v6 e Hailuo 02 para iteração rápida
Quando a velocidade de iteração importa mais do que a qualidade máxima, o Pixverse v6 e o Hailuo 02 oferecem resposta rápida em boa resolução. Eles funcionam bem para testar variações de prompt: escreva três versões da mesma cena com iluminação ou descrições de movimento diferentes, gere as três rapidamente e leve a versão mais forte para um modelo de qualidade superior na saída final.
Como usar a PicassoIA para escrever prompts de vídeo com IA
A PicassoIA dá acesso a todos os modelos acima a partir de uma única interface, sem precisar de chaves de API ou contas separadas para cada um. Veja como colocar esta checklist em prática na plataforma:
Ambiente (onde, com detalhes arquitetônicos ou naturais)
Hora do dia e clima
Ângulo e distância da câmera
Movimento da câmera, ou "plano estático travado"
Ação ou movimento (arco único, verbos ativos)
Iluminação (fonte, direção, qualidade)
Modificadores de estilo (realismo fotográfico padrão, tipo de filme se necessário)
Exclusões (no final, ou no campo negativo, se disponível)
Passo 3: Comece com 5 segundos e depois estenda
Gere primeiro um clipe de 5 segundos. Revise o primeiro quadro e a consistência ao longo do clipe. Se o primeiro quadro estiver errado, corrija a descrição da cena. Se a consistência falhar no meio do clipe, acrescente mais especificidade ao sujeito e reduza o número de elementos em movimento simultâneos. Só estenda para um clipe mais longo quando a versão de 5 segundos se sustentar.
Passo 4: Use imagem para vídeo para máxima consistência
Se você tem um primeiro quadro específico em mente, gere-o primeiro com um modelo de texto para imagem e depois passe essa imagem para o Wan 2.7 I2V, o Wan 2.5 I2V ou o Hailuo 2.3 para a animação. Isso elimina a maioria dos problemas de consistência temporal, porque o modelo tem um ponto de partida real, perfeito em nível de pixel, em vez de construir tudo a partir do texto.
Comece a gerar agora
A checklist não foi feita para ser memorizada. Ela foi feita para ser revisada rapidamente antes de você clicar em gerar, do mesmo jeito que um piloto faz a checagem pré-voo: não porque esqueceu como os sistemas funcionam, mas porque verificações sistemáticas pegam o elemento que, de outro modo, você deixaria de lado.
Copie esta estrutura para um arquivo de anotações e preencha antes de cada geração:
Subject: [who or what, described precisely]
Environment: [where, with specific detail]
Time and weather: [lighting context]
Camera angle: [low / eye / high / aerial + distance]
Camera movement: [named movement or "locked-off"]
Action: [single motion arc, active verbs]
Lighting: [source + direction + quality]
Style: [photorealistic, film stock, etc.]
Exclude: [what the model should avoid]
Cada campo preenchido significa menos gerações desperdiçadas e resultados mais rápidos. A diferença entre um prompt que produz um clipe chapado e trêmulo e um que produz algo que vale a pena guardar costuma depender de três ou quatro palavras específicas que você ainda não tinha acrescentado.
A PicassoIA reúne mais de 100 modelos de texto para vídeo num só lugar, sem nenhuma configuração trabalhosa. Escolha um modelo, passe por esta checklist e gere. Seu primeiro prompt estruturado está esperando em picassoia.com.