Referência para vídeo no Wan 2.7: como funciona de verdade
O Wan 2.7 é o modelo de geração de vídeo de código aberto mais capaz de 2027, com três modos distintos: texto para vídeo, imagem para vídeo e referência para vídeo. Este artigo explica como cada modo funciona por dentro, o que faz a consistência temporal se sustentar entre os quadros e como usar as três versões no PicassoIA para produzir vídeo cinematográfico em 1080p a partir de qualquer ponto de partida.
O Wan 2.7 não é apenas mais uma atualização incremental de um modelo existente. Ele representa uma mudança arquitetural real na forma como a geração de vídeo de código aberto lida, ao mesmo tempo, com movimento, fidelidade do sujeito e coerência temporal. Não importa se você começa com um prompt de texto, uma imagem estática ou um sujeito de referência: os resultados estão em outro patamar em relação ao que as linhas 2.1 e 2.5 produziam. Este artigo destrincha como cada um dos três modos do Wan 2.7 realmente funciona, para que você saiba exatamente o que enviar ao modelo e por quê.
O que é o Wan 2.7 de fato
O Wan 2.7 é um modelo de geração de vídeo baseado em difusão, desenvolvido pela Wan Video. Ele pertence à mesma família de modelos do Wan 2.1, 2.2, 2.5 e 2.6, mas introduz uma abordagem substancialmente revisada para a atenção entre quadros e a modelagem de movimento. O resultado é uma consistência de sujeito muito melhor, um movimento de câmera mais natural e uma resolução mais nítida em 1080p do que qualquer versão anterior.
O que o diferencia é que as três versões compartilham uma mesma base, mas se especializam na camada de condicionamento. Essa única decisão arquitetural é o motivo pelo qual T2V, I2V e R2V parecem coesos, e não três ferramentas desconexas.
Três modos, uma arquitetura
A família Wan 2.7 traz três versões distintas:
Wan 2.7 T2V: Gera vídeo apenas a partir de um prompt de texto, com saída em 1080p.
Wan 2.7 I2V: Recebe uma imagem estática como primeiro quadro e a anima para frente no tempo.
Wan 2.7 R2V: Aceita uma imagem de referência de um sujeito específico e anima esse sujeito dentro de uma nova cena descrita por um prompt de texto.
Cada modo atende a um fluxo de trabalho criativo diferente. O T2V serve para criar conceitos do zero. O I2V dá vida a fotos já existentes. O R2V resolve o problema mais difícil, que é manter um determinado personagem ou objeto consistente enquanto ele é colocado em um contexto totalmente novo.
O que mudou em relação às versões anteriores
A linha Wan 2.5 (T2V, I2V) já produzia vídeo convincente em 720p. A geração 2.6 (T2V, I2V) avançou para qualidade HD. O Wan 2.7 acrescenta três coisas que nenhuma das versões anteriores tinha em conjunto: um caminho de condicionamento R2V dedicado, janelas de atenção temporal aprimoradas que reduzem a cintilação em sequências longas e um prior de movimento de maior fidelidade, treinado com material cinematográfico e não apenas com vídeos da web.
Como funciona o modo T2V
O texto para vídeo é o ponto de entrada mais intuitivo. Você escreve a descrição do que quer ver, e o modelo produz uma sequência de quadros que corresponde a ela. Mas o mecanismo por trás disso é mais interessante do que esse resumo sugere.
Do texto aos quadros em movimento
O Wan 2.7 T2V funciona como um modelo de difusão latente com uma base de remoção de ruído baseada em transformer. Quando você envia um prompt, ele passa primeiro por um codificador de texto baseado em um modelo de linguagem (LLM), que converte suas palavras em uma representação vetorial densa. Essa representação condiciona todo o processo de remoção de ruído.
O modelo não gera os quadros um por um. Ele gera todos os quadros simultaneamente em um espaço latente comprimido e, no final, decodifica esse cubo latente em pixels. Essa abordagem de sequência completa é o motivo pelo qual ele lida com movimento de forma muito mais natural do que os modelos de vídeo autorregressivos: ele consegue considerar informações do quadro 12 ao decidir como deve ser o quadro 3, em vez de ficar preso a uma sequência estrita da esquerda para a direita.
💡 Dica prática: O Wan 2.7 T2V responde bem a descrições de movimento de câmera. Frases como "travelling lento para frente", "panorâmica suave com câmera na mão para a direita" ou "plano geral estático" moldam bastante o resultado, e não apenas as descrições do sujeito.
De onde vem a consistência temporal
A consistência temporal é a coisa mais difícil de acertar na geração de vídeo, e é onde o Wan 2.7 se sai claramente melhor do que o Wan 2.2 T2V Fast e de versões anteriores como o Wan 2.1.
O modelo usa um mecanismo de atenção 3D que opera simultaneamente nas dimensões espaciais e na dimensão de tempo. Cada "patch" de vídeo presta atenção aos patches vizinhos no quadro e à mesma localização espacial em quadros adjacentes. Isso é computacionalmente caro, mas obriga o modelo a manter texturas, iluminação e identidade do sujeito consistentes ao longo de todo o clipe, em vez de otimizar cada quadro de forma independente.
O resultado prático: os rostos não cintilam, o cabelo não muda de cor aleatoriamente entre os quadros e os elementos do fundo permanecem fixos. Modelos anteriores precisavam de prompts negativos específicos para combater esses artefatos. Com o Wan 2.7, eles são raros, e não o padrão.
Como funciona o modo I2V
A geração de imagem para vídeo faz uma pergunta diferente da do T2V: dado este ponto de partida visual exato, qual é uma continuação plausível? O Wan 2.7 I2V foi construído especificamente para isso, e a arquitetura de condicionamento difere de forma relevante em relação ao T2V.
Sua imagem como primeiro quadro
Quando você fornece uma imagem de origem, o Wan 2.7 I2V a codifica por meio de um codificador visual separado, e não do codificador de texto, para extrair representações profundas de características. Em seguida, concatena essas características com o latente com ruído em cada passo de remoção de ruído. Isso não é apenas "comece o vídeo desta imagem" em um sentido ingênuo. O modelo consulta continuamente o mapa de características da sua imagem durante toda a geração, e é por isso que, mesmo em cenas com movimento complexo, a aparência original do sujeito se mantém em grande parte intacta.
O prompt de texto que você adiciona sobre a imagem funciona como um controlador de movimento e direção. Ele diz o que deve acontecer na cena, enquanto a imagem diz como a cena deve parecer.
Como o movimento é sintetizado
O modelo foi treinado com dados pareados: clipes de vídeo reais em que quadros específicos foram usados como entradas de condicionamento. Esse regime de treinamento ensina a ele a física natural do movimento. A água deve ondular para fora, o cabelo deve soprar em uma direção coerente, as expressões faciais devem fazer transições suaves. O prior de movimento embutido no modelo atua como um regularizador que mantém o movimento gerado natural, mesmo quando seu prompt é abstrato.
💡 Dica prática: Para o I2V, descrições curtas de movimento funcionam melhor do que as longas. "Cabelo soprando suavemente para a esquerda, sorriso leve, câmera estática" supera um prompt com várias cláusulas descrevendo ações concorrentes ao mesmo tempo. Instruções de movimento mais simples dão ao prior de movimento aprendido pelo modelo mais espaço para atuar.
O modo R2V é a verdadeira novidade
Se o T2V é conveniente e o I2V é poderoso, o Wan 2.7 R2V é o modo que resolve um problema que os outros não conseguiam resolver. A referência para vídeo pega a foto de uma pessoa, animal ou objeto específico e anima esse sujeito dentro de uma nova cena que você descreve por meio de um prompt de texto. A identidade visual do sujeito é preservada, mesmo com fundo, iluminação e movimento sendo totalmente gerados.
Por que preservar o sujeito importa
Antes dos modelos com capacidade R2V, manter um personagem consistente em vídeo gerado por IA exigia fluxos de trabalho muito elaborados, como ControlNet, ajuste fino com LoRA e empilhamento de IP-Adapter, ou aceitar que o personagem mudasse de aparência. Nenhuma das opções era viável para uso em produção.
O R2V muda isso ao adicionar um caminho de condicionamento dedicado ao sujeito. A imagem de referência é processada por um codificador de identidade que extrai características de aparência específicas, separadas do condicionamento em nível de cena que vem do texto. O modelo aprende a respeitar as características de identidade em todos os quadros, tratando-as como restrições rígidas e não como sugestões.
Como o condicionamento por referência funciona
Sua imagem de referência é codificada duas vezes. Uma vez pelo codificador visual principal, para capturar características em nível de cena, e outra vez por um codificador de identidade treinado especificamente para capturar atributos de aparência de pessoas ou objetos. Os dois conjuntos de características condicionam o removedor de ruído em escalas diferentes, com as características de identidade injetadas nas camadas de nível mais alto, onde a informação semântica é representada.
O prompt de texto controla então apenas o contexto da cena e o movimento, porque a pergunta "como o sujeito é" já foi respondida pela imagem de referência. Essa separação de responsabilidades é o que torna as saídas do R2V mais controladas do que aplicar o condicionamento IP-Adapter sobre um modelo T2V padrão.
Como usar o Wan 2.7 no PicassoIA
As três versões do Wan 2.7 estão disponíveis no PicassoIA. Veja como usar cada uma delas com eficiência.
Começando com o T2V
Abra o Wan 2.7 T2V no PicassoIA. O campo de prompt aceita texto livre, mas prompts estruturados produzem resultados consistentemente melhores. Use esta ordem:
Sujeito: Quem ou o que está na cena, com detalhes de aparência.
Ação: O que está acontecendo e como se move.
Ambiente: Onde a cena se passa, incluindo a hora do dia.
Câmera: O que a câmera está fazendo (estática, em panorâmica, acompanhando etc.).
Estilo: Fotorrealista, cinematográfico, iluminação natural etc.
O modelo gera em 1080p por padrão, o que está entre as resoluções nativas mais altas de qualquer modelo de vídeo de código aberto. O tempo de geração é maior do que o da versão Wan 2.2 T2V Fast, mas a diferença de qualidade é grande o bastante para justificá-lo em tudo que vá além de prototipagem rápida.
Animando fotos com o I2V
Envie sua imagem de origem para o Wan 2.7 I2V. A imagem deve ser limpa, bem iluminada e conter o sujeito que você quer animar. Imagens borradas ou com pouco contraste reduzem a qualidade do resultado de forma perceptível, porque o modelo tem menos informação visual para se ancorar.
Escreva um prompt focado em movimento. Concentre-se em descrever o movimento e o ambiente, em vez de repetir a aparência do sujeito (o modelo já tem isso a partir da imagem). "Ondas quebrando suavemente na praia, luz de fim de tarde, plano geral estático" é melhor do que uma descrição composta e longa, que tenta especificar tudo de uma vez.
R2V: animando sujeitos específicos
O Wan 2.7 R2V exige duas entradas: uma imagem de referência do seu sujeito e um prompt de texto descrevendo a nova cena. Para a imagem de referência, fotos em estilo retrato, com um sujeito claro sobre um fundo relativamente simples, funcionam melhor. O codificador de identidade tem melhor desempenho quando o sujeito não está muito ocluído nem cercado por elementos visualmente semelhantes.
Para o prompt de texto, descreva a nova cena como se o sujeito de referência já estivesse nela. "Caminhando por uma trilha ensolarada na floresta, no outono, folhas caindo, brisa suave, travelling lento acompanhando." O modelo cuida de colocar seu sujeito de referência nesse contexto automaticamente.
Escrever prompts que realmente funcionam
A qualidade dos resultados do Wan 2.7 é afetada de forma desproporcional pela qualidade do prompt. Um prompt mal escrito desperdiça uma geração. Um bem estruturado produz consistentemente um vídeo utilizável já na primeira tentativa.
A estrutura que traz resultados
Use este modelo para prompts de T2V e I2V:
[Subject + appearance] [action] in [environment], [time of day / lighting], [camera motion], photorealistic, [quality modifiers]
Prompt fraco:
"Uma mulher caminhando por uma cidade à noite"
Prompt forte:
"Uma mulher na casa dos 20 e poucos anos, usando um casaco escuro de lã, caminha por uma rua de paralelepípedos molhada pela chuva, com luzes quentes de vitrines refletidas no asfalto úmido, travelling suave para frente em nível de rua, fotorrealista, 8K"
A versão estruturada dá ao modelo a identidade do sujeito, os detalhes do movimento, o ambiente, a iluminação, o comportamento da câmera e a orientação de qualidade. Cada uma dessas dimensões molda um aspecto diferente do resultado.
4 erros que desperdiçam gerações
Ações simultâneas demais. O Wan 2.7 lida bem com uma ação principal por clipe. Várias ações concorrentes produzem movimento inconsistente.
Não especificar a direção da câmera. Se você não define o movimento de câmera, o modelo faz uma escolha que pode não corresponder à sua intenção. Sempre nomeie-o.
Sujeitos excessivamente abstratos. "Uma sensação de solidão" não gera bem. "Uma pessoa sentada sozinha num banco de parque, pombos ciscando por perto, luz nublada" gera.
Ignorar a proporção. O modelo usa 16:9 por padrão. Se a imagem de origem para o I2V estiver na vertical, os resultados melhoram quando você recorta ou adiciona margens para 16:9 antes do envio.
Wan 2.7 ou a concorrência
O Wan 2.7 não existe no vácuo. Veja como ele se posiciona em relação a outros modelos líderes de texto para vídeo disponíveis no PicassoIA:
A principal vantagem do Wan 2.7 é o modo R2V, que nenhum dos concorrentes listados oferece nativamente. Para qualidade pura de T2V, o Veo 3.1 e o Seedance 2.5 competem de perto, e o Seedance vence em duração de clipe, com saídas de 30 segundos. Para a máxima resolução, o LTX 2.3 Pro em 4K é o teto atual. Para a combinação de fidelidade do sujeito, qualidade de movimento e acesso de código aberto em 1080p, o Wan 2.7 é o que há de melhor nesse conjunto específico de ferramentas.
💡 Quando usar cada modo: Se você está partindo do zero, use o T2V. Se tem uma foto que quer animar, use o I2V. Se precisa que um personagem consistente apareça em cenas diferentes, o R2V é o único modo criado especificamente para isso.
Comece a criar seu primeiro vídeo
O Wan 2.7 está disponível agora nos três modos no PicassoIA, e gerar seu primeiro clipe é mais simples do que a profundidade técnica do modelo pode sugerir. Comece com o Wan 2.7 T2V se tiver um conceito criativo e quiser produzi-lo a partir de uma descrição em texto. Passe para o Wan 2.7 I2V quando tiver uma imagem estática que quer trazer à vida. Use o Wan 2.7 R2V quando precisar que uma pessoa ou sujeito específico apareça de forma consistente em vídeos gerados, sem treinamento adicional.
A coleção de texto para vídeo do PicassoIA também oferece acesso a mais de 87 modelos, com diferentes contrapartidas entre velocidade, resolução e estilo. O Picassoia Video oferece geração gratuita e ilimitada se você quiser fazer protótipos rapidamente antes de reservar uma geração de maior qualidade para o Wan 2.7. O Ray 3.2 vale a pena testar se a cor cinematográfica HDR for prioridade para seu resultado.
O que separa um bom vídeo com IA de um ótimo, hoje, não é só a escolha do modelo. É a precisão do prompt e a intenção clara. Escolha seu modo, escreva um prompt que especifique sujeito, ação, ambiente, câmera e estilo, e deixe o Wan 2.7 fazer aquilo para que foi criado. Resultados em 1080p de um modelo de código aberto nessa faixa de qualidade não eram possíveis dezoito meses atrás. Hoje, estão disponíveis para qualquer pessoa no PicassoIA.