Por dentro do modo Image-Pro do Wan 2.7: o que mudou

O Wan 2.7 chegou com um modo Image-Pro dedicado, que muda de forma significativa a maneira como o modelo processa frames de referência, lida com a colorimetria e mantém a fidelidade visual em todas as sequências de vídeo geradas. Este texto detalha cada mudança técnica, compara o modelo com o Wan 2.6 e mostra como obter os melhores resultados no PicassoIA agora mesmo.

Por dentro do modo Image-Pro do Wan 2.7: o que mudou
Cristian Da Conceicao
Fundador do Picasso IA

A série Wan, da Wan-video, foi uma das linhas de modelos de vídeo com IA mais acompanhadas em 2027. Cada lançamento trouxe algo realmente útil, e o Wan 2.7 não é diferente. Mas esta versão introduziu algo que não recebeu atenção suficiente no lançamento: o modo Image-Pro. Não é um simples botão. Ele muda a forma como o modelo constrói a informação visual em um nível fundamental, e a diferença no resultado aparece desde o primeiro quadro.

Isto não é sobre jargão. É sobre o que de fato mudou no pipeline, o que você vê quando compara os resultados lado a lado e como trabalhar com as três versões do Wan 2.7 no PicassoIA: Wan 2.7 T2V, Wan 2.7 I2V e Wan 2.7 R2V.

O que é o modo Image-Pro, na prática

Antes de falar das mudanças, vale entender qual problema o modo Image-Pro resolve. As versões anteriores do Wan tratavam a imagem de referência principalmente como uma semente de movimento: um ponto de partida que o processo de difusão interpolava para a frente no tempo. A qualidade de imagem daquele frame inicial era aceitável, mas não era a prioridade.

O modo Image-Pro muda essa prioridade. Agora o modelo trata o primeiro frame como um artefato com foco em imagem, aplicando uma passagem dedicada de qualidade de imagem antes que o pipeline de difusão de vídeo comece. Isso significa que o frame inicial é renderizado com um padrão diferente do usado no Wan 2.6 ou no Wan 2.5.

A abordagem antiga e a nova

No Wan 2.5 I2V e no Wan 2.6 I2V, a imagem de referência enviada era usada como sinal de condicionamento. O modelo amostrava em torno dela. Os níveis de detalhe eram consistentes com o que você enviou, sem melhora significativa.

Com o modo Image-Pro no Wan 2.7 I2V, a imagem recebida passa por um pré-processamento de melhoria: nitidez de detalhes, normalização de cor e upscaling (aumento de resolução) com reconhecimento de bordas. O vídeo gerado não apenas começa no nível de qualidade da sua imagem. Muitas vezes, ele a supera.

Comparação de qualidade lado a lado em dois monitores em um estúdio moderno

Por que a qualidade da imagem importa na IA de vídeo

A maioria dos criadores pensa em modelos de vídeo em termos de coerência de movimento, aderência ao prompt ou resolução. A qualidade da imagem no nível do frame costuma ser deixada de lado. Mas, se o primeiro frame estiver suave ou sem detalhes, todos os frames seguintes herdam essa base. Você não consegue compensar uma imagem de referência fraca com desfoque de movimento.

O modo Image-Pro resolve isso na origem. É o motivo pelo qual os resultados do Wan 2.7 parecem mais cinematográficos mesmo quando o prompt não mudou.

As mudanças técnicas no Wan 2.7

O modo Image-Pro não é um recurso único. É um conjunto de mudanças na forma como o Wan 2.7 processa informação visual em três etapas: antes da difusão, durante a difusão e no pós-processamento da saída.

Melhorias de resolução e detalhe

O Wan 2.7 oferece saída nativa em 1080p pelo Wan 2.7 T2V. Isso não é novidade para modelos de vídeo, mas o que mudou é o tratamento dos detalhes nessa resolução. Versões anteriores às vezes suavizavam texturas em 1080p por causa dos artefatos de compressão introduzidos na etapa de codificação no espaço latente.

O modo Image-Pro usa uma passagem de VAE (Variational Autoencoder) de maior fidelidade, que preserva com mais precisão as informações de textura. Trama de tecido, poros da pele, veio da madeira, reflexos em metal: esses elementos sobrevivem melhor ao ciclo de codificação e decodificação do que no Wan 2.6.

Fileira de servidores em data center mostrando a infraestrutura de computação de IA

💡 Nota prática: ao usar o Wan 2.7 I2V, enviar uma imagem de origem de melhor qualidade ainda importa. O modo Image-Pro melhora a sua entrada, mas amplifica o que já está lá. Uma fonte 4K nítida vai gerar um resultado visivelmente melhor do que uma versão 720p comprimida.

O sistema de frames de referência

O Wan 2.7 R2V trouxe uma capacidade de referência para vídeo que é distinta do I2V. O R2V não trata a entrada como um frame inicial, mas como uma referência de sujeito, permitindo que o modelo anime o sujeito em uma nova cena ou contexto de movimento.

O modo Image-Pro afeta o R2V de forma diferente do I2V. No R2V, a passagem de qualidade se concentra no isolamento do sujeito e na extração de características, e não no processamento do quadro inteiro. O modelo identifica as principais características visuais do sujeito (detalhes do cabelo, textura da roupa, geometria facial) e as preserva especificamente enquanto constrói o contexto de vídeo ao redor delas.

Isso torna o Wan 2.7 R2V bem mais útil para fluxos de trabalho de animação de personagens, em que a consistência do sujeito importa mais do que a fidelidade do fundo.

Vista aérea de uma mesa de trabalho de designer com folhas de referência de IA impressas e ferramentas criativas

Diferenças reais que você vai notar

A descrição técnica ajuda, mas o que você realmente vê no resultado?

Gradação de cor e mapeamento de tons

Os resultados do Wan 2.6 tendiam a uma leve dessaturação de cor em áreas de detalhe de alta frequência. Realces da pele, tecidos claros e superfícies reflexivas às vezes ficavam lavados. Não era dramático, mas era consistente o bastante para exigir correção de cor na pós-produção.

O Wan 2.7 com modo Image-Pro apresenta um tratamento de curva tonal visivelmente melhor. Os realces mantêm mais informação de cor, as sombras exibem uma gradação mais profunda sem virar preto puro, e a imagem geral tem uma resposta de curva mais cinematográfica, parecida com filme. Ele se parece mais com o que você obteria filmando em RAW com uma câmera digital de cinema do que com o que as versões anteriores do Wan produziam.

Retrato macro em close-up mostrando detalhes extraordinários da pele e iluminação cinematográfica

Fidelidade de rosto e textura

É aqui que o modo Image-Pro causa o maior impacto visível. Nas versões anteriores do Wan, o detalhe facial em sequências de vídeo costumava suavizar ao longo de 5 a 10 segundos. A interpolação de movimento apagava detalhes finos como poros, fios de cabelo e detalhes dos olhos.

O Wan 2.7 aplica um mecanismo de atenção especificamente ajustado para características faciais humanas durante a passagem de difusão de vídeo. O efeito é que os rostos mantêm melhor o detalhe em sequências mais longas. Os olhos continuam nítidos. Fios de cabelo individuais mantêm a separação, em vez de se fundir em uma massa.

A fidelidade de textura fora dos rostos também melhorou. Superfícies de tijolo mostram as linhas individuais de argamassa de um frame para o outro. Tecido trançado mostra a estrutura dos fios, que não se borra durante o movimento. Veios da madeira mantêm direção e profundidade mesmo quando a câmera está em movimento.

💡 Para vídeos centrados em personagens: o Wan 2.7 R2V é a melhor escolha quando o sujeito humano é o foco principal. O pré-processamento de isolamento de sujeito do R2V, combinado com a preservação de textura do Image-Pro, oferece consistência de rosto e corpo visivelmente melhor do que o I2V na animação de personagens.

Como usar o Wan 2.7 no PicassoIA

O PicassoIA oferece acesso às três versões do Wan 2.7. Veja como usar cada uma delas com eficiência.

Passo a passo para o I2V

O fluxo de imagem para vídeo no Wan 2.7 I2V funciona melhor quando a imagem de referência já transmite a iluminação e a composição que você quer:

  1. Abra o Wan 2.7 I2V no PicassoIA
  2. Envie uma imagem de referência de alta qualidade (recomendado 1080p ou superior)
  3. Escreva um prompt de movimento descrevendo o movimento: o que se move, como e em que velocidade
  4. Defina a resolução como 1080p para ativar o pipeline completo do Image-Pro
  5. Envie e aguarde a geração (normalmente de 60 a 90 segundos)

O prompt de movimento importa tanto quanto a imagem. Descreva o movimento de forma específica: "deriva suave da câmera para a direita, folhas balançando devagar em primeiro plano, pessoa parada" funciona melhor do que "faça esta imagem se mover".

Videógrafo com câmera de cinema em um telhado na hora dourada, iluminado por trás pelo pôr do sol quente

Passo a passo para o T2V

O Wan 2.7 T2V gera vídeo inteiramente a partir de texto. O modo Image-Pro aqui se aplica ao primeiro frame gerado, antes que o modelo continue a sequência:

  1. Abra o Wan 2.7 T2V no PicassoIA
  2. Escreva uma descrição detalhada da cena, incluindo sujeito, ambiente, iluminação e comportamento da câmera
  3. Defina a resolução como 1080p
  4. Inclua instruções explícitas de movimento de câmera no seu prompt
  5. Gere e avalie a qualidade do primeiro frame antes de investir em sequências mais longas

No T2V, o benefício do Image-Pro é mais visível em planos de close-up. Planos abertos de apresentação mostram menos melhora, porque o detalhe por pixel importa menos nessa distância. Planos médios e de close-up são onde você vai notar a renderização mais limpa.

Dicas para um resultado melhor

DicaAplica-se aPor quê
Use resolução 1080pT2V, I2VAtiva o pipeline completo do Image-Pro
Envie imagens de origem em 1080p ou maisI2VUma entrada de maior qualidade significa uma base de saída melhor
Descreva a iluminação no seu promptT2VO modelo usa pistas de iluminação para calibrar o mapeamento de tons
Especifique explicitamente o movimento de câmeraTodas as versõesReduz artefatos de interpolação
Use o R2V para animação de personagensR2VO pré-processamento de isolamento do sujeito oferece melhor consistência facial

💡 A iluminação no prompt é subestimada: o mapeamento de tons do Wan 2.7 responde a descrições de iluminação. Escrever "luz quente da manhã vinda da esquerda, sombras profundas à direita" dá ao modelo uma informação de calibração que afeta como todo o pipeline de cor se comporta.

Comparação de qualidade em tela dividida, do borrado de baixa qualidade a uma imagem fotorrealista e cristalina

Wan 2.7 ou Wan 2.6: lado a lado

A diferença entre o Wan 2.6 e o Wan 2.7 não é revolucionária em todas as métricas. Algumas coisas melhoraram muito, outras continuaram parecidas.

Comparação de velocidade

O Wan 2.6 e o 2.7 têm tempos de geração comparáveis em 480p. Em 1080p, o Wan 2.7 é um pouco mais lento por causa da etapa de pré-processamento do Image-Pro. O processamento adicional acrescenta cerca de 10 a 15 segundos por geração, um custo pequeno diante da melhoria na qualidade.

Se a velocidade for mais importante que a qualidade, o Wan 2.5 T2V Fast continua sendo uma das opções mais rápidas da família Wan no PicassoIA.

Benchmarks de qualidade

MétricaWan 2.6Wan 2.7
Resolução nativa720p / 1080p1080p
Retenção de detalhe facialModeradaAlta
Fidelidade de texturaModeradaAlta
Precisão de corBoaMuito boa
Coerência de movimentoBoaBoa
Consistência do sujeito (R2V)N/AMuito boa

A pontuação de coerência de movimento permanecer igual não é uma crítica ao Wan 2.7. É o reconhecimento de que o Wan 2.6 já era forte em movimento. Os ganhos do 2.7 se concentram no domínio da qualidade de imagem, que é exatamente o que o modo Image-Pro foi criado para tratar.

Criador de conteúdo usando monitores duplos com a interface de uma plataforma de IA e saída de vídeo fotorrealista

Qual versão do Wan 2.7 usar

São três versões, e escolher a errada para o seu caso vai custar qualidade. Veja quando cada uma faz sentido.

T2V, I2V ou R2V

O Wan 2.7 T2V serve para quando você tem uma cena clara em mente, mas nenhuma imagem de referência. O modelo gera todo o visual a partir da sua descrição em texto. Ideal para: planos de apresentação, visuais abstratos, cenas de ambiente em que você não precisa de um visual específico.

O Wan 2.7 I2V serve para animar uma imagem específica que você já tem. O modelo usa sua imagem como frame zero e gera o movimento a partir dela. Ideal para: vídeos de produto, percursos arquitetônicos, animação de fotografias.

O Wan 2.7 R2V serve para animar um sujeito específico, a partir de uma foto de referência, em um novo contexto. Ideal para: animação de personagens, colocar uma pessoa em outra cena, animar um sujeito com movimento controlado enquanto o ambiente muda.

💡 A escolha certa importa mais do que o prompt: usar o I2V quando você precisa do comportamento do R2V (ou o contrário) vai gerar resultados piores, não importa quão bom seja o prompt. O pré-processamento é diferente, e também é diferente o que o modelo prioriza.

Outros modelos que valem a comparação

O Wan 2.7 não compete no vácuo. Veja como ele se posiciona em relação a outros modelos de vídeo de alta qualidade disponíveis no PicassoIA.

Alternativas ao Wan 2.7 no PicassoIA

O Kling v2.6, da Kwai VGI, é um forte concorrente para geração de vídeo cinematográfico. Ele lida muito bem com a dinâmica de movimento e entrega saídas de alta qualidade em 1080p. Onde o Wan 2.7 leva vantagem é no pré-processamento do Image-Pro ao trabalhar com I2V. O Kling v2.6 não tem uma passagem de qualidade de primeiro frame equivalente.

O LTX 2.3 Pro, da Lightricks, é feito para saída em 4K, o que o coloca imediatamente em outro patamar de resolução. Se você precisa de vídeo em 4K, o LTX 2.3 Pro é a escolha. Se 1080p é suficiente, o Wan 2.7 oferece mais controle sobre a qualidade do primeiro frame por meio do Image-Pro.

O Ray 3.2, da Luma, oferece saída HDR excepcional e é particularmente forte em conteúdo de natureza e paisagem. O Wan 2.7 tende a produzir resultados mais consistentes para sujeitos humanos, enquanto o Ray 3.2 costuma se sair melhor na geração de vídeo de ambientes e atmosfera.

O Seedance 2.5, da ByteDance, é capaz de gerar vídeos de 30 segundos, bem mais longos que a janela padrão do Wan 2.7. Para conteúdo de formato longo, o Seedance 2.5 tem uma vantagem estrutural. Para clipes mais curtos e de maior qualidade, em que o primeiro frame importa, o Wan 2.7 leva vantagem.

O Veo 3.1, do Google, está entre os modelos de texto para vídeo mais capazes disponíveis. Sua geração de áudio nativa e a qualidade em 1080p são fortes. Para texto para vídeo puro, o Veo 3.1 é um concorrente de verdade do Wan 2.7. O diferencial do Wan 2.7 está nas capacidades de I2V e R2V com o modo Image-Pro: o Veo 3.1 não tem um pipeline equivalente de imagem para vídeo com processamento de qualidade no primeiro frame.

Equipe de produção de cinema trabalhando em um set de estúdio com iluminação e equipamentos profissionais

Veja a diferença por conta própria

A melhor forma de ver o que o modo Image-Pro faz de fato é rodar o mesmo prompt no Wan 2.6 I2V e no Wan 2.7 I2V com as mesmas entradas. Use um retrato de rosto como imagem de referência. A diferença na retenção de detalhes da pele, na nitidez dos olhos e na precisão de cor ao longo da sequência de vídeo vai aparecer de imediato.

O PicassoIA oferece acesso às três versões do Wan 2.7 sem a necessidade de montar infraestrutura local. Para fluxos de trabalho que dependem da qualidade do primeiro frame, as versões I2V e R2V com o modo Image-Pro representam um avanço significativo em relação ao que era possível com o Wan 2.6.

Para a gama completa de opções de geração de vídeo, a página de todos os modelos em picassoia.com/en/all-models mostra todos os modelos em todas as categorias, incluindo a família Wan, que continua crescendo, e as opções concorrentes da Kling, Ray, LTX, Veo e Seedance.

O pipeline de qualidade de imagem na geração de vídeo com IA vem alcançando o pipeline de qualidade de movimento há algum tempo. Com o Wan 2.7 e o modo Image-Pro, ele deixou de ser o elo fraco. Teste seu próximo projeto com ele e veja o quanto a base mudou.

Mãos segurando uma fotografia impressa com detalhe fotográfico excepcional sob a luz quente de uma janela

Compartilhe este artigo

Escolha seu idioma