Wan 2.7: o mais recente modelo de vídeo de IA da Alibaba que você precisa conhecer

O Wan 2.7 é o mais recente modelo de vídeo de IA de pesos abertos da Alibaba, lançado com geração de texto para vídeo, imagem para vídeo e referência para vídeo em uma só versão. Este artigo mostra o que o torna diferente, como ele se compara com os concorrentes comerciais e como usar os três modos em fluxos de trabalho criativos reais.

Wan 2.7: o mais recente modelo de vídeo de IA da Alibaba que você precisa conhecer
Cristian Da Conceicao
Fundador do Picasso IA

O Wan 2.7 não chegou com campanha de divulgação. Foi lançado como um modelo da equipe de pesquisa da Alibaba, reunindo três capacidades distintas em uma única versão, e em poucas horas começaram a surgir os benchmarks de pesquisadores que já tinham baixado os pesos e começado a rodar testes. Essa recepção mostra algo importante sobre a série Wan: ela conquistou atenção séria na comunidade de código aberto de geração de vídeo com IA.

A série Wan é a principal família de modelos de geração de vídeo da Alibaba, desenvolvida na divisão de pesquisa em IA da empresa. Enquanto muitas empresas de tecnologia chinesas se concentraram em ferramentas de vídeo fechadas, acessíveis apenas por API, a Alibaba adotou outra abordagem com o Wan: liberou os pesos do modelo de forma aberta e deixou a comunidade de pesquisa construir sobre eles. O Wan 2.7 mantém essa tradição e dá um salto relevante em resolução, qualidade de movimento e versatilidade.

Editor de vídeo profissional trabalhando em uma estrutura de produção cinematográfica

O que mudou na versão 2.7

A geração anterior, o Wan 2.6 T2V, já era capaz de fazer texto para vídeo em 720p e animar imagens. O Wan 2.7 eleva o patamar em três áreas específicas:

  • Saída nativa em 1080p nos três modos de geração
  • Coerência temporal melhorada, o que significa menos tremulação e deriva em clipes mais longos
  • Referência para vídeo como recurso de primeira linha, e não como algo secundário

💡 A coerência temporal é o que separa o vídeo de IA de nível profissional dos clipes cintilantes e inconsistentes que faziam as primeiras ferramentas de texto para vídeo parecerem truques de festa. O Wan 2.7 leva isso a sério.

As melhorias na arquitetura se concentram no backbone de difusão de vídeo, que agora lida com sequências de tokens mais longas de forma mais eficiente. O resultado prático são transições de movimento mais suaves, melhor consistência de sujeitos entre os quadros e detalhes mais finos em texturas complexas, como cabelo, tecido e superfícies de água.

A linhagem do Wan

Vale entender onde a versão 2.7 se encaixa na progressão. A série avançou rapidamente:

VersãoResoluçãoCaracterística principal
Wan 2.1480p / 720pBase sólida de código aberto
Wan 2.2720pVariantes rápidas, suporte a sincronização de áudio
Wan 2.5720p-1080pMovimento melhor, melhorias em I2V
Wan 2.61080pQualidade refinada, variante flash
Wan 2.71080pT2V + I2V + R2V, lançamento completo

Cada iteração foi construída sobre a anterior, em vez de substituí-la. A variante Wan 2.2 I2V Fast ainda tem um caso de uso forte quando você prioriza velocidade em vez da qualidade máxima. O Wan 2.7 é o nível premium.

Data center de grande porte alimentando a infraestrutura de geração de vídeo com IA

Três modos em um só lançamento

A maioria dos modelos de geração de vídeo é especializada. Eles fazem texto para vídeo ou animam imagens, mas raramente fazem as duas coisas bem. O Wan 2.7 traz três modos distintos que cobrem os fluxos de trabalho mais comuns de geração de vídeo sem que você precise trocar de ferramenta.

Texto para vídeo (T2V)

O Wan 2.7 T2V recebe um prompt de texto e devolve um clipe de vídeo completo em 1080p. O modelo cuida do movimento da câmera, do movimento dos sujeitos e da composição da cena apenas a partir do prompt. Os resultados são bem mais nítidos do que os das versões anteriores do Wan, com melhor tratamento de elementos complexos do prompt, como cenas com multidões, efeitos climáticos e ambientes arquitetônicos.

Para prompts que envolvem movimento físico, como água fluindo, fogo ou tecido ao vento, a versão 2.7 mostra a melhoria mais clara em relação às antecessoras. O movimento com características físicas tem um peso mais crível.

Imagem para vídeo (I2V)

O Wan 2.7 I2V anima uma imagem fixa que você fornece. Este é o modo mais usado em fluxos de trabalho reais, porque dá controle preciso sobre o quadro inicial. Você não fica adivinhando como é a cena. Você a traz pronta.

A versão 2.7 lida com casos extremos que derrubavam modelos anteriores: rostos com iluminação incomum, cenas com vários sujeitos sobrepostos e tomadas arquitetônicas com padrões geométricos repetitivos. Todos esses casos são tradicionalmente difíceis na animação de imagens, porque o modelo precisa inferir profundidade e movimento sem ver o quadro anterior ou o seguinte.

💡 Para melhores resultados com I2V, use imagens de origem em alta resolução com sujeitos focais bem definidos. O Wan 2.7 lê a profundidade implícita da imagem e a usa para gerar um movimento de paralaxe realista.

Referência para vídeo (R2V)

O Wan 2.7 R2V é o modo que mais gera discussão. Você fornece uma imagem de referência de um personagem ou objeto, e o modelo gera um vídeo com esse sujeito em uma nova cena ou contexto de movimento. Não se trata de animar uma imagem. É extração do sujeito combinada com geração de cena.

Isso tem aplicações óbvias em publicidade, narrativas centradas em personagens e em qualquer situação em que você precise de uma identidade visual consistente em vários clipes de vídeo.

Diretor criativo revisando a reprodução de vídeo em um monitor de produção

Por que a saída em 1080p importa

O salto para a saída nativa em 1080p soa como um item de ficha técnica. Na prática, muda o que você pode de fato usar em vídeo gerado por IA.

Resolução ou qualidade

Há uma distinção que vale fazer: resolução e qualidade percebida não são a mesma coisa. Os primeiros modelos de vídeo com IA em 1080p faziam upscaling internamente e entregavam resultados nítidos, mas visualmente inconsistentes. O Wan 2.7 renderiza nativamente em 1080p, o que significa que os detalhes finos estão de fato ali, e não interpolados. Fios de cabelo, texto de fundo, padrões de trama de tecido: tudo isso se sustenta em escala total.

Em 720p, o vídeo de IA funciona bem para miniaturas de sites, prévias para redes sociais e pré-visualização rápida. Em 1080p, com o patamar de qualidade do Wan 2.7, a saída se torna viável para b-roll de emissoras, conteúdo para o YouTube, vídeos de apresentação e trabalhos comerciais de formato curto.

Consistência de movimento entre quadros

A outra coisa que o 1080p obriga o modelo a acertar é a consistência de movimento. Em resoluções mais baixas, pequenas inconsistências entre os quadros são menos visíveis. Em 1080p, um cabelo que muda de comprimento entre quadros, ou uma mão que tremula fora de proporção, fica imediatamente evidente.

As pontuações de consistência de movimento do Wan 2.7 em benchmarks padrão estão entre as mais altas de qualquer modelo de vídeo de pesos abertos lançado até hoje. Isso se observa na estabilidade quadro a quadro dos resultados, não apenas em um número de benchmark declarado.

Câmera de cinema profissional com lente que mostra precisão óptica

Como ele se compara aos concorrentes

O espaço de vídeo com IA ficou genuinamente competitivo. Comparar o Wan 2.7 com honestidade exige olhar para aquilo em que cada modelo é realmente bom.

Wan 2.7 comparado com modelos comerciais fechados

O Kling v3, da Kuaishou, e o Veo 3, do Google, são hoje as referências para geração de vídeo comercial fechada. Ambos produzem resultados excelentes. O Sora 2, da OpenAI, lida com vídeos narrativos longos melhor do que a maioria dos concorrentes neste momento.

Onde o Wan 2.7 se diferencia:

FatorWan 2.7Modelos comerciais
Pesos do modelo disponíveisSim (aberto)Não
Fine-tuning personalizado possívelSimNão
Referência consistente de sujeitoForte (R2V)Varia
Custo por geraçãoBaixo (hospedagem própria)Pagamento por uso
Saída nativa em 1080pSimSim (na maioria)
Geração de áudio nativaNãoAlguns (Veo 3, Sora 2)

O áudio é a lacuna mais clara do Wan 2.7 em relação aos modelos fechados. O Veo 3 e o Hailuo 02 geram áudio sincronizado de forma nativa. O Wan 2.7 não. Para fluxos de trabalho em que música ou som ambiente importam, você vai precisar de um pipeline de áudio separado ou de outro modelo.

Código aberto como vantagem real

A natureza de pesos abertos do Wan 2.7 merece ser levada a sério como recurso, e não apenas como uma questão de custo. Fazer fine-tuning com estilos visuais proprietários, integrar em pipelines personalizados, implantar em ambientes offline, executar adaptações LoRA para sujeitos específicos: nada disso é possível com modelos fechados. O Wan 2.7 é genuinamente extensível de maneiras que o Seedance 2.0 e seus contemporâneos fechados não são.

Espaço de trabalho de criador de conteúdo otimizado para produção de vídeo

Casos de uso que realmente funcionam

Criadores de conteúdo e vídeo para redes sociais

Conteúdo de vídeo em formato curto é o encaixe mais óbvio. O Wan 2.7 T2V gera clipes de 5 a 10 segundos a partir de prompts de texto, que é exatamente a duração necessária para capas de redes sociais, sequências de abertura e inserções de b-roll. A saída em 1080p significa nada de artefatos de upscaling ao publicar em plataformas que hoje já suportam 1080p60 nativamente.

Para criadores de conteúdo, o fluxo de trabalho mais útil de imediato é o I2V: pegue uma peça gráfica ou fotografia estática que você já tem, anime-a com o Wan 2.7 e tenha uma versão em movimento em poucos minutos.

Pré-visualização na produção de filmes

A pré-visualização, que é o esboço de planos antes da filmagem principal, tradicionalmente exigia um artista 3D habilidoso ou um estúdio terceirizado caro. O Wan 2.7 não substitui nenhum dos dois por completo. Mas, para comunicar rapidamente o ângulo de câmera, o movimento dos sujeitos e a marcação aproximada da cena a um diretor ou diretor de fotografia, a pré-visualização com vídeo de IA se tornou genuinamente útil no nível de qualidade da versão 2.7.

O modo R2V é especialmente relevante aqui: você pode pegar uma imagem de referência de um ator ou de uma locação e gerar ideias de cena mantendo intacta essa identidade visual específica.

Vídeo de produto e marketing

Demonstrações de produtos, fotos de estilo de vida de marcas e b-roll de marketing são áreas em que a relação entre qualidade e custo do Wan 2.7 se torna convincente. Uma foto de produto com movimento básico, uma cena de estilo de vida com um produto integrado, uma tomada de estabelecimento de local: tudo isso é possível a partir de prompts ou imagens de referência em 1080p, sem um orçamento completo de produção de vídeo.

Hardware de GPU de alto desempenho viabilizando a geração de vídeo com IA

Como usar o Wan 2.7 no PicassoIA

O PicassoIA hospeda as três versões do Wan 2.7, tornando-as acessíveis sem a necessidade de montar uma infraestrutura de GPU local. Veja como usar cada uma delas com eficiência.

Usando o Wan 2.7 T2V

  1. Acesse o Wan 2.7 T2V no PicassoIA
  2. Escreva um prompt de texto detalhado descrevendo sua cena, incluindo sujeito, ambiente, iluminação e direção do movimento
  3. Defina a duração (5 ou 10 segundos) de acordo com o seu caso de uso
  4. Selecione a saída em 1080p para a máxima qualidade
  5. Envie e aguarde cerca de 60 a 90 segundos pela geração

Dica de prompt: o Wan 2.7 T2V responde bem a termos de direção de câmera. Expressões como "panorâmica lenta para a esquerda", "recuo aéreo" ou "plano médio estático" influenciam de forma significativa o movimento da câmera na saída.

Usando o Wan 2.7 I2V

  1. Acesse o Wan 2.7 I2V no PicassoIA
  2. Envie sua imagem de origem (de preferência em 1080p ou em resolução maior)
  3. Adicione um prompt de orientação de movimento descrevendo o que deve se mover e como
  4. Mantenha o prompt de movimento curto e específico, por exemplo: "a câmera avança lentamente, as folhas balançam suavemente"
  5. Gere e revise o clipe em resolução total antes de baixar

Dica de parâmetro: se a sua imagem tiver uma linha de horizonte forte, o modelo a interpreta naturalmente como uma oportunidade de travelling ou aproximação. Evite sobrecarregar o prompt de movimento com direções conflitantes.

Usando o Wan 2.7 R2V

  1. Acesse o Wan 2.7 R2V no PicassoIA
  2. Envie a imagem de referência do sujeito (funciona melhor com fundo limpo ou sujeito bem isolado)
  3. Escreva um prompt de cena descrevendo onde e como você quer que o sujeito apareça
  4. Seja específico no movimento: "o sujeito caminha para a frente numa rua de paralelepípedos, luz da tarde vindo da esquerda"
  5. Verifique a consistência entre a referência e o personagem gerado ao longo de todo o clipe

💡 O R2V funciona melhor quando a sua imagem de referência tem uma definição de sujeito forte e clara. Uma fotografia de alto contraste com fundo simples dá ao modelo o sinal mais limpo para trabalhar.

Dois profissionais colaborando sobre uma interface de produção de vídeo

Os limites reais do Wan 2.7

Uma avaliação honesta importa mais do que o hype.

Com o que ele tem dificuldade

Clipes longos com continuidade narrativa continuam difíceis. O Wan 2.7 gera clipes na faixa de 5 a 10 segundos com eficiência. Um vídeo de 60 segundos com personagens consistentes se movendo por uma história coerente não é para o que este modelo foi construído. Isso continua sendo um problema ainda não resolvido na maioria dos modelos de vídeo abertos desta geração.

A renderização de texto dentro do vídeo é fraca. Qualquer fluxo de trabalho que exija texto legível na tela deve usar composição depois, e não depender do modelo para gerá-lo.

Movimento extremo, incluindo esportes rápidos, cortes rápidos de câmera e ação com alta taxa de quadros, produz mais artefatos do que o trabalho de câmera mais lento e cuidadoso, onde o Wan 2.7 realmente brilha. Trabalhe com os pontos fortes do modelo, e não contra eles.

Quando usar alternativas

Para geração rápida com menos exigências de qualidade, o Wan 2.2 T2V Fast ainda vale a pena. Ele é bem mais rápido ao custo de alguma qualidade. Para geração de áudio nativa, o Veo 3 ou o Hailuo 02 são as escolhas certas. Para animação guiada por áudio especificamente, o Wan 2.2 S2V lida bem com a geração de vídeo sincronizado ao som.

Monitor exibindo uma saída de vídeo cinematográfico vibrante gerada por IA

Comece a criar vídeo com IA agora

O Wan 2.7 é o modelo de vídeo de pesos abertos mais forte disponível agora, com uma combinação de resolução, versatilidade e consistência que não existia nesse patamar de preço antes. O lançamento em três modos cobre a grande maioria dos fluxos de trabalho criativos reais sem exigir uma ferramenta diferente para cada tarefa.

A forma mais rápida de ver o que ele faz é executá-lo. O PicassoIA dá acesso direto às três versões do Wan 2.7 sem nenhuma configuração local: sem GPU, sem pesos de modelo para baixar, sem arquivos de configuração. Você escreve um prompt ou envia uma imagem e recebe vídeo com IA em 1080p em menos de dois minutos.

Experimente o Wan 2.7 T2V para gerar vídeo a partir de um prompt de texto, o Wan 2.7 I2V para animar uma imagem fixa que você já tem, ou o Wan 2.7 R2V para colocar um sujeito específico em uma cena totalmente nova. O patamar de qualidade para geração de vídeo de código aberto subiu bastante com este lançamento. Nunca houve um momento melhor para começar a usá-lo.

Equipe de agência criativa trabalhando ao entardecer com o horizonte da cidade ao fundo

Compartilhe este artigo

Escolha seu idioma