Algo mudou na comunidade de vídeo com IA quando a equipe de pesquisa Wan, da Alibaba, lançou a versão 2.7 de sua suíte de geração de vídeo. Não por causa de um único número de destaque, mas porque o lançamento representa uma tríade: texto para vídeo, imagem para vídeo e um modo totalmente novo de referência para vídeo, reunidos em um pacote de pesos abertos que rivaliza com modelos disponíveis apenas por meio de APIs pagas. O alvoroço em torno do Wan 2.7 é merecido.
O que é o Wan 2.7, na verdade
Três modelos, não um
O "2.7" não é um único modelo. São três capacidades distintas lançadas juntas sob o mesmo número de versão:
- Wan 2.7 T2V: gera vídeo em 1080p diretamente a partir de um prompt de texto, sem necessidade de imagem de origem.
- Wan 2.7 I2V: pega uma imagem estática e a anima em um clipe de vídeo coerente.
- Wan 2.7 R2V: anima um sujeito específico isolado de uma foto de referência, dando aos criadores controle preciso sobre o que se move e como.
Cada modo atende a um fluxo de trabalho diferente. O T2V serve para criação pura a partir de prompts. O I2V serve para animar visuais já existentes. O R2V é o verdadeiro diferencial, e é a peça que mais tem chamado a atenção de cineastas e equipes de produto.
A base em 1080p faz diferença
Antes do Wan 2.7, obter saída em 1080p de um modelo de vídeo de pesos abertos exigia pós-processamento considerável ou pipelines de upscaling sobre a geração bruta. O Wan 2.7 T2V gera em 1080p nativamente. Isso importa porque a resolução nativa preserva a consistência temporal entre os quadros de uma forma que o upscaling pós-geração não consegue replicar. Desfoque de movimento, nitidez de bordas e detalhes finos de textura se degradam quando os quadros são redimensionados depois da síntese. Quando o modelo gera em resolução total desde o quadro zero, esses detalhes permanecem coerentes ao longo de todo o clipe.

O que mudou da 2.6 para a 2.7
A qualidade do movimento deu um passo real à frente
O Wan 2.6 T2V e o Wan 2.6 I2V já eram bons, especialmente para movimentos suaves de câmera e revelações de cenas estáticas. O Wan 2.7 fecha a lacuna no movimento de sujeitos, que era o ponto mais fraco da 2.6. Personagens e objetos nos clipes do Wan 2.7 mantêm suas proporções de forma mais consistente entre os quadros, e elementos que se movem rápido apresentam bem menos cintilação temporal do que na versão anterior.
O Wan 2.5 T2V exigia engenharia de prompt cuidadosa para evitar o característico "derretimento" de bordas que aparecia durante movimentos complexos de sujeitos. A versão 2.7 resolve isso com bem menos intervenção manual do usuário.
O R2V é uma categoria diferente
A maioria dos modelos de vídeo com IA oferece dois caminhos: descrever algo em texto ou partir de uma imagem. O Wan 2.7 R2V acrescenta um terceiro caminho: extrair um sujeito específico de uma foto de referência e animar esse sujeito em uma nova cena. Você fornece a imagem de uma pessoa ou de um produto, o modelo isola esse sujeito e gera movimento mantendo a aparência visual dele do início ao fim do clipe.
Preservar identidade, textura e proporções nos quadros sintetizados exige que o modelo mantenha uma representação interna detalhada do sujeito de referência. O Wan 2.7 faz isso de forma confiável para sujeitos estáticos e para sujeitos com movimentos simples.
💡 O R2V é especialmente útil para equipes de produto. Uma única foto de produto vira um clipe de vitrine giratória, sem estúdio físico nem equipamento de mesa giratória.

Velocidade e eficiência em 1080p
Resolução mais alta nem sempre significa geração proporcionalmente mais lenta. A arquitetura do Wan 2.7 incorpora melhorias no backbone de transformer de difusão que reduzem o custo computacional por passo em 1080p, em comparação com executar um passo de upscaling ingênuo sobre uma geração base em 720p. Isso mantém os tempos de geração práticos para fluxos de trabalho iterativos, nos quais os criadores fazem dezenas de variações antes de escolher o clipe final.
Como o Wan 2.7 se compara à concorrência
O mercado de vídeo com IA nunca teve tantas opções. Aqui está uma avaliação honesta de onde o Wan 2.7 se sai bem e onde ainda tem terreno a cobrir.
Wan 2.7 ou Veo 3
O Veo 3 e o Veo 3.1, do Google, geram áudio nativo sincronizado junto com o vídeo, o que o Wan 2.7 não faz. A qualidade cinematográfica do Veo 3 é realmente excepcional, especialmente em cenas externas com iluminação natural complexa. Mas o Veo 3 é uma API fechada com custos por geração que crescem rapidamente em volume. O Wan 2.7 tem pesos abertos, pode ser usado localmente ou por meio de plataformas como o PicassoIA, com custo por clipe significativamente menor. Para criadores que rodam centenas de iterações por projeto, essa diferença de custo costuma ser decisiva.
Wan 2.7 ou Sora 2
O Sora 2 se destaca em vídeos de duração estendida e em narrativas complexas com várias cenas. O ponto forte do Wan 2.7 são clipes curtos e precisos, com controle específico de sujeito. Se você precisa de um vídeo de 30 segundos com várias transições de cena e fala sincronizada, o Sora 2 é a ferramenta mais forte. Se precisa de um clipe de 5 a 10 segundos de um produto ou personagem específico, com movimento controlável, o Wan 2.7 é mais prático e bem mais acessível.
Wan 2.7 ou Kling v2.6
O Kling v2.6, da Kwai, é possivelmente o concorrente comercial mais forte na mesma faixa de qualidade de movimento. A consistência de personagem do Kling está um pouco à frente do Wan 2.7 para sujeitos humanos com expressões faciais complexas. Onde o Wan 2.7 ganha terreno é na flexibilidade de código aberto e no modo R2V, que o Kling não oferece em forma equivalente. O Kling v3, com seus recursos de controle de movimento, é excepcional, mas continua sendo um produto somente pago.

O Wan 2.7 na linha do tempo de IA da Alibaba
Do I2VGen ao Wan
A Alibaba está no espaço de geração de vídeo há mais tempo do que a maioria das pessoas imagina. O I2VGen-XL, lançado pela equipe de pesquisa ali-vilab, foi uma das primeiras tentativas sérias de código aberto em geração de imagem para vídeo com coerência estrutural. A série Wan deu continuidade ao que o I2VGen começou, adotando uma arquitetura de transformer de difusão que escala a resolução sem uma explosão proporcional de computação.
O Wan 2.1 1.3B introduziu a estrutura básica. O Wan 2.2 I2V Fast trouxe variantes otimizadas para velocidade, e o modo acionado por som Wan 2.2 S2V foi adicionado. O Wan 2.5 T2V melhorou bastante a consistência temporal. O Wan 2.6 T2V elevou o teto de resolução. A versão 2.7 agora torna o R2V uma capacidade de primeira classe, pronta para produção, junto com as melhorias de qualidade em todos os aspectos.

Happyhorse ou Wan: objetivos diferentes
A Alibaba também mantém a linha Happyhorse 1.1, que gera vídeo de até 1080p a partir de entradas de texto ou imagem. Enquanto o Happyhorse prioriza suavidade de movimento cinematográfico e consistência estilística em clipes mais longos, o Wan prioriza fidelidade do sujeito e controle preciso. Eles não competem dentro do ecossistema da Alibaba. O Happyhorse é a ferramenta de saída de nível de estúdio para resultados cinematográficos suaves. O Wan é a ferramenta de controle preciso para animação de sujeitos específicos. O Happyhorse 1.0 continua disponível para geração mais rápida em resoluções mais baixas.
Como usar o Wan 2.7 no PicassoIA
O PicassoIA hospeda diretamente os três modelos do Wan 2.7. Sem GPU local, sem gerenciamento de chave de API, sem configuração. Veja como cada modo funciona na prática.
Wan 2.7 T2V: texto para 1080p
- Abra o Wan 2.7 T2V no PicassoIA.
- Escreva um prompt detalhado descrevendo a cena, o sujeito, a iluminação e o movimento de câmera.
- Defina a duração desejada do clipe. De cinco a dez segundos entregam a melhor coerência temporal.
- Envie e receba a saída em 1080p.
💡 Inclua a direção de câmera no seu prompt. "Travelling lento de plano médio para primeiro plano" produz um movimento bem melhor do que um prompt que descreve apenas o conteúdo estático da cena.
Wan 2.7 I2V: anime qualquer foto
- Abra o Wan 2.7 I2V no PicassoIA.
- Envie sua imagem de origem.
- Descreva o movimento: o que se move, em que direção e em que velocidade.
- O modelo gera um clipe que começa a partir da sua imagem e cria um movimento coerente a partir dali.
Melhores entradas para o I2V: fotos de alto contraste, com um sujeito nítido contra um fundo bem definido. Imagens com bordas ambíguas exigem prompts de movimento mais detalhados para evitar artefatos temporais perto dos limites do sujeito.

Wan 2.7 R2V: animação de sujeito específico
- Abra o Wan 2.7 R2V no PicassoIA.
- Envie uma imagem de referência do sujeito que você quer animar.
- Descreva em detalhes o movimento desejado e o contexto da cena.
- O modelo isola o sujeito, preserva sua aparência e sintetiza o movimento ao redor dele.
O que funciona bem no R2V: produtos, personagens únicos, veículos e animais com silhuetas bem definidas. O que exige prompts cuidadosos: grupos de sujeitos sobrepostos ou fundos muito texturizados que competem visualmente com o sujeito principal pela atenção do modelo.
Usos reais que realmente funcionam
Clipes para redes sociais a partir de fotos
O uso mais imediato do Wan 2.7 I2V é converter o acervo fotográfico existente de uma marca em conteúdo de vídeo curto. Uma foto de comida vira uma revelação lenta e cinematográfica. Uma foto de moda ganha uma animação sutil de movimento do tecido. Uma foto de viagem ganha uma deriva suave de paralaxe que parece vídeo nativo em qualquer feed social. A barreira para produzir conteúdo de vídeo curto cai bastante quando as imagens estáticas já estão em mãos.

Prototipagem de filmes e comerciais
Diretores usam o Wan 2.7 T2V para pré-visualização. Um movimento de câmera complexo que levaria meio dia para ser montado na locação pode ser testado como um clipe de 5 segundos em menos de um minuto. Se o enquadramento funciona, a filmagem física fica mais eficiente. Se não funciona, nada foi desperdiçado, a não ser um minuto de tempo de processamento. O modelo Wan 2.2 S2V também lida com animação acionada por som, para pré-visualizações aproximadas com sincronização de áudio.

Visualização de produtos sem estúdio
O Wan 2.7 R2V já é usado ativamente por equipes de e-commerce para gerar vistas giratórias de produtos a partir de uma única fotografia de estúdio. Um relógio, um tênis, um frasco de skincare: envie a referência, descreva a rotação, e o modelo produz um clipe de movimento que, de outra forma, exigiria uma mesa giratória dedicada e um videomaker. A economia de custo e tempo em escala não é marginal.

Por que o ângulo de código aberto é central
O argumento de custo e controle
APIs de vídeo de código fechado cobram por segundo de conteúdo gerado. Em qualquer volume de produção relevante, esse custo cresce rapidamente. Um modelo de pesos abertos como o Wan 2.7 pode rodar em uma instância de nuvem com GPU por um custo mensal fixo, ou por meio de plataformas como o PicassoIA, que distribuem a despesa de infraestrutura entre muitos usuários. Para estúdios que geram centenas de clipes por semana, a conta é simples: o acesso a pesos abertos costuma ser uma ordem de grandeza mais barato por clipe do que as alternativas de API fechada.
Além do custo, pesos abertos significam que a comunidade mais ampla pode fazer fine-tuning, estender e adaptar o modelo para casos de uso específicos. Modelos fechados só melhoram quando seus desenvolvedores decidem investir em um ciclo de atualização. Modelos abertos melhoram continuamente, porque grupos de pesquisa, desenvolvedores independentes e equipes comerciais contribuem todos de volta para a base compartilhada.

Fine-tuning para consistência de marca
Como os pesos do Wan 2.7 são públicos, o fine-tuning em estilos visuais específicos é viável para qualquer equipe com recursos modestos de GPU. Uma produtora poderia treinar um adaptador LoRA com o estilo da casa e obter clipes visualmente consistentes em todos os ativos gerados por IA de seu pipeline. Esse nível de controle de marca não é possível com nenhum modelo de vídeo de código fechado disponível hoje, independentemente do orçamento.
💡 Pesos abertos também permitem inferência on-premises. Estúdios com exigências rígidas de confidencialidade de propriedade intelectual podem rodar o Wan 2.7 localmente, sem que nenhum conteúdo saia de sua rede. Isso é um requisito indispensável nas categorias de conteúdo jurídico, médico e financeiro, em que o uso de APIs na nuvem é restrito.
A série Wan em resumo
Para contextualizar a evolução da série, aqui estão as principais versões do Wan disponíveis no PicassoIA:
Experimente o Wan 2.7 agora mesmo
A conversa em torno do Wan 2.7 acontece porque a geração de vídeo em 1080p com pesos abertos e um modo dedicado de referência para vídeo é uma capacidade real e prática hoje. Não é uma prévia de pesquisa. Não é uma lista de espera. Os modelos estão no ar, os resultados são reproduzíveis, e você pode começar a gerar clipes sem sair do navegador.
O PicassoIA dá acesso direto aos três modos:
- Wan 2.7 T2V: digite um prompt e receba um clipe em 1080p.
- Wan 2.7 I2V: envie uma foto, descreva o movimento e veja ela ganhar vida.
- Wan 2.7 R2V: use uma imagem de referência para animar um sujeito específico, com aparência e identidade preservadas.
Se você quer ir além da geração de vídeo, o PicassoIA também hospeda um conjunto completo de modelos de texto para imagem, upscaling de super-resolução, aprimoramento de vídeo com IA, sincronização labial e ferramentas de geração de áudio. Tudo está acessível em uma única plataforma em picassoia.com/en/all-models. A única pergunta é qual projeto você quer dar vida primeiro.