O que torna o Extend Mode do LTX 2.3 Pro diferente de qualquer outra ferramenta de vídeo com IA

O Extend Mode do LTX 2.3 Pro é a primeira ferramenta de vídeo com IA a condicionar a geração em vários quadros anteriores no nível da arquitetura, produzindo continuações de vídeo contínuas que mantêm iluminação, física de movimento e geometria da cena consistentes em cada extensão. Este artigo explica como ele funciona e o que o diferencia de todas as outras abordagens disponíveis atualmente.

O que torna o Extend Mode do LTX 2.3 Pro diferente de qualquer outra ferramenta de vídeo com IA
Cristian Da Conceicao
Fundador do Picasso IA

A maioria das ferramentas de vídeo com IA trata a extensão como algo secundário. Você gera um clipe, ele termina e, se precisar de mais material, precisa gerar tudo de novo, aceitar a deriva visual ou juntar dois clipes e torcer para que o corte não fique tão óbvio. O LTX 2.3 Pro resolve isso no nível da arquitetura, não no nível da pós-produção, e essa diferença muda tudo o que você consegue produzir com ele.

O Extend Mode é o principal recurso do LTX 2.3 Pro, o modelo de difusão de vídeo em espaço latente carro-chefe da Lightricks, disponível no PicassoIA. Ele permite enviar ao modelo os últimos quadros de um clipe existente e pedir que ele produza a sequência lógica seguinte, com iluminação, física de movimento e geometria da cena mantidas consistentes na junção. Sem corte brusco. Sem diferença de correção de cor. Sem artefatos temporais surgindo na fronteira. É uma abordagem categoricamente diferente de continuação de vídeo em relação a qualquer outra disponível hoje.

Linha do tempo de edição de vídeo mostrando segmentos de imagens estendidas com várias trilhas e sobreposições de cor

O que o Extend Mode realmente faz

A forma mais simples de explicar: o Extend Mode não começa do ruído. Ele começa do seu clipe.

Os modelos padrão de geração de vídeo amostram a partir de um vetor de ruído latente aleatório e o decodificam em direção a um prompt-alvo. Cada nova geração é estatisticamente independente da anterior. Isso funciona bem quando você quer um clipe autônomo, mas é catastrófico quando precisa de continuidade. O modelo não tem memória estrutural de como era a sua cena original, como caíam as sombras, qual trajetória a câmera seguia ou em que direção os objetos se moviam.

O Extend Mode do LTX 2.3 Pro condiciona o processo de geração à representação latente codificada dos quadros finais do seu clipe existente. Esses quadros são codificados no espaço latente do modelo e passam a fazer parte das restrições iniciais do processo de difusão para a extensão. A remoção de ruído não opera mais no vácuo. Ela opera em relação direta com o que realmente aconteceu antes.

💡 Na prática: se o seu clipe original mostra uma mulher caminhando por um parque com luz da tarde filtrada vindo da parte superior esquerda, a extensão vai continuar com essa mesma mulher, esse mesmo parque e essa mesma direção de luz. A física da cena persiste porque o modelo foi condicionado a ela, e não forçado a adivinhá-la.

Essa não é uma distinção pequena. É o que faz toda a diferença.

Cineasta filmando em falésias costeiras na hora dourada com ondas do oceano ao fundo

Como a coerência temporal funciona aqui

A expressão "coerência temporal" é usada de forma vaga nas discussões sobre vídeo com IA. Vale detalhar o que ela significa no contexto do LTX 2.3 Pro, porque o mecanismo é o que faz a saída parecer diferente de todas as alternativas de I2V.

Coerência temporal é a consistência da informação visual ao longo dos quadros de uma sequência de vídeo. No nível do pixel, isso significa que os objetos mantêm forma, cor e posição de acordo com o que a física do movimento preveria. No nível semântico, significa que a cena é lida como uma experiência contínua, e não como uma série de quadros vagamente relacionados.

O LTX 2.3 Pro alcança isso com mecanismos de atenção causal em seu backbone de transformer. Ao gerar a extensão, as cabeças de atenção podem olhar para trás, para as representações latentes dos quadros anteriores. Isso é arquiteturalmente diferente de simplesmente usar o último quadro como prompt de imagem. Um único prompt de imagem oferece ao modelo um instantâneo, uma referência sem velocidade nem direção. A atenção causal sobre múltiplos quadros anteriores oferece ao modelo, ao mesmo tempo, vetores de velocidade, direção do gradiente de iluminação ao longo do tempo, dados da trajetória da câmera e trajetórias de posição dos objetos.

O resultado é uma previsão de movimento que parece fundamentada na física, e não alucinada. Água que fluía para a esquerda continua fluindo para a esquerda. Uma pessoa no meio de um passo continua o passo sem voltar a uma pose neutra. Uma panorâmica continua no mesmo ritmo angular, com a mesma linha do horizonte. São esses detalhes que separam imagens que se sustentam em um contexto profissional de imagens que são "boas o bastante para um post rápido nas redes sociais".

Um quadro diz ao modelo onde as coisas estão. Vários quadros dizem a ele para onde as coisas estão indo, e em que ritmo.

Estúdio de produção de vídeo profissional com três monitores mostrando clipes de vídeo estendidos sincronizados

Por que outros modelos ficam aquém na extensão

A comparação é direta. Pegue um modelo como o Kling v3 Video ou o Veo 3. Ambos são excelentes geradores de texto para vídeo por mérito próprio. Nenhum foi projetado em torno da continuação de vídeo sem emendas como um recurso arquitetural de primeira classe.

Quando você usa o modo imagem para vídeo (I2V) nesses modelos para "estender" um clipe, está alimentando o último quadro como uma imagem estática. O modelo então gera movimento a partir desse quadro com base no seu prompt de texto. É aqui que a emenda aparece:

  • A direção do movimento é reiniciada: o modelo escolhe uma direção de movimento compatível com a imagem estática e o prompt, e não com o impulso do clipe anterior.
  • A iluminação é recalculada de forma independente: os ângulos das sombras e a exposição podem mudar sutilmente à medida que o modelo reavalia a cena a partir de um ponto de partida congelado.
  • Os detalhes de micromovimento se perdem: tremor da câmera, respiração de um personagem, frequência das ondulações da água. Esses detalhes sutis que fazem as imagens parecerem vivas são gerados de novo e quase nunca combinam com o original.

A emenda visual entre o ponto final do clipe original e o início da extensão I2V é visível na maioria dos modelos se você olhar com atenção. A 24 fps em uma tela grande, muitas vezes ela é visível mesmo sem olhar com atenção.

💡 É por isso que criadores profissionais de vídeo costumam descrever a extensão I2V como "boa para redes sociais", mas inadequada para qualquer coisa que será exibida em um contexto profissional, apresentada a um cliente ou incluída em um reel de produção. A emenda é o que entrega.

O Sora 2 Pro e o Wan 2.7 T2V também produzem imagens autônomas de qualidade, mas igualmente não têm condicionamento nativo em múltiplos quadros anteriores para fluxos de extensão. Eles são ferramentas de geração, não de continuação. A diferença importa cada vez mais à medida que criadores tentam construir narrativas de vídeo com IA mais longas e mais coerentes.

Close-up de mãos trabalhando em software de edição de vídeo com comparação de quadros visível na tela

Três coisas que diferenciam o LTX 2.3 Pro

1. Condicionamento em múltiplos quadros anteriores

A maioria das abordagens I2V condiciona em um único quadro. O LTX 2.3 Pro condiciona em múltiplos quadros anteriores, codificados em conjunto em uma representação latente unificada. Isso dá ao modelo dados temporais suficientes para inferir vetores de velocidade dos objetos, velocidade e direção do movimento da câmera e a progressão dos gradientes de iluminação ao longo do tempo na cena.

A diferença na qualidade da saída entre o condicionamento de um quadro e o de múltiplos quadros não é marginal. É estrutural. O condicionamento de um quadro produz clipes que parecem continuar uma cena. O condicionamento de múltiplos quadros produz clipes que são uma continuação da cena no nível da física.

2. Resolução de saída nativa em 4K

O LTX 2.3 Pro gera em resolução 4K nativamente. Isso importa para a extensão especificamente, porque uma saída em alta resolução facilita muito o trabalho com a junção entre o material original e o estendido na pós-produção. Em 4K, você tem mais dados de pixel para trabalhar se precisar aplicar uma dissolução cruzada sobre a junção, e o nível de detalhe do quadro faz com que quaisquer inconsistências restantes na fronteira sejam menos perceptíveis para o espectador.

Compare com o LTX 2.3 Fast, que prioriza velocidade em vez de resolução e é uma boa opção quando você precisa de iterações rápidas, ou com o LTX Video original, que estabeleceu a arquitetura subjacente, mas opera em resoluções bem mais baixas. Para entrega final, o LTX 2.3 Pro é o modelo que você quer.

3. Direcionamento por prompt dentro da extensão

O Extend Mode não se limita a continuar a cena de forma mecânica. Você pode fornecer um prompt de texto que orienta o que acontece a seguir dentro das restrições estabelecidas pelos quadros anteriores. Isso significa que você pode pedir que um personagem se vire, que a câmera faça um travelling para a frente ou que a luz mude quando uma nuvem passa por cima, e o modelo tentará essas mudanças mantendo a consistência com a linguagem visual já estabelecida no material anterior.

Isso é continuação de cena com controle de direção, o que é uma ferramenta fundamentalmente diferente da extrapolação mecânica pura.

Clareira na floresta no início da manhã com raios de luz volumétrica entre os pinheiros e névoa matinal

LTX 2.3 Pro ou outros modelos de vídeo

Aqui está uma comparação direta de recursos para casos de uso de extensão de vídeo:

ModeloMétodo de extensãoResoluçãoCoerência temporalDirecionamento por prompt
LTX 2.3 ProCondicionamento em múltiplos quadros anteriores4KAltaSim
LTX 2 ProMúltiplos quadros anteriores1080pAltaSim
Kling v3 VideoI2V de quadro único1080pModeradaSim
Veo 3I2V de quadro único1080pModeradaSim
Wan 2.7 T2VRegeneração por texto1080pBaixa para extensãoSim
Hailuo 2.3I2V de quadro único1080pModeradaLimitado
Ray 3.2I2V de quadro únicoHDRModeradaSim
Seedance 2.5Texto e imagemClipes de 30 segundosBaixa para extensãoSim

A tabela deixa o posicionamento claro: o LTX 2.3 Pro é o único modelo deste grupo que combina condicionamento em múltiplos quadros anteriores com saída em resolução 4K. Seu antecessor, o LTX 2 Pro, compartilha a mesma arquitetura de condicionamento, mas opera em 1080p, o que torna o LTX 2.3 Pro o teto atual para trabalhos de extensão com alta fidelidade.

Dois monitores profissionais lado a lado mostrando o vídeo original e sua continuação estendida sem emendas

Como usar o LTX 2.3 Pro no PicassoIA

O LTX 2.3 Pro está disponível diretamente no PicassoIA. Veja como o fluxo de trabalho do Extend Mode funciona na prática:

Passo 1: gere ou envie seu clipe base. Comece com qualquer clipe de vídeo que você queira continuar. Pode ser um clipe que você gerou antes com o LTX 2.3 Pro, com o LTX 2.3 Fast ou qualquer material externo que atenda aos requisitos de entrada do modelo.

Passo 2: selecione o Extend Mode. Na interface do modelo, escolha a opção de extensão em vez da geração padrão. Isso ativa o condicionamento em múltiplos quadros em vez da amostragem de ruído novo.

Passo 3: defina a duração da extensão. Especifique quantos segundos de material novo você quer gerar. Extensões mais curtas, na faixa de 3 a 5 segundos, costumam ter a maior coerência. Extensões mais longas podem funcionar bem, mas podem mostrar mais deriva do prompt perto do fim do clipe.

Passo 4: escreva seu prompt de continuação. Seja específico sobre movimento e mudanças de cena. Em vez de "mulher continua caminhando", tente "mulher desacelera até parar e se vira para olhar para a câmera, luz do sol ainda vindo da esquerda, mesmo fundo de parque, um vento leve movendo o cabelo dela". A especificidade dá ao modelo uma intenção de direção clara a seguir dentro da cena já estabelecida.

Passo 5: revise e itere. Assista à extensão na velocidade normal de reprodução e depois avance quadro a quadro no ponto de junção. Se a junção não estiver perfeita, gere de novo com um prompt levemente ajustado ou use os últimos dois quadros da extensão como novo clipe base para uma nova chamada de extensão.

💡 Para conteúdo de longa duração, o método mais confiável é encadear: gere 5 segundos, estenda por mais 5 e estenda de novo. Cada extensão condiciona em quadros anteriores novos, mantendo a coerência alta mesmo quando a duração total do clipe chega a 30, 60 segundos ou mais.

Diretora criativa apontando para um quadro de vídeo gerado por IA em um tablet enquanto revisa com a cliente

Resultados reais: o que esperar do Extend Mode

A avaliação honesta, com base no que a arquitetura promete e no que ela entrega na prática:

Onde ele se sai bem:

  • Planos com câmera estática e sujeitos em movimento (pessoas caminhando, água correndo, folhagem ao vento)
  • Movimentos de câmera lentos e deliberados, em que a trajetória já está claramente estabelecida no clipe anterior
  • Cenas internas com iluminação artificial controlada que não muda rapidamente entre os quadros
  • Cenas com profundidade espacial clara, em que os objetos seguem paralaxe natural conforme a câmera se move

Onde exige mais trabalho de prompt:

  • Sequências de ação com cortes rápidos, em que a direção do movimento muda de repente entre o original e a extensão pretendida
  • Cenas com fontes de luz diretas e fortes que projetam sombras dinâmicas que mudam quadro a quadro
  • Cenas complexas com vários personagens, em que cada um tem vetores de movimento independentes que o modelo precisa rastrear ao mesmo tempo

💡 Quanto mais informação os quadros anteriores codificam sobre a física da cena, melhor a extensão se sai. Material estável e bem iluminado se estende de forma mais limpa do que material tremido e de alto contraste. Isso não é uma limitação do modelo. É uma propriedade física do que o condicionamento em múltiplos quadros consegue inferir a partir dos dados que recebe.

As cenas que produzem as extensões mais satisfatórias na primeira tentativa são também as que ficam melhores na produção com atores reais: boa luz, movimento de câmera deliberado e um sujeito claro com uma relação espacial clara com o ambiente.

A arquitetura por trás dos resultados

Vale dedicar um momento ao que a Lightricks construiu para fazer isso funcionar, porque a arquitetura é o que separa o LTX 2.3 Pro de modelos que aproximam a extensão por meio de soluções improvisadas.

O núcleo do LTX Video é um transformer de difusão em espaço latente, e não a arquitetura baseada em U-Net que dominou a primeira geração de modelos de difusão de vídeo. Arquiteturas transformer têm uma vantagem natural para modelagem temporal: o mecanismo de autoatenção pode ser configurado para operar simultaneamente nas dimensões espacial e temporal, uma propriedade chamada atenção espaçotemporal.

Em transformers de texto para vídeo padrão, a atenção temporal fica restrita a uma única janela de geração. No Extend Mode do LTX 2.3 Pro, a janela de atenção temporal é estendida para trás, até os quadros anteriores codificados. O modelo literalmente presta atenção ao próprio passado durante o processo de difusão, não como uma etapa de pós-processamento, mas como parte integrante da própria remoção de ruído.

É por isso que os resultados diferem tanto das abordagens I2V. O I2V entrega ao modelo uma fotografia e diz "faça isso se mover". O Extend Mode do LTX 2.3 Pro entrega ao modelo uma memória e diz "continue a partir daqui". A primeira produz movimento. A segunda produz continuação.

A resolução de saída em 4K amplia essa vantagem. Em resoluções mais altas, o modelo tem mais detalhe espacial para condicionar em cada quadro anterior, o que significa que a atenção temporal consegue rastrear detalhes mais finos: reflexos específicos em superfícies, fios de cabelo individuais se movendo entre os quadros, pequenos elementos do ambiente como folhas se deslocando ou dobras de tecido respondendo ao movimento do corpo.

Data center moderno com racks de servidores e um técnico inspecionando a infraestrutura de computação

Encadeando extensões para vídeo de longa duração

Uma das aplicações mais práticas do Extend Mode é o encadeamento de extensões. Como cada chamada ao Extend Mode condiciona nos quadros mais recentes da geração anterior, você pode encadear várias extensões para produzir clipes muito além do que qualquer janela de geração única permitiria, mantendo a consistência visual da cena do início ao fim.

O fluxo de trabalho:

  1. Gere um clipe base de 5 a 10 segundos com o LTX 2.3 Pro
  2. Estenda por 5 segundos, condicionando nos últimos 2 a 3 quadros do clipe base
  3. Estenda o resultado por mais 5 segundos
  4. Continue até chegar à duração total desejada

Cada etapa mantém a linguagem visual já estabelecida da cena. A deriva visual cumulativa ao longo de 5 a 6 extensões encadeadas é mínima, em comparação com gerar tudo de novo a cada etapa ou juntar clipes I2V nas emendas. Criadores que trabalham com demonstrações de produtos, percursos arquitetônicos, documentários sobre natureza e curtas-metragens relataram sequências limpas de 30 a 60 segundos montadas dessa forma, com emendas que não aparecem na velocidade normal de reprodução.

💡 Se você está criando uma demonstração de produto, um tour por um imóvel ou uma cena atmosférica para um curta-metragem, encadear extensões com o LTX 2.3 Pro é o caminho mais rápido para material de longa duração polido que, de outra forma, exigiria uma equipe de filmagem física.

A técnica também combina bem com o conjunto mais amplo de ferramentas de vídeo do PicassoIA. Você pode gerar o clipe base com o LTX 2.3 Pro, aplicar efeitos visuais da biblioteca de Efeitos (mais de 500 opções) e usar ferramentas de restauração de vídeo com IA para estabilizar ou aumentar a resolução da sequência final montada. A cadeia pode ser tão simples ou tão elaborada quanto o seu projeto exigir.

Jovem mulher revisando resultados de geração de vídeo com IA em um notebook em uma sala bem iluminada

Comece a criar com o LTX 2.3 Pro no PicassoIA

O LTX 2.3 Pro está disponível no PicassoIA junto com seu irmão mais rápido, o LTX 2.3 Fast, para quando você precisar de rascunhos rápidos e iterações. A biblioteca completa de modelos em picassoia.com/en/all-models inclui mais de 87 modelos de geração de vídeo, abrangendo texto para vídeo, imagem para vídeo, efeitos de vídeo e ferramentas de restauração, então há um pipeline completo disponível independentemente de onde o seu projeto começa.

Se você nunca trabalhou com extensão de vídeo antes, comece com uma cena simples: uma pessoa caminhando por uma rua na hora dourada, um rio correndo por uma paisagem rochosa, uma vela acesa sobre uma mesa em um quarto escuro. Esses tipos de cena dão ao Extend Mode dados temporais suficientes para trabalhar e produzem os resultados mais satisfatórios na primeira tentativa. A iluminação é consistente, o movimento tem uma direção clara e o ambiente espacial é fácil de rastrear para o modelo ao longo dos quadros.

A partir daí, à medida que você pegar o jeito de como o condicionamento por quadros anteriores responde a diferentes tipos de material, pode avançar para cenários mais complexos: cenas com vários personagens, movimentos de câmera rápidos e sequências narrativas que se desenrolam por 30 segundos ou mais por meio de extensões encadeadas.

A abordagem da Lightricks para a coerência temporal não é apenas um acréscimo de recurso a um pipeline existente. Ela representa uma filosofia diferente sobre o que a geração de vídeo com IA deve fazer: não apenas produzir clipes isolados, mas produzir material com o qual você realmente consegue construir uma produção.

Experimente o LTX 2.3 Pro no PicassoIA agora e veja a diferença que o condicionamento temporal no nível da arquitetura faz no seu primeiro clipe.

Compartilhe este artigo

Escolha seu idioma