Ce qui distingue le mode Extend de LTX 2.3 Pro de tous les autres outils vidéo d’IA

Le mode Extend de LTX 2.3 Pro est le premier outil vidéo d’IA à conditionner la génération sur plusieurs images précédentes au niveau de l’architecture. Il produit des prolongements de vidéo sans couture, qui gardent l’éclairage, la physique du mouvement et la géométrie de la scène cohérents d’une extension à l’autre. Cet article détaille son fonctionnement et ce qui le distingue de toutes les autres approches actuellement disponibles.

Ce qui distingue le mode Extend de LTX 2.3 Pro de tous les autres outils vidéo d’IA
Cristian Da Conceicao
Fondateur de Picasso IA

La plupart des outils vidéo d’IA traitent le prolongement après coup. Vous générez un clip, il se termine, et si vous avez besoin de plus de séquences, vous le regénérez depuis le début, vous acceptez la dérive visuelle, ou vous collez deux clips en espérant que la coupure ne se voie pas trop. LTX 2.3 Pro règle ce problème au niveau de l’architecture, et non au niveau du post-traitement, et cette différence change tout ce que vous pouvez réellement produire avec lui.

Le mode Extend est la fonctionnalité phare de LTX 2.3 Pro, le modèle de diffusion vidéo latente de Lightricks, disponible sur PicassoIA. Il vous permet de fournir au modèle les dernières images d’un clip existant et de lui demander de produire la séquence logique suivante, en gardant cohérents l’éclairage, la physique du mouvement et la géométrie de la scène au niveau de la jonction. Pas de coupure franche. Pas de décalage d’étalonnage des couleurs. Pas d’artefacts temporels qui apparaissent à la frontière. C’est une approche de la continuité vidéo fondamentalement différente de tout ce qui existe actuellement.

Chronologie de montage vidéo montrant des segments de séquences prolongées sur plusieurs pistes avec des superpositions de couleurs

Ce que fait réellement le mode Extend

La façon la plus simple de le présenter : le mode Extend ne part pas du bruit. Il part de votre clip.

Les modèles de génération vidéo standard échantillonnent à partir d’un vecteur de bruit latent aléatoire et le décodent vers un prompt cible. Chaque nouvelle génération est statistiquement indépendante de la précédente. C’est acceptable lorsque vous voulez un clip autonome, mais catastrophique lorsque vous avez besoin de continuité. Le modèle n’a aucune mémoire structurelle de l’apparence de votre scène d’origine, de la façon dont tombaient les ombres, de la trajectoire de la caméra ou de la direction dans laquelle les objets se déplaçaient.

Le mode Extend de LTX 2.3 Pro conditionne le processus de génération sur la représentation latente encodée des dernières images de votre clip existant. Ces images sont encodées dans l’espace latent du modèle et deviennent une partie des contraintes de départ du processus de diffusion pour l’extension. Le débruitage ne fonctionne plus dans le vide. Il fonctionne en lien direct avec ce qui s’est réellement passé avant.

💡 Concrètement : si votre clip d’origine montre une femme qui traverse un parc avec une lumière d’après-midi filtrée qui tombe depuis le haut à gauche, l’extension continuera avec cette même femme, ce même parc et cette même direction de lumière. La physique de la scène persiste parce que le modèle a été conditionné sur elle, et non parce qu’on lui demande de la deviner.

Cette distinction n’a rien de secondaire. C’est tout l’enjeu.

Cinéaste filmant sur des falaises côtières à l’heure dorée avec des vagues de l’océan en arrière-plan

Comment fonctionne ici la cohérence temporelle

L’expression « cohérence temporelle » est employée à tort et à travers dans les discussions sur la vidéo par IA. Ce qu’elle signifie réellement dans le cas de LTX 2.3 Pro mérite d’être détaillé avec précision, car c’est ce mécanisme qui donne au résultat un rendu différent de toutes les alternatives I2V.

La cohérence temporelle désigne la constance des informations visuelles d’une image à l’autre dans une séquence vidéo. Au niveau des pixels, cela signifie que les objets conservent leur forme, leur couleur et leur position conformes à ce que prédirait la physique du mouvement. Au niveau sémantique, cela signifie que la scène se lit comme une expérience continue plutôt que comme une suite d’images vaguement liées.

LTX 2.3 Pro y parvient grâce à des mécanismes d’attention causale dans son transformeur central. Lors de la génération de l’extension, les têtes d’attention peuvent remonter vers les représentations latentes des images précédentes. Cette approche est architecturalement différente d’une simple utilisation de la dernière image comme image de prompt. Une seule image de prompt donne au modèle un instantané, une référence sans vitesse ni direction. L’attention causale sur plusieurs images précédentes fournit au modèle, simultanément, des vecteurs de vitesse, la direction des gradients de lumière dans le temps, les données de trajectoire de la caméra et les trajectoires de position des objets.

Le résultat est une prédiction du mouvement qui paraît ancrée dans la physique plutôt qu’hallucinée. L’eau qui coulait vers la gauche continue de couler vers la gauche. Une personne en pleine foulée poursuit sa foulée sans revenir à une pose neutre. Un plan panoramique continue de pivoter à la même vitesse angulaire, avec la même ligne d’horizon. Ces détails font la différence entre des images qui tiennent dans un contexte professionnel et des images qui sont « assez bien pour une publication rapide sur les réseaux sociaux ».

Une seule image indique au modèle où se trouvent les choses. Plusieurs images lui indiquent où elles vont, et à quelle vitesse.

Studio de production vidéo professionnel avec trois écrans affichant des clips vidéo prolongés synchronisés

Pourquoi les autres modèles peinent à prolonger

La comparaison est directe. Prenons un modèle comme Kling v3 Video ou Veo 3. Tous deux sont d’excellents générateurs de texte vers vidéo. Aucun n’a été conçu autour de la continuité vidéo sans couture comme fonctionnalité architecturale de premier plan.

Lorsque vous utilisez le mode image vers vidéo (I2V) de ces modèles pour « prolonger » un clip, vous fournissez la dernière image comme une image fixe. Le modèle génère ensuite le mouvement à partir de cette image, en fonction de votre prompt textuel. C’est là que la couture apparaît :

  • La direction du mouvement est réinitialisée : le modèle choisit une direction de mouvement cohérente avec l’image fixe et le prompt, et non avec l’élan du clip précédent.
  • L’éclairage est recalculé indépendamment : les angles d’ombre et l’exposition peuvent légèrement changer lorsque le modèle réévalue la scène à partir d’un point de départ figé.
  • Les micro-mouvements sont perdus : les tremblements de caméra, la respiration d’un personnage, la fréquence des ondulations de l’eau, ces détails subtils qui donnent de la vie aux images sont régénérés à neuf et ne correspondent presque jamais à l’original.

La couture visuelle entre la fin du clip d’origine et le début de l’extension I2V est visible sur la plupart des modèles si vous regardez attentivement. À 24 images par seconde sur un grand écran, elle est souvent visible même sans regarder attentivement.

💡 C’est pourquoi les créateurs vidéo professionnels décrivent souvent le prolongement I2V comme « correct pour les réseaux sociaux », mais inadapté à tout ce qui sera projeté dans un cadre professionnel, présenté à un client ou inclus dans un reel de production. La couture trahit le procédé.

Sora 2 Pro et Wan 2.7 T2V produisent aussi des images autonomes de qualité, mais ils ne disposent pas non plus d’un conditionnement natif sur plusieurs images précédentes pour les flux de prolongement. Ce sont des outils de génération, pas des outils de continuité. Cette distinction compte de plus en plus à mesure que les créateurs cherchent à construire des récits vidéo plus longs et plus cohérents avec l’IA.

Gros plan de mains travaillant sur un logiciel de montage vidéo avec une comparaison d’images visible à l’écran

Trois éléments qui distinguent LTX 2.3 Pro

1. Conditionnement sur plusieurs images précédentes

La plupart des approches I2V conditionnent sur une seule image. LTX 2.3 Pro conditionne sur plusieurs images précédentes encodées ensemble dans une représentation latente unifiée. Cela donne au modèle suffisamment de données temporelles pour déduire les vecteurs de vitesse des objets, la vitesse et la direction des mouvements de caméra, ainsi que la progression des gradients de lumière à travers la scène au fil du temps.

L’écart de qualité entre un conditionnement sur une image et un conditionnement sur plusieurs images n’est pas marginal. Il est structurel. Un conditionnement sur une image produit des clips qui ont l’air de prolonger une scène. Un conditionnement sur plusieurs images produit des clips qui sont une continuation de la scène au niveau de la physique.

2. Résolution de sortie 4K native

LTX 2.3 Pro génère nativement en 4K. Cela compte particulièrement pour le prolongement, car une sortie en haute résolution facilite grandement le travail de raccord entre la séquence d’origine et l’extension en post-production. En 4K, vous disposez de davantage de données de pixels si vous devez appliquer un fondu enchaîné au niveau de la jonction, et le niveau de détail de l’image fait que les éventuelles incohérences restantes à la frontière sont moins perceptibles pour le spectateur.

Comparez avec LTX 2.3 Fast, qui privilégie la vitesse à la résolution et constitue une option solide lorsque vous avez besoin d’itérer rapidement, ou avec la version originale de LTX Video, qui a établi l’architecture sous-jacente mais fonctionne à des résolutions nettement plus basses. Pour la livraison finale, LTX 2.3 Pro est le modèle à privilégier.

3. Pilotage par prompt au sein de l’extension

Le mode Extend ne se contente pas de prolonger la scène mécaniquement. Vous pouvez fournir un prompt textuel qui guide ce qui se passe ensuite, dans les limites établies par les images précédentes. Vous pouvez ainsi demander à un personnage de se retourner, à la caméra d’avancer en travelling, ou à la lumière de changer lorsqu’un nuage passe au-dessus, et le modèle tentera ces changements tout en restant cohérent avec le langage visuel établi par les images précédentes.

Il s’agit d’une continuité de scène avec un contrôle de mise en scène, ce qui en fait un outil fondamentalement différent d’une extrapolation purement mécanique.

Clairière forestière au petit matin avec des rayons de lumière volumétriques traversant les pins et la brume matinale

LTX 2.3 Pro face aux autres modèles vidéo

Voici une comparaison directe des fonctionnalités pour les cas d’usage de prolongement vidéo :

ModèleMéthode d’extensionRésolutionCohérence temporellePilotage par prompt
LTX 2.3 ProConditionnement sur plusieurs images précédentes4KÉlevéeOui
LTX 2 ProPlusieurs images précédentes1080pÉlevéeOui
Kling v3 VideoI2V sur une seule image1080pMoyenneOui
Veo 3I2V sur une seule image1080pMoyenneOui
Wan 2.7 T2VRégénération à partir du texte1080pFaible pour le prolongementOui
Hailuo 2.3I2V sur une seule image1080pMoyenneLimité
Ray 3.2I2V sur une seule imageHDRMoyenneOui
Seedance 2.5Texte et imageClips de 30 secondesFaible pour le prolongementOui

Le tableau rend le positionnement clair : LTX 2.3 Pro est le seul modèle de ce groupe qui combine un conditionnement sur plusieurs images précédentes avec une sortie en résolution 4K. Son prédécesseur LTX 2 Pro partage la même architecture de conditionnement, mais fonctionne en 1080p, ce qui fait de LTX 2.3 Pro le plafond actuel pour un travail de prolongement haute fidélité.

Deux écrans professionnels côte à côte montrant la vidéo d’origine et sa suite prolongée sans couture

Comment utiliser LTX 2.3 Pro sur PicassoIA

LTX 2.3 Pro est disponible directement sur PicassoIA. Voici comment se déroule concrètement le flux de travail du mode Extend :

Étape 1 : Générez ou importez votre clip de base. Partez de n’importe quel clip vidéo que vous souhaitez prolonger. Il peut s’agir d’un clip que vous avez déjà généré avec LTX 2.3 Pro, LTX 2.3 Fast, ou de n’importe quelle séquence externe répondant aux exigences du modèle en matière d’entrée.

Étape 2 : Sélectionnez le mode Extend. Dans l’interface du modèle, choisissez l’option de prolongement plutôt que la génération standard. Cela active le conditionnement sur plusieurs images au lieu de l’échantillonnage à partir d’un bruit neuf.

Étape 3 : Définissez la durée du prolongement. Indiquez le nombre de secondes de nouvelles images à générer. Les prolongements courts, de 3 à 5 secondes, tendent à offrir la meilleure cohérence. Les prolongements plus longs peuvent donner de bons résultats, mais peuvent présenter davantage de dérive par rapport au prompt vers la fin du clip.

Étape 4 : Rédigez votre prompt de continuation. Soyez précis sur le mouvement et les changements de scène. Au lieu de « la femme continue de marcher », essayez « la femme ralentit, s’arrête et se retourne pour regarder la caméra, lumière du soleil toujours venant de la gauche, même fond de parc, léger vent qui fait bouger ses cheveux ». La précision donne au modèle une intention de mise en scène claire à suivre dans la scène établie.

Étape 5 : Vérifiez et itérez. Regardez le prolongement à vitesse de lecture normale, puis avancez image par image au point de jonction. Si la jonction n’est pas parfaitement fluide, régénérez avec un prompt légèrement modifié, ou utilisez les deux dernières images du prolongement comme nouveau clip de base pour un nouvel appel d’extension.

💡 Pour les contenus longs, la méthode la plus fiable consiste à enchaîner : générez 5 secondes, prolongez de 5, prolongez encore. Chaque extension se conditionne sur des images précédentes fraîches, ce qui maintient une cohérence élevée même lorsque la durée totale du clip atteint 30, 60 secondes, voire davantage.

Directeur de création désignant une image de vidéo générée par IA sur une tablette lors d’une revue avec un client

Résultats concrets : à quoi s’attendre avec le mode Extend

Voici une évaluation honnête, fondée sur ce que l’architecture promet et sur ce qu’elle apporte en pratique :

Là où il excelle :

  • Plans fixes avec des sujets en mouvement (personnes qui marchent, eau qui coule, feuillage agité par le vent)
  • Mouvements de caméra lents et délibérés, dont la trajectoire est clairement établie dans le clip précédent
  • Scènes d’intérieur avec un éclairage artificiel contrôlé qui ne change pas rapidement d’une image à l’autre
  • Scènes avec une profondeur spatiale claire, où les objets suivent une parallaxe naturelle lorsque la caméra se déplace

Là où il demande davantage de travail sur le prompt :

  • Séquences d’action au montage rapide, où la direction du mouvement change brusquement entre l’original et l’extension souhaitée
  • Scènes avec des sources de lumière directes et fortes, projetant des ombres dynamiques qui changent d’une image à l’autre
  • Scènes complexes à plusieurs personnages, où chaque personnage a des vecteurs de mouvement indépendants que le modèle doit suivre simultanément

💡 Plus les images précédentes encodent d’informations sur la physique de la scène, meilleure est l’extension. Les séquences stables et bien éclairées se prolongent plus proprement que les séquences instables à fort contraste. Ce n’est pas une limite du modèle. C’est une propriété physique de ce que le conditionnement sur plusieurs images peut déduire des données qu’il reçoit.

Les scènes qui donnent les extensions les plus satisfaisantes dès la première tentative sont aussi celles qui rendent le mieux en production en prise de vue réelle : une bonne lumière, un mouvement de caméra délibéré et un sujet clair entretenant une relation spatiale nette avec son environnement.

L’architecture derrière les résultats

Il vaut la peine de s’attarder sur ce que Lightricks a mis en place pour y parvenir, car l’architecture est ce qui distingue LTX 2.3 Pro des modèles qui approchent la prolongation grâce à des solutions de contournement.

Le cœur de LTX Video est un transformeur de diffusion latente, et non l’architecture à base de U-Net qui dominait la première génération de modèles de diffusion vidéo. Les architectures à transformeur ont un avantage naturel pour la modélisation temporelle : le mécanisme d’auto-attention peut être configuré pour opérer simultanément sur les dimensions spatiale et temporelle, une propriété appelée attention spatiotemporelle.

Dans les transformeurs texte vers vidéo standard, l’attention temporelle reste confinée à une seule fenêtre de génération. Dans le mode Extend de LTX 2.3 Pro, la fenêtre d’attention temporelle s’étend vers l’arrière, jusqu’aux images précédentes encodées. Le modèle regarde littéralement son propre passé pendant le processus de diffusion, non pas comme une étape de post-traitement, mais comme une partie intégrante du débruitage lui-même.

C’est pourquoi les résultats diffèrent autant de ceux des approches I2V. L’I2V donne au modèle une photographie et lui dit « fais-la bouger ». Le mode Extend de LTX 2.3 Pro donne au modèle une mémoire et lui dit « continue à partir d’ici ». La première produit du mouvement. La seconde produit une continuité.

La résolution de sortie 4K amplifie cet avantage. À plus haute résolution, le modèle dispose de davantage de détails spatiaux sur lesquels conditionner chaque image précédente, ce qui permet à l’attention temporelle de suivre des détails plus fins : reflets lumineux précis sur les surfaces, mèches de cheveux qui bougent d’une image à l’autre, petits éléments de l’environnement comme des feuilles qui frémissent ou des plis de tissu qui réagissent aux mouvements du corps.

Centre de données moderne avec baies de serveurs et technicien inspectant l’infrastructure informatique

Enchaîner les extensions pour la vidéo longue

L’une des applications les plus pratiques du mode Extend est le chaînage d’extensions. Comme chaque appel au mode Extend se conditionne sur les images les plus récentes de la génération précédente, vous pouvez enchaîner plusieurs extensions pour produire des clips bien au-delà de ce que permettrait une seule fenêtre de génération, tout en maintenant la cohérence visuelle de la scène d’un bout à l’autre.

Le flux de travail :

  1. Générez un clip de base de 5 à 10 secondes avec LTX 2.3 Pro
  2. Prolongez de 5 secondes en conditionnant sur les 2 à 3 dernières images du clip de base
  3. Prolongez le résultat de 5 secondes supplémentaires
  4. Continuez jusqu’à atteindre la durée totale souhaitée

Chaque étape conserve le langage visuel établi de la scène. La dérive visuelle cumulée sur 5 ou 6 extensions enchaînées est minime, comparée à une régénération complète à chaque étape ou à l’assemblage de clips I2V aux coutures. Des créateurs travaillant sur des démonstrations de produits, des visites d’architecture, des documentaires sur la nature et des courts métrages ont rapporté des séquences propres de 30 à 60 secondes assemblées de cette façon, avec des coutures invisibles à la vitesse de lecture standard.

💡 Si vous réalisez une démonstration de produit, une visite immobilière ou une scène d’ambiance pour un court métrage, le chaînage d’extensions avec LTX 2.3 Pro est le moyen le plus rapide d’obtenir des séquences longues et abouties, qui nécessiteraient autrement une équipe de tournage physique.

La technique se combine aussi bien avec l’ensemble plus large d’outils vidéo de PicassoIA. Vous pouvez générer le clip de base avec LTX 2.3 Pro, appliquer des effets visuels depuis la bibliothèque d’effets (plus de 500 options), et utiliser des outils de restauration vidéo par IA pour stabiliser ou augmenter la résolution de la séquence finale assemblée. La chaîne peut être aussi simple ou aussi élaborée que votre projet l’exige.

Jeune femme consultant les résultats d’une génération vidéo par IA sur un ordinateur portable dans un salon à la lumière chaleureuse

Commencez à créer avec LTX 2.3 Pro sur PicassoIA

LTX 2.3 Pro est disponible sur PicassoIA aux côtés de son petit frère plus rapide, LTX 2.3 Fast, pour les moments où vous avez besoin de brouillons et d’itérations rapides. La bibliothèque complète de modèles sur picassoia.com/en/all-models comprend plus de 87 modèles de génération vidéo couvrant le texte vers vidéo, l’image vers vidéo, les effets vidéo et les outils de restauration, de sorte qu’un ensemble complet de flux de travail est disponible quel que soit le point de départ de votre projet.

Si vous n’avez jamais travaillé avec le prolongement vidéo, commencez par une scène simple : une personne qui marche dans une rue à l’heure dorée, une rivière qui serpente dans un paysage rocheux, une bougie qui brûle sur une table dans une pièce sombre. Ces types de scènes donnent au mode Extend suffisamment de données temporelles pour travailler et produisent les résultats les plus satisfaisants dès la première tentative. L’éclairage est constant, le mouvement a une direction claire et l’environnement spatial est facile à suivre pour le modèle d’une image à l’autre.

Ensuite, à mesure que vous comprendrez comment le conditionnement sur les images précédentes réagit à différents types de séquences, vous pourrez aborder des scénarios plus complexes : scènes à plusieurs personnages, mouvements de caméra rapides et séquences narratives qui se déploient sur 30 secondes ou plus grâce à des extensions enchaînées.

L’approche de Lightricks pour la cohérence temporelle n’est pas un simple ajout de fonctionnalité à un pipeline existant. Elle reflète une autre philosophie de ce que la génération vidéo par IA devrait faire : non pas seulement produire des clips isolés, mais produire des images sur lesquelles vous pouvez réellement bâtir une production.

Essayez LTX 2.3 Pro sur PicassoIA dès maintenant et découvrez la différence que fait un conditionnement temporel au niveau de l’architecture sur votre premier clip.

Partager cet article

Choisissez votre langue