Ce qui distingue le mode Extend de LTX 2.3 Pro

Le mode Extend de LTX 2.3 Pro aborde la continuation de vidéos par IA de façon radicalement différente : au lieu de se baser sur une seule dernière image, il lit l’intégralité du clip précédent comme une fenêtre de contexte temporel, en suivant la vitesse, l’éclairage et le mouvement du sujet pour produire des extensions fluides qui conservent une cohérence visuelle sur plusieurs clips.

Ce qui distingue le mode Extend de LTX 2.3 Pro
Cristian Da Conceicao
Fondateur de Picasso IA

La plupart des outils de vidéo par IA se heurtent au même mur. Vous générez un clip de 5 secondes, vous aimez le plan et vous voulez en avoir davantage. Alors vous relancez le même prompt. Le résultat ? Une scène complètement différente. Une autre direction de lumière. Un autre mouvement. Des personnages qui ressemblent à peine à ceux du premier clip. C’est le problème central que le mode Extend de LTX 2.3 Pro a été conçu pour résoudre, et il le fait avec une approche architecturale qu’aucun autre modèle n’égale actuellement.

Ce que font mal tous les autres outils de vidéo par IA

La plupart des modèles de vidéo par IA traitent chaque génération comme une page blanche. Vous leur donnez un prompt, ils génèrent à partir de zéro. Même lorsque vous fournissez une image existante d’une vidéo comme référence, le modèle ne travaille qu’à partir d’un instantané statique de la dernière image. Il voit les couleurs, la composition, la position approximative du sujet. Mais il ne voit pas le mouvement. Il ne voit ni la vélocité, ni la direction, ni la physique subtile de la façon dont les objets se déplaçaient dans les instants qui précèdent cette dernière image.

Le piège de la dernière image

Lorsqu’un modèle se base sur une seule image, il fait des hypothèses sur ce qui va se passer ensuite, uniquement à partir de la composition. Une vague au premier plan peut aller vers la gauche ou vers la droite, grossir ou reculer. Le modèle en choisit une. Et souvent, il choisit mal. Le clip suivant commence avec une vague qui se déplace dans une direction légèrement différente, à une vitesse légèrement différente. Vous ne le remarquez qu’au point de raccord, mais une fois que vous l’avez vu, impossible de l’oublier.

Ce n’est pas un défaut de qualité. C’est un défaut d’information. Le modèle n’a tout simplement pas ce dont il a besoin pour prolonger le mouvement avec précision.

La dérive du mouvement sur plusieurs extensions

Le problème s’aggrave à chaque extension. Chaque nouveau clip est généré à partir de la dernière image du précédent. Les erreurs s’accumulent. Les températures de couleur se décalent légèrement à chaque passage. Le sujet dérive hors de l’axe au fil des clips successifs. À la cinquième extension, vous regardez une séquence qui s’est éloignée visuellement et physiquement de son point de départ. C’est ce qu’on appelle la dérive du mouvement, et c’est le principal mode d’échec des approches d’extension de première génération, utilisées par des outils comme Wan 2.7 I2V et d’autres lorsqu’on les emploie pour prolonger une vidéo plutôt que pour une génération à partir de zéro.

Planches de films séquentielles montrant la continuité d’une scène de plage sur cinq images

Comment fonctionne le mode Extend de LTX 2.3 Pro

LTX 2.3 Pro ne se base pas sur la dernière image. Il traite une fenêtre de contexte temporel qui couvre l’intégralité du clip précédent. C’est la différence architecturale décisive. Au lieu de demander « à quoi ressemble cette scène ? », le modèle demande « que fait cette scène, et où se dirige-t-elle physiquement ? »

Explication de la fenêtre de contexte temporel

Pensez à la différence entre lire une phrase et lire une seule lettre. Une seule lettre ne vous dit rien de ce qui vient après. Une phrase entière vous indique la grammaire, le rythme et la suite probable. Le mode Extend de LTX 2.3 Pro lit la séquence de mouvement complète et modélise :

  • Vélocité : la vitesse des objets et leur direction sur toute la durée du clip
  • Trajectoire de l’éclairage : si la lumière s’intensifie, s’adoucit ou reste stable d’une image à l’autre
  • Arc de position du sujet : où se dirigent les personnages ou les objets dans le cadre à la fin du clip
  • État atmosphérique : l’ambiance générale établie par la température de couleur et la cohérence du grain
  • Vecteur de mouvement de caméra : la direction et la vitesse de tout mouvement de caméra dans le clip source

Cette conscience multi-images signifie que le clip prolongé commence exactement là où le précédent s’est arrêté, non seulement visuellement mais physiquement. La vague poursuit sa course. La caméra poursuit son travelling. La tête du personnage poursuit son mouvement de rotation en plein geste.

Photographe professionnel examinant des bandes de film imprimées sur une table lumineuse

Le pipeline du mode Extend

Le processus interne du mode Extend se distingue de la génération standard par quatre étapes essentielles :

  1. Conditionnement de l’entrée : le clip précédent est encodé non pas comme une seule image, mais comme une séquence de mouvement complète avec l’ordre temporel préservé.
  2. Embedding temporel : le modèle construit un embedding qui encode l’état de mouvement précis à la frontière du clip, en capturant la vélocité et la direction de chaque élément du cadre.
  3. Synthèse de la continuation : de nouvelles images sont générées à partir de cet embedding de mouvement, et non à partir d’une image statique. La synthèse commence en plein mouvement plutôt qu’à l’arrêt.
  4. Fusion aux frontières : les dernières images du clip source et les premières images de l’extension sont pondérées pendant la synthèse afin d’assurer une transition fluide au niveau du pixel, sans aucune discontinuité visuelle.

Le résultat est une continuation qui respecte la physique déjà en jeu, au lieu d’inventer une physique nouvelle de toutes pièces.

Frise chronologique d’un logiciel de montage vidéo montrant des séquences étalonnées en couches avec des marqueurs d’extension fluides

L’avantage de la résolution 4K

La résolution ne se résume pas à la netteté. En 4K, il y a quatre fois plus de pixels par image qu’en 1080p. Pour le mode Extend, cela compte d’une manière précise et souvent négligée : le modèle dispose de données de mouvement plus riches pour calculer les embeddings temporels.

À basse résolution, les indices de mouvement subtils sont compressés. Un léger mouvement de main, un décalage infime de l’angle de caméra, le scintillement de la lumière sur l’eau. Ces détails disparaissent en 1080p et en dessous. LTX 2.3 Pro fonctionne nativement en 4K et préserve ces micro-détails. Lorsqu’il conditionne l’extension sur le clip source, il s’appuie sur un signal de mouvement bien plus riche que ce qu’un modèle limité au 1080p peut exploiter.

💡 Note : Le passage du 1080p au 4K n’est pas purement esthétique dans le cadre de l’extension vidéo. Davantage de données de pixels par image signifient des vecteurs de mouvement plus précis, ce qui se traduit directement par une meilleure cohérence temporelle entre les clips prolongés.

Gros plan d’un objectif de caméra de cinéma professionnelle montrant des éléments optiques en verre et des cannelures en aluminium usiné

Pourquoi le 4K change la physique

En 4K, les textures fines sont entièrement résolues : le tissage du tissu, le détail de la surface de la peau, les micro-rides de l’eau. Lorsque le mode Extend génère le clip suivant, il doit faire correspondre ces textures à travers la frontière du clip. Cela pousse le modèle vers une précision sur la continuité des surfaces que la génération en 1080p n’exige pas. En pratique, cela signifie moins de « saut » visuel aux points de coupe, une meilleure cohérence des matières d’une image à l’autre, et une impression plus naturelle lorsque les deux clips sont montés ensemble.

LTX 2.3 Pro face à la concurrence

Comment le mode Extend se compare-t-il aux fonctions de continuation des autres modèles majeurs ?

FonctionnalitéLTX 2.3 ProKling v2.6Seedance 2.5Wan 2.7 I2VVeo 3.1
Résolution de sortie maximale4K1080p1080p1080p1080p
Fenêtre de contexte temporelClip completDernière imageDernière imageDernière imageDernière image
Mode Extend natifOuiNonNonNonNon
Suivi de la vélocité du mouvementOuiPartielNonPartielNon
Fusion des pixels aux frontièresOuiNonNonNonNon
Résistance à la dérive (extensions multiples)ÉlevéeFaibleFaibleFaibleFaible

Vue à plat de graphiques imprimés comparant des benchmarks de vidéo par IA, avec des diagrammes en barres bleus et orange

Kling v2.6 offre une qualité cinématographique exceptionnelle pour la génération à partir de zéro et pour l’image vers vidéo, mais son approche de continuation repose sur un conditionnement par la dernière image. Seedance 2.5 se distingue pour la vidéo longue à partir de texte avec une synchronisation audio native, mais ne dispose pas d’un pipeline d’extension temporelle conçu spécifiquement pour cet usage. Veo 3.1 produit des résultats très fidèles avec un son natif, mais ne dispose d’aucune architecture d’extension dédiée. Wan 2.7 I2V offre un suivi partiel du mouvement pendant l’animation, mais pas d’un clip à l’autre lors des extensions.

Chaque modèle concurrent adapte son pipeline de génération standard pour l’extension. LTX 2.3 Pro a été conçu dès le départ avec la continuation comme fonctionnalité de premier ordre.

Applications concrètes

Qui a réellement besoin d’une extension vidéo fluide ? Plus de créateurs qu’on ne l’imagine.

Contenu long sans tournages supplémentaires

Les réalisateurs, les producteurs de publicités et les créateurs de contenu ont régulièrement besoin de séquences qui conservent une seule composition plus longtemps que ce qu’un modèle d’IA peut générer en une seule passe. Un plan de coupe de 30 secondes sur un panorama de montagne. Un survol de produit de 45 secondes. Une séquence d’ambiance de 60 secondes dans le hall d’un hôtel pour une marque hôtelière. La génération standard oblige à produire de nombreux clips individuels en espérant qu’ils se monteront proprement. Le mode Extend de LTX 2.3 Pro transforme un seul seed clip de 5 secondes en la base d’une séquence entièrement continue de 30 à 60 secondes.

Plan large d’une équipe de tournage positionnant une caméra de cinéma sur un rail de travelling dans un studio d’entrepôt

Extensions de scène pour la post-production

Les monteurs en post-production découvrent fréquemment qu’il leur faut deux ou trois secondes supplémentaires d’un plan pour qu’un raccord fonctionne correctement. Régénérer toute la scène risque de faire perdre l’aspect spécifique déjà établi dans le clip source. Le mode Extend résout ce problème avec précision. Le monteur fournit le clip existant à LTX 2.3 Pro et reçoit les secondes supplémentaires exactes dont il a besoin, en accord avec le clip source pour l’éclairage, le mouvement et l’atmosphère, sans aucune dérive au point de jonction.

Plaques d’arrière-plan pour les effets visuels

Les artistes en effets visuels ont besoin de plaques d’arrière-plan propres et continues pour le travail de compositing. Un arrière-plan qui change visuellement d’une section à l’autre crée des problèmes de recalage lorsqu’on superpose des éléments au premier plan. Le mode Extend produit des plaques d’arrière-plan dont l’éclairage et le mouvement environnemental restent cohérents sur toute la durée, ce qui simplifie nettement le compositing et réduit le temps de retouche en post-production.

Séquences en boucle sans couture

Le mode Extend permet aussi un flux de travail difficile à obtenir auparavant avec la vidéo par IA : la boucle sans couture. En prolongeant un clip sur plusieurs passages et en identifiant l’image qui correspond le mieux à l’image de départ d’origine, les monteurs peuvent créer des boucles d’ambiance qui tiennent à une lecture prolongée, sans le scintillement visuel courant dans les techniques de boucle classiques.

Étalonneur professionnel examinant des continuations vidéo fluides sur une station de post-production à écrans incurvés multiples

Enchaîner les extensions sans perte de qualité

Une préoccupation courante lorsqu’on enchaîne plusieurs extensions est la dégradation cumulative de la qualité. On craint que chaque extension introduise de petites erreurs qui s’accumulent avec le temps, jusqu’à produire des images inutilisables.

Avec le système de fusion aux frontières de LTX 2.3 Pro, cette inquiétude est nettement réduite. Le modèle n’ajoute pas simplement de nouvelles images à la fin du clip précédent. Il resynthétise la zone de frontière du clip à chaque extension, en lissant les discontinuités potentielles avant qu’elles ne s’accumulent. En pratique, vous pouvez enchaîner quatre ou cinq extensions sans dégradation visible de la qualité aux points de coupe.

Trois règles pratiques s’appliquent lorsque vous enchaînez plusieurs extensions :

  1. Gardez les prompts d’extension cohérents dans leur direction. N’introduisez pas, dans les prompts d’extension, d’éléments de scène absents du clip germe.
  2. Utilisez le clip précédent complet comme source pour chaque extension, et non seulement les dernières secondes.
  3. Vérifiez chaque extension avant de continuer. Repérer la dérive tôt est bien plus simple que la corriger après avoir ajouté trois clips par-dessus un clip défectueux.

Comment utiliser LTX 2.3 Pro sur PicassoIA

LTX 2.3 Pro est disponible directement sur PicassoIA sans aucune configuration. Voici le flux de travail efficace.

Flux de travail étape par étape

Étape 1 : générez votre seed clip. Commencez par du texte vers vidéo ou de l’image vers vidéo avec LTX 2.3 Pro. Gardez un prompt initial précis. Décrivez exactement ce qui se trouve dans la scène : le sujet, l’environnement, le caractère de la lumière et la direction du mouvement de caméra.

Étape 2 : examinez attentivement le résultat. Avant d’étendre, regardez le clip plusieurs fois. Notez la direction du mouvement, la température de la lumière et la trajectoire de la caméra. Votre prompt d’extension doit rester cohérent avec ces paramètres établis, sinon l’extension donnera l’impression d’un saut de montage.

Étape 3 : activez le mode Extend. Dans l’interface PicassoIA de LTX 2.3 Pro, importez votre clip source et sélectionnez l’option Extend. Le modèle traite automatiquement l’intégralité du contexte temporel.

Étape 4 : rédigez un prompt de continuation. Ne répétez pas le prompt du clip germe. Décrivez ce qui se passe ensuite. Si le clip d’origine montrait une caméra qui avance lentement vers une porte, votre prompt d’extension doit décrire ce que voit la caméra en franchissant la porte et en entrant dans l’espace qui se trouve au-delà.

Étape 5 : itérez avec méthode. Chaque extension devient le clip source de la suivante. Une séquence de cinq extensions avec LTX 2.3 Pro peut produire une prise de 25 à 30 secondes qui se lit comme un plan unique et continu.

Meilleurs réglages pour le mode Extend

RéglageValeur recommandéeRaison
Résolution4KDonnées de mouvement plus riches, cohérence temporelle plus élevée
Durée du clip5 secondesTaille de fenêtre de contexte optimale pour le modèle
Précision du promptÉlevéeRéduit le risque d’hallucination aux frontières
Longueur du promptPlus court que le germeLe contexte temporel porte déjà les informations de scène

💡 Astuce : Gardez les prompts d’extension plus courts que votre prompt germe. La fenêtre de contexte temporel fournit déjà les informations de scène. Le prompt d’extension est une simple indication directionnelle, et non une description complète de la scène. Le surcharger éloigne le modèle de l’état de mouvement établi.

Data scientist examinant un organigramme de séquence d’images vidéo sur un panneau en mousse dans un bureau ouvert et lumineux

Quand ne pas utiliser le mode Extend

Le mode Extend n’est pas la bonne approche dans toutes les situations. Trois cas où la génération standard fonctionne mieux :

1. Lorsque vous voulez un changement de scène. Le mode Extend est conçu pour maintenir la cohérence visuelle et physique. Si le clip suivant doit se dérouler dans un autre lieu, à une autre heure de la journée ou avec un autre sujet, utilisez une génération à partir de zéro plutôt qu’une extension.

2. Lorsque le clip source comporte des artefacts. Les erreurs visuelles, les artefacts de compression ou les incohérences de mouvement de votre clip germe se propageront dans la continuation. Corrigez la source avant d’étendre.

3. Lorsque la vitesse compte davantage que la continuité. Le mode Extend traite un clip complet comme contexte, ce qui prend plus de temps que la génération standard d’image vers vidéo. LTX 2.3 Fast ou LTX 2 Distilled sont les alternatives plus rapides lorsque vous avez besoin d’itérer vite plutôt que d’obtenir une cohérence parfaite.

Également disponible dans la famille LTX

Si le mode Extend ne répond pas à votre besoin immédiat, la gamme LTX plus large disponible sur PicassoIA couvre efficacement d’autres usages :

  • LTX 2.3 Fast : même sortie en 4K, délai de livraison plus court. Conçu pour la révision rapide de brouillons et l’itération.
  • LTX 2 Pro : la version phare de la génération précédente. Produit encore d’excellents résultats en 4K pour les flux de travail de génération standard.
  • LTX 2 Distilled : optimisé pour la vitesse, pour une génération rapide de texte vers vidéo lorsque l’extension temporelle n’est pas nécessaire.
  • LTX Video : le modèle original, utile pour des expérimentations de génération en temps réel à plus basse résolution.

Pour les projets où la cohérence temporelle sur plusieurs clips est l’exigence principale, LTX 2.3 Pro avec le mode Extend est le bon choix dans la gamme.

Créez vos propres scènes prolongées sur PicassoIA

L’architecture est claire. Le flux de travail est documenté. Mais la seule façon de juger à quel point le mode Extend tient la continuité temporelle est de le tester vous-même sur des séquences vidéo qui comptent pour votre projet.

PicassoIA vous donne un accès direct à LTX 2.3 Pro ainsi qu’à l’ensemble de la bibliothèque de modèles de texte vers vidéo, dont Kling v2.6, Veo 3.1, Seedance 2.5 et Wan 2.7 I2V. Générez un clip germe de 5 secondes, enchaînez trois extensions et comparez les points de coupe avec ce que vous avez généré avec d’autres outils. La différence apparaît dès la première lecture.

Créateur de contenu travaillant devant un écran de studio à domicile avec une interface de montage vidéo visible à l’écran

Choisissez votre premier prompt, rendez-vous sur PicassoIA et découvrez jusqu’où une seule scène peut aller.

Partager cet article

Choisissez votre langue