La mayoría de las herramientas de video con IA tratan la extensión como un añadido de última hora. Generas un clip, se acaba, y si necesitas más metraje, tienes que volver a generarlo desde cero, aceptar la deriva visual o pegar dos clips y esperar que el corte no se note demasiado. LTX 2.3 Pro resuelve esto a nivel de arquitectura, no de posprocesado, y esa diferencia cambia por completo lo que puedes producir con él.
El modo de extensión es la función estrella de LTX 2.3 Pro, el modelo insignia de difusión de video latente de Lightricks disponible en PicassoIA. Te permite darle al modelo los últimos fotogramas de un clip existente y pedirle que genere la siguiente secuencia lógica, manteniendo coherentes la iluminación, la física del movimiento y la geometría de la escena a lo largo del empalme. Sin corte brusco. Sin diferencias en la gradación de color. Sin artefactos temporales que se cuelen en la unión. Es un enfoque radicalmente distinto de cualquier otra opción disponible ahora mismo para continuar un video.

Qué hace realmente el modo Extend
La forma más sencilla de explicarlo: el modo Extend no parte del ruido. Parte de tu clip.
Los modelos estándar de generación de video muestrean un vector de ruido latente aleatorio y lo decodifican hacia un prompt objetivo. Cada nueva generación es estadísticamente independiente de la anterior. Esto sirve cuando quieres un clip independiente, pero es catastrófico cuando necesitas continuidad. El modelo no tiene memoria estructural de cómo era tu escena original, cómo caían las sombras, qué trayectoria seguía la cámara o hacia dónde se movían los objetos.
El modo Extend de LTX 2.3 Pro condiciona el proceso de generación con la representación latente codificada de los últimos fotogramas de tu clip existente. Esos fotogramas se codifican en el espacio latente del modelo y pasan a formar parte de las restricciones iniciales del proceso de difusión para la extensión. El desruido ya no opera en el vacío. Opera en relación directa con lo que ocurrió antes.
💡 En la práctica: si tu clip original muestra a una mujer caminando por un parque con luz de tarde moteada entrando desde arriba a la izquierda, la extensión seguirá con esa misma mujer, ese mismo parque y esa misma dirección de luz. La física de la escena se mantiene porque el modelo fue condicionado por ella, no porque tenga que adivinarla.
Esta no es una diferencia menor. Ahí está lo que de verdad importa.

Cómo funciona aquí la coherencia temporal
La frase "coherencia temporal" se usa a la ligera en las conversaciones sobre video con IA. Lo que realmente significa en el contexto de LTX 2.3 Pro merece desglosarse con precisión, porque el mecanismo es lo que hace que el resultado parezca distinto de cualquier alternativa I2V.
Coherencia temporal se refiere a la coherencia de la información visual entre los fotogramas de una secuencia de video. A nivel de píxel, significa que los objetos mantienen su forma, su color y su posición en relación con lo que predeciría la física del movimiento. A nivel semántico, significa que la escena se percibe como una experiencia continua y no como una serie de fotogramas vagamente relacionados.
LTX 2.3 Pro logra esto mediante mecanismos de atención causal en su núcleo transformer. Al generar la extensión, las cabezas de atención pueden mirar hacia atrás, a las representaciones latentes de los fotogramas previos. Esto es arquitectónicamente distinto de usar simplemente el último fotograma como prompt de imagen. Un prompt de imagen único le da al modelo una instantánea, una referencia sin velocidad ni dirección. La atención causal sobre varios fotogramas previos le da al modelo, a la vez, vectores de velocidad, la dirección del gradiente de iluminación a lo largo del tiempo, datos de la trayectoria de la cámara y trayectorias de posición de los objetos.
El resultado es una predicción del movimiento que parece físicamente fundamentada y no alucinada. El agua que fluía hacia la izquierda sigue fluyendo hacia la izquierda. Una persona a mitad de zancada sigue con la zancada sin volver a una pose neutra. Un plano panorámico sigue desplazándose a la misma velocidad angular y con la misma línea de horizonte. Estos detalles son los que separan un metraje que aguanta en un contexto profesional de uno que solo es "suficientemente bueno para una publicación rápida en redes".
Un fotograma le dice al modelo dónde están las cosas. Varios fotogramas le dicen hacia dónde van y a qué ritmo.

Por qué otros modelos se quedan cortos al extender
La comparación es directa. Toma un modelo como Kling v3 Video o Veo 3. Ambos son excelentes generadores de texto a video por derecho propio. Ninguno fue diseñado en torno a la continuación de video sin costuras como una característica arquitectónica de primer nivel.
Cuando usas el modo imagen a video (I2V) de estos modelos para "extender" un clip, estás dando el último fotograma como imagen estática. Luego el modelo genera el movimiento a partir de ese fotograma según tu prompt de texto. Aquí es donde se nota la costura:
- La dirección del movimiento se reinicia: El modelo elige una dirección de movimiento coherente con la imagen estática y el prompt, no con el impulso del clip anterior.
- La iluminación se recalcula de forma independiente: Los ángulos de sombra y la exposición pueden cambiar sutilmente cuando el modelo reevalúa la escena desde un punto de partida congelado.
- Se pierden los detalles de micromovimiento: El temblor de la cámara, la respiración de un personaje, la frecuencia de las ondas del agua: estos detalles sutiles que hacen que el metraje parezca vivo se regeneran desde cero y casi nunca coinciden con el original.
La costura visual donde termina el clip original y empieza la extensión I2V se ve en la mayoría de los modelos si miras con atención. A 24 fps en una pantalla grande, a menudo se nota incluso sin mirar con atención.
💡 Por eso los creadores de video profesionales suelen describir la extensión I2V como "válida para redes sociales", pero no apta para nada que vaya a proyectarse en un contexto profesional, presentarse a un cliente o incluirse en un reel de producción. La costura es lo que delata el montaje.
Sora 2 Pro y Wan 2.7 T2V también producen metraje independiente de calidad, pero igualmente carecen de condicionamiento nativo sobre varios fotogramas previos para flujos de extensión. Son herramientas de generación, no de continuación. La distinción pesa cada vez más a medida que los creadores intentan construir narrativas de video con IA más largas y coherentes.

Tres cosas que diferencian a LTX 2.3 Pro
1. Condicionamiento sobre varios fotogramas previos
La mayoría de los enfoques I2V condicionan sobre un solo fotograma. LTX 2.3 Pro condiciona sobre varios fotogramas previos codificados juntos en una representación latente unificada. Esto le da al modelo datos temporales suficientes para inferir vectores de velocidad de los objetos, la velocidad y dirección del movimiento de la cámara, y la progresión de los gradientes de iluminación a lo largo del tiempo en la escena.
La diferencia de calidad entre el condicionamiento de un solo fotograma y el de varios no es marginal. Es estructural. El condicionamiento de un solo fotograma produce clips que parecen continuar una escena. El condicionamiento de varios fotogramas produce clips que son una continuación de la escena a nivel físico.
2. Salida nativa en 4K
LTX 2.3 Pro genera en resolución 4K de forma nativa. Esto importa especialmente para la extensión, porque una resolución alta facilita mucho trabajar con la unión entre el metraje original y el extendido en la posproducción. A 4K tienes más datos de píxel si necesitas aplicar un fundido cruzado sobre la unión, y el nivel de detalle del fotograma hace que cualquier inconsistencia que quede en el límite sea menos perceptible para el espectador.
Compáralo con LTX 2.3 Fast, que prioriza la velocidad sobre la resolución y es una buena opción cuando necesitas iterar rápido, o con el LTX Video original, que estableció la arquitectura base pero trabaja con resoluciones significativamente más bajas. Para la entrega final, LTX 2.3 Pro es el modelo que necesitas.
3. Dirección mediante prompt dentro de la extensión
El modo Extend no se limita a continuar la escena de forma mecánica. Puedes dar un prompt de texto que guíe lo que ocurre a continuación dentro de las restricciones que fijan los fotogramas previos. Esto significa que puedes pedir que un personaje se dé la vuelta, que la cámara haga un travelling hacia delante o que la luz cambie cuando una nube pasa por encima, y el modelo intentará esos cambios manteniendo la coherencia con el lenguaje visual ya establecido en el metraje anterior.
Esto es continuación de escena con control de dirección, algo fundamentalmente distinto de la pura extrapolación mecánica.

LTX 2.3 Pro frente a otros modelos de video
Aquí tienes una comparación directa de funciones para casos de uso de extensión de video:
| Modelo | Método de extensión | Resolución | Coherencia temporal | Dirección mediante prompt |
|---|
| LTX 2.3 Pro | Condicionamiento sobre varios fotogramas previos | 4K | Alta | Sí |
| LTX 2 Pro | Varios fotogramas previos | 1080p | Alta | Sí |
| Kling v3 Video | I2V de un solo fotograma | 1080p | Moderada | Sí |
| Veo 3 | I2V de un solo fotograma | 1080p | Moderada | Sí |
| Wan 2.7 T2V | Regeneración desde texto | 1080p | Baja para extensión | Sí |
| Hailuo 2.3 | I2V de un solo fotograma | 1080p | Moderada | Limitada |
| Ray 3.2 | I2V de un solo fotograma | HDR | Moderada | Sí |
| Seedance 2.5 | Texto e imagen | Clips de 30 segundos | Baja para extensión | Sí |
La tabla deja clara la posición: LTX 2.3 Pro es el único modelo de este grupo que combina condicionamiento sobre varios fotogramas previos con salida en 4K. Su predecesor, LTX 2 Pro, comparte la arquitectura de condicionamiento pero trabaja a 1080p, lo que convierte a LTX 2.3 Pro en el máximo actual para trabajos de extensión de alta fidelidad.

Cómo usar LTX 2.3 Pro en PicassoIA
LTX 2.3 Pro está disponible directamente en PicassoIA. Así funciona en la práctica el flujo del modo Extend:
Paso 1: Genera o sube tu clip base. Empieza con cualquier clip de video que quieras continuar. Puede ser un clip que hayas generado antes con LTX 2.3 Pro, LTX 2.3 Fast, o cualquier metraje externo que cumpla los requisitos de entrada del modelo.
Paso 2: Selecciona el modo Extend. En la interfaz del modelo, elige la opción de extensión en lugar de la generación estándar. Esto activa el condicionamiento sobre varios fotogramas en lugar del muestreo desde ruido nuevo.
Paso 3: Define la duración de la extensión. Indica cuántos segundos de metraje nuevo quieres generar. Las extensiones cortas, de 3 a 5 segundos, tienden a tener la mayor coherencia. Las extensiones más largas pueden funcionar bien, pero pueden mostrar más deriva del prompt hacia el final del clip.
Paso 4: Escribe tu prompt de continuación. Sé específico con el movimiento y los cambios de escena. En lugar de "la mujer sigue caminando", prueba con "la mujer se detiene despacio y se gira para mirar a la cámara, la luz del sol sigue entrando desde la izquierda, el mismo fondo del parque, una brisa suave le mueve el pelo". La especificidad le da al modelo una intención de dirección clara que seguir dentro de la escena establecida.
Paso 5: Revisa e itera. Mira la extensión a velocidad de reproducción completa y luego avanza fotograma a fotograma en el punto de unión. Si la unión no es perfecta, vuelve a generar con un prompt ligeramente ajustado o prueba a usar los dos últimos fotogramas de la extensión como nuevo clip base para una nueva llamada de extensión.
💡 Para contenido de larga duración, el método más fiable es encadenar: genera 5 segundos, extiende 5, vuelve a extender. Cada extensión condiciona sobre fotogramas previos nuevos, lo que mantiene la coherencia alta incluso cuando la duración total del clip llega a 30, 60 segundos o más.

Resultados reales: qué esperar del modo Extend
La valoración honesta, basada en lo que promete la arquitectura y en lo que ofrece en la práctica:
Dónde destaca:
- Planos de cámara fija con sujetos en movimiento (personas caminando, agua fluyendo, follaje con viento)
- Movimientos de cámara lentos y deliberados, cuya trayectoria ya está clara en el clip anterior
- Escenas de interior con iluminación artificial controlada que no cambia bruscamente entre fotogramas
- Escenas con profundidad espacial clara, donde los objetos siguen un paralaje natural cuando la cámara se mueve
Dónde requiere más trabajo de prompt:
- Secuencias de acción con cortes rápidos, en las que la dirección del movimiento cambia de forma abrupta entre el original y la extensión prevista
- Escenas con fuentes de luz directa intensas que proyectan sombras dinámicas que cambian de un fotograma a otro
- Escenas complejas con varios personajes, donde cada uno tiene vectores de movimiento independientes que el modelo debe seguir a la vez
💡 Cuanta más información codifiquen los fotogramas previos sobre la física de la escena, mejor funciona la extensión. El metraje estable y bien iluminado se extiende de forma más limpia que el metraje con mucha sacudida y alto contraste. Esto no es una limitación del modelo. Es una propiedad física de lo que el condicionamiento sobre varios fotogramas puede inferir de los datos que recibe.
Las escenas que producen las extensiones más satisfactorias en el primer intento son también las que mejor se ven en una producción con actores reales: buena luz, movimiento de cámara deliberado y un sujeto claro con una relación espacial clara con su entorno.
La arquitectura detrás de los resultados
Merece la pena detenerse en lo que Lightricks construyó para que esto funcione, porque la arquitectura es lo que separa a LTX 2.3 Pro de los modelos que aproximan la extensión mediante soluciones alternativas.
El núcleo de LTX Video es un transformer de difusión en espacio latente, en lugar de la arquitectura basada en U-Net que dominó la primera generación de modelos de difusión de video. Las arquitecturas transformer tienen una ventaja natural para el modelado temporal: el mecanismo de autoatención puede configurarse para operar a la vez en las dimensiones espacial y temporal, una propiedad llamada atención espaciotemporal.
En los transformers de texto a video estándar, la atención temporal está contenida dentro de una única ventana de generación. En el modo Extend de LTX 2.3 Pro, la ventana de atención temporal se extiende hacia atrás, sobre los fotogramas previos codificados. El modelo literalmente atiende a su propio pasado durante el proceso de difusión, no como un paso de posprocesado, sino como parte integral del propio desruido.
Por eso los resultados difieren tanto de los enfoques I2V. I2V le da al modelo una fotografía y le dice "haz que se mueva". El modo Extend de LTX 2.3 Pro le da al modelo una memoria y le dice "sigue desde aquí". Lo primero produce movimiento. Lo segundo produce continuidad.
La resolución de salida 4K multiplica esta ventaja. A mayor resolución, el modelo tiene más detalle espacial sobre el que condicionar dentro de cada fotograma previo, lo que significa que la atención temporal puede seguir detalles más finos: reflejos de luz concretos en las superficies, mechones de pelo que se mueven entre fotogramas, pequeños elementos del entorno como hojas que se desplazan o pliegues de tela que responden al movimiento del cuerpo.

Encadenar extensiones para video de larga duración
Una de las aplicaciones más prácticas del modo Extend es el encadenamiento de extensiones. Como cada llamada al modo Extend condiciona sobre los fotogramas más recientes de la generación anterior, puedes encadenar varias extensiones para producir clips mucho más largos de lo que permitiría cualquier ventana de generación individual, manteniendo la coherencia visual de la escena en todo momento.
El flujo de trabajo:
- Genera un clip base de 5 a 10 segundos con LTX 2.3 Pro
- Extiende 5 segundos más, condicionando sobre los últimos 2 o 3 fotogramas del clip base
- Extiende el resultado otros 5 segundos
- Continúa hasta alcanzar la duración total deseada
Cada paso mantiene el lenguaje visual establecido de la escena. La deriva visual acumulada tras 5 o 6 extensiones encadenadas es mínima en comparación con regenerar desde cero en cada paso o unir clips I2V en las costuras. Creadores que trabajan en demos de productos, recorridos arquitectónicos, documentales de naturaleza y cortometrajes han informado de secuencias limpias de 30 a 60 segundos ensambladas de esta forma, con costuras que no se ven a velocidad de reproducción estándar.
💡 Si estás construyendo una demo de producto, un recorrido por una propiedad inmobiliaria o una escena atmosférica para un cortometraje, encadenar extensiones con LTX 2.3 Pro es el camino más rápido hacia metraje de larga duración pulido que de otro modo requeriría un equipo de rodaje físico.
La técnica también combina bien con el conjunto de herramientas de video más amplio de PicassoIA. Puedes generar el clip base con LTX 2.3 Pro, aplicar efectos visuales de la biblioteca de Effects (más de 500 opciones) y usar herramientas de restauración de video con IA para estabilizar o escalar la secuencia final ensamblada. La cadena puede ser tan sencilla o tan elaborada como requiera tu proyecto.

Empieza a crear con LTX 2.3 Pro en PicassoIA
LTX 2.3 Pro está disponible en PicassoIA junto a su hermano más rápido, LTX 2.3 Fast, para cuando necesitas borradores e iteraciones rápidas. La biblioteca completa de modelos en picassoia.com/en/all-models incluye más de 87 modelos de generación de video que abarcan texto a video, imagen a video, efectos de video y herramientas de restauración, así que hay un flujo de trabajo completo disponible independientemente de dónde empiece tu proyecto.
Si nunca has trabajado con extensión de video, empieza con una escena sencilla: una persona caminando por una calle a la hora dorada, un río que fluye por un paisaje rocoso, una vela encendida sobre una mesa en una habitación oscura. Este tipo de escenas dan al modo Extend suficientes datos temporales con los que trabajar y producen los resultados más satisfactorios en el primer intento. La iluminación es constante, el movimiento tiene una dirección clara y el entorno espacial es fácil de seguir para el modelo a lo largo de los fotogramas.
A partir de ahí, a medida que vayas cogiendo soltura con la forma en que el condicionamiento sobre fotogramas previos responde a distintos tipos de metraje, puedes avanzar hacia escenarios más complejos: escenas con varios personajes, movimientos de cámara rápidos y secuencias narrativas que se desarrollen durante 30 segundos o más mediante extensiones encadenadas.
El enfoque de Lightricks hacia la coherencia temporal no es solo una función añadida a una canalización existente. Representa una filosofía distinta sobre lo que debe hacer la generación de video con IA: no solo producir clips aislados, sino producir metraje con el que de verdad se pueda construir una producción.
Prueba LTX 2.3 Pro en PicassoIA ahora y comprueba la diferencia que marca el condicionamiento temporal a nivel de arquitectura en tu primer clip.