Qué hace diferente al modo Extend de LTX 2.3 Pro

El modo Extend de LTX 2.3 Pro adopta un enfoque radicalmente distinto para la continuación de video con IA: en lugar de condicionarse a un único último fotograma, lee el clip anterior completo como una ventana de contexto temporal, rastrea la velocidad, la iluminación y el movimiento del sujeto, y genera extensiones fluidas que mantienen la coherencia visual a lo largo de varios clips.

Qué hace diferente al modo Extend de LTX 2.3 Pro
Cristian Da Conceicao
Fundador de Picasso IA

La mayoría de las herramientas de video con IA se topan con el mismo límite. Generas un clip de 5 segundos, te encanta la toma y quieres más. Así que repites el mismo prompt. ¿El resultado? Una escena completamente distinta. Otra dirección de la luz. Otro movimiento. Personajes que apenas se parecen a quienes eran en el primer clip. Ese es el problema central que el modo Extend de LTX 2.3 Pro fue diseñado para resolver, y lo resuelve con un enfoque arquitectónico que ningún otro modelo iguala actualmente.

Lo que todas las demás herramientas de video con IA hacen mal

La mayoría de los modelos de video con IA tratan cada generación como una hoja en blanco. Les das un prompt y generan desde cero. Incluso cuando aportas un fotograma de un video existente como referencia, el modelo trabaja con una instantánea estática del último fotograma únicamente. Ve los colores, la composición y la posición aproximada del sujeto. Pero no ve el movimiento. No ve la velocidad, la dirección ni la física sutil de cómo se movían los objetos en los instantes previos a ese último fotograma.

La trampa del último fotograma

Cuando un modelo se condiciona a un único fotograma, hace suposiciones sobre lo que ocurrirá después basándose solo en la composición. Una ola en primer plano podría moverse hacia la izquierda o hacia la derecha, crecer o retroceder. El modelo elige una opción. Y a menudo elige mal. El siguiente clip empieza con la ola moviéndose en una dirección algo distinta, a una velocidad algo distinta. Solo lo notas en el corte de edición, pero una vez que lo ves no puedes dejar de verlo.

Esto no es un fallo de calidad. Es un fallo de información. El modelo simplemente no tiene lo que necesita para continuar el movimiento con precisión.

La deriva de movimiento en varias extensiones

El problema se acumula con cada extensión. Cada nuevo clip se genera a partir del último fotograma del anterior. Los errores se acumulan. Las temperaturas de la luz cambian ligeramente en cada pasada. El sujeto se desvía del eje en los clips sucesivos. Para la quinta extensión, estás viendo una secuencia que se ha alejado visual y físicamente de donde empezó. Esto es la deriva de movimiento, y es el fallo central de los primeros enfoques de extensión usados por herramientas como Wan 2.7 I2V y otras cuando se usan para extender en lugar de generar desde cero.

Fotogramas de cine en secuencia que muestran la continuidad de una escena de playa a lo largo de cinco fotogramas

Cómo funciona el modo Extend de LTX 2.3 Pro

LTX 2.3 Pro no se condiciona al último fotograma. Procesa una ventana de contexto temporal que abarca todo el clip anterior. Esta es la diferencia arquitectónica clave. En lugar de preguntarse "¿cómo se ve esta escena?", el modelo se pregunta "¿qué está haciendo esta escena y hacia dónde se dirige físicamente?".

La ventana de contexto temporal explicada

Piensa en la diferencia entre leer una frase completa y leer una sola letra. Una letra sola no te dice nada sobre lo que viene después. Una frase completa te revela la gramática, el ritmo y la continuación probable. El modo Extend de LTX 2.3 Pro lee la secuencia de movimiento completa y modela:

  • Velocidad: Con qué rapidez se mueven los objetos y en qué dirección, a lo largo de la duración del clip
  • Trayectoria de la luz: Si la luz se intensifica, se suaviza o se mantiene estable a lo largo de los fotogramas
  • Arco de posicionamiento del sujeto: Hacia dónde se dirigen los personajes u objetos dentro del encuadre al final del clip
  • Estado atmosférico: El ambiente que establecen la temperatura de color y la constancia del grano
  • Vector de movimiento de cámara: La dirección y la rapidez de cualquier movimiento de cámara en el clip de origen

Esta conciencia multifotograma significa que el clip extendido empieza exactamente donde terminó el anterior, no solo visualmente, sino físicamente. La ola continúa su arco. La cámara continúa su travelling. La cabeza del personaje continúa su giro a mitad del movimiento.

Fotógrafo profesional examinando tiras de película impresas sobre una mesa de luz iluminada

El pipeline del modo Extend

El proceso interno del modo Extend se distingue de la generación estándar en cuatro pasos críticos:

  1. Acondicionamiento de entrada: el clip anterior se codifica no como un único fotograma, sino como una secuencia de movimiento completa con el orden temporal preservado.
  2. Incrustación temporal: el modelo construye una incrustación que codifica el estado de movimiento preciso en el límite del clip, capturando la velocidad y la dirección de cada elemento del encuadre.
  3. Síntesis de la continuación: los nuevos fotogramas se generan a partir de esta incrustación de movimiento, no de una imagen estática. La síntesis empieza a mitad del movimiento y no desde el reposo.
  4. Fusión en el límite: los últimos fotogramas del clip original y los primeros de la extensión se ponderan durante la síntesis para garantizar una transición fluida a nivel de píxel, sin ninguna discontinuidad visual.

El resultado es una continuación que respeta la física que ya está en juego, en lugar de inventar una física nueva desde cero.

Línea de tiempo de un software de edición de video que muestra metraje con gradación de color en capas y marcadores de extensión fluidos

La ventaja de la resolución 4K

La resolución no es solo cuestión de nitidez. En 4K hay cuatro veces más píxeles por fotograma que en 1080p. Para el modo Extend, esto importa de una forma específica y a menudo pasada por alto: el modelo dispone de datos de movimiento más ricos con los que calcular las incrustaciones temporales.

En resoluciones más bajas, las pistas sutiles de movimiento se pierden en la compresión. Un ligero movimiento de la mano, un micro desplazamiento del ángulo de cámara, el brillo de la luz sobre el agua. Estos detalles desaparecen a 1080p y por debajo. LTX 2.3 Pro funciona de forma nativa en 4K, preservando esos microdetalles. Cuando condiciona la extensión al clip original, lo hace con una señal de movimiento mucho más rica que la que puede obtener cualquier modelo limitado a 1080p.

💡 Nota: El salto de 1080p a 4K no es puramente estético en el contexto de la extensión de video. Más datos de píxeles por fotograma significan vectores de movimiento más precisos, lo que se traduce directamente en una mejor coherencia temporal entre los clips extendidos.

Primer plano de la lente de una cámara de cine profesional que muestra elementos ópticos de vidrio y aletas de aluminio mecanizado

Por qué el 4K cambia la física

En 4K, las texturas finas se resuelven por completo: el tejido de la tela, el detalle de la superficie de la piel, los microrizos del agua. Cuando el modo Extend genera el siguiente clip, debe igualar estas texturas a través del límite entre clips. Esto obliga al modelo a ser preciso con la continuidad de la superficie de formas que la generación en 1080p no exige. En la práctica, esto significa menos "saltos" visuales en los puntos de corte, una mejor constancia del material fotograma a fotograma y los dos clips resultan más naturales al editarlos juntos.

LTX 2.3 Pro frente a la competencia

¿Cómo se compara el modo Extend con las funciones de continuación de otros modelos líderes?

FunciónLTX 2.3 ProKling v2.6Seedance 2.5Wan 2.7 I2VVeo 3.1
Resolución máxima de salida4K1080p1080p1080p1080p
Ventana de contexto temporalClip completoÚltimo fotogramaÚltimo fotogramaÚltimo fotogramaÚltimo fotograma
Modo Extend nativoSíNoNoNoNo
Seguimiento de la velocidad de movimientoSíParcialNoParcialNo
Fusión de píxeles en el límiteSíNoNoNoNo
Resistencia a la deriva (múltiples extensiones)AltaBajaBajaBajaBaja

Vista cenital de gráficos comparativos impresos de benchmarks de video con IA con gráficas de barras azules y naranjas

Kling v2.6 ofrece una calidad cinematográfica excepcional para la generación desde cero y el trabajo de imagen a video, pero su enfoque de continuación depende del condicionamiento por último fotograma. Seedance 2.5 destaca en el texto a video de formato largo con sincronización de audio nativa, pero carece de un pipeline de extensión temporal diseñado específicamente para ello. Veo 3.1 produce resultados de alta fidelidad con audio nativo, pero no tiene una arquitectura de extensión dedicada. Wan 2.7 I2V ofrece seguimiento parcial del movimiento durante la animación, pero no a lo largo de las extensiones de clips.

Todo modelo de la competencia adapta su pipeline de generación estándar para la extensión. LTX 2.3 Pro se diseñó con la continuación como función principal desde el principio.

Aplicaciones reales

¿Quién necesita de verdad una extensión de video fluida? Más creadores de los que imaginas.

Contenido de formato largo sin rodajes adicionales

Cineastas, productores comerciales y creadores de contenido necesitan con regularidad metraje que mantenga una sola composición durante más tiempo del que cualquier modelo de IA puede generar en una sola pasada. Un plano de apoyo de 30 segundos de un paisaje de montaña. Un sobrevuelo de producto de 45 segundos. Una secuencia ambiental de 60 segundos del vestíbulo de un hotel para una marca de hostelería. La generación estándar exige producir muchos clips individuales y esperar que encajen bien al montarlos. El modo Extend de LTX 2.3 Pro convierte un único clip semilla de 5 segundos en la base de una secuencia continua de 30 a 60 segundos.

Plano general de un equipo de producción de cine colocando una cámara de cine sobre una vía de travelling en un estudio de almacén

Extensiones de escena para la posproducción

Los editores de posproducción descubren con frecuencia que necesitan dos o tres segundos extra de un plano para que un corte funcione bien. Volver a generar toda la escena arriesga perder el aspecto concreto que ya tiene el clip original. El modo Extend resuelve esto con precisión. El editor envía el clip existente a LTX 2.3 Pro y recibe los segundos adicionales exactos que necesita, igualando el clip original en iluminación, movimiento y atmósfera, sin ninguna deriva en la unión.

Planos de fondo para efectos visuales

Los artistas de efectos visuales necesitan planos de fondo limpios y fluidos para el trabajo de composición. Un fondo que cambia visualmente entre secciones crea problemas de registro al superponer elementos en primer plano. El modo Extend produce planos de fondo en los que la iluminación y el movimiento ambiental se mantienen constantes durante toda la duración, lo que simplifica mucho la composición y reduce el tiempo de limpieza en posproducción.

Secuencias en bucle sin cortes

El modo Extend también habilita un flujo de trabajo que antes resultaba difícil de lograr con video de IA: los bucles sin cortes. Al extender un clip a lo largo de varias pasadas e identificar el fotograma que más se parece al fotograma inicial original, los editores pueden crear bucles ambientales que aguantan una reproducción prolongada sin el tartamudeo visual habitual en las técnicas de bucle estándar.

Colorista profesional revisando continuaciones de video fluidas en una suite de posproducción con varios monitores curvos

Encadenar extensiones sin perder calidad

Una preocupación habitual al encadenar varias extensiones es la degradación acumulativa de la calidad. El temor es que cada extensión introduzca pequeños errores que se acumulen con el tiempo, produciendo al final un metraje inservible.

Con el sistema de fusión en el límite de LTX 2.3 Pro, esta preocupación se reduce de forma notable. El modelo no se limita a añadir nuevos fotogramas al final del clip anterior. Vuelve a sintetizar la zona del límite del clip en cada extensión, suavizando las posibles discontinuidades antes de que puedan acumularse. En la práctica, puedes encadenar cuatro o cinco extensiones sin degradación visible de la calidad en los puntos de corte.

Tres reglas prácticas se aplican al encadenar varias extensiones:

  1. Mantén los prompts de extensión coherentes en su dirección. No introduzcas en los prompts de extensión elementos de escena que no estaban en el clip semilla.
  2. Usa el clip anterior completo como fuente para cada extensión, no solo los últimos segundos.
  3. Revisa cada extensión antes de seguir. Detectar la deriva a tiempo es mucho más fácil que corregirla después de construir tres clips más encima de uno defectuoso.

Cómo usar LTX 2.3 Pro en PicassoIA

LTX 2.3 Pro está disponible directamente en PicassoIA sin necesidad de configuración. Así es el flujo de trabajo eficaz.

Flujo de trabajo paso a paso

Paso 1: Genera tu clip semilla. Empieza con texto a video o imagen a video usando LTX 2.3 Pro. Mantén el prompt inicial específico. Describe exactamente lo que hay en la escena: sujeto, entorno, tipo de luz y dirección del movimiento de cámara.

Paso 2: Revisa el resultado con atención. Antes de extender, mira el clip varias veces. Anota la dirección del movimiento, la temperatura de la luz y la trayectoria de la cámara. Tu prompt de extensión debe mantenerse coherente con estos parámetros establecidos, o la extensión parecerá un corte brusco.

Paso 3: Activa el modo Extend. En la interfaz de PicassoIA de LTX 2.3 Pro, sube tu clip original y selecciona la opción Extend. El modelo procesa el contexto temporal completo de forma automática.

Paso 4: Escribe un prompt de continuación. No repitas el prompt del clip semilla. Describe lo que pasa después. Si el clip original mostraba una cámara que avanza lentamente hacia una puerta, tu prompt de extensión debe describir lo que la cámara ve al pasar por la puerta y entrar en el espacio que hay más allá.

Paso 5: Itera con criterio. Cada extensión se convierte en el clip original de la siguiente. Una secuencia de cinco extensiones de LTX 2.3 Pro puede producir una toma de 25 a 30 segundos que se reproduce como un plano continuo.

Mejores ajustes para el modo Extend

AjusteValor recomendadoMotivo
Resolución4KDatos de movimiento más ricos, mayor coherencia temporal
Duración del clip5 segundosTamaño óptimo de la ventana de contexto para el modelo
Especificidad del promptAltaReduce el riesgo de alucinación en el límite
Longitud del promptMás corto que el de la semillaEl contexto temporal ya aporta la información de la escena

💡 Consejo: Mantén los prompts de extensión más cortos que el prompt semilla. La ventana de contexto temporal ya aporta la información de la escena. El prompt de extensión es un empujón en una dirección, no una descripción completa de la escena. Sobrecargarlo aleja al modelo del estado de movimiento establecido.

Científica de datos examinando un diagrama de flujo de la secuencia de fotogramas de un video sobre un panel de espuma en una oficina diáfana y luminosa

Cuándo no usar el modo Extend

El modo Extend no es el enfoque adecuado en todas las situaciones. Tres casos en los que la generación estándar funciona mejor:

1. Cuando quieres un cambio de escena. El modo Extend está diseñado para mantener la coherencia visual y física. Si el siguiente clip necesita otra ubicación, otra hora del día o otro sujeto, usa una generación desde cero en lugar de una extensión.

2. Cuando el clip original tiene artefactos. Los errores visuales, los artefactos de compresión o las irregularidades de movimiento en tu clip semilla se propagarán a la continuación. Corrige el original antes de extender.

3. Cuando la velocidad importa más que la continuidad. El modo Extend procesa un clip completo como contexto, lo que tarda más que la generación estándar de imagen a video. LTX 2.3 Fast o LTX 2 Distilled son las alternativas más rápidas cuando necesitas iterar con rapidez y priorizas eso frente a la coherencia perfecta.

También disponible en la familia LTX

Si el modo Extend no es tu necesidad inmediata, la gama más amplia de LTX en PicassoIA cubre otros casos de uso de forma eficiente:

  • LTX 2.3 Fast: La misma salida en 4K, con una generación más rápida. Pensado para la revisión rápida de borradores e iteración.
  • LTX 2 Pro: El producto estrella de la generación anterior. Sigue produciendo resultados excelentes en 4K para flujos de trabajo de generación estándar.
  • LTX 2 Distilled: Optimizado para la velocidad, para texto a video rápido cuando la extensión temporal no es un requisito.
  • LTX Video: El modelo original, útil para experimentos de generación en tiempo real a menor resolución.

Para proyectos en los que la coherencia temporal a lo largo de varios clips es el requisito principal, LTX 2.3 Pro con el modo Extend es la opción adecuada dentro de la gama.

Crea tus propias escenas extendidas en PicassoIA

La arquitectura está clara. El flujo de trabajo está documentado. Pero la única forma de comprobar lo bien que el modo Extend mantiene la continuidad temporal es probarlo tú mismo con metraje que importe para tu proyecto.

PicassoIA te da acceso directo a LTX 2.3 Pro junto con toda la biblioteca de modelos de texto a video, incluidos Kling v2.6, Veo 3.1, Seedance 2.5 y Wan 2.7 I2V. Genera un clip semilla de 5 segundos, haz tres extensiones seguidas y compara los puntos de corte con lo que has generado con otras herramientas. La diferencia se nota en la primera reproducción.

Creadora de contenido trabajando en el monitor de un estudio en casa con una interfaz de edición de video visible en pantalla

Elige tu primer prompt, ve a PicassoIA y descubre hasta dónde puede llegar una sola escena.

Compartir este artículo

Elige tu idioma