Algo extraño ocurre cuando metes una sola fotografía en una herramienta moderna de video con IA. En cuestión de segundos, las nubes empiezan a desplazarse, la superficie del océano comienza a ondular y la persona del encuadre gira la cabeza poco a poco. La imagen ya no está congelada. Respira. ¿Qué pasa realmente dentro de esos modelos durante esos pocos segundos? Este artículo lo desglosa todo, desde las matemáticas hasta el movimiento, para que dejes de verlo como magia y empieces a ver la mecánica real detrás de una de las tecnologías más impresionantes de la IA en este momento.
Lo que la IA realmente ve
Antes de que algo se mueva, el modelo tiene que leer tu imagen, y leer, en este contexto, significa algo muy concreto.
Una foto son solo números
Desde la perspectiva del modelo, tu fotografía es un tensor: una matriz tridimensional de números que representa la intensidad de los píxeles en los canales rojo, verde y azul. Una imagen de 1024x576 contiene algo más de 1,7 millones de números. La IA no "ve" como lo hace una persona. Procesa patrones estadísticos dentro de esas matrices numéricas, patrones que aprendió durante el entrenamiento con millones de pares de imágenes y videos.
Esto significa que el modelo no tiene una comprensión semántica de lo que es una ola. Ha visto suficientes patrones de píxeles que parecen olas, y suficientes secuencias cortas de olas en movimiento, como para construir un modelo probabilístico de cómo deberían cambiar esos píxeles con el tiempo. En otras palabras, el movimiento se codifica como un patrón estadístico de cambio numérico.
El espacio latente: donde ocurre el trabajo
Procesar píxeles en bruto es computacionalmente caro, así que los modelos modernos de imagen a video no operan directamente en el espacio de píxeles. En su lugar, usan un autoencoder variacional (VAE) para comprimir la imagen en una representación latente más pequeña, normalmente entre 8 y 16 veces más pequeña en cada dimensión espacial.
Tu imagen de 1024x576 se convierte en un tensor compacto de 128x72 que flota en lo que los investigadores llaman espacio latente. Esta representación comprimida conserva el significado semántico de la imagen, la composición, los sujetos y las condiciones de iluminación, sin cargar con cada píxel redundante. Toda la generación de movimiento ocurre en este espacio latente. Solo en el paso final de decodificación el modelo convierte el resultado de nuevo en píxeles visibles.
💡 Trabajar en el espacio latente no es solo una optimización de velocidad. Obliga al modelo a razonar a nivel de estructuras y conceptos y no de valores de píxel individuales, lo que produce un movimiento más suave y coherente entre fotogramas.

El motor de difusión que hay debajo
La mayoría de los mejores modelos de imagen a video de hoy se basan en modelos de difusión, la misma arquitectura base que impulsa los mejores sistemas de texto a imagen. Si has usado algún generador de imágenes moderno, ya has interactuado con esta tecnología.
Añadir ruido y luego quitarlo
La difusión funciona en dos fases: un proceso directo y un proceso inverso.
En el proceso directo (durante el entrenamiento), el modelo toma datos de entrenamiento limpios, en este caso clips de video reales, y les añade progresivamente ruido gaussiano aleatorio hasta que los datos quedan completamente irreconocibles. Este proceso se ejecuta a lo largo de miles de pequeños pasos.
En el proceso inverso (durante la inferencia, cuando lo usas de verdad), el modelo tiene que deshacer ese ruido. Partiendo de una nube de ruido puro, predice y elimina el ruido de forma iterativa, paso a paso, guiado por la señal de condicionamiento: tu imagen de entrada más cualquier prompt de texto que hayas indicado. Tras suficientes pasos de eliminación de ruido, surge un video coherente de algo que al principio era estático.
Lo que el modelo aprende realmente a hacer es predecir la función de predicción del ruido: dado un ejemplo ruidoso a un nivel de ruido concreto, ¿cuál era la señal limpia original? La arquitectura, normalmente una U-Net o un diseño basado en Transformers, desarrolla esa capacidad de predicción con tanta precisión que, al ejecutarla en sentido inverso, produce con regularidad resultados fotorrealistas.
Cómo cambia la ecuación con el video
En las imágenes fijas, la difusión trabaja en un espacio 2D. En el video, el modelo debe operar en un espacio 3D: ancho, alto y tiempo. Aquí la arquitectura se vuelve bastante más compleja.
En lugar de eliminar el ruido de un solo fotograma, el modelo elimina el ruido de una pila de fotogramas a la vez. El número de fotogramas varía según el modelo, normalmente entre 16 y 81, según la duración objetivo y la tasa de fotogramas. Todos los fotogramas pasan por la eliminación de ruido en cada paso y, sobre todo, el modelo aplica mecanismos de atención 3D que permiten que cada fotograma "vea" a todos los demás mientras se desruidan.
Esta atención 3D es lo que evita que el video parezca una presentación de diapositivas con imágenes sin relación entre sí. Cada fotograma se genera junto con los demás, con plena conciencia de sus vecinos.

Coherencia temporal: el verdadero desafío
Generar fotogramas es un problema. Lograr que esos fotogramas fluyan de forma natural unos hacia otros es un problema completamente distinto y más difícil.
Por qué los fotogramas deben concordar entre sí
Imagina generar 25 fotogramas independientes de la misma persona caminando. Aunque cada fotograma por separado parezca perfecto, sin coherencia temporal, la chaqueta de la persona cambiará de color al azar entre fotogramas, su paso temblará y el fondo parpadeará con texturas irregulares. El resultado no se parece en nada a un movimiento real.
La coherencia temporal es la propiedad por la que los fotogramas contiguos se mantienen coherentes entre sí a lo largo del tiempo. Los modelos modernos la consiguen mediante varios mecanismos:
- Capas de atención temporal: mecanismos de atención dedicados que procesan la información a lo largo del eje temporal, y no solo de los ejes espaciales
- Enmascaramiento causal: algunas arquitecturas limitan cada fotograma a atender solo a los fotogramas anteriores, imitando la forma en que un video se desarrolla de manera causal en el tiempo
- Condicionamiento por anclaje: el primer fotograma (tu imagen de entrada) actúa como un ancla de condicionamiento fuerte. Cada fotograma posterior debe mantenerse estadísticamente coherente con ese ancla
- Supervisión del flujo óptico: algunos modelos se entrenaron con señales explícitas de flujo óptico que enseñan cómo deben desplazarse los píxeles entre fotogramas
Flujo óptico y predicción del movimiento
El flujo óptico es un concepto clásico de la visión artificial: para cada píxel del fotograma N, ¿qué vector describe su desplazamiento hasta el fotograma N+1? En la edición de video tradicional, el flujo óptico se calculaba explícitamente con algoritmos. En la generación de video con IA moderna, el modelo desarrolla un flujo óptico implícito como parte de su objetivo de entrenamiento.
Por eso modelos de alta calidad como Wan 2.6 I2V o Kling v3 Video producen un movimiento que parece físicamente plausible: los patrones de movimiento son estadísticamente coherentes con la forma en que se mueven los objetos reales en el mundo, incluidos detalles sutiles como el movimiento secundario (el pelo que se agita cuando gira la cabeza, la tela que cae cuando alguien camina).

Prompts de movimiento y señales de condicionamiento
Darle tu imagen al modelo es solo el comienzo. La mayoría de los sistemas modernos de imagen a video aceptan entradas adicionales que orientan el tipo, la dirección y la intensidad del movimiento.
Prompts de texto que dirigen el movimiento
Añadir un prompt de texto como "olas del océano rompiendo, cámara lenta" no se limita a describir el contenido. Condiciona activamente el proceso de eliminación de ruido. El texto se codifica en un vector de alta dimensión mediante un modelo de lenguaje (a menudo CLIP o T5), y este vector se inyecta en las capas de atención cruzada del modelo de difusión en cada paso de eliminación de ruido.
Esto significa que el texto no es un añadido posterior. Es una señal activa que modula cómo interpreta el modelo tu imagen y qué patrones de movimiento genera. Describir el movimiento de cámara ("panorámica lenta a la izquierda"), el comportamiento del sujeto ("mujer riendo") o las condiciones del entorno ("viento que agita los árboles") desplaza la distribución de probabilidad sobre los posibles videos hacia el resultado que quieres.
💡 La precisión del prompt importa: cuanto más específica sea tu descripción del movimiento, mejor podrá el modelo acotar su resultado. "Nubes moviéndose" es débil. "Nubes altocúmulos que se desplazan lentamente en diagonal, de abajo a la izquierda hacia arriba a la derecha" le da al modelo mucho más con lo que trabajar.
Semillas y control de cámara
Algunos modelos ya aceptan entradas explícitas de control de cámara. Kling v2.6 Motion Control te permite especificar trayectorias de cámara, y Minimax Video 01 Director te deja fijar tipos concretos de movimiento de cámara. Esto funciona inyectando incrustaciones de la pose de la cámara en la señal de condicionamiento junto con la imagen y el texto.
El resultado es una nueva categoría de control creativo que simplemente no era posible con los enfoques anteriores de interpolación de fotogramas.

Los modelos que lo hacen hoy
El número de modelos capaces de imagen a video ha crecido con rapidez en los últimos 18 meses. Así se diferencian las principales familias en enfoque y en el carácter de sus resultados.
Serie Wan: velocidad frente a calidad
La familia de modelos Wan, de Wan-Video, ofrece una de las gamas más amplias de contrapartidas entre velocidad y calidad disponibles actualmente. Wan 2.6 I2V Flash y Wan 2.5 I2V Fast están optimizados para una generación rápida con una coherencia temporal sólida, mientras que Wan 2.2 I2V A14B prioriza la calidad con un mayor número de parámetros.
La arquitectura Wan usa un backbone DiT (Diffusion Transformer) en lugar de una U-Net tradicional, lo que escala con más eficiencia con el cómputo y gestiona de forma más natural los requisitos de atención 3D de la generación multifotograma.
Kling y el enfoque cinematográfico
Kling, de la división de IA de Kuaishou, adopta un enfoque arquitectónico distinto, con un fuerte énfasis en la calidad del movimiento cinematográfico. Kling v3 Video y Kling v2.6 producen con regularidad resultados con movimiento secundario de aspecto natural: física del cabello, dinámica de la tela, cáusticas del agua. Esto proviene del entrenamiento con metraje cinematográfico seleccionado y de alta calidad, en lugar de video genérico de internet.
Para animar imágenes en concreto, Kling v2.1 sigue siendo uno de los modelos más fiables para tomar una fotografía de retrato y generar movimiento convincente de la cabeza y del rostro.
Minimax Hailuo: movimiento fotorrealista
La serie Hailuo de Minimax se centra, sobre todo, en el fotorrealismo. Hailuo 2.3 y Hailuo 2.3 Fast destacan especialmente en contenido de retrato y belleza, con un movimiento que mantiene bien la identidad a lo largo de los fotogramas. El modelo Video 01 Live se especializa en animar imágenes fijas, con el foco puesto en mantener la fidelidad del sujeto durante todo el clip.
💡 Para retratos y animación facial en concreto, los modelos entrenados con datos faciales de alta resolución, como Hailuo 2.3 y Kling v2.1, superan con regularidad a los modelos de propósito general.

Enfoques anteriores que vale la pena conocer
Algunos modelos más antiguos, aunque todavía disponibles, ilustran cómo avanzó este campo. I2VGen XL, del equipo de investigación de Alibaba, fue uno de los primeros modelos de imagen a video a gran escala con generación en dos etapas: una pasada de movimiento grueso seguida de una pasada de refinamiento en alta resolución. PIA (Personalized Image Animator) destacó por aceptar módulos de movimiento enchufables, lo que permitía aplicar distintos estilos de movimiento a la misma imagen sin reentrenar.
Estos enfoques anteriores dependían más de plantillas de movimiento explícitas que de la inferencia estadística generalizada, lo que los hacía más rápidos pero menos flexibles que los sistemas actuales basados en DiT.

Qué hace que un clip parezca real
No todos los videos generados con IA resultan igual de convincentes. La diferencia suele depender de dos factores.
Física frente a patrones estadísticos
Los modelos actuales de imagen a video no simulan la física. No hay motor de dinámica de cuerpos rígidos, ni simulación de fluidos, ni sistema de resortes para la tela. El realismo del movimiento procede por completo de patrones estadísticos absorbidos durante el entrenamiento con datos de video reales.
Esto tiene una implicación muy concreta: los modelos rinden mejor con los sujetos que aparecen con frecuencia en sus datos de entrenamiento. Los cuerpos humanos, los rostros, los entornos naturales (agua, árboles, nubes) y el temblor de cámara aparecen en cantidades enormes en el video del mundo real. Estos sujetos se animan de forma convincente. Los sujetos abstractos, las condiciones de iluminación poco habituales o las imágenes de entrada de aspecto sintético suelen producir artefactos, porque el modelo tiene menos patrones estadísticos en los que apoyarse.
Por eso, en estos modelos, la ingeniería de prompts recompensa describir escenarios familiares y fotorrealistas en lugar de escenarios abstractos o estilizados.
Resolución, FPS y duración: las contrapartidas
Todo modelo de imagen a video se enfrenta a un triángulo de cómputo: resolución, tasa de fotogramas y duración. No puedes maximizar las tres a la vez.
| Prioridad | Lo que sacrificas |
|---|
| Alta resolución (1080p+) | Menos fotogramas o menor duración |
| FPS altos (24 fps+) | Menor resolución o menor duración |
| Duración larga (10 s+) | Menor resolución o menor FPS |
Modelos como LTX 2.3 Pro de Lightricks apuntan a salidas en 4K, mientras que Wan 2.1 I2V 480p cambia resolución por velocidad y costo. Elegir el modelo adecuado significa sopesar estas contrapartidas según tu caso de uso concreto, en lugar de quedarte por defecto con el que encabece cualquier clasificación.
💡 Para el contenido de redes sociales, donde 720p es más que suficiente, los modelos rápidos como Wan 2.6 I2V Flash o Hailuo 2.3 Fast suelen dar mejores resultados por generación que los modelos de alta resolución trabajando en su máximo de calidad.

Elegir un modelo para tu caso de uso
Con más de 80 opciones de generación de video disponibles, ajustar el modelo al trabajo importa más que elegir el nombre que suene más impresionante. Esta es una referencia rápida:

Pruébalo con tus propias fotos
La tecnología descrita arriba no es teórica. Cada modelo mencionado en este artículo está disponible ahora mismo en PicassoIA, sin necesidad de configurar APIs, gestionar cómputo ni instalar nada. Toma una foto que ya tengas, escribe una breve descripción del movimiento, elige un modelo según la tabla de arriba y ejecútalo. La distancia entre saber cómo funciona esto y hacerlo de verdad es un solo clic.
Los modelos mejoran con cada ciclo de lanzamiento. Lo que Wan 2.5 I2V produce hoy es notablemente mejor de lo que era posible hace 12 meses, y las próximas versiones ya están en desarrollo. Mantener la curiosidad y experimentar con regularidad es la mejor manera de estar un paso por delante de lo que es posible.
Tanto si animas retratos, si das vida a paisajes o si creas contenido para redes sociales a gran escala, estas herramientas recompensan a quienes realmente las usan. Empieza con una sola imagen y mira qué pasa.
