Lo que Sora 2.5 hace bien con el movimiento en la IA y por qué importa a los creadores de video

Sora 2.5 supone un avance importante en el video generado por IA, sobre todo en cómo maneja el movimiento. Este artículo desglosa los avances técnicos concretos, desde la simulación de física hasta la coherencia temporal, y cómo se comparan con Sora 2.5 las herramientas rivales de plataformas como PicassoIA.

Lo que Sora 2.5 hace bien con el movimiento en la IA y por qué importa a los creadores de video
Cristian Da Conceicao
Fundador de Picasso IA

En el momento en que una persona levanta una taza de café, el líquido del interior se mueve de una forma muy concreta. Cuando una tela resbala del hombro de alguien, la gravedad y la resistencia del aire interactúan en patrones que reconocemos al instante como reales. La percepción humana se ha calibrado durante millones de años observando objetos físicos en movimiento, y por eso el video generado por IA siempre nos ha parecido extraño, incluso cuando no sabíamos explicar por qué.

Sora 2.5 cambia eso. No del todo. No a la perfección. Pero de maneras lo bastante importantes como para cambiar la forma en que los creadores profesionales piensan sobre las herramientas de video con IA.

Este artículo desglosa los ámbitos concretos en los que Sora 2.5 logra avances medibles: coherencia temporal, simulación de física e inteligencia de cámara. Después analiza cómo se comparan los modelos de texto a video disponibles en PicassoIA y qué hace diferente la competencia.

El problema del movimiento que siempre tuvo el video con IA

Por qué la física hizo fracasar a todos los modelos iniciales

La primera generación de modelos de texto a video trataba el video como una secuencia de imágenes. Generaba un fotograma, luego otro, luego otro, y los unía. El problema es que el mundo físico no funciona fotograma a fotograma. Una pelota que rueda por una mesa no se reinicia entre fotogramas. Su velocidad, su giro, su relación con la gravedad y su interacción con la superficie persisten en el tiempo como un proceso físico continuo.

Los primeros modelos producían clips con una calidad onírica, con objetos que se transformaban de forma inesperada entre fotogramas y fondos que cambiaban violando la continuidad básica. La información visual solía ser atractiva, pero la física fallaba de formas que hacían el material inservible para el trabajo profesional.

Las opciones de código abierto más recientes mejoraron mucho la velocidad de iteración. Modelos como Wan 2.7 T2V, de WanVideo, y LTX 2.3 Pro, de Lightricks, llevaron la coherencia temporal a nuevos niveles, pero el desafío de fondo seguía siendo el mismo: los modelos de generación de video están optimizados para producir fotogramas individuales con aspecto plausible, no simulaciones físicamente precisas del mundo.

Simulación de física del movimiento en video con IA

Qué aspecto tienen realmente los "artefactos de movimiento"

Los artefactos de movimiento son los fallos concretos que delatan que un video es sintético. Entre ellos están:

  • Efecto fantasma: restos semitransparentes de objetos que aparecen en posiciones que ocupaban en fotogramas anteriores
  • Temblor: objetos que vibran levemente entre fotogramas sin ninguna causa física
  • Manos y dedos que se deforman: uno de los indicios más comunes, donde el número de dedos o la forma de las manos cambia de un fotograma a otro
  • Inestabilidad del fondo: texturas de paredes o suelos que se desplazan o se hinchan entre cortes
  • Dinámica de fluidos imposible: agua que no fluye, tela que no cae, cabello que se congela a mitad del movimiento y luego teletransporta

Sora 2.5 aborda estos problemas de forma sistemática. El modelo usa un mecanismo conjunto de atención espacio-temporal que procesa los fotogramas no como imágenes independientes, sino como segmentos de un volumen 4D continuo, donde el tiempo es la cuarta dimensión. Este enfoque hace que la coherencia física sea una propiedad estructural del proceso de generación, y no algo que el modelo aprende a aparentar.

💡 La idea clave: Sora 2.5 no simula la física desde primeros principios. Ha aprendido un prior muy potente sobre cómo se ve un movimiento físicamente plausible a partir del entrenamiento con enormes volúmenes de datos de video, y luego aplica ese prior de forma constante a lo largo del tiempo.

La coherencia temporal, por fin bien resuelta

La permanencia de los objetos entre fotogramas

La permanencia de objetos es la comprensión cognitiva básica de que los objetos siguen existiendo aunque salgan del encuadre o cambien de posición. En los modelos de video con IA, mantener la permanencia de objetos significa que la camiseta de una persona conserve su color cuando se da la vuelta, que la taza de café siga sobre la mesa cuando la cámara se aleja y vuelve, y que la cola del perro mantenga la misma longitud durante todo el plano.

Sora 2 ya estaba claramente por delante de sus contemporáneos en este aspecto. Sora 2.5 lo amplía con lo que OpenAI describe como un seguimiento mejorado del estado del mundo, en el que el modelo mantiene una representación interna de las posiciones, propiedades y relaciones de los objetos que se conserva durante toda la duración del clip.

El efecto práctico es llamativo. En clips de prueba, la cámara puede girar 180 grados y volver a encontrar los objetos exactamente donde estaban, con las sombras y la iluminación correctas para el nuevo ángulo. Los personajes pueden caminar detrás de obstáculos y salir correctamente por el otro lado. Los líquidos pueden verterse y acumularse de forma realista en los recipientes.

Mujer corriendo por un campo de trigo, coherencia temporal

Cómo el pensamiento a nivel de escena lo cambia todo

En el enfoque anterior, fotograma a fotograma, cada fotograma generado se preguntaba: "¿Cómo debería verse este fotograma?". La arquitectura de Sora 2.5 traslada esa pregunta a otra: "¿Qué está pasando en esta escena y cómo debería verse ahora mismo?".

Esa diferencia puede sonar filosófica, pero tiene consecuencias concretas. Un modelo que piensa a nivel de fotograma generará un fuego que parpadea de forma impredecible, porque los píxeles del fuego varían de manera probabilística. Un modelo que piensa a nivel de escena entiende que este fuego concreto empezó en este punto concreto y lleva ardiendo estos segundos, y que su estado actual se deriva causalmente de todo eso.

Es la diferencia entre alucinar un video y recordarlo.

Modelos como Ray 3.2, de Luma AI, también han avanzado de forma notable en la coherencia a nivel de escena, sobre todo en el movimiento de cámara. Seedance 2.5, de ByteDance, aborda el problema desde un ángulo arquitectónico distinto, dando prioridad a la suavidad del movimiento y a la sincronización del audio. Cada uno tiene sus puntos fuertes, pero el seguimiento del estado del mundo de Sora 2.5 es actualmente la implementación más sólida del pensamiento a nivel de escena disponible comercialmente.

Sora 2.5 y la física de los fluidos

Agua, tela y simulación de cuerpos blandos

Tres categorías de simulación física son, siempre, las más difíciles para los modelos de video con IA: la dinámica de fluidos, la simulación de tela y la física de cuerpos blandos. Son difíciles por las mismas razones por las que son costosas desde el punto de vista computacional en los flujos de trabajo tradicionales de VFX: las ecuaciones físicas subyacentes producen un comportamiento caótico y no lineal, muy sensible a las condiciones iniciales.

Observa cómo cae el agua de una jarra en un clip de Sora 2.5 y compárala con cualquier competidor de hace dos generaciones. El chorro se estrecha correctamente al caer, la tensión superficial crea una adherencia realista en el borde del pico antes de romperse, y los patrones de salpicadura al impactar siguen la dinámica de fluidos. El modelo ha visto suficientes imágenes reales de agua como para que su prior aprendido sobre el movimiento de los fluidos sea ahora genuinamente preciso.

Primer plano de la dinámica de fluidos del agua

La simulación de tela muestra un avance parecido. La tela responde bien a la gravedad y al movimiento: un abrigo se hincha cuando un personaje gira rápido, se asienta con un peso preciso y se forman arrugas en las articulaciones y en los puntos de presión con patrones físicamente plausibles. El cabello sigue la dirección del viento con regularidad a lo largo de un clip, en lugar de cambiar de dirección entre fotogramas.

Por qué estas cosas son tan difíciles de resolver bien

La dificultad no es solo computacional. Es que la física de los fluidos y de las telas es profundamente no local: lo que sucede en una parte de un material que fluye depende de lo que ocurre simultáneamente en todas las demás. Una ola en el agua afecta a las condiciones aguas arriba y aguas abajo. La tensión de la tela en un punto tira de las zonas adyacentes.

Los modelos actuales de difusión de video generan información espacial mediante mecanismos de atención que, aunque potentes, no se diseñaron explícitamente para captar estas dependencias físicas no locales. Sora 2.5 parece compensarlo con una combinación de mayor volumen de datos de entrenamiento y una escala de modelo que le da la capacidad de representación necesaria para aproximar estas interacciones de forma implícita.

💡 Para los creadores: Esto significa que los prompts que describen escenarios físicos complejos (lluvia cayendo sobre la superficie de un charco, seda al viento, cabello bajo el agua) tienen ahora muchas más probabilidades de producir material utilizable que hace apenas seis meses.

Una inteligencia de cámara que parece humana

Lenguaje cinematográfico sin equipo de rodaje

La cinematografía profesional tiene su propio vocabulario: rack focus, dolly zoom, plano holandés, a mano alzada, travelling, grúa hacia arriba. Estos términos describen no solo la posición de la cámara, sino la relación entre la cámara y el sujeto a lo largo del tiempo, incluido lo que el movimiento comunica emocionalmente.

Sora 2.5 ha interiorizado este vocabulario de una forma que los modelos anteriores no habían logrado. Pedir un "lento dolly hacia el rostro de un orador" produce material en el que el movimiento de cámara tiene peso e intención. Un "plano de seguimiento a mano alzada" produce una inestabilidad leve y realista de la cámara, que se percibe como manejada por una persona y no como un temblor aleatorio.

Calle empedrada aérea con cámara cinematográfica

Este es un terreno en el que Gen 4.5, de Runway, ha destacado especialmente, y en el que Kling v3, de Kwai, ha logrado avances notables en la precisión del control de movimiento. El panorama competitivo es muy reñido en este punto, y cada modelo muestra fortalezas distintas a la hora de interpretar el lenguaje cinematográfico.

Composición dinámica frente a estática

Una cámara estática no significa que no pase nada. La cámara se mantiene quieta, pero los sujetos se mueven por el encuadre, cambia la luz y el movimiento ambiental continúa. Sora 2.5 maneja especialmente bien el movimiento ambiental en los clips con cámara estática: los árboles se mecen de forma creíble, las cortinas se mueven con las corrientes de aire y la actividad de fondo sigue con una variedad adecuada.

Los clips con cámara dinámica plantean un reto distinto: al moverse la cámara, todo el fondo debe reproyectarse correctamente, las zonas ocultas deben rellenarse de forma plausible y las relaciones de profundidad deben mantenerse. La fortaleza de Sora 2.5 en el seguimiento del estado del mundo respalda directamente el rendimiento con cámara dinámica, ya que el modelo mantiene un modelo 3D coherente por el que se mueve la cámara, en lugar de generar píxeles de fondo nuevos sobre la marcha.

Cómo se compara Sora 2.5 con la competencia

Comparativa directa: los modelos que vale la pena seguir

El campo del texto a video ha avanzado mucho en capacidades durante el último año. Esta es una valoración honesta de dónde están los principales modelos:

ModeloCoherencia temporalPrecisión físicaControl de cámaraAudio nativoResolución máxima
Sora 2 ProExcelenteExcelenteSólidoSí1080p
Veo 3.1Muy buenaMuy buenaBuenaSí1080p
Seedance 2.5BuenaBuenaBuenaSí1080p
Kling v3BuenaModeradaMuy buenaParcial1080p
Ray 3.2BuenaModeradaMuy buenaSí1080p
Wan 2.7 T2VBuenaModeradaModeradoNo1080p
Hailuo 02Muy buenaBuenaModeradoNo1080p

Cineastas revisando una comparación de material de video

Dónde destaca cada herramienta por encima del resto

Ningún modelo lo hace todo mejor. Veo 3.1, de Google, produce video sincronizado con el audio y una calidad de sonido ambiental que hoy no tiene rival: la lluvia suena mojada, los pasos tienen la resonancia correcta según la superficie, y el momento de los diálogos encaja de forma natural con el movimiento de la boca.

Kling v2.6 sigue siendo la opción más sólida en precisión de control de movimiento, sobre todo para contenido deportivo y de acción, donde importan los trayectos de movimiento concretos. Ray 3.2 destaca en los movimientos de cámara cinematográficos y genera material con una calidad de película que encaja de forma natural junto a imágenes rodadas profesionalmente.

Seedance 2.5, de ByteDance, destaca por su coherencia en formatos largos. Hasta 30 segundos de material temporalmente coherente es una ventaja práctica considerable para las narraciones en las que varios cortes deben encajar entre sí.

Para los creadores que necesitan elegir un punto de partida e iterar, el consejo práctico es ajustar la herramienta al tipo de contenido:

Cortometrajes y narraciones que ya funcionan

Qué cambia para los cineastas independientes

Antes de que existieran modelos de la clase de Sora 2.5, el video con IA se limitaba de verdad a clips ilustrativos cortos: presentaciones de productos, visuales abstractos, elementos de fondo. La calidad del movimiento no era lo bastante buena para el trabajo narrativo, porque fallaba la coherencia de los personajes, la física se rompía y los movimientos de cámara resultaban artificiales.

La mejor coherencia temporal de Sora 2.5 cambia el cálculo para los creadores independientes. Un cineasta que sabe escribir prompts detallados y técnicamente precisos puede ahora producir material para:

  • Planos de situación que reflejen la atmósfera de un lugar concreto
  • Insertos de corte que muestren objetos, entornos o acontecimientos mencionados en los diálogos
  • Secuencias abstractas o simbólicas en las que el realismo físico potencia el impacto emocional
  • Material de prueba de concepto para presentar proyectos a inversores o colaboradores

Actor de teatro en un monólogo narrativo

Las posibilidades narrativas que se abren

El enfoque útil no es "la IA reemplaza al cine", sino "la IA amplía lo que es posible con un presupuesto determinado". Un cortometraje con un presupuesto de producción de 5000 $ no podía incluir antes una escena rodada desde un helicóptero, una secuencia de multitudes con cien figurantes o una ambientación histórica que requiera una escenografía de época exacta. Con una IA de video suficientemente capaz, algunas de esas secuencias se vuelven accesibles.

La principal limitación que sigue en pie es la coherencia de los personajes entre cortes. Si tu película requiere que la misma persona aparezca en varios planos separados generados por IA, los modelos actuales, incluido Sora 2.5, no mantendrán de forma fiable la misma geometría facial ni las mismas características físicas. Aquí es donde Kling Avatar v2 y P Video cubren un nicho concreto, usando imágenes de referencia para anclar la apariencia del personaje entre generaciones.

El video comercial y de producto, reinventado

Del concepto al resultado en minutos

En las aplicaciones comerciales, el cálculo es distinto al del cine narrativo. El video comercial suele ser corto (de 15 a 60 segundos), se centra en los planos más que en los personajes y pone el acento en la calidad visual y en la presentación del producto, más que en la continuidad de la historia.

Aquí es donde las mejoras de física de Sora 2.5 se traducen más directamente en beneficios para los profesionales. Un video de producto para una marca de cosmética necesita que el agua se vea real. Un clip publicitario de comida necesita que el vapor, la salsa y la textura se comporten de forma convincente. Un video de moda necesita que la tela se mueva con elegancia al viento.

Video comercial de arte latte en una cafetería

El flujo de trabajo para un briefing de video comercial tiene hoy este aspecto en muchos equipos de producción:

  1. Concepto y storyboard: usa un modelo de lenguaje (LLM) como GPT 5 o Claude Sonnet 5 para crear prototipos rápidos de conceptos a partir de un briefing
  2. Referencia visual: genera fotogramas fijos para alinear las expectativas del cliente antes de comprometerte con la generación de video
  3. Generación de video: produce clips con el modelo de texto a video más adecuado para el tipo de contenido
  4. Posproducción: corrige el color, añade música con licencia y compón las tomas de producto necesarias

Para muchas aplicaciones comerciales de formato corto, este flujo comprime días de preproducción en horas, y días de rodaje en minutos de tiempo de generación.

💡 El listón de calidad que importa: La pregunta no es si el video con IA se ve tan bien como una cámara RED en condiciones controladas. Es si se ve lo bastante bien para el canal de salida concreto: redes sociales, campañas de correo electrónico, presentaciones o propuestas a clientes. En muchos de esos contextos, la calidad de los modelos actuales ya supera ese listón.

La arquitectura técnica detrás del movimiento

Por qué los modelos de difusión tratan el tiempo de otra manera

Los modelos de difusión de video se enfrentan a un reto que los modelos de difusión de imagen no tienen: deben ser coherentes en tres dimensiones espaciales y en una temporal al mismo tiempo. Los primeros enfoques resolvían esto entrenando los fotogramas por separado, y por eso los artefactos temporales eran tan frecuentes.

La innovación arquitectónica que emplean los modelos de la clase Sora es un mecanismo de atención espacio-temporal conjunta. En lugar de prestar atención solo a los vecinos espaciales (píxeles cercanos entre sí en un mismo fotograma), el modelo presta atención a los vecinos espaciotemporales (voxels cercanos entre sí tanto en el espacio como en el tiempo). Esto hace que sea estructuralmente más difícil que el modelo produzca incoherencias temporales, porque los mismos pesos de atención que garantizan la coherencia espacial local también garantizan la coherencia temporal local.

Flujo de trabajo de edición de video con doble monitor

La escala como prior de física

Dentro de Sora 2.5 no hay ningún motor de física explícito. El modelo no ejecuta ecuaciones de simulación de fluidos ni resuelve las de Navier-Stokes para el movimiento del agua. Lo que tiene en su lugar es un modelo estadístico masivo de cómo se ven los fenómenos físicos reales en video, construido a partir del entrenamiento con un corpus enorme de imágenes del mundo real.

Este enfoque funciona mejor de lo esperado, porque la física del mundo real está muy regulada: el agua se comporta igual un martes que un sábado. Un modelo con suficientes datos de entrenamiento aprenderá la distribución del movimiento físicamente válido del agua tan bien que, al generar muestras de esa distribución, obtiene resultados que parecen físicamente exactos.

La consecuencia es que la escala del modelo se traduce directamente en precisión física. Los modelos más grandes entrenados con más datos tendrán priors de física más precisos, que es exactamente la trayectoria que ha seguido Sora desde la versión 1 hasta la 2.5.

Crea video con IA en PicassoIA ahora mismo

Todos los modelos que se analizan en este artículo están disponibles desde una única plataforma. PicassoIA aloja Sora 2, Sora 2 Pro, Veo 3.1, Seedance 2.5, Kling v3, Ray 3.2 y más de 80 modelos adicionales de texto a video en un solo lugar, junto con el conjunto completo de modelos de lenguaje (LLM) para afinar los prompts.

La forma más rápida de entender qué hace bien Sora 2.5 con el movimiento es generar clips con el mismo prompt en varios modelos y comparar los resultados directamente. Empieza con un escenario físico sencillo (agua que cae, tela al viento, una persona caminando sobre una superficie con textura), donde la precisión física es fácil de evaluar a simple vista. Las diferencias entre modelos se verán enseguida, y pronto tendrás una idea clara de qué herramienta encaja con cada tipo de proyecto.

Mujer joven fotografiando un jardín en PicassoIA

La precisión del prompt es la habilidad que más rápido se acumula. Los prompts vagos dan resultados promediados. Los prompts detallados que especifican la dirección de la luz, las características del objetivo de la cámara, las propiedades físicas de los materiales y la velocidad del movimiento dan al modelo las restricciones suficientes para producir material que coincida con una visión creativa clara.

Empieza a generar. La distancia entre lo que la IA de video podía hacer hace un año y lo que puede hacer hoy es tan grande que la mayoría de las suposiciones sobre sus limitaciones ya están desfasadas. Los modelos disponibles ahora mismo, incluido Sora 2.5 y sus competidores en PicassoIA, son capaces de producir material que hace apenas 18 meses habría requerido un equipo de rodaje, equipamiento y búsqueda de localizaciones considerables.

Esa distancia sigue reduciéndose. Los creadores que experimentan ahora están construyendo la fluidez con los prompts y la intuición de flujo de trabajo que más importarán a medida que la tecnología siga avanzando.

Compartir este artículo

Elige tu idioma