Escribes una frase. Unos segundos después aparece un clip de video que coincide casi exactamente con tus palabras, sin cámara, sin actores ni estudio de edición. Solo un prompt y un modelo en marcha. Si lo has visto y todavía no te lo acabas de creer, no eres el único. La mecánica de la IA de texto a video es realmente sorprendente, y la mayoría de las explicaciones la hacen más difícil de entender, no más fácil. Así que aquí tienes la versión real: clara, precisa y sin exageraciones.

Lo que el modelo recibe realmente
La IA de texto a video empieza con palabras, pero lo que el modelo procesa no se parece en nada a la frase que escribiste. En el momento en que pulsas generar, tu prompt se convierte en una secuencia de tokens, una representación numérica de tu texto en la que cada palabra, o a veces partes de palabras, corresponde a un número dentro de una gigantesca tabla de consulta creada durante el entrenamiento.
Esa secuencia de tokens pasa después por un codificador de texto, una red neuronal entrenada específicamente para extraer el significado semántico del lenguaje. La salida del codificador se llama vector de embedding: una larga lista de números de punto flotante que representa el significado de tu prompt en un espacio matemático de alta dimensión. Piensa en ello menos como una frase y más como una coordenada en un vasto mapa conceptual. "Un perro corriendo a toda velocidad por la arena mojada" está cerca de "un cachorro corriendo por una playa" en ese espacio, y muy lejos de "una fábrica de acero al atardecer".
Tu prompt no es un guion
Esta distinción importa porque el modelo nunca lee tu prompt como lo lees tú. No analiza la estructura narrativa, la gramática ni la secuencia. Trabaja únicamente a partir de ese embedding comprimido, y lo usa para dirigir un proceso de generación que empieza en un punto completamente distinto de tus palabras. Por eso una redacción muy específica puede cambiar mucho el resultado, aunque el significado en superficie parezca idéntico. El espacio de embeddings es sensible al vocabulario, a la especificidad y a las relaciones entre conceptos.
Tokens, pesos y atención
La mayoría de los modelos actuales usan una variante de la arquitectura transformer para construir estos embeddings. Dentro del transformer, un mecanismo de atención permite que cada token observe a todos los demás y les asigne pesos de relevancia. "Atardecer" tiene más peso semántico cuando aparece junto a "océano" que junto a "almacén". Ese contexto ponderado da forma al embedding final que se pasa al generador de video. Por eso los prompts que incluyen descripciones relacionales, "un gato durmiendo encima de un sofá de cuero gastado junto a una ventana", tienden a producir resultados con mayor precisión espacial que las listas planas de palabras clave.

Dentro del proceso de difusión
La generación de video en sí misma, en la mayoría de los modelos más avanzados, incluidos Veo 3, Wan 2.6 T2V y Kling v3 Video, se basa en un proceso llamado difusión. Una vez que entiendes la difusión, todo lo demás en la IA de texto a video encaja en su sitio.
Empezar desde ruido puro
El modelo no parte de un lienzo en blanco ni de un boceto aproximado de tu escena. Parte de un tensor de ruido aleatorio puro, valores desordenados que esencialmente no significan nada, en una representación comprimida del espacio de video llamada espacio latente. El espacio latente es una codificación de menor resolución y más abstracta de los datos reales del video. Trabajar en el espacio latente en lugar de en píxeles en bruto es lo que hace que la difusión sea computacionalmente viable. Manipular video 1080p en bruto fotograma a fotograma en el espacio de píxeles requeriría recursos de cómputo muy por encima del hardware actual.
El ruido es intencionado. Los modelos de difusión se entrenan haciendo lo contrario: se toman clips de video reales, se les añade ruido progresivamente hasta que se convierten en una estática irreconocible, y luego se entrena una red neuronal para predecir y revertir esa adición de ruido paso a paso.
Eliminación del ruido paso a paso
A partir de ese ruido inicial, el modelo ejecuta una serie de pasos de eliminación de ruido, normalmente entre 20 y 50 iteraciones según el modelo y la configuración de calidad. En cada paso, una red neuronal llamada denoiser, normalmente una U-Net o una arquitectura más reciente de transformer de difusión, recibe tres entradas: el latente ruidoso actual, el embedding de texto de tu prompt y un valor de paso de tiempo que indica en qué punto del proceso de eliminación de ruido se encuentra. Predice qué ruido se añadió en ese paso. El modelo resta ese ruido predicho, dejando un resultado algo más coherente.
Repite ese proceso entre 30 y 50 veces y el ruido aleatorio se va transformando gradualmente en un clip de video que refleja tu prompt.
Tu embedding de texto está presente en cada uno de los pasos de eliminación de ruido, no solo en el primero. Guía el proceso de forma continua mediante una técnica llamada guía sin clasificador (classifier-free guidance). El denoiser ejecuta dos predicciones simultáneamente en cada paso: una condicionada por el embedding de tu prompt y otra sin él. La diferencia entre esas dos predicciones se amplifica y se suma a la salida. Si subes el guidance scale (CFG), tu prompt tiene más influencia sobre el resultado. Si lo subes demasiado, la salida se sobresatura y aparecen artefactos.

Cómo los fotogramas se convierten en video
Generar una sola imagen coherente es un problema. Generar decenas o cientos de fotogramas que fluyan de forma coherente a lo largo del tiempo es un problema fundamentalmente más difícil, y ahí es donde la IA de texto a video se separa de forma notable de la IA de texto a imagen.
El problema de la coherencia temporal
Una imagen fija puede evaluarse de forma aislada. Un video no. Si un modelo de IA genera cada fotograma por separado, aparecen parpadeos visuales, objetos que se deforman y personajes cuyos rostros cambian sutilmente de un fotograma a otro. Este problema, llamado inconsistencia temporal, fue la limitación definitoria de los primeros modelos de texto a video. Si miras los resultados tempranos de los modelos lanzados en 2023, lo verás de inmediato: el sujeto es el correcto, pero todo tiembla y se desplaza como si se hubiera filmado a través de una distorsión por calor.
El reto central es la preservación de la identidad a lo largo del tiempo. La taza de café sobre la mesa tiene que ser la misma taza en el fotograma 12 que en el 60, con el mismo ángulo, el mismo color y la misma textura. Cualquier desviación en la trayectoria de eliminación de ruido que afecte a un fotograma pero no a los contiguos aparece como una discontinuidad visible en el clip final.
Cómo lo resuelven los modelos
Las arquitecturas modernas abordan la coherencia temporal mediante varios enfoques que a menudo funcionan juntos:
- Capas de atención 3D: En lugar de atender solo a posiciones espaciales dentro de un único fotograma, estas capas permiten que cada posición de cada fotograma atienda a todas las demás posiciones de todo el clip. El fotograma 5 informa directamente al 6 y al 7.
- Convoluciones temporales: Capas convolucionales que operan a lo largo de la dimensión temporal en lugar de solo en altura y anchura, suavizando el movimiento entre fotogramas contiguos.
- Codificación con VAE de video: El autoencoder variacional que comprime el video en el espacio latente se entrena con clips de video en lugar de con imágenes individuales, así que aprende a codificar el movimiento como una variable continua, no como instantáneas independientes.
- Entrenamiento por flow matching: Algunos modelos más recientes, como LTX 2.3 Pro y Seedance 2.0, usan objetivos de flow matching en lugar de los calendarios de ruido de la difusión tradicional, lo que proporciona una interpolación más suave a lo largo de la trayectoria de generación y una calidad de movimiento notablemente mejor.

Texto a video frente a texto a imagen
A nivel de arquitectura, los modelos de texto a imagen y de texto a video comparten ideas fundamentales, pero difieren en alcance y complejidad de formas que explican por qué la generación de video es mucho más difícil y exige más recursos.
| Dimensión | Texto a imagen | Texto a video |
|---|
| Forma de la salida | Altura x Anchura | Altura x Anchura x Fotogramas |
| Alcance de la atención | Solo espacial | Espacial + temporal |
| Espacio latente | Latente de imagen 2D | Latente de video 3D |
| Datos de entrenamiento | Pares imagen-descripción | Clips de video con descripciones |
| Cómputo por generación | Moderado | Alto a muy alto |
| Modo de fallo principal | Errores de anatomía y composición | Inconsistencia temporal |
| Sensibilidad al prompt | Alta | Muy alta |
Qué cambia a nivel de arquitectura
El mayor cambio arquitectónico es el paso de la atención espacial 2D a la atención espaciotemporal 3D completa o, como mínimo, a la atención espacio-temporal factorizada. En la atención 3D completa, cada posición de cada fotograma puede atender a cada posición de todos los demás fotogramas a la vez. Esto da una coherencia temporal excelente, pero escala mal con el número de fotogramas y la resolución.
Los enfoques factorizados alternan pasadas de atención solo espacial y solo temporal como un compromiso práctico. Esto hace que la generación sea viable en duraciones más largas sin un crecimiento exponencial de la memoria. La mayoría de los modelos de producción usan atención factorizada con capas de atención completa selectivas en ciertas profundidades de la red.
Se cree que modelos como Sora 2 Pro y Veo 3.1 usan arquitecturas de transformer espaciotemporal completas, entrenadas con enormes conjuntos de datos de video cuidadosamente seleccionados, y por eso sus resultados muestran una coherencia temporal y una física del movimiento muy superiores a las de los modelos de generaciones anteriores. La diferencia no es solo de cómputo. Es el resultado de las decisiones de arquitectura y de la calidad de los datos de entrenamiento trabajando juntas.

Los modelos que lo hacen bien hoy
Hoy existen más de 80 modelos creíbles de texto a video, cada uno con sus propias contrapartidas entre velocidad, calidad, resolución, precisión de movimiento y costo. Aquí tienes un desglose práctico.
Opciones de gama alta
Estos modelos priorizan la calidad y el realismo de la salida, a menudo con más tiempo de generación o un costo mayor por minuto:
- Kling v3 Video: Calidad de movimiento cinematográfica con un seguimiento sólido del sujeto y control de la composición
- Veo 3: Generación de audio nativo junto con el video a partir de un único prompt de texto, un salto importante en capacidades
- Veo 3.1: Salidas en 1080p con una física del movimiento mejorada respecto a la versión anterior
- Sora 2 Pro: Salidas de alta resolución con una gran coherencia narrativa en formatos largos
- Hailuo 2.3: 1080p con un render de personajes coherente a lo largo de la duración del clip
- Seedance 2.0: Texto a video con audio sincronizado nativo y una gran estabilidad temporal
- Kling v2.6: Salida cinematográfica fiable con funciones de control de movimiento
Opciones rápidas y gratuitas
Estos modelos sacrifican algo de calidad a cambio de velocidad, lo que los hace ideales para iterar prompts y hacer pruebas rápidas:
- Wan 2.5 T2V Fast: Generación rápida con calidad sólida en 720p
- Ray Flash 2 720p: Generación de video gratuita en 720p con buena adherencia al prompt
- LTX Video: Velocidades de generación casi en tiempo real gracias al flow-matching
- Pixverse v5: 1080p rápido y con un manejo del estilo coherente
- CogVideoX 5B: Modelo de pesos abiertos con gran precisión de prompt a video
💡 Consejo: Usa un modelo rápido para iterar tu prompt hasta que la escena y el movimiento te parezcan bien. Después ejecuta la versión final con un modelo de gama alta. Ahorrarás tiempo y costo de forma notable.

Por qué algunos videos de IA se ven mal
Incluso con los mejores modelos disponibles, los resultados pueden decepcionar. Las causas suelen ser concretas y solucionables una vez que sabes qué buscar.
Modos de fallo habituales
Parpadeo temporal: Cada fotograma por separado parece aceptable, pero los fotogramas contiguos no encajan con suavidad. Suele pasar cuando la arquitectura usa poca atención temporal o cuando los pasos de inferencia están demasiado bajos. Cambiar a un modelo con un entrenamiento temporal más sólido, como Kling v3 Omni Video, suele resolverlo.
Rostros deformados y anatomía que se disuelve: La anatomía humana es extraordinariamente difícil. El modelo aprendió de datos de video en los que los rostros y los cuerpos se mueven de formas complejas y muy variables. Cuando el proceso de eliminación de ruido no tiene claro hacia cuál de dos posiciones plausibles ir, promedia ambas, y eso crea el efecto de rostro derretido. Los prompts más específicos sobre la pose y el ángulo reducen la incertidumbre y mejoran la estabilidad del resultado.
Movimiento flotante o físicamente incorrecto: La física no se modela de forma explícita en los sistemas de difusión. El movimiento se aproxima a partir de patrones estadísticos de los datos de video de entrenamiento. Todo lo que requiera un comportamiento físico preciso, la dinámica de la tela, un líquido que se vierte o colisiones de cuerpos rígidos, tiende a verse mal. Para corregirlo, describe el movimiento de forma explícita en el prompt en lugar de dejar que el modelo lo deduzca.
Sangrado de prompt: Dos conceptos distintos dentro de un prompt pueden fundirse espacialmente de formas que no pretendías. "Un bolso rojo sobre una mesa blanca" podría producir una mesa rosa porque los descriptores de color se contaminan entre sí. Separa tus descriptores espaciales de forma deliberada y sé específico sobre qué propiedad pertenece a cada objeto.
Deriva de la escena en clips más largos: En clips de más de 6 a 8 segundos, muchos modelos pierden el hilo de la escena inicial y se desvían poco a poco hacia una composición diferente. Es una limitación conocida del tamaño actual de los espacios latentes de video. Mantener los prompts centrados en un único movimiento continuo dentro de un solo lugar ayuda mucho.
💡 Consejo: Los prompts cortos, específicos y de una sola escena casi siempre superan a las descripciones largas de varios eventos. Una acción clara es mejor que una secuencia.

Cómo usar Wan 2.6 T2V en PicassoIA
Wan 2.6 T2V es uno de los modelos de texto a video de arquitectura abierta más sólidos disponibles ahora mismo, con una coherencia temporal especialmente buena y una gran adherencia al prompt. Así se ejecuta directamente en PicassoIA.
Paso 1: Abre la página del modelo
Entra en la página de Wan 2.6 T2V en PicassoIA. La interfaz carga de inmediato los parámetros del modelo y un campo para el prompt.
Paso 2: Escribe un prompt estructurado
Construye tu prompt por capas, no como un flujo de conciencia:
- Sujeto primero: ¿Quién o qué aparece en el encuadre y cómo es? ("Una mujer con un abrigo color crema")
- Acción en segundo lugar: ¿Qué ocurre y cómo? ("camina despacio por una calle adoquinada y desierta")
- Comportamiento de la cámara: ¿Dónde está la cámara y cómo se mueve? ("la cámara sigue desde atrás a la altura de la cintura, con un leve avance")
- Entorno: ¿Dónde transcurre y cómo se ve? ("temprano por la mañana, niebla densa, luz gris suave y difusa")
- Atmósfera: Cualquier descriptor final de calidad ("fotorrealista, cinematográfico, sin música")
Paso 3: Configura los parámetros
| Parámetro | Valor inicial recomendado |
|---|
| Duración | 5 segundos |
| Resolución | 720p |
| Guidance Scale | 7,0 a 7,5 |
| Pasos de inferencia | 30 |
| Relación de aspecto | 16:9 |
Empieza con valores conservadores. Siempre puedes aumentar los pasos y la resolución cuando tu prompt funcione. Los clips más largos necesitan más pasos para mantener la coherencia temporal.
Paso 4: Revisa el resultado
Después de generar, evalúa tu salida en tres aspectos:
- Adherencia al prompt: ¿El contenido coincide con lo que describiste?
- Coherencia temporal: ¿El sujeto mantiene su identidad a lo largo del clip?
- Realismo del movimiento: ¿La física parece verosímil?
Paso 5: Itera con eficiencia
Si algo no encaja, cambia una sola cosa a la vez en tu prompt. Si necesitas un resultado más rápido mientras pruebas, Wan 2.5 T2V Fast usa una arquitectura similar a una velocidad de generación mayor, así que lo que aprendas con tus prompts se traslada directamente.
💡 Consejo: Para obtener los mejores resultados temporales con Wan 2.6 T2V, centra cada prompt en un único movimiento continuo dentro de una sola ubicación. Los cambios de escena y las secuencias con varios eventos ponen a prueba los límites de coherencia del modelo.

Ahora te toca a ti
Entender la mecánica es una cosa. Generar algo de verdad es otra. La distancia entre un resultado mediocre y uno realmente bueno se reduce rápido cuando sabes lo que hace el modelo en cada paso. Ya no adivinas. Sabes que parte de ruido, que se dirige hacia tu embedding en cada paso, que presta atención a lo largo del tiempo para mantener la coherencia y que decodifica de nuevo en píxeles mediante un decodificador aprendido.
Ese conocimiento cambia la forma de escribir prompts. Descripciones más cortas. Instrucciones de movimiento explícitas. Una sola escena coherente por clip. Especificidad espacial para cada propiedad. Expectativas realistas sobre la física que el modelo puede reproducir de forma verosímil.
PicassoIA tiene más de 80 modelos de texto a video listos para usar ahora mismo, desde puntos de entrada gratuitos como Ray Flash 2 540p y Pixverse v5.6 hasta opciones de calidad cinematográfica como Kling v3 Omni Video y Veo 3.1. No hay mejor forma de entender cómo funcionan estos modelos que probar unos cuantos prompts tú mismo, comparar los resultados lado a lado y notar exactamente dónde y por qué difieren.
Elige un modelo. Escribe una frase clara y específica. Mira lo que devuelve. Luego cambia una cosa y vuelve a ejecutarlo.
