La diferencia entre un video con IA olvidable y uno que detiene el scroll suele reducirse a unas pocas docenas de palabras. No miles. Ni siquiera cientos. Las palabras de tu prompt determinan el movimiento, el comportamiento de la cámara, el tono atmosférico y el flujo temporal, y la mayoría de la gente simplemente describe una escena sin pensar en nada de eso.
Esto no es una crítica. Es como empieza la mayoría. Escribes lo que ves en tu cabeza, pulsas generar y obtienes algo que parece una fotografía que decidió moverse. El sujeto es correcto, pero el video resulta estático, aleatorio o incorrecto. El problema no es el modelo. Es la instrucción.
A continuación, desglosamos exactamente qué separa un prompt que produce video de IA cinematográfico de uno que produce un bucle confuso de píxeles.
Por qué los prompts cortos fallan en video
La generación de imágenes y la generación de video son tareas fundamentalmente distintas, pero muchos usuarios escriben sus prompts de video igual que sus prompts de imagen. Un prompt de imagen estática describe un estado. Un prompt de video necesita describir un cambio a lo largo del tiempo.
Cuando escribes "una mujer caminando por un bosque", un modelo de video tiene que deducir:
- ¿A qué velocidad camina?
- ¿La cámara sigue, permanece quieta o hace un paneo?
- ¿Qué cambia en el fondo mientras ella se mueve?
- ¿Cambia la iluminación?
- ¿Cómo evoluciona esto a lo largo de 5 segundos?
Un modelo como Seedance 2.0 o Veo 3 hará su mejor suposición sobre todo esto, pero una "mejor suposición" no es lo mismo que tu intención. Los prompts cortos ceden el control al modelo. Los prompts detallados te lo devuelven a ti.
💡 El principio básico: Cada elemento que dejas sin definir en un prompt de video es una decisión que le entregas a la IA. Sé intencional con lo que defines.

Los 5 elementos básicos que todo prompt de video necesita
Estos cinco componentes no son extras opcionales. Son los bloques de construcción de un video que de verdad se comporta como tú quieres.

1. Sujeto y estado inicial
Describe al sujeto con precisión. No solo quién o qué es, sino su posición exacta, su postura y su relación con el entorno en el primer fotograma.
Débil: "Un hombre en una ciudad"
Sólido: "Un hombre de mediana edad con un abrigo gris está de pie en el borde de una intersección urbana mojada por la lluvia, con la cabeza ligeramente inclinada y las manos en los bolsillos"
La versión sólida le da al modelo un fotograma inicial definido. Todo lo demás se construye sobre eso.
2. Directiva de movimiento
Esto es lo que el video añade frente a las imágenes, y es el elemento que más se suele omitir. Tienes que describir qué se mueve, cómo se mueve y a qué ritmo.
Las directivas de movimiento incluyen:
- Movimiento del sujeto ("ella gira lentamente", "la multitud avanza de golpe", "las hojas caen a la deriva")
- Movimiento de cámara ("travelling lento hacia delante", "ligera inclinación hacia arriba", "plano fijo bloqueado")
- Movimiento del entorno ("el vapor sube desde una rejilla", "el tráfico se difumina en el fondo")
Modelos como Kling v2.6 y Wan 2.7 T2V responden bien al lenguaje de movimiento explícito. El movimiento vago produce resultados incoherentes.
3. Secuencia temporal
Los modelos de video con IA generan una duración fija de contenido, normalmente entre 4 y 10 segundos según el modelo. Tu prompt debe describir la evolución de esos segundos, no solo un momento estático.
Piensa en ello como en un mini guion: ¿qué ocurre al principio, en el medio y al final de esos segundos?
Ejemplo: "La cámara abre con un primer plano de una taza de café. Durante los siguientes segundos se aleja poco a poco para revelar una cafetería llena de gente. En el último fotograma, queda enfocado el sujeto, una mujer en una mesa del rincón."
Esto le indica al modelo qué priorizar en cada momento de la generación.
4. Iluminación y atmósfera
La iluminación no es solo visual. En los prompts de video, también transmite el ambiente, la hora del día y la calidad del movimiento. Las sombras se mueven de forma distinta con la luz dura del mediodía que con el cielo nublado y suave. Especifica:
- Hora del día ("hora dorada", "hora azul", "sol de mediodía cenital")
- Dirección de la fuente de luz ("luz que entra desde arriba a la izquierda", "sujeto a contraluz")
- Calidad de la luz ("suave y difusa", "dura y direccional", "haces volumétricos a través de una ventana")
- Elementos atmosféricos ("neblina matinal", "polvo en el aire", "lluvia sobre el cristal")
5. Especificaciones de cámara
Dile al modelo qué tipo de cámara podría capturar teóricamente esta escena. Esto ancla toda la estética.
Términos útiles: distancia focal del objetivo ("35 mm gran angular", "85 mm retrato"), profundidad de campo ("f/1.8 poca profundidad", "f/11 enfoque profundo"), tipo de movimiento ("ligero balanceo a mano alzada", "gimbal suave", "trípode bloqueado") y estilo de película ("Kodak Portra 400", "grano de 35 mm").
Movimientos de cámara que de verdad funcionan
No todas las descripciones de movimiento de cámara son iguales. Algunas se interpretan de forma coherente entre modelos. Otras son ambiguas y producen comportamientos aleatorios.

Estos son los términos de cámara que producen resultados fiables en la mayoría de las plataformas de texto a video:
| Término | Qué hace | Funciona mejor cuando |
|---|
| Travelling lento hacia delante | La cámara avanza físicamente hacia el sujeto | El sujeto está quieto |
| Travelling lento hacia atrás | La cámara retrocede, revelando el entorno | Crear contexto o escala |
| Paneo izquierda/derecha | La cámara gira horizontalmente sobre un eje fijo | Mostrar un espacio amplio |
| Inclinación arriba/abajo | La cámara gira verticalmente sobre un eje fijo | Revelar altura o profundidad |
| Plano de seguimiento | La cámara sigue a un sujeto en movimiento | El sujeto está en movimiento |
| Plano orbital | La cámara da vueltas alrededor de un sujeto | Enfoque en un producto o personaje |
| Plano fijo bloqueado | La cámara no se mueve | Enfatizar el movimiento del sujeto |
💡 Consejo profesional: Combina como máximo un movimiento del sujeto con un movimiento de cámara. Más de dos movimientos simultáneos suelen hacer que los modelos elijan uno e ignoren el resto, o que produzcan un resultado inestable.
Modelos como LTX 2 Pro y Hailuo 02 manejan las instrucciones de movimiento de cámara con especial coherencia. Ambos están disponibles en PicassoIA.
Cómo describir el movimiento a lo largo del tiempo
Esta es la sección en la que más prompts fallan, y corregirla produce la mejora más grande en los resultados de video con IA.
La generación de video con IA no es un render de imágenes estáticas. El modelo genera cada fotograma basándose en la probabilidad de lo que viene después. Tu prompt puede influir en ese flujo temporal si su estructura es cronológica.

Piensa como un director, no como un pintor
Un pintor describe lo que es. Un director describe lo que sucede. Esas dos mentalidades producen prompts completamente distintos.
Mentalidad de pintor: "Un paisaje de montaña con nieve y niebla matinal."
Mentalidad de director: "La niebla matinal se adhiere a un valle de montaña. Durante varios segundos, un haz de luz solar cálido atraviesa la cresta y barre lentamente el fondo del valle de izquierda a derecha, mientras la niebla empieza a disiparse."
La segunda versión le indica al modelo la causalidad y la secuencia temporal, no solo la apariencia.
Usa lenguaje de transición
Las palabras que señalan un cambio a lo largo del tiempo incluyen:
- "A medida que avanza el plano..."
- "Durante los siguientes segundos..."
- "Poco a poco, el..."
- "En el último fotograma..."
- "La cámara revela lentamente..."
Estas frases enseñan al modelo que se trata de un suceso temporal, no de una descripción estática.
Evita el movimiento contradictorio
Un error habitual es describir dos estados incompatibles a la vez. "Una figura corriendo rápido mientras la cámara se desplaza suavemente" suele producir un resultado inestable, porque el movimiento rápido del sujeto y el movimiento lento de la cámara son difíciles de armonizar. Ralentiza al sujeto o ajusta la energía de la cámara al ritmo del sujeto.
Iluminación y atmósfera bien resueltas
La iluminación es donde la mayoría de los prompts se quedan demasiado genéricos. "Luz natural" o "iluminación dramática" le dicen al modelo casi nada.

Lenguaje de la hora del día que funciona
| Frase | Efecto visual |
|---|
| Hora dorada | Tonos ámbar cálidos, sombras horizontales largas, luz suave envolvente |
| Hora azul | Paleta fría y desaturada, resplandor ambiental del cielo, profundidad previa al amanecer |
| Nublado difuso | Sin sombras duras, exposición uniforme, colores apagados |
| Sol de mediodía duro | Alto contraste, sombras cortas, colores saturados |
| Silueta a contraluz | Sujeto oscuro sobre fondo brillante, luz de contorno en forma de halo |
| Luz matinal volumétrica | Haces de luz visibles a través de la atmósfera, calidad brumosa |
Estas frases las entienden todos los modelos principales de texto a video, incluidos Pixverse v5, Wan 2.7 I2V y Sora 2.
Capas atmosféricas
Añade elementos atmosféricos después de tu descripción principal de la luz:
- "con partículas de polvo visibles en los haces de luz"
- "niebla matinal que suaviza el fondo"
- "vibración del aire por el calor que sube desde el pavimento"
- "lluvia visible como trazos sobre un fondo oscuro"
Cada uno de estos añade movimiento al video más allá de tu sujeto principal, llenando el encuadre de vida sin necesidad de una secuencia de acción compleja.
La diferencia entre prompts de imagen y de video
Aquí tienes una comparación directa para que veas la evolución en la práctica.

Prompt de imagen: "Una mujer con un vestido rojo de pie en un campo de girasoles a la hora dorada, objetivo de 85 mm, poca profundidad de campo, Kodak Portra 400."
Prompt de video para la misma escena: "Una mujer con un vestido rojo está de pie de espaldas a la cámara en un amplio campo de girasoles a la hora dorada. A lo largo del plano, levanta lentamente los brazos hacia los lados, con las palmas hacia arriba, mientras una brisa suave empieza a mover las cabezas de girasol a su alrededor. La cámara realiza un travelling orbital lento desde detrás de ella hacia su lado derecho, revelando su perfil en el último fotograma. La luz lateral cálida del sol bajo a la derecha crea un fuerte contraluz de borde sobre su vestido y los girasoles cercanos. Rodado a 85 mm f/1.8, poca profundidad de campo, grano de película Kodak Portra 400."
El prompt de imagen describe un estado. El prompt de video describe un suceso. Cada frase adicional controla el comportamiento temporal, no solo la apariencia.
Errores comunes en los prompts (y cómo corregirlos)
Estos son los patrones que producen de forma fiable resultados de video débiles, con alternativas corregidas.

Error 1: Sin directiva de movimiento
- Mal: "Un pájaro posado en una rama en un bosque."
- Corrección: "Un pequeño pájaro posado en una rama de repente despliega las alas y levanta el vuelo, con la cámara fija mientras se eleva fuera del encuadre sobre un dosel verde desenfocado."
Error 2: Indicaciones de estilo contradictorias
- Mal: "Metraje de dron cinematográfico fotorrealista con estética de anime."
- Corrección: Elige un estilo. Mezclar lenguajes visuales incompatibles divide la salida del modelo y no logra ninguno de los dos estilos.
Error 3: Demasiados sujetos
- Mal: "Tres personas hablando, pasa un perro, un coche toca el claxon y un avión sobrevuela."
- Corrección: Un sujeto principal, como máximo un elemento secundario. "Un hombre sentado en un banco del parque lee un periódico mientras un perro trota al fondo."
Error 4: Sin estado final definido
- Mal: "Un fuego ardiendo en una chimenea." (El modelo simplemente entra en bucle.)
- Corrección: "Las llamas de una chimenea de piedra arden bajas. A lo largo del plano, un leño grande prende poco a poco y el fuego se intensifica, proyectando una luz naranja más fuerte sobre la repisa de piedra."
Error 5: Atmósfera genérica
- Mal: "Iluminación preciosa."
- Corrección: "Luz suave y direccional que entra por una gran ventana arriba a la izquierda, proyectando una sombra marcada sobre el suelo, con una calidez ámbar de tarde."
Consejos por modelo en PicassoIA
Cada modelo responde a estilos de prompt distintos. Esto es lo que conviene saber antes de generar.

El modelo insignia de ByteDance responde muy bien a estructuras de prompt cinematográficas y cronológicas. Su conciencia de audio integrada hace que los prompts atmosféricos que describen lluvia, ruido de multitud o sonido ambiente suelan producir audio sincronizado. Incluye el entorno sonoro con detalle.
Veo 3.1 de Google maneja mejor las escenas complejas con varios elementos que la mayoría de los modelos. Se beneficia de un lenguaje de movimiento de cámara explícito y responde a términos del lenguaje cinematográfico como "plano de establecimiento", "plano de seguimiento" y "plano de reacción". Es muy sólido para secuencias narrativas.
La versión v3 de Kling está optimizada para una salida cinematográfica en 1080p. Usa descripciones de iluminación muy específicas y movimiento preciso del sujeto. Maneja especialmente bien el movimiento lento y deliberado, y le cuesta más con prompts que describen movimientos caóticos y simultáneos.
El modelo 2.7 de Wan maneja texto a video en 1080p con una gran coherencia. Se beneficia de descripciones detalladas del entorno y responde bien a los detalles arquitectónicos y de escenas naturales. Excelente para planos de establecimiento y narración ambiental.
El modelo de Lightricks prioriza la velocidad y la salida en 4K. Usa prompts concisos y muy específicos. Los párrafos largos diluyen la señal. Céntrate en un sujeto, un movimiento, un entorno y una condición de iluminación.
Ray 2 de Luma destaca especialmente con movimientos fluidos y orgánicos. Los prompts que describen fenómenos naturales, como agua, fuego, viento y crecimiento orgánico, tienden a producir resultados sorprendentemente convincentes.
Después de probar con varios modelos, esta estructura de prompt produce resultados fiables:
[Sujeto + posición/estado inicial] + [lo que hace el sujeto durante el plano] + [movimiento de cámara] + [detalles del entorno/fondo] + [especificación de iluminación] + [detalles de cámara/objetivo] + [atmósfera]
Escrita como prompt completo:
"Una joven de pelo oscuro está sentada en un escritorio de madera, con la barbilla apoyada en una mano, mirando por una ventana surcada por la lluvia. A lo largo del plano, exhala lentamente y sus hombros se relajan; después se inclina hacia delante para cerrar la pantalla de su equipo portátil. La cámara mantiene un plano medio fijo desde su lado izquierdo. Detrás de ella, gotas de lluvia resbalan por el cristal de una gran ventana que muestra un paisaje urbano gris y desenfocado. La luz nublada y difusa llena el encuadre de manera uniforme desde la ventana, proyectando sombras suaves sobre la superficie del escritorio. Rodado a 50 mm f/2.4, grano de película Kodak Portra 400, un leve calor de ambiente en la habitación."
Este nivel de detalle se puede lograr para cualquier escena en unos dos o tres minutos. No es complicado. Solo requiere pensar en términos temporales en lugar de estáticos.
Pruébalo ahora mismo en PicassoIA
PicassoIA reúne más de 87 modelos de texto a video en un solo lugar, desde el generador gratuito e ilimitado PicassoIA Video hasta Sora 2 Pro, Gen 4.5, Seedance 2.0 y Kling v2.6.
Empieza con la fórmula de arriba. Elige una escena. Escríbela completa usando los cinco elementos. Genera primero con el modelo gratuito para probar la estructura y luego pasa a tu modelo premium preferido cuando el movimiento y el tiempo te parezcan bien.
El primer resultado no será perfecto. Ese no es el objetivo. El objetivo es entender qué elemento ajustar después. Escribir prompts para video con IA es una habilidad que crece rápido, y el ciclo de retroalimentación en PicassoIA es lo bastante ágil como para iterar varias veces en una sola sesión.
Tu mejor prompt de video está a una revisión de distancia de uno mediocre. Los modelos están esperando.