La mejor estructura de prompt para video con IA que de verdad funciona
Escribir prompts para video con IA no tiene nada que ver con escribirlos para imágenes. Una estructura equivocada desperdicia créditos y produce resultados planos e irregulares. Este artículo desglosa la anatomía exacta del prompt que funciona en todos los principales modelos de texto a video de 2027, con ejemplos reales, consejos de movimiento, ángulos de cámara y los errores más comunes que conviene evitar.
Escribir un buen prompt para video con IA no es lo mismo que escribir uno para imágenes. La diferencia entre ambas disciplinas es enorme, y la mayoría de la gente lo descubre por las malas, después de gastar créditos en clips planos y sin vida que no se parecen en nada a lo que imaginaban. La realidad es que el video con IA responde a la estructura, y una vez que la conoces, tus resultados cambian de forma notable.
Por qué fallan los prompts de video sin estructura
Los prompts de imagen pueden permitirse ser vagos. Basta con unos cuantos adjetivos y un sujeto, y el modelo rellena los huecos con algo visualmente coherente. Los modelos de video no pueden hacer eso con limpieza. Interpretan al mismo tiempo el movimiento, la duración, la continuidad de la iluminación y la física de la escena. Un prompt vago le da al modelo demasiada libertad creativa, y el resultado casi siempre es genérico.
Los fallos más habituales:
Deriva del sujeto: el personaje cambia de aspecto a mitad del clip
Planos estáticos: nada se mueve de verdad en el video
Ritmo incorrecto: la acción ocurre demasiado rápido o demasiado despacio
Iluminación irregular: las sombras saltan o la gradación de color cambia a mitad del clip
Todos ellos tienen la misma causa de fondo: el prompt no comunicaba lo suficiente.
💡 Regla rápida: si tu prompt serviría como buen pie de foto para una imagen, es demasiado corto para el video con IA. El video necesita movimiento, tiempo y lenguaje de cámara.
El marco de prompt de 7 partes
Hay una estructura que supera de forma constante a los prompts improvisados en modelos como Kling v2.6, Veo 3, Wan 2.7 T2V y Sora 2. Tiene siete partes, y cada una cumple una función concreta.
Parte 1: Sujeto y acción
Empieza por quién o qué aparece en el encuadre y qué está haciendo. Sé específico. No escribas "una mujer caminando". Escribe "una mujer de unos 30 y pico años, con el pelo oscuro y un abrigo de lino beige, caminando despacio entre hojas de otoño".
La acción debe ser continua y sencilla. Los modelos de video con IA manejan mejor el movimiento en bucle o el que se desarrolla de forma progresiva que las secuencias complejas de varios pasos. Limítate a una acción principal clara por clip.
Parte 2: Escena y entorno
Describe dónde ocurre la acción con suficiente detalle físico para que el modelo pueda renderizar elementos de fondo coherentes. Incluye:
Tipo de lugar: calle urbana, sendero de bosque, estudio interior, playa
Hora del día: hora dorada, sol de mediodía, tarde nublada, hora azul
Clima o atmósfera: niebla ligera, cielo despejado, lluvia suave, viento en los árboles
Ejemplo: "en una calle empedrada de un casco antiguo europeo, al final de la tarde, con una luz cálida y dorada que proyecta sombras largas sobre el pavimento de piedra."
Parte 3: Ángulo de cámara y tipo de plano
Es la parte que más principiantes se saltan por completo, y es donde más calidad se pierde. Especificar el tipo de plano obliga al modelo a decidirse por un encuadre en lugar de recurrir a un plano medio estático por defecto.
Tipo de plano
Qué hace
Plano general
Establece el lugar y muestra el entorno completo
Plano medio
Muestra al sujeto desde la cintura hacia arriba, ideal para diálogos
Primer plano
Capta la emoción, la textura y los detalles finos
Contrapicado
Hace que el sujeto parezca poderoso y dominante
Vista cenital
Perspectiva dramática desde arriba
Plano de seguimiento
La cámara sigue el movimiento del sujeto
Dolly zoom
Efecto de zoom cinematográfico clásico
💡 Consejo profesional: Modelos como Kling v3 Video y Seedance 1.5 Pro responden muy bien al lenguaje de movimiento de cámara explícito. Usa "avance lento de dolly hacia el sujeto" o "cámara orbitando desde la izquierda" para lograr un movimiento cinematográfico.
Parte 4: Especificación de la iluminación
La iluminación define el ambiente de un video más rápido que cualquier otra cosa. Los modelos de IA responden a los descriptores de luz y los aplicarán con más regularidad si aparecen al principio del prompt.
Estos son los términos de iluminación más fiables para prompts de texto a video:
Luz de hora dorada: cálida, rayos de sol horizontales, sombras largas
Luz difusa de cielo cubierto: suave, sin sombras, tonos uniformes
Contraluz de borde: definición del borde por detrás que separa al sujeto del fondo
Luz volumétrica: haces de luz a través de la atmósfera (niebla, polvo)
Iluminación práctica: fuentes de luz visibles en el encuadre (lámparas, velas, pantallas)
Evita términos vagos como "buena iluminación" o "brillante". No comunican nada al modelo.
Parte 5: Movimiento y ritmo
Este es el elemento que separa un clip cinematográfico de una presentación de diapositivas. Los descriptores de movimiento le indican al modelo cómo deben moverse las cosas en la escena a lo largo del tiempo, y con qué rapidez.
Lento y deliberado: "el pelo se mueve suavemente con la brisa, las hojas caen a la deriva"
Dinámico y urgente: "la cámara avanza rápido, el sujeto gira bruscamente"
Ambiental y sutil: "el vapor sube de la taza de café, las luces bokeh palpitan suavemente"
Modelos como LTX 2 Pro y Pixverse v5 manejan bien el ritmo del movimiento cuando lo describes de forma explícita. Si quieres cámara lenta, dilo. Si quieres tiempo real, aclara también eso.
Parte 6: Estilo y estética
Los descriptores de estilo definen el lenguaje visual del clip. Para resultados fotorrealistas, usa lenguaje de fotografía cinematográfica:
"grano de película de 35 mm, gradación de color Kodak Portra 400"
"estilo de fotografía RAW, paleta de color natural"
"lente anamórfica cinematográfica, un ligero destello de lente"
"estilo documental con cámara en mano, ligera vibración de cámara"
Para una salida más estilizada, puedes especificar:
"gradación de color vintage de los años 1970, tonos cálidos y desvaídos"
"blanco y negro de alto contraste, sombras nítidas"
"acabado mate suave, paleta de colores pastel"
💡 Importante: Evita los términos de estilo que sugieran ilustración, animación o arte digital. Modelos como Hailuo 02 y Veo 3.1 interpretarán correctamente los descriptores fotográficos para resultados realistas.
Parte 7: Restricciones negativas
Es opcional, pero muy útil. Al final de tu prompt, añade lo que no quieres. Esto evita que el modelo recurra a los clichés visuales habituales.
Ejemplos de restricciones negativas:
"sin textos superpuestos"
"sin cortes bruscos"
"evita la vibración de cámara"
"sin rasgos caricaturescos"
"sin marcas de agua"
Juntándolo todo
Esto es lo que parece un prompt estructurado completo frente a uno sin estructura:
Prompt débil:
"Una mujer caminando por una ciudad de noche"
Prompt estructurado:
"Una mujer de unos 20 y pocos años, con pelo castaño rojizo y un abrigo trench color camello, camina despacio por una acera urbana mojada por la lluvia, de noche, con letreros de neón reflejados que brillan en los charcos, plano medio de seguimiento desde un lateral, la cámara avanza al mismo ritmo que el sujeto, luz práctica cálida procedente de los escaparates, vapor que sube de una rejilla cerca de sus pies, aspecto cinematográfico de película de 35 mm, poca profundidad de campo, sin vibración de cámara, sin texto"
El segundo prompt tiene 80 palabras. El primero, 10. Esa diferencia se nota directamente en la calidad del resultado.
Longitud del prompt: ¿cuándo es demasiado largo?
Una preocupación habitual es que los prompts largos confundan al modelo. En la práctica, suele pasar lo contrario. La mayoría de los modelos de video con IA se han entrenado con descripciones detalladas, así que las descripciones más ricas les dan más con lo que trabajar.
Longitudes de prompt recomendadas según el tipo de modelo:
El punto ideal para la mayoría de los modelos está entre 70 y 120 palabras. Por debajo de 40 palabras, te quedas corto en la especificación. Por encima de 200, puede que el modelo empiece a ignorar algunas restricciones.
3 errores que arruinan la calidad del video
Error 1: Describir el estado final, no el movimiento
La mayoría describe cómo se ve la escena en lugar de lo que está ocurriendo. El video con IA necesita verbos de acción y lenguaje temporal.
Mal: "una puesta de sol sobre el océano"
Bien: "el sol desciende despacio hacia el horizonte, extendiendo un resplandor naranja cada vez mayor sobre las aguas tranquilas del océano, mientras las olas suaves avanzan hacia la orilla"
Error 2: Mezclar estilos contradictorios
Pedir "cinematográfico y animado, fantasía y documental" en el mismo prompt empuja al modelo en demasiadas direcciones. Elige un registro visual y mantenlo de principio a fin.
Error 3: No incluir información de cámara
Si omites el tipo de plano y el movimiento de cámara, el modelo tiene que improvisar. Y la improvisación casi siempre cae en un plano medio estático. Especifica siempre el comportamiento de la cámara.
💡 Arreglo rápido: añade un término de cámara y un descriptor de movimiento a cada prompt, incluso a los mínimos. "Primer plano, zoom lento hacia atrás" es mejor que nada.
Cómo funciona la coherencia temporal en los prompts
La coherencia temporal significa que el sujeto, la iluminación y la escena se mantienen estables durante toda la duración del clip. Algunos modelos lo manejan mejor que otros, pero todos se benefician de prompts que la refuercen.
Tácticas para mejorar la coherencia:
Describe al sujeto una vez, por completo. No dejes que el modelo adivine los detalles.
Ancla la iluminación a una fuente. "luz de ventana desde la izquierda" es más estable que "luz natural".
Evita los cambios bruscos. Si el prompt implica varios eventos seguidos, el modelo puede intentar comprimirlos y fallar.
Usa indicaciones de duración. Frases como "durante todo el clip" o "de forma continua" indican que un estado debe mantenerse.
Cómo escribir prompts para distintos estilos de video
No todos los prompts de video tienen el mismo propósito. La estructura se adapta según lo que estés creando.
Para cortometrajes cinematográficos
Céntrate en: descripción ambiental rica, iluminación que defina el ambiente, lenguaje de lente específico, movimiento lento y deliberado.
Ejemplo: "primer plano del rostro de una mujer, ojos cerrados, luz suave de la mañana filtrándose por cortinas blancas, la sombra de las ramas de un árbol moviéndose sobre su piel, lente de retrato de 85 mm, poca profundidad de campo, calidez de Kodak Portra, quietud absoluta rota solo por su respiración"
Para clips de redes sociales
Céntrate en: un gancho visual inmediato en el primer segundo, movimiento de cámara dinámico, ritmo de mucha energía.
Ejemplo: "plano de seguimiento rápido de una mujer que corre descalza por una playa de arena blanca al amanecer, cámara a la altura de la rodilla, rocío de arena y espuma del mar captando la luz, contraluz dorado y cálido, ritmo de mucha energía, poca profundidad de campo centrada en sus pies"
Para video de producto o de marca
Céntrate en: fondos limpios, encuadre de producto deliberado, iluminación controlada.
Ejemplo: "primer plano de un frasco de perfume de cristal sobre una superficie de mármol blanco, luz de softbox de estudio desde arriba y a la izquierda, giro lento del frasco que revela un diseño intrincado, gotas de agua en el cristal que captan la luz, objetivo macro de 100 mm, estilo de fotografía de producto fotorrealista"
Cómo usar Wan 2.7 T2V en PicassoIA
Wan 2.7 T2V es uno de los modelos de texto a video más potentes disponibles, con salida en 1080p y una coherencia temporal sólida. Así se usa de forma eficaz:
Paso 2: Escribe tu prompt con el marco de 7 partes de arriba. En Wan 2.7, el punto ideal está entre 70 y 120 palabras, con descriptores claros de sujeto, movimiento e iluminación.
Paso 3: Configura la duración. Wan 2.7 admite clips de hasta unos 10 segundos. Para prompts complejos, los clips más cortos de 4 a 6 segundos producen resultados más constantes.
Paso 4: Haz primero una generación de prueba con una versión simplificada de tu prompt. Así compruebas que los elementos básicos (sujeto, movimiento, entorno) se renderizan bien antes de lanzar una generación más larga y detallada.
Paso 5: Si el resultado se aleja de lo que buscas, aísla qué parte del prompt se está ignorando y muévela más arriba en el texto. Los modelos tienden a dar más peso al principio de los prompts.
💡 Consejo para Wan 2.7: Este modelo maneja especialmente bien los descriptores de iluminación. Un lenguaje de iluminación detallado que cubra dirección, temperatura de color y suavidad produce resultados notablemente mejores que la mayoría de los demás modelos.
La plantilla de prompt que puedes copiar
Aquí tienes una plantilla para rellenar que funciona con la mayoría de los modelos de video con IA:
[Subject: age, appearance, clothing, expression] [Action verb + motion detail], [Environment: location, time of day, weather], [Shot type] [Camera movement], [Lighting: source, direction, quality, color], [Motion detail: ambient elements, pacing], [Style: film look, depth of field], [Negative constraints]
Ejemplo rellenado:
A woman in her mid-30s with silver-streaked hair, wearing a gray cashmere turtleneck, slowly stirs a cup of coffee while gazing out of a floor-to-ceiling window, in a minimalist apartment on a gray rainy morning, medium shot with very slight handheld drift, soft overcast window light from the right casting subtle shadows, steam rising gently from the cup, rain drops running down the glass behind her, cinematic 50mm film look, shallow depth of field on her hands, no music overlays, no text
Ese prompt tiene 94 palabras y cubre las siete partes. Úsalo como punto de partida.
Empieza a crear ahora
La única forma de mejorar al escribir prompts para video con IA es la repetición. Toma la plantilla de arriba, rellénala con tu sujeto y tu escena, y pruébala en cualquiera de los modelos disponibles, incluidos Kling v2.6, Veo 3.1, Wan 2.7 T2V, LTX 2 Pro o Seedance 1.5 Pro.
Cada modelo tiene su propia personalidad, y dedicar unas cuantas generaciones a cada uno te enseña más que cualquier tutorial escrito. Lanza un prompt. Ajusta un elemento. Vuelve a lanzarlo. Con este enfoque iterativo, los avances se acumulan rápido, y en pocas sesiones tendrás un estilo de prompt que produce de forma fiable el resultado que buscas.
PicassoIA te da acceso a más de 100 modelos de texto a video en un solo lugar. Esa variedad te permite probar el mismo prompt en varios modelos en cuestión de minutos y ver exactamente cómo interpreta cada uno de forma distinta tus instrucciones. Es el ciclo de retroalimentación más rápido que existe para afinar tus habilidades al escribir prompts para video con IA.