Una lista de verificación de prompts para video con IA que sí funciona

Escribir prompts para video con IA que den resultados cinematográficos y coherentes exige más que describir lo que quieres. Esta lista de verificación desglosa cada elemento, desde la composición de la escena y el movimiento de cámara hasta las indicaciones de iluminación y el ritmo, para que tu próxima generación de video acierte a la primera.

Una lista de verificación de prompts para video con IA que sí funciona
Cristian Da Conceicao
Fundador de Picasso IA

El campo de prompt vacío frente a un modelo de texto a video parece engañosamente sencillo. Escribes algo, pulsas generar y, dos minutos después, tienes un video. Solo que no se parece en nada a lo que imaginabas.

La distancia entre "lo describí con claridad" y "salió bien" casi siempre es un problema de prompt. No porque escribieras las palabras equivocadas, sino porque los modelos de texto a video necesitan un tipo de información muy concreto y en un orden muy preciso, y la mayoría de la gente omite la mitad sin darse cuenta. Esta lista de verificación recoge cada elemento que debe incluir un prompt para video con IA, organizado para que puedas repasarlo antes de cada generación.

Persona revisando notas de prompts escritas a mano en fichas bajo la luz cálida de una ventana

Por qué la mayoría de los prompts para video con IA se quedan cortos

La diferencia entre escribir prompts para imagen y para video

Los prompts de imagen describen un único momento congelado. Puedes ser flexible con el tiempo y el movimiento, porque el modelo solo necesita sintetizar un fotograma. Los prompts de video describen una secuencia. El modelo necesita saber qué inicia la escena, cómo cambia a lo largo de 5 o 10 segundos y qué hace la cámara en todo momento. Si lo omites, el modelo rellena los huecos como quiera, normalmente con deriva aleatoria de la cámara, temblor del sujeto y un punto medio que no se parece en nada al fotograma inicial.

Lo que el modelo necesita saber de verdad

La mayoría de los modelos de video con IA se entrenan con millones de clips que llevan incorporadas las convenciones de la cinematografía profesional. Responden bien al lenguaje de ese oficio: términos de cámara concretos, vocabulario de iluminación y verbos de movimiento. Los adjetivos vagos como "genial" o "bonito" no le dan nada concreto con lo que trabajar.

Modelos como Seedance 2.0, Kling v3 Video y Veo 3.1 responden mucho mejor a prompts estructurados y específicos. Vamos a desglosar cada sección de uno.

La lista de verificación de la base de la escena

Antes de cualquier detalle de cámara o movimiento, un buen prompt para video con IA establece el quién, qué y dónde. Estos tres anclajes dan al modelo un punto de partida estable para cada fotograma.

Plano aéreo amplio de un plató de rodaje al atardecer dorado con miembros del equipo en silueta

Sujeto: quién o qué aparece en el encuadre

Define a tu sujeto con la precisión suficiente para que un director de casting pudiera encontrarlo. En lugar de "una mujer", prueba con "una mujer de unos 30 años, con el pelo corto y oscuro, que lleva un impermeable color crema". En lugar de "un coche", prueba con "un muscle car negro de los años sesenta con molduras cromadas y tubos de escape traseros".

Este nivel de detalle favorece la coherencia temporal. Cuando el modelo tiene una descripción precisa del sujeto, mantiene esa descripción estable en todos los fotogramas en lugar de desviarse.

DébilFuerte
"un hombre caminando""un hombre barbudo con traje gris, de mediados de los 40 años, caminando con las manos en los bolsillos"
"una ciudad""una calle estrecha y empedrada en una ciudad europea lluviosa, escaparates mojados, por la noche"
"escena de naturaleza""un claro de pinar al amanecer, niebla a ras de suelo, con contraluz del sol naciente"

Entorno: dónde ocurre la acción

El entorno necesita la misma precisión que el sujeto. "En una cafetería" es pobre. "Dentro de una pequeña cafetería independiente con paredes de ladrillo visto, sillas de madera desparejadas, luz cálida de bombillas estilo Edison y lluvia visible en el cristal de la calle al fondo" le da al modelo un espacio real que poblar. Cuanto más rica sea la descripción del entorno, más estable se mantendrá el fondo a lo largo de los fotogramas.

Hora del día y clima

Estos dos parámetros hacen más trabajo que casi cualquier otro elemento de tu prompt. Determinan la dirección de la luz, la temperatura de color, la dureza de las sombras y la difusión atmosférica. "Niebla de primera hora de la mañana", "sol de mediodía, duro", "tarde nublada", "crepúsculo de hora azul": cada uno de estos términos pone en movimiento un mundo visual completamente distinto. Nunca dejes la hora del día sin especificar.

Indicaciones de cámara y composición

Primer plano en contrapicado de la lente de una cámara profesional con gotas de lluvia sobre el cristal

Ángulo y distancia

Los modelos de video con IA responden bien a los términos estándar de la cinematografía para ángulo y distancia. Úsalos directamente:

  • Ángulos: a la altura de los ojos, contrapicado, picado, cenital, plano inclinado holandés, por encima del hombro
  • Distancias: primerísimo primer plano (ECU), primer plano (CU), plano medio (MS), plano entero (FS), plano general, plano general muy abierto (EWS)

Combinarlos ("plano medio en contrapicado") le indica al modelo exactamente dónde colocar la cámara respecto al sujeto.

Instrucciones de movimiento que funcionan

El movimiento de cámara es una de las palancas más eficaces en la escritura de prompts para video, y una de las más descuidadas. Estas son algunas descripciones de movimiento fiables a las que la mayoría de los modelos responden bien:

  • "travelling lento hacia el sujeto": la cámara se desplaza físicamente hacia el sujeto
  • "panorámica suave a la derecha": la cámara gira horizontalmente
  • "inclinación hacia arriba": la cámara gira verticalmente hacia arriba
  • "plano de seguimiento": la cámara sigue al sujeto en movimiento
  • "plano fijo bloqueado": sin movimiento, muy estable
  • "descenso aéreo lento": vista cenital que desciende

💡 Para modelos como Kling v2.6 y Kling v3 Omni Video, especificar el movimiento de cámara directamente en el prompt produce resultados más intencionados y dirigidos que dejarlo sin especificar.

Notas sobre la lente y la profundidad de campo

Si sabes la distancia focal que quieres, inclúyela. "Objetivo de retrato de 85 mm con poca profundidad de campo" produce un resultado distinto de "gran angular de 28 mm, todo enfocado". Estos números no son arbitrarios: codifican estéticas visuales concretas que aparecen de forma constante en los datos de entrenamiento. Un gran angular de 28 mm crea contexto ambiental. Un 85 mm comprime el espacio y aísla al sujeto. Un teleobjetivo de 200 mm aplana los planos y crea un aislamiento dramático del sujeto frente a fondos cargados.

Descripción del movimiento y la acción

Velocista masculino captado a mitad de zancada en una pista mojada al amanecer, con contraluz en el borde y desenfoque de movimiento en las extremidades

Describir el movimiento con precisión

El error más común al describir el movimiento es decir lo que algo es en lugar de lo que hace.

"Una persona corriendo" le dice al modelo que el sujeto está en movimiento. No le dice la calidad, la velocidad, la dirección ni el detalle físico de ese movimiento. "Una mujer corriendo a toda velocidad hacia la cámara, con los brazos bombeando, grava saltando tras sus pies, expresión concentrada" le dice las cinco cosas.

Usa verbos activos y detalles físicos observables: desmoronarse, balancearse, centellear, inclinarse, girar, ondear, hincharse. Generan un movimiento más coherente que términos generales como "moviéndose" o "animado".

El problema del ritmo

Los videos de cinco segundos necesitan un único arco de acción claro. Los de diez segundos pueden sostener dos momentos. Generadores como Wan 2.7 T2V, LTX 2.3 Pro y Hailuo 02 producen mejores clips cuando el prompt describe una única acción continua en lugar de varios eventos separados.

Si escribes "ella abre la puerta, entra, se sienta y toma el teléfono", estás describiendo una escena de 30 segundos comprimida en un clip de 5. El modelo se saltará fotogramas o producirá saltos desconectados. Mejor: "ella abre despacio la pesada puerta de madera, deteniéndose en el umbral, con la luz dorada entrando a raudales tras ella".

Qué significa realmente la coherencia temporal

La coherencia temporal es la estabilidad de los elementos visuales a lo largo de los fotogramas: el rostro del sujeto, el fondo, la iluminación, la paleta de color. Cuando se rompe, aparecen texturas parpadeantes, rostros que se deforman o entornos que cambian a mitad del clip.

Mejorarla exige darle al modelo anclajes estables. Ayudan las descripciones largas y específicas del sujeto. Ayudan las descripciones sólidas de la iluminación de la escena. Ayuda evitar demasiados elementos en movimiento a la vez. Modelos como Pixverse v6 y Gen 4.5 tienen mejoras de estabilidad integradas, pero el prompt sigue determinando la base.

Iluminación y atmósfera

Escenario de teatro vacío con un foco único y dramático que crea un cono de luz sobre tablas de madera desgastadas

Luz natural frente a luz artificial

Las descripciones de luz natural tienen asociaciones muy fuertes en los datos de entrenamiento. "Contraluz de hora dorada", "luz difusa de día nublado", "luz de farola en la hora azul", "sol de mediodía cenital que proyecta sombras duras": cada una fija de inmediato el contexto visual para el modelo.

La luz artificial te da más precisión. "Una única bombilla de tungsteno en el techo", "letrero de neón reflejado en el asfalto mojado", "montaje de estudio de tres puntos con relleno suave", "fluorescente parpadeando en un pasillo": todos estos codifican ambientes cinematográficos concretos con mucha coherencia.

Ambiente mediante la temperatura de color

La temperatura de color afecta a la lectura emocional de una escena tanto como cualquier otro elemento de tu prompt. Usa estos términos directamente:

  • Cálida (naranja-ámbar): íntima, nostálgica, confortable
  • Fría (azul-verde azulado): clínica, tensa, aislada
  • Neutra: documental, realista, con los pies en la tierra
  • Mixta: cinematográfica y dramática (p. ej., "luz cálida de interior que se derrama sobre un exterior azul y frío")

Interior de un estudio de fotografía con tres softbox profesionales sobre un fondo blanco sin costuras

Cómo evitar el problema del video plano

Los videos planos y subexpuestos suelen venir de prompts sin ninguna descripción de la luz. El modelo recurre a un gris medio. Para evitarlo:

  1. Nombra siempre una fuente de luz (ventana, sol, lámpara, farola, pantalla)
  2. Indica la dirección (desde la izquierda, desde arriba, en contraluz, en luz lateral)
  3. Indica la calidad (dura, suave, difusa, directa, dispersa)

Incluso una sola frase de descripción de la luz ("luz cálida de ventana desde la izquierda, que proyecta sombras suaves sobre el rostro del sujeto") cambia de forma notable el resultado visual de cualquier generación.

Estilo, prompts negativos y revisiones finales

Sendero denso de bosque con niebla al amanecer, con pinos y bruma que difuminan la luz suave de la mañana

Modificadores de estilo que realmente funcionan

Los mejores modificadores de estilo para video con IA se toman de referencias cinematográficas reales. Codifican sistemas visuales concretos que el modelo ha absorbido de películas y fotografía reales:

  • "fotorrealista, 8K": base de realismo fotográfico
  • "grano de película, Kodak Portra 400": textura analógica, calidez desaturada
  • "paleta Kodachrome": color vintage saturado
  • "look de Arri Alexa": ciencia del color de cine profesional
  • "destellos de lente anamórfica": estética de cine panorámico
  • "documental con cámara al hombro": temblor naturalista intencionado

Evita los términos que suenan artificiales como "digital hiperrealista" o "render 3D cinematográfico". A menudo empujan al modelo hacia estéticas de CG aunque quieras fotografía de acción real.

Prompts negativos: qué excluir

No todos los modelos de video tienen un campo de prompt negativo independiente. Cuando lo tienen, úsalo. Exclusiones habituales que mejoran la mayoría de los videos:

  • borroso, fuera de foco (salvo que sea intencionado)
  • marca de agua, texto superpuesto, logotipo
  • dibujos animados, ilustración, animado, anime
  • baja calidad, pixelado, artefactos de compresión
  • sacudidas excesivas de cámara (salvo que se pidan)
  • varias personas (si tu escena necesita un único sujeto)

La prueba de lectura final

Antes de enviar cualquier prompt, léelo de nuevo y responde a estas seis preguntas:

  1. ¿Puedes visualizar exactamente cómo es el primer fotograma?
  2. ¿Sabes qué cambia entre el primer y el último fotograma?
  3. ¿Hay una fuente de luz nombrada?
  4. ¿Has indicado el ángulo de cámara?
  5. ¿Has descrito el movimiento de cámara o has dejado explícitamente la cámara quieta?
  6. ¿Está el sujeto descrito con la suficiente precisión como para mantenerse coherente a lo largo de los fotogramas?

Si respondes "no" a cualquiera de estas, cubre ese hueco antes de generar.

Lista de verificación de prompts por modelo de video con IA

Los distintos modelos responden de forma distinta al mismo prompt. Adaptar tu lenguaje a las características del modelo da mejores resultados que un enfoque único para todos.

Vista cenital de un paso de cebra concurrido en la ciudad, con peatones proyectando sombras largas de la tarde

Seedance 2.0 para movimiento y audio

Seedance 2.0 genera audio nativo junto con el video, lo que lo hace ideal para escenas en las que importa el sonido ambiente. Su calidad de movimiento maneja bien los sujetos de desplazamiento rápido. Con Seedance, describir el contexto sonoro en el prompt mejora el paisaje sonoro generado: "olas rompiendo contra una orilla rocosa", "zumbido del tráfico urbano en hora punta", "pasos sobre un sendero de grava".

Kling v3 para control cinematográfico

Kling v3 Video responde especialmente bien al lenguaje de cámara específico. Nombrar tipos de movimiento ("travelling de acercamiento lento", "plano de grúa subiendo") produce resultados notablemente más controlados que las descripciones genéricas. La salida en 1080p de Kling v3 lo convierte en una opción sólida cuando importa más la calidad de salida que la velocidad de generación. Kling v2.6 ofrece un buen equilibrio entre velocidad y control para iterar más rápido.

Wan 2.7 para secuencias más largas

Wan 2.7 T2V genera en 1080p y es una opción sólida para clips más largos con buena estabilidad temporal. Su variante de imagen a video, Wan 2.7 I2V, toma una imagen de referencia como primer fotograma, lo que reduce de forma notable los problemas de coherencia, porque el modelo tiene un punto de partida concreto y preciso a nivel de píxel en lugar de construirlo solo desde el texto.

Veo 3.1 para contenido sincronizado con el audio

Veo 3.1 genera video con audio nativo sincronizado. Para escenas de diálogo o contenido con música, incluir descripciones del sonido en tu prompt le da más material a la generación de audio: "guitarra acústica alegre sonando suavemente de fondo", "diálogo en un baño de azulejos con reverberación natural", "viento entre los pinos".

Pixverse v6 y Hailuo 02 para iterar rápido

Cuando la velocidad de iteración importa más que la calidad máxima, Pixverse v6 y Hailuo 02 ofrecen una entrega rápida con buena resolución. Funcionan bien para probar variaciones del prompt: escribe tres versiones de la misma escena con distintas descripciones de luz o movimiento, genéralas todas rápidamente y lleva después la versión más sólida a un modelo de mayor calidad para el resultado final.

Cómo usar PicassoIA para escribir prompts de video con IA

PicassoIA te da acceso a todos los modelos anteriores desde una sola interfaz, sin necesidad de claves de API ni cuentas separadas para cada uno. Así puedes poner en práctica esta lista de verificación en la plataforma:

Paso 1: elige tu modelo

Ve a la colección de texto a video y elige el modelo que mejor encaje con tu escena. Para iterar rápido, empieza con P Video o Ray Flash 2 720p. Para un resultado de calidad final, pasa a Seedance 2.0, Kling v3 Video o Veo 3.1.

Paso 2: construye tu prompt por secciones

Recorre estos nueve campos en orden:

  1. Sujeto (quién o qué, descrito con precisión)
  2. Entorno (dónde, con detalle arquitectónico o natural)
  3. Hora del día y clima
  4. Ángulo y distancia de cámara
  5. Movimiento de cámara, o "plano fijo bloqueado"
  6. Acción o movimiento (un único arco, verbos activos)
  7. Iluminación (fuente, dirección, calidad)
  8. Modificadores de estilo (fotorrealismo estándar, película si hace falta)
  9. Exclusiones (al final, o en el campo negativo si está disponible)

Paso 3: empieza con 5 segundos y luego amplía

Genera primero un clip de 5 segundos. Revisa el primer fotograma y la coherencia a lo largo del clip. Si el primer fotograma no es el correcto, corrige la descripción de la escena. Si la coherencia se rompe a mitad del clip, añade más especificidad al sujeto y reduce el número de elementos en movimiento simultáneos. Solo amplía a un clip más largo cuando la versión de 5 segundos se sostenga bien.

Paso 4: usa imagen a video para la máxima coherencia

Si tienes en mente un primer fotograma concreto, genéralo primero con un modelo de texto a imagen y pasa después esa imagen a Wan 2.7 I2V, Wan 2.5 I2V o Hailuo 2.3 para animarla. Esto elimina la mayoría de los problemas de coherencia temporal, porque el modelo tiene un punto de partida real y preciso a nivel de píxel en lugar de construirlo todo desde el texto.

Bocetos de storyboard dispuestos sobre una mesa de madera con ángulos de cámara escritos a mano y una taza de café

Empieza a generar ahora

La lista de verificación no está pensada para memorizarla. Está pensada para repasarla rápidamente antes de pulsar generar, igual que un piloto hace su revisión previa al vuelo: no porque haya olvidado cómo funcionan los sistemas, sino porque las revisiones sistemáticas detectan el elemento que, de otro modo, te saltarías.

Copia esta estructura en un archivo de notas y rellénala antes de cada generación:

Subject: [who or what, described precisely]
Environment: [where, with specific detail]
Time and weather: [lighting context]
Camera angle: [low / eye / high / aerial + distance]
Camera movement: [named movement or "locked-off"]
Action: [single motion arc, active verbs]
Lighting: [source + direction + quality]
Style: [photorealistic, film stock, etc.]
Exclude: [what the model should avoid]

Cada campo completado significa menos generaciones desperdiciadas y resultados más rápidos. La diferencia entre un prompt que produce un clip plano y tembloroso y otro que produce algo que merece la pena conservar suele reducirse a tres o cuatro palabras concretas que aún no habías añadido.

PicassoIA reúne más de 100 modelos de texto a video en un solo lugar, sin configuración previa. Elige un modelo, repasa esta lista de verificación y genera. Tu primer prompt estructurado te espera en picassoia.com.

Compartir este artículo

Elige tu idioma