Cómo crear videos de IA con personajes coherentes en Veo 3.1
Veo 3.1 puede generar videos de IA con personajes coherentes si se combina con la arquitectura de prompt adecuada. Este artículo explica el método de la biblia del personaje, las técnicas de bloqueo de semilla, los flujos de trabajo de varias escenas y los mejores modelos de PicassoIA para mantener la identidad visual en cada clip que generes.
Mantener el mismo personaje en varios clips de video con IA es uno de los problemas más difíciles de la producción de video con IA en la actualidad. En una escena, tu protagonista tiene ojos marrones cálidos y cabello oscuro a la altura de los hombros. En la siguiente, tiene los ojos más claros, otra forma de mandíbula y su atuendo ha cambiado por completo. Ocurre en casi todos los modelos, y para quien crea una serie, un cortometraje o una campaña de marca, esta falta de coherencia destruye el trabajo antes de que llegue al público.
Veo 3.1 aborda este problema de forma más directa que sus predecesores. No lo resuelve del todo de manera automática, pero con las estrategias de prompting adecuadas, sistemas de referencia de personajes y disciplina en el flujo de trabajo, puedes producir videos de IA de varias escenas en los que tus personajes parezcan la misma persona en cada clip.
Así se hace, paso a paso.
Por qué los personajes cambian entre escenas
La causa raíz en los modelos de texto a video
Los modelos de texto a video generan cada clip como un proceso de muestreo independiente. No conservan una memoria de cómo era un personaje en una generación anterior, a menos que les des anclajes explícitos y estructurados. El modelo interpreta tu prompt desde cero cada vez. Un pequeño cambio de redacción, incluso mover una frase a otra posición dentro del prompt, puede alterar de forma notable el rostro, el tono de piel y las proporciones del personaje.
El problema se agrava con las descripciones vagas. Escribir "una mujer con cabello oscuro" le deja al modelo un margen enorme. El cabello oscuro puede ser negro azabache o castaño chocolate, corto, largo, ondulado o liso. El modelo elige lo que encaja con su distribución de probabilidad en ese momento, y eso cambia en cada render.
Qué hace Veo 3.1 de forma diferente
Veo 3.1 introdujo una coherencia temporal más refinada, lo que significa que el modelo mantiene mejor la coherencia visual dentro de un mismo clip. Entre clips, sin embargo, tienes que gestionar tú mismo la coherencia mediante la arquitectura de tus prompts.
La variante rápida sacrifica parte de esta coherencia a cambio de velocidad, lo que funciona bien para las iteraciones de borrador, pero no es ideal para las escenas finales con personajes fijos.
💡 Distinción importante: La coherencia temporal (dentro de un clip) es una capacidad del modelo. La coherencia entre clips es una disciplina de flujo de trabajo. Esa parte te corresponde a ti.
Cómo crear tu sistema de referencia de personajes
Antes de escribir el primer prompt de Veo 3.1, necesitas un documento de referencia del personaje. Este es el paso más importante de todo el flujo de trabajo. Sin él, tu personaje se desviará por muy buena que sea tu técnica de prompting.
El método de la biblia del personaje
Una biblia del personaje es un bloque de texto fijo que copias y pegas literalmente en cada prompt de ese personaje. Define los anclajes visuales innegociables. La creas una vez y nunca la cambias a mitad del proyecto.
Esta es una estructura de ejemplo:
Rasgo
Valor específico
Cabello
Cabello negro liso, cortado justo por debajo de los hombros, con una ligera ondulación natural en las puntas
Ojos
Ojos marrón oscuro en forma de almendra, línea de pestañas superior marcada
Piel
Tono cálido dorado-marrón, pecas sutiles sobre el puente de la nariz
Rostro
Forma de rostro ovalada, pómulos definidos, mandíbula suave
Complexión
Complexión atlética y delgada, aproximadamente 5'6" (1,68 m)
Atuendo distintivo
Chaqueta cargo verde oscuro ajustada con cremallera de latón, sobre una camiseta de tirantes blanca de canalé
Cada detalle aquí es específico. No "cabello oscuro", sino "cabello negro liso, cortado justo por debajo de los hombros, con una ligera ondulación natural en las puntas". La especificidad es lo que le quita al modelo la libertad para desviarse.
Rasgos físicos que siempre debes definir
Estos son los rasgos en los que los modelos más suelen desviarse. Fija cada uno de ellos:
Cabello: Color, longitud, estilo de corte, textura y cómo cae de forma natural
Ojos: Color, forma y cualquier rasgo distintivo (densidad de pestañas, delineado, etc.)
Tono de piel: Una referencia descriptiva, no solo "claro" u "oscuro"
Forma del rostro: Ovalada, redonda, cuadrada o de corazón
Altura y complexión: Proporciones aproximadas en relación con el encuadre
Atuendo distintivo: Un solo atuendo coherente para escenas de alta continuidad
Con tu biblia del personaje lista, el siguiente paso es estructurar tus prompts de Veo 3.1 para que la descripción del personaje ancle la generación en todo momento.
La técnica de la frase ancla
Empieza siempre tu prompt con el bloque de la biblia del personaje. No lo entierres en medio. Los modelos dan más peso a los primeros tokens, así que empezar por la descripción física le da a los rasgos del personaje la mayor influencia sobre el resultado.
"Una mujer con cabello negro liso cortado justo por debajo de los hombros, con una ligera ondulación natural, ojos marrón oscuro de forma almendrada, tono marrón dorado cálido con pecas sutiles en la nariz, que lleva una chaqueta cargo verde oscuro ajustada con cremallera de latón sobre una camiseta de tirantes blanca de canalé, caminando por una calle lluviosa de Tokio de noche, con letreros de neón reflejándose en charcos poco profundos, plano medio, siguiendo el movimiento de cámara, cinematográfico."
Fíjate en que el bloque del personaje va primero y después siguen la acción y el entorno. Ese orden no es opcional.
Prompts negativos para mayor estabilidad
Cuando la interfaz lo permita, usa prompts negativos para bloquear las variaciones de desvío más comunes:
blonde hair, blue eyes, light skin, red outfit, short hair, different face
Esto evita que el modelo recurra a sus configuraciones de personaje más probables y obliga a la generación a permanecer dentro del espacio visual que definiste.
💡 Consejo: Guarda un documento de "bloque negativo del personaje" junto a tu biblia principal. Pega ambos en cada generación. Uno define lo que el personaje ES, el otro define lo que NO es.
Cómo usar Veo 3.1 en PicassoIA
Veo 3.1 está disponible directamente en PicassoIA sin necesidad de configuración. Así es el proceso completo, paso a paso, para la producción de video con personajes coherentes.
Paso 1: Abre el modelo
Entra en la página del modelo Veo 3.1 en PicassoIA. Verás el campo de texto para tu prompt. Si estás trabajando en iteraciones de borrador o probando conceptos de escena, Veo 3.1 Fast también está disponible y procesa mucho más rápido, con una pérdida de calidad mínima en la fase de borrador.
Paso 2: Pega primero tu biblia del personaje
Abre tu documento de la biblia del personaje. Copia el bloque completo de la descripción física y pégalo al principio del campo del prompt. Después añade la acción, el entorno y los detalles cinematográficos de la escena.
No parafrasees la descripción del personaje entre una escena y otra. No la resumas. Usa exactamente las mismas palabras que definiste en tu biblia. Incluso un pequeño cambio de redacción introduce la variación semántica suficiente para alterar el aspecto visual del personaje.
Paso 3: Estructura los prompts de varias escenas
Para un proyecto de varias escenas, crea una lista numerada de prompts en un documento aparte antes de generar nada:
Escena 1:[Character Bible] + walking through a rainy street at night, neon reflections, medium shot
Escena 2:[Character Bible] + sitting at a café window, warm morning light, close-up shot
Escena 3:[Character Bible] + running across a rooftop at dusk, wide establishing shot
El bloque de la biblia del personaje es idéntico en las tres. Solo cambian la acción, el entorno y la dirección de cámara.
Paso 4: Fija la semilla
Si Veo 3.1 muestra un parámetro de semilla en la interfaz, anota la semilla de la generación del personaje que mejor se vea. Usa ese mismo valor de semilla en cada escena posterior con ese personaje. Es la palanca más potente que tienes para mantener la coherencia.
💡 Nota de flujo de trabajo: Genera primero dos o tres variaciones de cada escena. Elige la que mejor representa los rasgos de la biblia del personaje. Después fija esa semilla antes de pasar a la siguiente escena.
Parámetros de prompt de Veo 3.1 de un vistazo
Parámetro
Qué hacer
Orden del prompt
Biblia del personaje primero, acción después, entorno al final
Prompt negativo
Enumera los rasgos que el personaje NO tiene
Semilla
Usa un valor fijo para todas las escenas con el mismo personaje
Variante del modelo
Veo 3.1 para las versiones finales, Veo 3.1 Fast para los borradores
Duración del clip
Usa la duración estándar en la primera pasada antes de comprometerte
Otros modelos que vale la pena probar para mantener la coherencia
Veo 3.1 es una gran opción principal, pero no es la única en PicassoIA para este flujo de trabajo. Según el tipo de proyecto, estos modelos ofrecen fortalezas complementarias.
Kling V3 Motion Control
Kling V3 Motion Control te permite transferir el movimiento de un video de referencia directamente a tu personaje. Esto resulta especialmente útil cuando ya tienes una imagen de personaje coherente y quieres animarla con movimientos concretos, en lugar de depender solo de una descripción en texto para el movimiento.
El flujo de trabajo: primero genera un retrato de personaje coherente y después envía esa imagen, junto con un video de referencia de movimiento, a Kling V3 Motion Control. Tu personaje hereda el patrón de movimiento y conserva la identidad visual de la imagen de referencia.
DreamActor-M2.0 para animar retratos
DreamActor-M2.0 de ByteDance se especializa en animar una sola foto de retrato. Si generas o capturas tu personaje una vez con una gran coherencia visual, DreamActor produce varios clips animados que hacen referencia a la misma imagen de origen. Es uno de los enfoques más fiables para la coherencia entre clips, porque el ancla visual es una imagen real y no una descripción en texto.
💡 Consejo de flujo de trabajo: Genera el retrato de referencia de tu personaje con un modelo de texto a imagen, confirma que coincide con tu biblia del personaje con precisión y luego usa DreamActor-M2.0 para animar distintas escenas. El retrato se convierte en tu ancla de coherencia.
Wan 2.2 Animate Replace
Wan 2.2 Animate Replace adopta un enfoque distinto: reemplaza un personaje de un clip de video existente por tu personaje personalizado, a partir de una referencia. Es ideal cuando ya tienes una escena con la acción y el movimiento de cámara adecuados, pero necesitas cambiar al personaje. El clip original aporta el movimiento y el entorno; la descripción de tu personaje aporta la identidad visual.
También vale la pena probarlos para casos de uso concretos:
Kling Avatar V2 para videos de personajes basados en avatares con una gran coherencia facial
Hailuo 2.3 para clips de estilo cinematográfico que mantienen bien el detalle del personaje en primeros planos
Gen-4.5 by Runway para escenas con mucho movimiento en las que la identidad del personaje debe mantenerse durante un movimiento rápido
3 errores que rompen la coherencia siempre
Incluso con las herramientas adecuadas, estos tres errores debilitarán la continuidad de tu personaje sin importar el modelo que uses.
Descripciones físicas vagas
"Una mujer alta con cabello oscuro" no es una descripción de personaje. Es una sugerencia. El modelo llena cada espacio no definido con su propia interpretación, y esa interpretación cambia entre generaciones.
Solución: Cada rasgo físico necesita al menos dos atributos específicos. Color de cabello Y textura Y longitud. Color de ojos Y forma. Tono de piel Y cualquier marca distintiva.
Cambiar la estructura del prompt entre escenas
Si la biblia de tu personaje aparece en la posición uno en la Escena 1 y en la posición tres en la Escena 3, el modelo pondera la descripción de forma distinta. El personaje se desviará aunque el texto sea idéntico.
Solución: Crea una plantilla de prompt rígida. La biblia del personaje siempre va primero. La acción siempre en segundo lugar. El entorno en tercero. La cámara y la iluminación al final. No te desvíes nunca de este orden en todo el proyecto.
Ignorar la configuración de la semilla
Cada generación sin una semilla fija es como lanzar los dados de nuevo. Dos prompts con el mismo texto producen personajes con aspecto distinto porque la inicialización del ruido cambia cada vez.
Solución: Anota la semilla de tu mejor generación. Usa esa semilla en todas las escenas posteriores con ese personaje. Si el modelo no muestra una entrada de semilla, haz una captura de pantalla de la configuración de generación como referencia.
Flujos de trabajo avanzados para proyectos de varias escenas
Generación por lotes con bloqueo de semilla
Cuando encuentres una semilla que produzca un personaje que coincida con tu biblia, genera de cuatro a seis variaciones de escena con esa misma semilla y con descripciones de acción ligeramente distintas. Compáralas lado a lado. El rostro y la complexión deberían mantenerse estables mientras solo cambia la acción.
Si el personaje empieza a desviarse tras varias variaciones, es probable que la descripción de la acción entre en conflicto con la del personaje en algún punto del prompt. Simplifica el segmento de acción o reordena la estructura del prompt para dar prioridad a la biblia del personaje.
La imagen a video como el anclaje más fuerte
El flujo de trabajo más fiable para mantener la coherencia no depende solo de los prompts de texto. Usa un proceso de dos pasos:
Genera un retrato de tu personaje de alta calidad y coherente con un modelo de texto a imagen
Cuando el modelo recibe una imagen real de tu personaje como entrada visual en lugar de solo texto, el rostro, el tono de piel, el cabello y las proporciones del personaje quedan fijados a esa referencia. La deriva del texto a video prácticamente desaparece, porque el modelo tiene algo concreto con lo que compararse.
Este enfoque requiere más pasos, pero ofrece un nivel de coherencia visual que, por ahora, el prompting solo con texto no puede alcanzar.
💡 Flujo de producción: Usa Veo 3.1 para las escenas que necesitan entornos dinámicos y una alta calidad visual con movimiento cinematográfico. Usa flujos de imagen a video cuando la precisión facial del personaje sea la prioridad absoluta y no puedas permitirte ninguna deriva.
Empieza a crear tus propios videos con personajes coherentes
La coherencia de personajes en el video de IA es un problema resuelto, no porque los modelos la gestionen solos, sino porque existe un proceso claro y repetible para lograrla. Crea tu biblia del personaje. Fija la estructura de tus prompts. Usa valores de semilla. Cuando sea posible, usa un ancla de imagen en lugar de solo texto.
Veo 3.1 premia la estructura de los prompts más que cualquier improvisación creativa vaga. Los creadores que logran los resultados más constantes no son los que escriben los prompts más creativos. Son los que tienen la arquitectura de prompts más disciplinada, la documentación de personajes más específica y el flujo de trabajo más limpio entre escenas.
Todos los modelos mencionados en este artículo están disponibles en PicassoIA. Puedes ejecutar Veo 3.1, Kling V3 Motion Control, DreamActor-M2.0, Wan 2.2 Animate Replace y Hailuo 2.3 sin cambiar de plataforma, lo que facilita comparar resultados y construir el flujo de trabajo que mejor se adapte al tipo de proyecto que tengas.
Empieza con un solo personaje. Escribe la biblia. Fija la semilla. Genera la primera escena. Lo demás sale de ahí.