Veo 3.1 Ingredients to Video: usa imágenes de referencia para video con IA

La función Ingredients to Video de Veo 3.1 te permite usar imágenes de referencia para fijar cada detalle visual de tu video generado con IA, desde la iluminación y el color hasta la identidad del sujeto. Este artículo explica con detalle cómo funciona la función, cómo usarla paso a paso en PicassoIA y cómo escribir prompts que den resultados constantes y de alta calidad en varias generaciones.

Veo 3.1 Ingredients to Video: usa imágenes de referencia para video con IA
Cristian Da Conceicao
Fundador de Picasso IA

Si tienes una carpeta de fotos de referencia y una idea clara de lo que debe pasar en una escena, la función Ingredients to Video de Veo 3.1 está pensada justo para ese momento. En lugar de depender solo de descripciones de texto para definir el estilo visual, la apariencia del sujeto y el ambiente, puedes darle al modelo una imagen de referencia y dejar que se encargue de lo más difícil. El resultado es un video que se parece de verdad a la escena que tenías en mente.

Fotografías de referencia dispuestas sobre un tablero de corcho listas para la generación de video con IA

Qué hace realmente "Ingredients to Video"

El nombre no es casual. "Ingredients" indica que tus entradas, tanto la imagen de referencia como tu prompt de texto, son materia prima que el modelo combina para producir el resultado. Veo 3.1 no se limita a animar una foto fija. Usa la información visual de la referencia como ancla de composición y luego genera movimiento que continúa de forma natural desde ese punto de partida.

Esto es fundamentalmente distinto de las herramientas de imagen a video que solo añaden un movimiento sutil a una foto. Veo 3.1 sintetiza fotogramas nuevos a partir de lo que deduce sobre la iluminación, la profundidad, las relaciones espaciales y las características del sujeto en la referencia. El video que produce puede mostrar movimiento de cámara, acciones del sujeto y detalles del entorno que nunca estuvieron en la imagen original.

El papel de las imágenes de referencia

En este contexto, una imagen de referencia no es simplemente un primer fotograma. Es un documento de especificación visual. Veo 3.1 la analiza para:

  • Identidad del sujeto: estructura del rostro, proporciones del cuerpo, tono de piel, textura del cabello
  • Condiciones de iluminación: dirección, dureza, temperatura de color
  • Tipo de entorno: interior, exterior, natural, urbano
  • Paleta de colores: los tonos dominantes y de acento que se mantienen en el video generado
  • Profundidad de campo aparente: carácter del bokeh, indicios de distancia focal

Cuanta más información contenga tu imagen de referencia, con más precisión Veo 3.1 puede calibrar su resultado. Un retrato nítido y bien iluminado le da al modelo más con qué trabajar que una foto borrosa tomada con el teléfono.

Cómo Veo 3.1 interpreta el contexto visual

Google DeepMind entrenó Veo 3.1 con enormes conjuntos de datos de video, lo que significa que tiene muy buenas nociones previas sobre cómo evolucionan las escenas con el tiempo. Cuando una imagen de referencia muestra a una mujer de pie junto a una ventana con luz de la tarde, el modelo sabe que esa situación de iluminación produce movimientos de sombra concretos a medida que pasa el tiempo, reflejos especulares específicos en la piel y en la tela, y cambios de color ambiental determinados. Ese conocimiento contextual es lo que diferencia a Veo 3.1 de las herramientas de animación más simples.

💡 Consejo útil: Las imágenes de referencia con iluminación direccional marcada producen el video más coherente visualmente. La luz plana y nublada le da al modelo menos con qué trabajar.

Hombre sosteniendo una fotografía de referencia mientras un equipo portátil muestra la interfaz de video con IA

Por qué las imágenes de referencia lo cambian todo

Los prompts de texto tienen una limitación fundamental: las palabras describen conceptos, no detalles concretos. Puedes escribir "una mujer con cabello castaño cálido a la luz de la hora dorada" y el modelo decidirá por su cuenta cómo se ve eso. Si añades una imagen de referencia de la persona, la escena y la iluminación exactas, esa decisión se reduce mucho.

Coherencia sin trucos de prompt

Una de las frustraciones más persistentes de la generación de video con IA es la coherencia. Generar un segundo clip con el mismo personaje, el mismo lugar y la misma iluminación que el primero exige una ingeniería de prompts muy precisa, y aun así los resultados varían. Las imágenes de referencia resuelven gran parte de este problema.

Cuando usas la misma imagen de referencia en varias generaciones de Veo 3.1, el modelo ancla cada resultado a la misma huella visual. La persona de tu referencia tendrá el mismo rostro, la habitación tendrá la misma temperatura de color y la luz caerá desde la misma dirección. Por eso, la generación de video guiada por referencias es el enfoque más práctico para quien produce una serie de clips.

Transferencia de estilo en movimiento

Las imágenes de referencia también funcionan como referencias de estilo, no solo de sujeto. Si proporcionas una fotografía con un aspecto cinematográfico concreto, una gradación de color determinada o un estilo de composición específico, Veo 3.1 traslada esas cualidades a los fotogramas de video que genera. Así es como los cineastas y creadores de contenido usan los tableros de referencia en la producción tradicional: para establecer un lenguaje visual antes de empezar a rodar.

La misma lógica se aplica aquí. Tu imagen de referencia es tu documento de lenguaje visual.

Casos de uso reales que funcionan

Caso de usoLo que aportasLo que genera Veo 3.1
Campaña de modaFoto de modelo con un atuendo concretoClip de 5 segundos con movimiento natural
Presentación de productoFoto cenital o imagen principal del productoRevelado orbital con iluminación cinematográfica
Contenido de viajesFoto de paisaje del destinoPaneo cinematográfico con movimiento atmosférico
Avatar para redes socialesRetrato con un aspecto específicoBucle sutil con micromovimiento natural
InmobiliariaFoto del interior de una habitaciónAvance de cámara suave a través del espacio

Pantalla dividida que muestra la foto de referencia junto a fotogramas de video generados con IA

Cómo usar Veo 3.1 en PicassoIA

Veo 3.1 está disponible directamente en PicassoIA, sin configuración de API ni instalación local. Este es el flujo exacto para usarlo con imágenes de referencia.

Paso 1: elige tu imagen de referencia

Antes de abrir la herramienta, dedica tiempo a elegir la referencia adecuada. Las cualidades que más importan son:

  • Resolución: 1024 px o más en el lado corto. Una resolución mayor le da al modelo más detalle del que extraer información.
  • Nitidez: enfoque preciso en tu sujeto principal. El desenfoque por movimiento en la referencia crea ambigüedad.
  • Composición: encuadra a tu sujeto como quieres que aparezca en el video.
  • Iluminación: elige una imagen de referencia que tenga la iluminación que quieres en el video final. El modelo no inventará mejor luz de la que le proporciones.

Evita usar capturas de pantalla de redes sociales. Los artefactos de compresión y las marcas de agua introducen ruido en la lectura que hace el modelo de la imagen.

Paso 2: prepara el prompt

Con Veo 3.1, tu prompt de texto debe centrarse en el movimiento y la acción, no en la apariencia. La imagen de referencia se encarga de la apariencia. Tu prompt debe responder a esta pregunta: ¿qué pasa en esta escena?

Estructuras de prompt que funcionan bien:

  1. Primero la acción: "Caminando despacio por un jardín bañado por el sol, hojas cayendo a su alrededor, una brisa suave moviendo el cabello"
  2. Primero la cámara: "Dolly lento hacia delante dentro de la habitación, la profundidad de campo pasa del objeto en primer plano al sujeto"
  3. Primero la atmósfera: "La luz del amanecer se intensifica poco a poco, la niebla sube desde la hierba, pájaros cruzan el encuadre"

Mantén los prompts entre 30 y 80 palabras. Veo 3.1 procesa prompts más largos, pero los cortos y específicos producen resultados más ajustados.

Paso 3: configura y ejecuta

En PicassoIA, la interfaz de Veo 3.1 te ofrece los parámetros principales:

ParámetroAjuste recomendadoNotas
Imagen de referenciaTu foto seleccionadaSube la imagen directamente desde tu dispositivo
PromptDescripción centrada en el movimiento30-80 palabras
Duración5-8 segundosIdeal para redes sociales y web
Relación de aspecto16:9 o 9:16Ajústala a la plataforma de destino
SemillaValor fijoUsa la misma semilla para repeticiones coherentes

Haz clic en generar y espera. Veo 3.1 suele tardar entre 60 y 120 segundos por generación.

💡 Guarda tu semilla: si obtienes un resultado que te gusta, anota el valor de la semilla antes de cerrar. Puedes usar la misma semilla con pequeñas variaciones del prompt para producir series de resultados coherentes.

Qué esperar de los resultados

Las primeras generaciones rara vez son resultados finales. Usa la primera ejecución para evaluar si el modelo ha leído bien la referencia. Revisa:

  • Interpretación correcta del sujeto: ¿la persona o el objeto del video coinciden con tu referencia?
  • Continuidad de la iluminación: ¿la dirección de la luz y la temperatura de color son coherentes con la referencia?
  • Naturalidad del movimiento: ¿el movimiento resulta físicamente plausible?

Si el sujeto se ve mal, es posible que la imagen de referencia sea demasiado ambigua. Si la iluminación no cuadra, tu prompt puede estar anulando la referencia. Ajusta y vuelve a generar.

Pared de tablero creativo cubierta de fotografías de referencia

Consejos de prompt que funcionan con imágenes de referencia

La combinación de una imagen de referencia y un prompt de texto crea una pequeña tensión: el modelo tiene que conciliar dos fuentes de información. Saber cómo resuelve esa tensión te ayuda a escribir mejores prompts.

Describe el movimiento, no la apariencia

Esta es la regla más importante para la generación guiada por referencias. Si tu referencia muestra a una mujer con un vestido rojo y tu prompt dice "mujer con un vestido rojo caminando", estarás describiendo de forma redundante lo que la referencia ya comunica. Peor aún, si tu prompt dice "mujer con un vestido azul caminando", creas un conflicto que produce resultados impredecibles.

Escribe los prompts como si el modelo ya pudiera ver exactamente quién y qué aparece en la referencia. Describe lo que hacen, no cómo se ven.

3 estructuras de prompt que dan buen resultado

Estructura 1: sujeto + movimiento + entorno "Se gira despacio para mirar por encima del hombro, se dibuja una leve sonrisa, una brisa cálida de la tarde mueve la tela"

Estructura 2: movimiento de cámara + punto focal "La cámara sube despacio desde la altura de la mesa hasta la altura de los ojos, revelando todo el estudio detrás del sujeto, con poca profundidad de campo en todo momento"

Estructura 3: atmósfera + paso del tiempo "La luz de la mañana se intensifica durante 5 segundos, las sombras giran un poco, el vapor de la taza se disipa en el aire"

Qué evitar en tu prompt de texto

  • Descripciones de apariencia que entren en conflicto con la imagen de referencia
  • Palabras de estilo vagas como "cinematográfico" o "fotorrealista", porque la imagen de referencia ya define el estilo
  • Palabras de movimiento vagas como "movimiento natural": sé específico sobre qué se mueve y cómo
  • Prompts demasiado largos con varias instrucciones que compiten entre sí

💡 Resolución de conflictos: Cuando tu prompt y la imagen de referencia entran en conflicto, Veo 3.1 suele dar más peso a la imagen de referencia en cuanto a la apariencia del sujeto, y más peso al prompt en cuanto a la dirección del movimiento. Aprovecha este comportamiento de forma predecible.

Mujer de perfil revisando los resultados de video generados con IA en un monitor grande

Veo 3.1 frente a otros modelos de imagen a video

PicassoIA tiene más de 87 modelos de generación de video. Elegir el adecuado para trabajar con imágenes de referencia exige saber en qué destaca cada uno.

Veo 3.1 frente a Kling V3

Kling V3 es un competidor sólido para el video guiado por referencias. Maneja movimientos complejos y produce clips más largos con una precisión física impresionante. Donde Veo 3.1 gana es en la fidelidad de la iluminación, en concreto en lo bien que conserva el carácter lumínico de la imagen de referencia. Para retratos y trabajo de moda, donde el tono de piel y la dirección de la luz son fundamentales, Veo 3.1 es la opción más fiable.

Veo 3.1 frente a Wan 2.6 i2v

Wan 2.6 Image-to-Video es más rápido y, en general, más accesible por generación. Es excelente para animaciones sencillas en las que la imagen de referencia funciona como un primer fotograma literal. Los Ingredients to Video de Veo 3.1 son la mejor opción cuando quieres que el modelo genere un video que vaya más allá del contenido literal de la referencia, creando escenas que la referencia solo sugería.

Cuándo elegir Veo 3.1 Fast

Veo 3.1 Fast es la versión que conviene usar cuando iteras rápido con variaciones. Produce tiempos de generación más cortos a costa de una pequeña pérdida de calidad. El flujo de trabajo que usan la mayoría de los profesionales: iterar con Veo 3.1 Fast hasta que la interpretación de la referencia y el movimiento sean correctos, y luego pasar el resultado final por Veo 3.1 para obtener la máxima calidad.

ModeloIdeal paraVelocidadFidelidad a la referencia
Veo 3.1Resultados finales, trabajo con iluminación críticaMediaMuy alta
Veo 3.1 FastIteración y pruebasRápidaAlta
Kling V3Clips largos, movimientos complejosMediaAlta
Wan 2.6 i2vAnimación rápida, eficiencia de presupuestoRápidaMedia

Vista cenital de fotografías de referencia seleccionadas sobre una superficie de lino

Errores comunes con imágenes de referencia

La mayoría de las generaciones fallidas se deben a uno de tres problemas de entrada, no a limitaciones del modelo.

Entradas de baja resolución

Subir una imagen de referencia comprimida o pequeña es la forma más rápida de obtener resultados irregulares. Cuando el modelo no puede resolver el detalle fino de la referencia, rellena los huecos con sus propias nociones previas. El resultado es un video que capta el ambiente general de la referencia pero no sus particularidades. Tu sujeto se ve distinto. La luz está en el lugar equivocado.

Recomendación mínima: 1024x576 px para contenido 16:9. Apunta a 1920x1080 px cuando el detalle del sujeto importe.

Prompts que entran en conflicto

Un prompt que describe la apariencia de tu sujeto suele anular o difuminar la influencia de la imagen de referencia. Esto ocurre porque Veo 3.1 recibe ambas cosas como instrucciones y tiene que ponderarlas. Cuanto más específica y detallada sea tu descripción de la apariencia, más alejará al modelo de la referencia.

La solución es sencilla: quita de tu prompt todo el lenguaje sobre la apariencia y sustitúyelo solo por lenguaje de movimiento.

Ignorar la relación de aspecto

La imagen de referencia y el video de salida deben compartir la misma relación de aspecto. Subir un retrato cuadrado 1:1 como referencia y pedir una salida 16:9 obliga al modelo a inventar lo que queda fuera del encuadre. A veces funciona. Con frecuencia produce proporciones distorsionadas o una extrapolación incorrecta del entorno.

Recorta tu referencia a la relación de aspecto de salida que quieres antes de subirla.

Manos sosteniendo una tableta que muestra la interfaz de generación de video con IA con una cuadrícula de imágenes de referencia

Lo que puedes crear ahora mismo

La generación de video guiada por referencias con Veo 3.1 no es teórica. Estos son tipos de contenido concretos que dan resultados sólidos con este flujo de trabajo hoy.

Contenido de moda y estilo de vida

Aquí es donde la tecnología resulta más útil de inmediato. Las marcas de moda y los creadores de estilo de vida necesitan video de productos concretos en personas concretas y en escenarios concretos. La generación guiada por referencias te permite partir de material fotográfico que ya tienes, dedicar menos horas a rodar y producir más contenido.

Una sola fotografía de moda de alta calidad se convierte en un clip de 5 segundos, un estudio de textura en primer plano y un video de estilo de vida al aire libre, todos con coherencia visual en cada resultado.

Video de viajes y destinos

Los productores de contenido de viajes suelen tener fotografías de lugares, pero necesitan video. La generación guiada por referencias cierra esa brecha. Una fotografía de paisaje se convierte en un paneo cinematográfico lento. Un interior arquitectónico se convierte en un avance suave a través del espacio. La referencia ancla al modelo en los detalles visuales del lugar real, en lugar de en una interpretación genérica de la escena.

Clips de presentación de productos

Las marcas de comercio electrónico necesitan video de producto, pero no siempre tienen un presupuesto de producción completo. Una imagen principal del producto usada como referencia, combinada con un prompt de movimiento de rotación o revelado, produce video de producto utilizable que coincide con la fotografía existente de la marca. El color, la iluminación y el tratamiento del fondo de la referencia pasan directamente al video.

Estudio de video profesional con varios monitores que muestran resultados de video generados con IA

Empieza a crear con tus propias referencias

La forma más rápida de ver lo que hacen los Ingredients to Video de Veo 3.1 es probarlo tú mismo. Elige una fotografía que ya tengas, con una iluminación clara y un sujeto nítido. Escribe una frase corta de prompt de movimiento que describa lo que debe pasar en la escena. Sube ambas cosas a Veo 3.1 en PicassoIA y lanza tu primera generación.

El primer resultado te enseñará más sobre cómo interactúan las imágenes de referencia con este modelo que cualquier explicación escrita. A partir de ahí, ajusta tu selección de referencias, afina tu prompt, prueba Veo 3.1 Fast para ciclos de iteración más rápidos y compara resultados con Kling V3 o Wan 2.6 i2v para encontrar lo que mejor se adapta a las necesidades de tu contenido.

PicassoIA te da acceso a todos estos modelos en un solo lugar, así que puedes usar la misma referencia en varios sistemas y comparar los resultados lado a lado. Esa comparación directa es el circuito de retroalimentación más útil para desarrollar intuición sobre la generación de video con IA a partir de imágenes de referencia.

Hoja de guion gráfico con fotografías de referencia que planifican el flujo de trabajo de video con IA

Compartir este artículo

Elige tu idioma