Cómo usar Seedance 2.0 con varias imágenes y audio

Seedance 2.0 de ByteDance acepta varias imágenes de entrada y archivos de audio nativos para producir videos de IA fluidos y sincronizados, con personajes coherentes entre escenas. Este artículo cubre el flujo de trabajo multimodal completo: desde preparar tus fotos de referencia hasta sincronizar los ritmos del audio con el movimiento del video, con instrucciones paso a paso para usar el modelo directamente en PicassoIA.

Cómo usar Seedance 2.0 con varias imágenes y audio
Cristian Da Conceicao
Fundador de Picasso IA

La mayoría de los modelos de video con IA toman una imagen y generan movimiento a partir de ella. Seedance 2.0 de ByteDance hace algo fundamentalmente distinto: acepta varias imágenes de referencia y una pista de audio nativa en una sola pasada de generación, y produce videos en los que los personajes se mantienen coherentes entre tomas, los entornos cambian de forma natural y el movimiento responde de verdad a los golpes y al ritmo del audio. Es el flujo de trabajo que cineastas, creadores de contenido y productores de redes sociales llevaban tiempo esperando, y está disponible ahora mismo sin ninguna configuración técnica.

Varias fotos de retrato impresas como referencia sobre una mesa de mármol junto a una cámara sin espejo, con las manos de un cineasta seleccionando imágenes para usar como entrada multi-imagen en la generación de video con IA

Qué hace diferente a Seedance 2.0

Antes de entrar en el flujo de trabajo, conviene entender por qué importa la entrada multi-imagen. La mayoría de los modelos de generación de video están condicionados por un solo fotograma: les das una foto y la animan. El personaje, el entorno y el estilo visual del resultado quedan fijados a ese único fotograma. Si quieres un video en el que una persona camine por varios lugares, o una narrativa que alterne entre personas distintas, tienes que generar cada clip por separado y luego unirlos en la postproducción.

Seedance 2.0 reduce todo eso a un solo paso.

Sistema de referencia multi-imagen

El modelo procesa las imágenes como un conjunto de referencia coherente, no como entradas independientes. Internamente, construye una identidad visual compartida a partir de las imágenes que le proporcionas, y las usa para mantener la coherencia de la apariencia de los personajes, la lógica de iluminación y la coherencia del entorno a lo largo de todo el clip generado. Si le das a la vez un retrato de una persona bajo el sol cálido de la tarde y una foto de paisaje de una playa a la misma hora del día, el modelo deduce que pertenecen a la misma escena y genera un movimiento que las conecta sin saltos bruscos.

Esto es especialmente útil para:

  • Videos de personajes en los que quieres que el mismo rostro aparezca en movimiento desde varios ángulos o poses
  • Narrativa de marca con una identidad visual coherente en distintas ubicaciones
  • Producción de videoclips musicales en los que las distintas tomas deben parecer estilísticamente unificadas
  • Reels para redes sociales que necesitan cortes fluidos entre varias escenas sin edición manual

Compatibilidad con audio nativo

La integración de audio en Seedance 2.0 no es un postprocesado. El modelo condiciona el movimiento del video a la forma de onda del audio durante la generación. Esto significa que los golpes, los cambios de tempo y los picos de amplitud de tu archivo de audio influyen directamente en el momento e intensidad del movimiento del resultado. Un golpe de batería en el segundo 0:03 puede provocar un movimiento de cámara o de sujeto justo en ese instante. Una nota larga y sostenida mantiene el movimiento suave y tranquilo.

Primer plano de una mesa de mezclas de audio profesional con medidores VU iluminados y LED de forma de onda, que refleja las capacidades de sincronización de audio necesarias para la generación de video con IA con Seedance 2.0

Cómo preparar tus imágenes para la entrada multi-referencia

Tener imágenes de referencia limpias y bien preparadas es el factor más importante para la calidad del resultado. El modelo solo puede trabajar con lo que le das.

Requisitos de resolución y formato

Seedance 2.0 funciona mejor con imágenes que cumplan estas especificaciones:

PropiedadRecomendadoMínimo
Resolución1280x720 o superior512x512
FormatoJPG, PNGJPG, PNG
Relación de aspecto16:9Cualquiera
Tamaño de archivoMenos de 10 MB por imagenMenos de 20 MB
IluminaciónConstante entre imágenesCualquiera

Más allá de las especificaciones técnicas, el contenido de tus imágenes de referencia importa muchísimo. Las imágenes con dirección de luz constante, temperatura de color similar y altura de perspectiva coherente se fusionan mucho mejor que las tomadas en condiciones muy distintas.

Consejo: Si estás haciendo fotos específicamente para usarlas como referencias multi-imagen, tómalas en una sola sesión bajo la misma fuente de luz natural. Los cielos nublados del mediodía son ideales porque producen sombras suaves y sin dirección que se mezclan con facilidad entre fotogramas.

Cuántas imágenes puedes usar

Seedance 2.0 admite hasta 4 imágenes de referencia por generación. Añadir más tiene una contrapartida importante en calidad:

  • 1 imagen: máxima fidelidad de detalle, comportamiento estándar de imagen a video
  • 2 imágenes: equilibrio ideal entre diversidad de referencia y coherencia, muy bueno para pares de personaje y lugar
  • 3 imágenes: funciona bien para secuencias narrativas; ligero aumento de artefactos de fusión en las transiciones
  • 4 imágenes: arco narrativo completo en una sola generación; necesita imágenes con una fuerte similitud visual para evitar desviaciones

En la mayoría de los casos, de 2 a 3 imágenes da los mejores resultados. Si necesitas 4 imágenes, asegúrate de que al menos 3 de ellas compartan una paleta de color dominante o el mismo sujeto.

Joven sosteniendo una tableta que muestra una cuadrícula de seis imágenes de retrato de referencia en una interfaz oscura, de pie en un estudio creativo minimalista y blanco

Cómo añadir audio a tu video de Seedance 2.0

La entrada de audio es lo que realmente separa este flujo de trabajo de cualquier cosa que puedas hacer con modelos básicos de imagen a video. Usada bien, convierte fotos de referencia estáticas en clips que parecen musicalizados y editados con intención.

Formatos de audio aceptados

Seedance 2.0 acepta los siguientes formatos de audio a través de la interfaz de PicassoIA:

  • MP3 (recomendado para pistas musicales)
  • WAV (recomendado para audio de alta fidelidad, sobre todo voz)
  • AAC (adecuado para audio comprimido de dispositivos móviles)

Mantén tus clips de audio cortos y centrados. El modelo genera videos de hasta 10 segundos en la implementación actual, así que usar un segmento de audio que coincida con esa duración (o que la supere entre 1 y 2 segundos) da la sincronización más limpia.

Consejo: Recorta tu audio a exactamente 10 segundos antes de subirlo. Usa la sección más intensa y rítmicamente interesante de tu pista. El modelo responde con más claridad a los transitorios y a los golpes que a los tonos sostenidos.

Cómo el audio impulsa el movimiento

El modelo no analiza el audio de forma semántica. No escucha el significado de las palabras ni el género de la música. En cambio, responde a la envolvente de energía acústica de la forma de onda. Esto es lo que significa en la práctica:

  • Secciones de alta amplitud (golpes fuertes, caídas de guitarra, crescendos) activan un movimiento de cámara y del sujeto más intenso
  • Secciones de baja amplitud (intros tranquilas, fundidos de salida) producen un movimiento más suave y sutil
  • Cambios rápidos de tempo crean cortes de movimiento más frecuentes entre fotogramas de referencia
  • Notas individuales sostenidas mantienen el fotograma actual más tiempo, con un paralaje o zoom suave

Este comportamiento significa que la música con mucha percusión produce los videos visualmente más dinámicos, mientras que el audio ambiental u orquestal crea resultados cinematográficos y de movimiento lento.

Plano general de una suite de postproducción de video profesional con tres monitores curvos que muestran fotogramas de video fusionados en una interfaz de línea de tiempo, con iluminación ámbar cálida de estudio

Cómo usar Seedance 2.0 en PicassoIA

Seedance 2.0 está disponible directamente en PicassoIA sin configuración de API, sin configuración de la cuenta y sin tarjeta de crédito para el acceso inicial. Este es el flujo de trabajo exacto.

Paso 1: abre la página del modelo

Ve a la página del modelo Seedance 2.0 en PicassoIA. Verás la interfaz de generación con tres zonas de subida diferenciadas y un campo de prompt de texto en la parte superior. Si necesitas resultados más rápidos a cambio de algo de calidad, Seedance 2.0 Fast también está disponible y sigue la misma interfaz.

Paso 2: sube tus imágenes de referencia

Haz clic en el área Image Input para abrir el selector de archivos. Puedes subir las imágenes una a una o seleccionar varias a la vez si tu navegador lo permite. La interfaz numera cada imagen subida y muestra una pequeña vista previa en miniatura. Arrastra las miniaturas para reordenarlas si es necesario: el modelo trata la primera imagen como la referencia principal y las siguientes como elementos secundarios de la escena.

Consejo: Coloca en primera posición la imagen que contiene a tu personaje principal o el elemento visual más importante. El modelo se ancla con más fuerza a la primera referencia.

Paso 3: sube tu archivo de audio

Debajo de la zona de subida de imágenes verás la sección Audio Input. Haz clic en ella y selecciona tu archivo MP3 o WAV preparado. La interfaz muestra una vista previa sencilla de la forma de onda para que confirmes que el archivo se cargó correctamente. Aquí no hay reproducción previa, así que asegúrate de haber escuchado tu clip de audio antes de subirlo y de que empieza en el momento correcto de tu pista.

Paso 4: escribe tu prompt de texto y genera

El prompt de texto funciona junto con tus entradas visuales y de audio como una tercera señal de condicionamiento. Mantenlo centrado en la descripción del movimiento y el ambiente en lugar de repetir lo que ya se ve en tus imágenes de referencia. Buenas estrategias de prompt para la entrada multi-imagen:

Céntrate en verbos de movimiento: "panorámica lenta por la escena, deriva suave de cámara, movimiento natural del viento en el pelo"

Describe el ambiente que buscas: "tarde de verano cinematográfica, cálida y relajada, movimiento suave"

Evita describir la apariencia (las imágenes ya se encargan de eso): No escribas "una mujer con pelo castaño de pie en una playa"

Una vez que hagas clic en Generate, el procesamiento suele tardar entre 45 segundos y 3 minutos, según la carga del servidor. El video resultante aparecerá directamente en la página cuando esté listo.

Perfil lateral de un hombre con auriculares sentado en una estación de trabajo, con los ojos cerrados en una concentración intensa, y un monitor detrás que muestra una forma de onda de audio sincronizada y una línea de tiempo de video

Ajustes de parámetros que importan

Seedance 2.0 expone varios parámetros que afectan de forma notable a la calidad del resultado. No son ajustes opcionales: acertar con ellos es la diferencia entre un video convincente y uno genérico.

Intensidad de movimiento

El control deslizante de motion strength regula con qué intensidad anima el modelo tus imágenes de referencia. La escala suele ir de 0 a 1, y el valor adecuado depende por completo de tu audio:

Tipo de audioIntensidad de movimiento recomendada
Hip-hop, EDM, pop0,7 a 0,9
Orquestal cinematográfico0,3 a 0,5
Ambient, lo-fi0,2 a 0,4
Voz o narración0,4 a 0,6
Silencioso (sin audio)0,5 por defecto

Si pones la intensidad de movimiento demasiado alta con un audio lento, se generan movimientos antinaturales y a tirones. Si la pones demasiado baja con un audio enérgico, desperdicias el potencial del condicionamiento de audio.

Duración y resolución

La implementación actual de Seedance 2.0 ofrece duraciones de 5 segundos y 10 segundos. Para entradas multi-imagen, 10 segundos es casi siempre la mejor opción: le da al modelo suficientes fotogramas para hacer transiciones suaves entre tus imágenes de referencia en lugar de cortar de forma abrupta.

La resolución de salida es 1280x720 (HD) por defecto. En la versión actual no hay opción 4K, pero la calidad en HD es realmente buena para redes sociales, YouTube y presentaciones.

Vista cenital de un escritorio de madera de nogal de un cineasta con una tira de película de 35 mm, fotos de referencia dispersas, una libreta con bocetos a mano y un disco duro externo

Seedance 2.0 frente a modelos similares

¿Cómo se compara Seedance 2.0 con otros modelos de video multimodales disponibles en PicassoIA?

ModeloMulti-imagenAudio nativoDuración de salidaVelocidad
Seedance 2.0Sí (hasta 4)Sí5-10 sMedia
Seedance 2.0 FastSí (hasta 4)Sí5-10 sRápida
LTX-2.3-ProNoSíHasta 30 sRápida
Audio to VideoÚnicaSíVariableRápida
Kling V3NoNo5-10 sMedia
Vidu Q3 ProSí (inicio/fin)No5-10 sMedia
P-VideoÚnicaSíVariableRápida

La conclusión: si necesitas entrada multi-imagen y audio nativo en un solo modelo, Seedance 2.0 es actualmente la única opción de la plataforma que combina ambas capacidades. LTX-2.3-Pro gana en duración de salida si para tu proyecto basta con sincronizar el audio con una sola imagen.

Dos monitores uno al lado del otro: el de la izquierda muestra una fotografía original de una mujer con luz de hora dorada, y el de la derecha muestra el fotograma de video generado con IA a partir de esa foto, con un desenfoque de movimiento natural

Problemas habituales y soluciones

Incluso con buenas entradas, a veces obtendrás resultados que no coinciden con lo que esperabas. Estos son los problemas más frecuentes y cómo solucionarlos.

Personajes que se mezclan incorrectamente

Síntoma: Una persona de una imagen de referencia empieza a transformarse en la persona de otra imagen de referencia a mitad del clip.

Causa: El modelo trata los distintos rostros como variaciones del mismo personaje en lugar de como sujetos distintos.

Solución: Asegúrate de que tus imágenes de referencia tengan sujetos claramente diferenciados. Si ambas muestran personas de aspecto parecido (mismo color de pelo, edad similar), el modelo tiene dificultades para mantener la separación. Prueba a añadir una tercera imagen que establezca un límite ambiental o contextual claro entre los sujetos. También puedes reservar las entradas con varias personas para escenarios en los que cada persona aparezca en un entorno claramente distinto.

El audio no se sincroniza con el movimiento

Síntoma: El video generado se mueve a un ritmo constante sin importar el nivel de energía del audio.

Causa: En la mayoría de los casos, es un problema de la configuración de intensidad de movimiento. Si la intensidad de movimiento está por debajo de 0,4, el modelo amortigua la variación impulsada por el audio.

Solución: Sube la intensidad de movimiento a al menos 0,6 y vuelve a generar. Comprueba también que tu archivo de audio no esté normalizado en volumen a un nivel plano: el modelo responde al rango dinámico, así que un audio muy comprimido y sin picos producirá resultados de movimiento planos. Una normalización ligera a -6 LUFS, en lugar del estándar de streaming de -14 LUFS, le da al modelo más información dinámica con la que trabajar.

Las imágenes no hacen transiciones suaves

Síntoma: El video corta de forma abrupta entre las imágenes de referencia en lugar de hacer una transición.

Solución: Usa la opción de 10 segundos en lugar de la de 5 segundos. Las duraciones cortas no dan al modelo suficientes fotogramas para interpolar con suavidad. Comprueba también que tus imágenes compartan al menos un ancla visual fuerte (un tono de fondo similar, una dirección de luz constante o el mismo sujeto).

Primer plano macro extremo del elemento frontal del objetivo de una cámara profesional que refleja tres retratos de rostros humanos distorsionados en la superficie de cristal multicapa, simbolizando la generación de video con múltiples referencias

Otros modelos que vale la pena probar

Seedance 2.0 cubre el caso de uso de varias imágenes con audio mejor que cualquier otra opción disponible actualmente, pero según las necesidades concretas de tu proyecto, estos modelos de PicassoIA merecen tu atención:

Para animación de una sola imagen guiada por audio: Lightricks Audio to Video toma una sola imagen y la anima para que coincida con un archivo de audio. El modelo está especializado únicamente en la sincronización audiovisual y produce una sincronización más limpia en videos de un solo sujeto que un modelo multi-imagen.

Para control de fotograma inicial y final: Vidu Q3 Pro acepta una imagen de inicio y una de fin y genera el movimiento interpolado entre ambas. No tiene entrada de audio, pero es excelente para transiciones de escena controladas en las que sabes exactamente cómo deben verse el primer y el último fotograma.

Para video de una sola toma de alta calidad: Hailuo 2.3 es un sólido modelo de imagen única a video conocido por su movimiento suave y naturalista. Si solo tienes una gran foto y no necesitas audio, a menudo produce una calidad por fotograma más alta que los modelos multi-imagen.

Para iterar rápido: Seedance 2.0 Fast es la misma arquitectura del modelo con una inferencia optimizada para funcionar más rápido. Úsalo para probar distintas formulaciones de prompt y combinaciones de imágenes antes de comprometerte con una generación a calidad completa con el Seedance 2.0 estándar.

Foto atmosférica de una mujer de pelo rubio corto sentada en un estudio de noche, con las piernas cruzadas en un sofá con un equipo portátil que muestra una interfaz de generación de video, rodeada de fotogramas de referencia clavados en un tablero de corcho

Empieza a crear tus propios videos

El flujo de trabajo de varias imágenes con audio en Seedance 2.0 es un terreno realmente nuevo para la generación de video con IA. Hace un año, producir un clip de 10 segundos que mantuviera la coherencia de personajes entre varias imágenes de referencia y se sincronizara con una pista de audio requería un equipo de producción completo y software de postproducción. Ahora basta con cuatro archivos subidos y un prompt de texto.

La forma más rápida de dominarlo es hacer experimentos sin mucho en juego. Elige dos fotos que ya tengas en el teléfono, saca un clip de 10 segundos de una pista que te guste y genera algo. Fíjate en dónde las transiciones se ven bruscas y en qué ajustes puedes hacer en la selección de imágenes o en el prompt. La curva de aprendizaje es corta porque el ciclo de retroalimentación es rápido.

Ve a Seedance 2.0 en PicassoIA, sube tus imágenes de referencia, añade tu audio y mira qué sale. La primera generación siempre sorprende.

Compartir este artículo

Elige tu idioma