La mayoría de los modelos de video con IA toman una imagen y generan movimiento a partir de ella. Seedance 2.0 de ByteDance hace algo fundamentalmente distinto: acepta varias imágenes de referencia y una pista de audio nativa en una sola pasada de generación, y produce videos en los que los personajes se mantienen coherentes entre tomas, los entornos cambian de forma natural y el movimiento responde de verdad a los golpes y al ritmo del audio. Es el flujo de trabajo que cineastas, creadores de contenido y productores de redes sociales llevaban tiempo esperando, y está disponible ahora mismo sin ninguna configuración técnica.

Qué hace diferente a Seedance 2.0
Antes de entrar en el flujo de trabajo, conviene entender por qué importa la entrada multi-imagen. La mayoría de los modelos de generación de video están condicionados por un solo fotograma: les das una foto y la animan. El personaje, el entorno y el estilo visual del resultado quedan fijados a ese único fotograma. Si quieres un video en el que una persona camine por varios lugares, o una narrativa que alterne entre personas distintas, tienes que generar cada clip por separado y luego unirlos en la postproducción.
Seedance 2.0 reduce todo eso a un solo paso.
Sistema de referencia multi-imagen
El modelo procesa las imágenes como un conjunto de referencia coherente, no como entradas independientes. Internamente, construye una identidad visual compartida a partir de las imágenes que le proporcionas, y las usa para mantener la coherencia de la apariencia de los personajes, la lógica de iluminación y la coherencia del entorno a lo largo de todo el clip generado. Si le das a la vez un retrato de una persona bajo el sol cálido de la tarde y una foto de paisaje de una playa a la misma hora del día, el modelo deduce que pertenecen a la misma escena y genera un movimiento que las conecta sin saltos bruscos.
Esto es especialmente útil para:
- Videos de personajes en los que quieres que el mismo rostro aparezca en movimiento desde varios ángulos o poses
- Narrativa de marca con una identidad visual coherente en distintas ubicaciones
- Producción de videoclips musicales en los que las distintas tomas deben parecer estilísticamente unificadas
- Reels para redes sociales que necesitan cortes fluidos entre varias escenas sin edición manual
Compatibilidad con audio nativo
La integración de audio en Seedance 2.0 no es un postprocesado. El modelo condiciona el movimiento del video a la forma de onda del audio durante la generación. Esto significa que los golpes, los cambios de tempo y los picos de amplitud de tu archivo de audio influyen directamente en el momento e intensidad del movimiento del resultado. Un golpe de batería en el segundo 0:03 puede provocar un movimiento de cámara o de sujeto justo en ese instante. Una nota larga y sostenida mantiene el movimiento suave y tranquilo.

Cómo preparar tus imágenes para la entrada multi-referencia
Tener imágenes de referencia limpias y bien preparadas es el factor más importante para la calidad del resultado. El modelo solo puede trabajar con lo que le das.
Requisitos de resolución y formato
Seedance 2.0 funciona mejor con imágenes que cumplan estas especificaciones:
| Propiedad | Recomendado | Mínimo |
|---|
| Resolución | 1280x720 o superior | 512x512 |
| Formato | JPG, PNG | JPG, PNG |
| Relación de aspecto | 16:9 | Cualquiera |
| Tamaño de archivo | Menos de 10 MB por imagen | Menos de 20 MB |
| Iluminación | Constante entre imágenes | Cualquiera |
Más allá de las especificaciones técnicas, el contenido de tus imágenes de referencia importa muchísimo. Las imágenes con dirección de luz constante, temperatura de color similar y altura de perspectiva coherente se fusionan mucho mejor que las tomadas en condiciones muy distintas.
Consejo: Si estás haciendo fotos específicamente para usarlas como referencias multi-imagen, tómalas en una sola sesión bajo la misma fuente de luz natural. Los cielos nublados del mediodía son ideales porque producen sombras suaves y sin dirección que se mezclan con facilidad entre fotogramas.
Cuántas imágenes puedes usar
Seedance 2.0 admite hasta 4 imágenes de referencia por generación. Añadir más tiene una contrapartida importante en calidad:
- 1 imagen: máxima fidelidad de detalle, comportamiento estándar de imagen a video
- 2 imágenes: equilibrio ideal entre diversidad de referencia y coherencia, muy bueno para pares de personaje y lugar
- 3 imágenes: funciona bien para secuencias narrativas; ligero aumento de artefactos de fusión en las transiciones
- 4 imágenes: arco narrativo completo en una sola generación; necesita imágenes con una fuerte similitud visual para evitar desviaciones
En la mayoría de los casos, de 2 a 3 imágenes da los mejores resultados. Si necesitas 4 imágenes, asegúrate de que al menos 3 de ellas compartan una paleta de color dominante o el mismo sujeto.

Cómo añadir audio a tu video de Seedance 2.0
La entrada de audio es lo que realmente separa este flujo de trabajo de cualquier cosa que puedas hacer con modelos básicos de imagen a video. Usada bien, convierte fotos de referencia estáticas en clips que parecen musicalizados y editados con intención.
Formatos de audio aceptados
Seedance 2.0 acepta los siguientes formatos de audio a través de la interfaz de PicassoIA:
- MP3 (recomendado para pistas musicales)
- WAV (recomendado para audio de alta fidelidad, sobre todo voz)
- AAC (adecuado para audio comprimido de dispositivos móviles)
Mantén tus clips de audio cortos y centrados. El modelo genera videos de hasta 10 segundos en la implementación actual, así que usar un segmento de audio que coincida con esa duración (o que la supere entre 1 y 2 segundos) da la sincronización más limpia.
Consejo: Recorta tu audio a exactamente 10 segundos antes de subirlo. Usa la sección más intensa y rítmicamente interesante de tu pista. El modelo responde con más claridad a los transitorios y a los golpes que a los tonos sostenidos.
Cómo el audio impulsa el movimiento
El modelo no analiza el audio de forma semántica. No escucha el significado de las palabras ni el género de la música. En cambio, responde a la envolvente de energía acústica de la forma de onda. Esto es lo que significa en la práctica:
- Secciones de alta amplitud (golpes fuertes, caídas de guitarra, crescendos) activan un movimiento de cámara y del sujeto más intenso
- Secciones de baja amplitud (intros tranquilas, fundidos de salida) producen un movimiento más suave y sutil
- Cambios rápidos de tempo crean cortes de movimiento más frecuentes entre fotogramas de referencia
- Notas individuales sostenidas mantienen el fotograma actual más tiempo, con un paralaje o zoom suave
Este comportamiento significa que la música con mucha percusión produce los videos visualmente más dinámicos, mientras que el audio ambiental u orquestal crea resultados cinematográficos y de movimiento lento.

Cómo usar Seedance 2.0 en PicassoIA
Seedance 2.0 está disponible directamente en PicassoIA sin configuración de API, sin configuración de la cuenta y sin tarjeta de crédito para el acceso inicial. Este es el flujo de trabajo exacto.
Paso 1: abre la página del modelo
Ve a la página del modelo Seedance 2.0 en PicassoIA. Verás la interfaz de generación con tres zonas de subida diferenciadas y un campo de prompt de texto en la parte superior. Si necesitas resultados más rápidos a cambio de algo de calidad, Seedance 2.0 Fast también está disponible y sigue la misma interfaz.
Paso 2: sube tus imágenes de referencia
Haz clic en el área Image Input para abrir el selector de archivos. Puedes subir las imágenes una a una o seleccionar varias a la vez si tu navegador lo permite. La interfaz numera cada imagen subida y muestra una pequeña vista previa en miniatura. Arrastra las miniaturas para reordenarlas si es necesario: el modelo trata la primera imagen como la referencia principal y las siguientes como elementos secundarios de la escena.
Consejo: Coloca en primera posición la imagen que contiene a tu personaje principal o el elemento visual más importante. El modelo se ancla con más fuerza a la primera referencia.
Paso 3: sube tu archivo de audio
Debajo de la zona de subida de imágenes verás la sección Audio Input. Haz clic en ella y selecciona tu archivo MP3 o WAV preparado. La interfaz muestra una vista previa sencilla de la forma de onda para que confirmes que el archivo se cargó correctamente. Aquí no hay reproducción previa, así que asegúrate de haber escuchado tu clip de audio antes de subirlo y de que empieza en el momento correcto de tu pista.
Paso 4: escribe tu prompt de texto y genera
El prompt de texto funciona junto con tus entradas visuales y de audio como una tercera señal de condicionamiento. Mantenlo centrado en la descripción del movimiento y el ambiente en lugar de repetir lo que ya se ve en tus imágenes de referencia. Buenas estrategias de prompt para la entrada multi-imagen:
Céntrate en verbos de movimiento:
"panorámica lenta por la escena, deriva suave de cámara, movimiento natural del viento en el pelo"
Describe el ambiente que buscas:
"tarde de verano cinematográfica, cálida y relajada, movimiento suave"
Evita describir la apariencia (las imágenes ya se encargan de eso):
No escribas "una mujer con pelo castaño de pie en una playa"
Una vez que hagas clic en Generate, el procesamiento suele tardar entre 45 segundos y 3 minutos, según la carga del servidor. El video resultante aparecerá directamente en la página cuando esté listo.

Ajustes de parámetros que importan
Seedance 2.0 expone varios parámetros que afectan de forma notable a la calidad del resultado. No son ajustes opcionales: acertar con ellos es la diferencia entre un video convincente y uno genérico.
Intensidad de movimiento
El control deslizante de motion strength regula con qué intensidad anima el modelo tus imágenes de referencia. La escala suele ir de 0 a 1, y el valor adecuado depende por completo de tu audio:
| Tipo de audio | Intensidad de movimiento recomendada |
|---|
| Hip-hop, EDM, pop | 0,7 a 0,9 |
| Orquestal cinematográfico | 0,3 a 0,5 |
| Ambient, lo-fi | 0,2 a 0,4 |
| Voz o narración | 0,4 a 0,6 |
| Silencioso (sin audio) | 0,5 por defecto |
Si pones la intensidad de movimiento demasiado alta con un audio lento, se generan movimientos antinaturales y a tirones. Si la pones demasiado baja con un audio enérgico, desperdicias el potencial del condicionamiento de audio.
Duración y resolución
La implementación actual de Seedance 2.0 ofrece duraciones de 5 segundos y 10 segundos. Para entradas multi-imagen, 10 segundos es casi siempre la mejor opción: le da al modelo suficientes fotogramas para hacer transiciones suaves entre tus imágenes de referencia en lugar de cortar de forma abrupta.
La resolución de salida es 1280x720 (HD) por defecto. En la versión actual no hay opción 4K, pero la calidad en HD es realmente buena para redes sociales, YouTube y presentaciones.

Seedance 2.0 frente a modelos similares
¿Cómo se compara Seedance 2.0 con otros modelos de video multimodales disponibles en PicassoIA?
La conclusión: si necesitas entrada multi-imagen y audio nativo en un solo modelo, Seedance 2.0 es actualmente la única opción de la plataforma que combina ambas capacidades. LTX-2.3-Pro gana en duración de salida si para tu proyecto basta con sincronizar el audio con una sola imagen.

Problemas habituales y soluciones
Incluso con buenas entradas, a veces obtendrás resultados que no coinciden con lo que esperabas. Estos son los problemas más frecuentes y cómo solucionarlos.
Personajes que se mezclan incorrectamente
Síntoma: Una persona de una imagen de referencia empieza a transformarse en la persona de otra imagen de referencia a mitad del clip.
Causa: El modelo trata los distintos rostros como variaciones del mismo personaje en lugar de como sujetos distintos.
Solución: Asegúrate de que tus imágenes de referencia tengan sujetos claramente diferenciados. Si ambas muestran personas de aspecto parecido (mismo color de pelo, edad similar), el modelo tiene dificultades para mantener la separación. Prueba a añadir una tercera imagen que establezca un límite ambiental o contextual claro entre los sujetos. También puedes reservar las entradas con varias personas para escenarios en los que cada persona aparezca en un entorno claramente distinto.
El audio no se sincroniza con el movimiento
Síntoma: El video generado se mueve a un ritmo constante sin importar el nivel de energía del audio.
Causa: En la mayoría de los casos, es un problema de la configuración de intensidad de movimiento. Si la intensidad de movimiento está por debajo de 0,4, el modelo amortigua la variación impulsada por el audio.
Solución: Sube la intensidad de movimiento a al menos 0,6 y vuelve a generar. Comprueba también que tu archivo de audio no esté normalizado en volumen a un nivel plano: el modelo responde al rango dinámico, así que un audio muy comprimido y sin picos producirá resultados de movimiento planos. Una normalización ligera a -6 LUFS, en lugar del estándar de streaming de -14 LUFS, le da al modelo más información dinámica con la que trabajar.
Las imágenes no hacen transiciones suaves
Síntoma: El video corta de forma abrupta entre las imágenes de referencia en lugar de hacer una transición.
Solución: Usa la opción de 10 segundos en lugar de la de 5 segundos. Las duraciones cortas no dan al modelo suficientes fotogramas para interpolar con suavidad. Comprueba también que tus imágenes compartan al menos un ancla visual fuerte (un tono de fondo similar, una dirección de luz constante o el mismo sujeto).

Otros modelos que vale la pena probar
Seedance 2.0 cubre el caso de uso de varias imágenes con audio mejor que cualquier otra opción disponible actualmente, pero según las necesidades concretas de tu proyecto, estos modelos de PicassoIA merecen tu atención:
Para animación de una sola imagen guiada por audio: Lightricks Audio to Video toma una sola imagen y la anima para que coincida con un archivo de audio. El modelo está especializado únicamente en la sincronización audiovisual y produce una sincronización más limpia en videos de un solo sujeto que un modelo multi-imagen.
Para control de fotograma inicial y final: Vidu Q3 Pro acepta una imagen de inicio y una de fin y genera el movimiento interpolado entre ambas. No tiene entrada de audio, pero es excelente para transiciones de escena controladas en las que sabes exactamente cómo deben verse el primer y el último fotograma.
Para video de una sola toma de alta calidad: Hailuo 2.3 es un sólido modelo de imagen única a video conocido por su movimiento suave y naturalista. Si solo tienes una gran foto y no necesitas audio, a menudo produce una calidad por fotograma más alta que los modelos multi-imagen.
Para iterar rápido: Seedance 2.0 Fast es la misma arquitectura del modelo con una inferencia optimizada para funcionar más rápido. Úsalo para probar distintas formulaciones de prompt y combinaciones de imágenes antes de comprometerte con una generación a calidad completa con el Seedance 2.0 estándar.

Empieza a crear tus propios videos
El flujo de trabajo de varias imágenes con audio en Seedance 2.0 es un terreno realmente nuevo para la generación de video con IA. Hace un año, producir un clip de 10 segundos que mantuviera la coherencia de personajes entre varias imágenes de referencia y se sincronizara con una pista de audio requería un equipo de producción completo y software de postproducción. Ahora basta con cuatro archivos subidos y un prompt de texto.
La forma más rápida de dominarlo es hacer experimentos sin mucho en juego. Elige dos fotos que ya tengas en el teléfono, saca un clip de 10 segundos de una pista que te guste y genera algo. Fíjate en dónde las transiciones se ven bruscas y en qué ajustes puedes hacer en la selección de imágenes o en el prompt. La curva de aprendizaje es corta porque el ciclo de retroalimentación es rápido.
Ve a Seedance 2.0 en PicassoIA, sube tus imágenes de referencia, añade tu audio y mira qué sale. La primera generación siempre sorprende.