Comment utiliser Seedance 2.0 avec plusieurs images et de l’audio

Seedance 2.0 de ByteDance accepte plusieurs images de référence et des fichiers audio natifs pour produire des vidéos IA fluides et synchronisées, avec des personnages cohérents d’une scène à l’autre. Cet article présente le flux de travail multimodal complet, de la préparation de vos photos de référence à la synchronisation des temps forts de l’audio avec le mouvement, avec des instructions pas à pas pour utiliser le modèle directement sur PicassoIA.

Comment utiliser Seedance 2.0 avec plusieurs images et de l’audio
Cristian Da Conceicao
Fondateur de Picasso IA

La plupart des modèles de génération de vidéos par IA prennent une seule image et créent du mouvement à partir de celle-ci. Seedance 2.0 de ByteDance fait autre chose : il accepte plusieurs images de référence et une piste audio native dans un seul passage de génération, et produit des vidéos où les personnages restent cohérents d’un plan à l’autre, où les environnements passent naturellement de l’un à l’autre, et où le mouvement répond réellement au rythme et à la cadence de l’audio. C’est le flux de travail qu’attendaient les réalisateurs, les créateurs de contenu et les producteurs de réseaux sociaux, et il est disponible dès maintenant, sans aucune configuration technique.

Plusieurs photos de portrait imprimées disposées sur un bureau en marbre avec un appareil photo hybride, des mains de réalisateur sélectionnant les images à utiliser comme entrée multi-images pour la génération de vidéos IA

Ce qui différencie Seedance 2.0

Avant d’entrer dans le flux de travail, il est utile de comprendre pourquoi l’entrée multi-images compte. La plupart des modèles de génération vidéo sont conditionnés par une seule image : vous leur donnez une photo, ils l’animent. Le personnage, l’environnement et le style visuel de la sortie sont alors figés sur cette image unique. Si vous voulez une vidéo qui montre une personne traversant plusieurs lieux, ou un récit qui alterne entre différentes personnes, vous devez générer chaque clip séparément, puis les assembler au montage.

Seedance 2.0 réunit tout cela en une seule étape.

Système de référence multi-images

Le modèle traite les images multiples comme un ensemble de référence cohérent plutôt que comme des entrées indépendantes. En interne, il construit une identité visuelle commune à partir des images fournies, et s’en sert pour maintenir la cohérence de l’apparence des personnages, la logique de l’éclairage et la cohérence de l’environnement sur toute la durée du clip généré. Si vous fournissez le portrait d’une personne sous le soleil chaud de l’après-midi et une photo de paysage d’une plage au même moment de la journée, le modèle en déduit qu’elles appartiennent à la même scène et génère un mouvement qui les relie sans ruptures brutales.

C’est particulièrement utile pour :

  • les vidéos de personnages, lorsque vous voulez que le même visage apparaisse en mouvement sous plusieurs angles ou poses
  • la narration de marque, avec une identité visuelle cohérente d’un lieu à l’autre
  • la production de clips musicaux, lorsque les différents plans doivent paraître stylistiquement unifiés
  • les Reels pour les réseaux sociaux, qui exigent des enchaînements fluides entre plusieurs scènes sans montage manuel

Prise en charge de l’audio natif

L’intégration audio dans Seedance 2.0 n’est pas un traitement après coup. Le modèle conditionne le mouvement de la vidéo sur la forme d’onde audio pendant la génération. Cela signifie que les temps forts, les changements de tempo et les pics d’amplitude de votre fichier audio influencent directement le timing et l’intensité du mouvement dans la sortie. Un coup de batterie à 0:03 peut déclencher un mouvement de caméra ou un déplacement du sujet à ce moment précis. Une note longue et tenue maintient un mouvement doux et léger.

Gros plan d’une console de mixage audio professionnelle avec des VU-mètres éclairés et des LED de forme d’onde, illustrant les capacités de synchronisation audio nécessaires à la génération vidéo avec Seedance 2.0

Préparer vos images pour une entrée multi-références

Obtenir des images de référence propres et bien préparées est le facteur le plus important pour la qualité du résultat. Le modèle ne peut travailler qu’avec ce que vous lui donnez.

Exigences de résolution et de format

Seedance 2.0 donne les meilleurs résultats avec des images qui respectent ces spécifications :

PropriétéRecommandéMinimum
Résolution1280x720 ou plus512x512
FormatJPG, PNGJPG, PNG
Proportions (format)16:9Quelconque
Taille de fichierMoins de 10 Mo par imageMoins de 20 Mo
ÉclairageCohérent d’une image à l’autreQuelconque

Au-delà des spécifications techniques, le contenu de vos images de référence compte énormément. Des images avec une direction de lumière cohérente, une température de couleur proche et une hauteur de perspective similaire se fondent bien mieux que des images prises dans des conditions très différentes.

Astuce : Si vous prenez des photos spécifiquement pour les utiliser comme références multi-images, réalisez-les en une seule session, sous la même source de lumière naturelle. Un ciel couvert en milieu de journée est idéal, car il produit des ombres douces et sans direction précise qui se fondent facilement d’une image à l’autre.

Combien d’images pouvez-vous utiliser

Seedance 2.0 prend en charge jusqu’à 4 images de référence par génération. Ajouter des images implique un compromis réel sur la qualité :

  • 1 image : fidélité de détail maximale, comportement image vers vidéo standard
  • 2 images : équilibre idéal entre diversité des références et cohérence, parfait pour des paires personnage et lieu
  • 3 images : convient bien aux séquences narratives ; légère hausse des artefacts de fusion aux transitions
  • 4 images : un arc narratif complet en une génération ; exige des images qui partagent une forte cohérence visuelle pour éviter la dérive

Pour la plupart des cas d’usage, 2 à 3 images donnent les meilleurs résultats. Si vous avez besoin de 4 images, assurez-vous qu’au moins 3 d’entre elles partagent une palette de couleurs dominante ou le même sujet.

Jeune femme tenant une tablette qui affiche une grille de six images de référence de portrait dans une interface sombre, debout dans un studio créatif blanc et épuré

Ajouter de l’audio à votre vidéo Seedance 2.0

L’entrée audio est ce qui distingue vraiment ce flux de travail de tout ce que vous pouvez faire avec des modèles image vers vidéo basiques. Utilisée correctement, elle transforme des photos de référence statiques en clips qui paraissent avoir été composés et montés avec intention.

Formats audio acceptés

Seedance 2.0 accepte les formats audio suivants via l’interface de PicassoIA :

  • MP3 (recommandé pour les pistes musicales)
  • WAV (recommandé pour une haute fidélité, notamment pour la parole)
  • AAC (adapté à l’audio compressé provenant d’appareils mobiles)

Gardez vos extraits audio courts et ciblés. Le modèle génère des vidéos d’une durée maximale de 10 secondes dans la version actuelle. Utiliser un segment audio qui correspond à cette durée (ou qui la dépasse de 1 à 2 secondes) donne la synchronisation la plus nette.

Astuce : Découpez votre audio à exactement 10 secondes avant l’import. Choisissez la section la plus forte et la plus riche en rythme de votre morceau. Le modèle réagit surtout aux transitoires et aux temps forts, plutôt qu’aux sons tenus.

Comment l’audio pilote le mouvement

Le modèle n’analyse pas l’audio de manière sémantique. Il n’écoute ni le sens des paroles ni le genre de la musique. Il réagit à l’enveloppe d’énergie acoustique de la forme d’onde. Concrètement, cela signifie :

  • les sections à forte amplitude (temps forts marqués, chutes de guitare, crescendos) déclenchent un mouvement de caméra et du sujet plus marqué
  • les sections à faible amplitude (intros calmes, fondus de sortie) produisent un mouvement plus doux et plus subtil
  • les changements de tempo rapides créent des coupures de mouvement plus fréquentes entre les images de référence
  • les notes isolées et tenues maintiennent l’image plus longtemps, avec une légère parallaxe ou un zoom doux

Ce comportement signifie que la musique riche en percussions produit les vidéos les plus dynamiques visuellement, tandis que l’audio ambiant ou orchestral donne des résultats cinématographiques et lents.

Plan large d’une suite de post-production vidéo professionnelle avec trois moniteurs incurvés affichant des images vidéo fusionnées sur une interface de timeline, éclairage de studio ambré et chaleureux

Utiliser Seedance 2.0 sur PicassoIA

Seedance 2.0 est disponible directement sur PicassoIA, sans configuration d’API, sans configuration de compte ni carte bancaire pour un premier accès. Voici le flux de travail exact.

Étape 1 : ouvrir la page du modèle

Rendez-vous sur la page du modèle Seedance 2.0 sur PicassoIA. Vous verrez l’interface de génération avec trois zones d’import distinctes et un champ de prompt textuel en haut. Si vous avez besoin de résultats plus rapides au prix d’une certaine qualité, Seedance 2.0 Fast est également disponible et suit la même interface.

Étape 2 : importer vos images de référence

Cliquez sur la zone Image Input pour ouvrir le sélecteur de fichiers. Vous pouvez importer les images une à une, ou en sélectionner plusieurs à la fois si votre navigateur le permet. L’interface numérote chaque image importée et affiche une petite miniature. Faites glisser les miniatures pour les réordonner si nécessaire : le modèle considère la première image comme la référence principale et les suivantes comme des éléments de scène secondaires.

Astuce : Placez en première position l’image qui contient votre personnage principal ou l’élément visuel le plus important. Le modèle s’ancre plus fortement sur la première référence.

Étape 3 : importer votre fichier audio

Sous la zone d’import d’images, vous verrez la section Audio Input. Cliquez dessus et sélectionnez votre fichier MP3 ou WAV préparé. L’interface affiche un aperçu simple de la forme d’onde pour vérifier que le fichier s’est bien chargé. Il n’y a pas de lecture d’aperçu ici : assurez-vous donc d’avoir écouté votre extrait audio avant l’import et confirmé qu’il commence au bon moment de votre piste.

Étape 4 : rédiger votre prompt et générer

Le prompt textuel fonctionne avec vos entrées visuelles et audio comme un troisième signal de conditionnement. Concentrez-le sur la description du mouvement et de l’ambiance plutôt que sur la répétition de ce qui est déjà visible dans vos images de référence. Voici de bonnes stratégies de prompt pour une entrée multi-images :

Privilégiez les verbes de mouvement : « panoramique lent à travers la scène, légère dérive de caméra, mouvement naturel du vent dans les cheveux »

Décrivez l’ambiance recherchée : « après-midi d’été cinématographique, chaleureux et détendu, mouvement doux »

Évitez de décrire l’apparence (les images s’en chargent déjà) : N’écrivez pas « une femme aux cheveux bruns debout sur une plage »

Une fois que vous cliquez sur Generate, le traitement prend généralement entre 45 secondes et 3 minutes selon la charge du serveur. La vidéo générée apparaît directement sur la page dès qu’elle est prête.

Profil d’un homme au casque assis à un poste de travail, les yeux fermés dans une concentration intense, avec un moniteur derrière lui affichant une forme d’onde audio synchronisée et une timeline vidéo

Les réglages de paramètres qui comptent

Seedance 2.0 expose plusieurs paramètres qui influencent fortement la qualité du résultat. Ce ne sont pas des retouches facultatives : bien les régler fait la différence entre une vidéo convaincante et une vidéo générique.

Intensité du mouvement

Le curseur motion strength (intensité du mouvement) contrôle la vigueur avec laquelle le modèle anime vos images de référence. L’échelle va généralement de 0 à 1, et le bon réglage dépend entièrement de votre audio :

Type d’audioIntensité de mouvement recommandée
Hip-hop, EDM, pop0,7 à 0,9
Orchestral cinématographique0,3 à 0,5
Ambient, lo-fi0,2 à 0,4
Parole ou voix off0,4 à 0,6
Silencieux (sans audio)0,5 par défaut

Une intensité trop élevée avec un audio lent crée un mouvement artificiel et saccadé. Une intensité trop faible avec un audio énergique gâche le potentiel du conditionnement audio.

Durée et résolution

La version actuelle de Seedance 2.0 propose des durées de 5 secondes et de 10 secondes. Pour les entrées multi-images, 10 secondes est presque toujours le meilleur choix : elles laissent au modèle assez d’images pour passer en douceur d’une image de référence à l’autre, plutôt que de couper brutalement.

La résolution de sortie est par défaut de 1280x720 (HD). Il n’existe pas d’option 4K dans la version actuelle, mais la qualité en HD est vraiment solide pour les réseaux sociaux, YouTube et les présentations.

Vue aérienne en plongée d’un bureau en noyer de réalisateur avec une bande de film 35 mm, des photos de référence éparpillées, un carnet de croquis manuscrits et un disque dur externe

Seedance 2.0 face à des modèles similaires

Comment Seedance 2.0 se situe-t-il par rapport aux autres modèles vidéo multimodaux disponibles sur PicassoIA ?

ModèleMulti-imagesAudio natifDurée de sortieVitesse
Seedance 2.0Oui (jusqu’à 4)Oui5-10 sMoyenne
Seedance 2.0 FastOui (jusqu’à 4)Oui5-10 sRapide
LTX-2.3-ProNonOuiJusqu’à 30 sRapide
Audio to VideoUne seuleOuiVariableRapide
Kling V3NonNon5-10 sMoyenne
Vidu Q3 ProOui (début/fin)Non5-10 sMoyenne
P-VideoUne seuleOuiVariableRapide

En résumé : si vous avez besoin à la fois d’une entrée multi-images ET d’audio natif dans un seul modèle, Seedance 2.0 est actuellement la seule option de la plateforme qui combine ces deux capacités. LTX-2.3-Pro l’emporte en matière de durée de sortie si la synchronisation audio sur une seule image suffit à votre projet.

Deux écrans de moniteur côte à côte : à gauche, une photographie originale en lumière dorée d’une femme ; à droite, l’image vidéo générée par IA à partir de cette photo, avec un flou de bougé naturel

Problèmes courants et solutions

Même avec de bonnes entrées, vous obtiendrez parfois des résultats qui ne correspondent pas à vos attentes. Voici les problèmes les plus fréquents et comment les corriger.

Personnages qui se mélangent

Symptôme : une personne d’une image de référence commence à se transformer en la personne d’une autre image de référence en cours de clip.

Cause : le modèle traite les différents visages comme des variantes d’un même personnage plutôt que comme des sujets distincts.

Solution : assurez-vous que vos images de référence présentent des sujets nettement différenciés. Si les deux images montrent des personnes à l’apparence proche (même couleur de cheveux, âge similaire), le modèle peine à maintenir la séparation. Essayez d’ajouter une troisième image qui établit une frontière environnementale ou contextuelle claire entre les sujets. Sinon, limitez les entrées à plusieurs personnes aux scénarios où chaque personne apparaît dans un décor nettement différent.

L’audio ne se synchronise pas avec le mouvement

Symptôme : la vidéo générée avance à un rythme constant, quel que soit le niveau d’énergie de l’audio.

Cause : dans la plupart des cas, il s’agit d’un problème de réglage de l’intensité du mouvement. Si elle est fixée en dessous de 0,4, le modèle atténue les variations pilotées par l’audio.

Solution : augmentez l’intensité du mouvement à au moins 0,6 et relancez la génération. Vérifiez également que votre fichier audio n’est pas normalisé à un niveau uniforme : le modèle réagit à la dynamique, donc un audio très compressé, sans crêtes, produira un mouvement plat. Une normalisation légère à -6 LUFS, plutôt que le standard de diffusion de -14 LUFS, donne au modèle davantage d’informations dynamiques à exploiter.

Les images ne font pas de transition en douceur

Symptôme : la vidéo coupe brutalement entre les images de référence au lieu de faire une transition.

Solution : choisissez l’option de 10 secondes plutôt que celle de 5 secondes. Les durées courtes ne laissent pas au modèle assez d’images pour interpoler en douceur. Vérifiez aussi que vos images partagent au moins un repère visuel fort (une tonalité de fond similaire, une direction de lumière cohérente ou le même sujet).

Gros plan macro extrême de l’élément frontal d’un objectif d’appareil photo professionnel reflétant trois portraits de visages humains déformés sur sa surface en verre multicouche, symbolisant la génération vidéo multi-références

Autres modèles à essayer

Seedance 2.0 couvre mieux que tout autre modèle disponible actuellement le cas d’usage multi-images plus audio. Selon les besoins précis de votre projet, voici toutefois quelques modèles de PicassoIA qui méritent d’être connus :

Pour l’animation d’une seule image pilotée par l’audio : Lightricks Audio to Video prend une seule image et l’anime pour correspondre à un fichier audio. Ce modèle est spécialisé uniquement dans la synchronisation audiovisuelle et produit une synchronisation plus propre sur des vidéos à sujet unique qu’un modèle multi-images.

Pour le contrôle par image de début et de fin : Vidu Q3 Pro accepte une image de début et une image de fin, puis génère le mouvement interpolé entre les deux. Pas d’entrée audio, mais excellent pour les transitions de scène contrôlées lorsque vous savez exactement à quoi doivent ressembler la première et la dernière image.

Pour une vidéo haute qualité en plan unique : Hailuo 2.3 est un modèle image vers vidéo performant, réputé pour son mouvement fluide et naturel. Si vous n’avez qu’une seule belle photo et aucune exigence audio, il produit souvent une qualité par image plus élevée que les modèles multi-images.

Pour itérer rapidement : Seedance 2.0 Fast repose sur la même architecture de modèle, avec une inférence optimisée pour la vitesse. Utilisez-le pour tester différentes formulations de prompt et combinaisons d’images avant de lancer une génération complète avec le Seedance 2.0 standard.

Plan d’ambiance en studio, en soirée, d’une femme aux cheveux courts blonds assise en tailleur sur un canapé avec un ordinateur portable affichant une interface de génération vidéo, entourée d’images de référence épinglées sur un panneau de liège

Commencez à créer vos propres vidéos

Le flux de travail multi-images plus audio de Seedance 2.0 est vraiment un territoire nouveau pour la génération de vidéos par IA. Il y a un an, produire un clip de 10 secondes qui conservait la cohérence des personnages à travers plusieurs images de référence et se synchronisait sur une piste audio exigeait une équipe de production complète et un logiciel de post-production. Aujourd’hui, il suffit de quatre fichiers importés et d’un prompt textuel.

La façon la plus rapide de bien maîtriser cet outil est de faire des essais sans enjeu. Choisissez deux photos que vous avez déjà sur votre téléphone, prélevez un extrait de 10 secondes d’un morceau que vous aimez, et générez quelque chose. Observez où les transitions paraissent brutales, puis ajustez la sélection des images ou le prompt. La courbe d’apprentissage est courte, car la boucle de retour est rapide.

Rendez-vous sur Seedance 2.0 sur PicassoIA, importez vos images de référence, ajoutez votre audio et découvrez le résultat. La première génération est toujours surprenante.

Partager cet article

Choisissez votre langue