Seedance 2.0 n’est pas une nouvelle tentative de ByteDance pour construire un modèle générique de texte vers vidéo. C’est une réponse directe à la plus grande critique que les créateurs adressaient aux générations précédentes de vidéo IA : le mouvement semblait faux. Les corps flottaient. Les caméras dérivaient sans but. La physique était cassée. Seedance 2.0 traite ce problème grâce à deux systèmes parallèles qui travaillent ensemble : une architecture de mouvement à double flux et une couche structurée de contrôle de caméra. Comprendre les deux changera la manière dont vous écrivez vos prompts et ce que vous attendez du résultat.

Sur quoi Seedance 2.0 repose réellement
ByteDance a entraîné Seedance 2.0 sur un ensemble de données considérable de vidéos de haute qualité associées à des annotations de mouvement précises. Contrairement aux modèles qui traitent une vidéo comme une suite d’images indépendantes, Seedance 2.0 considère chaque génération comme un événement de mouvement : un processus physique borné dans le temps, avec des conditions de départ définies, une trajectoire et un état final.
L’architecture est décrite en interne comme un système à double flux. Un flux traite le contenu sémantique (ce que sont les sujets, à quoi ils ressemblent, ce qu’ils font). L’autre traite les champs de mouvement (la façon dont les pixels se déplacent dans l’espace au fil du temps). Ces flux sont entraînés séparément, puis fusionnés pendant l’inférence.
Cette séparation compte énormément. Dans un modèle à flux unique, le mouvement et l’apparence se disputent les mêmes paramètres. Un modèle qui tente de conserver le visage d’un personnage pendant 8 secondes tente aussi de décrire un travelling réaliste. Ces deux objectifs entrent en conflit pendant l’entraînement. Dans Seedance 2.0, ils disposent de représentations distinctes.
💡 L’architecture à double flux explique pourquoi Seedance 2.0 peut maintenir l’identité des sujets sur des clips plus longs. Le flux d’apparence n’est pas perturbé par l’estimation du mouvement.

Mouvement du sujet et mouvement de la scène
Toute vidéo comporte deux types distincts de mouvement : celui des sujets dans la scène et celui de la caméra elle-même par rapport à la scène. La plupart des modèles de vidéo IA antérieurs confondaient les deux. Seedance 2.0 les sépare explicitement.
Le mouvement du sujet englobe tout ce qui bouge dans le cadre : une personne qui marche, de l’eau qui coule, un drapeau qui ondule. Le mouvement de la scène résulte du déplacement de la caméra : un panoramique qui fait glisser tout le cadre vers la gauche, un zoom qui agrandit uniformément toute l’image, une inclinaison qui fait apparaître le ciel.
Lorsque vous soumettez à Seedance 2.0 le prompt « une femme qui court dans un parc avec un plan suivi latéral », le modèle génère deux champs de mouvement distincts : l’un pour la foulée biomécaniquement plausible de la femme, l’autre pour le mouvement latéral de suivi de la caméra. Ces champs sont composés au moment de l’inférence, au lieu d’être générés comme un flux unique et indifférencié de pixels.
Le résultat concret est que le mouvement du sujet ne se dégrade pas lorsque le mouvement de caméra est complexe. Vous pouvez obtenir un panoramique rapide sur une scène tandis qu’un sujet au premier plan conserve un mouvement anatomiquement correct, sans que les bras et les jambes ne deviennent flous ou déformés.
Cohérence temporelle d’une image à l’autre
La cohérence temporelle mesure la capacité d’un modèle à conserver l’identité et la physique sur l’ensemble des images d’un clip. C’est la raison pour laquelle les anciens modèles produisaient des personnages dont le visage changeait entre les secondes 2 et 4, ou dont les mains gagnaient ou perdaient des doigts en plein mouvement.
Seedance 2.0 aborde la cohérence temporelle grâce à une attention au niveau de l’image avec des fenêtres de contexte étendues. Plutôt que de générer chaque image en ne prêtant attention qu’aux images immédiatement précédentes, il s’intéresse à un historique bien plus long. Cela signifie que les décisions concernant l’apparence et la position sont prises en se référant simultanément à de nombreuses images antérieures.
Le résultat se voit dans les sorties : les visages restent stables sur toute la durée du clip, les plis des vêtements se déforment physiquement, et les cheveux bougent avec un poids et une inertie cohérents. Le modèle « se souvient » de l’apparence d’un sujet à la seconde 1 lorsqu’il génère la seconde 7.

Pourquoi le mouvement rapide paraît différent ici
L’une des caractéristiques remarquables de Seedance 2.0 est la façon dont il gère le mouvement à haute vélocité. La plupart des modèles de texte vers vidéo peinent avec les mouvements rapides, car les vecteurs de flux optique deviennent très grands entre images adjacentes, ce qui dépasse la capacité du modèle à maintenir une cohérence sémantique.
Seedance 2.0 utilise une normalisation de l’amplitude du mouvement pendant l’entraînement. Les scènes à mouvement rapide et lent sont échantillonnées avec des stratégies de pondération différentes, afin que le modèle développe des représentations solides des deux extrêmes. Un sprinteur à pleine vitesse et une personne immobile sont tous deux traités sans que le modèle retombe sur un mouvement artificiellement ralenti (un défaut courant chez les modèles concurrents) ou ne produise des images de mouvement rapide floues et incohérentes.
| Type de mouvement | Modèle d’IA typique | Seedance 2.0 |
|---|
| Mouvement lent | Bon | Excellent |
| Marche à vitesse moyenne | Moyen | Excellent |
| Course et action rapides | Médiocre, souvent flou | Bon à excellent |
| Panoramique pendant l’action | Souvent déformé | Stable, séparé |
| Eau et dynamique des fluides | Souvent défectueux | Bon |
Le système de contrôle de caméra
Types de mouvements de caméra disponibles
Seedance 2.0 prend en charge un contrôle explicite de la caméra grâce à des prompts en langage naturel et, selon l’interface, à des paramètres de caméra structurés. Le modèle a été entraîné sur des données de trajectoires de caméra annotées, ce qui signifie qu’il a intégré la physique des vrais dispositifs de prise de vue.
Les mouvements suivants sont bien pris en charge :
- Panoramique : rotation horizontale autour de l’axe vertical de la caméra. « Panoramique à gauche à travers la pièce. »
- Inclinaison : rotation verticale autour de l’axe horizontal de la caméra. « Inclinez vers le haut pour révéler le sommet de la montagne. »
- Travelling : déplacement physique de la caméra dans l’espace. « Travelling avant vers le sujet. »
- Zoom : modification de la distance focale, et non déplacement physique. « Zoom lent avant sur son visage. »
- Orbite/Arc : la caméra décrit un arc autour d’un sujet. « Orbite dans le sens horaire autour de la voiture, au niveau du sol. »
- Grue/Pédestal : la caméra se déplace verticalement. « Mouvement de grue depuis le niveau de la rue jusqu’au toit. »
- Caméra à l’épaule : simulation d’un mouvement de caméra organique. « Caméra à l’épaule, légèrement instable comme un reportage documentaire. »
💡 Combiner deux mouvements de caméra dans un seul prompt fonctionne bien avec Seedance 2.0. « Travelling avant lent avec une légère inclinaison vers le haut » produit un mouvement composé cohérent. Évitez d’en combiner plus de deux simultanément.

Comment écrire les instructions de caméra dans les prompts
Les instructions de caméra dans les prompts de Seedance 2.0 fonctionnent au mieux lorsqu’elles sont précises, séquentielles et fondées sur le vocabulaire cinématographique réel. Des instructions vagues comme « déplacez la caméra » produisent des résultats imprévisibles.
Modèles de prompts efficaces :
- Indiquez d’abord le type de mouvement : « Plan suivi lent vers la gauche… »
- Ajoutez des indications de rythme : « …progressivement, sur toute la durée du clip… »
- Décrivez la relation avec le sujet : « …en gardant le sujet centré dans le cadre… »
- Incluez une référence de focale : « …avec un grand-angle équivalent à 35 mm. »
Modèles à éviter :
- « Rendez-le cinématographique » (trop vague, aucune instruction de mouvement précise)
- « Caméra dynamique » (ambigu)
- « Caméra en mouvement » (trop générique)
- Combiner plus de deux mouvements de caméra à la fois
Le modèle répond au vocabulaire cinématographique standard. Si vous raisonnez en termes d’instructions d’un vrai opérateur de caméra sur un plateau de tournage, vos prompts seront interprétés avec une bien meilleure fidélité.
À quoi ressemblent les plans orbitaux et de suivi
Les plans orbitaux, où la caméra se déplace en arc de cercle autour d’un sujet immobile ou en mouvement, comptent parmi les capacités les plus impressionnantes de Seedance 2.0. Le modèle conserve une distorsion de perspective correcte tout au long de l’arc, ce qui signifie que les sujets au centre de l’orbite semblent tourner naturellement, au lieu de paraître se dilater ou se déformer.
Les plans de suivi qui accompagnent un sujet en mouvement exigent du modèle qu’il calcule simultanément la trajectoire de mouvement du sujet et la trajectoire correspondante de la caméra. Seedance 2.0 y parvient en liant le champ de mouvement de la caméra au champ de mouvement du sujet pendant la génération, créant une relation interdépendante où la trajectoire de la caméra répond dynamiquement aux estimations de position du sujet.

Seedance 2.0 face à la concurrence
Comment Seedance 2.0 se situe-t-il par rapport aux autres modèles performants disponibles aujourd’hui ? La réponse honnête est que chaque modèle a ses forces, et que le bon choix dépend de ce qu’exigent vos séquences.
Kling v3 Motion Control propose un contrôle de caméra explicite, basé sur des images clés, que certains créateurs trouvent plus prévisible que les instructions de caméra en langage naturel. Si vous avez besoin d’une trajectoire de caméra très précise, l’interface de contrôle structurée de Kling vous offre des résultats plus déterministes.
Video 01 Director de Minimax se spécialise dans le contrôle des mouvements de caméra et excelle particulièrement dans les mouvements cinématographiques spectaculaires comme les plans de grue et les paysages panoramiques. Sa force réside dans le mouvement de caméra ; la physique du mouvement des sujets est moins prioritaire.
Veo 3 produit des rendus très photoréalistes et intègre la génération audio native, à laquelle Seedance 2.0 n’accorde pas la même priorité. Pour des séquences de style documentaire avec un son d’ambiance synchronisé, Veo 3 est convaincant.
| Caractéristique | Seedance 2.0 | Kling v3 Motion Control | Video 01 Director | Veo 3 |
|---|
| Qualité du mouvement des sujets | Excellent | Bon | Moyen | Excellent |
| Précision du contrôle de caméra | Bon | Excellent | Excellent | Bon |
| Cohérence temporelle | Excellent | Bon | Bon | Excellent |
| Audio natif | Limité | Non | Non | Oui |
| Gestion des mouvements rapides | Excellent | Bon | Moyen | Bon |
| Souplesse des prompts | Élevée | Moyenne | Moyenne | Élevée |

Ses limites
Aucun modèle n’est sans limites. Seedance 2.0 présente des modes de défaillance spécifiques qu’il vaut la peine de connaître avant de vous engager dans un flux de travail.
Les scènes complexes à plusieurs sujets, avec trois sujets ou plus qui bougent indépendamment, peuvent produire des artefacts lorsque le modèle confond les champs de mouvement entre les sujets. Une scène de foule sera convaincante. Une scène où trois personnages distincts exécutent simultanément chacun une action précise différente est plus difficile à réussir.
Les clips très longs, au-delà de 10 secondes, montrent parfois une dérive de l’apparence des sujets lorsque le contexte d’attention étendu atteint ses limites. Pour les clips qui exigent plus de 8 à 10 secondes d’identité stable du sujet, générer plusieurs segments plus courts puis les monter ensemble donne de meilleurs résultats.
Les gros plans extrêmes avec mouvement de caméra rapide peuvent produire des micro-tremblements, en particulier dans les scènes à texture fine comme le tissu ou les cheveux. Un panoramique rapide combiné à un cadrage macro serré pousse le système de séparation du mouvement au-delà de sa zone de confort.
Les changements d’éclairage au sein d’un clip (comme le passage d’une scène d’intérieur à une scène d’extérieur) sont parfois gérés de façon incohérente, le modèle produisant des variations d’éclairage brusques plutôt que progressives.
💡 Pour de meilleurs résultats avec Seedance 2.0 : concentrez vos clips sur un ou deux sujets, visez des sorties de 5 à 8 secondes, et soyez précis sur le mouvement de caméra en langage naturel.

Seedance 2.0 est disponible directement sur PicassoIA, aux côtés de la variante plus rapide Seedance 2.0 Fast. Voici comment passer du prompt au résultat efficacement.
Étape 1 : accéder au modèle
Rendez-vous sur Seedance 2.0 sur PicassoIA depuis la collection texte vers vidéo. Vous verrez un champ de saisie de prompt textuel et des options de résolution. Aucune liaison de compte ni configuration de clé API n’est nécessaire, au-delà de votre compte PicassoIA.
Étape 2 : rédiger votre prompt
Structurez votre prompt en trois couches :
- Mise en scène : quel est l’environnement, le moment de la journée et l’éclairage ? « Un toit méditerranéen baigné de soleil à midi. »
- Description du sujet : qui ou quoi se trouve dans la scène et que fait-il ? « Une femme en robe de lin blanc verse un espresso à une petite table ronde. »
- Instruction de caméra : que fait la caméra ? « Travelling arrière lent, en partant de très près de la tasse de café et en s’élargissant progressivement pour révéler tout le toit et la skyline de la ville en contrebas. »
Chaque couche donne à l’architecture à double flux de Seedance 2.0 les informations dont elle a besoin, sans ambiguïté.
Étape 3 : choisir la résolution et la durée
PicassoIA expose les principaux paramètres de génération :
- Résolution : 720p est plus rapide ; 1080p produit un détail de sujet plus net, au prix d’un temps de génération plus long. Pour les contenus riches en mouvement, 720p suffit dans la plupart des cas.
- Durée : 5 secondes constituent le juste équilibre pour la qualité du mouvement des sujets. 8 secondes conviennent bien aux plans dominés par la caméra avec moins de mouvement du sujet.
- Format : 16:9 pour le paysage, 9:16 pour le vertical et les contenus sociaux, 1:1 pour les formats carrés.
Étape 4 : itérer par petites modifications
La méthode d’itération la plus efficace avec Seedance 2.0 consiste à modifier une seule variable à la fois. Si le mouvement du sujet convient mais que le mouvement de caméra est incorrect, ajustez uniquement l’instruction de caméra lors de votre essai suivant. Si les deux posent problème, corrigez d’abord la mise en scène, puis affinez à partir de là.
💡 Conservez le texte exact de tout prompt qui produit un résultat qui vous plaît. Un prompt bien construit produit de manière fiable des résultats dans la même gamme de qualité, même si les sorties individuelles varient légèrement.
Vous pouvez aussi essayer Seedance 1.5 Pro ou Seedance 1 Pro si vous souhaitez comparer la gestion du mouvement de la génération précédente avec la nouvelle architecture. L’amélioration du contrôle de caméra entre la version 1 et la version 2 est considérable et immédiatement visible dans les comparaisons côte à côte.

Commencez à créer dès maintenant
L’écart entre la compréhension du fonctionnement de Seedance 2.0 et sa mise en œuvre dans vos propres projets n’est qu’à un prompt de distance. L’architecture de mouvement à double flux et le système de contrôle de caméra ne sont pas des caractéristiques abstraites : ils se traduisent immédiatement dans la qualité de votre premier résultat, dès que vous rédigez votre prompt avec la bonne structure.
PicassoIA vous donne accès à Seedance 2.0 et Seedance 2.0 Fast côte à côte, afin que vous puissiez comparer le modèle complet à la version optimisée pour la vitesse selon votre cas d’usage. La plateforme vous donne aussi accès à des alternatives comme Kling v3 Motion Control et Video 01 Director si vous voulez tester la façon dont différentes approches architecturales traitent le même prompt.
La meilleure façon d’affiner votre intuition sur le mouvement en vidéo IA consiste à générer la même description de scène avec plusieurs modèles et à comparer directement les résultats. Choisissez un sujet à mouvement rapide, spécifiez un mouvement de caméra non trivial, et voyez quel modèle garde les deux sans défaut. Ce seul test vous en apprendra plus que n’importe quelle analyse écrite.
