Comment créer des vidéos IA avec des personnages cohérents dans Veo 3.1
Veo 3.1 peut produire des vidéos IA aux personnages cohérents, à condition de s’appuyer sur la bonne architecture de prompt. Cet article détaille la méthode du character bible, les techniques de verrouillage du seed, les flux de travail multi-scènes et les meilleurs modèles de PicassoIA pour conserver une identité visuelle stable dans chaque clip que vous générez.
Garder le même personnage d’un clip vidéo IA à l’autre est l’un des problèmes les plus difficiles de la production vidéo par IA aujourd’hui. Dans une scène, votre protagoniste a des yeux marron chauds et des cheveux noirs mi-longs. Dans la suivante, elle a les yeux plus clairs, une autre forme de mâchoire, et sa tenue a complètement changé. Cela arrive avec presque tous les modèles, et pour quiconque construit une série, un court-métrage ou une campagne de marque, cette incohérence ruine le travail avant qu’il n’atteigne le public.
Veo 3.1 répond à ce problème plus directement que ses prédécesseurs. Il ne le résout pas entièrement de façon automatique, mais avec les bonnes stratégies de prompting, des systèmes de références de personnages et une certaine rigueur dans le flux de travail, vous pouvez produire des vidéos IA multi-scènes où vos personnages ressemblent à la même personne dans chaque clip.
Voici exactement comment procéder.
Pourquoi les personnages changent d’une scène à l’autre
La cause profonde dans les modèles texte vers vidéo
Les modèles texte vers vidéo génèrent chaque clip comme un processus d’échantillonnage indépendant. Ils ne conservent pas de mémoire de l’apparence d’un personnage dans une génération précédente, à moins que vous ne leur fournissiez des ancrages explicites et structurés. Le modèle interprète votre prompt à nouveau à chaque fois. Une petite modification de formulation, même le simple déplacement d’une expression à un autre endroit du prompt, peut modifier nettement le visage, le teint et les proportions du personnage.
Le problème s’aggrave avec les descriptions vagues. Écrire « une femme aux cheveux foncés » laisse au modèle une latitude énorme. Les cheveux foncés peuvent être noir de jais ou brun chocolat. Courts, longs, ondulés, raides. Le modèle choisit ce qui correspond à sa distribution de probabilités à ce moment précis, et cela change à chaque rendu.
Ce que Veo 3.1 fait différemment
Veo 3.1 a introduit une cohérence temporelle affinée, ce qui signifie que le modèle maintient mieux la cohérence visuelle au sein d’un même clip. D’un clip à l’autre, en revanche, vous devez toujours gérer vous-même la cohérence grâce à votre architecture de prompt.
La version rapide sacrifie une partie de cette cohérence au profit de la vitesse, ce qui convient bien aux itérations de brouillon mais n’est pas idéal pour les scènes finales à personnage verrouillé.
💡 Distinction importante : La cohérence temporelle (au sein d’un clip) est une capacité du modèle. La cohérence d’un clip à l’autre relève de la rigueur du flux de travail. Cette partie vous revient.
Construire votre système de références de personnages
Avant d’écrire le moindre prompt Veo 3.1, il vous faut un document de référence du personnage. C’est l’étape la plus importante de tout le processus. Sans lui, votre personnage dérivera, quelle que soit la qualité de votre technique de prompting.
La méthode du character bible
Un character bible est un bloc de texte fixe que vous copiez-collez mot pour mot dans chaque prompt concernant ce personnage. Il définit les ancrages visuels non négociables. Vous le construisez une fois et ne le modifiez jamais en cours de projet.
Voici un exemple de structure :
Trait
Valeur spécifique
Cheveux
Cheveux noirs raides, coupés juste sous les épaules, légère ondulation naturelle aux pointes
Yeux
Yeux bruns foncés en amande, ligne de cils supérieure épaisse
Peau
Teint brun doré chaud, légères taches de rousseur sur l’arête du nez
Visage
Visage ovale, pommettes marquées, mâchoire douce
Silhouette
Silhouette mince et athlétique, environ 5'6"
Tenue signature
Veste cargo vert foncé ajustée, fermeture éclair en laiton, portée sur un débardeur blanc côtelé
Chaque détail est précis. Pas « cheveux foncés », mais « cheveux noirs raides, coupés juste sous les épaules, avec une légère ondulation naturelle aux pointes ». La précision retire au modèle la liberté de dériver.
Les traits physiques à toujours définir
Ce sont les traits sur lesquels les modèles dérivent le plus souvent. Fixez-les tous :
Cheveux : couleur, longueur, coupe, texture et chute naturelle
Yeux : couleur, forme et tout détail distinctif (densité des cils, eye-liner, etc.)
Teint : un repère descriptif, pas seulement « clair » ou « foncé »
Forme du visage : ovale, rond, carré ou en cœur
Taille et corpulence : proportions approximatives par rapport au cadre
Tenue signature : une tenue constante pour les scènes à forte continuité
Tout signe distinctif : cicatrice, grain de beauté, lunettes, bijou, tatouage
Écrire des prompts qui verrouillent la cohérence
Une fois votre character bible prête, l’étape suivante consiste à structurer vos prompts Veo 3.1 pour que la description du personnage ancre la génération à chaque fois.
La technique de la phrase d’ancrage
Ouvrez toujours votre prompt avec le bloc du character bible. Ne l’enfouissez pas au milieu. Les modèles accordent plus de poids aux tokens placés en début de texte, donc commencer par la description physique donne aux traits du personnage la plus grande influence sur le résultat.
« Une femme aux cheveux noirs raides coupés juste sous les épaules avec une légère ondulation naturelle, yeux bruns foncés en amande, teint brun doré chaud avec de légères taches de rousseur sur le nez, vêtue d’une veste cargo vert foncé ajustée à fermeture en laiton par-dessus un débardeur côtelé blanc, marchant dans une rue de Tokyo pluvieuse la nuit, enseignes au néon se reflétant dans des flaques peu profondes, plan moyen, caméra qui suit le mouvement, cinématographique. »
Remarquez que le bloc du personnage ouvre le prompt, puis l’action et le décor suivent. Cet ordre n’est pas facultatif.
Prompt négatif pour la stabilité
Lorsque l’interface le permet, utilisez des prompts négatifs pour bloquer les variations de dérive les plus courantes :
blonde hair, blue eyes, light skin, red outfit, short hair, different face
Cela empêche le modèle de se rabattre sur ses configurations de personnage les plus probables et oblige la génération à rester dans l’espace visuel que vous avez défini.
💡 Astuce : Conservez un document de « bloc de personnage négatif » à côté de votre character bible principal. Collez les deux dans chaque génération. L’un définit ce que le personnage EST, l’autre ce qu’il N’EST PAS.
Utiliser Veo 3.1 sur PicassoIA
Veo 3.1 est disponible directement sur PicassoIA, sans configuration. Voici la procédure complète, étape par étape, pour une production vidéo à personnages cohérents.
Étape 1 : ouvrir le modèle
Rendez-vous sur la page du modèle Veo 3.1 de PicassoIA. Vous verrez le champ de saisie de votre prompt. Si vous travaillez sur des itérations de brouillon ou testez des concepts de scène, Veo 3.1 Fast est également disponible et traite nettement plus vite, avec un compromis de qualité minime à l’étape du brouillon.
Étape 2 : coller d’abord votre character bible
Ouvrez votre document de character bible. Copiez le bloc complet de la description physique et collez-le au tout début du champ de prompt. Ajoutez ensuite l’action, le décor et les détails cinématographiques propres à la scène.
Ne paraphrasez pas la description du personnage d’une scène à l’autre. Ne la résumez pas. Utilisez exactement les mêmes mots que ceux définis dans votre character bible. Même une légère reformulation introduit une variation sémantique suffisante pour modifier l’apparence visuelle du personnage.
Étape 3 : structurer les prompts multi-scènes
Pour un projet multi-scènes, créez une liste de prompts numérotée dans un document séparé avant de générer quoi que ce soit :
Scène 1 :[Character Bible] + walking through a rainy street at night, neon reflections, medium shot
Scène 2 :[Character Bible] + sitting at a café window, warm morning light, close-up shot
Scène 3 :[Character Bible] + running across a rooftop at dusk, wide establishing shot
Le bloc du character bible est identique dans les trois. Seuls l’action, le décor et la direction de caméra changent.
Étape 4 : verrouiller le seed
Si Veo 3.1 expose un paramètre de seed dans l’interface, notez le seed de votre génération de personnage la plus réussie. Utilisez cette valeur exacte pour chaque scène suivante mettant en scène ce personnage. C’est le levier de cohérence le plus puissant dont vous disposez.
💡 Note sur le flux de travail : Générez d’abord deux à trois variantes de chaque scène. Choisissez celle où les traits du character bible sont le mieux représentés. Verrouillez ensuite ce seed avant de passer à la scène suivante.
Les paramètres de prompt de Veo 3.1 en un coup d’œil
Paramètre
Ce qu’il faut faire
Ordre du prompt
Character bible d’abord, action ensuite, décor en troisième
Prompt négatif
Lister les traits que le personnage n’a PAS
Seed
Utiliser une valeur fixe pour toutes les scènes d’un même personnage
Version du modèle
Veo 3.1 pour les versions finales, Veo 3.1 Fast pour les brouillons
Durée du clip
Utiliser la durée standard lors du premier passage avant de valider
D’autres modèles à tester pour la cohérence
Veo 3.1 est un excellent choix principal, mais ce n’est pas la seule option de PicassoIA pour ce flux de travail. Selon le type de projet, ces modèles offrent des atouts complémentaires.
Kling V3 Motion Control
Kling V3 Motion Control vous permet de transférer le mouvement d’une vidéo de référence directement sur votre personnage. C’est particulièrement utile lorsque vous disposez déjà d’une image de personnage cohérente et souhaitez l’animer avec des mouvements précis, sans vous fier uniquement à une description textuelle du mouvement.
Le flux de travail : générez d’abord un portrait cohérent du personnage, puis transmettez cette image ainsi qu’une vidéo de référence de mouvement à Kling V3 Motion Control. Votre personnage reprend le schéma de mouvement tout en conservant l’identité visuelle de l’image de référence.
DreamActor-M2.0 pour l’animation de portraits
DreamActor-M2.0 de ByteDance est spécialisé dans l’animation d’une seule photo de portrait. Si vous générez ou capturez votre personnage une fois avec une forte cohérence visuelle, DreamActor produit plusieurs clips animés qui se réfèrent tous à la même image source. C’est l’une des approches les plus fiables pour la cohérence d’un clip à l’autre, car l’ancrage visuel est une image réelle et non une description textuelle.
💡 Conseil de flux de travail : Générez le portrait de référence de votre personnage avec un modèle texte vers image, vérifiez qu’il correspond précisément à votre character bible, puis utilisez DreamActor-M2.0 pour animer différentes scènes. Le portrait devient votre verrou de cohérence.
Wan 2.2 Animate Replace
Wan 2.2 Animate Replace adopte une approche différente : il remplace un personnage dans un clip vidéo existant par votre personnage personnalisé, à partir d’une image de référence. C’est idéal lorsque vous disposez déjà d’une scène avec la bonne action et le bon mouvement de caméra, mais que vous avez besoin de substituer votre personnage. Le clip d’origine fournit le mouvement et le décor ; la description de votre personnage fournit l’identité visuelle.
À tester également pour des cas d’usage précis :
Kling Avatar V2 pour des vidéos de personnages sous forme d’avatars, avec une forte cohérence du visage
Hailuo 2.3 pour des clips au style cinématographique qui conservent bien les détails du personnage en gros plan
Gen-4.5 de Runway pour les scènes très dynamiques où l’identité du personnage doit tenir malgré les mouvements rapides
3 erreurs qui brisent la cohérence à chaque fois
Même avec les bons outils, ces trois erreurs compromettront la continuité de vos personnages, quel que soit le modèle utilisé.
Des descriptions physiques vagues
« Une grande femme aux cheveux foncés » n’est pas une description de personnage. C’est une suggestion. Le modèle comble chaque espace non défini avec sa propre interprétation, et cette interprétation change d’une génération à l’autre.
Correction : chaque trait physique doit comporter au moins deux attributs précis. Couleur ET texture ET longueur des cheveux. Couleur ET forme des yeux. Teint ET tout signe distinctif.
Modifier la structure du prompt d’une scène à l’autre
Si votre character bible apparaît en première position dans la scène 1 et en troisième position dans la scène 3, le modèle pondère différemment la description. Le personnage dérivera alors même que le texte est identique.
Correction : établissez un modèle de prompt rigide. Le character bible passe toujours en premier. L’action en deuxième. Le décor en troisième. La caméra et l’éclairage en dernier. Ne dérogez jamais à cet ordre sur l’ensemble du projet.
Ignorer les réglages de seed
Chaque génération sans seed fixe revient à relancer les dés. Deux prompts au texte identique produisent des personnages d’apparence différente, car l’initialisation du bruit diffère à chaque fois.
Correction : notez le seed de votre meilleure génération. Utilisez-le pour toutes les scènes suivantes mettant en scène ce personnage. Si le modèle n’expose pas de champ de seed, faites une capture d’écran des paramètres de génération pour référence.
Flux de travail avancés pour les projets multi-scènes
Génération par lots avec verrouillage du seed
Une fois que vous avez trouvé un seed qui produit un personnage correspondant précisément à votre character bible, générez quatre à six variantes de scène avec ce même seed, en modifiant légèrement la description de l’action. Comparez-les côte à côte. Le visage et la silhouette doivent rester stables, seule l’action doit changer.
Si le personnage commence à dériver après plusieurs variantes, la description de l’action entre probablement en conflit avec celle du personnage quelque part dans le prompt. Simplifiez le segment d’action ou réorganisez la structure du prompt pour donner la priorité au character bible.
L’image vers vidéo comme ancrage le plus solide
Le flux de travail le plus fiable pour la cohérence ne repose pas uniquement sur des prompts textuels. Il s’appuie sur un processus en deux étapes :
Générez un portrait de votre personnage, de haute qualité et cohérent, avec un modèle texte vers image
Lorsque le modèle dispose d’une véritable image de votre personnage comme entrée visuelle, et non uniquement d’un texte, le visage, le teint, les cheveux et les proportions du personnage sont verrouillés par cette référence. La dérive propre au texte vers vidéo disparaît en grande partie, car le modèle a quelque chose de concret auquel se comparer.
Cette approche demande plus d’étapes, mais elle offre un niveau de cohérence visuelle qu’un prompting uniquement textuel ne peut pas atteindre pour l’instant.
💡 Chaîne de production : Utilisez Veo 3.1 pour les scènes qui exigent des décors dynamiques, une grande qualité visuelle et un mouvement cinématographique. Recourez aux flux image vers vidéo lorsque la fidélité du visage du personnage est la priorité absolue et que vous ne pouvez pas vous permettre la moindre dérive.
Commencez à créer vos propres vidéos à personnages cohérents
La cohérence des personnages dans la vidéo IA est un problème résolu, non pas parce que les modèles la gèrent automatiquement, mais parce qu’il existe un processus clair et reproductible pour y parvenir. Construisez votre character bible. Verrouillez l’architecture de vos prompts. Utilisez les valeurs de seed. Lorsque c’est possible, appuyez-vous sur une image d’ancrage plutôt que sur le texte seul.
Veo 3.1 récompense davantage un prompting structuré que toute improvisation créative vague. Les créateurs qui obtiennent les résultats les plus cohérents ne sont pas ceux qui écrivent les prompts les plus créatifs. Ce sont ceux qui disposent de l’architecture de prompt la plus rigoureuse, de la documentation de personnage la plus précise et du flux de travail le plus propre d’une scène à l’autre.
Tous les modèles cités dans cet article sont disponibles sur PicassoIA. Vous pouvez utiliser Veo 3.1, Kling V3 Motion Control, DreamActor-M2.0, Wan 2.2 Animate Replace et Hailuo 2.3 sans changer de plateforme, ce qui permet de comparer facilement les résultats et de construire le flux de travail adapté à votre type de projet.
Commencez avec un seul personnage. Écrivez la bible. Verrouillez le seed. Générez la première scène. La suite découle de là.