Comment créer des vidéos IA avec des personnages cohérents dans Veo 3.1

Veo 3.1 peut produire des vidéos IA aux personnages cohérents, à condition de s’appuyer sur la bonne architecture de prompt. Cet article détaille la méthode du character bible, les techniques de verrouillage du seed, les flux de travail multi-scènes et les meilleurs modèles de PicassoIA pour conserver une identité visuelle stable dans chaque clip que vous générez.

Comment créer des vidéos IA avec des personnages cohérents dans Veo 3.1
Cristian Da Conceicao
Fondateur de Picasso IA

Garder le même personnage d’un clip vidéo IA à l’autre est l’un des problèmes les plus difficiles de la production vidéo par IA aujourd’hui. Dans une scène, votre protagoniste a des yeux marron chauds et des cheveux noirs mi-longs. Dans la suivante, elle a les yeux plus clairs, une autre forme de mâchoire, et sa tenue a complètement changé. Cela arrive avec presque tous les modèles, et pour quiconque construit une série, un court-métrage ou une campagne de marque, cette incohérence ruine le travail avant qu’il n’atteigne le public.

Un directeur créatif étudiant une interface de prompt texte vers vidéo dans un studio domestique minimaliste

Veo 3.1 répond à ce problème plus directement que ses prédécesseurs. Il ne le résout pas entièrement de façon automatique, mais avec les bonnes stratégies de prompting, des systèmes de références de personnages et une certaine rigueur dans le flux de travail, vous pouvez produire des vidéos IA multi-scènes où vos personnages ressemblent à la même personne dans chaque clip.

Voici exactement comment procéder.

Pourquoi les personnages changent d’une scène à l’autre

La cause profonde dans les modèles texte vers vidéo

Les modèles texte vers vidéo génèrent chaque clip comme un processus d’échantillonnage indépendant. Ils ne conservent pas de mémoire de l’apparence d’un personnage dans une génération précédente, à moins que vous ne leur fournissiez des ancrages explicites et structurés. Le modèle interprète votre prompt à nouveau à chaque fois. Une petite modification de formulation, même le simple déplacement d’une expression à un autre endroit du prompt, peut modifier nettement le visage, le teint et les proportions du personnage.

Le problème s’aggrave avec les descriptions vagues. Écrire « une femme aux cheveux foncés » laisse au modèle une latitude énorme. Les cheveux foncés peuvent être noir de jais ou brun chocolat. Courts, longs, ondulés, raides. Le modèle choisit ce qui correspond à sa distribution de probabilités à ce moment précis, et cela change à chaque rendu.

Ce que Veo 3.1 fait différemment

Veo 3.1 a introduit une cohérence temporelle affinée, ce qui signifie que le modèle maintient mieux la cohérence visuelle au sein d’un même clip. D’un clip à l’autre, en revanche, vous devez toujours gérer vous-même la cohérence grâce à votre architecture de prompt.

La version rapide sacrifie une partie de cette cohérence au profit de la vitesse, ce qui convient bien aux itérations de brouillon mais n’est pas idéal pour les scènes finales à personnage verrouillé.

💡 Distinction importante : La cohérence temporelle (au sein d’un clip) est une capacité du modèle. La cohérence d’un clip à l’autre relève de la rigueur du flux de travail. Cette partie vous revient.

Gros plan de mains tapant rapidement sur un clavier rétroéclairé dans une salle de production faiblement éclairée

Construire votre système de références de personnages

Avant d’écrire le moindre prompt Veo 3.1, il vous faut un document de référence du personnage. C’est l’étape la plus importante de tout le processus. Sans lui, votre personnage dérivera, quelle que soit la qualité de votre technique de prompting.

La méthode du character bible

Un character bible est un bloc de texte fixe que vous copiez-collez mot pour mot dans chaque prompt concernant ce personnage. Il définit les ancrages visuels non négociables. Vous le construisez une fois et ne le modifiez jamais en cours de projet.

Voici un exemple de structure :

TraitValeur spécifique
CheveuxCheveux noirs raides, coupés juste sous les épaules, légère ondulation naturelle aux pointes
YeuxYeux bruns foncés en amande, ligne de cils supérieure épaisse
PeauTeint brun doré chaud, légères taches de rousseur sur l’arête du nez
VisageVisage ovale, pommettes marquées, mâchoire douce
SilhouetteSilhouette mince et athlétique, environ 5'6"
Tenue signatureVeste cargo vert foncé ajustée, fermeture éclair en laiton, portée sur un débardeur blanc côtelé

Chaque détail est précis. Pas « cheveux foncés », mais « cheveux noirs raides, coupés juste sous les épaules, avec une légère ondulation naturelle aux pointes ». La précision retire au modèle la liberté de dériver.

Les traits physiques à toujours définir

Ce sont les traits sur lesquels les modèles dérivent le plus souvent. Fixez-les tous :

  • Cheveux : couleur, longueur, coupe, texture et chute naturelle
  • Yeux : couleur, forme et tout détail distinctif (densité des cils, eye-liner, etc.)
  • Teint : un repère descriptif, pas seulement « clair » ou « foncé »
  • Forme du visage : ovale, rond, carré ou en cœur
  • Taille et corpulence : proportions approximatives par rapport au cadre
  • Tenue signature : une tenue constante pour les scènes à forte continuité
  • Tout signe distinctif : cicatrice, grain de beauté, lunettes, bijou, tatouage

Fiches de référence de personnages étalées sur le bureau en bois d’un cinéaste, avec une documentation des traits écrite à la main

Écrire des prompts qui verrouillent la cohérence

Une fois votre character bible prête, l’étape suivante consiste à structurer vos prompts Veo 3.1 pour que la description du personnage ancre la génération à chaque fois.

La technique de la phrase d’ancrage

Ouvrez toujours votre prompt avec le bloc du character bible. Ne l’enfouissez pas au milieu. Les modèles accordent plus de poids aux tokens placés en début de texte, donc commencer par la description physique donne aux traits du personnage la plus grande influence sur le résultat.

Structure de prompt efficace :

[Character Bible Block] + [Action] + [Environment] + [Lighting and Atmosphere] + [Camera Direction]

Exemple :

« Une femme aux cheveux noirs raides coupés juste sous les épaules avec une légère ondulation naturelle, yeux bruns foncés en amande, teint brun doré chaud avec de légères taches de rousseur sur le nez, vêtue d’une veste cargo vert foncé ajustée à fermeture en laiton par-dessus un débardeur côtelé blanc, marchant dans une rue de Tokyo pluvieuse la nuit, enseignes au néon se reflétant dans des flaques peu profondes, plan moyen, caméra qui suit le mouvement, cinématographique. »

Remarquez que le bloc du personnage ouvre le prompt, puis l’action et le décor suivent. Cet ordre n’est pas facultatif.

Prompt négatif pour la stabilité

Lorsque l’interface le permet, utilisez des prompts négatifs pour bloquer les variations de dérive les plus courantes :

blonde hair, blue eyes, light skin, red outfit, short hair, different face

Cela empêche le modèle de se rabattre sur ses configurations de personnage les plus probables et oblige la génération à rester dans l’espace visuel que vous avez défini.

💡 Astuce : Conservez un document de « bloc de personnage négatif » à côté de votre character bible principal. Collez les deux dans chaque génération. L’un définit ce que le personnage EST, l’autre ce qu’il N’EST PAS.

Vue d’ensemble d’un studio de production épuré avec trois écrans affichant des images de personnages IA cohérents selon différentes scènes

Utiliser Veo 3.1 sur PicassoIA

Veo 3.1 est disponible directement sur PicassoIA, sans configuration. Voici la procédure complète, étape par étape, pour une production vidéo à personnages cohérents.

Étape 1 : ouvrir le modèle

Rendez-vous sur la page du modèle Veo 3.1 de PicassoIA. Vous verrez le champ de saisie de votre prompt. Si vous travaillez sur des itérations de brouillon ou testez des concepts de scène, Veo 3.1 Fast est également disponible et traite nettement plus vite, avec un compromis de qualité minime à l’étape du brouillon.

Étape 2 : coller d’abord votre character bible

Ouvrez votre document de character bible. Copiez le bloc complet de la description physique et collez-le au tout début du champ de prompt. Ajoutez ensuite l’action, le décor et les détails cinématographiques propres à la scène.

Ne paraphrasez pas la description du personnage d’une scène à l’autre. Ne la résumez pas. Utilisez exactement les mêmes mots que ceux définis dans votre character bible. Même une légère reformulation introduit une variation sémantique suffisante pour modifier l’apparence visuelle du personnage.

Étape 3 : structurer les prompts multi-scènes

Pour un projet multi-scènes, créez une liste de prompts numérotée dans un document séparé avant de générer quoi que ce soit :

  1. Scène 1 : [Character Bible] + walking through a rainy street at night, neon reflections, medium shot
  2. Scène 2 : [Character Bible] + sitting at a café window, warm morning light, close-up shot
  3. Scène 3 : [Character Bible] + running across a rooftop at dusk, wide establishing shot

Le bloc du character bible est identique dans les trois. Seuls l’action, le décor et la direction de caméra changent.

Étape 4 : verrouiller le seed

Si Veo 3.1 expose un paramètre de seed dans l’interface, notez le seed de votre génération de personnage la plus réussie. Utilisez cette valeur exacte pour chaque scène suivante mettant en scène ce personnage. C’est le levier de cohérence le plus puissant dont vous disposez.

💡 Note sur le flux de travail : Générez d’abord deux à trois variantes de chaque scène. Choisissez celle où les traits du character bible sont le mieux représentés. Verrouillez ensuite ce seed avant de passer à la scène suivante.

Une femme souriant devant son ordinateur portable affichant une plateforme de génération de vidéos IA, dans la vitrine lumineuse d’un café

Les paramètres de prompt de Veo 3.1 en un coup d’œil

ParamètreCe qu’il faut faire
Ordre du promptCharacter bible d’abord, action ensuite, décor en troisième
Prompt négatifLister les traits que le personnage n’a PAS
SeedUtiliser une valeur fixe pour toutes les scènes d’un même personnage
Version du modèleVeo 3.1 pour les versions finales, Veo 3.1 Fast pour les brouillons
Durée du clipUtiliser la durée standard lors du premier passage avant de valider

D’autres modèles à tester pour la cohérence

Veo 3.1 est un excellent choix principal, mais ce n’est pas la seule option de PicassoIA pour ce flux de travail. Selon le type de projet, ces modèles offrent des atouts complémentaires.

Kling V3 Motion Control

Kling V3 Motion Control vous permet de transférer le mouvement d’une vidéo de référence directement sur votre personnage. C’est particulièrement utile lorsque vous disposez déjà d’une image de personnage cohérente et souhaitez l’animer avec des mouvements précis, sans vous fier uniquement à une description textuelle du mouvement.

Le flux de travail : générez d’abord un portrait cohérent du personnage, puis transmettez cette image ainsi qu’une vidéo de référence de mouvement à Kling V3 Motion Control. Votre personnage reprend le schéma de mouvement tout en conservant l’identité visuelle de l’image de référence.

DreamActor-M2.0 pour l’animation de portraits

DreamActor-M2.0 de ByteDance est spécialisé dans l’animation d’une seule photo de portrait. Si vous générez ou capturez votre personnage une fois avec une forte cohérence visuelle, DreamActor produit plusieurs clips animés qui se réfèrent tous à la même image source. C’est l’une des approches les plus fiables pour la cohérence d’un clip à l’autre, car l’ancrage visuel est une image réelle et non une description textuelle.

💡 Conseil de flux de travail : Générez le portrait de référence de votre personnage avec un modèle texte vers image, vérifiez qu’il correspond précisément à votre character bible, puis utilisez DreamActor-M2.0 pour animer différentes scènes. Le portrait devient votre verrou de cohérence.

Une femme professionnelle aux cheveux auburn tenant une tablette affichant des vignettes de personnages dans un bureau tech moderne

Wan 2.2 Animate Replace

Wan 2.2 Animate Replace adopte une approche différente : il remplace un personnage dans un clip vidéo existant par votre personnage personnalisé, à partir d’une image de référence. C’est idéal lorsque vous disposez déjà d’une scène avec la bonne action et le bon mouvement de caméra, mais que vous avez besoin de substituer votre personnage. Le clip d’origine fournit le mouvement et le décor ; la description de votre personnage fournit l’identité visuelle.

À tester également pour des cas d’usage précis :

  • Kling Avatar V2 pour des vidéos de personnages sous forme d’avatars, avec une forte cohérence du visage
  • Hailuo 2.3 pour des clips au style cinématographique qui conservent bien les détails du personnage en gros plan
  • Gen-4.5 de Runway pour les scènes très dynamiques où l’identité du personnage doit tenir malgré les mouvements rapides

Vue aérienne à plat d’un espace de travail créatif de cinéaste, avec carnets, clavier et notes de personnages codées par couleur

3 erreurs qui brisent la cohérence à chaque fois

Même avec les bons outils, ces trois erreurs compromettront la continuité de vos personnages, quel que soit le modèle utilisé.

Des descriptions physiques vagues

« Une grande femme aux cheveux foncés » n’est pas une description de personnage. C’est une suggestion. Le modèle comble chaque espace non défini avec sa propre interprétation, et cette interprétation change d’une génération à l’autre.

Correction : chaque trait physique doit comporter au moins deux attributs précis. Couleur ET texture ET longueur des cheveux. Couleur ET forme des yeux. Teint ET tout signe distinctif.

Modifier la structure du prompt d’une scène à l’autre

Si votre character bible apparaît en première position dans la scène 1 et en troisième position dans la scène 3, le modèle pondère différemment la description. Le personnage dérivera alors même que le texte est identique.

Correction : établissez un modèle de prompt rigide. Le character bible passe toujours en premier. L’action en deuxième. Le décor en troisième. La caméra et l’éclairage en dernier. Ne dérogez jamais à cet ordre sur l’ensemble du projet.

Ignorer les réglages de seed

Chaque génération sans seed fixe revient à relancer les dés. Deux prompts au texte identique produisent des personnages d’apparence différente, car l’initialisation du bruit diffère à chaque fois.

Correction : notez le seed de votre meilleure génération. Utilisez-le pour toutes les scènes suivantes mettant en scène ce personnage. Si le modèle n’expose pas de champ de seed, faites une capture d’écran des paramètres de génération pour référence.

Une créatrice de contenu travaillant devant deux écrans, esquissant une référence de personnage sur une tablette graphique

Flux de travail avancés pour les projets multi-scènes

Génération par lots avec verrouillage du seed

Une fois que vous avez trouvé un seed qui produit un personnage correspondant précisément à votre character bible, générez quatre à six variantes de scène avec ce même seed, en modifiant légèrement la description de l’action. Comparez-les côte à côte. Le visage et la silhouette doivent rester stables, seule l’action doit changer.

Si le personnage commence à dériver après plusieurs variantes, la description de l’action entre probablement en conflit avec celle du personnage quelque part dans le prompt. Simplifiez le segment d’action ou réorganisez la structure du prompt pour donner la priorité au character bible.

L’image vers vidéo comme ancrage le plus solide

Le flux de travail le plus fiable pour la cohérence ne repose pas uniquement sur des prompts textuels. Il s’appuie sur un processus en deux étapes :

  1. Générez un portrait de votre personnage, de haute qualité et cohérent, avec un modèle texte vers image
  2. Transmettez cette image à un modèle image vers vidéo comme Wan 2.2 Animate Replace, DreamActor-M2.0 ou Kling V3 Motion Control

Lorsque le modèle dispose d’une véritable image de votre personnage comme entrée visuelle, et non uniquement d’un texte, le visage, le teint, les cheveux et les proportions du personnage sont verrouillés par cette référence. La dérive propre au texte vers vidéo disparaît en grande partie, car le modèle a quelque chose de concret auquel se comparer.

Cette approche demande plus d’étapes, mais elle offre un niveau de cohérence visuelle qu’un prompting uniquement textuel ne peut pas atteindre pour l’instant.

💡 Chaîne de production : Utilisez Veo 3.1 pour les scènes qui exigent des décors dynamiques, une grande qualité visuelle et un mouvement cinématographique. Recourez aux flux image vers vidéo lorsque la fidélité du visage du personnage est la priorité absolue et que vous ne pouvez pas vous permettre la moindre dérive.

Une créatrice de contenu créative aux cheveux bouclés debout dans un bureau à domicile chaleureux, expression assurée, lumière de l’heure dorée

Commencez à créer vos propres vidéos à personnages cohérents

La cohérence des personnages dans la vidéo IA est un problème résolu, non pas parce que les modèles la gèrent automatiquement, mais parce qu’il existe un processus clair et reproductible pour y parvenir. Construisez votre character bible. Verrouillez l’architecture de vos prompts. Utilisez les valeurs de seed. Lorsque c’est possible, appuyez-vous sur une image d’ancrage plutôt que sur le texte seul.

Veo 3.1 récompense davantage un prompting structuré que toute improvisation créative vague. Les créateurs qui obtiennent les résultats les plus cohérents ne sont pas ceux qui écrivent les prompts les plus créatifs. Ce sont ceux qui disposent de l’architecture de prompt la plus rigoureuse, de la documentation de personnage la plus précise et du flux de travail le plus propre d’une scène à l’autre.

Tous les modèles cités dans cet article sont disponibles sur PicassoIA. Vous pouvez utiliser Veo 3.1, Kling V3 Motion Control, DreamActor-M2.0, Wan 2.2 Animate Replace et Hailuo 2.3 sans changer de plateforme, ce qui permet de comparer facilement les résultats et de construire le flux de travail adapté à votre type de projet.

Commencez avec un seul personnage. Écrivez la bible. Verrouillez le seed. Générez la première scène. La suite découle de là.

Partager cet article

Choisissez votre langue