Générateur de vidéos IA à personnage cohérent : outils gratuits et prompts
Gardez un personnage reconnaissable dans chaque plan d’une vidéo IA. Cet article compare les outils gratuits qui maintiennent un visage stable, présente un flux de travail par image de référence basé sur PicassoIA, et propose des prompts prêts à l’emploi pour les fiches de personnage, les clips en mouvement et les histoires en plusieurs scènes.
Vous générez un excellent clip d’une femme en ciré olive qui traverse un marché sous la pluie. Puis vous générez le plan suivant, et elle apparaît avec un autre nez, d’autres cheveux, et un manteau qui a discrètement changé de couleur. C’est le casse-tête quotidien de quiconque raconte une histoire avec la vidéo IA, et c’est précisément ce que le flux de travail d’un générateur de vidéos IA à personnage cohérent est conçu pour résoudre. Bonne nouvelle : vous n’avez pas besoin d’une suite de studio payante. Quelques outils gratuits, une image de référence solide et une structure de prompt reproductible suffisent pour garder la même personne à l’écran du premier clip au dixième.
Cet article analyse pourquoi les personnages dérivent, quels outils gratuits conservent le mieux une identité, un flux de travail en quatre étapes par image de référence, deux tutoriels pratiques sur PicassoIA, et des prompts que vous pouvez coller directement dans un générateur.
Pourquoi les personnages dérivent d’un clip à l’autre
Tout outil de vidéo IA est, au fond, une machine probabiliste. Demandez-lui « une femme en ciré » deux fois et vous obtenez deux femmes différentes, car rien dans la requête ne précise qui elle est. La cohérence n’est pas un interrupteur que l’on active. Elle se construit en donnant au modèle davantage à retenir qu’une simple phrase.
À quoi ressemble la dérive d’identité
La dérive apparaît rarement sous la forme d’un grand échec. Elle s’installe par de petits changements qui s’accumulent sur une série de plans :
Dérive du visage : la mâchoire s’adoucit, les yeux se rapprochent, ou le nez change de forme d’un clip à l’autre.
Dérive de la garde-robe : un col gagne un bouton, une écharpe passe du moutarde à l’orange, un logo apparaît de nulle part.
Dérive du style : le premier plan ressemble à un film 35 mm granuleux, le second à une publicité lisse.
Dérive du mouvement : à l’intérieur d’un même clip, le visage se déforme subtilement lors d’un mouvement rapide de la tête ou d’une longue marche vers la caméra.
Les spectateurs repèrent ces quatre dérives en moins d’une seconde, même lorsqu’ils ne peuvent pas dire ce qui cloche. Un personnage qui ne ressemble plus à lui-même cesse tout simplement de paraître un personnage.
Pourquoi cela arrive
Chaque génération part d’un bruit aléatoire. Une description textuelle comme « jeune femme, cheveux auburn, taches de rousseur » correspond à des milliers de visages différents, donc le modèle en choisit un nouveau à chaque fois. Les mots sont une description approximative d’une personne. Une image, non.
C’est pourquoi toutes les approches fiables présentées dans cet article ancrent le modèle avec une image plutôt qu’avec un paragraphe plus long.
💡 Règle empirique : utilisez des images pour qui est le personnage, et du texte pour ce que le personnage fait. Ne demandez jamais à un prompt de faire le travail d’une photo de référence.
Les outils gratuits qui permettent de tenir un personnage
Les outils vidéo gratuits se répartissent en trois familles, et chacune gère l’identité différemment :
Image vers vidéo. Vous fournissez la première image, donc le visage de la première image est exactement votre référence.
Référence vers vidéo. Vous fournissez une ou plusieurs images ou vidéos de référence, et le modèle garde le sujet reconnaissable pendant qu’il invente la scène.
Transfert de mouvement. Vous fournissez une image de personnage et une vidéo du mouvement souhaité, et le modèle applique ce mouvement à votre personnage.
Voici comment se positionnent les principales options de PicassoIA :
Un modèle vidéo n’est aussi cohérent que l’image fixe que vous lui donnez, donc l’essentiel du travail se fait avant le rendu du premier clip.
Le flux de travail par image de référence
Quatre étapes composent l’ensemble du processus. Suivez-les dans l’ordre et ne sautez aucune d’entre elles.
Commencez par une fiche de personnage
Avant de toucher à un outil vidéo, créez une pile d’images fixes de votre personnage : vue de face, de profil, de trois quarts, et une ou deux expressions. Nano Banana Pro convient bien à cette étape, car il accepte jusqu’à 14 images de référence à côté de votre prompt. Une fois que vous avez un portrait qui vous plaît, réinjectez-le et demandez les autres angles.
Rédigez ensuite un bloc d’identité unique : un paragraphe de mots fixes qui décrit le personnage. Collez-le, sans le modifier, au début de chaque prompt pour le reste du projet.
a woman in her late twenties with a short auburn bob, light freckles across her nose and cheeks, hazel eyes, a small silver stud earring, an olive-green waxed cotton raincoat and a mustard-yellow wool scarf
Le concret l’emporte sur le poétique. La longueur des cheveux, un trait du visage et une tenue font plus qu’une page d’adjectifs.
Verrouillez la garde-robe et le visage
La tenue provoque plus de dérives que le visage. Choisissez une tenue à silhouette simple et à deux couleurs unies. Les logos, les inscriptions, les franges, les bijoux superposés et les motifs chargés sont des aimants à dérive, car le modèle doit les réinventer dans chaque image.
Lorsqu’une image fixe est presque juste, corrigez-la au lieu de la regénérer. PicassoIA Image Editor Pro accepte jusqu’à trois images de référence et vous permet de les désigner par « image 1 », « image 2 », etc., dans le prompt. Essayez quelque chose comme : « Conservez le visage et les cheveux de l’image 1. Changez uniquement l’écharpe en jaune moutarde. » Comme le modèle est illimité, vous pouvez enchaîner des dizaines de petites corrections jusqu’à obtenir une fiche propre.
Animez à partir de la première image
Choisissez la meilleure image fixe et utilisez-la comme première image d’une génération image vers vidéo. Seedance 2.5 Lite et PicassoIA Video traitent l’image d’entrée comme image d’ouverture et reprennent son format. Cela signifie que le visage de la première image sert de référence, et que le modèle n’a plus qu’à le maintenir stable pendant cinq à dix secondes.
Rédigez le prompt uniquement sur le mouvement. Ne décrivez pas à nouveau le visage, car l’image l’a déjà fait. Bonnes formulations de mouvement : « tourne la tête vers la caméra », « avance sous une pluie fine », « travelling avant lent ». Gardez une seule action par clip.
Enchaînez les scènes avec les dernières images
Pour poursuivre l’histoire, exportez la dernière image du clip un depuis n’importe quel lecteur vidéo et utilisez-la comme première image du clip deux. Seedance 2.5 Lite propose aussi une option Last frame image : avec une première frame définie, le clip s’anime depuis celle-ci vers celle que vous fournissez, ce qui est pratique pour des transitions planifiées.
Tenez un journal de production simple pour pouvoir reproduire ce qui a fonctionné :
Scène
Image source
Seed
Ligne de mouvement
1. Marché
Vue de face, ciré
4821
Se tourne vers la caméra, sourit
2. Quai
Vue de trois quarts
4821
Regarde sa montre
3. Café
Vue de profil
7390
Enroule ses mains autour d’une tasse
💡 Astuce : enregistrez le seed de chaque clip qui vous plaît. Relancer le même prompt avec le même seed reproduit le résultat, ce qui vous permet de changer un seul mot et de voir exactement ce que ce mot a produit.
Seedance 2.5 Lite pas à pas
Seedance 2.5 Lite est l’édition allégée de Seedance 2.5. Il génère en 480p et 720p, produit des clips allant jusqu’à 10 secondes avec audio synchronisé, et les membres Wonder peuvent l’utiliser sans coût par clip. Ce dernier point compte pour le travail de cohérence, car vous allez beaucoup régénérer.
Ouvrez la page du modèle et importez votre image de personnage dans Input image. Laissez Aspect ratio sur match_input_image afin que le clip conserve le cadrage de votre référence.
Rédigez un prompt centré sur le mouvement. Les descriptions cinématographiques et chronologiques fonctionnent le mieux : ce qui bouge, comment la caméra se déplace, ce qui change pendant le plan.
Choisissez une résolution. Utilisez le 480p pour les brouillons rapides et le 720p, la valeur par défaut, pour les versions que vous comptez garder.
Définissez la durée. Choisissez 5 secondes pour un rythme court ou 10 secondes lorsque l’action a besoin de place.
Saisissez un seed. Tout nombre entier convient. Notez-le dans votre journal.
Ajoutez une image de dernière frame (facultatif). Importez une image de fin lorsque vous voulez que le clip se termine sur une pose ou un décor précis.
Décidez de l’audio.Save audio est activé par défaut. Désactivez-le si vous prévoyez d’ajouter votre propre bande-son.
Générez et comparez. Lancez trois ou quatre variantes, gardez la meilleure et notez quelle formulation a provoqué la dérive.
Vous préférez un format prévisible ? PicassoIA Video fonctionne de la même façon avec une image d’entrée, mais chaque clip dure 5 secondes fixes à 24 images par seconde, en 480p ou 720p. Il est ainsi facile de découper une séquence entière à la même durée.
💡 Astuce : faites des brouillons en 480p jusqu’à ce que le mouvement vous convienne, puis relancez le prompt et le seed gagnants en 720p.
Wan 2.7 R2V pour les clips de référence
Wan 2.7 R2V est un modèle de référence vers vidéo. Il lit vos références et s’en sert pour ancrer l’identité du sujet dans toute la vidéo, ce qui vous permet de placer un personnage connu dans une toute nouvelle scène sans fournir de première frame. Il produit du 720p ou du 1080p et prend en charge les formats 16:9, 9:16, 1:1, 4:3 et 3:4.
Les réglages qui comptent :
Images de référence : un ou plusieurs portraits de votre personnage au format JPG, PNG, BMP ou WebP.
Vidéos de référence : de courts clips MP4 ou MOV du même personnage, lorsque vous voulez que l’apparence et le mouvement soient transmis à la nouvelle vidéo.
Prompt : décrivez la scène et l’action. Écrivez « la femme de la référence » au lieu de la décrire à nouveau.
Type de plan :single pour un seul sujet, multi pour les scènes comptant plusieurs sujets.
Prompt négatif : listez ce qui ne doit pas apparaître, comme une coiffure modifiée ou des personnes supplémentaires.
Résolution : 720p pour les tests, 1080p (la valeur par défaut) pour les rendus finaux.
Seed : toute valeur de 0 à 2147483647 pour un résultat reproductible.
Quand le mouvement compte le plus
Certains plans demandent un mouvement précis, pas seulement un visage stable. Kling v3 Motion Control prend une image de personnage et une courte vidéo de référence, puis applique le mouvement à votre personnage. Le mode standard génère du 720p pour les aperçus rapides, et le mode Professional génère du 1080p pour les clips finaux.
Le réglage character orientation modifie la limite de durée. Réglé sur image, le personnage regarde dans la direction de votre image fixe et les clips peuvent atteindre 10 secondes. Réglé sur video, le personnage suit la personne de la vidéo de référence et les clips peuvent aller jusqu’à 30 secondes. Comme le personnage provient de votre image fixe, l’identité reste en place pendant que le mouvement vient du clip. Un court prompt textuel peut ajouter des détails de décor par-dessus.
Des prompts à copier
Remplacez les parties entre crochets et laissez tout le reste exactement tel quel.
Prompt de fiche de personnage
Photorealistic portrait of [IDENTITY BLOCK]. Neutral grey backdrop, soft window light from the left, 85mm lens, shallow depth of field, natural skin texture, relaxed expression, [front view / three-quarter view / profile view].
Lancez-le trois fois et ne modifiez que la vue entre crochets. Tous les autres mots restent identiques.
Prompt de mouvement pour les premières frames
She turns her head slowly toward the camera and smiles, raindrops slide off the edge of her hood, shoppers drift past in soft focus behind her. Slow dolly-in, gentle handheld movement, late afternoon light.
Remarquez ce qui manque : les cheveux, les taches de rousseur, le manteau. La première frame porte tout cela.
Prompt de clip de référence
The woman from the reference images walks through a rainy outdoor market, stops at a fruit stall and lifts an orange to smell it. Medium tracking shot at eye level, warm string lights, light rain, shallow depth of field.
Associez-le à un prompt négatif :
different face, changed hairstyle, different coat, extra people, text, watermark, blurry, distorted hands
Plan d’histoire en quatre scènes
Scène
Décor
Ligne de mouvement
Caméra
1
Marché sous la pluie
Passe devant les étals de fruits
Travelling lent
2
Quai de gare au crépuscule
Regarde sa montre, observe les rails
Plan fixe
3
Fenêtre d’un café
Enroule ses deux mains autour d’une tasse, jette un œil dehors
Rapprochement lent
4
Toit à l’aube
Resserre son écharpe, se tourne vers le lever du soleil
Panoramique vers la droite
Pour obtenir une image fixe de chaque décor, demandez à PicassoIA Image Editor Pro : « Placez la femme de l’image 1 sur un quai de gare au crépuscule. Conservez son visage, ses cheveux et sa tenue sans changement. » Animez ensuite chaque image fixe avec la ligne de mouvement du tableau.
Les erreurs qui brisent la cohérence
Réécrire le bloc d’identité
Remplacer « carré auburn » par « cheveux courts roux » donne au modèle de nouvelles consignes, et il en profitera pour prendre des libertés. Copiez et collez le bloc. Ne le retapez jamais de mémoire.
Demander trop à un seul clip
Les rotations rapides, les foules qui passent devant le visage et les longues séquences d’action poussent le modèle à redessiner le personnage en plein plan. Donnez une seule action à chaque clip et coupez entre eux.
La plupart des autres problèmes remontent aux mêmes quelques causes :
Problème
Cause probable
Solution
Le visage change en cours de clip
Rotation rapide de la tête ou clip long
Réduisez à 5 secondes et ralentissez la ligne de mouvement
Le manteau change de couleur entre les scènes
Couleur décrite avec des mots différents
Réutilisez le bloc d’identité mot pour mot
Les clips ressemblent à des films différents
Formulation de l’objectif et de la lumière modifiée
Réutilisez la même ligne d’objectif et de lumière dans chaque prompt
Le visage paraît flou ou écrasé
Référence en basse résolution
Partez d’une image fixe plus nette en 2K ou 4K créée avec Nano Banana Pro
Essayez avec votre propre personnage
L’ensemble du processus tient en un après-midi. Choisissez un personnage, rédigez le bloc d’identité, créez une fiche de cinq images avec Nano Banana Pro, peaufinez-la avec PicassoIA Image Editor Pro, puis animez deux ou trois scènes avec Seedance 2.5 Lite. Notez chaque seed au fur et à mesure.
Votre première tentative ne sera pas parfaite, et ce n’est pas grave. Chaque passage vous montre quels mots maintiennent le personnage stable et lesquels le laissent glisser. Ouvrez Picasso IA, créez vos propres images de personnage, importez la meilleure comme première frame et générez dès aujourd’hui votre premier clip cohérent. Lorsque vous voudrez comparer d’autres modèles vidéo côte à côte, parcourez le catalogue complet sur picassoia.com/en/all-models.