Une checklist de prompts pour la vidéo IA qui fonctionne vraiment
Rédiger des prompts vidéo IA qui donnent des résultats cinématographiques et cohérents demande plus que de décrire ce que vous voulez. Cette checklist détaille chaque élément, de la composition de la scène et du mouvement de caméra aux indications d’éclairage et au rythme, pour que votre prochaine génération de vidéo réussisse dès le premier essai.
Le champ de saisie vide devant un modèle de texte vers vidéo paraît d’une simplicité trompeuse. Vous tapez quelque chose, vous lancez la génération, et deux minutes plus tard vous avez une vidéo. Sauf qu’elle ne ressemble en rien à ce que vous aviez imaginé.
L’écart entre « je l’ai décrit clairement » et « le résultat est juste » tient presque toujours à un problème de prompt. Ce n’est pas que vous ayez mal choisi vos mots, mais les modèles de texte vers vidéo ont besoin d’un type d’information très précis, dans un ordre très précis, et la plupart des gens en oublient la moitié sans s’en rendre compte. Cette checklist couvre chaque élément qui doit figurer dans un prompt vidéo IA, organisé pour que vous puissiez le parcourir avant chaque génération.
Pourquoi la plupart des prompts vidéo IA sont insuffisants
La différence entre prompt image et prompt vidéo
Les prompts image décrivent un instant figé. Vous pouvez être approximatif sur le temps et le mouvement, car le modèle n’a besoin de synthétiser qu’une seule image. Les prompts vidéo décrivent une séquence. Le modèle doit savoir ce qui lance la scène, comment elle évolue pendant 5 ou 10 secondes, et ce que fait la caméra tout au long. Si vous omettez ces éléments, le modèle comble les vides comme il l’entend, avec en général une dérive aléatoire de la caméra, des saccades du sujet et un milieu de clip qui ne ressemble pas à l’image d’ouverture.
Ce que le modèle doit vraiment savoir
La plupart des modèles vidéo IA sont entraînés sur des millions de clips qui intègrent les conventions de la cinématographie professionnelle. Ils répondent bien au langage de ce métier : termes de caméra précis, vocabulaire de l’éclairage, verbes de mouvement. Des adjectifs vagues comme « cool » ou « joli » ne donnent au modèle rien de concret sur quoi travailler.
Des modèles comme Seedance 2.0, Kling v3 Video et Veo 3.1 répondent nettement mieux à des prompts structurés et précis. Décomposons chaque section de l’un d’eux.
La checklist des fondations de la scène
Avant tout détail de caméra ou de mouvement, un bon prompt vidéo IA établit le qui, le quoi et le où. Ces trois repères donnent au modèle un point de départ stable pour chaque image.
Sujet : qui ou quoi est dans le cadre
Décrivez votre sujet avec assez de précision pour qu’un directeur de casting puisse le trouver. Au lieu de « une femme », essayez « une femme d’une trentaine d’années, aux cheveux courts et bruns, vêtue d’un imperméable couleur crème ». Au lieu de « une voiture », essayez « une muscle car noire des années 1960, avec des garnitures chromées et des sorties d’échappement à l’arrière ».
Ce niveau de détail sert la cohérence temporelle. Lorsque le modèle dispose d’une description précise du sujet, il la maintient stable sur toutes les images au lieu de la laisser dériver.
Faible
Solide
« un homme qui marche »
« un homme barbu en costume gris, la quarantaine, marchant les mains dans les poches »
« une ville »
« une rue étroite pavée dans une ville européenne pluvieuse, vitrines mouillées, en soirée »
« une scène de nature »
« une clairière de forêt de pins à l’aube, brume au ras du sol, contre-jour du soleil levant »
Environnement : où se déroule l’action
L’environnement demande la même précision que le sujet. « Dans un café » reste maigre. « À l’intérieur d’un petit café indépendant aux murs de brique apparente, avec des chaises en bois dépareillées, un éclairage chaud aux ampoules Edison et de la pluie visible sur la vitre donnant sur la rue » offre au modèle un véritable espace à peupler. Plus la description de l’environnement est riche, plus l’arrière-plan restera stable d’une image à l’autre.
Moment de la journée et météo
Ces deux paramètres font plus de travail que presque n’importe quel autre élément de votre prompt. Ils déterminent la direction de la lumière, la température de couleur, la dureté des ombres et la diffusion atmosphérique. « Brouillard du petit matin », « soleil de midi éclatant », « après-midi couvert », « crépuscule de l’heure bleue » : chacun de ces termes met en mouvement un univers visuel complètement différent. Ne laissez jamais le moment de la journée non précisé.
Indications de caméra et de composition
Angle et distance
Les modèles de vidéo IA répondent bien aux termes standards de la cinématographie pour l’angle et la distance. Utilisez-les tels quels :
Angles : niveau des yeux, contre-plongée, plongée, plongée zénithale, plan incliné (Dutch tilt), par-dessus l’épaule
Distances : très gros plan (ECU), gros plan (CU), plan moyen (MS), plan américain (FS), plan large, très plan large (EWS)
Les combiner (« plan moyen en contre-plongée ») indique au modèle exactement où placer la caméra par rapport au sujet.
Instructions de mouvement qui fonctionnent
Le mouvement de caméra est l’un des leviers les plus efficaces du prompt vidéo, et l’un des plus souvent négligés. Voici quelques descriptions de mouvement fiables, auxquelles la plupart des modèles réagissent bien :
« travelling avant lent » : la caméra se rapproche physiquement du sujet
« panoramique droit doux » : la caméra pivote horizontalement
« tilt vers le haut » : la caméra pivote verticalement vers le haut
« plan suiveur » : la caméra suit le sujet en mouvement
« plan fixe verrouillé » : aucun mouvement, très stable
« descente aérienne lente » : plongée zénithale qui descend
💡 Pour des modèles comme Kling v2.6 et Kling v3 Omni Video, préciser le mouvement de caméra directement dans le prompt donne des résultats plus intentionnels et mieux dirigés que de le laisser non spécifié.
Notes sur l’objectif et la profondeur de champ
Si vous connaissez la focale souhaitée, indiquez-la. « Objectif portrait de 85 mm à faible profondeur de champ » ne donne pas le même résultat que « grand-angle de 28 mm, tout est net ». Ces chiffres ne sont pas arbitraires : ils encodent des esthétiques visuelles précises qui apparaissent de façon constante dans les données d’entraînement. Un grand-angle de 28 mm crée un contexte environnemental. Un 85 mm comprime l’espace et isole le sujet. Un téléobjectif de 200 mm aplatit les plans et crée une isolation dramatique du sujet face à des arrière-plans chargés.
Description du mouvement et de l’action
Décrire le mouvement avec précision
L’erreur la plus fréquente dans la description du mouvement consiste à dire ce qu’une chose est plutôt que ce qu’elle fait.
« Une personne qui court » indique au modèle que le sujet est en mouvement. Cela ne lui dit ni la qualité, ni la vitesse, ni la direction, ni le détail physique de ce mouvement. « Une femme qui sprinte à pleine vitesse vers la caméra, bras pompant, graviers projetés derrière ses pieds, expression concentrée » lui donne les cinq.
Utilisez des verbes d’action et des détails physiques observables : s’effriter, se balancer, scintiller, s’incliner, tournoyer, onduler, se gonfler. Ils génèrent un mouvement plus cohérent que des termes généraux comme « bouger » ou « animé ».
Le problème du rythme
Les vidéos de cinq secondes ont besoin d’un seul arc d’action clair. Celles de dix secondes peuvent porter deux temps forts. Des générateurs comme Wan 2.7 T2V, LTX 2.3 Pro et Hailuo 02 produisent de meilleurs clips lorsque le prompt décrit une action continue unique plutôt que plusieurs événements distincts.
Si vous écrivez « elle ouvre la porte, entre, s’assoit et décroche le téléphone », vous décrivez une scène de 30 secondes compressée en un clip de 5 secondes. Le modèle sautera des images ou produira des enchaînements disjoints. Écrivez plutôt : « elle ouvre lentement la lourde porte en bois, marque une pause sur le seuil, une lumière dorée entrant à flots derrière elle ».
Ce que signifie vraiment la cohérence temporelle
La cohérence temporelle est la stabilité des éléments visuels d’une image à l’autre : le visage du sujet, l’arrière-plan, l’éclairage, la palette de couleurs. Lorsqu’elle se dégrade, on observe des textures qui scintillent, des visages qui se déforment ou des environnements qui changent en cours de clip.
L’améliorer exige de donner au modèle des repères stables. Des descriptions de sujet longues et précises aident. Des descriptions d’éclairage de scène solides aident. Éviter trop d’éléments en mouvement simultané aide. Des modèles comme Pixverse v6 et Gen 4.5 intègrent déjà des améliorations de stabilité, mais le prompt reste ce qui détermine la base.
Éclairage et atmosphère
Lumière naturelle ou artificielle
Les descriptions de lumière naturelle ont de fortes associations dans les données d’entraînement. « Contre-jour de l’heure dorée », « lumière diffuse d’un ciel couvert », « lumière de rue de l’heure bleue », « soleil de midi au zénith projetant des ombres dures » : chacune pose immédiatement le contexte visuel pour le modèle.
La lumière artificielle offre plus de précision. « Ampoule de tungstène unique au plafond », « enseigne au néon reflétée sur un trottoir mouillé », « montage de studio à trois points avec un fill doux », « néon vacillant dans un couloir » : tous ces termes encodent des ambiances cinématographiques précises avec une grande constance.
L’ambiance à travers la température de couleur
La température de couleur influe sur la lecture émotionnelle d’une scène autant que n’importe quel autre élément de votre prompt. Utilisez ces termes tels quels :
Mixte : cinématographique et dramatique (par exemple « lumière chaude d’un intérieur qui se répand dans un extérieur bleu froid »)
Éviter le problème de la vidéo plate
Les vidéos plates et sous-exposées résultent souvent de prompts sans aucune description d’éclairage. Le modèle se rabat sur un gris moyen. Pour l’éviter :
Nommez toujours une source de lumière (fenêtre, soleil, lampe, lampadaire, écran)
Indiquez la direction (de la gauche, d’en haut, en contre-jour, de côté)
Précisez la qualité (dure, douce, diffuse, directe, dispersée)
Une seule phrase de description d’éclairage (« lumière chaude d’une fenêtre venant de la gauche, projetant des ombres douces sur le visage du sujet ») modifie nettement le rendu de n’importe quelle génération.
Style, prompts négatifs et contrôles finaux
Modificateurs de style qui fonctionnent vraiment
Les meilleurs modificateurs de style pour la vidéo IA sont tirés de références cinématographiques réelles. Ils encodent des systèmes visuels précis que le modèle a assimilés à partir de films et de photographies authentiques :
« photoréaliste, 8K » : base de réalisme photographique
« rendu Arri Alexa » : science des couleurs du cinéma professionnel
« reflets anamorphiques » : esthétique de cinéma en format large
« documentaire caméra à l’épaule » : tremblements naturalistes volontaires
Évitez les termes au son artificiel comme « numérique hyperréaliste » ou « rendu 3D cinématographique ». Ils tirent souvent le modèle vers une esthétique de synthèse même lorsque vous voulez une photographie en prise de vues réelles.
Prompts négatifs : quoi exclure
Tous les modèles vidéo n’ont pas de champ de prompt négatif distinct. Lorsqu’il existe, utilisez-le. Voici les exclusions standards qui améliorent la plupart des vidéos :
flou, flou de mise au point (sauf si voulu)
filigrane, texte superposé, logo
cartoon, illustration, animation, anime
basse qualité, pixellisation, artefacts de compression
secousses excessives de la caméra (sauf si demandées)
plusieurs personnes (si votre scène exige un seul sujet)
Le test de relecture finale
Avant de soumettre un prompt, relisez-le et répondez à ces six questions :
Pouvez-vous visualiser exactement à quoi ressemble la première image ?
Savez-vous ce qui change entre la première et la dernière image ?
Y a-t-il une source de lumière nommée ?
Avez-vous précisé l’angle de caméra ?
Avez-vous décrit le mouvement de caméra, ou indiqué explicitement que la caméra reste fixe ?
Le sujet est-il décrit avec assez de précision pour rester cohérent d’une image à l’autre ?
Si vous répondez « non » à l’une de ces questions, comblez cette lacune avant de générer.
Checklist de prompts par modèle de vidéo IA
Les modèles réagissent différemment au même prompt. Adapter votre formulation aux caractéristiques du modèle donne de meilleurs résultats qu’une approche unique pour tous.
Seedance 2.0 pour le mouvement et l’audio
Seedance 2.0 produit un audio natif en même temps que la vidéo, ce qui le rend idéal pour les scènes où le son d’ambiance compte. Il gère bien les sujets rapides. Pour Seedance, décrire le contexte sonore dans le prompt améliore la bande-son générée : « vagues qui s’écrasent sur une côte rocheuse », « bourdonnement de la circulation urbaine à l’heure de pointe », « pas sur un chemin de gravier ».
Kling v3 pour le contrôle cinématographique
Kling v3 Video répond particulièrement bien au langage de caméra précis. Nommer les types de mouvement (« push-in lent », « plan de grue qui s’élève ») produit des résultats nettement plus maîtrisés que des descriptions génériques. La sortie en 1080p de Kling v3 en fait un bon choix lorsque la qualité de sortie compte plus que la vitesse de génération. Kling v2.6 offre un bon équilibre entre vitesse et contrôle pour des itérations plus rapides.
Wan 2.7 pour les séquences plus longues
Wan 2.7 T2V gère la génération en 1080p et constitue un bon choix pour des clips plus longs avec une bonne stabilité temporelle. Sa variante image vers vidéo, Wan 2.7 I2V, prend une image de référence comme première image, ce qui réduit nettement les problèmes de cohérence puisque le modèle dispose d’un point de départ concret, précis au pixel près, au lieu de partir uniquement du texte.
Veo 3.1 pour les contenus synchronisés avec le son
Veo 3.1 génère une vidéo avec un audio natif synchronisé. Pour les scènes de dialogue ou les contenus portés par la musique, inclure des descriptions sonores dans votre prompt donne à la génération audio davantage de matière : « guitare acoustique aux accents enjoués jouée doucement en arrière-plan », « dialogue dans une salle de bain carrelée avec une réverbération naturelle », « vent dans les pins ».
Pixverse v6 et Hailuo 02 pour une itération rapide
Lorsque la vitesse d’itération compte plus que la qualité maximale, Pixverse v6 et Hailuo 02 offrent des temps de génération rapides en bonne résolution. Ils conviennent bien pour tester des variantes de prompt : écrivez trois versions de la même scène avec des descriptions d’éclairage ou de mouvement différentes, générez les trois rapidement, puis confiez la version la plus convaincante à un modèle de meilleure qualité pour le résultat final.
Comment utiliser PicassoIA pour rédiger ses prompts vidéo IA
PicassoIA vous donne accès à tous les modèles ci-dessus depuis une seule interface, sans avoir besoin de clés API ou de comptes distincts pour chacun. Voici comment appliquer cette checklist sur la plateforme :
Environnement (où, avec des détails architecturaux ou naturels)
Moment de la journée et météo
Angle et distance de caméra
Mouvement de caméra, ou « plan fixe verrouillé »
Action ou mouvement (un seul arc, verbes d’action)
Éclairage (source, direction, qualité)
Modificateurs de style (photoréalisme standard, pellicule si nécessaire)
Exclusions (en fin de prompt, ou dans le champ négatif si disponible)
Étape 3 : commencez par 5 secondes, puis prolongez
Générez d’abord un clip de 5 secondes. Examinez la première image et la cohérence sur l’ensemble du clip. Si la première image est fausse, corrigez la description de la scène. Si la cohérence se rompt en cours de clip, ajoutez de la précision sur le sujet et réduisez le nombre d’éléments en mouvement simultané. Ne passez à un clip plus long qu’une fois que la version de 5 secondes tient la route.
Étape 4 : utilisez l’image vers vidéo pour une cohérence maximale
Si vous avez une première image précise en tête, générez-la d’abord avec un modèle de texte vers image, puis transmettez cette image à Wan 2.7 I2V, Wan 2.5 I2V ou Hailuo 2.3 pour l’animer. Cela élimine la plupart des problèmes de cohérence temporelle, car le modèle dispose d’un point de départ réel, précis au pixel près, au lieu de tout construire à partir du texte.
Commencez à générer dès maintenant
La checklist n’est pas faite pour être mémorisée. Elle se parcourt rapidement avant de lancer la génération, à la manière d’un pilote qui effectue sa vérification avant le vol : non parce qu’il a oublié le fonctionnement des systèmes, mais parce qu’un contrôle systématique attrape l’élément que l’on aurait autrement omis.
Copiez cette structure dans un fichier de notes et remplissez-la avant chaque génération :
Subject: [who or what, described precisely]
Environment: [where, with specific detail]
Time and weather: [lighting context]
Camera angle: [low / eye / high / aerial + distance]
Camera movement: [named movement or "locked-off"]
Action: [single motion arc, active verbs]
Lighting: [source + direction + quality]
Style: [photorealistic, film stock, etc.]
Exclude: [what the model should avoid]
Chaque champ rempli signifie moins de générations gâchées et des résultats plus rapides. La différence entre un prompt qui produit un clip plat et saccadé et un prompt qui donne quelque chose à garder tient souvent à trois ou quatre mots précis que vous n’aviez pas encore ajoutés.
PicassoIA réunit plus de 100 modèles de texte vers vidéo en un seul endroit, sans configuration fastidieuse. Choisissez un modèle, parcourez cette checklist et générez. Votre premier prompt structuré vous attend sur picassoia.com.