Comment écrire des prompts image vers vidéo qui fonctionnent vraiment

Rédiger des prompts efficaces pour l’IA image vers vidéo demande un vocabulaire de mouvement précis, des consignes de caméra claires et des repères de timing structurés. Cet article détaille chaque élément avec des exemples concrets et des comparaisons de modèles, pour obtenir des résultats toujours cinématographiques à partir de n’importe quelle image de départ.

Comment écrire des prompts image vers vidéo qui fonctionnent vraiment
Cristian Da Conceicao
Fondateur de Picasso IA

Écrire un prompt image vers vidéo n’est pas la même chose qu’écrire un prompt d’image. Les règles sont différentes, le vocabulaire aussi, et surtout le modèle mental à adopter est totalement différent. Un bon prompt d’image fixe décrit un instant figé. Un bon prompt de mouvement décrit une suite d’événements qui se déroulent dans le temps. Si vous envoyez votre meilleure image dans un modèle de vidéo par IA et obtenez des résultats raides, faux ou simplement bizarres, le problème vient presque certainement de votre prompt.

Pourquoi votre prompt fait tout le travail

Chaque modèle image vers vidéo, de Wan 2.7 I2V à Kling v3 Omni Video, fonctionne en interprétant deux entrées : votre image de départ et vos instructions de mouvement. Le modèle lit l’image pour le contexte de la scène, l’éclairage, le sujet, les indices de profondeur et la palette de couleurs. Puis il lit votre prompt pour savoir quoi faire de tout cela pendant les cinq prochaines secondes.

Si votre prompt est vague, le modèle devine. Parfois il devine juste. Souvent non. Si votre prompt est précis et orienté mouvement, le modèle exécute. C’est toute la différence entre un clip que vous montreriez à quelqu’un et un clip que vous supprimeriez.

Créatrice de contenu devant un double écran dans un studio baigné de lumière d’après-midi

C’est pourquoi vous ne pouvez pas copier-coller un prompt d’image générative dans Seedance 2.0 en espérant un rendu cinématographique. Les prompts d’image sont optimisés pour la composition statique. Les prompts vidéo demandent une réflexion temporelle.

Pensée statique contre pensée de mouvement

Un prompt statique répond à une seule question : à quoi cela ressemble-t-il ? Un prompt de mouvement répond à une autre question : que se passe-t-il ici, dans quel ordre, et depuis quelle position de caméra ?

Voici une comparaison directe :

Prompt statiquePrompt de mouvement
« Femme assise à la fenêtre d’un café, lumière du matin »« La femme soulève lentement sa tasse de café, jette un regard à gauche par la fenêtre, une lumière douce glisse sur son visage à mesure que les nuages passent »
« Rivière en forêt à l’heure dorée »« La caméra avance doucement, à basse altitude au-dessus de la surface de l’eau, de la brume se détache des rochers à mesure que le courant avance »
« Homme marchant sous la pluie »« L’homme avance de la gauche vers la droite sur des pavés mouillés, des flaques ondulent à chaque pas, la caméra le suit à mi-distance »

Chaque prompt de mouvement décrit des événements dans le temps. Il y a un sujet, un verbe et un contexte qui indique comment la scène évolue. Cette structure est précisément ce que les modèles vidéo sont conçus pour lire.

Ce que le modèle lit réellement

Les modèles de vidéo par IA pondèrent les éléments d’un prompt selon un ordre de priorité approximatif. Le mouvement du sujet arrive en tête. Le mouvement de caméra vient en deuxième. Les détails d’atmosphère et de texture viennent en dernier. Si vous placez les descriptions de scène en début de prompt et reléguez le mouvement à la fin, le modèle risque de produire un clip visuellement exact mais presque statique.

💡 Règle : placez d’abord ce qui bouge. Action du sujet dans la première phrase. Mouvement de caméra dans la deuxième. Éclairage et atmosphère en dernier.

L’anatomie d’un bon prompt de mouvement

Chaque prompt image vers vidéo performant contient trois éléments structurels. Si vous en omettez un seul, vos résultats varieront d’une génération à l’autre.

Le sujet d’abord, l’action ensuite

Le sujet est l’élément principal de votre image. L’action est ce que ce sujet fait pendant le clip. Les deux doivent être précis et concrets.

Faible : « Une femme dans un café » Fort : « Une femme soulève sa tasse d’expresso à deux mains, la vapeur monte en volutes dans la lumière du matin »

C’est dans le verbe que se loge l’animation. « Soulève », « tourne », « jette un regard », « sourit », « marche », « incline » donnent au modèle quelque chose de concret à exécuter. Les verbes abstraits comme « ressent » ou « vit l’expérience de » ne produisent rien d’utile, car ils n’ont aucun équivalent physique que le modèle puisse rendre en mouvement d’une image à l’autre.

Femme près d’une fenêtre de café ensoleillée, lumière matinale diffuse, tasse de café au premier plan

Des modèles comme Wan 2.6 I2V et Kling v2.6 Motion Control réagissent particulièrement bien à une formulation précise de l’action du sujet. Plus votre description de l’action est fine, plus le modèle peut l’exécuter fidèlement sur toute la durée du clip.

Le rôle du mouvement de caméra

Le mouvement de caméra est l’élément le plus sous-utilisé dans les prompts de mouvement amateurs. C’est aussi celui qui transforme le plus sûrement un clip correct en clip cinématographique.

Direction de caméraCe qu’elle produit
Travelling avant lentIntimité, attire l’attention vers le sujet
Panoramique doux à gauche ou à droiteRévèle l’environnement, crée une impression de voyage
Montée en contre-plongéeDramatisme, le sujet paraît dominant dans le cadre
Descente aérienneSensation d’arrivée, établit l’échelle et le lieu
Statique, verrouilléToute l’attention sur le mouvement du sujet, délibéré et contenu
Légère dérive à l’épauleRéalisme organique, qualité documentaire
Dézoom lentÉlargissement du contexte, révèle progressivement l’échelle
Orbite à 360 degrésMise en valeur du produit, montre tous les angles successivement

💡 Choisissez un seul mouvement de caméra par clip et tenez-vous-y. Combiner deux mouvements de caméra en cinq secondes crée une confusion visuelle, et les modèles réussissent rarement à exécuter les deux proprement.

Gen4 Turbo et Kling v3 Motion Control répondent très bien aux consignes de caméra explicites. Kling v3 Motion Control a été spécifiquement conçu pour suivre des trajectoires de caméra, ce qui le rend précieux lorsque le contrôle spatial précis compte.

Repères de timing et de vitesse

Cinq secondes passent vite. La vitesse à laquelle votre sujet et votre caméra se déplacent dans cette fenêtre change entièrement le ton émotionnel du clip.

Modificateurs de vitesse utiles :

  • « lentement », « doucement », « progressivement » — calme, méditatif, élégant
  • « brusquement », « soudain » — forte énergie, dramatique
  • « à peine perceptiblement » — atmosphérique, impressionniste
  • « régulièrement », « constamment » — contrôlé, délibéré
  • « par à-coups », « en rythme » — dynamique, cinétique

Vous n’avez pas besoin de préciser des fréquences d’images ni des durées en millisecondes. Le modèle gère cela en interne. Ce que vous faites avec ces mots, c’est fixer le sentiment de vitesse par le choix des adverbes et des adjectifs, et ce sentiment est précisément ce qui est rendu.

Un vocabulaire de mouvement qui fonctionne

Les mots précis que vous utilisez déterminent ce qui sera généré. Voici un vocabulaire de travail organisé par fonction, prêt à être utilisé directement.

Mots pour l’action du sujet

Dérive, glisse, jaillit, se pose, scintille, pulse, balaie, tourbillonne, trace, pivote, se contracte, se dilate, s’élève, retombe, incline, tourne, soulève, libère, ondule, miroite

Mots pour le mouvement de caméra

Travelling avant, panoramique à gauche, monte, descend, incline vers le haut, incline vers le bas, suit vers la droite, tourne autour, orbite, révèle, monte en grue, reste immobile, traverse, recule, suit à distance

Mots pour l’atmosphère et la texture

Volumétrique, diffus, rasant, moucheté, scintillant, feutré, brumeux, cristallin, granuleux, stratifié, dispersé, bords doux, prismatique, anguleux, aux tons chauds

Scène aérienne d’une forêt d’automne avec une rivière, brume matinale à l’heure dorée

Comment construire une phrase : [Subject from set 1] + [direction or purpose] + [camera word from set 2] + [atmosphere from set 3]

Exemple : « La brume de la rivière monte à travers la canopée ambrée tandis que la caméra avance doucement à hauteur d’eau, la lumière diffuse du matin se dispersant entre les branches. »

Cela fait 28 mots. Cette phrase donne au modèle une action de sujet, un mouvement de caméra et une texture atmosphérique. Tout ce dont il a besoin pour produire un clip cohérent.

Modèles de structure de prompt

Deux structures couvrent environ 90 % des cas d’usage. La plus simple s’écrit plus vite et fonctionne bien avec la plupart des modèles. La plus détaillée produit des résultats plus précis lorsque vous en avez besoin.

La formule simple en 3 parties

[Subject action] + [Camera movement] + [Atmosphere]

Exemple : « Une femme se tourne lentement vers la caméra avec un léger sourire. La caméra avance doucement. Lumière matinale chaude et diffuse. »

Cette structure fonctionne bien avec des modèles rapides, notamment Wan 2.5 I2V Fast, Seedance 2.0 Fast et Video 01 Live. Les prompts courts laissent au modèle la liberté d’exprimer son propre style de mouvement, ce qui, avec les modèles de haute qualité, joue souvent en votre faveur.

La formule cinématographique en 5 parties

[Subject starting state] + [Action sequence] + [Camera movement] + [Lighting behavior] + [Atmospheric detail]

Exemple : « Un homme se tient au bord d’une rue détrempée par la pluie, le col de sa veste relevé, les mains le long du corps. Il lève lentement le regard vers l’extrémité de la rue et fait un pas en avant. La caméra le suit en contre-plongée basse, en s’élevant légèrement. La lumière chaude d’un lampadaire au sodium se reflète sur l’asphalte mouillé à gauche. Une brume légère traverse les immeubles en arrière-plan. »

Homme dans une rue urbaine mouillée au crépuscule, reflets dans les flaques

Cette structure de 65 mots donne aux modèles de précision comme Wan 2.7 I2V et Kling v3 Omni Video assez de matière pour produire un clip véritablement cinématographique, avec un mouvement cohérent sur les cinq secondes.

Quand utiliser chacune des formules

SituationMeilleure formule
Contenus pour les réseaux sociaux, itérations rapidesFormule simple en 3 parties
Court-métrage ou séquences narrativesFormule cinématographique en 5 parties
Animations de produitsFormule simple en 3 parties avec un verbe d’action spécifique au produit
Scènes avec personnagesFormule cinématographique en 5 parties
Plans de nature ou de paysageFormule simple en 3 parties (les modèles comblent bien les vides de l’environnement)
Séquences de clips musicauxFormule cinématographique en 5 parties

Erreurs courantes dans les prompts

Ces trois schémas produisent systématiquement des résultats faibles, et les trois sont faciles à éviter une fois que vous savez quoi surveiller.

Surcharger la scène

Cinq secondes ne peuvent pas contenir trois événements distincts. Si votre prompt comporte plusieurs changements de scène, le modèle en ignore certains ou crée des coupures brutales entre eux.

À éviter : « La femme se retourne, puis la caméra coupe sur la rue extérieure, puis zoome sur une tasse de café, puis la lumière passe du jour à la nuit. »

À faire à la place : choisissez un moment et rendez-le entièrement. Gardez les autres plans pour des prompts et des générations séparés.

Ignorer l’image de départ

Le modèle utilise votre image comme image zéro. Si votre prompt décrit quelque chose qui ne peut pas découler de l’état de l’image, le modèle ignore l’instruction ou produit des artefacts de distorsion en tentant de concilier le conflit.

Si votre image montre une femme assise, les yeux fermés, et que votre prompt dit « elle ouvre les yeux et sort en courant », vous demandez au modèle de contredire sa propre entrée. Partez de l’état de l’image, pas à son encontre.

💡 Avant de rédiger votre prompt, écrivez une phrase décrivant précisément ce que montre votre image. Puis rédigez un prompt qui prolonge naturellement cet état. Cette seule habitude élimine la plupart des générations ratées.

Macro d’un objectif d’appareil photo, texture métallique des lamelles sous une lumière de studio

Utiliser le langage de la génération d’images

Certaines formules qui fonctionnent dans les générateurs d’images perturbent activement les modèles vidéo :

  • « Très détaillé, 8K, photoréaliste » — le modèle gère la résolution en interne ; ces mots gaspillent des tokens du prompt
  • « Dans le style de [photographe] » — les références de style fonctionnent pour la composition statique, pas pour décrire un mouvement dans le temps
  • « Étalonnage cinématographique » — l’étalonnage est appliqué en interne par le modèle ; cette formule ne dirige pas le mouvement
  • « Mise au point nette, arrière-plan flou » — la mise au point est définie par votre image d’entrée ; le prompt ne doit pas redécrire l’état statique

Remplacez chacune de ces formules par une consigne de mouvement. Chaque token dépensé pour « très détaillé » est un token que vous n’avez pas utilisé pour demander à la caméra de s’élever.

Modèles image vers vidéo sur PicassoIA

PicassoIA héberge plus de 100 modèles de génération de vidéos, parmi les systèmes image vers vidéo les plus performants disponibles partout aujourd’hui.

Les meilleurs modèles pour les prompts de mouvement

ModèlePoint fortQualité de sortie
Wan 2.7 I2VAnimation de scène détaillée, forte fidélité du mouvement720p
Kling v3 Motion ControlPrécision de la trajectoire de caméra, mouvement cinématographique1080p
Kling v3 Omni VideoVidéo de haute qualité à partir de texte et d’image1080p
Seedance 2.0Mouvement réaliste et fluide avec audio natif1080p
Gen4 TurboImage vers vidéo rapide, idéal pour les itérations rapides720p
Ovi I2VAnimation de personnages avec audio synchronisé720p
Video 01 LiveAnimation naturelle de photos fixes1080p
Wan 2.5 I2VÉquilibre entre qualité et vitesse pour un usage quotidien720p
Hailuo 2.3Qualité de sortie cinématographique en 1080p1080p
LTX 2 ProQualité maximale, sortie en 4K4K

Falaise côtière à l’heure bleue, vagues déferlantes et brume marine

Comment utiliser Wan 2.7 I2V sur PicassoIA

Wan 2.7 I2V figure constamment parmi les meilleurs modèles image vers vidéo pour une animation réactive aux prompts. Voici comment obtenir des résultats fiables :

  1. Importez votre image de départ dans l’interface du modèle. Une largeur minimale de 512 px fournit au modèle assez de données de pixels pour un mouvement cohérent.
  2. Rédigez votre prompt avec l’une des deux formules. Action du sujet en premier, puis mouvement de caméra, puis atmosphère. Gardez la première phrase entièrement consacrée à ce que fait le sujet.
  3. Choisissez la résolution : 720p offre le meilleur rapport qualité-vitesse pour la plupart des usages. Utilisez-la par défaut.
  4. Itérez en changeant les verbes : générez trois variantes du même prompt avec des verbes de mouvement différents. « Dérive » et « glisse » donnent des impressions de mouvement différentes à partir d’entrées identiques. Le vocabulaire des verbes est votre principal levier d’itération.
  5. Quand le mouvement est trop discret : si Wan 2.7 donne des résultats trop retenus, passez le même prompt dans Kling v3 Motion Control. Kling produit de façon constante un mouvement plus marqué à partir du même texte, ce qui fait de ces deux modèles des compléments naturels pour trouver la bonne intensité de mouvement.

Exemples de prompts réels

Voici quatre prompts complets, prêts à l’emploi, pour quatre types d’images courants. Reprenez la structure et adaptez les détails à vos propres images.

Animation de portrait

Image de départ : personne regardant légèrement à gauche, lumière douce de studio

Prompt : « Elle tourne lentement la tête vers la caméra, un léger sourire se dessinant au coin de sa bouche. La caméra reste immobile, verrouillée. Une lumière de studio douce et diffuse venant du haut à gauche accroche sa pommette et le bord de son épaule. »

Meilleurs modèles : Ovi I2V, Video 01 Live

Mouvement de paysage

Image de départ : canopée d’une forêt d’automne, rivière visible depuis un angle aérien

Prompt : « La surface de la rivière capte la lumière tandis que la caméra descend doucement vers l’eau, les cimes des arbres s’écartant de chaque côté. La brume traverse la partie supérieure de la canopée. La lumière passe de l’ambre à un or chaud à mesure que l’angle de descente change. »

Meilleurs modèles : Wan 2.7 I2V, Wan 2.6 I2V

Appareil photo hybride sur un plan de travail en marbre, tache de lumière de fenêtre précise

Présentation de produit

Image de départ : boîtier d’appareil photo sur un plan de travail en marbre, lumière de fenêtre visible

Prompt : « Le boîtier de l’appareil photo reste immobile sur la surface de marbre pendant qu’une lente orbite de 180 degrés commence depuis le côté droit, révélant progressivement la texture de la poignée et les détails des molettes. La tache de lumière glisse sur les veines du marbre à mesure que l’angle change. Fluide, continu, commercial. »

Meilleurs modèles : Gen4 Turbo, Seedance 2.0

Séquence d’action

Image de départ : danseuse en plein saut dans un entrepôt

Prompt : « Elle retombe de son saut et enchaîne aussitôt une lente pirouette, les bras s’ouvrant de chaque côté du corps. La caméra s’élève légèrement et dérive vers la gauche, en gardant la danseuse centrée dans le cadre tout du long. L’unique lampe suspendue projette son ombre tournoyante sur le sol en béton en dessous d’elle. Contrasté, délibéré, contenu. »

Meilleurs modèles : Kling v3 Video, Hailuo 2.3

Danseuse en plein saut dans un entrepôt industriel, éclairage dramatique par le haut et ombre portée

Ce qui distingue le bon du très bon

À ce stade, vous avez la structure : action du sujet, mouvement de caméra, atmosphère, dans le bon ordre, avec un vocabulaire précis. Ce qui sépare les résultats que vous supprimeriez de ceux que vous utiliseriez vraiment, c’est la précision sur la manière dont quelque chose bouge, et pas seulement sur ce qui bouge.

Comparez ces deux prompts pour la même image :

Passable : « Les feuilles soufflent dans le vent. »

Impressionnant : « Des feuilles isolées se détachent de l’extrémité des branches et tombent en spirales lentes, se retournant à mesure qu’elles descendent, tandis que la caméra s’élève doucement jusqu’à ce que la dernière se pose au sol. »

La seconde version décrit une trajectoire, une physique et la relation de la caméra à l’événement sur toute la durée du clip. Ce niveau de détail donne au modèle quelque chose de réel à exploiter, de la première image jusqu’à la 120e.

Une remarque pratique sur l’itération : si vos résultats commencent à se ressembler, changez vos verbes de mouvement avant de changer quoi que ce soit d’autre. Remplacez « lentement » par « progressivement ». Remplacez « dérive » par « glisse ». De petits changements de vocabulaire dans la phrase d’action du sujet produisent des mouvements sensiblement différents, car les modèles sont plus sensibles au choix du verbe qu’on ne le pense en général.

Bout des doigts sur un clavier mécanique éclairé par la lueur d’un écran la nuit

Vos images sont déjà prêtes

Chaque image que vous avez jamais réalisée est un cadre de départ potentiel. Les modèles de vidéo par IA sur PicassoIA se chargent du rendu. Votre rôle est de décrire ce qui se passe ensuite, dans un langage de mouvement que le modèle peut exécuter.

Choisissez une image. Écrivez une phrase d’action pour le sujet. Ajoutez un mouvement de caméra. Ajoutez une note d’atmosphère. Collez le tout dans Wan 2.7 I2V ou Seedance 2.0 et lancez la génération. Le résultat sera nettement meilleur que tout ce que vous obteniez avant d’appliquer cette structure. Changez ensuite un seul verbe et relancez. C’est ainsi que la pratique de l’écriture de prompts se construit réellement.

Parcourez les plus de 100 modèles de génération de vidéos sur picassoia.com/en/all-models et commencez par le modèle du tableau ci-dessus qui correspond le mieux à votre cas d’usage.

Partager cet article

Choisissez votre langue