Veo 3.1 Ingredients to Video : utiliser des images de référence pour la vidéo IA

La fonction Ingredients to Video de Veo 3.1 vous permet d’utiliser des images de référence pour ancrer chaque détail visuel de votre vidéo générée par IA, de l’éclairage et des couleurs à l’identité du sujet. Cet article explique précisément comment fonctionne cette fonction, comment l’utiliser pas à pas sur PicassoIA, et comment rédiger des prompts qui donnent des résultats cohérents et de haute qualité sur plusieurs générations.

Veo 3.1 Ingredients to Video : utiliser des images de référence pour la vidéo IA
Cristian Da Conceicao
Fondateur de Picasso IA

Si vous avez un dossier de photos de référence et une idée précise de ce qui doit se passer dans une scène, la fonction Ingredients to Video de Veo 3.1 a été conçue pour ce moment précis. Au lieu de vous appuyer uniquement sur des descriptions textuelles pour définir le style visuel, l’apparence du sujet et l’ambiance, vous pouvez fournir une image de référence au modèle et le laisser faire l’essentiel du travail. Le résultat est une vidéo qui ressemble vraiment à la scène que vous aviez en tête.

Photos de référence disposées sur un panneau de liège, prêtes pour la génération de vidéo IA

Ce que fait réellement « Ingredients to Video »

Le nom est délibéré. « Ingredients » indique que vos entrées, notamment l’image de référence et votre prompt textuel, sont des matières premières que le modèle combine pour produire le résultat. Veo 3.1 ne se contente pas d’animer une photo fixe. Il utilise les informations visuelles de la référence comme point d’ancrage de la composition, puis génère un mouvement qui prolonge naturellement ce point de départ.

C’est fondamentalement différent des outils d’image vers vidéo qui ajoutent simplement un léger mouvement à une photo. Veo 3.1 synthétise de nouvelles images à partir de ce qu’il déduit de l’éclairage, de la profondeur, des relations spatiales et des caractéristiques du sujet présents dans la référence. La vidéo produite peut montrer des mouvements de caméra, des actions du sujet et des détails d’environnement qui ne figuraient jamais dans l’image d’origine.

Le rôle des images de référence

Dans ce contexte, une image de référence n’est pas simplement une première image. C’est un document de spécifications visuelles. Veo 3.1 en extrait :

  • Identité du sujet : structure du visage, proportions du corps, teint de la peau, texture des cheveux
  • Conditions d’éclairage : direction, dureté, température de couleur
  • Type d’environnement : intérieur, extérieur, naturel, urbain
  • Palette de couleurs : les tons dominants et d’accent qui se retrouvent dans la vidéo générée
  • Profondeur de champ apparente : caractère du bokeh, indices de distance focale

Plus votre image de référence contient d’informations, plus Veo 3.1 peut calibrer précisément son résultat. Un portrait net et bien éclairé donne au modèle davantage d’éléments à exploiter qu’un cliché flou pris avec un smartphone.

Comment Veo 3.1 lit le contexte visuel

Google DeepMind a entraîné Veo 3.1 sur de vastes jeux de données vidéo, ce qui signifie qu’il dispose de solides a priori sur la façon dont les scènes évoluent dans le temps. Lorsqu’une image de référence montre une femme debout près d’une fenêtre, sous une lumière d’après-midi, le modèle sait que cette situation d’éclairage produit des mouvements d’ombre précis au fil du temps, des reflets spéculaires spécifiques sur la peau et les tissus, et des variations de couleur ambiante bien définies. Cette connaissance contextuelle est ce qui distingue Veo 3.1 des outils d’animation plus simples.

💡 Astuce : les images de référence à fort éclairage directionnel produisent les résultats vidéo les plus cohérents visuellement. Un éclairage plat et couvert offre moins d’éléments au modèle.

Homme tenant une photo de référence pendant que son ordinateur affiche l’interface de vidéo IA

Pourquoi les images de référence changent tout

Les prompts textuels seuls ont une limite fondamentale : les mots décrivent des concepts, pas des détails précis. Vous pouvez écrire « une femme aux cheveux bruns chauds dans la lumière dorée de l’heure du coucher de soleil », et le modèle tranchera sur la manière dont cela doit se présenter. Ajoutez une image de référence montrant la personne exacte, la scène et l’éclairage, et cette part d’interprétation se réduit considérablement.

La cohérence sans astuces de prompt

L’un des problèmes les plus tenaces de la génération de vidéos par IA est la cohérence. Générer un second clip avec le même personnage, le même lieu et le même éclairage que le premier exige une ingénierie de prompt précise, et même dans ce cas, les résultats varient. Les images de référence résolvent une grande partie de ce problème.

Lorsque vous utilisez la même image de référence sur plusieurs générations Veo 3.1, le modèle ancre chaque résultat à la même empreinte visuelle. La personne de votre référence gardera le même visage, la pièce aura la même température de couleur, et la lumière tombera depuis la même direction. C’est ce qui fait de la génération de vidéo guidée par référence l’approche la plus pratique pour quiconque produit une série de clips.

Le transfert de style en mouvement

Les images de référence servent aussi de références de style, et pas seulement de références de sujet. Fournissez une photo au style cinématographique précis, à l’étalonnage couleur précis ou à la composition stylistique précise, et Veo 3.1 reprend ces qualités dans les images vidéo qu’il génère. C’est ainsi que les réalisateurs et les créateurs de contenu utilisent les planches de référence dans la production traditionnelle : pour établir un langage visuel avant le début du tournage.

La même logique s’applique ici. Votre image de référence est votre document de langage visuel.

Des cas d’usage réels qui fonctionnent

Cas d’usageCe que vous fournissezCe que Veo 3.1 génère
Campagne modePhoto du mannequin dans une tenue préciseClip de 5 secondes avec un mouvement naturel
Présentation de produitPhoto à plat ou plan héros du produitRévélation en orbite avec un éclairage cinématographique
Contenu voyagePhoto de paysage de la destinationPanoramique cinématographique avec mouvement atmosphérique
Avatar pour les réseaux sociauxPortrait avec un look précisBoucle subtile avec micro-mouvements naturels
ImmobilierPhoto d’une pièce intérieurePoussée fluide de la caméra à travers l’espace

Écran partagé montrant la photo de référence à côté d’images vidéo générées par IA

Comment utiliser Veo 3.1 sur PicassoIA

Veo 3.1 est disponible directement sur PicassoIA, sans configuration d’API ni installation locale. Voici le flux de travail exact pour l’utiliser avec des images de référence.

Étape 1 : choisir votre image de référence

Avant d’ouvrir l’outil, prenez le temps de sélectionner la bonne référence. Les qualités qui comptent le plus :

  • Résolution : 1024 px ou plus sur le petit côté. Une résolution plus élevée donne au modèle davantage de détails à extraire.
  • Netteté : mise au point nette sur votre sujet principal. Le flou de bougé dans la référence crée de l’ambiguïté.
  • Composition : cadrez votre sujet tel que vous voulez qu’il apparaisse dans la vidéo.
  • Éclairage : choisissez une image de référence qui présente l’éclairage souhaité pour la vidéo finale. Le modèle n’inventera pas un meilleur éclairage que celui que vous fournissez.

Évitez les captures d’écran issues des réseaux sociaux. Les artefacts de compression et les filigranes introduisent du bruit dans la lecture de l’image par le modèle.

Étape 2 : rédiger le prompt

Avec Veo 3.1, votre prompt textuel doit porter sur le mouvement et l’action, pas sur l’apparence. L’image de référence s’occupe de l’apparence. Votre prompt doit répondre à la question : que se passe-t-il dans cette scène ?

Structures de prompt efficaces :

  1. Action d’abord : « Marche lente dans un jardin ensoleillé, feuilles qui tombent autour d’elle, brise légère qui traverse ses cheveux »
  2. Caméra d’abord : « Travelling avant lent dans la pièce, profondeur de champ qui fait passer la mise au point de l’objet au premier plan au sujet »
  3. Atmosphère d’abord : « Lumière de l’aube qui s’intensifie progressivement, brume qui se lève de l’herbe, oiseaux qui traversent le cadre »

Gardez vos prompts entre 30 et 80 mots. Veo 3.1 accepte des prompts plus longs, mais des prompts plus courts et précis donnent des résultats plus nets.

Étape 3 : configurer et lancer

Sur PicassoIA, l’interface de Veo 3.1 vous donne accès aux paramètres principaux :

ParamètreRéglage recommandéRemarques
Image de référenceLa photo que vous avez sélectionnéeImportez-la directement depuis votre appareil
PromptDescription centrée sur le mouvement30 à 80 mots
Durée5 à 8 secondesIdéal pour les réseaux sociaux et le web
Format16:9 ou 9:16Adaptez-le à la plateforme de diffusion
SeedValeur fixeUtilisez la même seed pour des relances cohérentes

Cliquez sur générer et patientez. Veo 3.1 met généralement 60 à 120 secondes par génération.

💡 Conservez votre seed : si vous obtenez un résultat qui vous plaît, notez la valeur du seed avant de fermer la page. Vous pouvez réutiliser le même seed avec de légères variations du prompt pour produire des séries de résultats cohérentes.

Ce à quoi vous attendre des résultats

Les premières générations sont rarement des résultats définitifs. Utilisez la première passe pour vérifier si le modèle a correctement lu la référence. Vérifiez :

  • Interprétation correcte du sujet : la personne ou l’objet de la vidéo correspond-il à votre référence ?
  • Continuité de l’éclairage : la direction de la lumière et la température de couleur sont-elles cohérentes avec la référence ?
  • Naturel du mouvement : le mouvement paraît-il physiquement plausible ?

Si le sujet semble incorrect, l’image de référence est peut-être trop ambiguë. Si l’éclairage ne correspond pas, votre prompt prend peut-être le pas sur la référence. Ajustez et relancez.

Mur de planches d’inspiration couvert de photos de référence

Astuces de prompt qui fonctionnent avec les images de référence

La combinaison d’une image de référence et d’un prompt textuel crée une petite tension : le modèle doit concilier deux sources d’information. Comprendre la manière dont il résout cette tension vous aide à mieux rédiger vos prompts.

Décrivez le mouvement, pas l’apparence

C’est la règle la plus importante de la génération guidée par référence. Si votre référence montre une femme en robe rouge et que votre prompt dit « femme en robe rouge qui marche », vous décrivez en double ce que la référence communique déjà. Pire encore, si votre prompt dit « femme en robe bleue qui marche », vous créez un conflit qui produit un résultat imprévisible.

Rédigez vos prompts comme si le modèle voyait déjà exactement qui et quoi figure dans la référence. Décrivez ce qu’ils font, pas à quoi ils ressemblent.

3 structures de prompt qui donnent de bons résultats

Structure 1 : sujet + mouvement + environnement « Tourne lentement la tête pour regarder par-dessus son épaule, léger sourire qui se dessine, brise chaude de l’après-midi qui traverse le tissu »

Structure 2 : mouvement de caméra + point focal « La caméra s’élève lentement de la hauteur du bureau au niveau des yeux, révélant tout le studio derrière le sujet, faible profondeur de champ du début à la fin »

Structure 3 : atmosphère + passage du temps « La lumière du matin se renforce pendant 5 secondes, les ombres pivotent légèrement, la vapeur de la tasse se dissipe dans l’air »

Ce qu’il faut éviter dans votre prompt textuel

  • Descriptions d’apparence qui entrent en conflit avec l’image de référence
  • Termes de style vagues comme « cinématographique » ou « photoréaliste », car l’image de référence définit déjà le style
  • Termes de mouvement vagues comme « mouvement naturel » : précisez ce qui bouge et comment
  • Prompts trop longs avec plusieurs consignes concurrentes

💡 Résolution des conflits : lorsque votre prompt et votre image de référence se contredisent, Veo 3.1 accordera généralement plus de poids à l’image de référence pour l’apparence du sujet, et plus de poids au prompt pour la direction du mouvement. Appuyez-vous sur ce comportement, il est prévisible.

Profil d’une femme examinant des résultats de vidéo générés par IA sur un grand écran

Veo 3.1 ou d’autres modèles d’image vers vidéo

PicassoIA propose plus de 87 modèles de génération de vidéos. Choisir le bon pour un travail à partir d’images de référence suppose de savoir où chacun excelle.

Veo 3.1 ou Kling V3

Kling V3 est un concurrent sérieux pour la vidéo guidée par référence. Il gère les mouvements complexes et produit des clips plus longs avec une précision physique impressionnante. Là où Veo 3.1 l’emporte, c’est en matière de fidélité à l’éclairage, plus précisément dans sa manière de préserver le caractère lumineux de l’image de référence. Pour les portraits et le travail de mode, où le teint de la peau et la direction de la lumière sont essentiels, Veo 3.1 est le choix le plus fiable.

Veo 3.1 ou Wan 2.6 i2v

Wan 2.6 Image-to-Video est plus rapide et généralement plus abordable par génération. Il est excellent pour une animation simple où l’image de référence sert de première image littérale. La fonction Ingredients to Video de Veo 3.1 est le meilleur choix lorsque vous voulez que le modèle génère une vidéo qui dépasse le contenu littéral de la référence, en créant des scènes que la référence ne faisait que suggérer.

Quand choisir Veo 3.1 Fast

Veo 3.1 Fast est la version à utiliser lorsque vous itérez rapidement sur des variantes. Elle offre des temps de génération plus courts, au prix d’une légère baisse de qualité. Le flux de travail que suivent la plupart des professionnels : itérer avec Veo 3.1 Fast jusqu’à ce que l’interprétation de la référence et le mouvement soient corrects, puis passer le résultat final par Veo 3.1 pour une qualité maximale.

ModèleIdéal pourVitesseFidélité à la référence
Veo 3.1Résultats finaux, travaux où l’éclairage est critiqueMoyenneTrès élevée
Veo 3.1 FastItération et testsRapideÉlevée
Kling V3Clips longs, mouvements complexesMoyenneÉlevée
Wan 2.6 i2vAnimation rapide, efficacité budgétaireRapideMoyenne

Vue à plat de photos de référence sélectionnées sur une surface en lin

Erreurs courantes avec les images de référence

La plupart des générations ratées se ramènent à l’un de trois problèmes d’entrée, et non à des limites du modèle.

Entrées de faible résolution

Importer une image de référence compressée ou de petite taille est le moyen le plus rapide d’obtenir un résultat incohérent. Lorsque le modèle ne parvient pas à distinguer les détails fins de la référence, il comble les vides avec ses propres a priori. Le résultat est une vidéo qui capte l’ambiance générale de la référence, mais pas ses spécificités. Votre sujet paraît différent. La lumière est au mauvais endroit.

Recommandation minimale : 1024x576 px pour un contenu en 16:9. Visez 1920x1080 px lorsque le détail du sujet compte.

Prompts contradictoires

Un prompt qui décrit l’apparence de votre sujet va souvent annuler ou brouiller l’influence de l’image de référence. Cela arrive parce que Veo 3.1 reçoit les deux comme des consignes et doit les pondérer. Plus votre description d’apparence est précise et détaillée, plus elle éloigne le modèle de la référence.

La solution est simple : retirez de votre prompt tout ce qui concerne l’apparence et remplacez-le uniquement par du langage de mouvement.

Ignorer le format

L’image de référence et la vidéo de sortie doivent partager le même format. Importer un portrait carré en 1:1 comme référence et demander une sortie en 16:9 oblige le modèle à inventer ce qui se trouve hors du cadre. Parfois, cela fonctionne. Souvent, cela produit des proportions déformées ou une extrapolation incorrecte de l’environnement.

Recadrez votre référence au format de sortie visé avant de l’importer.

Mains tenant une tablette affichant l’interface de génération de vidéo IA avec une grille d’images de référence

Ce que vous pouvez créer dès maintenant

La génération de vidéos guidée par référence avec Veo 3.1 n’est pas théorique. Voici des types de contenus précis qui donnent de bons résultats avec ce flux de travail aujourd’hui.

Contenus de mode et de style de vie

C’est là que la technologie est la plus immédiatement utile. Les marques de mode et les créateurs de contenus lifestyle ont besoin de vidéos de produits précis, portés par des personnes précises, dans des décors précis. La génération guidée par référence vous permet de partir de photos existantes, de passer moins d’heures sur le tournage et de produire davantage.

Une seule photo de mode de haute qualité peut devenir un clip de 5 secondes, une étude en gros plan sur une texture et une vidéo lifestyle en extérieur, le tout avec une cohérence visuelle sur chaque résultat.

Vidéo de voyage et de destination

Les créateurs de contenus voyage disposent souvent de photos de lieux, mais ont besoin de vidéos. La génération guidée par référence comble cet écart. Une photo de paysage devient un panoramique cinématographique lent. Un intérieur architectural devient une traversée fluide. La référence ancre le modèle dans les spécificités visuelles du lieu réel plutôt que dans une interprétation générique de la scène.

Clips de présentation de produits

Les marques de e-commerce ont besoin de vidéos de produits, mais pas toujours d’un budget de production complet. Un plan héros du produit utilisé comme image de référence, combiné à un prompt de mouvement de rotation ou de révélation, produit une vidéo de produit exploitable qui correspond à la photographie existante de la marque. La couleur, l’éclairage et le traitement de l’arrière-plan de la référence se retrouvent directement dans la vidéo.

Studio vidéo professionnel avec plusieurs écrans affichant des résultats de vidéos générées par IA

Commencez à créer avec vos propres références

La façon la plus rapide de voir ce que fait la fonction Ingredients to Video de Veo 3.1 est de l’essayer vous-même. Choisissez une photo que vous possédez déjà, avec un éclairage net et un sujet bien défini. Rédigez un prompt de mouvement court, en une phrase, décrivant ce qui doit se passer dans la scène. Importez les deux sur Veo 3.1 sur PicassoIA et lancez votre première génération.

Le premier résultat vous en apprendra plus sur la façon dont les images de référence interagissent avec ce modèle que n’importe quelle explication écrite. Ensuite, ajustez votre sélection de référence, affinez votre prompt, testez Veo 3.1 Fast pour des cycles d’itération plus rapides, et comparez les résultats avec Kling V3 ou Wan 2.6 i2v pour trouver ce qui correspond à vos besoins de contenu précis.

PicassoIA vous donne accès à tous ces modèles au même endroit, ce qui vous permet de faire passer la même référence dans plusieurs systèmes et de comparer les résultats côte à côte. Cette comparaison directe est la boucle de retour la plus efficace pour développer votre intuition de la génération de vidéos IA à partir d’images de référence.

Planche de storyboard avec des photos de référence pour planifier le flux de travail de vidéo IA

Partager cet article

Choisissez votre langue