Serveur MCP Veo 3.1 : générer des vidéos Veo dans Claude et Gemini
Un serveur MCP Veo 3.1 permet à Claude et Gemini de lancer des rendus vidéo Google, de suivre la tâche et d’enregistrer le MP4 pour vous. Découvrez les vrais noms des outils, les blocs de configuration pour Claude Desktop, Claude Code et Gemini CLI, les prix par seconde et les structures de prompts qui donnent de meilleurs clips.
Taper une phrase dans Claude et récupérer une vidéo finie avec du son n’est plus une expérience de laboratoire. Avec un serveur MCP Veo 3.1, c’est un appel d’outil ordinaire : votre client envoie le prompt au modèle vidéo de Google, attend le rendu du clip et enregistre le MP4 dans le dossier de votre choix. Le piège, c’est que rien ne fonctionne d’emblée. Vous choisissez un serveur, vous le reliez à Claude ou Gemini, et vous vérifiez la facturation avant le premier rendu, qui peut vider votre budget.
Cet article détaille cette installation avec les noms réels des outils, les vrais blocs de configuration et les prix réels par seconde, puis présente l’alternative sans configuration sur PicassoIA. Tout ce qui concerne les serveurs tiers provient de leurs README et fiches publics : considérez-le comme une liste de lecture, et non comme un rapport de test.
Ce que fait un serveur MCP Veo
MCP, le Model Context Protocol, est le standard ouvert qui permet à un client d’IA d’appeler des outils externes. Un serveur MCP Veo est un petit programme qui expose la génération de vidéos sous forme de quelques outils. Votre client le lance comme processus local, lit la liste des outils et appelle ces outils chaque fois que vous demandez un clip.
Pourquoi ne pas appeler directement l’API Gemini ? Vous le pouvez, et un court script Python fait le travail. Un serveur MCP se justifie quand vous voulez que la conversation pilote le travail : Claude rédige le découpage des plans, choisit les réglages, lance le rendu, vérifie son avancement et vous indique où le fichier a été enregistré, le tout dans un seul fil.
Les trois éléments en jeu
Chaque installation repose sur les mêmes trois couches, quel que soit le serveur choisi.
Élément
Exemple
Rôle
Client
Claude Desktop, Claude Code, Gemini CLI
Reçoit votre demande et décide quel outil appeler
Serveur
Un package Python lancé avec uvx
Transforme les appels d’outils en requêtes vers l’API Gemini
Le serveur détient votre identifiant Google : c’est donc la partie qui mérite le plus d’attention.
Pourquoi la vidéo exige des outils asynchrones
Une réponse texte arrive en quelques secondes. Une vidéo, non. Le README d’un serveur indique des durées de rendu allant de 11 secondes à 6 minutes selon le prompt, et un autre lance le job en arrière-plan, renvoie un identifiant de job et demande au client de l’interroger toutes les 15 à 20 secondes. Ce schéma compte, car les clients de chat abandonnent les appels d’outils qui durent trop longtemps.
💡 Si un serveur bloque jusqu’à la fin de la vidéo, attendez-vous à des délais d’attente sur les longs rendus. Privilégiez les serveurs qui proposent un outil pour lancer le job et un outil distinct pour en vérifier l’état.
Serveurs communautaires et leurs outils
Google distribue Veo via l’API Gemini, et la communauté l’a encapsulé dans plusieurs serveurs MCP. Aucun n’est fourni par Google ni par PicassoIA. Les détails ci-dessous proviennent du serveur alohc sur GitHub, de la fiche Gemini Media MCP, de visualgen mcp et de mcp-veo d’AceDataCloud.
veo_generate_video, veo_image_to_video, veo_interpolate_video, veo_extend_video, veo_check_job, veo_list_jobs et trois outils utilitaires
720p, 1080p ou 4K, lots de 1 à 4 vidéos
visualgen mcp
Un générateur d’images et Veo 3.1 en versions lite, fast et standard
720p jusqu’à 4K, image vers vidéo en option
mcp-veo (AceDataCloud)
Texte vers vidéo, image vers vidéo, upscaling 1080p, suivi des tâches
Passe par l’API AceDataCloud, et non directement par Google
Trois types d’outils reviennent partout : texte vers vidéo, image vers vidéo et extension. L’extension ajoute environ 7 secondes à un clip existant, mais un README la limite à 720p et à 148 secondes au total, et Veo 3.1 Lite ne prend pas du tout en charge l’extension.
Le modèle par défaut du serveur alohc est veo-3.1-generate-preview, et le serveur Gemini Media MCP propose une version standard et une version rapide. Quand un serveur vous laisse choisir le modèle par son nom, indiquez ce choix dans votre prompt pour que le client n’ait pas à deviner.
Choisir un serveur que vous pouvez auditer
Ces programmes tournent sur votre machine avec votre identifiant Google dans leur environnement. Avant d’en installer un :
Lisez le code source, car chacun est assez court pour être parcouru.
Épinglez une version précise au lieu de suivre la dernière publication.
Créez un identifiant Google dédié, pour pouvoir le révoquer sans rien casser d’autre.
Configurez une alerte de budget sur le compte de facturation, car une boucle incontrôlée est facturée à la seconde de vidéo.
Connecter Veo à Claude
Claude se connecte aux serveurs MCP de deux façons : Claude Desktop via un fichier de configuration JSON, et Claude Code via une seule commande. Les deux lancent le même package serveur.
Configuration de Claude Desktop
Installez uv, le lanceur Python qui fournit uvx.
Dans Claude Desktop, ouvrez Paramètres, puis Developer, puis Edit Config.
Ajoutez votre identifiant Gemini dans ce même bloc env, en utilisant le nom de variable indiqué dans le README du serveur choisi.
Quittez complètement Claude Desktop puis rouvrez-le. Les outils Veo devraient apparaître dans le menu des outils.
💡 Les variables du dossier de sortie varient selon le serveur. Un README utilise VIDEO_OUTPUT_DIR, un autre VEO_OUTPUT_DIR. Reprenez le nom indiqué dans le projet que vous avez installé.
Si les outils n’apparaissent pas, validez d’abord le JSON, car une seule virgule finale casse tout le fichier. Vérifiez ensuite que uvx est bien dans votre PATH et que vous avez quitté l’application au lieu de simplement fermer la fenêtre.
Configuration de Claude Code
Une seule commande enregistre le serveur pour chaque projet que vous ouvrez :
claude mcp add veo -s user -- uvx veo-mcp-server
Transmettez votre identifiant avec l’option -e, puis exécutez /mcp pour vérifier que le serveur apparaît comme connecté. Ensuite, un prompt du type « Génère un clip vertical de 6 secondes de pluie sur la vitre d’un tramway, sans musique, puis dis-moi où le fichier est enregistré » déclenche un appel de démarrage, plusieurs vérifications d’état et, à la fin, un chemin de fichier. Pour votre premier essai, demandez un clip de 4 secondes en 720p : une mauvaise configuration ou un prompt vague vous coûtera quelques centimes au lieu de plusieurs dollars.
Connecter Veo à Gemini
Vous avez deux options. Gemini CLI peut charger les mêmes serveurs MCP, et l’application Gemini peut générer des clips Veo par elle-même.
Configuration de Gemini CLI
Gemini CLI lit ~/.gemini/settings.json et attend les serveurs sous un objet mcpServers, la même structure que celle utilisée par Claude :
Ajoutez ici aussi la variable d’identifiant, redémarrez le CLI et exécutez /mcp pour lister tous les outils chargés. Gemini CLI accepte aussi les serveurs SSE et HTTP en streaming, donc un serveur hébergé fonctionne également, à condition que vous lui fassiez confiance.
Si vous voulez qu’un modèle de chat rédige des découpages de plans avant de dépenser quoi que ce soit en rendu, Gemini 3.5 Flash est rapide pour des ébauches, et Gemini 3.1 Pro convient mieux aux scripts plus longs.
L’application Gemini sans MCP
L’application Gemini peut aussi générer directement des vidéos Veo avec les forfaits compatibles. Cette voie convient aux clips ponctuels. Elle ne propose ni scripts, ni traitement par lots, ni chemin de fichier que vous contrôlez. Dès que vous avez besoin de résultats reproductibles, MCP l’emporte.
Des prompts qui donnent de meilleurs clips
Veo 3.1 génère des clips de 4, 6 ou 8 secondes en 16:9 ou 9:16, avec un audio créé en même temps que l’image. Il accepte un prompt négatif, un seed, jusqu’à 3 images de référence, ainsi qu’une première et une dernière image. Les exemples du modèle sur PicassoIA écrivent les dialogues et l’ambiance sonore directement dans le prompt : traitez donc le prompt comme un scénario, et non comme une liste de mots-clés.
Plan, sujet, mouvement, son
Construisez chaque prompt en quatre temps :
Plan : objectif, angle et distance, par exemple « contre-plongée, 35 mm, lent travelling avant ».
Sujet : qui ou quoi est à l’écran, avec deux ou trois détails concrets.
Mouvement : ce qui change au fil du clip, dans l’ordre.
Son : bruit d’ambiance, musique ou dialogue cité.
Le son est l’étape que la plupart des gens oublient. Le modèle génère l’audio par défaut : décrivez donc l’ambiance de la pièce et toute réplique parlée, et écrivez « no music » lorsque vous ne voulez que des sons naturels. Si votre outil propose un interrupteur audio, le désactiver vous donne une séquence muette que vous pourrez sonoriser vous-même plus tard.
Un exemple concret : Contre-plongée, 35 mm, lent travelling avant sur une tasse en céramique de thé posée sur un rebord de fenêtre sous la pluie. De la vapeur s’élève en volutes, une goutte glisse sur la vitre derrière elle. Pluie douce, cloche lointaine d’un tramway, pas de musique.
Prompt faible
Prompt efficace
Une jolie vidéo de ville
Vue aérienne en recul au-dessus d’un marché de rue mouillé au crépuscule, des vendeurs baissant leurs auvents, des guirlandes lumineuses chaudes se reflétant sur l’asphalte humide, tonnerre lointain et voix étouffées
Une personne qui parle
Plan américain serré d’une femme en manteau de laine sur un quai de gare, elle dit « Le dernier qui rentre éteint la lumière », une annonce de la gare résonnant derrière elle
💡 Placez tout ce que vous ne voulez pas, comme les textes superposés ou les tremblements de caméra à l’épaule, dans le prompt négatif plutôt que dans le prompt principal.
Première image et dernière image
L’image vers vidéo offre le plus de contrôle. Définissez image comme première image et last_frame comme dernière image, et le modèle construit la transition entre les deux. Les entrées idéales correspondent au format de sortie, soit environ 1280x720 pour du 16:9 ou 720x1280 pour du 9:16. Vous pouvez générer ces images fixes avec PicassoIA Image, qui propose les deux formats.
Deux limites à retenir : les images de référence ne fonctionnent qu’en 16:9 et sur 8 secondes, et la dernière image est ignorée dès que des images de référence sont présentes.
Le coût réel par clip
Le serveur MCP lui-même ne coûte rien. Google facture l’API Gemini à la seconde de vidéo, audio compris, et un même clip peut coûter 8 fois plus cher ou 8 fois moins cher selon le palier choisi.
Tarifs par seconde
Tarifs publiés de l’API Gemini au moment de la rédaction :
Consultez la page de tarifs de Google avant d’établir votre budget, car les prix changent. En 1080p et en 4K, les clips durent 8 secondes.
Choisir le bon palier
Faites vos brouillons sur Lite ou Fast en 720p. Un brouillon Fast de 8 secondes coûte 0,80 $, et un brouillon Lite coûte 0,40 $.
Générez la version finale sur le palier standard Veo 3.1 lorsque la qualité compte le plus. Lite ne propose ni 4K ni extension.
Procédez par lots avec un plafond. Vingt clips sociaux de 8 secondes totalisent 160 secondes de vidéo : 8,00 $ sur Lite en 720p, 19,20 $ sur Fast en 1080p, 64,00 $ sur le standard en 1080p.
💡 Dix brouillons de 8 secondes en 720p coûtent 8 $ sur Fast et 32 $ sur le standard. Itérez à petit prix, puis payez une fois pour la version finale.
Un coût supplémentaire n’apparaît pas sur la facture : le README d’alohc avertit que les vidéos générées restent sur les serveurs de Google pendant environ 2 jours. Assurez-vous que votre serveur télécharge chaque fichier sur le disque le jour même.
Oubliez les identifiants, les fichiers de configuration et le compte de facturation. La page du modèle sur PicassoIA expose les mêmes réglages dans un navigateur, et le clip arrive dans votre galerie, prêt à être téléchargé.
Rédigez votre prompt en suivant les quatre temps décrits plus haut.
Choisissez les options dans le tableau ci-dessous.
Ajoutez facultativement une première image, une dernière image, jusqu’à 3 images de référence, un prompt négatif ou un seed.
Générez, prévisualisez et téléchargez le MP4.
Réglage
Options
Par défaut
Durée
4, 6 ou 8 secondes
8
Résolution
720p ou 1080p
1080p
Format
16:9 ou 9:16
16:9
Audio
Activé ou désactivé
Activé
Veo 3.1 Fast utilise les mêmes réglages, à l’exception des images de référence, qu’il ne propose pas. Choisissez-le pour des brouillons rapides : les exemples Fast de sa page ont été rendus en 45 à 59 secondes, tandis que ceux du modèle standard ont pris environ 73 à 114 secondes.
PicassoIA via MCP
PicassoIA dispose aussi d’une API pour développeurs à l’adresse https://api.picassoia.com/v1, avec des points de terminaison de prédiction de type Replicate et une authentification Bearer, ainsi que d’un connecteur MCP. Les deux donnent accès à quatre modèles : un modèle d’image, un éditeur d’images, un modèle vidéo et Seedance 2.5 Lite avec audio. Veo 3.1 ne figure pas dans cette liste : pour Veo, utilisez donc la page du modèle, et pour une vidéo scriptée dans Claude, vous pouvez appeler PicassoIA Video ou Seedance 2.5 Lite. Chaque compte peut lancer jusqu’à 5 prédictions simultanément, partagées entre toutes les connexions.
Réaliser votre premier clip
Choisissez une phrase que vous pourriez filmer en un seul plan. Une main qui verse du thé, un tramway qui traverse un pont, un chien qui attend devant une porte. Des scènes courtes et concrètes donnent à Veo la cible la plus claire, et elles coûtent le moins cher à reproduire.
Trois erreurs à éviter
Oublier l’expiration. Les vidéos laissées du côté de Google disparaissent au bout d’environ 2 jours : téléchargez-les.
Faire les brouillons en 4K. Faites des brouillons économiques, et finalisez une seule fois.
Négliger l’outil d’état. Les clients qui attendent un seul appel long expirent. Utilisez les identifiants de job et interrogez-les.
Prêt à essayer vous-même ? Ouvrez PicassoIA, générez une première image avec PicassoIA Image, puis animez-la avec Veo 3.1. Modifiez un seul détail à chaque essai, comparez les résultats avec Seedance 2.5 Lite, et conservez les versions que vous préférez. Vos propres images et vidéos ne sont qu’à un prompt sur PicassoIA, et la liste complète des modèles vous attend sur picassoia.com/en/all-models.