Serveur MCP de génération vidéo : Veo, Kling et Seedance dans un seul chat
Un serveur MCP de génération vidéo permet à un seul chat de demander des clips à Veo, Kling et Seedance sans changer d’onglet. Cet article explique le fonctionnement des outils, des tâches asynchrones et du suivi par interrogation, quel modèle convient à quel plan, les limites à prévoir et comment rédiger des prompts qui passent l’épreuve du premier rendu.
Vous avez un onglet Veo ouvert, un onglet Kling dans une autre fenêtre et un onglet Seedance que vous avez oublié de fermer, et le plan que vous cherchez pourrait se trouver dans l’un des trois. Chaque générateur réclame son propre format de prompt, son propre panneau de réglages et son propre bouton de téléchargement. Un serveur MCP de génération de vidéos remplace cette routine par une seule phrase tapée dans un chat : vous décrivez le clip, l’assistant choisit un modèle, soumet la tâche, en suit l’avancement et vous remet un lien. Cet article montre comment fonctionne cette configuration, ce que Veo 3.1, Kling v3 Video et Seedance 2.5 Lite font le mieux, et comment rédiger des prompts qui passent l’épreuve du premier rendu.
Pourquoi un seul chat vaut mieux que cinq onglets
La taxe du changement d’onglet
Changer d’outil paraît anodin tant qu’on ne compte pas les étapes. Vous copiez un prompt dans un site, attendez, téléchargez le fichier, le renommez, ouvrez le site suivant, collez, réalisez que le second modèle veut que l’audio soit décrit autrement, et réécrivez. À la troisième tentative, vous ne savez plus quel seed a produit quel clip, et le dossier sur votre bureau est un tas de fichiers nommés « final_v2_vraiment ».
Un chat inverse la logique. La conversation elle-même devient le fichier du projet : chaque prompt, chaque réglage et chaque lien de résultat se trouve dans un même fil que vous pouvez rechercher plus tard. L’assistant peut aussi transformer un brief créatif unique en trois prompts adaptés à chaque modèle, ce qui est la partie fastidieuse que personne n’aime faire à la main.
Ce que fait réellement MCP
Le Model Context Protocol est un standard ouvert, présenté par Anthropic fin 2024, qui permet à une application de chat de dialoguer avec des outils externes de façon prévisible. Un serveur annonce une liste d’outils. Chaque outil a un nom, une description en langage courant et un schéma JSON qui détaille ses entrées. L’application de chat montre cette liste au modèle, le modèle décide quand un outil convient, et l’application transmet l’appel au serveur puis réinjecte le résultat dans la conversation.
Les serveurs fonctionnent en local via stdio ou à distance via HTTP. Un serveur vidéo peut donc être un petit processus sur votre ordinateur portable ou un point d’accès hébergé que vous connectez une seule fois. Du point de vue du chat, « faites un clip de cinq secondes d’un cuisinier sur un marché de nuit » cesse d’être un vœu flou et devient un appel structuré, avec un prompt, une durée et une résolution.
💡 Astuce : Les descriptions d’outils comptent plus qu’on ne le pense. Le modèle les lit pour décider quel outil appeler : un serveur qui indique « générer une vidéo à partir d’un prompt texte » sera utilisé bien plus fiablement qu’un serveur qui indique « lancer la tâche ».
Comment le serveur gère les tâches vidéo
Outils, schémas et interrogation du statut
Le connecteur PicassoIA est un bon exemple concret, car sa liste d’outils est courte et lisible. Au moment de la rédaction, il expose les outils suivants :
Renvoie votre forfait et vos limites de tâches simultanées
cancel_generation
Annule une tâche, sauf si le GPU rend déjà la vidéo
Chaque outil de génération renvoie un predict_id dès qu’un GPU accepte la tâche, accompagné d’un temps estimé. Vous appelez ensuite get_generation après l’attente suggérée, puis à nouveau après chaque attente qu’il renvoie, jusqu’à ce que le statut indique succeeded ou failed. Un échec est définitif : l’assistant soumet donc une nouvelle génération au lieu de relancer la même.
Pourquoi la vidéo a besoin de tâches asynchrones
Un appel texte vers image renvoie une réponse en quelques secondes. Une vidéo, non. Les exemples de rendus sur les pages des modèles donnent une idée : ceux de Veo 3.1 ont pris d’une à deux minutes, ceux de Seedance 2.5 Lite environ deux à trois minutes, et ceux de Kling v3 Video allaient d’environ cinq à dix-huit minutes selon la durée et les réglages. Un appel d’outil dans un chat ne peut pas attendre aussi longtemps.
Le serveur renvoie donc un ticket et laisse l’assistant en suivre l’avancement. C’est aussi pour cela que votre chat peut continuer à discuter pendant qu’un clip se rend : demandez le prompt du plan suivant pendant que le premier mijote.
À quoi ressemble une session
Voici un échange réaliste une fois le serveur connecté :
Vous tapez : « Faites un clip de 5 secondes en 16:9 d’un cuisinier qui fait sauter des nouilles sur un marché du soir, ampoules chaudes, bruit de friture. »
L’assistant choisit l’outil vidéo, remplit le prompt, la durée et la résolution, puis soumet la tâche.
Le serveur répond avec un predict_id et un temps estimé.
L’assistant attend l’intervalle suggéré, appelle get_generation, constate que la tâche est toujours en cours, et attend à nouveau.
Le statut passe à succeeded, et l’assistant publie le lien MP4 dans le chat.
Vous dites « même plan, mais le cuisinier lève les yeux vers la caméra », et l’assistant relance la génération avec le même seed et une ligne de mouvement modifiée.
Toute la boucle reste dans une seule fenêtre, et rien ne vous oblige à lire une référence d’API.
Cinq tâches à la fois
La documentation API de PicassoIA indique 5 prédictions simultanées par compte, partagées entre votre accès API et vos connexions MCP. Pour un storyboard de huit plans, l’assistant doit donc en soumettre cinq, les interroger, et mettre les autres en file d’attente au fur et à mesure que des places se libèrent. Vous pouvez le dire simplement : « Lancez les plans par lots de cinq et publiez chaque lien dès qu’il est prêt. »
Trois modèles, trois forces
Aucun modèle ne remporte tous les plans, et c’est le vrai argument pour placer plusieurs modèles derrière un même chat. Voici ce que disent les pages des modèles sur leur vocation.
Quand le réalisme et le son comptent
Veo 3.1 transforme un prompt texte en vidéo 1080p avec un audio qui tient compte du contexte : le cliquetis, le vent ou les voix arrivent en accord avec l’image. Les clips durent 4, 6 ou 8 secondes, en 16:9 ou en 9:16. Vous pouvez définir une première image et une dernière image pour faire l’interpolation entre deux instants, ou fournir jusqu’à trois images de référence pour garder un sujet cohérent d’un plan à l’autre. Un champ de prompt négatif permet d’exclure ce que vous ne voulez pas. Une variante plus rapide, Veo 3.1 Fast, existe pour les brouillons rapides.
Faites appel à lui quand le plan est un moment réel crédible : une voiture sur une route côtière, une conversation dans un café, un produit posé sur une table avec un son d’ambiance naturel.
Quand vous avez besoin d’un contrôle multi-plans
Kling v3 Video est l’option longue durée. Il produit des clips allant jusqu’à 15 secondes et prend en charge la scénarisation multi-plans : vous définissez jusqu’à 6 scènes, chacune avec son propre prompt et sa durée, au sein d’une seule génération. Le mode standard génère en 720p et le mode pro en 1080p. Vous pouvez figer la première et la dernière image avec des images, choisir 16:9, 9:16 ou 1:1, et ajouter un prompt négatif. La génération audio est un interrupteur désactivé par défaut : demandez au chat de l’activer quand vous voulez du son.
C’est celui à utiliser quand un clip a besoin d’un petit arc narratif, par exemple un plan large, un gros plan et une réaction, sans assembler trois fichiers séparés. Attendez-vous aux temps d’attente les plus longs du groupe.
Quand vous voulez des itérations rapides
Seedance 2.5 Lite est conçu pour le volume. Il produit des clips de 5 ou 10 secondes en 480p ou 720p, avec un son synchronisé activé par défaut, à partir d’un texte ou d’une image de départ, et il accepte un seed que vous pouvez verrouiller pour reproduire un résultat. Sa page de modèle le décrit comme illimité pour les membres Wonder, ce qui en fait le modèle naturel pour tester dix variantes de prompt avant le déjeuner. Des versions plus grandes existent si vous en avez besoin : Seedance 2.5 est annoncé avec des clips allant jusqu’à 30 secondes, et Seedance 2.0 propose le texte vers vidéo avec audio intégré.
Choisir le bon modèle plan par plan
Mettez les caractéristiques côte à côte et les décisions d’aiguillage deviennent plus simples. Les temps de rendu proviennent des générations d’exemple de chaque page de modèle : considérez-les comme des ordres de grandeur, pas comme des promesses.
Une règle empirique de routage qui tient dans la pratique :
Dialogues, son d’ambiance, lieux crédibles :Veo 3.1.
Une mini-histoire avec plusieurs scènes dans un seul fichier :Kling v3 Video.
Brouillons rapides, nombreuses variantes, boucles pour les réseaux sociaux :Seedance 2.5 Lite.
💡 Astuce : Ébauchez dans le modèle rapide, finalisez dans le modèle lent. Figez l’idée, le cadrage et le mouvement avec des itérations rapides, puis consacrez les longs rendus aux plans que vous avez déjà validés.
Les clips bruts sont rarement la dernière étape. PicassoIA propose aussi le montage vidéo, l’upscaling vidéo (augmentation de la résolution) et un large catalogue d’effets visuels, ce qui permet d’ajouter une touche stylisée ou une passe de nettoyage une fois que le générateur a fait son travail. La liste complète se trouve sur picassoia.com/en/all-models.
Rédiger des prompts que le chat peut réutiliser
Les listes de plans valent mieux que les adjectifs
La page du modèle Seedance 2.5 Lite indique que les descriptions cinématographiques et chronologiques fonctionnent le mieux, et la même habitude aide avec tous les modèles vidéo. Décrivez ce qui se passe dans l’ordre, comme un réalisateur lit une liste de plans, au lieu d’empiler des adjectifs comme « épique » ou « époustouflant ». Le modèle ne peut pas filmer un adjectif, mais il peut filmer un cuisinier qui fait sauter les nouilles une fois pendant que les flammes jaillissent.
Un modèle de prompt qui fonctionne
Une structure en quatre lignes permet de garder des prompts cohérents quand l’assistant les réécrit pour différents modèles :
Subject and starting pose.
What moves, in order, over the clip.
Camera move.
Light and sound.
Rempli, cela donne :
Un cuisinier de street food, en tablier de toile, tient un wok au-dessus d’une flamme de gaz. Il fait sauter les nouilles une fois, les flammes jaillissent, la vapeur monte vers l’objectif. Rapprochement lent à hauteur de poitrine. Ampoules chaudes au-dessus de la tête, huile qui grésille et brouhaha du marché.
Demandez ensuite au chat de l’adapter à chaque modèle. Pour Veo 3.1, précisez le son, car l’audio suit le prompt. Pour Kling v3 Video, découpez les temps forts en scènes et faites en sorte que les durées des plans totalisent la durée finale, avec au moins une seconde par plan. Pour Seedance 2.5 Lite, gardez un seul paragraphe fluide et verrouillez le seed une fois que le résultat vous plaît.
Si le modèle de votre chat est faible pour décrire des plans, rédigez les prompts avec un rédacteur plus performant, comme Claude Sonnet 5 ou Gemini 3.5 Flash, puis collez le résultat dans la conversation.
Corriger un premier rendu décevant
Changez une seule variable à la fois. Verrouillez le seed, puis modifiez uniquement la ligne de mouvement. Quelques habitudes font gagner des heures :
Le sujet dérive : fournissez une image comme première image afin que le modèle parte d’un rendu fixe.
Des objets indésirables apparaissent : utilisez le champ de prompt négatif que proposent à la fois Veo 3.1 et Kling v3 Video.
Le clip paraît surchargé : raccourcissez-le. Un clip de cinq secondes avec une seule action vaut mieux qu’un clip de dix secondes avec trois.
💡 Astuce : Combinez les outils. Générez une image fixe avec l’outil image, validez le cadrage, puis importez cette image comme première image pour que la vidéo démarre exactement là où vous le voulez.
Seedance 2.5 Lite est le point de départ pratique, car il est rapide, gère l’audio par défaut et fait partie des deux outils vidéo du connecteur. Voici le déroulé sur PicassoIA :
Ouvrez la page Seedance 2.5 Lite, ou demandez à votre chat d’appeler generate_video_seedance.
Rédigez le prompt dans l’ordre chronologique en suivant le modèle en quatre lignes ci-dessus.
Choisissez une durée de 5 ou 10 secondes. Prenez 5 pendant vos tests.
Choisissez une résolution. Le 480p est le plus rapide et convient aux brouillons, le 720p est plus net et convient à la version que vous gardez.
Choisissez un format, ou importez une image à utiliser comme première image. Avec une image, le clip reprend l’image et ignore le réglage du format.
Laissez l’option Sauvegarder l’audio activée, sauf si vous voulez un clip muet.
Définissez un seed si vous voulez reproduire le résultat plus tard.
Soumettez, interrogez jusqu’à ce que la tâche réussisse, puis ouvrez le lien renvoyé.
Réglage
Options
Quand le modifier
Durée
5 ou 10 secondes
Passez à 10 quand l’action a besoin de place
Résolution
480p ou 720p
480p pour les brouillons, 720p pour les versions retenues
Format
16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3
Adaptez-le à la plateforme où vous publiez
Image d’entrée
Facultative
Figer le rendu de la première image
Image de fin
Facultative, nécessite une image d’entrée
Contrôler la fin du plan
Seed
Tout nombre entier
Reproduire ou comparer des essais
Sauvegarder l’audio
Activé ou désactivé
Désactivé pour les plans de coupe muets
Le même déroulé pour Veo et Kling
Les étapes restent les mêmes, avec quelques changements. Sur Veo 3.1, choisissez 4, 6 ou 8 secondes et 720p ou 1080p. Les images de référence ne fonctionnent qu’en 16:9 et sur 8 secondes, et une dernière image est ignorée lorsque des références sont présentes. Sur Kling v3 Video, choisissez le mode standard (720p) ou pro (1080p), activez l’audio, gardez le prompt sous 2 500 caractères, et ajoutez une liste multi-plans quand vous voulez plusieurs scènes.
Limites à prendre en compte
File d’attente, relances et échecs
Limite parallèle : 5 prédictions simultanées par compte, partagées entre les connexions. Organisez vos lots par cinq.
Échecs définitifs : interroger une tâche échouée ne la fera pas revenir. L’assistant doit en soumettre une nouvelle, de préférence avec un prompt plus simple.
Taille du prompt : l’API PicassoIA accepte des prompts jusqu’à 4 000 caractères, et Kling v3 Video plafonne son propre prompt à 2 500 caractères, donc rédigez d’abord la version la plus courte.
Annulation : une tâche peut être annulée jusqu’à ce que le GPU commence à rendre la vidéo. Ensuite, elle va jusqu’au bout.
Ce que le connecteur ne fait pas
Le périmètre mérite une mise au point honnête. Au moment de la rédaction, le connecteur PicassoIA répertorie quatre modèles : un générateur d’images, un éditeur d’images, PicassoIA Video et Seedance 2.5 Lite. Veo 3.1 et Kling v3 Video fonctionnent depuis le site PicassoIA, et les intégrer au même chat nécessiterait un serveur MCP personnel qui encapsule leurs API fournisseurs.
Exécutez list_models dans votre propre compte pour voir ce qui est exposé aujourd’hui, et consultez picassoia.com/en/pricing pour savoir quels forfaits incluent les connexions MCP avant de bâtir un flux de travail autour d’elles.
Créez votre premier clip dès aujourd’hui
Choisissez un plan que vous filmeriez normalement ou que vous achèteriez sous forme de séquence de banque d’images, rédigez-le en prompt de quatre lignes, et faites-le passer par les trois modèles. Mettez Seedance 2.5 Lite en premier pour un brouillon rapide, envoyez la version validée à Veo 3.1 pour un son réaliste ou à Kling v3 Video pour un montage multi-plans, et comparez les résultats côte à côte. En une après-midi, vous saurez vers quel modèle votre style penche.
Vous pouvez tout essayer sur Picasso IA. Générez une image fixe avec l’un des modèles d’image, utilisez-la comme première image, et regardez-la bouger. Parcourez le catalogue complet sur picassoia.com/en/all-models et lancez votre premier prompt ce soir.