Serveur MCP YouTube : transcriptions et recherche de vidéos dans Claude, et là où ça casse
Un serveur MCP YouTube permet à Claude de récupérer des transcriptions, de rechercher des vidéos et d’obtenir des détails à la demande. Découvrez les trois façons dont ces serveurs fonctionnent, la configuration de Claude Desktop et de Claude Code, les prompts qui donnent des réponses citables, et une solution de repli pour les vidéos sans sous-titres.
Vous collez un lien YouTube dans une discussion, vous demandez les trois affirmations qui comptent, et Claude répond à partir de la transcription réelle au lieu de deviner à partir du titre. C’est la promesse d’un serveur MCP YouTube : un petit programme placé entre Claude et YouTube, qui fournit sur demande les transcriptions, les détails des vidéos et les résultats de recherche. Fini le défilement d’une conférence de 90 minutes pour retrouver l’unique diapositive sur les tarifs. Fini le copier-coller des sous-titres dans une fenêtre de discussion en espérant que la mise en forme tienne.
Il comporte aussi des pièges. Les sous-titres sont parfois désactivés. La recherche consomme rapidement le quota de l’API. Les longues transcriptions saturent la fenêtre de contexte. Cet article montre comment ces serveurs fonctionnent, comment en connecter un à Claude Desktop ou Claude Code, quels prompts renvoient des réponses que vous pouvez citer, et que faire lorsqu’une vidéo refuse de livrer son texte. La dernière section propose une solution de repli pour les vidéos sans aucun sous-titre : transcrire vous-même l’audio, puis renvoyer le texte à Claude.
Ce que fait un serveur MCP YouTube
Le MCP en termes simples
Le Model Context Protocol, ou MCP, est un standard ouvert présenté par Anthropic fin 2024 pour que les assistants d’IA appellent des outils externes d’une manière unique et cohérente. Un serveur MCP publie une liste d’outils, chacun avec un nom, une courte description et des entrées typées. Un client, comme Claude Desktop ou Claude Code, lit cette liste. Lorsque votre demande nécessite l’un de ces outils, Claude l’appelle et lit ce qui revient.
Un serveur MCP YouTube expose généralement une combinaison de ces outils, même si les noms varient d’un projet à l’autre :
Obtenir la transcription : prend l’URL ou l’ID d’une vidéo et renvoie le texte des sous-titres, souvent avec des horodatages.
Obtenir les détails de la vidéo : titre, chaîne, description, durée, date de publication et nombre de vues.
Rechercher des vidéos : prend une requête et renvoie les vidéos correspondantes.
Lister les vidéos d’une chaîne ou d’une playlist : utile pour traiter en lot le catalogue d’un créateur.
Obtenir les commentaires : inclus par certains serveurs, pratique pour mesurer la réaction du public.
La plupart des serveurs locaux communiquent avec Claude via stdio. Claude lance le programme sur votre propre machine et échange des messages avec lui par l’entrée et la sortie standard. Rien n’est hébergé pour vous, et rien ne tourne tant que le client ne le démarre pas.
Transcriptions ou recherche de vidéos
Deux fonctions font l’essentiel du travail, et elles résolvent des problèmes différents.
Les transcriptions répondent à la question « que dit-on dans cette vidéo ». Elles sont peu coûteuses, rapides et uniquement textuelles. Claude peut citer une phrase, construire un plan horodaté ou relever tous les chiffres cités par un intervenant.
La recherche de vidéos répond à la question « quelles vidéos valent mon temps ». Elle renvoie les titres, les chaînes et les dates, mais ne dit rien de leur contenu tant que vous n’avez pas récupéré les transcriptions des meilleurs candidats. Le flux le plus efficace enchaîne les deux : rechercher, présélectionner, récupérer les transcriptions, comparer.
💡 Astuce : Demandez à Claude d’afficher la présélection de la recherche avant de récupérer la moindre transcription. Vous économisez le quota et gardez la fenêtre de contexte propre.
Trois façons dont ces serveurs fonctionnent
Tous les serveurs MCP YouTube ne passent pas par les mêmes méthodes pour accéder à YouTube. Cette méthode détermine ce que vous installez, ce que cela coûte et là où cela échoue.
Serveurs d’extraction des sous-titres
Ils récupèrent la piste de sous-titres que YouTube affiche déjà sous une vidéo, soit via une bibliothèque de transcription, soit en lisant les sous-titres avec yt-dlp. Aucun identifiant d’API ni projet Google Cloud n’est nécessaire, si bien que l’installation prend quelques minutes. Leur faiblesse est évidente : sans sous-titres, il n’y a rien à récupérer. Ils sont aussi plus souvent bloqués lorsqu’ils tournent depuis un serveur cloud que depuis une connexion domestique.
Serveurs utilisant l’API YouTube Data
Ils appellent l’API YouTube Data v3 officielle et nécessitent un identifiant délivré par la Google Cloud Console. Les métadonnées et la recherche sont fiables, mais le quota est serré. Chaque projet dispose par défaut de 10 000 unités par jour, une requête de recherche coûte 100 unités et une simple consultation de vidéo coûte 1 unité. Cela représente environ 100 recherches par jour avant épuisement du quota, qui se réinitialise à minuit, heure du Pacifique. La table officielle des quotas indique le coût de chaque méthode.
Autre piège : télécharger des sous-titres via l’API officielle coûte 200 unités par appel et exige un droit de modification sur la vidéo. La seule voie API ne permet généralement pas de récupérer les transcriptions des vidéos d’autres créateurs, c’est pourquoi beaucoup de configurations associent l’API Data pour la recherche à un extracteur pour les transcriptions.
Serveurs de téléchargement et de transcription
Ils téléchargent l’audio avec yt-dlp, puis appliquent une reconnaissance vocale. Ils sont plus lents et demandent de la puissance de calcul, mais ils fonctionnent sur les vidéos sans sous-titres. C’est l’option la plus lourde, et le bon choix lorsque la précision sur un audio difficile compte plus que la vitesse.
Approche
Effort de mise en place
Identifiant API requis
Fonctionne sans sous-titres
Limite principale
Extraction des sous-titres
Faible
Non
Non
Sous-titres absents, requêtes bloquées
API YouTube Data
Moyen
Oui
Non, pour les vidéos d’autres créateurs
10 000 unités par jour
Téléchargement et transcription
Élevé
Selon le serveur
Oui
Lent, demande de la puissance de calcul
Le connecter à Claude en quelques minutes
Avant d’installer quoi que ce soit, choisissez un serveur dont vous pouvez lire le code source. Un serveur MCP exécute du code sur votre machine avec vos droits, donc vérifiez d’abord le dépôt, l’éditeur et l’historique récent des commits. Il vous faut aussi Node.js pour les serveurs lancés avec npx, ou Python avec uv pour les serveurs écrits en Python.
Configuration de Claude Desktop
Ouvrez Paramètres, puis Développeur, puis Modifier la configuration, ou ouvrez directement le fichier. Sur macOS, il se trouve à ~/Library/Application Support/Claude/claude_desktop_config.json. Sur Windows, il se trouve à %APPDATA%\Claude\claude_desktop_config.json. Ajoutez une entrée sous mcpServers :
Remplacez your-youtube-mcp-package par le nom du paquet indiqué dans le README du serveur, et ajoutez toute variable d’environnement demandée, comme l’identifiant de l’API Data. Fermez ensuite complètement Claude Desktop puis rouvrez-le. Le menu des outils devrait désormais afficher les outils YouTube.
Claude Code en une ligne
Claude Code enregistre un serveur avec une seule commande :
claude mcp add youtube -- npx -y your-youtube-mcp-package
Ajoutez --scope user pour rendre le serveur disponible dans tous les projets au lieu du seul projet en cours. Exécutez /mcp dans Claude Code pour vérifier que la connexion est active.
💡 Astuce Windows : sur Windows natif, les serveurs lancés avec npx ont généralement besoin de l’enveloppe cmd /c. Utilisez claude mcp add youtube -- cmd /c npx -y your-youtube-mcp-package.
Faites un test avec une courte vidéo : « Récupérez la transcription de cette URL et donnez-moi les cinq premières minutes sous forme de puces avec des horodatages. » Claude demande l’autorisation la première fois qu’il appelle un outil. Approuvez, puis vérifiez que les horodatages correspondent à la vidéo.
Des prompts qui fonctionnent vraiment
Prompts pour une seule vidéo
Les demandes précises l’emportent sur les demandes vagues. Demandez des preuves, pas des impressions :
« Récupérez la transcription et rédigez un plan de 10 lignes avec un horodatage sur chaque ligne. »
« Liste chaque prix, chiffre et date cités par l’intervenant, avec la phrase exacte d’où ils sont tirés. »
« Cite chaque affirmation de l’intervenant que je devrais vérifier ailleurs. »
« Rédige cinq questions de quiz à partir de ce cours, avec les réponses et les horodatages. »
💡 Astuce : Demander des horodatages et des citations exactes permet de garder Claude ancré dans le texte. Si une réponse n’a aucune citation derrière elle, méfiez-vous.
Prompts pour plusieurs vidéos
Enchaîner recherche et transcriptions est ce qui rend la configuration rentable. Essayez un prompt de ce type :
« Recherchez sur YouTube les cinq vidéos les plus pertinentes sur [sujet] et montrez-moi d’abord les titres et les chaînes. Après que j’en ai choisi trois, récupère leurs transcriptions et compare dans un tableau ce que chacune dit sur [question]. »
Surveillez la taille de ce que vous récupérez. La parole en anglais tourne autour de 150 mots par minute, et un mot représente environ 1,3 token. Ce sont donc des estimations approximatives :
Durée de la vidéo
Mots environ
Tokens environ
10 minutes
1 500
2 000
1 heure
9 000
12 000
3 heures
27 000
36 000
Faire entrer cinq conférences d’une heure dans une seule discussion représente environ 60 000 tokens de texte brut avant que Claude n’écrive le moindre mot. Les grandes fenêtres de contexte prennent cela en charge, mais la consommation grimpe vite. Résumez chaque vidéo dans sa propre requête, puis demandez à Claude de fusionner les résumés.
Des flux de travail réels à reproduire
Chercheurs et étudiants. Faites passer une playlist de cours par le serveur, une vidéo à la fois. Demandez un glossaire et une liste de questions ouvertes pour chaque cours, puis fusionnez-les dans une seule fiche de révision. Comme chaque réponse porte un horodatage, vous pouvez revenir à la minute exacte lorsqu’un passage semble douteux.
Créateurs et podcasteurs. Récupérez les transcriptions de votre propre catalogue et demandez quels épisodes évoquent un sujet, quelles accroches reviennent et quelles idées méritent une suite. Les longs épisodes deviennent des brouillons d’articles, des sections de newsletter et des scripts de courts extraits, sans que personne ne retape un seul mot.
Équipes produit et marketing. Regardez les webinaires et démonstrations produits de vos concurrents sans bloquer l’après-midi de quiconque. Récupérez la transcription, demandez à Claude de lister les nouvelles fonctionnalités, les changements de tarifs et les arguments de positionnement, puis déposez le résultat dans un document partagé. Les équipes support peuvent transformer des vidéos de tutoriel en brouillons pour le centre d’aide de la même manière.
💡 Respectez la source : Les transcriptions appartiennent aux créateurs. Utilisez-les pour la recherche, résumez-les et citez l’auteur, mais ne les republiez pas mot pour mot.
Là où ça casse et que faire
Sous-titres absents et requêtes bloquées
La plupart des échecs remontent à une courte liste de causes :
Symptôme
Cause probable
Solution
« No transcript available »
Sous-titres désactivés ou pas encore générés
Transcrivez l’audio, voir le tutoriel ci-dessous
Fonctionne chez vous, échoue sur un serveur
La plage IP de l’hébergeur est bloquée
Lancez le serveur en local
Transcription dans la mauvaise langue
Le serveur a choisi la première piste de sous-titres
Indiquez le code de langue dans votre prompt, par exemple en
Noms déformés, ponctuation absente
Sous-titres générés automatiquement
Demandez à Claude de nettoyer le texte et de signaler les noms incertains
La recherche s’arrête en cours de journée
Quota quotidien épuisé
Recherchez moins, raccourcissez les listes de résultats, attendez la réinitialisation
Outils absents dans Claude
JSON invalide ou pas de redémarrage
Valider le fichier de configuration, redémarrer complètement le client, consulter les journaux
Vidéos longues et texte non fiable
Les vidéos longues mettent à rude épreuve la fenêtre de contexte. Demandez un résumé par segment de 10 minutes, puis un plan fusionné à la fin. Si le serveur renvoie des horodatages en secondes, demandez à Claude de les convertir en minutes et secondes pour pouvoir accéder directement au passage.
Traitez aussi les transcriptions comme une entrée non fiable. Une vidéo peut contenir des instructions, prononcées ou écrites, destinées à un modèle d’IA, et une transcription les transmet directement dans la discussion. Gardez les autorisations d’outils activées, et n’utilisez pas une session YouTube à côté d’outils capables d’écrire des fichiers, d’envoyer des e-mails ou de modifier des systèmes de production.
Lorsque les sous-titres sont absents ou très déformés, transcrivez l’audio vous-même. Ne téléchargez que des audios que vous avez le droit d’utiliser : vos propres vidéos, des contenus sous licence ou des contenus dont le créateur autorise la réutilisation. GPT 4o Transcribe sur Picasso IA transforme ensuite l’enregistrement en texte. Il accepte les fichiers mp3, mp4, mpeg, mpga, m4a, ogg, wav et webm, si bien que vous avez rarement besoin de convertir quoi que ce soit au préalable.
Importez votre enregistrement dans le champ audio_file.
Renseignez le champ language avec un code ISO 639 1 comme en, es ou fr. Indiquer la langue améliore à la fois la précision et la vitesse.
Ajoutez éventuellement un prompt avec les orthographes dont vous avez besoin, par exemple les noms de produits et le jargon. Il doit être dans la même langue que l’audio.
Laissez temperature à sa valeur par défaut de 0 pour obtenir le résultat le plus précis.
Lancez la transcription, puis copiez le texte.
💡 Astuce : Testez d’abord un extrait de 30 secondes. Si les noms sortent mal, ajoutez-les au champ prompt et relancez l’extrait avant de traiter l’enregistrement complet.
GPT 4o Mini Transcribe et Gemini 3 Pro appartiennent à la même catégorie de reconnaissance vocale, vous pouvez donc comparer leur précision sur le même extrait.
Résumer la transcription
Ouvrez Claude Sonnet 5 sur Picasso IA et collez la transcription dans le champ prompt. Trois réglages comptent :
effort :low est la valeur par défaut et la plus rapide, avec la réflexion désactivée. Passez à medium ou high lorsque la transcription est longue et que la question est subtile.
max_tokens : la valeur par défaut est 8192, suffisante pour un plan détaillé.
system_prompt : définissez un rôle une fois pour toutes, par exemple « Vous êtes un assistant de recherche qui cite toujours l’intervenant et ajoute un horodatage. »
Un prompt qui fonctionne bien : « Résumez cette transcription en cinq puces, listez chaque chiffre cité et citez les deux phrases les plus importantes. » Pour les enregistrements d’une heure, découpez le texte en segments de 10 minutes et fusionnez les résultats, comme avec le serveur YouTube.
Transformer les notes en extrait vidéo
Une fois le résumé obtenu, vous pouvez en faire quelque chose que les gens regardent vraiment. Demandez à Claude Sonnet 5 de condenser les trois points les plus forts en une courte description de scène avec un sujet clair, un mouvement de caméra et une indication d’éclairage. Collez ensuite cette description dans un modèle de texte vers vidéo comme Seedance 2.0 ou Veo 3.1 Fast. Un court extrait fait une excellente animation d’en-tête pour un article ou une newsletter, et toute la boucle, de l’audio à la vidéo, prend quelques minutes.
Essayez sur Picasso IA dès aujourd’hui
Vous avez maintenant la boucle complète. Un serveur MCP YouTube donne à Claude la transcription et les résultats de recherche. Quand les sous-titres échouent, la reconnaissance vocale comble le manque. Puis un grand modèle de langage transforme le texte brut en notes, et un modèle vidéo transforme ces notes en extrait.
Commencez petit. Choisissez une vidéo de cinq minutes, transcrivez-la sur Picasso IA, résumez-la avec Claude Sonnet 5 et animez la meilleure idée avec un modèle de texte vers vidéo. Modifiez un réglage à la fois, comparez les résultats et conservez les prompts qui fonctionnent. Ouvrez Picasso IA, lancez votre première transcription et voyez quelle part de votre prochaine session de recherche vous pouvez confier.