Transcription audio MCP : transcrire des fichiers dans Claude et Cursor
Un serveur MCP de transcription audio permet à Claude et Cursor de lire directement vos fichiers MP3, WAV et M4A. Cet article présente la configuration pour Claude Desktop, Claude Code et Cursor, les prompts qui transforment les transcriptions en notes, et les solutions aux erreurs qui bloquent la plupart des premières installations.
Donnez à un modèle un MP3 de 90 minutes et il n’a rien à lire. Un serveur MCP de transcription audio règle ce problème. Il se place entre votre fenêtre de chat ou votre éditeur et un moteur de reconnaissance vocale, si bien que vous pouvez écrire « transcris interview-04.mp3 et extrais les trois meilleures citations » et obtenir le texte directement dans Claude ou Cursor. Plus besoin de changer d’onglet, de formulaires d’import ni de copier-coller entre cinq applications.
Cet article détaille la configuration exacte pour Claude Desktop, Claude Code et Cursor, les prompts qui fonctionnent sur des transcriptions brouillonnes, et les solutions aux erreurs qui bloquent la plupart des premiers essais. Il présente aussi une méthode sans installation pour les enregistrements ponctuels, avec les modèles de reconnaissance vocale de PicassoIA, ainsi qu’une façon de transformer ce que disent les gens dans un enregistrement en images.
Ce que fait un MCP de transcription audio
Le Model Context Protocol (MCP) est un standard ouvert qui permet à une application d’IA d’appeler des outils externes via un petit processus serveur. Un serveur de transcription expose quelques outils, généralement du type « transcrire ce chemin de fichier » ou « découper cet enregistrement long », et c’est le client qui décide quand les appeler. Le serveur fait le gros du travail avec un moteur de reconnaissance vocale et renvoie du texte brut à la conversation.
Le déroulement de la requête
Voici ce qui se passe quand vous demandez une transcription :
Vous écrivez une demande qui indique le chemin d’un fichier local.
Le client voit l’outil de transcription dans sa liste d’outils et vous demande l’autorisation de le lancer.
Le serveur lit le fichier et l’envoie à une API cloud ou à un modèle Whisper local.
Le texte revient comme résultat de l’outil, et le modèle poursuit : il résume, extrait des citations ou réécrit.
💡 À retenir : dans cette configuration, le modèle n’entend jamais l’audio. Il lit la transcription, donc toute erreur dans un résumé remonte à ce que le moteur a entendu en premier. Vérifiez les noms, les chiffres et les dates par rapport à la source avant de publier quoi que ce soit.
Pourquoi le chat seul ne suffit pas
Coller une transcription à la main fonctionne pour un fichier. Cela devient impraticable pour dix. Avec un serveur en place, vous pouvez désigner tout un dossier, conserver les horodatages et enchaîner les étapes dans un seul prompt : transcrire, rédiger les notes de l’émission, enregistrer dans notes.md. Dans Cursor, le même appel d’outil peut écrire le résultat directement dans votre dépôt, à côté du code ou de la documentation auxquels il se rapporte. Dans Claude Code, il peut alimenter un script qui renomme les fichiers selon l’intervenant ou le sujet.
Trois situations où cette configuration rapporte vite :
Réunions hebdomadaires : enregistrez, transcrivez et obtenez les actions à mener sans que personne ne prenne de notes.
Entretiens et appels de recherche : extrayez des citations textuelles avec horodatage pour un rapport.
Podcasts et vidéos : produisez les notes d’émission, les listes de chapitres et les brouillons de sous-titres à partir de la piste audio.
Choisir un moteur de transcription
Avant de toucher à un fichier de configuration, décidez où l’audio sera traité. Ce choix détermine le coût, la confidentialité et la vitesse bien plus que n’importe quel réglage que vous modifierez plus tard.
API cloud ou Whisper en local
Critère
API cloud
Whisper en local
Installation
Coller un identifiant dans la configuration
Installer un environnement d’exécution, télécharger un modèle
Confidentialité
L’audio quitte votre machine
L’audio reste sur le disque
Vitesse
Quelques secondes pour la plupart des fichiers
Dépend de votre CPU ou GPU
Limites de taille
Des plafonds d’import s’appliquent (le point de terminaison de transcription d’OpenAI limite depuis longtemps les envois à 25 Mo)
Limitées par le disque et la mémoire
Coût
Facturé à l’usage
Gratuit après installation
Idéal pour
Un traitement rapide d’un audio propre
Enregistrements sensibles et travail hors ligne
Si l’enregistrement est un appel client, une note médicale ou quelque chose soumis à un accord de confidentialité, choisissez le local. Pour les podcasts et les webinaires publics, une API cloud est généralement plus rapide à configurer.
Trois serveurs à examiner
Des projets communautaires existent déjà, et leurs noms indiquent ce qu’ils font :
mcp-server-whisper : un serveur construit autour des modèles de parole d’OpenAI.
whisper-mcp : transcription locale avec les modèles Whisper via whisper.cpp, donc aucun audio n’est envoyé en ligne.
serveurs MCP fast-whisper : des enveloppes autour de Faster Whisper pour une reconnaissance locale rapide sur un GPU ou un CPU correct.
Les noms changent et les projets deviennent obsolètes. Ouvrez le dépôt, vérifiez la date du dernier commit, lisez la liste des outils exposés par le serveur et copiez la commande d’installation depuis son README plutôt que depuis cette page. Les configurations ci-dessous utilisent des espaces réservés pour cette raison.
💡 Contrôle de sécurité : un serveur MCP s’exécute comme un processus avec vos droits d’utilisateur. N’installez que du code que vous avez lu ou en lequel vous avez confiance, et limitez-le à un dossier d’enregistrements plutôt qu’à l’ensemble de votre dossier personnel.
Le configurer dans Claude
Claude Desktop lit les serveurs dans un fichier JSON. Claude Code les ajoute avec une commande. Les deux lancent le serveur comme processus local sur votre machine.
Configuration de Claude Desktop
Ouvrez le fichier de configuration de votre système :
TRANSCRIBE_TOKEN est un espace réservé à remplacer. Utilisez le nom de variable demandé par le README de votre serveur. Les serveurs Python se lancent généralement avec uvx au lieu de npx, donc modifiez command et args en conséquence. Ensuite, quittez entièrement Claude Desktop, pas seulement la fenêtre, puis rouvrez-le. La liste des outils affiche le nouveau serveur une fois le processus démarré.
Deux règles piègent souvent les utilisateurs : toutes les options vont avant le nom du serveur, et le double tiret sépare le nom du serveur de la commande qui le lance. Vérifiez le résultat avec claude mcp list, inspectez-le avec claude mcp get transcribe et supprimez-le avec claude mcp remove transcribe.
💡 Utilisez --scope project pour enregistrer l’entrée dans un fichier .mcp.json partagé avec votre équipe. N’y validez jamais un identifiant en clair. Référencez plutôt une variable d’environnement, comme ${TRANSCRIBE_TOKEN}, et laissez chaque personne définir la sienne.
Faites un test rapide avant de confier un vrai fichier au serveur : enregistrez dix secondes de votre voix avec un téléphone, déposez le fichier dans votre dossier d’enregistrements et demandez à Claude de le transcrire. Une transcription correcte confirme d’un coup le serveur, l’identifiant et le chemin du fichier.
Le configurer dans Cursor
Cursor lit la même structure mcpServers dans un fichier. Placez .cursor/mcp.json dans un projet pour limiter le serveur à ce dépôt, ou ~/.cursor/mcp.json dans votre dossier personnel pour le rendre disponible partout.
La syntaxe ${env:NAME} récupère la valeur depuis l’environnement de votre shell, donc le fichier peut être versionné sans risque. Cursor résout aussi ${workspaceFolder} dans les valeurs de command, args et env, ce qui est pratique lorsque le serveur a besoin du chemin d’un dossier d’enregistrements situé dans le dépôt.
L’appeler depuis le chat
Ouvrez le chat de l’agent et consultez la page des paramètres MCP : le serveur doit apparaître comme activé, avec le nom de ses outils. Demandez ensuite en langage courant :
Transcris recordings/call-0612.m4a avec l’outil de transcription et enregistre le texte dans docs/call-0612.md. Ajoute un résumé de cinq lignes en haut.
Par défaut, Cursor vous demande d’approuver chaque appel d’outil avant son exécution. Approuvez le premier, vérifiez la sortie, et seulement ensuite envisagez d’activer l’exécution automatique pour ce serveur.
Des prompts efficaces sur les transcriptions
Les transcriptions brutes sont longues et désordonnées, donc c’est le prompt qui décide si vous obtenez un pavé de texte ou quelque chose d’exploitable. Les meilleurs prompts nomment le fichier, indiquent ce qu’il faut extraire et précisent quoi faire lorsque l’audio est peu clair.
Comptes rendus de réunion avec des responsables
Transcris standup-0612.m4a. Liste ensuite les décisions, les questions ouvertes et les actions à mener. Pour chaque action, indique le responsable et la date qu’il a donnée. Si personne n’a donné de date, écris « sans date » au lieu de deviner.
La dernière phrase compte. Sans elle, les modèles ont tendance à combler les vides avec un vendredi plausible.
Citations d’entretien avec horodatage
Transcris interview-04.mp3 avec les horodatages. Choisis les cinq citations les plus fortes, conserve chacune mot pour mot et indique l’horodatage à côté. Signale toute citation où l’audio paraissait peu clair.
Le texte mot pour mot associé aux horodatages vous permet de vérifier chaque citation par rapport à l’enregistrement en quelques secondes.
Quelques habitudes qui font gagner du temps à chaque prompt :
Indiquez le chemin exact, extension comprise.
Demandez des citations textuelles et interdisez la paraphrase lorsque la formulation compte.
Demandez de signaler les incertitudes afin que les passages peu clairs soient marqués plutôt que lissés.
Ajoutez un glossaire de noms de produits, de personnes et de termes techniques, car les moteurs devinent l’orthographe.
Travaillez par segments pour les enregistrements de plus d’une heure : transcrivez, résumez chaque partie, puis fusionnez.
Corriger les erreurs courantes
La plupart des échecs ont cinq causes. Ce tableau vous mène rapidement à la bonne.
Symptôme
Cause probable
Solution
L’outil n’apparaît jamais
Erreur de syntaxe JSON ou redémarrage complet absent
Valider le JSON, quitter entièrement l’application, la rouvrir
« command not found »
npx ou uvx absent du PATH de l’application
Utiliser le chemin absolu de l’exécutable
Erreur d’authentification
Variable d’identifiant absente ou incorrecte
Reprendre le nom exact de la variable indiqué dans le README
Délai dépassé sur un long fichier
Plafond d’import ou moteur lent
Découper le fichier en segments de 15 minutes
Noms mal orthographiés
Le moteur a deviné l’orthographe
Ajouter un glossaire ou un prompt de style
Serveur absent de la liste
Commencez par les vérifications élémentaires. Une virgule en trop dans la dernière entrée casse tout le fichier, et une application de bureau n’hérite souvent pas du PATH que vous voyez dans votre terminal : npx fonctionne donc dans un shell mais échoue dans l’application. Collez le chemin absolu de l’exécutable dans command et réessayez.
Lancez ensuite la commande du serveur à la main dans un terminal. Si elle échoue là, elle échouera aussi dans le client, et le terminal affiche la vraie erreur. Pour Claude Desktop, les fichiers journaux MCP se trouvent dans un dossier logs : %APPDATA%\Claude\logs sous Windows et ~/Library/Logs/Claude sous macOS.
Gros fichiers et délais dépassés
Claude comme Cursor peuvent abandonner un appel d’outil qui dure trop longtemps, et les moteurs cloud ont des plafonds d’import. Réduire le fichier règle les deux problèmes. La parole n’a pas besoin d’une qualité de studio : un audio mono à faible fréquence d’échantillonnage suffit :
Demandez ensuite au modèle de transcrire part_000.mp3, part_001.mp3 et ainsi de suite, dans l’ordre, puis assemblez les résultats dans un dernier prompt.
Transcrire dans le navigateur sur PicassoIA
Pour un enregistrement ponctuel, un serveur demande plus d’installation que la tâche ne le mérite. PicassoIA fait tourner des modèles de reconnaissance vocale dans le navigateur, sans rien installer : GPT 4o Transcribe, GPT 4o Mini Transcribe et Gemini 3 Pro. Le connecteur PicassoIA pour Claude est conçu pour la génération d’images et de vidéos ; la transcription se fait donc sur les pages des modèles, et vous collez ensuite le texte final dans Claude ou Cursor.
Importez votre fichier audio. Le modèle accepte les formats MP3, MP4, MPEG, MPGA, M4A, OGG, WAV et WebM.
Renseignez le champ Language avec un code ISO-639-1 comme en, es ou fr. La page du modèle indique que le renseigner améliore à la fois la précision et la latence.
Ajoutez un Prompt facultatif : un court texte qui fixe le style ou prolonge un segment précédent. Il doit être dans la même langue que l’audio. Une ligne listant les noms des intervenants et les termes produits fonctionne bien.
Laissez Temperature à sa valeur par défaut de 0 pour un résultat plus prévisible.
Lancez la transcription, puis copiez le texte.
💡 Faites d’abord un test avec un extrait de 30 secondes. Si des noms sortent mal, corrigez la ligne du prompt avant de lancer l’enregistrement complet.
Audio très long, transcription et résumé dans une seule requête
Un fichier audio jusqu’à 8,4 heures, niveau de réflexion, instruction système
Gemini 3 Pro accepte un prompt texte avec l’audio, ce qui vous permet de demander une transcription, une liste de décisions et un résumé de trois lignes en une seule passe. Une fois le texte obtenu, un modèle de langage sur PicassoIA comme Claude Sonnet 5 peut le réécrire en notes d’émission, en e-mail ou en journal des modifications.
De la transcription à l’image sur PicassoIA
Une transcription est aussi une source d’éléments visuels. Un appel de brainstorming, un entretien client ou un épisode de podcast regorge de scènes concrètes que les gens ont décrites à voix haute, et ces scènes donnent de meilleurs prompts d’image que tout ce que vous pourriez inventer sur une page blanche.
Rédiger le prompt d’image à partir des citations
Demandez à Claude ou Cursor de transformer la transcription en cinq descriptions de scène, chacune avec un sujet, un décor, la lumière et un objectif. Par exemple :
Un petit comptoir de boulangerie à l’ouverture, un boulanger glissant un plateau de pains vers la caméra, une lumière chaude venant de la fenêtre à gauche, objectif 50 mm, faible profondeur de champ, poussière de farine dans l’air.
Collez chaque description dans un modèle d’image sur PicassoIA : Flux 2 Pro, P-Image ou Nano Banana Pro. Lancez le même prompt sur deux d’entre eux et comparez, car chaque modèle lit la lumière et la texture un peu différemment. Gardez une seule scène par prompt, précisez la direction de la lumière et l’objectif, et décrivez des surfaces comme la laine, le grain du bois ou la vapeur. Ces détails distinguent un résultat qui ressemble à une photographie d’un résultat générique.
Votre prochain enregistrement contient déjà vos cinq prochaines images. Choisissez un court extrait, transcrivez-le avec la configuration décrite plus haut ou sur PicassoIA, repérez la scène la plus parlante, et créez vos propres images sur PicassoIA dès aujourd’hui. Changez l’objectif, déplacez la lumière et voyez jusqu’où peut aller une seule phrase prononcée.