Transcription audio MCP : transcrire des fichiers dans Claude et Cursor

Un serveur MCP de transcription audio permet à Claude et Cursor de lire directement vos fichiers MP3, WAV et M4A. Cet article présente la configuration pour Claude Desktop, Claude Code et Cursor, les prompts qui transforment les transcriptions en notes, et les solutions aux erreurs qui bloquent la plupart des premières installations.

Transcription audio MCP : transcrire des fichiers dans Claude et Cursor
Cristian Da Conceicao
Fondateur de Picasso IA

Donnez à un modèle un MP3 de 90 minutes et il n’a rien à lire. Un serveur MCP de transcription audio règle ce problème. Il se place entre votre fenêtre de chat ou votre éditeur et un moteur de reconnaissance vocale, si bien que vous pouvez écrire « transcris interview-04.mp3 et extrais les trois meilleures citations » et obtenir le texte directement dans Claude ou Cursor. Plus besoin de changer d’onglet, de formulaires d’import ni de copier-coller entre cinq applications.

Cet article détaille la configuration exacte pour Claude Desktop, Claude Code et Cursor, les prompts qui fonctionnent sur des transcriptions brouillonnes, et les solutions aux erreurs qui bloquent la plupart des premiers essais. Il présente aussi une méthode sans installation pour les enregistrements ponctuels, avec les modèles de reconnaissance vocale de PicassoIA, ainsi qu’une façon de transformer ce que disent les gens dans un enregistrement en images.

Ce que fait un MCP de transcription audio

Le Model Context Protocol (MCP) est un standard ouvert qui permet à une application d’IA d’appeler des outils externes via un petit processus serveur. Un serveur de transcription expose quelques outils, généralement du type « transcrire ce chemin de fichier » ou « découper cet enregistrement long », et c’est le client qui décide quand les appeler. Le serveur fait le gros du travail avec un moteur de reconnaissance vocale et renvoie du texte brut à la conversation.

Un développeur en sweat-shirt gris penché vers un ordinateur portable, avec un dossier d’enregistrements audio à côté

Le déroulement de la requête

Voici ce qui se passe quand vous demandez une transcription :

  1. Vous écrivez une demande qui indique le chemin d’un fichier local.
  2. Le client voit l’outil de transcription dans sa liste d’outils et vous demande l’autorisation de le lancer.
  3. Le serveur lit le fichier et l’envoie à une API cloud ou à un modèle Whisper local.
  4. Le texte revient comme résultat de l’outil, et le modèle poursuit : il résume, extrait des citations ou réécrit.

💡 À retenir : dans cette configuration, le modèle n’entend jamais l’audio. Il lit la transcription, donc toute erreur dans un résumé remonte à ce que le moteur a entendu en premier. Vérifiez les noms, les chiffres et les dates par rapport à la source avant de publier quoi que ce soit.

Pourquoi le chat seul ne suffit pas

Coller une transcription à la main fonctionne pour un fichier. Cela devient impraticable pour dix. Avec un serveur en place, vous pouvez désigner tout un dossier, conserver les horodatages et enchaîner les étapes dans un seul prompt : transcrire, rédiger les notes de l’émission, enregistrer dans notes.md. Dans Cursor, le même appel d’outil peut écrire le résultat directement dans votre dépôt, à côté du code ou de la documentation auxquels il se rapporte. Dans Claude Code, il peut alimenter un script qui renomme les fichiers selon l’intervenant ou le sujet.

Trois situations où cette configuration rapporte vite :

  • Réunions hebdomadaires : enregistrez, transcrivez et obtenez les actions à mener sans que personne ne prenne de notes.
  • Entretiens et appels de recherche : extrayez des citations textuelles avec horodatage pour un rapport.
  • Podcasts et vidéos : produisez les notes d’émission, les listes de chapitres et les brouillons de sous-titres à partir de la piste audio.

Choisir un moteur de transcription

Avant de toucher à un fichier de configuration, décidez où l’audio sera traité. Ce choix détermine le coût, la confidentialité et la vitesse bien plus que n’importe quel réglage que vous modifierez plus tard.

Vue à plat d’un ordinateur portable, d’un casque de studio, d’un enregistreur vocal portable et d’un carnet sur un bureau en bois

API cloud ou Whisper en local

CritèreAPI cloudWhisper en local
InstallationColler un identifiant dans la configurationInstaller un environnement d’exécution, télécharger un modèle
ConfidentialitéL’audio quitte votre machineL’audio reste sur le disque
VitesseQuelques secondes pour la plupart des fichiersDépend de votre CPU ou GPU
Limites de tailleDes plafonds d’import s’appliquent (le point de terminaison de transcription d’OpenAI limite depuis longtemps les envois à 25 Mo)Limitées par le disque et la mémoire
CoûtFacturé à l’usageGratuit après installation
Idéal pourUn traitement rapide d’un audio propreEnregistrements sensibles et travail hors ligne

Si l’enregistrement est un appel client, une note médicale ou quelque chose soumis à un accord de confidentialité, choisissez le local. Pour les podcasts et les webinaires publics, une API cloud est généralement plus rapide à configurer.

Trois serveurs à examiner

Des projets communautaires existent déjà, et leurs noms indiquent ce qu’ils font :

  • mcp-server-whisper : un serveur construit autour des modèles de parole d’OpenAI.
  • whisper-mcp : transcription locale avec les modèles Whisper via whisper.cpp, donc aucun audio n’est envoyé en ligne.
  • serveurs MCP fast-whisper : des enveloppes autour de Faster Whisper pour une reconnaissance locale rapide sur un GPU ou un CPU correct.

Les noms changent et les projets deviennent obsolètes. Ouvrez le dépôt, vérifiez la date du dernier commit, lisez la liste des outils exposés par le serveur et copiez la commande d’installation depuis son README plutôt que depuis cette page. Les configurations ci-dessous utilisent des espaces réservés pour cette raison.

💡 Contrôle de sécurité : un serveur MCP s’exécute comme un processus avec vos droits d’utilisateur. N’installez que du code que vous avez lu ou en lequel vous avez confiance, et limitez-le à un dossier d’enregistrements plutôt qu’à l’ensemble de votre dossier personnel.

Le configurer dans Claude

Claude Desktop lit les serveurs dans un fichier JSON. Claude Code les ajoute avec une commande. Les deux lancent le serveur comme processus local sur votre machine.

Une femme en chemise en jean tapant sur un ordinateur portable sur une table de cuisine, à la lumière du matin

Configuration de Claude Desktop

Ouvrez le fichier de configuration de votre système :

  • macOS : ~/Library/Application Support/Claude/claude_desktop_config.json
  • Windows : %APPDATA%\Claude\claude_desktop_config.json

Ajoutez le serveur sous mcpServers :

{
  "mcpServers": {
    "transcribe": {
      "command": "npx",
      "args": ["-y", "<package-name-from-the-readme>"],
      "env": {
        "TRANSCRIBE_TOKEN": "<your-credential>"
      }
    }
  }
}

TRANSCRIBE_TOKEN est un espace réservé à remplacer. Utilisez le nom de variable demandé par le README de votre serveur. Les serveurs Python se lancent généralement avec uvx au lieu de npx, donc modifiez command et args en conséquence. Ensuite, quittez entièrement Claude Desktop, pas seulement la fenêtre, puis rouvrez-le. La liste des outils affiche le nouveau serveur une fois le processus démarré.

Claude Code en une ligne

claude mcp add --transport stdio transcribe --env TRANSCRIBE_TOKEN=<your-credential> -- npx -y <package-name-from-the-readme>

Deux règles piègent souvent les utilisateurs : toutes les options vont avant le nom du serveur, et le double tiret sépare le nom du serveur de la commande qui le lance. Vérifiez le résultat avec claude mcp list, inspectez-le avec claude mcp get transcribe et supprimez-le avec claude mcp remove transcribe.

💡 Utilisez --scope project pour enregistrer l’entrée dans un fichier .mcp.json partagé avec votre équipe. N’y validez jamais un identifiant en clair. Référencez plutôt une variable d’environnement, comme ${TRANSCRIBE_TOKEN}, et laissez chaque personne définir la sienne.

Faites un test rapide avant de confier un vrai fichier au serveur : enregistrez dix secondes de votre voix avec un téléphone, déposez le fichier dans votre dossier d’enregistrements et demandez à Claude de le transcrire. Une transcription correcte confirme d’un coup le serveur, l’identifiant et le chemin du fichier.

Le configurer dans Cursor

Cursor lit la même structure mcpServers dans un fichier. Placez .cursor/mcp.json dans un projet pour limiter le serveur à ce dépôt, ou ~/.cursor/mcp.json dans votre dossier personnel pour le rendre disponible partout.

Un développeur barbu vu de dos devant un bureau à deux écrans, avec un éditeur de code et une barre latérale de chat

Modifier mcp.json

{
  "mcpServers": {
    "transcribe": {
      "command": "npx",
      "args": ["-y", "<package-name-from-the-readme>"],
      "env": {
        "TRANSCRIBE_TOKEN": "${env:TRANSCRIBE_TOKEN}"
      }
    }
  }
}

La syntaxe ${env:NAME} récupère la valeur depuis l’environnement de votre shell, donc le fichier peut être versionné sans risque. Cursor résout aussi ${workspaceFolder} dans les valeurs de command, args et env, ce qui est pratique lorsque le serveur a besoin du chemin d’un dossier d’enregistrements situé dans le dépôt.

L’appeler depuis le chat

Ouvrez le chat de l’agent et consultez la page des paramètres MCP : le serveur doit apparaître comme activé, avec le nom de ses outils. Demandez ensuite en langage courant :

Transcris recordings/call-0612.m4a avec l’outil de transcription et enregistre le texte dans docs/call-0612.md. Ajoute un résumé de cinq lignes en haut.

Par défaut, Cursor vous demande d’approuver chaque appel d’outil avant son exécution. Approuvez le premier, vérifiez la sortie, et seulement ensuite envisagez d’activer l’exécution automatique pour ce serveur.

Des prompts efficaces sur les transcriptions

Les mains d’une femme surlignant des lignes sur la transcription imprimée d’un entretien avec un surligneur jaune

Les transcriptions brutes sont longues et désordonnées, donc c’est le prompt qui décide si vous obtenez un pavé de texte ou quelque chose d’exploitable. Les meilleurs prompts nomment le fichier, indiquent ce qu’il faut extraire et précisent quoi faire lorsque l’audio est peu clair.

Comptes rendus de réunion avec des responsables

Transcris standup-0612.m4a. Liste ensuite les décisions, les questions ouvertes et les actions à mener. Pour chaque action, indique le responsable et la date qu’il a donnée. Si personne n’a donné de date, écris « sans date » au lieu de deviner.

La dernière phrase compte. Sans elle, les modèles ont tendance à combler les vides avec un vendredi plausible.

Citations d’entretien avec horodatage

Transcris interview-04.mp3 avec les horodatages. Choisis les cinq citations les plus fortes, conserve chacune mot pour mot et indique l’horodatage à côté. Signale toute citation où l’audio paraissait peu clair.

Le texte mot pour mot associé aux horodatages vous permet de vérifier chaque citation par rapport à l’enregistrement en quelques secondes.

Quelques habitudes qui font gagner du temps à chaque prompt :

  • Indiquez le chemin exact, extension comprise.
  • Demandez des citations textuelles et interdisez la paraphrase lorsque la formulation compte.
  • Demandez de signaler les incertitudes afin que les passages peu clairs soient marqués plutôt que lissés.
  • Ajoutez un glossaire de noms de produits, de personnes et de termes techniques, car les moteurs devinent l’orthographe.
  • Travaillez par segments pour les enregistrements de plus d’une heure : transcrivez, résumez chaque partie, puis fusionnez.

Corriger les erreurs courantes

Un ingénieur dans une salle de réunion aux murs vitrés, se frottant la tempe en lisant l’écran de son ordinateur portable

La plupart des échecs ont cinq causes. Ce tableau vous mène rapidement à la bonne.

SymptômeCause probableSolution
L’outil n’apparaît jamaisErreur de syntaxe JSON ou redémarrage complet absentValider le JSON, quitter entièrement l’application, la rouvrir
« command not found »npx ou uvx absent du PATH de l’applicationUtiliser le chemin absolu de l’exécutable
Erreur d’authentificationVariable d’identifiant absente ou incorrecteReprendre le nom exact de la variable indiqué dans le README
Délai dépassé sur un long fichierPlafond d’import ou moteur lentDécouper le fichier en segments de 15 minutes
Noms mal orthographiésLe moteur a deviné l’orthographeAjouter un glossaire ou un prompt de style

Serveur absent de la liste

Commencez par les vérifications élémentaires. Une virgule en trop dans la dernière entrée casse tout le fichier, et une application de bureau n’hérite souvent pas du PATH que vous voyez dans votre terminal : npx fonctionne donc dans un shell mais échoue dans l’application. Collez le chemin absolu de l’exécutable dans command et réessayez.

Lancez ensuite la commande du serveur à la main dans un terminal. Si elle échoue là, elle échouera aussi dans le client, et le terminal affiche la vraie erreur. Pour Claude Desktop, les fichiers journaux MCP se trouvent dans un dossier logs : %APPDATA%\Claude\logs sous Windows et ~/Library/Logs/Claude sous macOS.

Gros fichiers et délais dépassés

Claude comme Cursor peuvent abandonner un appel d’outil qui dure trop longtemps, et les moteurs cloud ont des plafonds d’import. Réduire le fichier règle les deux problèmes. La parole n’a pas besoin d’une qualité de studio : un audio mono à faible fréquence d’échantillonnage suffit :

ffmpeg -i long-call.wav -ac 1 -ar 16000 -b:a 64k long-call.mp3

S’il est toujours trop lourd, découpez-le en segments de 15 minutes sans réencodage :

ffmpeg -i long-call.mp3 -f segment -segment_time 900 -c copy part_%03d.mp3

Demandez ensuite au modèle de transcrire part_000.mp3, part_001.mp3 et ainsi de suite, dans l’ordre, puis assemblez les résultats dans un dernier prompt.

Transcrire dans le navigateur sur PicassoIA

Pour un enregistrement ponctuel, un serveur demande plus d’installation que la tâche ne le mérite. PicassoIA fait tourner des modèles de reconnaissance vocale dans le navigateur, sans rien installer : GPT 4o Transcribe, GPT 4o Mini Transcribe et Gemini 3 Pro. Le connecteur PicassoIA pour Claude est conçu pour la génération d’images et de vidéos ; la transcription se fait donc sur les pages des modèles, et vous collez ensuite le texte final dans Claude ou Cursor.

Un animateur de podcast dans un petit studio parlant devant un microphone, avec un ordinateur portable affichant une page d’import

Importer et définir la langue

  1. Ouvrez la page GPT 4o Transcribe sur PicassoIA.
  2. Importez votre fichier audio. Le modèle accepte les formats MP3, MP4, MPEG, MPGA, M4A, OGG, WAV et WebM.
  3. Renseignez le champ Language avec un code ISO-639-1 comme en, es ou fr. La page du modèle indique que le renseigner améliore à la fois la précision et la latence.
  4. Ajoutez un Prompt facultatif : un court texte qui fixe le style ou prolonge un segment précédent. Il doit être dans la même langue que l’audio. Une ligne listant les noms des intervenants et les termes produits fonctionne bien.
  5. Laissez Temperature à sa valeur par défaut de 0 pour un résultat plus prévisible.
  6. Lancez la transcription, puis copiez le texte.

💡 Faites d’abord un test avec un extrait de 30 secondes. Si des noms sortent mal, corrigez la ligne du prompt avant de lancer l’enregistrement complet.

Changer de modèle pour les longs enregistrements

ModèleIdéal pourRemarques
GPT 4o TranscribeTranscriptions précises de fichiers courts et moyensChamps Language, prompt et temperature
GPT 4o Mini TranscribeBrouillons rapidesVariante allégée de la même famille
Gemini 3 ProAudio très long, transcription et résumé dans une seule requêteUn fichier audio jusqu’à 8,4 heures, niveau de réflexion, instruction système

Gemini 3 Pro accepte un prompt texte avec l’audio, ce qui vous permet de demander une transcription, une liste de décisions et un résumé de trois lignes en une seule passe. Une fois le texte obtenu, un modèle de langage sur PicassoIA comme Claude Sonnet 5 peut le réécrire en notes d’émission, en e-mail ou en journal des modifications.

De la transcription à l’image sur PicassoIA

Une créatrice de contenu épinglant des maquettes de photos imprimées et des fiches sur un panneau de liège, debout devant son bureau

Une transcription est aussi une source d’éléments visuels. Un appel de brainstorming, un entretien client ou un épisode de podcast regorge de scènes concrètes que les gens ont décrites à voix haute, et ces scènes donnent de meilleurs prompts d’image que tout ce que vous pourriez inventer sur une page blanche.

Rédiger le prompt d’image à partir des citations

Demandez à Claude ou Cursor de transformer la transcription en cinq descriptions de scène, chacune avec un sujet, un décor, la lumière et un objectif. Par exemple :

Un petit comptoir de boulangerie à l’ouverture, un boulanger glissant un plateau de pains vers la caméra, une lumière chaude venant de la fenêtre à gauche, objectif 50 mm, faible profondeur de champ, poussière de farine dans l’air.

Collez chaque description dans un modèle d’image sur PicassoIA : Flux 2 Pro, P-Image ou Nano Banana Pro. Lancez le même prompt sur deux d’entre eux et comparez, car chaque modèle lit la lumière et la texture un peu différemment. Gardez une seule scène par prompt, précisez la direction de la lumière et l’objectif, et décrivez des surfaces comme la laine, le grain du bois ou la vapeur. Ces détails distinguent un résultat qui ressemble à une photographie d’un résultat générique.

Votre prochain enregistrement contient déjà vos cinq prochaines images. Choisissez un court extrait, transcrivez-le avec la configuration décrite plus haut ou sur PicassoIA, repérez la scène la plus parlante, et créez vos propres images sur PicassoIA dès aujourd’hui. Changez l’objectif, déplacez la lumière et voyez jusqu’où peut aller une seule phrase prononcée.

Trois collègues autour d’une longue table en bois dans un espace de coworking ensoleillé, examinant ensemble un ordinateur portable

Partager cet article

Choisissez votre langue