MCP de transcripción de audio: transcribe archivos en Claude y Cursor

Un servidor MCP de transcripción de audio permite que Claude y Cursor lean directamente tus archivos MP3, WAV y M4A. Este artículo muestra la configuración para Claude Desktop, Claude Code y Cursor, los prompts que convierten las transcripciones en notas y las soluciones a los errores que bloquean la mayoría de las primeras instalaciones.

MCP de transcripción de audio: transcribe archivos en Claude y Cursor
Cristian Da Conceicao
Fundador de Picasso IA

Si le das a un modelo un MP3 de 90 minutos, no tiene nada que leer. Un servidor MCP de transcripción de audio soluciona eso. Se sitúa entre tu ventana de chat o tu editor y un motor de voz a texto, así que puedes escribir "transcribe interview-04.mp3 y extrae las tres mejores citas" y recibir el texto dentro de Claude o Cursor. Sin cambiar de pestaña, sin formularios de subida y sin copiar y pegar entre cinco aplicaciones.

Este artículo recorre la configuración exacta para Claude Desktop, Claude Code y Cursor, los prompts que funcionan con transcripciones desordenadas y las soluciones a los errores que frenan la mayoría de los primeros intentos. También muestra una ruta sin instalación para grabaciones puntuales, usando los modelos de voz a texto de PicassoIA, y una forma de convertir en imágenes lo que la gente dijo en una grabación.

Qué hace un MCP de transcripción de audio

El Model Context Protocol (MCP) es un estándar abierto que permite a una aplicación de IA llamar a herramientas externas a través de un pequeño proceso servidor. Un servidor de transcripción expone unas cuantas herramientas, normalmente del tipo "transcribe esta ruta de archivo" o "divide esta grabación larga", y el cliente decide cuándo usarlas. El servidor hace el trabajo pesado con un motor de voz a texto y devuelve el texto plano a la conversación.

Un desarrollador de software con sudadera gris inclinado hacia un equipo portátil, con una carpeta de grabaciones de audio a su lado

El flujo de la petición

Esto es lo que ocurre cuando pides una transcripción:

  1. Escribes una petición que indica la ruta de un archivo local.
  2. El cliente ve la herramienta de transcripción en su lista de herramientas y pide permiso para ejecutarla.
  3. El servidor lee el archivo y lo envía a una API en la nube o a un modelo Whisper local.
  4. El texto vuelve como resultado de la herramienta, y el modelo continúa: resume, extrae citas o reescribe.

💡 Conviene recordarlo: en esta configuración el modelo nunca escucha el audio. Lee la transcripción, así que cualquier error en un resumen viene de lo que el motor oyó primero. Comprueba nombres, cifras y fechas contra el original antes de publicar nada.

Por qué el chat solo se queda corto

Pegar una transcripción a mano funciona con un archivo. Se rompe con diez. Con un servidor en marcha puedes señalar una carpeta entera, conservar las marcas de tiempo y encadenar pasos en un solo prompt: transcribir, redactar notas del programa y guardar en notes.md. Dentro de Cursor, la misma llamada a una herramienta puede escribir el resultado directamente en tu repositorio, junto al código o la documentación a la que pertenece. Dentro de Claude Code puede alimentar un script que renombra archivos según el hablante o el tema.

Tres situaciones en las que la configuración se amortiza rápido:

  • Reuniones semanales: grabas, transcribes y obtienes los puntos de acción sin que nadie escriba las actas.
  • Entrevistas y llamadas de investigación: extraes citas textuales con marcas de tiempo para un informe.
  • Pódcast y videos: generas notas del programa, listas de capítulos y borradores de subtítulos a partir de la pista de audio.

Elige un motor de transcripción

Antes de tocar un archivo de configuración, decide dónde se procesa el audio. Esa única decisión condiciona el costo, la privacidad y la velocidad más que cualquier ajuste que cambies después.

Vista cenital de un equipo portátil, unos auriculares de estudio, una grabadora de voz de mano y una libreta sobre un escritorio de madera

API en la nube o Whisper local

FactorAPI en la nubeWhisper local
ConfiguraciónPegar una credencial en la configuraciónInstalar un entorno de ejecución, descargar un modelo
PrivacidadEl audio sale de tu equipoEl audio se queda en el disco
VelocidadSegundos para la mayoría de archivosDepende de tu CPU o GPU
Límites de archivoSe aplican límites de subida (el endpoint de transcripción de OpenAI ha limitado durante mucho tiempo las subidas a 25 MB)Limitado por el disco y la memoria
CostoSe cobra por usoGratis tras la configuración
Mejor paraRespuesta rápida con audio limpioGrabaciones sensibles y trabajo sin conexión

Si la grabación es una llamada con un cliente, una nota médica o algo protegido por un acuerdo de confidencialidad, elige local. Para pódcast y seminarios web públicos, una API en la nube suele ser más rápida de conectar.

Tres servidores que vale la pena revisar

Ya existen proyectos de la comunidad, y sus nombres dicen lo que hacen:

  • mcp-server-whisper: un servidor construido en torno a los modelos de voz de OpenAI.
  • whisper-mcp: transcripción local con modelos Whisper a través de whisper.cpp, así que no se sube ningún audio.
  • fast-whisper MCP servers: envoltorios de Faster Whisper para un reconocimiento local rápido en una GPU o en una CPU decente.

Los nombres cambian y los proyectos quedan abandonados. Abre el repositorio, revisa la fecha del último commit, lee qué herramientas expone el servidor y copia el comando de instalación del README en lugar de copiarlo de esta página. Por eso las configuraciones de abajo usan marcadores de posición.

💡 Comprobación de seguridad: un servidor MCP se ejecuta como un proceso con los permisos de tu usuario. Instala solo código que hayas leído o en el que confíes, y apúntalo a una carpeta de grabaciones en lugar de a todo tu directorio personal.

Configúralo en Claude

Claude Desktop lee los servidores desde un archivo JSON. Claude Code los añade con un comando. Ambos inician el servidor como un proceso local en tu equipo.

Una mujer con camisa vaquera escribiendo en un equipo portátil sobre una mesa de cocina con luz de mañana

Configuración de Claude Desktop

Abre el archivo de configuración de tu sistema:

  • macOS: ~/Library/Application Support/Claude/claude_desktop_config.json
  • Windows: %APPDATA%\Claude\claude_desktop_config.json

Añade el servidor bajo mcpServers:

{
  "mcpServers": {
    "transcribe": {
      "command": "npx",
      "args": ["-y", "<package-name-from-the-readme>"],
      "env": {
        "TRANSCRIBE_TOKEN": "<your-credential>"
      }
    }
  }
}

TRANSCRIBE_TOKEN es un marcador de posición. Usa el nombre de variable que pida el README de tu servidor. Los servidores en Python suelen lanzarse con uvx en lugar de npx, así que cambia command y args para que coincidan. Después, cierra Claude Desktop por completo, no solo la ventana, y ábrelo de nuevo. La lista de herramientas muestra el nuevo servidor cuando arranca el proceso.

Claude Code en una sola línea

claude mcp add --transport stdio transcribe --env TRANSCRIBE_TOKEN=<your-credential> -- npx -y <package-name-from-the-readme>

Dos reglas hacen tropezar a la gente: todas las opciones van antes del nombre del servidor, y el doble guion separa el nombre del comando que inicia el servidor. Comprueba el resultado con claude mcp list, inspecciónalo con claude mcp get transcribe y elimínalo con claude mcp remove transcribe.

💡 Usa --scope project para guardar la entrada en un archivo .mcp.json que comparta tu equipo. Nunca subas una credencial en texto plano allí. Haz referencia a una variable de entorno como ${TRANSCRIBE_TOKEN} y que cada persona configure la suya.

Haz una prueba rápida antes de confiarle un archivo real: graba diez segundos de ti mismo con el teléfono, guarda el archivo en tu carpeta de grabaciones y pide a Claude que lo transcriba. Una transcripción correcta confirma a la vez el servidor, la credencial y la ruta del archivo.

Configúralo en Cursor

Cursor lee la misma estructura mcpServers desde un archivo. Coloca .cursor/mcp.json dentro de un proyecto para limitar el servidor a ese repositorio, o ~/.cursor/mcp.json en tu carpeta personal para tenerlo disponible en todas partes.

Un desarrollador con barba visto de espaldas en un escritorio con dos monitores, un editor de código y una barra lateral de chat

Edita mcp.json

{
  "mcpServers": {
    "transcribe": {
      "command": "npx",
      "args": ["-y", "<package-name-from-the-readme>"],
      "env": {
        "TRANSCRIBE_TOKEN": "${env:TRANSCRIBE_TOKEN}"
      }
    }
  }
}

La sintaxis ${env:NAME} toma el valor del entorno de tu shell, así que el archivo puede subirse al repositorio sin riesgo. Cursor también resuelve ${workspaceFolder} dentro de los valores de command, args y env, lo cual resulta útil cuando el servidor necesita una ruta a una carpeta de grabaciones dentro del repo.

Llámalo desde el chat

Abre el chat del agente y revisa la página de ajustes de MCP: el servidor debería aparecer como habilitado, con sus nombres de herramientas listados. Después pide en lenguaje natural:

Transcribe recordings/call-0612.m4a con la herramienta de transcripción y guarda el texto en docs/call-0612.md. Añade un resumen de cinco líneas al principio.

Por defecto, Cursor te pide aprobar cada llamada a una herramienta antes de que se ejecute. Aprueba la primera, revisa la salida y solo entonces considera activar la ejecución automática para este servidor.

Prompts que funcionan con transcripciones

Unas manos de mujer subrayando líneas de una transcripción impresa de una entrevista con un marcador amarillo

Las transcripciones en bruto son largas y desordenadas, así que el prompt decide si obtienes un muro de texto o algo que puedas usar. Los mejores prompts nombran el archivo, dicen qué extraer e indican al modelo qué hacer cuando el audio no se entiende.

Notas de reunión que asignan responsables

Transcribe standup-0612.m4a. Después, enumera las decisiones, las preguntas abiertas y los puntos de acción. Para cada punto de acción, indica el responsable y la fecha que dio. Si nadie dio una fecha, escribe "sin fecha" en lugar de adivinarla.

La última frase importa. Sin ella, los modelos tienden a rellenar los huecos con un viernes plausible.

Citas de entrevistas con marcas de tiempo

Transcribe interview-04.mp3 con marcas de tiempo. Elige las cinco citas más sólidas, conserva cada una palabra por palabra y pon la marca de tiempo junto a ella. Marca cualquier cita en la que el audio sonara poco claro.

El texto literal con marcas de tiempo te permite comprobar cada cita contra la grabación en segundos.

Algunos hábitos que ahorran tiempo en cada prompt:

  • Indica la ruta exacta, incluida la extensión.
  • Pide citas textuales y prohíbe la paráfrasis cuando la redacción importa.
  • Pide marcas de incertidumbre para que los pasajes poco claros se señalen en lugar de suavizarse.
  • Añade un glosario de nombres de productos, personas y jerga, ya que los motores adivinan la ortografía.
  • Trabaja por bloques con grabaciones de más de una hora: transcribe, resume cada parte y luego une los resúmenes.

Soluciona los errores habituales

Un ingeniero en una sala de reuniones de cristal frotándose la sien mientras lee la pantalla de un equipo portátil

La mayoría de los fallos se deben a cinco causas. Esta tabla te lleva rápido a la causa correcta.

SíntomaCausa probableSolución
La herramienta nunca apareceError de sintaxis en el JSON o no se reinició por completoValida el JSON, cierra la aplicación por completo y vuelve a abrirla
"command not found"npx o uvx no está en el PATH de la aplicaciónUsa la ruta absoluta del ejecutable
Error de autenticaciónVariable de credencial incorrecta o ausenteHaz coincidir el nombre exacto de la variable con el del README
Tiempo de espera en un archivo largoLímite de subida o motor lentoDivide el archivo en partes de 15 minutos
Nombres mal escritosEl motor adivinó la ortografíaAñade un glosario o un prompt de estilo

El servidor no aparece en la lista

Empieza por las comprobaciones básicas. Una coma final rompe todo el archivo, y una aplicación de escritorio a menudo no hereda el PATH que ves en tu terminal, así que npx funciona en una shell pero falla en la aplicación. Pega la ruta absoluta del ejecutable en command y vuelve a intentarlo.

Después, ejecuta el comando del servidor a mano en una terminal. Si falla ahí, también falla en el cliente, y la terminal muestra el error real. En Claude Desktop, los archivos de registro de MCP están en una carpeta logs: %APPDATA%\Claude\logs en Windows y ~/Library/Logs/Claude en macOS.

Archivos grandes y tiempos de espera

Tanto Claude como Cursor pueden abandonar una llamada a una herramienta que tarda demasiado, y los motores en la nube tienen límites de subida. Reducir el archivo soluciona ambos problemas. La voz no necesita calidad de estudio, así que sirve un audio mono con una frecuencia de muestreo baja:

ffmpeg -i long-call.wav -ac 1 -ar 16000 -b:a 64k long-call.mp3

Si sigue siendo demasiado grande, córtalo en segmentos de 15 minutos sin recodificarlo:

ffmpeg -i long-call.mp3 -f segment -segment_time 900 -c copy part_%03d.mp3

Después pide al modelo que transcriba part_000.mp3, part_001.mp3 y así sucesivamente, en orden, y une los resultados en un solo prompt al final.

Transcribe en el navegador con PicassoIA

Para una grabación puntual, un servidor exige más configuración de la que el trabajo merece. PicassoIA ejecuta modelos de voz a texto en el navegador sin nada que instalar: GPT 4o Transcribe, GPT 4o Mini Transcribe y Gemini 3 Pro. El conector de PicassoIA para Claude está pensado para la generación de imágenes y video, así que la transcripción se hace en las páginas de los modelos, y después pegas el texto terminado en Claude o Cursor.

Un presentador de pódcast en un pequeño estudio hablando frente a un micrófono, con un equipo portátil que muestra una página de subida

Sube el archivo y elige el idioma

  1. Abre la página de GPT 4o Transcribe en PicassoIA.
  2. Sube tu archivo de audio. El modelo acepta MP3, MP4, MPEG, MPGA, M4A, OGG, WAV y WebM.
  3. Rellena Language con un código ISO-639-1, como en, es o fr. La página del modelo indica que indicarlo mejora tanto la precisión como la latencia.
  4. Añade un Prompt opcional: un texto breve que fije el estilo o continúe un segmento anterior. Debe coincidir con el idioma del audio. Una línea con los nombres de los hablantes y los términos del producto funciona bien.
  5. Deja Temperature en su valor por defecto de 0 para obtener el resultado más predecible.
  6. Ejecútalo y después copia la transcripción.

💡 Prueba primero con un clip de 30 segundos. Si los nombres salen mal, corrige la línea del prompt antes de procesar la hora completa.

Cambia de modelo para grabaciones largas

ModeloMejor paraNotas
GPT 4o TranscribeTranscripciones precisas de archivos cortos y medianosCampos de idioma, prompt y temperatura
GPT 4o Mini TranscribeBorradores rápidosVariante más ligera de la misma familia
Gemini 3 ProAudio muy largo, transcripción más resumen en una sola peticiónUn archivo de audio de hasta 8,4 horas, nivel de razonamiento, instrucción del sistema

Gemini 3 Pro acepta un prompt de texto junto con el audio, así que puedes pedir una transcripción, una lista de decisiones y un resumen de tres líneas en una sola pasada. Una vez que tienes el texto, un modelo de lenguaje en PicassoIA como Claude Sonnet 5 puede reescribirlo como notas del programa, un correo o un registro de cambios.

De la transcripción a la imagen en PicassoIA

Una creadora de contenido colocando en un tablero de corcho maquetas de fotos impresas y fichas, de pie frente a un escritorio

Una transcripción también es una fuente de material visual. Una llamada de lluvia de ideas, una entrevista con un cliente o un episodio de pódcast están llenos de escenas concretas que la gente describe en voz alta, y esas escenas funcionan mejor como prompts de imagen que cualquier cosa que inventarías ante una página en blanco.

Escribe el prompt de imagen a partir de las citas

Pide a Claude o a Cursor que convierta la transcripción en cinco descripciones de escena, cada una con un sujeto, un escenario, la luz y un objetivo. Por ejemplo:

Un pequeño mostrador de panadería a la hora de abrir, un panadero deslizando una bandeja de barras de pan hacia la cámara, luz cálida de ventana desde la izquierda, objetivo de 50 mm, profundidad de campo reducida, polvo de harina en el aire.

Pega cada descripción en un modelo de imagen de PicassoIA: Flux 2 Pro, P-Image o Nano Banana Pro. Pasa el mismo prompt por dos de ellos y compara, ya que cada modelo interpreta la luz y la textura de forma un poco distinta. Mantén una escena por prompt, indica la dirección de la luz y el objetivo, y describe superficies como la lana, la veta de la madera o el vapor. Esos detalles separan un resultado parecido a una fotografía de uno genérico.

Tu próxima grabación ya contiene tus próximas cinco imágenes. Elige un clip corto, transcríbelo con la configuración de arriba o en PicassoIA, extrae la escena más vívida y crea tus propias imágenes en Picasso IA hoy mismo. Cambia el objetivo, mueve la luz y comprueba hasta dónde puede llegar una sola frase hablada.

Tres colegas alrededor de una larga mesa de madera en un espacio de coworking iluminado por el sol, revisando juntos un equipo portátil

Compartir este artículo

Elige tu idioma