MCP de transcrição de áudio: transcreva arquivos no Claude e no Cursor
Um servidor MCP de transcrição de áudio permite que o Claude e o Cursor leiam diretamente seus arquivos MP3, WAV e M4A. Este artigo mostra a configuração para Claude Desktop, Claude Code e Cursor, os prompts que transformam transcrições em anotações e as correções para os erros que travam a maioria das primeiras configurações.
Entregue a um modelo um MP3 de 90 minutos e ele não tem como ler nada. Um servidor MCP de transcrição de áudio resolve isso. Ele fica entre sua janela de chat ou seu editor e um mecanismo de conversão de fala em texto, e assim você pode digitar "transcreva interview-04.mp3 e extraia as três melhores citações" e receber o texto de volta dentro do Claude ou do Cursor. Nada de trocar de aba, de formulários de upload ou de copiar e colar entre cinco aplicativos.
Este artigo mostra a configuração exata para Claude Desktop, Claude Code e Cursor, os prompts que funcionam em transcrições bagunçadas e as correções para os erros que param a maioria das primeiras tentativas. Ele também mostra um caminho sem instalação para gravações pontuais, usando os modelos de conversão de fala em texto da PicassoIA, e uma forma de transformar em imagens o que as pessoas disseram em uma gravação.
O que um MCP de transcrição de áudio faz
O Model Context Protocol (MCP) é um padrão aberto que permite a um aplicativo de IA chamar ferramentas externas por meio de um pequeno processo servidor. Um servidor de transcrição expõe algumas ferramentas, normalmente com nomes como "transcreva este caminho de arquivo" ou "divida esta gravação longa", e o cliente decide quando chamá-las. O servidor faz o trabalho pesado com um mecanismo de conversão de fala em texto e devolve texto simples para a conversa.
O fluxo do pedido
Veja o que acontece quando você pede uma transcrição:
Você digita um pedido que informa um caminho de arquivo local.
O cliente vê a ferramenta de transcrição na lista de ferramentas e pede sua permissão para executá-la.
O servidor lê o arquivo e o envia para uma API na nuvem ou para um modelo Whisper local.
O texto volta como resultado da ferramenta, e o modelo segue em frente: resume, extrai citações, reescreve.
💡 Vale lembrar: nessa configuração, o modelo nunca ouve o áudio. Ele lê a transcrição, então qualquer erro em um resumo remonta ao que o mecanismo ouviu primeiro. Confira nomes, números e datas com a fonte antes de publicar qualquer coisa.
Por que só o chat não basta
Colar uma transcrição à mão funciona para um arquivo. Quebra com dez. Com um servidor no lugar, você pode apontar para uma pasta inteira, manter os timestamps e encadear etapas em um único prompt: transcrever, redigir notas do episódio, salvar em notes.md. Dentro do Cursor, a mesma chamada de ferramenta pode gravar o resultado diretamente no seu repositório, ao lado do código ou da documentação a que ele pertence. Dentro do Claude Code, ela pode alimentar um script que renomeia arquivos por falante ou por tema.
Três situações em que a configuração compensa rapidamente:
Reuniões semanais: grave, transcreva e obtenha os itens de ação sem que ninguém precise digitar a ata.
Entrevistas e chamadas de pesquisa: extraia citações literais com timestamps para um relatório.
Podcasts e vídeos: produza notas do episódio, listas de capítulos e rascunhos de legendas a partir da faixa de áudio.
Escolha um mecanismo de transcrição
Antes de mexer em qualquer arquivo de configuração, decida onde o áudio será processado. Essa escolha define custo, privacidade e velocidade mais do que qualquer ajuste que você fará depois.
API na nuvem ou Whisper local
Fator
API na nuvem
Whisper local
Configuração
Cole uma credencial na configuração
Instale um ambiente de execução e baixe um modelo
Privacidade
O áudio sai da sua máquina
O áudio fica no disco
Velocidade
Segundos para a maioria dos arquivos
Depende da sua CPU ou GPU
Limites de arquivo
Valem os limites de upload (o endpoint de transcrição da OpenAI tem limitado uploads a 25 MB há muito tempo)
Limitado pelo disco e pela memória
Custo
Cobrado pelo uso
Gratuito após a configuração
Ideal para
Entrega rápida de áudio limpo
Gravações sensíveis e trabalho offline
Se a gravação for uma chamada com cliente, uma anotação médica ou qualquer conteúdo sob NDA, escolha o local. Para podcasts e webinars públicos, uma API na nuvem costuma ser mais rápida de conectar.
Três servidores que valem a pena conferir
Já existem projetos da comunidade, e seus nomes dizem o que fazem:
mcp-server-whisper: um servidor construído em torno dos modelos de fala da OpenAI.
whisper-mcp: transcrição local com modelos Whisper por meio do whisper.cpp, então nenhum áudio é enviado.
servidores MCP de fast-whisper: wrappers do Faster Whisper para reconhecimento local rápido em uma GPU ou em uma CPU decente.
Nomes mudam e projetos ficam desatualizados. Abra o repositório, verifique a data do último commit, leia quais ferramentas o servidor expõe e copie o comando de instalação do README dele, e não desta página. As configurações abaixo usam marcadores por esse motivo.
💡 Verificação de segurança: um servidor MCP roda como um processo com as permissões do seu usuário. Instale apenas código que você leu ou em que confia, e aponte para uma pasta de gravações em vez de todo o seu diretório pessoal.
Configure no Claude
O Claude Desktop lê os servidores de um arquivo JSON. O Claude Code os adiciona com um comando. Os dois iniciam o servidor como um processo local na sua máquina.
TRANSCRIBE_TOKEN é um exemplo. Use o nome de variável que o README do seu servidor pede. Servidores em Python costumam iniciar com uvx em vez de npx, então troque o command e o args para combinar. Depois, feche o Claude Desktop por completo, e não só a janela, e abra-o de novo. A lista de ferramentas mostra o novo servidor assim que o processo começa.
Duas regras pegam as pessoas de surpresa: todas as opções vêm antes do nome do servidor, e o duplo traço separa o nome do comando que inicia o servidor. Confira o resultado com claude mcp list, inspecione com claude mcp get transcribe e remova com claude mcp remove transcribe.
💡 Use --scope project para salvar a entrada em um arquivo .mcp.json que sua equipe compartilha. Nunca faça commit de uma credencial bruta ali. Referencie uma variável de ambiente, como ${TRANSCRIBE_TOKEN}, e deixe cada pessoa definir a sua.
Faça um teste rápido antes de confiar a ele um arquivo real: grave dez segundos de você mesmo no celular, coloque o arquivo na sua pasta de gravações e peça ao Claude para transcrevê-lo. Uma transcrição correta confirma, de uma vez, o servidor, a credencial e o caminho do arquivo.
Configure no Cursor
O Cursor lê o mesmo formato mcpServers a partir de um arquivo. Coloque .cursor/mcp.json dentro de um projeto para limitar o servidor àquele repositório, ou ~/.cursor/mcp.json na sua pasta pessoal para deixá-lo disponível em todos os lugares.
A sintaxe ${env:NAME} puxa o valor do ambiente do seu shell, então o arquivo continua seguro para commit. O Cursor também resolve ${workspaceFolder} dentro dos valores de command, args e env, o que é útil quando o servidor precisa de um caminho para uma pasta de gravações dentro do repositório.
Chame pelo chat
Abra o chat do agente e confira a página de configurações do MCP: o servidor deve aparecer como habilitado, com os nomes das ferramentas listados. Depois, peça em linguagem simples:
Transcreva recordings/call-0612.m4a com a ferramenta de transcrição e salve o texto em docs/call-0612.md. Adicione um resumo de cinco linhas no topo.
Por padrão, o Cursor pede que você aprove cada chamada de ferramenta antes de ela rodar. Aprove a primeira, confira a saída e só então considere ativar a execução automática para este servidor.
Prompts que funcionam em transcrições
Transcrições brutas são longas e desorganizadas, então o prompt decide se você recebe um bloco de texto ou algo que pode usar. Os melhores prompts nomeiam o arquivo, dizem o que extrair e informam ao modelo o que fazer quando o áudio estiver pouco claro.
Anotações de reunião que atribuem responsáveis
Transcreva standup-0612.m4a. Depois, liste decisões, questões em aberto e itens de ação. Para cada item de ação, informe o responsável e a data que ele deu. Se ninguém deu uma data, escreva "sem data" em vez de adivinhar.
A última frase importa. Sem ela, os modelos tendem a preencher as lacunas com uma sexta-feira plausível.
Citações de entrevista com timestamps
Transcreva interview-04.mp3 com timestamps. Escolha as cinco citações mais fortes, mantenha cada uma palavra por palavra e coloque o timestamp ao lado. Marque qualquer citação em que o áudio pareceu pouco claro.
Texto literal somado a timestamps permite conferir cada citação com a gravação em segundos.
Alguns hábitos que economizam tempo em todo prompt:
Informe o caminho exato, incluindo a extensão.
Peça citações literais e proíba paráfrases quando a redação importar.
Peça marcações de incerteza para que trechos pouco claros sejam sinalizados, e não suavizados.
Adicione um glossário de nomes de produtos, pessoas e jargões, já que os mecanismos adivinham grafias.
Trabalhe em partes para gravações com mais de uma hora: transcreva, resuma cada parte e depois junte.
Corrija os erros mais comuns
A maioria das falhas se resume a cinco causas. Esta tabela leva você rapidamente à causa certa.
Sintoma
Causa provável
Correção
A ferramenta nunca aparece
Erro de sintaxe no JSON ou falta de reinício completo
Valide o JSON, feche o aplicativo por completo e abra de novo
"command not found"
npx ou uvx ausente no PATH do aplicativo
Use o caminho absoluto do executável
Erro de autenticação
Variável de credencial errada ou ausente
Use exatamente o nome da variável indicado no README
Tempo esgotado em arquivo longo
Limite de upload ou mecanismo lento
Divida o arquivo em partes de 15 minutos
Nomes com grafia errada
O mecanismo adivinhou a grafia
Adicione um glossário ou um prompt de estilo
Servidor fora da lista
Comece pelas verificações básicas. Uma vírgula sobrando no fim quebra o arquivo inteiro, e um aplicativo de desktop muitas vezes não herda o PATH que você vê no terminal, então npx funciona em um shell, mas falha no aplicativo. Cole o caminho absoluto do executável em command e tente de novo.
Depois, rode o comando do servidor manualmente em um terminal. Se falhar ali, falha também no cliente, e o terminal mostra o erro real. No Claude Desktop, os arquivos de log do MCP ficam em uma pasta logs: %APPDATA%\Claude\logs no Windows e ~/Library/Logs/Claude no macOS.
Arquivos grandes e tempo esgotado
Tanto o Claude quanto o Cursor podem desistir de uma chamada de ferramenta que roda por tempo demais, e os mecanismos na nuvem têm limites de upload. Reduzir o arquivo resolve as duas coisas. Fala não precisa de qualidade de estúdio, então mono com taxa de amostragem baixa funciona:
Depois, peça ao modelo para transcrever part_000.mp3, part_001.mp3 e assim por diante, em ordem, e junte os resultados em um único prompt no final.
Transcreva no navegador na PicassoIA
Para uma gravação pontual, um servidor dá mais trabalho de configuração do que a tarefa merece. A PicassoIA roda modelos de conversão de fala em texto no navegador, sem nada para instalar: GPT 4o Transcribe, GPT 4o Mini Transcribe e Gemini 3 Pro. O conector da PicassoIA para Claude foi feito para geração de imagens e vídeos, então a transcrição acontece nas páginas dos modelos, e você cola o texto final no Claude ou no Cursor depois.
Envie seu arquivo de áudio. O modelo aceita MP3, MP4, MPEG, MPGA, M4A, OGG, WAV e WebM.
Preencha Language com um código ISO-639-1, como en, es ou fr. A página do modelo diz que informá-lo melhora a precisão e a latência.
Adicione um Prompt opcional: um texto curto que define o estilo ou continua um trecho anterior. Ele deve estar no mesmo idioma do áudio. Uma linha com nomes de falantes e termos de produto funciona bem.
Deixe Temperature no padrão, 0, para a saída mais previsível.
Execute e copie a transcrição.
💡 Teste primeiro com um trecho de 30 segundos. Se os nomes saírem errados, corrija a linha do prompt antes de rodar a hora inteira.
Áudios muito longos, transcrição e resumo em um único pedido
Um arquivo de áudio de até 8,4 horas, nível de raciocínio, instrução de sistema
O Gemini 3 Pro aceita um prompt de texto junto com o áudio, então você pode pedir uma transcrição, uma lista de decisões e um resumo de três linhas em uma única passada. Com o texto em mãos, um modelo de linguagem da PicassoIA, como o Claude Sonnet 5, pode reescrevê-lo como notas do episódio, um e-mail ou um changelog.
Da transcrição à imagem na PicassoIA
Uma transcrição também é fonte de elementos visuais. Uma chamada de brainstorm, uma entrevista com cliente ou um episódio de podcast está cheio de cenas concretas que as pessoas descreveram em voz alta, e essas cenas rendem prompts de imagem melhores do que qualquer coisa que você inventaria com uma página em branco.
Escreva o prompt de imagem a partir das citações
Peça ao Claude ou ao Cursor que transforme a transcrição em cinco descrições de cena, cada uma com um sujeito, um cenário, a luz e uma lente. Por exemplo:
Um pequeno balcão de padaria na hora da abertura, um padeiro deslizando uma bandeja de pães em direção à câmera, luz quente de janela vinda da esquerda, lente de 50mm, profundidade de campo rasa, poeira de farinha no ar.
Cole cada descrição em um modelo de imagem na PicassoIA: Flux 2 Pro, P-Image ou Nano Banana Pro. Rode o mesmo prompt em dois deles e compare, já que cada modelo interpreta luz e textura de um jeito um pouco diferente. Mantenha uma cena por prompt, informe a direção da luz e a lente, e descreva superfícies como lã, veio da madeira ou vapor. Esses detalhes separam um resultado parecido com fotografia de um resultado genérico.
Sua próxima gravação já contém suas próximas cinco imagens. Escolha um trecho curto, transcreva-o com a configuração acima ou na PicassoIA, extraia a cena mais vívida e crie suas próprias imagens na PicassoIA hoje. Mude a lente, mova a luz e veja até onde uma única frase falada pode chegar.