Melhores servidores MCP para LLMs locais em 2027: configurações com Ollama, LM Studio e Open WebUI

Modelos locais são privados, mas só conseguem conversar até você conectar ferramentas. Este artigo ranqueia sete servidores MCP para Ollama, LM Studio e Open WebUI, mostra a configuração de cada cliente, sugere modelos que chamam ferramentas com confiabilidade e lista as regras de segurança que mantêm um agente local sob controle.

Melhores servidores MCP para LLMs locais em 2027: configurações com Ollama, LM Studio e Open WebUI
Cristian Da Conceicao
Fundador do Picasso IA

Modelos locais são privados e baratos de rodar, mas, de fábrica, só conseguem conversar. Eles não leem a pasta do seu projeto, não verificam um git diff e não abrem uma página web. O MCP, o Model Context Protocol, fecha essa lacuna ao dar a qualquer aplicativo compatível uma forma padrão de entregar ferramentas reais a um modelo. O problema é que uma configuração local tem dois desafios que um chatbot na nuvem não tem: uma janela de contexto menor e um modelo menor, que erra chamadas de ferramenta com mais frequência. Por isso, os melhores servidores MCP para LLMs locais não são os catálogos mais numerosos. São os poucos que são leves, previsíveis e seguros para deixar rodando na sua própria máquina.

Abaixo você encontra sete servidores que atendem a esse critério, três maneiras de conectá-los ao Ollama, ao LM Studio e ao Open WebUI, e os erros que deixam os agentes locais lentos ou arriscados.

Por que modelos locais precisam de MCP

Desenvolvedor digitando em uma mesa de madeira ao lado de um notebook com um terminal escuro

O que o MCP faz na prática

Um servidor MCP é um pequeno programa que anuncia uma lista de ferramentas: ler um arquivo, executar um comando git, buscar uma página. Um cliente MCP, como o LM Studio ou o Open WebUI, mostra essa lista ao seu modelo. Quando o modelo quer usar uma ferramenta, ele emite uma chamada estruturada, o cliente a executa no servidor e o resultado volta para a conversa.

Essa divisão combina com o uso local. O modelo continua no seu hardware, o servidor roda ao lado dele e nada sai da sua rede, a menos que a própria ferramenta acesse a web. Dois transportes aparecem em todo lugar:

  • stdio: o cliente inicia o servidor como um processo filho na sua máquina. A maioria dos servidores de referência funciona assim.
  • Streamable HTTP: o servidor roda como um serviço web, que é o que aplicativos baseados em navegador, como o Open WebUI, esperam.

Onde os modelos pequenos têm dificuldade

Um modelo com 7 a 20 bilhões de parâmetros consegue chamar ferramentas, mas é menos tolerante do que um modelo de fronteira. Ele pode escolher a ferramenta errada, inventar um argumento ou entrar em loop repetindo a mesma chamada. Cada ferramenta que um servidor expõe é descrita no prompt, então dez servidores podem consumir uma parte grande de uma janela de contexto modesta antes de você digitar qualquer coisa.

💡 Regra prática: habilite três ou quatro servidores por chat, não doze. A própria documentação do LM Studio alerta que servidores feitos para Claude ou ChatGPT podem consumir muitos tokens e derrubar o desempenho de um modelo local.

Escolha primeiro o cliente

Vista de cima de uma mesa com um diagrama em um caderno, um minicomputador e uma xícara de café

O cliente define quais servidores você pode usar e quanta configuração terá de fazer. Três opções respondem pela maioria das configurações locais, e cada uma trata o MCP de um jeito diferente.

LM Studio: o caminho mais rápido

O LM Studio adicionou suporte a MCP na versão 0.3.17 e lida com servidores locais e remotos. Abra a aba Program na barra lateral direita, escolha Install e depois Edit mcp.json. O arquivo segue a notação do Cursor, então configurações copiadas de outras ferramentas geralmente se colam direto.

{
  "mcpServers": {
    "filesystem": {
      "command": "npx",
      "args": ["-y", "@modelcontextprotocol/server-filesystem", "/Users/you/notes"]
    }
  }
}

Servidores remotos usam uma url e, opcionalmente, headers em vez de um comando. Ao colar uma configuração encontrada na internet, copie apenas o conteúdo dentro de "mcpServers": { ... }, senão as chaves aninhadas quebram o arquivo.

💡 Servidores iniciados com npx precisam de Node.js, e servidores iniciados com uvx precisam de uv. Um ambiente de execução ausente passa despercebido com facilidade quando um servidor recém-adicionado não mostra ferramenta nenhuma.

Ollama mais uma ponte

O Ollama roda modelos e oferece chamada de ferramentas, mas não fala MCP sozinho. Você precisa de um cliente no meio que liste as ferramentas e as traduza para o formato de ferramentas do Ollama. Suas opções:

  • ollmcp (MCP Client for Ollama): um aplicativo de terminal que conecta modelos do Ollama a servidores MCP via stdio, SSE e Streamable HTTP, com modo agente e uma etapa de confirmação humana antes de as ferramentas rodarem. Instale com uv tool install --upgrade ollmcp.
  • MCPHost: um favorito anterior que não tem mais manutenção ativa, com o Kit indicado como sucessor.
  • ollama-mcp-bridge: um projeto de ponte da comunidade para quem prefere uma camada mais leve.

Escolha o ollmcp se você passa o dia no terminal. Mantenha as confirmações ativadas enquanto testa. Nem todo modelo do Ollama suporta ferramentas, e a biblioteca do Ollama marca os que suportam, então filtre por essa marcação antes de baixar um modelo.

Open WebUI e Streamable HTTP

Rack de laboratório doméstico montado na parede com um switch de rede, dois servidores compactos e cabos azuis organizados

O Open WebUI oferece suporte nativo a MCP a partir da versão 0.6.31, mas somente via Streamable HTTP, porque é um aplicativo web para vários usuários, e não um processo de desktop. Um administrador adiciona um servidor em Settings > Admin > Integrations, escolhe + Add Connection e define o tipo como MCP (Streamable HTTP). Usuários comuns não podem registrar os próprios servidores, uma escolha de segurança deliberada.

Para servidores stdio, rode-os atrás do mcpo, um proxy que transforma servidores stdio ou SSE em endpoints OpenAPI:

uvx mcpo --port 8000 -- npx -y @modelcontextprotocol/server-memory

Depois, adicione a URL resultante como um servidor de ferramentas OpenAPI. Se você roda o Open WebUI no Docker, defina a variável de ambiente WEBUI_SECRET_KEY. Sem ela, as ferramentas conectadas via OAuth quebram sempre que o contêiner reinicia.

Os melhores servidores MCP, classificados

Vista por cima do ombro de um desenvolvedor estudando dois monitores em um escritório doméstico com pouca luz

Estes sete estão ordenados pelo quanto acrescentam a uma configuração local típica para cada token de contexto que usam. Seis vêm da coleção oficial de referência, que atualmente mantém Everything, Fetch, Filesystem, Git, Memory, Sequential Thinking e Time. O sétimo, Playwright, é da Microsoft.

Filesystem

O servidor que quase todo mundo instala primeiro. Ele dá ao modelo ferramentas para ler, escrever, listar e buscar arquivos, limitadas às pastas que você passa como argumentos. Aponte-o para um cofre de anotações, uma pasta de documentos ou um único repositório, nunca para todo o seu diretório pessoal. Ele cuida de tarefas como resumir anotações de reuniões, renomear um lote de arquivos ou rascunhar um README a partir do código-fonte.

Git

Executado com uvx mcp-server-git, ele permite que um modelo leia status, diffs e histórico, e crie commits. É compacto e se comporta bem, o que o torna uma boa escolha para modelos da classe de 8B. Peça uma mensagem de commit com base no diff preparado e o modelo tem tudo de que precisa em uma única chamada.

Fetch

O Fetch baixa uma URL e converte a página para markdown, para que caiba em uma janela de contexto. Em muitas configurações locais, é a única forma de acessar a web ao vivo que não exige conta nem token. Trate cada página buscada como texto não confiável. Uma página pode conter instruções direcionadas ao seu modelo, um problema conhecido como prompt injection.

Memory

Foto macro de um SSD NVMe e dois módulos de memória sobre uma mesa de nogueira escura

Uma memória em grafo de conhecimento que armazena entidades, relações e observações em um arquivo local, para que o modelo possa lembrar fatos entre os chats. É uma das maneiras mais baratas de fazer um modelo pequeno parecer coerente. Faça backup desse arquivo e dê uma olhada nele de vez em quando, porque o modelo decide o que é guardado. Um prompt de sistema curto, que diga quando guardar um fato e quando recuperá-lo, ajuda, já que modelos pequenos tendem a salvar tudo ou nada.

Playwright

O @playwright/mcp da Microsoft controla um navegador real por meio de snapshots de acessibilidade em vez de capturas de tela, então um modelo local só de texto consegue clicar e digitar sem um modelo de visão. É o servidor mais pesado da lista e o mais arriscado, já que um navegador pode alcançar tudo o que a sua rede alcança. Use um perfil de navegador dedicado e mantenha as confirmações ativadas.

Sequential Thinking

Mulher com um suéter creme anotando em um caderno ao lado de um notebook, diante de uma janela com chuva

Ele dá ao modelo uma forma estruturada de quebrar um problema em pensamentos numerados, revisá-los e ramificá-los. Isso pode oferecer a um modelo menor um apoio para tarefas de várias etapas. Modelos que já raciocinam nativamente talvez não precisem dele, então teste com e sem.

A sétima escolha, Time, é um servidor minúsculo para a hora atual e a conversão de fusos horários. Ele importa mais do que parece, já que um modelo local não tem relógio.

ServidorMelhor paraComando de inicializaçãoRisco
FilesystemLer e editar anotações, documentos e códigonpx -y @modelcontextprotocol/server-filesystem <folder>Médio
GitStatus, diffs, histórico e commitsuvx mcp-server-gitMédio
FetchBuscar páginas web em markdownuvx mcp-server-fetchMédio
MemoryFatos que persistem entre chatsnpx -y @modelcontextprotocol/server-memoryBaixo
PlaywrightControlar um navegador realnpx @playwright/mcp@latestAlto
Sequential ThinkingDivisão de problemas passo a passonpx -y @modelcontextprotocol/server-sequential-thinkingBaixo
TimeHora atual e fusos horáriosuvx mcp-server-timeBaixo

Quais três habilitar primeiro? Para programação, experimente Filesystem, Git e Sequential Thinking. Para pesquisa e anotações, combine Fetch com Memory e Time. Para automação de navegador, rode o Playwright sozinho, para que a lista de ferramentas tenha a janela de contexto só para ela.

💡 Os servidores para SQLite, PostgreSQL, GitHub, Brave Search e Puppeteer já faziam parte da coleção de referência, mas hoje estão em um arquivo. Procure uma alternativa mantida antes de depender de um deles.

Modelos que chamam ferramentas bem

Vista de baixo ângulo de uma torre de computador preta e compacta com uma placa de vídeo grande atrás de vidro

Um ótimo servidor é desperdiçado em um modelo que não consegue formatar uma chamada de ferramenta. As famílias que as pessoas costumam recomendar para chamadas de ferramenta locais incluem Qwen, Llama 3.1 e versões mais recentes, e Codestral. Mais dois merecem teste. O GPT OSS 20B é um modelo de pesos abertos que a OpenAI construiu pensando em trabalho agêntico, como chamada de funções, e a OpenAI diz que ele roda com 16 GB de memória. O Granite 4.1 8B é a opção compacta da IBM para GPUs de faixa intermediária.

Os dois estão disponíveis como modelos hospedados no PicassoIA, o que significa que você pode testar prompts ali antes de baixar qualquer peso. Essas execuções hospedadas acontecem nos servidores do PicassoIA, e não na sua máquina.

O que observar

  • Chamada de ferramenta nativa: verifique no model card se há suporte a ferramentas no template de chat. Sem isso, o cliente recorre a truques de prompt pouco confiáveis.
  • Tamanho do contexto: busque de 16K a 32K tokens para que os esquemas das ferramentas, os resultados e a conversa caibam juntos.
  • Quantização: versões com menos bits economizam memória, mas podem tornar a formatação dos argumentos menos confiável. Se as chamadas começarem a falhar, experimente um arquivo com mais bits.
  • Temperatura baixa: 0,1 a 0,3 mantém os argumentos JSON estáveis.

Use o GPT OSS 20B no PicassoIA

Antes de baixar qualquer coisa, você pode verificar como um modelo formata chamadas de ferramenta. Isso leva cerca de dois minutos.

  1. Abra a página do modelo. Acesse o GPT OSS 20B no PicassoIA. Nenhum parâmetro é obrigatório, então você só precisa de um prompt.
  2. Escreva um prompt no estilo de ferramenta. Liste algumas ferramentas com seus argumentos e depois dê uma tarefa:
You can call these tools. Reply with JSON only.
read_file(path), list_directory(path), git_diff(repo)
Task: show me what changed in the notes folder today.
  1. Defina os parâmetros. Mantenha a Temperature no padrão de 0,1 para uma saída estável, o Top P em 1, as duas penalidades em 0 e o Max Tokens em 2048, a menos que você espere respostas longas.
  2. Gere e inspecione. O JSON é válido? O modelo escolheu a ferramenta certa e um argumento sensato?
  3. Refine e depois passe para a execução local. Ajuste a redação até a saída ficar estável e, em seguida, reutilize as mesmas instruções como prompt de sistema no LM Studio ou no Ollama.

💡 Isso testa como um modelo formata chamadas. Não se conecta aos seus servidores MCP, então trate como um ensaio, e não como substituto de uma execução local.

Mantenha sua configuração segura

Mãos encaixando um cabo ethernet azul em um pequeno minicomputador prateado

Um servidor MCP pode executar código, ler arquivos e usar a sua rede. É exatamente isso que o torna útil, e é por isso que a documentação do LM Studio diz para nunca instalar MCPs de fontes não confiáveis.

Defina o escopo de cada pasta

  • Dê ao servidor Filesystem uma pasta por projeto, nunca a raiz de um drive.
  • Trabalhe em uma branch do git sempre que o modelo puder fazer commits.
  • Rode os servidores com um usuário separado do sistema operacional ou em um contêiner, se for possível.
  • Mantenha as confirmações ativadas para qualquer ferramenta que escreva, apague ou envie dados.
  • Evite combinar ferramentas web, como Fetch ou Playwright, com acesso de escrita no mesmo chat, já que uma página hostil poderia direcionar o modelo.

Controle o orçamento de contexto

Verifique quantos tokens suas descrições de ferramentas usam antes de culpar o modelo. Se ele começar a ignorar instruções depois que você adicionar servidores, remova servidores primeiro. Três servidores bem escolhidos superam uma dúzia que tome o espaço da conversa.

Adicione geração de imagens ao seu agente

Pequeno computador de mesa prateado em uma prateleira de carvalho ao lado de uma samambaia e um roteador branco

Modelos locais não desenham, mas um cliente MCP pode acoplar um servidor de imagens hospedado ao lado dos seus servidores locais. O modelo local escreve o prompt e um modelo hospedado o renderiza. O PicassoIA oferece uma API e uma conexão MCP para isso. A API fica em api.picassoia.com/v1 e usa tokens Bearer, e a conexão MCP expõe quatro modelos: o PicassoIA Image para texto para imagem, o PicassoIA Image Editor Pro para edições, e dois modelos de vídeo.

Você configura a conexão na página de MCP da sua conta. No LM Studio, um servidor remoto entra no mcp.json como uma url mais headers, o mesmo padrão que a documentação mostra para outros servidores remotos.

Dois pontos de atenção se aplicam:

  • Privacidade: o prompt sai da sua máquina, então mantenha material privado fora das solicitações de imagem.
  • Limites: as contas permitem 5 predições simultâneas, compartilhadas entre seus tokens de API e conexões MCP. Confira na página de preços qual plano inclui acesso à API e ao MCP antes de montar um fluxo de trabalho em cima disso.

Crie suas próprias imagens no PicassoIA

Você não precisa de um agente completo para tirar proveito dessa configuração. Peça ao seu modelo local três prompts de imagem que descrevam a mesma cena de ângulos diferentes: um plano baixo, um plano de cima e um close. Cole-os no PicassoIA Image e compare os resultados lado a lado.

Depois, escolha o seu favorito e abra-o no PicassoIA Image Editor Pro para ajustar a iluminação, trocar um objeto ou limpar um detalhe. Prompts curtos, com um sujeito claro, uma direção de luz e uma escolha de lente, tendem a gerar os resultados fotográficos mais nítidos.

Experimente com o seu próximo cabeçalho de blog, mockup de produto ou papel de parede de desktop. Quanto mais você testar os prompts que seu modelo local rascunha, mais rápido encontrará uma redação que funciona, e o PicassoIA torna cada rodada barata de repetir.

Compartilhe este artigo

Escolha seu idioma