Mejores servidores MCP para LLM locales en 2027: configuraciones con Ollama, LM Studio y Open WebUI
Los modelos locales son privados, pero solo pueden conversar hasta que les conectas herramientas. Este artículo ordena siete servidores MCP para Ollama, LM Studio y Open WebUI, muestra la configuración de cada cliente, sugiere modelos que llaman herramientas de forma fiable y enumera las reglas de seguridad que mantienen a raya a un agente local.
Los modelos locales son privados y baratos de ejecutar, pero, de serie, solo saben conversar. No pueden leer la carpeta de tu proyecto, revisar un diff de git ni abrir una página web. MCP, el Model Context Protocol, cierra esa brecha al dar a cualquier aplicación compatible una forma estándar de entregar herramientas reales a un modelo. El problema es que una configuración local tiene dos inconvenientes que un chatbot en la nube no tiene: una ventana de contexto más pequeña y un modelo más reducido que falla con más frecuencia al hacer llamadas a herramientas. Por eso, los mejores servidores MCP para LLM locales no son los catálogos más grandes. Son los pocos que son ligeros, predecibles y seguros para dejarlos funcionando en tu propia máquina.
A continuación encontrarás siete servidores que cumplen ese criterio, tres formas de conectarlos a Ollama, LM Studio y Open WebUI, y los errores que hacen que los agentes locales vayan lentos o sean arriesgados.
Por qué los modelos locales necesitan MCP
Qué hace MCP en la práctica
Un servidor MCP es un programa pequeño que anuncia una lista de herramientas: leer un archivo, ejecutar un comando de git, descargar una página. Un cliente MCP, como LM Studio u Open WebUI, muestra esa lista a tu modelo. Cuando el modelo quiere una herramienta, emite una llamada estructurada, el cliente la ejecuta en el servidor y el resultado vuelve a la conversación.
Esa división encaja bien con el uso local. El modelo sigue en tu hardware, el servidor se ejecuta junto a él y nada sale de tu red, salvo que una herramienta llegue por sí misma a la web. Hay dos transportes que aparecen en todas partes:
stdio: el cliente lanza el servidor como proceso hijo en tu máquina. La mayoría de los servidores de referencia funcionan así.
Streamable HTTP: el servidor se ejecuta como servicio web, que es lo que esperan aplicaciones basadas en navegador como Open WebUI.
Dónde flaquean los modelos pequeños
Un modelo de 7 a 20 000 millones de parámetros puede llamar a herramientas, pero es menos indulgente que un modelo de vanguardia. Puede elegir la herramienta equivocada, inventar un argumento o quedarse en bucle repitiendo la misma llamada. Cada herramienta que expone un servidor se describe en el prompt, así que diez servidores pueden ocupar gran parte de una ventana de contexto modesta antes de que escribas una sola palabra.
💡 Regla general: activa tres o cuatro servidores por chat, no doce. La documentación de LM Studio advierte de que los servidores creados para Claude o ChatGPT pueden consumir muchos tokens y lastrar a un modelo local.
Elige primero el cliente
El cliente decide qué servidores puedes usar y cuánta configuración tendrás que hacer. Tres opciones explican la mayoría de las configuraciones locales, y cada una trata MCP de forma distinta.
LM Studio: la ruta más rápida
LM Studio añadió compatibilidad con MCP en la versión 0.3.17 y gestiona tanto servidores locales como remotos. Abre la pestaña Program en la barra lateral derecha, elige Install y después Edit mcp.json. El archivo sigue la notación de Cursor, así que las configuraciones copiadas de otras herramientas suelen pegarse tal cual.
Los servidores remotos usan un url y, opcionalmente, headers en lugar de un comando. Cuando pegues una configuración que hayas encontrado en internet, copia solo el contenido que va dentro de "mcpServers": { ... }; si no, las llaves anidadas romperán el archivo.
💡 Los servidores que se lanzan con npx necesitan Node.js, y los que se lanzan con uvx necesitan uv. Es fácil pasar por alto un entorno de ejecución que falta cuando un servidor recién añadido no muestra herramientas.
Ollama más un puente
Ollama ejecuta modelos y admite llamadas a herramientas, pero no habla MCP por sí solo. Necesitas un cliente intermedio que liste las herramientas y las traduzca al formato de herramientas de Ollama. Tus opciones:
ollmcp (MCP Client for Ollama): una aplicación de terminal que conecta modelos de Ollama con servidores MCP mediante stdio, SSE y Streamable HTTP, con un modo agente y un paso de confirmación con supervisión humana antes de ejecutar herramientas. Instálala con uv tool install --upgrade ollmcp.
MCPHost: un favorito anterior que ya no tiene mantenimiento activo, y se indica que su sucesor es Kit.
ollama-mcp-bridge: un proyecto de puente de la comunidad para quien prefiera un envoltorio más ligero.
Elige ollmcp si pasas la mayor parte del tiempo en la terminal. Mantén activadas sus confirmaciones mientras haces pruebas. No todos los modelos de Ollama admiten herramientas, y la biblioteca de Ollama etiqueta los que sí, así que filtra por esa etiqueta antes de descargar un modelo.
Open WebUI y Streamable HTTP
Open WebUI admite MCP de forma nativa desde la versión 0.6.31, pero solo mediante Streamable HTTP, porque es una aplicación web para varios usuarios y no un proceso de escritorio. Un administrador añade un servidor en Settings > Admin > Integrations, elige + Add Connection y establece el tipo en MCP (Streamable HTTP). Los usuarios normales no pueden registrar sus propios servidores, una decisión de seguridad deliberada.
Para los servidores stdio, ejecútalos detrás de mcpo, un proxy que convierte servidores stdio o SSE en endpoints de OpenAPI:
Después, añade la URL resultante como servidor de herramientas OpenAPI. Si ejecutas Open WebUI con Docker, define la variable de entorno WEBUI_SECRET_KEY. Sin ella, las herramientas conectadas con OAuth se rompen cada vez que se reinicia el contenedor.
Los mejores servidores MCP, ordenados
Estos siete están ordenados según cuánto aportan a una configuración local típica por cada token de contexto que usan. Seis proceden de la colección oficial de referencia, que mantiene actualmente Everything, Fetch, Filesystem, Git, Memory, Sequential Thinking y Time. El séptimo, Playwright, es de Microsoft.
Filesystem
El que casi todo el mundo instala primero. Da al modelo herramientas para leer, escribir, listar y buscar archivos, limitadas a las carpetas que pases como argumentos. Apúntalo a una bóveda de notas, a una carpeta de documentos o a un único repositorio, nunca a todo tu directorio personal. Sirve para tareas como resumir notas de reuniones, renombrar un lote de archivos o redactar un README a partir del código fuente.
Git
Ejecutado con uvx mcp-server-git, permite a un modelo leer el estado, los diffs y el historial, y crear commits. Es compacto y se comporta bien, lo que lo convierte en una buena opción para modelos de la clase 8B. Pide un mensaje de commit basado en los cambios en el área de preparación y el modelo tendrá todo lo necesario en una sola llamada.
Fetch
Fetch descarga una URL y convierte la página a markdown para que quepa en una ventana de contexto. En muchas configuraciones locales es la única vía a la web en vivo que no requiere cuenta ni token. Trata cada página descargada como texto no fiable. Una página puede contener instrucciones dirigidas a tu modelo, un problema conocido como inyección de prompts.
Memory
Una memoria de grafo de conocimiento que almacena entidades, relaciones y observaciones en un archivo local, para que el modelo recuerde datos entre chats. Es una de las formas más baratas de hacer que un modelo pequeño resulte coherente. Haz copias de seguridad de ese archivo y revísalo de vez en cuando, porque el modelo decide qué se guarda. Un prompt de sistema breve que indique cuándo guardar un dato y cuándo recuperarlo ayuda, ya que los modelos pequeños tienden a guardarlo todo o nada.
Playwright
El @playwright/mcp de Microsoft maneja un navegador real a través de instantáneas de accesibilidad en lugar de capturas de pantalla, así que un modelo local solo de texto puede hacer clic y escribir sin un modelo de visión. Es el servidor más pesado de la lista y el más arriesgado, porque un navegador puede llegar a todo lo que alcanza tu red. Usa un perfil de navegador dedicado y mantén las confirmaciones activadas.
Sequential Thinking
Da al modelo una forma estructurada de dividir un problema en pensamientos numerados, revisarlos y bifurcarlos. Puede ofrecer a un modelo pequeño un andamiaje para tareas de varios pasos. Los modelos que ya razonan de forma nativa quizá no lo necesiten, así que prueba con y sin él.
El séptimo de la lista, Time, es un servidor diminuto para la hora actual y la conversión entre zonas horarias. Importa más de lo que parece, ya que un modelo local no tiene reloj.
¿Cuáles tres activar primero? Para programar, prueba Filesystem, Git y Sequential Thinking. Para investigación y notas, combina Fetch con Memory y Time. Para automatización del navegador, ejecuta Playwright por separado para que su lista de herramientas tenga toda la ventana de contexto para sí.
💡 Los servidores para SQLite, PostgreSQL, GitHub, Brave Search y Puppeteer solían estar en la colección de referencia, pero ahora están en un archivo. Busca una alternativa mantenida antes de depender de uno.
Modelos que llaman bien a las herramientas
Un servidor excelente se desaprovecha con un modelo que no sabe dar formato a una llamada a herramienta. Las familias que la gente suele recomendar para llamadas a herramientas en local incluyen Qwen, Llama 3.1 y versiones posteriores, y Codestral. Hay otros dos que merece la pena probar. GPT OSS 20B es un modelo de pesos abiertos que OpenAI creó pensando en trabajo agéntico, como las llamadas a funciones, y OpenAI afirma que funciona con 16 GB de memoria. Granite 4.1 8B es la opción compacta de IBM para GPU de gama media.
Ambos están disponibles como modelos alojados en PicassoIA, lo que significa que puedes ensayar prompts allí antes de descargar ningún peso. Esas ejecuciones alojadas ocurren en los servidores de PicassoIA, no en tu máquina.
Qué buscar
Llamadas nativas a herramientas: revisa la ficha del modelo para comprobar que el chat template admite herramientas. Si no lo admite, el cliente recurre a trucos poco fiables en el prompt.
Longitud de contexto: apunta a entre 16K y 32K tokens para que quepan los esquemas de herramientas, los resultados y toda la conversación.
Cuantización: las versiones de menor cantidad de bits ahorran memoria, pero pueden hacer que el formato de los argumentos sea menos fiable. Si las llamadas empiezan a fallar, prueba un archivo de más bits.
Temperatura baja: entre 0,1 y 0,3 mantiene estables los argumentos JSON.
Usa GPT OSS 20B en PicassoIA
Antes de descargar nada, puedes comprobar cómo un modelo da formato a sus llamadas a herramientas. Esto lleva unos dos minutos.
Abre la página del modelo. Ve a GPT OSS 20B en PicassoIA. No se requiere ningún parámetro, así que solo necesitas un prompt.
Escribe un prompt al estilo de herramienta. Enumera algunas herramientas con sus argumentos y luego plantea una tarea:
You can call these tools. Reply with JSON only.
read_file(path), list_directory(path), git_diff(repo)
Task: show me what changed in the notes folder today.
Define los parámetros. Deja Temperature en su valor predeterminado de 0,1 para una salida estable, Top P en 1, ambas penalizaciones en 0 y Max Tokens en 2048, salvo que esperes respuestas largas.
Genera y revisa. ¿El JSON es válido? ¿Eligió la herramienta correcta y un argumento sensato?
Refina y luego llévalo a local. Ajusta la redacción hasta que la salida sea estable y después reutiliza las mismas instrucciones como prompt de sistema en LM Studio u Ollama.
💡 Esto prueba cómo un modelo da formato a las llamadas. No se conecta a tus servidores MCP, así que tómalo como un ensayo y no como sustituto de una ejecución local.
Mantén tu configuración segura
Un servidor MCP puede ejecutar código, leer archivos y usar tu red. Justo por eso es útil, y por eso la documentación de LM Studio dice que nunca instales MCP de fuentes no fiables.
Limita cada carpeta
Da al servidor Filesystem una carpeta por proyecto, nunca la raíz de una unidad.
Trabaja en una rama de git siempre que el modelo pueda hacer commits.
Ejecuta los servidores con un usuario del sistema operativo separado o en un contenedor si puedes.
Mantén las confirmaciones activadas para cualquier herramienta que escriba, borre o envíe datos.
Evita combinar herramientas web como Fetch o Playwright con acceso de escritura en el mismo chat, ya que una página hostil podría dirigir al modelo.
Vigila el presupuesto de contexto
Comprueba cuántos tokens consumen las descripciones de tus herramientas antes de culpar al modelo. Si empieza a ignorar instrucciones después de añadir servidores, quita primero servidores. Tres servidores bien elegidos superan a una docena que desplazan la conversación.
Añade generación de imágenes a tu agente
Los modelos locales no saben dibujar, pero un cliente MCP puede añadir un servidor de imágenes alojado junto a los locales. El modelo local escribe el prompt y un modelo alojado lo renderiza. PicassoIA ofrece una API y una conexión MCP para esto. La API está en api.picassoia.com/v1 y usa tokens Bearer, y la conexión MCP expone cuatro modelos: PicassoIA Image para texto a imagen, PicassoIA Image Editor Pro para ediciones y dos modelos de video.
Configuras la conexión desde la página MCP de tu cuenta. En LM Studio, un servidor remoto se añade a mcp.json como url más headers, el mismo patrón que muestra la documentación para otros servidores remotos.
Se aplican dos advertencias:
Privacidad: el prompt sale de tu máquina, así que mantén el material privado fuera de las solicitudes de imagen.
Límites: las cuentas permiten 5 predicciones simultáneas, compartidas entre tus tokens de API y tus conexiones MCP. Consulta la página de precios para saber qué plan incluye acceso a la API y a MCP antes de construir un flujo de trabajo sobre ello.
Crea tus propias imágenes en PicassoIA
No necesitas un agente completo para beneficiarte de esta configuración. Pide a tu modelo local tres prompts de imagen que describan la misma escena desde distintos ángulos: un plano bajo, un plano cenital y un primer plano. Pégalos en PicassoIA Image y compara los resultados lado a lado.
Después, elige tu favorita y ábrela en PicassoIA Image Editor Pro para ajustar la iluminación, cambiar un objeto o limpiar un detalle. Los prompts cortos, con un sujeto claro, una dirección de luz y una elección de objetivo, suelen dar los resultados fotográficos más nítidos.
Pruébalo con tu próxima cabecera de blog, maqueta de producto o fondo de escritorio. Cuanto más experimentes con los prompts que redacta tu modelo local, antes encontrarás una redacción que funcione, y PicassoIA hace que cada ronda sea barata de repetir.