Meilleurs serveurs MCP pour LLM locaux en 2027 : configurations Ollama, LM Studio et Open WebUI
Les modèles locaux sont privés, mais ils ne peuvent que discuter tant que vous ne leur ajoutez pas d’outils. Cet article classe sept serveurs MCP pour Ollama, LM Studio et Open WebUI, présente la configuration de chaque client, suggère des modèles qui appellent les outils de façon fiable et énumère les règles de sécurité qui gardent un agent local sous contrôle.
Les modèles locaux sont privés et peu coûteux à faire tourner, mais par défaut ils ne peuvent que discuter. Ils ne peuvent pas lire le dossier de votre projet, examiner un diff git ni ouvrir une page web. MCP, le Model Context Protocol, comble cette lacune en donnant à toute application compatible une manière standard de confier de vrais outils à un modèle. Le piège, c’est qu’une configuration locale présente deux problèmes qu’un chatbot dans le cloud n’a pas : une fenêtre de contexte plus petite, et un modèle plus petit qui se trompe plus souvent dans ses appels d’outils. Les meilleurs serveurs MCP pour les LLM locaux ne sont donc pas les catalogues les plus volumineux. Ce sont les quelques-uns qui sont légers, prévisibles et sûrs à laisser tourner sur votre propre machine.
Vous trouverez ci-dessous sept serveurs qui répondent à ce critère, trois façons de les connecter à Ollama, LM Studio et Open WebUI, ainsi que les erreurs qui rendent les agents locaux lents ou risqués.
Pourquoi les modèles locaux ont besoin de MCP
Ce que fait MCP en pratique
Un serveur MCP est un petit programme qui annonce une liste d’outils : lire un fichier, exécuter une commande git, récupérer une page. Un client MCP, comme LM Studio ou Open WebUI, présente cette liste à votre modèle. Lorsque le modèle veut utiliser un outil, il émet un appel structuré, le client l’exécute sur le serveur, et le résultat revient dans la conversation.
Ce fonctionnement convient à un usage local. Le modèle reste sur votre matériel, le serveur tourne à côté, et rien ne quitte votre réseau, sauf si un outil lui-même accède au web. Deux transports reviennent partout :
stdio : le client lance le serveur comme processus enfant sur votre machine. La plupart des serveurs de référence fonctionnent ainsi.
Streamable HTTP : le serveur tourne comme un service web, ce qu’attendent les applications dans le navigateur comme Open WebUI.
Là où les petits modèles peinent
Un modèle de 7 à 20 milliards de paramètres peut appeler des outils, mais il est moins indulgent qu’un modèle de pointe. Il peut choisir le mauvais outil, inventer un argument ou tourner en boucle sur le même appel. Chaque outil exposé par un serveur est décrit dans le prompt, si bien que dix serveurs peuvent avaler une grande partie d’une fenêtre de contexte modeste avant même que vous ayez tapé un mot.
💡 Règle empirique : activez trois ou quatre serveurs par conversation, pas douze. La documentation de LM Studio avertit que les serveurs conçus pour Claude ou ChatGPT peuvent consommer beaucoup de tokens et ralentir un modèle local.
Choisir d’abord le client
Le client détermine quels serveurs vous pouvez utiliser et la complexité de la configuration. Trois options couvrent l’essentiel des configurations locales, et chacune traite MCP différemment.
LM Studio : la voie la plus rapide
LM Studio a ajouté la prise en charge de MCP dans la version 0.3.17 et gère à la fois les serveurs locaux et distants. Ouvrez l’onglet Program dans la barre latérale droite, choisissez Install, puis Edit mcp.json. Le fichier suit la notation de Cursor, donc les configurations copiées depuis d’autres outils se collent généralement telles quelles.
Les serveurs distants utilisent une url et, éventuellement, des headers au lieu d’une commande. Lorsque vous collez une configuration trouvée en ligne, copiez uniquement le contenu situé à l’intérieur de "mcpServers": { ... }, sinon les accolades imbriquées casseront le fichier.
💡 Les serveurs lancés avec npx nécessitent Node.js, et ceux lancés avec uvx ont besoin de uv. Un environnement d’exécution manquant passe facilement inaperçu lorsqu’un serveur fraîchement ajouté n’affiche aucun outil.
Ollama plus un pont
Ollama fait tourner des modèles et gère l’appel d’outils, mais il ne parle pas MCP par lui-même. Il vous faut un client intermédiaire qui liste les outils et les traduit dans le format d’outils d’Ollama. Vos options :
ollmcp (MCP Client for Ollama) : une application de terminal qui connecte les modèles Ollama aux serveurs MCP via stdio, SSE et Streamable HTTP, avec un mode agent et une étape de confirmation humaine avant l’exécution des outils. Installez-la avec uv tool install --upgrade ollmcp.
MCPHost : un ancien favori qui n’est plus activement maintenu, Kit étant désigné comme son successeur.
ollama-mcp-bridge : un projet de pont communautaire pour ceux qui préfèrent un wrapper plus léger.
Choisissez ollmcp si vous travaillez dans le terminal. Gardez ses demandes de confirmation activées pendant vos tests. Tous les modèles Ollama ne prennent pas en charge les outils, et la bibliothèque Ollama signale ceux qui le font par un tag : filtrez sur ce tag avant de télécharger un modèle.
Open WebUI et Streamable HTTP
Open WebUI prend en charge MCP nativement à partir de la version 0.6.31, mais uniquement via Streamable HTTP, car c’est une application web destinée à plusieurs utilisateurs et non un processus de bureau. Un administrateur ajoute un serveur dans Settings > Admin > Integrations, choisit + Add Connection et règle le type sur MCP (Streamable HTTP). Les utilisateurs standard ne peuvent pas enregistrer leurs propres serveurs, un choix de sécurité délibéré.
Pour les serveurs stdio, lancez-les derrière mcpo, un proxy qui transforme les serveurs stdio ou SSE en points de terminaison OpenAPI :
Ajoutez ensuite l’URL obtenue comme serveur d’outils OpenAPI. Si vous exécutez Open WebUI dans Docker, définissez la variable d’environnement WEBUI_SECRET_KEY. Sans elle, les outils connectés par OAuth cessent de fonctionner à chaque redémarrage du conteneur.
Les meilleurs serveurs MCP, classés
Ces sept serveurs sont classés selon ce qu’ils apportent à une configuration locale type, par token de contexte consommé. Six proviennent de la collection de référence officielle, qui maintient actuellement Everything, Fetch, Filesystem, Git, Memory, Sequential Thinking et Time. Le septième, Playwright, est celui de Microsoft.
Filesystem
Celui que presque tout le monde installe en premier. Il donne au modèle des outils pour lire, écrire, lister et rechercher des fichiers, limités aux dossiers que vous passez en arguments. Pointez-le vers un coffre de notes, un dossier de documentation ou un seul dépôt, jamais vers l’ensemble de votre répertoire personnel. Il gère des tâches comme résumer des comptes rendus de réunion, renommer un lot de fichiers ou rédiger un README à partir du code source.
Git
Lancé avec uvx mcp-server-git, il permet à un modèle de lire le statut, les diffs et l’historique, et de créer des commits. Il est compact et se comporte bien, ce qui en fait un bon choix pour les modèles de la catégorie 8B. Demandez un message de commit à partir du diff indexé et le modèle dispose de tout ce qu’il lui faut en un seul appel.
Fetch
Fetch récupère une URL et convertit la page en markdown pour qu’elle tienne dans une fenêtre de contexte. Pour beaucoup de configurations locales, c’est la seule voie vers le web en direct qui ne nécessite ni compte ni token. Traitez chaque page récupérée comme un texte non fiable. Une page peut contenir des instructions destinées à votre modèle, un problème connu sous le nom d’injection de prompt.
Memory
Une mémoire sous forme de graphe de connaissances qui stocke entités, relations et observations dans un fichier local, afin que le modèle puisse se souvenir de faits entre les conversations. C’est l’un des moyens les moins coûteux de donner une impression de cohérence à un petit modèle. Sauvegardez ce fichier et jetez-y un œil de temps en temps, car c’est le modèle qui décide de ce qui y est enregistré. Un court prompt système qui indique quand enregistrer un fait et quand le rappeler aide, car les petits modèles ont tendance à tout sauvegarder ou à ne rien sauvegarder.
Playwright
Le @playwright/mcp de Microsoft pilote un vrai navigateur à partir d’instantanés d’accessibilité plutôt que de captures d’écran, si bien qu’un modèle local qui ne traite que du texte peut cliquer et saisir sans modèle de vision. C’est le serveur le plus lourd de la liste et le plus risqué, car un navigateur peut atteindre tout ce que votre réseau peut atteindre. Utilisez un profil de navigateur dédié et gardez les confirmations activées.
Sequential Thinking
Il donne au modèle une manière structurée de décomposer un problème en pensées numérotées, de les réviser et de les ramifier. Cela peut offrir à un petit modèle un cadre pour les tâches en plusieurs étapes. Les modèles qui raisonnent déjà nativement n’en ont pas forcément besoin, alors testez avec et sans.
Le septième choix, Time, est un minuscule serveur qui fournit l’heure actuelle et convertit les fuseaux horaires. Il compte davantage qu’il n’y paraît, puisqu’un modèle local n’a pas d’horloge.
Lesquels activer en premier ? Pour le code, essayez Filesystem, Git et Sequential Thinking. Pour la recherche et les notes, associez Fetch à Memory et Time. Pour l’automatisation du navigateur, lancez Playwright seul afin que sa liste d’outils dispose à elle seule de la fenêtre de contexte.
💡 Les serveurs pour SQLite, PostgreSQL, GitHub, Brave Search et Puppeteer figuraient dans la collection de référence, mais se trouvent désormais dans une archive. Cherchez une alternative maintenue avant d’en dépendre.
Des modèles qui savent bien appeler des outils
Un excellent serveur est gâché avec un modèle incapable de formater un appel d’outil. Les familles souvent recommandées pour l’appel d’outils en local incluent Qwen, Llama 3.1 et les versions plus récentes, ainsi que Codestral. Deux autres méritent d’être testés. GPT OSS 20B est un modèle à poids ouverts qu’OpenAI a conçu en pensant aux tâches agentiques comme l’appel de fonctions, et OpenAI indique qu’il fonctionne avec 16 Go de mémoire. Granite 4.1 8B est l’option compacte d’IBM pour les GPU de milieu de gamme.
Les deux sont disponibles en modèles hébergés sur PicassoIA, ce qui vous permet de tester vos prompts avant de télécharger quoi que ce soit. Ces exécutions hébergées ont lieu sur les serveurs de PicassoIA, pas sur votre machine.
Ce qu’il faut rechercher
Appel d’outils natif : vérifiez dans la fiche du modèle la prise en charge des outils dans le template de chat. Sans cela, le client se replie sur des astuces de prompt peu fiables.
Longueur de contexte : visez 16K à 32K tokens pour que les schémas d’outils, les résultats et la conversation tiennent tous.
Quantification : les versions à faible précision économisent de la mémoire, mais peuvent rendre le formatage des arguments moins fiable. Si les appels commencent à échouer, essayez un fichier à plus haute précision.
Température basse : 0,1 à 0,3 garde les arguments JSON stables.
Utiliser GPT OSS 20B sur PicassoIA
Avant de télécharger quoi que ce soit, vous pouvez vérifier comment un modèle formate ses appels d’outils. Cela prend environ deux minutes.
Ouvrez la page du modèle. Rendez-vous sur GPT OSS 20B sur PicassoIA. Aucun paramètre n’est obligatoire, il vous suffit donc d’un prompt.
Rédigez un prompt de type outil. Listez quelques outils avec leurs arguments, puis donnez une tâche :
You can call these tools. Reply with JSON only.
read_file(path), list_directory(path), git_diff(repo)
Task: show me what changed in the notes folder today.
Réglez les paramètres. Gardez Temperature à sa valeur par défaut de 0,1 pour une sortie stable, Top P à 1, les deux pénalités à 0 et Max Tokens à 2048, sauf si vous attendez de longues réponses.
Générez et inspectez. Le JSON est-il valide ? Le modèle a-t-il choisi le bon outil et un argument cohérent ?
Affinez, puis transférez-le. Ajustez la formulation jusqu’à obtenir une sortie stable, puis réutilisez les mêmes instructions comme prompt système dans LM Studio ou Ollama.
💡 Ceci teste la manière dont un modèle formate les appels. Cela ne se connecte pas à vos serveurs MCP, considérez-le donc comme une répétition et non comme un remplacement d’une exécution locale.
Protéger votre configuration
Un serveur MCP peut exécuter du code, lire des fichiers et utiliser votre réseau. C’est précisément ce qui le rend utile, et pourquoi la documentation de LM Studio recommande de ne jamais installer de MCP provenant de sources non fiables.
Limiter chaque dossier
Donnez au serveur Filesystem un dossier par projet, jamais la racine d’un disque.
Travaillez sur une branche git dès que le modèle peut effectuer des commits.
Lancez les serveurs sous un utilisateur système distinct ou dans un conteneur si vous le pouvez.
Gardez les confirmations activées pour tout outil qui écrit, supprime ou envoie des données.
Évitez d’associer des outils web comme Fetch ou Playwright à un accès en écriture dans la même conversation, car une page malveillante pourrait orienter le modèle.
Surveiller le budget de contexte
Vérifiez combien de tokens vos descriptions d’outils consomment avant d’accuser le modèle. S’il commence à ignorer les instructions après l’ajout de serveurs, retirez d’abord des serveurs. Trois serveurs bien choisis valent mieux qu’une douzaine qui encombrent la conversation.
Ajouter la génération d’images à votre agent
Les modèles locaux ne savent pas dessiner, mais un client MCP peut ajouter un serveur d’images hébergé à côté de vos serveurs locaux. Le modèle local rédige le prompt et un modèle hébergé en génère le rendu. PicassoIA propose une API et une connexion MCP pour cela. L’API se trouve à api.picassoia.com/v1 et utilise des tokens Bearer, et la connexion MCP expose quatre modèles : PicassoIA Image pour le texte vers image, PicassoIA Image Editor Pro pour les retouches, et deux modèles vidéo.
Vous configurez la connexion depuis la page MCP de votre compte. Dans LM Studio, un serveur distant se place dans mcp.json sous la forme d’une url plus headers, le même schéma que la documentation présente pour les autres serveurs distants.
Deux précautions s’appliquent :
Confidentialité : le prompt quitte votre machine, donc n’incluez pas de contenu privé dans les demandes d’images.
Limites : les comptes autorisent 5 prédictions simultanées, partagées entre vos tokens API et vos connexions MCP. Consultez la page tarifs pour savoir quel forfait inclut l’accès à l’API et à MCP avant de bâtir un flux de travail autour.
Créer vos propres images sur PicassoIA
Vous n’avez pas besoin d’un agent complet pour profiter de cette configuration. Demandez à votre modèle local trois prompts d’image décrivant la même scène sous des angles différents : une contre-plongée, une vue de dessus et un gros plan. Collez-les dans PicassoIA Image et comparez les résultats côte à côte.
Choisissez ensuite votre préféré et ouvrez-le dans PicassoIA Image Editor Pro pour ajuster l’éclairage, remplacer un objet ou corriger un détail. Les prompts courts avec un sujet clair, une direction de lumière et un choix d’objectif donnent en général les résultats photographiques les plus nets.
Essayez avec votre prochain en-tête de blog, maquette de produit ou fond d’écran de bureau. Plus vous expérimenterez les prompts que votre modèle local rédige, plus vite vous trouverez une formulation qui fonctionne, et PicassoIA rend chaque essai peu coûteux à répéter.