Electrosens R&D
Electrosens LLM auto hébergées · 17 September 2026

LLM open source chez soi en 2026 : le guide complet des runtimes pour ne pas se ruiner

En septembre 2026, faire tourner un LLM chez soi n’est plus un fantasme de geek fortuné : les runtimes open-source ont mûri, les modèles open-weight ont explosé en qualité — jusqu’au géant Kimi K3 de 2,8 billions de paramètres — et le coût du matériel a enfin cessé de grimper. Mais entre Ollama, vLLM, llama.cpp, MLX, LM Studio et le nouveau venu FreeToken, le choix peut donner le tournis. Ce comparatif approfondi vous aide à trancher selon votre budget et votre usage, sans vous ruiner.

2026 : l’année où l’IA locale a cessé d’être un luxe

Il y a encore deux ans, exécuter un modèle 70B chez soi relevait de la quadrature du cercle : il fallait aligner plusieurs GPU professionnels à plusieurs milliers d’euros, ou se contenter de modèles 7B aux capacités limitées. En 2026, la donne a changé. Les modèles open-weight comme Llama 4 Scout, Gemma 4 E4B, DeepSeek V4 Flash et Mistral Medium 3.5 ont atteint un niveau de qualité qui les rend utilisables pour des tâches réelles, et les runtimes d’inférence ont fait des bonds de géant en matière d’efficacité mémoire.

Le contexte économique a accéléré le mouvement. Les coûts d’API cloud ont continué d’augmenter, poussant de nombreux développeurs et petites entreprises à chercher des alternatives locales. Selon une enquête récente, 45,5 % des décideurs IA citent les coûts élevés comme principale barrière à l’adoption du cloud. Parallèlement, les techniques de quantification se sont affinées : le GGUF en Q4_K_M est devenu un standard de facto, et des innovations comme TurboQuant — la compression vectorielle de Google présentée à l’ICLR 2026 à Singapour le 25 avril, qui réduit la mémoire du KV-cache d’un facteur 6 — promettent de faire tourner des modèles toujours plus gros sur des machines toujours plus modestes. Le CEO de Cloudflare, Matthew Prince, l’a même qualifiée de « moment DeepSeek de Google ».

Et l’actualité de l’été a rebattu les cartes. Le 27 juillet 2026, Moonshot AI a publié les poids complets de Kimi K3 sur Hugging Face : un modèle MoE de 2,8 billions de paramètres avec un contexte d’un million de tokens, sous licence personnalisée avec un seuil de 20 M$ de revenus pour le MaaS. C’est le plus gros modèle open-weight jamais mis en ligne — mais avec 1,56 To de poids et une recommandation de 64+ accélérateurs, il reste hors de portée du particulier. En revanche, DSpark, le framework de décodage spéculatif semi-autorégressif de DeepSeek publié en juillet 2026, promet d’accélérer l’inférence de 60 à 85 % sans réentraînement — une aubaine pour les configurations modestes.

Enfin, FreeToken a fait une entrée fracassante fin août : ce moteur d’inférence open-source permet d’exécuter des modèles MoE massifs (jusqu’à 753 milliards de paramètres) sur un seul GPU grand public, avec des performances annoncées jusqu’à 3 fois supérieures à Ollama. Une révolution pour ceux qui veulent faire tourner des modèles de pointe sans vendre un rein.

Résultat : en septembre 2026, six runtimes dominent le paysage — Ollama, vLLM, llama.cpp, MLX, LM Studio et FreeToken — et chacun a publié des mises à jour majeures qui réduisent la barrière du coût matériel. Mais tous ne se valent pas selon votre profil. C’est ce que nous allons disséquer.

Les six prétendants : Ollama, vLLM, llama.cpp, MLX, LM Studio, FreeToken

Chacun de ces outils a une philosophie différente, née de son histoire et de son public cible. Une distinction fondamentale s’impose d’emblée : Ollama et LM Studio sont des couches d’expérience qui enveloppent des moteurs ; llama.cpp, MLX et FreeToken sont des moteurs purs ; vLLM est un système de service conçu pour la production multi-utilisateurs.

Source : codersera.com

Ollama est le champion de la simplicité. Son installation en une commande, son API compatible OpenAI et sa gestion automatique des modèles en font la porte d’entrée idéale pour les débutants. En mai 2026, Ollama a enchaîné cinq versions point (0.23.0 à 0.23.4) et une version mineure (0.24.0) en seulement 11 jours — un rythme effréné qui montre son dynamisme, mais aussi une certaine frénésie. La version 0.23.1, publiée le 5 mai, a ajouté le décodage spéculatif Gemma 4 MTP via le runner MLX sur Apple Silicon, avec un gain de vitesse de plus de 2x sur les tâches de codage avec Gemma 4 31B. La 0.23.0 avait introduit un support de Claude Desktop, retiré dès la 0.23.2 car limité aux modèles Anthropic — un aller-retour qui illustre les tâtonnements du projet. Depuis le début de l’année, Ollama utilise d’ailleurs le moteur MLX sur Apple Silicon au lieu de l’ancien chemin Metal de llama.cpp — un changement qui, selon les benchmarks internes d’Ollama, double presque le débit de décodage (chiffre constructeur, mais directionnellement réel).

vLLM est le poids lourd de la production. Conçu pour les déploiements multi-utilisateurs sur GPU, il utilise PagedAttention et le continuous batching pour atteindre des débits spectaculaires. Sa version v0.21.0, sortie en mai 2026, a stabilisé DeepSeek V4 sur les GPU Blackwell avec un nouveau backend TOKENSPEED_MLA, et a ajouté le respect des budgets de raisonnement au décodage spéculatif. C’est l’outil des serveurs, des API et des équipes qui ont besoin de concurrence élevée. Il est aussi le runtime de référence pour servir Kimi K3 en auto-hébergement, comme le montrent les guides de déploiement publiés fin juillet.

llama.cpp est le vétéran fondateur, un moteur C++ sous licence MIT qui a ouvert la voie à l’inférence locale sur CPU et Apple Silicon. En avril 2026, une refonte majeure a été fusionnée dans la branche principale — presque sans tambour ni trompette. Cette réécriture, qui remplace l’ancien noyau ggml par un générateur de kernels, un KV cache contigu et un dispatch unifié, promet des gains de 2,1x sur les modèles 70B et de 1,4x sur les 7B, selon les benchmarks préliminaires. En mai 2026, il a fusionné le support Qwen 3.6 MTP (PR #22673) et publié des prebuilts Windows CUDA 13.1 au build b9196. Sa communauté est extrêmement active, avec des améliorations continues — un fil Reddit r/LocalLLM s’intitule d’ailleurs « Llama.cpp is getting better with every update ».

MLX est la solution taillée pour l’écosystème Apple. Développé par l’équipe de machine learning d’Apple, il exploite la mémoire unifiée des puces M-series et les Neural Accelerators. La version 0.31.x, couplée à macOS 26.2, débloque les Neural Accelerators M5 pour un time-to-first-token (TTFT) jusqu’à 4x plus rapide. C’est l’outil de choix pour les possesseurs de Mac. Selon les benchmarks rapportés, le moteur MLX est environ 3 fois plus rapide que le chemin Metal de llama.cpp sur Mac.

LM Studio est l’interface graphique grand public par excellence. Avec son navigateur de modèles Hugging Face intégré et sa configuration en quelques clics, il attire ceux qui veulent éviter le terminal. Les versions 0.4.13 et 0.4.14 de mai 2026 ont ajouté les prédictions vision parallèles et promu le décodage spéculatif MTP en stable. Il propose aussi un serveur OpenAI-compatible sur localhost:1234 et un mode headless pour les déploiements légers.

FreeToken est le nouveau venu qui bouscule le marché. Présenté fin août 2026, ce moteur d’inférence open-source (dépôt GitHub FlashML, article arXiv 2608.16157) vise spécifiquement les modèles Mixture of Experts (MoE) sur GPU grand public. Son approche : faire résider le modèle en RAM système plutôt qu’en VRAM, avec un cache LRU et un double buffering pour minimiser les transferts PCIe. Les benchmarks annoncés font état de performances jusqu’à 3 fois supérieures à Ollama pour les MoE massifs, et la possibilité d’exécuter un modèle de 753 milliards de paramètres sur une seule carte. Des chiffres à prendre avec précaution (voir section Benchmarks), mais qui ouvrent des perspectives alléchantes.

Runtime Version (mai 2026) Philosophie Public cible
Ollama 0.23.x → 0.24.0 Simplicité maximale, CLI + API Débutants, prototypage rapide
vLLM v0.21.0 Performance de production, haute concurrence Serveurs, API, équipes
llama.cpp b9196 (réécriture avril 2026) Moteur C++ fondateur, flexibilité totale Développeurs, bricoleurs
MLX 0.31.x Optimisé Apple Silicon, mémoire unifiée Utilisateurs Mac
LM Studio 0.4.13 / 0.4.14 Interface graphique complète Grand public, non-techniciens
FreeToken 0.1.x (août 2026) MoE sur GPU grand public, RAM système Utilisateurs GPU modestes, MoE massifs

Sous le capot : comment chaque moteur économise votre VRAM

La clé pour ne pas se ruiner, c’est la gestion de la mémoire. Voici comment chaque runtime s’y prend.

llama.cpp est le cœur C++ qui a popularisé la quantification GGUF. Son approche est directe : il charge les poids en mémoire avec la précision la plus basse possible (Q4_K_M est le standard), et peut décharger une partie des couches vers le CPU quand la VRAM manque. Cette flexibilité permet de faire tourner un modèle 70B sur une machine avec 24 Go de VRAM et beaucoup de RAM, au prix d’une latence accrue. La réécriture d’avril 2026 a introduit un KV cache contigu qui réduit la fragmentation mémoire — l’ancien système se dégradait nettement au-delà de 8K tokens de contexte. Le support de TurboQuant (la compression du KV-cache de Google) est en cours d’intégration via un fork non officiel, avec la rotation Hadamard déjà intégrée — de quoi réduire encore la mémoire nécessaire pour les longues fenêtres de contexte.

vLLM utilise PagedAttention, une technique qui découpe le KV-cache en pages et les gère comme la mémoire virtuelle d’un OS. Cela élimine la fragmentation : là où llama.cpp et Ollama perdent par défaut 30 à 50 % de VRAM à cause de la fragmentation du KV-cache, vLLM maintient cette perte sous 4 %. Combiné au continuous batching (qui traite plusieurs requêtes simultanément), cela explique son débit 16 à 20 fois supérieur à celui d’Ollama en concurrence. Mais cette efficacité a un coût : vLLM est plus complexe à configurer et exige un GPU NVIDIA avec une VRAM correcte pour briller.

MLX tire parti de la mémoire unifiée des puces Apple. Sur un MacBook Pro M-series, le CPU, le GPU et les Neural Accelerators partagent la même mémoire, ce qui élimine les copies entre VRAM et RAM. Un modèle 70B en Q4_K_M peut ainsi tourner sur un Mac avec 64 Go ou 128 Go de mémoire unifiée, là où un PC nécessiterait plusieurs GPU. En mai 2026, MLX 0.31.x avec macOS 26.2 débloque les Neural Accelerators M5, réduisant le TTFT jusqu’à 4x. Selon les benchmarks rapportés, le moteur MLX est environ 3 fois plus rapide que le chemin Metal de llama.cpp sur Mac.

Ollama est un wrapper Go qui s’appuie sur llama.cpp (ou MLX sur Apple Silicon depuis la version 0.19 de mars 2026). Il hérite donc des performances de son moteur sous-jacent, mais ajoute une couche de gestion automatique : téléchargement des modèles, choix de quantification, offloading CPU/GPU automatique. C’est une commodité précieuse pour le débutant, mais elle masque les réglages fins que llama.cpp permet.

LM Studio utilise également llama.cpp en interne, mais l’enrobe dans une interface Electron. Il offre un contrôle visuel de l’offloading, de la quantification et du contexte, ainsi qu’un navigateur de modèles intégré. La version 0.4.14 a promu le décodage spéculatif MTP en stable, ce qui accélère significativement la génération sur les modèles qui le supportent.

FreeToken innove radicalement : au lieu de tout charger en VRAM, il fait résider le modèle en RAM système et ne transfère que les experts actifs vers le GPU via un cache LRU. Le double buffering masque la latence des transferts PCIe. Cette approche permet d’exécuter des MoE de plusieurs centaines de milliards de paramètres sur un GPU de 24 Go, à condition d’avoir suffisamment de RAM (64 Go minimum recommandé) et une bande passante PCIe correcte. Le vrai goulot d’étranglement reste la bande passante PCIe et la latence mémoire, comme le soulignent les analyses techniques.

Benchmarks : les chiffres qui comptent (et ceux qui manquent)

Parlons chiffres. Les fourchettes de débit annoncées en 2026 sont les suivantes :

Source : botmonster.com
Runtime Débit annoncé (tok/s) Contexte
Ollama ~40 (pic) Mono-utilisateur, sur A100 selon benchmark Red Hat
LM Studio ~50-90 Avec continuous batching
MLX ~130-230 Mono-utilisateur sur Apple Silicon
vLLM ~800-12 500 Multi-utilisateurs, GPU serveur
FreeToken jusqu’à 3x Ollama (MoE) GPU grand public, MoE massifs

Ces chiffres proviennent d’articles de blogs (principalement codersera.com, digitalapplied.com et stork.ai pour FreeToken) et doivent être pris avec des pincettes. Le benchmark le plus cité — un test Red Hat qui a mesuré vLLM à 793 tokens par seconde contre 41 pour Ollama sur le même A100, soit un écart de 19x — est souvent présenté hors contexte. En réalité, à un seul utilisateur, les deux runtimes se rejoignent autour de 130-180 tok/s. L’avantage de vLLM ne se manifeste qu’en concurrence : il est conçu pour servir de nombreuses requêtes simultanément, pas pour la vitesse d’un seul flux.

Pour FreeToken, les benchmarks publiés par le projet (via freetoken.wiki) montrent des gains de 2 à 3x par rapport à Ollama sur des modèles MoE comme Mixtral ou Qwen MoE, mais ces mesures sont réalisées par les auteurs du projet eux-mêmes. Une analyse indépendante (pachca.com) note que les chiffres dépendent fortement de la configuration matérielle, notamment de la bande passante PCIe. Sur un GPU de 24 Go avec une RTX 4090 et 128 Go de RAM, les résultats semblent crédibles ; sur du matériel plus modeste, l’écart se réduit.

Ce qui manque cruellement, c’est un benchmark standardisé sur les GPU grand public. Aucune source fiable ne fournit de mesures précises pour un Llama 3.3 70B Q4_K_M sur une RTX 4060 Ti 16 Go ou une RTX 5090 32 Go. Les tests indépendants type Artificial Analysis se concentrent sur les API cloud, pas sur l’inférence locale. La communauté Reddit r/LocalLLM publie bien des chiffres, mais ils sont souvent disparates et difficilement reproductibles.

Ce que l’on peut affirmer avec prudence : vLLM est incontestablement le plus rapide en concurrence, grâce à PagedAttention et au continuous batching. MLX est très performant sur Mac, surtout avec les Neural Accelerators M5. llama.cpp et ses dérivés (Ollama, LM Studio) offrent des débits corrects en mono-utilisateur, mais pèchent en cas de forte charge. FreeToken est prometteur pour les MoE massifs sur GPU grand public, mais ses benchmarks restent à confirmer par des tests indépendants.

Un point important : le décodage spéculatif MTP (Multi-Token Prediction) fait des merveilles sur les modèles qui le supportent (Gemma 4, Qwen 3.6, DeepSeek V4). Combiné à DSpark, il peut accélérer l’inférence de 60 à 85 % sans réentraînement, selon les chiffres de DeepSeek publiés en juillet 2026. C’est sans doute la voie la plus prometteuse pour les configurations modestes.

Matériel : les options pour ne pas se ruiner en 2026

Au-delà des runtimes, le choix du matériel est crucial. Voici les options qui se sont démocratisées en 2026.

Les mini PC à mémoire unifiée sont la grande nouveauté. L’AMD Strix Halo, lancé en 2025, a ouvert la voie avec 64 à 128 Go de mémoire unifiée LPDDR5X et une bande passante de 256 Go/s. En 2026, l’entrée de gamme (64-128 Go) permet de faire tourner des modèles 70B-120B en 4-bit pour environ 1500 $. Le haut de gamme AMD Gorgon Halo va jusqu’à 192 Go et supporte les modèles 200B+. Le mini PC officiel AMD Ryzen AI Halo (128 Go) est annoncé à 3999 $, tandis que l’Acer mini PC IA (128 Go) supporte les modèles 200B annoncés. Côté Apple, le M4 Ultra (sorti en 2026) offre 128 Go de mémoire unifiée avec une bande passante de 546 Go/s — le choix idéal pour MLX.

Les GPU d’occasion restent une option économique. Une RTX 3080 10 Go se trouve autour de 300-400 € d’occasion et fait tourner des modèles 7B-13B en Q4_K_M. Une RTX 3090 24 Go (500-600 € d’occasion) permet d’atteindre les 20B-34B. Pour les 70B, il faut soit une RTX 4090 24 Go (encore chère, ~1500 €), soit un setup multi-GPU, soit un mini PC à mémoire unifiée.

Les configurations CPU-only restent possibles pour les petits modèles. Un PC avec 32 Go de RAM fait tourner un 7B en Q4_K_M à ~5-10 tok/s, ce qui est utilisable pour du chat occasionnel. Pour du 70B en CPU, il faut 64 Go de RAM et beaucoup de patience (~1-2 tok/s).

Les coûts réels en 2026 : une configuration tour GPU avec RTX 4090 revient à environ 2900 $ (GPU + CPU + RAM + SSD). Un mini PC Strix Halo d’entrée de gamme coûte 1500 $. Un MacBook Pro M4 avec 64 Go coûte ~2500 $. Le rapport perf/prix penche clairement vers les mini PC à mémoire unifiée pour les modèles moyens, et vers les GPU d’occasion pour les petits modèles.

Le post-training et la quantification : les pièges à éviter

Un point que les guides grand public négligent : les modèles récents sont de plus en plus souvent entraînés avec du RL (RLHF, GRPO, RLVR), ce qui produit des logits « pointus » qui résistent mal à la quantification agressive. Un modèle 70B quantifié en Q4_K_M peut perdre 10-15 % de ses capacités de raisonnement si ses logits sont trop pointus. Il faut donc tester plusieurs niveaux de quantification (Q4, Q5, Q6) et choisir le meilleur compromis qualité/VRAM.

Source : local-llm.net

Le Ray Summit 2026 (San Francisco, 25 août) a mis en lumière cette convergence forcée de l’infrastructure open-source vers le post-training RL. Bryan Catanzaro de NVIDIA y a présenté les défis matériels posés par ces modèles. En pratique, pour un usage local, privilégiez les modèles spécifiquement optimisés pour l’inférence (comme DeepSeek V4-Flash, 284B paramètres totaux mais seulement 13B activés par token) plutôt que les modèles RL-trainés bruts.

Conclusion : quel runtime pour quel profil ?

  • Débutant, usage occasionnel : Ollama ou LM Studio. Installez, téléchargez un modèle 7B-13B, et c’est parti. Budget : 0 € si vous avez déjà un PC correct, ~500 € pour une RTX 3060 12 Go d’occasion.
  • Développeur, usage quotidien : llama.cpp ou Ollama avec Open WebUI. Un 13B-20B en Q4_K_M sur une RTX 3090 d’occasion (500-600 €) offre un excellent rapport qualité/prix.
  • Mac user : MLX, sans hésiter. Un MacBook M4 avec 64 Go fait tourner des modèles 70B en Q4_K_M à des vitesses impressionnantes.
  • PME, usage multi-utilisateurs : vLLM sur un GPU serveur (A100, H100) ou un cluster. C’est le seul runtime qui tienne la charge.
  • MoE massifs sur GPU grand public : FreeToken, si vous avez 64+ Go de RAM et un GPU 24 Go. Les benchmarks sont prometteurs mais à confirmer.

En 2026, la question n’est plus « puis-je me le permettre ? » mais « quel compromis qualité/vitesse/prix me convient ? ». Les runtimes ont fait leur part du travail ; le matériel a suivi ; les modèles open-weight sont là. Il ne reste qu’à choisir.

Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *