LLM auto hébergées · 17 September 2026LLM open source chez soi en 2026 : le guide GPU pour ne pas se ruiner (mise à jour septembre)
En septembre 2026, faire tourner un LLM open-source sur sa propre machine n’est plus un luxe réservé aux initiés. Mais entre la pénurie de mémoire qui a fait flamber les prix, une génération de cartes aux specs alléchantes, des alternatives inattendues comme les mini PC à mémoire unifiée et l’irruption de moteurs d’inférence comme FreeToken, le choix du bon matériel relève plus que jamais du casse-tête. Voici comment naviguer ce marché sous tension avec méthode, sans céder au syndrome de la carte la plus chère.
Introduction : le paradoxe de 2026
Nous sommes en septembre 2026. L’écosystème des LLM open-source n’a jamais été aussi dynamique — mais il a changé de visage. En mai 2026, cinq modèles de niveau « frontier » sont sortis en moins de 30 jours : Qwen 3.5 (Alibaba), DeepSeek V4 (Pro + Flash), Gemma 4 (Google), Mistral Medium 3.5, et côté Meta, la donne a basculé. Le nom « Llama » a disparu : après avoir fermé la porte à l’open source le 8 avril 2026 avec Muse Spark (propriétaire, API seulement), Meta a fait volte-face le 10 août en publiant Muse Glimmer, un modèle 30B en Apache 2.0 pensé pour les agents locaux. Le « Behemoth » annoncé à deux trillions de paramètres n’est jamais sorti — abandonné en route.
Côté runtimes, l’outillage a mûri à toute vitesse. Ollama, l’outil d’inférence locale le plus populaire, a enchaîné les versions : 0.23.0 → 0.24.0 en onze jours en mai, avec le support de Codex App, le speculative decoding Gemma 4 MTP via le runner MLX et un sampler MLX retravaillé. vLLM v0.21.0 a stabilisé DeepSeek V4 sur Blackwell avec un nouveau backend TOKENSPEED_MLA. llama.cpp a fusionné le support de Qwen 3.6 MTP (PR #22673) et publié des prebuilts Windows CUDA 13.1. MLX 0.31.x, couplé à macOS 26.2, exploite les Neural Accelerators des puces M5 pour un TTFT jusqu’à 4x plus rapide. Et un nouveau venu bouscule les règles : FreeToken, un moteur d’inférence open-source qui promet de faire tourner des MoE massifs sur GPU grand public en utilisant la RAM système.
Pourtant, le marché du matériel est paradoxalement hostile. Une pénurie mondiale de mémoire a poussé les prix des GPU entre 1,5 et 2 fois au-dessus de leur tarif de lancement. En juillet 2026, un RTX 5090 se négocie entre 3 500 et 3 950 €, un RTX 4090 entre 2 900 et 3 200 €, un RTX 4080 Super entre 1 500 et 1 700 €. Même les cartes d’entrée de gamme ont pris l’ascenseur : le RTX 3060 12 Go, sorti en 2021, se vend encore entre 340 et 400 € neuf — mais on le trouve désormais entre 170 et 200 € d’occasion, ce qui en fait la meilleure affaire du moment.
Dans ce contexte, bien choisir son matériel n’est pas une question de puissance brute, mais de stratégie. La bonne nouvelle ? Les règles du jeu sont plus claires que jamais. Les critères décisifs — VRAM, bande passante mémoire, quantification — sont désormais bien documentés, et des alternatives crédibles émergent, y compris du côté d’AMD, d’Apple et des mini PC à mémoire unifiée. Ce dossier vous donne la méthode pour trancher selon votre usage réel, sans vous ruiner.
Les trois piliers techniques : VRAM, bande passante, calcul
La VRAM : le critère roi
Pour faire tourner un LLM localement, la première question n’est pas « quelle carte est la plus rapide ? » mais « combien de mémoire vidéo ai-je besoin ? ». La règle empirique, confirmée en 2026, est simple : en quantification Q4_K_M (le format standard pour l’inférence locale), il faut compter environ 0,6 Go de VRAM par milliard de paramètres, plus 2 à 4 Go pour le contexte et l’outillage.
Concrètement, un modèle 7B quantifié en 4 bits exige entre 4 et 5 Go de VRAM. Un modèle 13B en Q8 ou 20B en Q4 demande environ 12 à 16 Go. Un modèle 34B en Q4_K_M tourne confortablement dans 24 Go. Et un modèle 70B en Q4 nécessite environ 44 à 50 Go de VRAM — ce qui dépasse largement les 24 Go du RTX 4090 et même les 32 Go du RTX 5090, la seule carte grand public capable de faire tenir un 70B en Q4 sans configuration bi-GPU.
Cette règle des 0,6 Go par milliard est corroborée par les mesures de terrain : le Qwen3-30B-A3B (MoE, 30 milliards de paramètres) tourne sur une RTX 4090 en Q4 avec 17 Go de VRAM occupés et génère 40 tokens par seconde — un résultat qui relevait de la science-fiction il y a dix-huit mois. Le Qwen3.6-27B (dense, publié le 22 avril 2026) tient en environ 17 Go en Q4_K_M, confortable sur une RTX 4090. Attention toutefois aux modèles multimodaux : Muse Glimmer de Meta annonce ~20 Go pour les poids seuls en Q4, mais une enveloppe de 24 à 32 Go une fois le cache KV et l’encodeur visuel comptés — sur une carte de 22 Go, ça ne passe pas.
La VRAM détermine non seulement si le modèle tient, mais aussi la longueur maximale du contexte que vous pouvez utiliser. Un 8B avec un contexte de 128K en pleine précision consomme 10-20 Go de KV-cache à lui seul — un point crucial pour les usages agentiques.
La bande passante mémoire : le vrai goulot d’étranglement
Une fois le modèle chargé en VRAM, c’est la bande passante mémoire qui dicte la vitesse de génération. L’inférence d’un LLM est fondamentalement une opération de lecture de poids : à chaque token généré, le GPU doit relire l’intégralité des poids du modèle. Plus la bande passante est élevée, plus vite les tokens sortent.
Les études de 2026 convergent : une bande passante supérieure à 1 To/s améliore la latence d’inférence jusqu’à 30 % par rapport à des cartes moins rapides, à nombre de cœurs égal. C’est pourquoi le RTX 4090, avec ses 1 008 Go/s, reste une référence pour la vitesse de génération, malgré ses 24 Go seulement.
À l’inverse, la puissance de calcul brute (TFLOPS) est largement surévaluée dans le choix d’un GPU pour LLM. Un RTX 5090 avec ses 575 W de TDP et ses milliers de cœurs CUDA n’est pas « 2 fois plus rapide » qu’un RTX 4090 pour l’inférence — la bande passante mémoire plafonne le gain. Les benchmarks comparatifs le montrent : à VRAM égale, deux cartes avec des TFLOPS très différents produisent des vitesses de génération étonnamment proches.
L’interaction avec la quantification
La quantification (Q4_K_M, Q8_0, etc.) joue sur les deux tableaux. D’un côté, elle réduit la taille des poids, donc la VRAM nécessaire. De l’autre, elle augmente la vitesse effective en réduisant la quantité de données à lire par token. Un modèle 13B en Q8 (16 Go) sera plus lent qu’en Q4 (8 Go) sur la même carte, simplement parce qu’il faut lire deux fois plus de poids à chaque token.
Le choix du niveau de quantification est donc un arbitrage entre qualité et vitesse. En 2026, Q4_K_M est devenu le standard de facto pour l’inférence locale : il offre un bon rapport qualité/performance, et les modèles récents (Qwen 3.6, Muse Glimmer, DeepSeek V4) sont entraînés pour bien résister à cette compression. Attention toutefois aux modèles entraînés par RL (RLHF, GRPO) : leurs logits « pointus » peuvent mal réagir à une quantification trop agressive — un point souligné par les analyses du post-training en 2026. Le consensus est de rester en Q4_K_M ou Q5_K_M pour un usage sérieux, et de réserver Q8_0 aux modèles plus petits où la VRAM le permet.
Le marché GPU en 2026 : une pénurie qui redessine la carte
Des prix sous tension
La pénurie de mémoire de 2026 a bouleversé les repères. Les prix de lancement officiels des RTX 50xx ont été largement dépassés dès les premières semaines. Voici un instantané des prix relevés en juillet 2026 sur le marché européen, neuf et occasion :
| Carte | VRAM | Prix juillet 2026 (neuf) | Prix occasion | Consommation | Usage recommandé |
|---|---|---|---|---|---|
| RX 6700 XT | 12 Go | 140-190 € | — | 230 W | 7B-13B en Q4, budget ultra-serré (config AMD) |
| RTX 3060 12 Go | 12 Go | 340-400 € | 170-200 € | 170 W | 7B-13B en Q4, meilleur rapport qualité/prix |
| RTX A4000 | 16 Go | — | <220 € | 140 W | Meilleur rapport VRAM/€ en occasion |
| RTX 5060 Ti 16 Go | 16 Go | 400-420 € | — | 180 W | 13B-14B avec marge de contexte, meilleur neuf budget |
| RTX 4070 Super | 12 Go | ~450 € | — | 220 W | 7B-14B rapide (25-30 tok/s) |
| RTX 4060 Ti 16 Go | 16 Go | 780-820 € | — | 165 W | 13B en Q8 / 20B en Q4, meilleur rapport VRAM/prix NVIDIA |
| RX 7800 XT | 16 Go | ~500-600 € | — | 263 W | 14B confortable, alternative AMD |
| RTX 5070 Ti 16 Go | 16 Go | non précisé | — | non précisé | Meilleure carte 16 Go GDDR7 (Blackwell) |
| RTX 4080 Super | 16 Go | 1 500-1 700 € | — | 320 W | 14B/22B, choix durable |
| RTX 3090 | 24 Go | — | variable | 350 W | 34B en Q4_K_M, meilleure valeur occasion |
| RTX 4090 | 24 Go | 2 900-3 200 € | — | 450 W | 33B, vitesse de génération maximale |
| RTX 5090 | 32 Go | 3 500-3 950 € | — | 575 W (alim 850-1000 W) | 70B en Q4, seule carte grand public |
Ce tableau révèle plusieurs tendances fortes.
Le budget : le RTX 3060 12 Go reste la valeur reine. À 170-200 € d’occasion, il fait tourner tous les modèles 7B-8B en Q4/Q5 et la plupart des denses 13B-14B en Q4. Les tests de terrain confirment : un Qwen3 14B en Q4_K_M utilise ~9 Go de VRAM et génère 9-12 tokens/s ; un Qwen3 8B atteint 16-20 tok/s ; un DeepSeek-R1 7B (raisonnement) tourne à 10-12 tok/s. C’est le meilleur choix pour débuter sans se ruiner.
Le nouveau venu : le RTX 5060 Ti 16 Go. À 400-420 € neuf, cette carte de génération actuelle offre 4 Go de VRAM de plus que la 3060 — de quoi accueillir confortablement les modèles 13B-14B avec une marge pour des fenêtres de contexte plus larges. C’est le meilleur choix neuf pour les budgets serrés, et il est moins touché par la flambée des prix que les cartes haut de gamme.
Le milieu de gamme : le RTX 4060 Ti 16 Go. À 780-820 €, il est recommandé par le guide llmhardware.io (mis à jour en mai 2026) comme « meilleur rapport VRAM/prix (NVIDIA) » pour les modèles 13B en Q8 ou 20B en Q4. Il offre 16 Go de VRAM, soit le minimum confortable pour les contextes de plus de 16 000 tokens. C’est aussi le GPU le plus proche de son tarif de lancement, donc le moins touché par la flambée.
Le haut de gamme : le RTX 4080 Super. À 1 500-1 700 €, c’est la carte 16 Go la plus rapide, et après les mouvements de prix de 2026 elle coûte à peu près autant que le RTX 4070 Ti Super, plus lent. Pour les modèles 14B rapides et un travail 22B léger, c’est le choix durable.
Le marché de l’occasion reste une option sérieuse. Le RTX 3090 24 Go, recommandé comme « meilleure valeur sur le marché de l’occasion » pour les modèles 34B en Q4_K_M, offre une capacité mémoire que seules les cartes à plus de 3 000 € peuvent égaler en neuf. Attention toutefois : sa consommation de 350 W et son encombrement imposent une alimentation adaptée.
AMD : viable mais plus exigeant
Les cartes AMD offrent une VRAM par euro compétitive : le RX 6700 XT (12 Go) se trouve à 140-190 €, le RX 7800 XT (16 Go) autour de 500-600 €. Mais la configuration ROCm ajoute des heures de travail face à NVIDIA CUDA — les guides 2026 le rappellent : si vous êtes prêt à bricoler, AMD peut être rentable ; sinon, restez sur NVIDIA pour un déploiement sans friction.
Le cas particulier du RTX 5090
Le RTX 5090, avec ses 32 Go de VRAM, est présenté comme la seule carte grand public capable de faire tenir un modèle 70B en Q4 sans configuration bi-GPU. C’est un argument de poids pour les passionnés qui veulent exécuter les plus gros modèles open-source (DeepSeek V4, Qwen 3.6) en local. Mais son prix de 3 500-3 950 € et sa consommation de 575 W (nécessitant une alimentation de 850-1000 W) le réservent à un public averti.
Pour la plupart des usages, un 70B en Q4 est un luxe : les modèles 30B-34B en Q4_K_M, qui tiennent dans 24 Go, offrent déjà des performances très honorables pour le chat, le codage et la plupart des tâches agentiques. Le RTX 4090, à 2 900-3 200 €, reste donc un excellent compromis pour ceux qui veulent de la vitesse sans atteindre les sommets.
L’alternative des mini PC à mémoire unifiée
Une tendance forte de 2026 : les mini PC à mémoire unifiée, qui bousculent le monopole des GPU. L’AMD Strix Halo (16 cœurs Zen 5, GPU RDNA 3.5, LPDDR5X, bande passante 256 Go/s) se décline en entrée de gamme avec 64-128 Go de mémoire unifiée pour environ 1 500 $, capable de faire tourner des modèles 70B-120B en 4-bit. Le Ryzen AI Halo officiel d’AMD pousse à 128 Go et 120B+ pour 3 999 $. L’Acer mini PC IA annonce 128 Go de mémoire unifiée et le support de modèles jusqu’à 200B. Et le Apple M4 Ultra (546 Go/s, 128 Go unifiés) reste une référence pour MLX. Ces machines ne battent pas un RTX 4090 en vitesse pure, mais elles offrent une capacité mémoire imbattable pour le prix — idéal pour les gros modèles sans vendre un rein.
Les runtimes : bien plus qu’Ollama en 2026
En 2026, « faire tourner un LLM en local » n’est plus une décision unique — c’en est cinq. L’écosystème s’est proprement bifurqué en runtimes optimisés pour différentes charges : hobby vs production, CLI vs GUI, NVIDIA vs Apple Silicon, mono-utilisateur vs serveur concurrent. Voici le panorama :

| Runtime | Forme | Idéal pour | Format | Débit concurrent |
|---|---|---|---|---|
| Ollama | CLI + API REST | Prototypage dev | GGUF, MLX sur M-series | ~40 tok/s pic |
| LM Studio | GUI desktop + headless | Navigation modèles, GUI | GGUF + MLX | ~50-90 tok/s |
| vLLM | Serveur Python | Serving multi-utilisateurs | safetensors, AWQ, GPTQ, FP8 | ~800-12 500 tok/s |
| llama.cpp | Binaire C/C++ + serveur | Edge, matériel exotique | GGUF (l’inventeur) | Comparable à Ollama |
| MLX | Bibliothèque Python | Apple Silicon natif | MLX safetensors | ~130-230 tok/s |
| FreeToken | Moteur MoE natif edge | MoE massifs sur GPU grand public | GGUF, MoE | Jusqu’à 3x plus rapide qu’Ollama |
Ollama reste le standard pour débuter : simple, rapide, multi-plateforme. Depuis la version 0.19, il utilise MLX sous le capot sur les puces M-series. LM Studio est le choix GUI pour naviguer les modèles. vLLM est le système de serving par excellence : grâce à PagedAttention et au continuous batching, il atteint environ 16-20x le débit concurrent d’Ollama — indispensable pour servir plusieurs utilisateurs. llama.cpp reste l’engin de référence pour les déploiements exotiques (CPU, CUDA, ROCm, Vulkan, Metal). MLX est la voie la plus rapide sur Apple Silicon.
Et puis il y a FreeToken, le nouveau venu qui fait parler de lui depuis l’été 2026. Issu du dépôt GitHub FlashML et décrit dans l’article arXiv 2608.16157, ce moteur d’inférence open-source promet de faire résider les modèles MoE massifs en RAM système plutôt qu’en VRAM, en utilisant un cache LRU et du double buffering pour ne charger que les experts actifs. Les benchmarks annoncés parlent de faire tourner des modèles à 300 milliards de paramètres, voire 753 milliards, sur une seule carte grand public — jusqu’à 3x plus rapide qu’Ollama selon les tests préliminaires. Attention : les chiffres annoncés restent à vérifier de manière indépendante, et le vrai goulot d’étranglement est la bande passante PCIe et la latence mémoire. Mais si la promesse se confirme, c’est potentiellement la fin du GPU à 3 000 € pour les MoE de pointe.
Stratégies pour optimiser son budget : quantification, offloading, modèles plus petits
La quantification : votre meilleur allié
La quantification est la première stratégie à maîtriser. En passant d’une précision 16 bits à Q4_K_M, vous divisez par 4 la mémoire nécessaire pour les poids. Un modèle 70B qui exigerait ~140 Go en précision 16 bits ne demande plus que ~44-50 Go en Q4. C’est la différence entre un cluster de datacenter et une carte grand public.
Mais attention : la quantification a ses limites. Les modèles très récents (Qwen 3.6, Muse Glimmer) sont généralement plus robustes à la quantification que leurs prédécesseurs, mais une quantification trop agressive (Q2, Q3) peut dégrader sensiblement la qualité des réponses. Le consensus en 2026 est de rester en Q4_K_M ou Q5_K_M pour un usage sérieux, et de réserver Q8_0 aux modèles plus petits où la VRAM le permet.
L’offloading CPU : le piège à éviter
Lorsque les poids du modèle ne tiennent pas en VRAM, la tentation est grande d’utiliser l’offloading CPU : le GPU traite une partie du modèle, le CPU le reste. C’est une erreur stratégique. Les benchmarks de 2026 sont sans appel : si les poids ne sont pas en VRAM, la génération chute à environ 0,1 token par seconde au lieu de 50. Autrement dit, un modèle 70B en offloading sur un RTX 4090 sera 500 fois plus lent qu’un modèle 34B entièrement en VRAM.
La règle d’or : choisissez un modèle qui tient entièrement dans votre VRAM, même s’il est plus petit. Un 34B en Q4_K_M dans 24 Go sera toujours plus rapide et plus agréable qu’un 70B en offloading.
Le décodage spéculatif et les modèles MoE
Deux techniques permettent de gagner en vitesse sans changer de carte. Le décodage spéculatif (speculative decoding) brise la limite séquentielle de la génération : un petit modèle « draft » propose plusieurs tokens, le grand modèle les valide en parallèle. Ollama 0.24.0 et LM Studio 0.4.14 l’ont promu en stable en 2026, et vLLM v0.21.0 fait respecter les budgets de raisonnement au décodage spéculatif. Les gains peuvent atteindre 2-3x sur la vitesse perçue.
Les modèles MoE (Mixture of Experts) sont une autre voie : ils n’activent qu’une fraction de leurs paramètres à chaque token. Le Qwen3.6-35B-A3B (3 milliards de paramètres actifs) offre la qualité d’un 35B pour le coût d’un 3B. Le DeepSeek V4-Flash (284 milliards de paramètres totaux, ~13 milliards actifs par token) est un cas extrême — et c’est exactement le type de modèle que FreeToken vise.
Le post-training RL : un piège VRAM
Un point crucial soulevé au Ray Summit 2026 (San Francisco, 25 août) : le post-training par renforcement (RLHF, GRPO, RLVR) est devenu le nouveau champ de bataille, mais il fait grimper la facture VRAM. Les modèles RL-trainés ont des logits « pointus » qui résistent mal à une quantification trop agressive. Si vous utilisez un modèle récent entraîné par RL, testez-le en Q5_K_M ou Q8_0 avant de descendre en Q4 — la différence de qualité peut être significative.
Les modèles recommandés par budget en septembre 2026
Budget < 300 € : le RTX 3060 12 Go d’occasion
C’est la valeur reine. Avec 170-200 €, vous faites tourner :
- Qwen3 8B en Q4_K_M : 16-20 tok/s
- Qwen3 14B en Q4_K_M (~9 Go) : 9-12 tok/s
- DeepSeek-R1 7B (raisonnement) : 10-12 tok/s
- Phi-3.5 Mini (3.8B) : très confortable
Budget 400-500 € : le RTX 5060 Ti 16 Go neuf
Le meilleur choix neuf pour les budgets serrés. 16 Go de VRAM permettent :
- Qwen3.6-27B en Q4_K_M (~17 Go) — juste à la limite, avec contexte réduit
- Mistral Small 3.1 (24B) en Q4
- Tous les 13B-14B avec une large marge de contexte
Budget 800 € : le RTX 4060 Ti 16 Go
Le « meilleur rapport VRAM/prix NVIDIA » selon llmhardware.io :
- Qwen3.6-27B en Q4_K_M confortable
- Muse Glimmer (30B) en Q4 — attention, 24-32 Go avec KV cache et encodeur visuel, donc plutôt pour les 32 Go
- Modèles 20B en Q4 avec contexte étendu
Budget 1 500-1 700 € : le RTX 4080 Super
La carte 16 Go la plus rapide :
- Qwen3-30B-A3B en Q4 : 40 tok/s mesurés
- Modèles 14B rapides et travail 22B léger
Budget 2 900-3 200 € : le RTX 4090
Le compromis ultime pour la vitesse :
- Qwen3-30B-A3B : 40 tok/s
- Qwen3.6-35B-A3B (MoE) : excellent pour l’agentique
- Modèles 33B en Q4_K_M
Budget 3 500-3 950 € : le RTX 5090
La seule carte grand public pour un 70B en Q4 (44-50 Go). Pour les passionnés qui veulent DeepSeek V4 ou les plus gros modèles en local. Sinon, un mini PC à 128 Go de mémoire unifiée (1 500-4 000 €) peut être une alternative plus polyvalente pour les très gros modèles.
Conclusion : la stratégie gagnante en 2026
Le marché de 2026 est sous tension, mais les règles du jeu sont claires. Trois principes résument la stratégie gagnante :
-
La VRAM d’abord, la vitesse ensuite. Un modèle qui tient entièrement en VRAM sera toujours plus rapide qu’un plus gros en offloading. Choisissez votre carte en fonction du modèle que vous voulez vraiment faire tourner.
-
La quantification est votre meilleur allié. Q4_K_M divise par 4 les besoins mémoire. Maîtrisez-la avant d’acheter quoi que ce soit.
-
Les alternatives existent. Mini PC à mémoire unifiée (AMD Strix Halo, Apple M4 Ultra), cartes AMD d’occasion, et désormais FreeToken pour les MoE massifs — le GPU NVIDIA haut de gamme n’est plus la seule porte d’entrée.
Et rappelez-vous : un RTX 3060 d’occasion à 170 € fait déjà tourner des modèles 8B-14B parfaitement utilisables. Le syndrome de la carte la plus chère n’a jamais été aussi peu justifié qu’en 2026.
Sources

- LLM open source en local : quel modèle pour quel GPU — N-3DS
- Ollama vs LM Studio vs vLLM vs llama.cpp vs MLX (2026) — Codersera
- Local AI Runtimes May 2026 Update — Codersera
- Faire tourner des LLM en local en 2026 : guide complet avec Ollama
- FreeToken : Exécutez d’énormes modèles d’IA MoE 3x plus vite qu’avec Ollama — Stork.ai
- FreeToken llama : guide et conseils pour configurer MoE local — freetoken.wiki
- Ray Summit 2026 : RL Post-Training Forces Open-Source AI Infrastructure to Converge — TechTimes
- [C’est parti : les poids de Kimi K3, plus gros modèle IA ouvert au monde,
Article recherché et rédigé automatiquement · Magazine Electrosens