Electrosens R&D
Electrosens Magazine LLM Opensource · 15 September 2026

LLM open source en septembre 2026 : Qwen3.8-Max, GLM-5.3, Hy4 et la guerre froide des modèles s’intensifie

Fini le temps où exécuter un modèle de langage nécessitait plusieurs GPU professionnels pour 50 000 € et une maîtrise de PyTorch. En septembre 2026, une simple commande bash suffit pour lancer Mistral 7B sur un MacBook Pro M3 ou un PC équipé d’une RTX 3080. Mais le paysage a radicalement changé : Alibaba a ouvert les poids de Qwen3.8-Max, un modèle de 2 400 milliards de paramètres, tandis que Moonshot AI a lancé Kimi K3, un géant MoE de 2,8 billions de paramètres. Meta a fait volte-face avec Muse Glimmer, Z.ai a dégainé GLM-5.3, et Tencent vient de surprendre avec Hy4. Ce panorama dresse l’état des lieux des LLM open-source réellement utilisables localement en septembre 2026 : quels modèles, quelles configurations, quelles performances, et comment les spécialiser via le fine-tuning.

De 50 000 € à une commande bash : la révolution silencieuse des LLM locaux

En janvier 2023, déployer un LLM en local relevait de l’exploit technique et financier : il fallait plusieurs GPU professionnels (souvent des A100 80 Go) pour un budget avoisinant 50 000 €, et une maîtrise poussée de PyTorch et du pipeline d’inférence. Les modèles open-source de l’époque – Llama 1, Falcon – dépassaient rarement les 7 milliards de paramètres en version non quantifiée, et leur qualité restait loin des géants propriétaires.

Trois ans et demi plus tard, le paysage a radicalement changé. En septembre 2026, une simple commande ollama run mistral télécharge et exécute Mistral 7B sur un MacBook Pro M3 ou un PC avec une RTX 3080, sans configuration complexe. Les modèles open-source ont explosé en taille et en capacité : Llama 3.3 70B, Qwen 3 72B, DeepSeek V4 Pro (non quantifié) atteignent des scores comparables aux modèles frontier sur de nombreuses tâches. L’écart avec les modèles propriétaires comme GPT-5.6 ou Claude Fable 5 s’est réduit, et pour 80 % des usages courants, un bon modèle local suffit. Selon le LLM Stats Index, l’écart entre les meilleurs modèles open-weights et les modèles propriétaires est désormais inférieur à trois mois.

Cette révolution tient à trois facteurs : la démocratisation du matériel grand public (RTX 3060 12 Go, MacBook Pro 16 Go), les techniques de quantification (GGUF, AWQ, bitsandbytes 4‑bit) qui réduisent la mémoire nécessaire de 75 %, et des outils d’inférence matures comme Ollama, llama.cpp ou LM Studio. Le résultat ? Un développeur peut aujourd’hui faire tourner un modèle 7B quantifié en Q4 dans moins de 5 Go de VRAM, et un 70B dans 40‑48 Go – soit une seule RTX 4090 ou 5090.

Mais l’été 2026 a marqué un tournant géopolitique. Le 3 août, Alibaba a ouvert les poids de Qwen3.8-Max (2,4 billions de paramètres, 95 milliards d’actifs), la première fois qu’un modèle de classe Max est publié en open-weights. Le 10 août, Meta a publié Muse Glimmer, un modèle agentique de 30 milliards de paramètres sous licence Apache 2.0. Le 14 août, Z.ai a dégainé GLM-5.3, un MoE de 743 milliards de paramètres qui domine le benchmark cybersécurité CyberGym. Et fin août, Tencent a surpris tout le monde avec Hy4, un modèle de 770 milliards de paramètres (49B actifs) orienté codage et productivité. Ces annonces confirment la bascule chinoise : les modèles open source les plus puissants ne viennent plus de la Silicon Valley.

Le matériel qui compte : RTX 3060, MacBook M3 et les configurations gagnantes

Tous les modèles ne tiennent pas sur toutes les machines. La mémoire vive (VRAM pour GPU, RAM pour CPU) est le facteur limitant. Voici les besoins typiques pour des modèles quantifiés en Q4 avec un contexte de 4K tokens, selon plusieurs sources concordantes (computingforgeeks.com, techsy.io, codersera.com) :

VRAM nécessaire (Q4) par taille de modèle3-4B2.5Go7-8B5Go14-24B12Go27-33B16Go70-72B40Go90-120B55Go235B80Go
Taille du modèle VRAM nécessaire (Q4) RAM nécessaire (CPU) Exemples de modèles
3‑4B paramètres ~2,5 Go ~4 Go Phi‑3 Mini, Gemma 3 4B, VibeThinker-3B
7‑8B paramètres ~5 Go ~8 Go Mistral 7B, Llama 3.3 8B, Qwen 3 8B
14‑24B paramètres ~12‑16 Go ~16‑24 Go Qwen 3 14B, DeepSeek Coder V2 15B, Mistral Small 3.1 24B
27‑33B paramètres ~16‑24 Go ~32 Go Gemma 3 27B, Qwen3.8-27B, Muse Glimmer 30B
70‑72B paramètres ~40‑48 Go ~64 Go Llama 3.3 70B, Qwen 2.5 72B
90‑120B paramètres ~55‑70 Go ~96‑128 Go Llama 4 Scout (~55 Go), DeepSeek V4 Flash
235B (MoE) ~80‑100 Go ~128+ Go Qwen 3 235B-A22B (22B actifs)
743B (MoE) ~200+ Go ~400+ Go GLM-5.3 (Z.ai)
770B (MoE) ~200+ Go ~400+ Go Hy4 (Tencent, 49B actifs)
1,6T (MoE) ~300+ Go ~600+ Go DeepSeek V4 Pro
2,4T (MoE) ~500+ Go ~1 To+ Qwen3.8-Max (Alibaba)
2,8T (MoE) ~600+ Go ~1,2 To+ Kimi K3 (Moonshot AI)

Point d’entrée minimal : une RTX 3060 12 Go permet de faire tourner confortablement les modèles 7‑8B (Mistral 7B, Llama 3.3 8B). Un MacBook Pro avec 16 Go de RAM unifiée suffit pour Mistral 7B via le backend Metal d’Ollama. Pour les modèles 70B, une RTX 4090 (24 Go) ne suffit pas en Q4 : il faut soit une RTX 5090 (32 Go), soit deux RTX 4090 en parallèle, soit une exécution CPU avec 64 Go de RAM. Les modèles MoE comme Qwen 3 235B-A22B (22B actifs) offrent un bon compromis performance/mémoire.

Performances mesurées : sur une RTX 4070, l’inférence locale atteint 60 à 80 tokens par seconde selon le modèle et la quantification, soit environ 12,5 à 16,7 ms par token (source : dev‑ai.fr). C’est largement suffisant pour une utilisation interactive. En CPU seul, le débit chute à 5‑15 tokens/s pour un 7B, mais reste acceptable pour des tâches asynchrones.

Ollama, llama.cpp, MLX, DSpark : la boîte à outils du déploiement local en 2026

En septembre 2026, Ollama s’est imposé comme l’outil standard de facto pour l’exécution locale de LLM. Avec plus de 95 000 étoiles GitHub, il offre une installation en une commande (curl -fsSL https://ollama.com/install.sh | sh) et expose une API REST compatible OpenAI sur le port 11434. Il encapsule llama.cpp en backend, avec support de CUDA (NVIDIA), Metal (Apple Silicon) et ROCm (AMD Linux). C’est le choix recommandé pour la plupart des utilisateurs, que ce soit pour le développement API-first ou l’usage en ligne de commande.

Attention sécurité : fin août 2026, une faille a été signalée dans l’API réseau d’Ollama (CVE-2026-65105), permettant un empoisonnement persistant des modèles dans les environnements d’agents IA. À ce jour, aucune confirmation officielle NVD/MITRE/Nvidia n’a été publiée, mais il est recommandé de limiter l’exposition réseau d’Ollama et de vérifier l’intégrité des modèles téléchargés.

Alternatives notables :

  • LM Studio : interface graphique intuitive, idéale pour les débutants et le chat bureau. Son créateur, Adrien Grondin, travaille également sur Bionic, un agent IA souverain pour le code et les documents, lancé en juillet 2026 (code open source MIT, modes local et cloud sans rétention).
  • llama.cpp : le moteur C++ pur, utilisé en coulisse par Ollama, offre un contrôle fin (quantification, contexte, threads). C’est l’outil le plus flexible.
  • vLLM : optimisé pour la production et les déploiements multi‑utilisateurs (PagedAttention, continuous batching). Idéal pour le serving en production. La première conférence vLLM s’est tenue en parallèle du Ray Summit 2026 (24-26 août à San Francisco), reflétant la convergence de l’infrastructure open source autour du RL post-training.
  • MLX : framework d’Apple pour les puces M‑series, avec des performances remarquables en float16. Meilleur choix pour les développeurs Mac cherchant la vitesse maximale.
  • DSpark : framework d’inférence open source de DeepSeek (licence MIT) basé sur le décodage spéculatif. DeepSeek annonce jusqu’à 85 % de réduction de latence sur son modèle V4-Flash sans modification des poids ni ajout de matériel. Le code a été ouvert le 27 juin 2026, et la publication académique a été soumise sur arXiv le 6 juillet 2026 (arXiv:2607.20062). DSpark est désormais disponible pour les modèles V4-Pro et V4-Flash, avec des checkpoints pré-entraînés fournis pour Qwen3 et Gemma 4. Il est compatible avec vLLM et SGLang. Pour les organisations qui auto-hébergent DeepSeek V4, DSpark représente un gain de coût par token significatif : les benchmarks indépendants montrent une amélioration du throughput de +51 % à +400 % selon les configurations, avec une dégradation de qualité inférieure à 0,3 % (delta BLEU). Trois mois après sa sortie, DSpark s’impose comme un standard de fait pour l’inférence spéculative, même si ses angles morts (précision sur certains workloads, prérequis matériels) restent à documenter.
  • Jan et GPT4All : deux alternatives orientées confidentialité et simplicité, respectivement.

Tous ces outils supportent la quantification (GGUF, AWQ, bitsandbytes) et permettent de charger des modèles depuis Hugging Face ou des fichiers locaux. L’écosystème est mature : les modèles sont téléchargés une fois et mis en cache, les temps de chargement sont de l’ordre de quelques secondes pour un 7B.

Quels modèles pour quelle tâche ? Guide de sélection septembre 2026

Le choix du modèle dépend de votre matériel et de l’usage visé. Voici nos recommandations, basées sur les guides et comparatifs de juillet-septembre 2026 (techsy.io, computingforgeeks.com, codersera.com, the-agent-report.com, et le blog Hugging Face de Daya Shankar) :

Source : i-actu.fr
Usage Modèle recommandé Taille VRAM nécessaire Particularité
Conversation générale Mistral 7B ou Qwen 3 8B 7‑8B ~5 Go Fluide, bon équilibre qualité/vitesse
Raisonnement et mathématiques Qwen 3 14B / 27B 14‑27B 12‑24 Go Performances solides sur benchmarks (MMLU, HumanEval)
Codage DeepSeek V4 Pro ou Qwen 3 235B-A22B 235B+ ~80‑100 Go 93,5 % sur LiveCodeBench, meilleur que GPT‑4 selon plusieurs benchmarks
Tâches complexes / agent Llama 3.3 70B ou Qwen 2.5 72B 70‑72B ~40‑48 Go Modèles généralistes de haut niveau
Contrainte extrême (CPU, 8 Go RAM) Phi‑3 Mini, Gemma 3 4B, Phi‑4 14B (quantifié) 3‑14B ~2,5‑8 Go Rapides, qualité suffisante pour QA simple
Multimodal / long contexte Llama 4 Scout ~109B (MoE) ~55 Go Contexte 10M tokens, multimodal (vision + texte)
Raisonnement transparent Magistral (Mistral) 24B 24B ~16 Go Modèle open-weight (Apache 2.0) avec raisonnement pas à pas, 65,2 % sur AIME 2024
Meilleur rapport performance/mémoire Gemma 3 27B 27B ~16 Go Déploiement sur GPU unique, multimodal, licence permissive
Agent local Muse Glimmer (Meta) 30B dense 24‑32 Go Apache 2.0, multimodal, conçu pour l’exécution locale sur PC/Mac
Codage + cybersécurité GLM-5.3 (Z.ai) 743B MoE ~100+ Go 84,5 % sur CyberGym, Terminal-Bench 3.0 à 28,3 %
Codage + productivité Hy4 (Tencent) 770B MoE (49B actifs) ~200+ Go Contexte 1M+, orienté codage, bureautique et recherche
Géant chinois Qwen3.8-Max (Alibaba) 2,4T (MoE) ~500+ Go Contexte 1M tokens, poids ouverts le 3 août 2026
Plus grand open source Kimi K3 (Moonshot AI) 2,8T (MoE) ~600+ Go 104B actifs, contexte 1M, multimodal texte+image+vidéo

Cas particuliers : Qwen3.6 27B (non quantifié) obtient 77,2 % sur SWE‑bench, un score impressionnant pour un modèle de cette taille. DeepSeek V4 Pro atteint 93,5 % sur LiveCodeBench, ce qui le place au niveau des meilleurs modèles propriétaires pour le code. Laguna XS 2.1 (33B MoE) affiche 70,9 % sur SWE‑bench Verified et 63,1 % sur SWE‑bench Multilingual – une excellente option pour les environnements multilingues. Le modèle Falcon 3 (10B), bien que plus ancien (décembre 2024), reste pertinent pour les petits déploiements grâce à sa licence Apache-2.0 et ses performances honorables sur les benchmarks de sa catégorie.

Les géants de l’été 2026 : Alibaba a ouvert les poids de Qwen3.8-2.4T-A95B le 3 août, avec un contexte de 1 million de tokens et une licence custom (Qwen3.8-Max License), accompagné du plus petit Qwen3.8-27B (Apache 2.0, vision-langage natif, 262K contexte, score Artificial Analysis de 52 – au niveau de GLM-5.2). Selon VentureBeat, Qwen3.8-Max revendique surpasser GPT-5.6 Sol Max et Fable 5 sur l’utilisation agentique d’ordinateur. Lors d’un test autonome, le modèle a mené un projet de codage de 16 jours sans intervention humaine, accumulant 265 commits, 127 pull requests et 151 issues. Il a également reproduit et amélioré les expériences d’un article de recherche en 125 heures, écrivant environ 7 600 lignes de code. Moonshot AI a lancé Kimi K3 fin juillet, présenté comme le plus grand modèle open source jamais développé (2,8T paramètres, 104B actifs, 896 experts, contexte 1M, multimodal texte+image+vidéo), avec des performances annoncées proches de GPT-5.6 sur les benchmarks standards. Z.ai a dégainé GLM-5.3 le 14 août, un modèle qui ne change pas de taille (743B MoE) mais qui change de métier : post-entraînement intensif pour le code long-horizon et la cybersécurité, avec 84,5 % sur CyberGym et Terminal-Bench 3.0 passant de 4,6 à 28,3 % par le seul post-entraînement. Meta a publié Muse Glimmer le 10 août, un modèle agentique 30B dense sous Apache 2.0, conçu pour l’exécution locale sur PC et Mac, accompagné d’un manifeste open source.

Le nouveau venu : Hy4 de Tencent — Fin août 2026, Tencent a ouvert les poids de Hy4 preview, un modèle de 770 milliards de paramètres (49B actifs) avec un contexte d’un million de tokens. Conçu autour du codage, de la productivité bureautique et de la recherche scientifique, Hy4 est accessible via API et ses poids sont disponibles en open source. C’est le premier modèle de cette envergure publié par Tencent, confirmant l’engagement des géants chinois dans l’open source.

Le mystère Ox Alpha — Depuis le 20 août, un modèle de raisonnement gratuit sans éditeur connu tourne sur OpenRouter. Baptisé Ox Alpha, il impressionne les développeurs par ses capacités en code et en agents autonomes. Son origine est inconnue, certains suspectant un laboratoire chinois. Il restera accessible gratuitement jusqu’au 27 août. Ce phénomène illustre la vitalité et l’opacité croissante de l’écosystème open source.

Les classements de septembre 2026 : selon BenchLM (benchlm.ai), qui classe 95 modèles open-weight, jamais autant de modèles open source n’ont tutoyé les meilleurs systèmes propriétaires. Le classement Artificial Analysis place 15 modèles chinois dans le top 20. Les scores se resserrent : sur Terminal-Bench 2.1, Claude Opus 4.8 atteint 85,0, mais GLM-5.2 le talonne à 1 % près sur FrontierSWE, et GLM-5.3 le dépasse sur les tâches cyber.

Fine-tuning et post-entraînement : la nouvelle frontière

Le post-entraînement est devenu le champ de bataille principal. GLM-5.3 en est la preuve éclatante : sans aucun nouveau paramètre, Z.ai a transformé un modèle de 743B en leader du codage long-horizon et de la cybersécurité, simplement par un post-entraînement intensif. Cette approche, combinée à des techniques comme le RL post-training, a été au cœur du Ray Summit 2026 (24-26 août), où l’infrastructure open source converge autour de ces méthodes.

Pour le fine-tuning, Axolotl reste l’outil de référence : il supporte plus de 100 modèles, avec un support multimodal natif (LLaMA-Vision, Qwen2-VL, Pixtral). Un fine-tuning Llama-3.1 8B en QLoRA (2 époques, 512 tokens, A100 40 Go) prend environ 5,8 heures. Les batch sizes typiques vont de 1 à 4. Les techniques de quantification AWQ réduisent la pénalité de perplexité INT4 de 74 % par rapport à GPTQ (de 4,57 à 1,17).

Sécurité : le talon d’Achille de l’open source

La faille NemoClaw (CVE-2026-65105) a mis en lumière les risques des architectures d’agents : une mauvaise configuration de l’API Ollama peut permettre un empoisonnement persistant des modèles. Bien que non confirmée officiellement, cette alerte circulant sur LinkedIn depuis le 26 août rappelle que l’open source n’est pas exempt de risques. Les entreprises doivent mettre en place des contrôles de sécurité et de gouvernance, comme le soulignent les analystes à propos de GLM-5.2 : « Les entreprises occidentales voudront une validation indépendante des benchmarks, des déploiements réussis chez des clients mondiaux, de solides contrôles de sécurité et des engagements de support à long terme » (Pareekh Jain, CEO de Pareekh Consulting).

Source : pratique-ia.fr

Géopolitique : la guerre froide de l’IA s’intensifie

La bascule est nette : les modèles open source les plus puissants viennent désormais de Chine. Alibaba, Z.ai, Moonshot AI, DeepSeek, Tencent : tous publient leurs poids, souvent sous licence permissive (MIT, Apache 2.0). Pendant ce temps, Meta a fait volte-face avec Muse Glimmer, revenant à une stratégie open source après des hésitations. Cette guerre froide des modèles a des implications stratégiques majeures : l’AI Act européen est entré en application le 2 août 2026 pour les règles de transparence, tandis que les entreprises américaines cherchent à sécuriser leurs chaînes d’approvisionnement en GPU (CoreWeave dépasse 50 000 GPU). Le prix est aussi un champ de bataille : DeepSeek V4-Pro est proposé à 0,14 $/M tokens en entrée et 0,87 $/M en sortie (build V4 Pro 0813 du 12 août), bien en dessous de Kimi K3 sur OpenRouter.

Sources

Source : techsy.io
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *