Electrosens R&D
Electrosens Magazine LLM Opensource · 10 September 2026

LLM open source 2026 : vitesse, benchmarks et écosystème — le guide de choix

La vitesse d’inférence est devenue le nerf de la guerre pour déployer des LLM en production. Entre architectures MoE affûtées, quantification agressive et optimisations logicielles, les modèles open source de 2026 promettent des débits jamais vus sur du matériel grand public. Mais derrière les classements flatteurs, quels sont les vrais champions de la latence et du throughput ? Nous avons passé au crible les annonces, les benchmarks disponibles et les retours de la communauté pour vous offrir un guide de choix sans concession.


Introduction : la course à la vitesse a commencé

En ce début septembre 2026, le paysage des LLM open source s’est encore densifié — et les échelles ont explosé. En l’espace de deux mois, plusieurs modèles chinois aux dimensions inédites ont fait leur apparition : Kimi K3 de Moonshot AI (2,8 billions de paramètres, lancé le 16 juillet 2026), Qwen3.8-Max d’Alibaba (2,4 billions de paramètres, annoncé le 3 août 2026), GLM-5.3 de Z.ai (753 milliards, sorti le 14 août 2026) et Hy4 Preview de Tencent (770 milliards, publié le 28 août 2026). Ces géants à poids ouverts redéfinissent la frontière de ce qu’on peut déployer — ou du moins, de ce qu’on peut espérer déployer.

Mais l’actualité ne s’arrête pas là. Le 10 août, Meta a surpris tout le monde en publiant Muse Glimmer, un modèle agentique de 30 milliards de paramètres sous licence Apache 2.0, conçu pour tourner sur un simple PC ou Mac avec 24 Go de VRAM. Le 12 août, DeepSeek a officialisé la version production de DeepSeek V4 Pro (1,6 billion de paramètres, 49 milliards d’actifs), mettant fin à une période de prévisualisation de près de quatre mois. Et le 20 août, un mystérieux modèle nommé Ox Alpha est apparu sur OpenRouter, gratuit et sans éditeur connu, spécialisé dans le code et les agents autonomes.

Pourtant, l’attention s’est déplacée du simple score MMLU vers des métriques opérationnelles : tokens par seconde, latence au premier token, consommation mémoire, coût par requête. Les entreprises veulent du temps réel, les développeurs veulent tourner sur une RTX 5090, et les chercheurs veulent des benchmarks reproductibles. Le classement BenchLM, mis à jour le 21 août 2026, classe désormais 101 modèles open-weight — avec Qwen3.8-Max en tête à 79/100. La LM Arena publie ses scores ELO mensuels, et les frameworks d’inférence comme vLLM, TensorRT-LLM et SGLang se livrent une guerre de benchmarks.

Pourtant, les données précises sur la vitesse d’inférence restent étonnamment rares dans les communications officielles. Les blogs et classements abondent, mais les chiffres de throughput (tokens/s) et de latence (p50, p99) sont souvent absents. Nous avons donc compilé ce que les sources disponibles disent — et ne disent pas — pour vous aider à y voir clair.


1. Innovations architecturales : MoE, quantification et accélération logicielle

L’architecture Mixture of Experts (MoE) n’est pas nouvelle, mais son adoption massive en 2025-2026 a transformé la donne. En activant seulement une fraction des paramètres à chaque token, les modèles MoE offrent un compromis séduisant : une capacité totale élevée pour un coût de calcul réduit. Selon StartBrain, cette architecture permet de réduire la facture LLM de 89 à 95 % par rapport à un modèle dense équivalent.

Source : techsy.io

Les modèles MoE stars de 2026

  • Kimi K3 : 2,8 billions de paramètres totaux, 104,2 milliards d’actifs par token, 896 experts avec routage Stable LatentMoE (seuls 16 experts s’activent par token). Lancé le 16 juillet 2026 par Moonshot AI, il talonne les meilleurs systèmes propriétaires sur Terminal-Bench et DeepSWE. Contexte d’un million de tokens. Licence open-weights (mais pas open-source stricto sensu). Les poids sont devenus téléchargeables le 27 juillet 2026.
  • Qwen3.8-Max : 2,4 billions de paramètres, 95 milliards d’actifs, annoncé le 3 août 2026 par Alibaba. Poids ouverts effectivement en ligne sur Hugging Face. Contexte d’un million de tokens. Il mène le classement BenchLM open-weight d’août 2026 avec 79/100.
  • DeepSeek V4 Pro : 1,6 billion de paramètres, 49 milliards d’actifs, architecture MoE + attention sparse. Version production publiée le 12 août 2026 (build V4 Pro 0813), après une prévisualisation d’environ quatre mois. Contexte d’un million de tokens. Licence MIT.
  • DeepSeek V4 Flash : 284 milliards de paramètres, 13 milliards d’actifs, même architecture MoE + sparse attention. Contexte d’un million de tokens. Licence MIT. Positionné comme l’option budget : exécuter une suite de tests coûte 33 fois moins cher qu’avec Kimi K3.
  • GLM-5.3 : 753 milliards de paramètres (base MoE de GLM-5.2), sorti le 14 août 2026 par Z.ai. Aucun nouveau paramètre : tout vient du post-entraînement. Il s’impose en tête du benchmark CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol sur les tâches cybersécurité. Terminal-Bench 3.0 passe de 4,6 % à 28,3 % grâce au post-training. Poids différés, API accessible via le Coding Plan.
  • Hy4 Preview : 770 milliards de paramètres, 49 milliards d’actifs, publié par Tencent le 28 août 2026. Contexte dépassant le million de tokens. Conçu pour le codage, la productivité bureautique et la recherche scientifique. Déjà disponible sur OpenRouter et via l’API Yuanbao.
  • Qwen 3 235B-A22B : 235 milliards de paramètres, 22 milliards d’actifs. Classé n°1 pour le raisonnement et le code par le blog Techsy.io (mise à jour du 5 juillet 2026). Licence Apache 2.0.
  • DeepSeek R1 : 671 milliards de paramètres totaux, 37 milliards d’actifs par token. Publié fin 2024, il reste une référence pour le raisonnement mathématique et la logique profonde.
  • Gemma 4 26B-A4B : sorti le 2 avril 2026 par Google DeepMind, ce modèle MoE active seulement 4 milliards de paramètres sur 26 milliards totaux. Il fait partie d’une famille comprenant aussi des versions denses (2B, 4B, 31B), toutes sous licence Apache 2.0.
  • Muse Glimmer : 30 milliards de paramètres, publié par Meta le 10-11 août 2026 sous licence Apache 2.0. Modèle agentique multimodal conçu pour l’exécution locale sur PC/Mac avec une seule carte graphique (24 Go de VRAM). Accompagné d’un manifeste de Mark Zuckerberg plaidant pour l’IA open-weight.
  • Llama 4 Scout : le modèle de Meta, avec son contexte de 10 millions de tokens, reste pertinent pour le traitement de documents massifs.

Ces architectures permettent de faire tourner des modèles de très grande taille sur du matériel raisonnable, à condition de bien gérer la mémoire et la bande passante. La quantification (passage en 4 bits, Q4) est systématiquement utilisée pour réduire l’empreinte VRAM. Techsy.io indique ainsi que Qwen 3 235B-A22B nécessite environ 132 Go de VRAM en Q4, et DeepSeek R1 environ 136 Go. Le guide complet de la quantification publié par notre magazine (GGUF, AWQ, GPTQ, FP8) rappelle qu’un modèle de 70 milliards pèse 140 Go en FP16, mais seulement 40-45 Go en GGUF Q4_K_M.

Le cas des géants : Kimi K3, Qwen3.8-Max, Hy4 et DeepSeek V4 Pro

Avec 2,8 et 2,4 billions de paramètres, Kimi K3 et Qwen3.8-Max posent un défi matériel inédit. Même en quantification 4-bit, un modèle de cette taille pèserait plusieurs téraoctets — impossible sur une seule carte, même professionnelle. Les stratégies de contournement évoquées par la communauté incluent le sharding sur plusieurs nœuds, l’inférence distribuée avec des moteurs comme vLLM, ou l’utilisation d’API cloud. Le guide de déploiement de Qwen3.8-Max publié par Open Source For You le 4 août 2026 détaille ces approches.

Hy4 Preview, avec ses 770 milliards de paramètres, est plus accessible : selon Techgenyz, il peut être déployé sur des clusters de GPU professionnels avec quantification, et son API est déjà opérationnelle. DeepSeek V4 Pro, avec ses 1,6 billion de paramètres, reste également hors de portée du matériel local en l’état — mais sa licence MIT et son architecture sparse attention le rendent plus accessible pour les clusters.

L’accélération logicielle : DeepSeek DSpark et les frameworks d’inférence

C’est l’une des annonces les plus importantes de l’été 2026 : DeepSeek DSpark, un framework d’inférence accélérée, a ouvert son code le 27 juin 2026 sous licence MIT, en collaboration avec l’Université de Pékin. Les benchmarks indépendants de juillet 2026 (sur A100 80 Go et H100, séquences de 1k à 8k tokens) montrent des gains de throughput de +51 % à +400 % selon les configurations, avec une dégradation de qualité inférieure à 0,3 % de BLEU. En production, des utilisateurs rapportent des accélérations de latence de 60-85 % sur DeepSeek V4-Flash-DSpark, et des gains de 50-70 % en throughput. DSpark fournit des checkpoints pré-entraînés pour d’autres modèles (Qwen3 et Gemma 4) et est compatible avec vLLM et SGLang.

Mais DSpark n’est pas seul. Le blog Spheron propose un cadre de décision pour choisir entre vLLM, TensorRT-LLM et SGLang : l’optimisation d’inférence consiste à arbitrer entre throughput, latence et mémoire, pas à chasser un chiffre de leaderboard. vLLM reste le choix par défaut pour sa flexibilité et son écosystème, TensorRT-LLM excelle sur les GPU NVIDIA avec une latence minimale, et SGLang se distingue pour les workloads agentiques complexes grâce à son gestionnaire de radix attention. Le Ray Summit 2026, qui s’est tenu fin août à San Francisco, a d’ailleurs mis en évidence une convergence structurelle : le RL post-training impose des infrastructures open source unifiées, et vLLM y était co-localisé avec Ray.

Où sont les papiers de recherche ?

Aucune des sources fournies ne détaille les mécanismes précis d’attention éparse, de routage dynamique ou de quantification à virgule fixe 4 bits. Les articles de blogs généralistes (techsy.io, siliconflow.com, unite.ai) ne citent pas de publications académiques. Pour les curieux, les papiers originaux de DeepSeek, Google ou Alibaba restent la meilleure source – mais ils ne sont pas inclus dans notre corpus. Cela dit, les faits sont là : les modèles existent, tournent, et les communautés les testent.


2. Comparatif des modèles phares : paramètres, VRAM, licence

Le tableau ci-dessous synthétise les informations disponibles dans les sources pour les modèles open source les plus rapides ou les plus prometteurs de 2026. Les données de VRAM sont celles annoncées pour une quantification Q4, sauf indication contraire.

Modèle Paramètres totaux Paramètres actifs VRAM estimée (Q4) Licence Date de publication
Qwen3-8B 8,2 B 8,2 B (dense) ~6 Go Apache 2.0 2025
Qwen 3 235B-A22B 235 B 22 B ~132 Go Apache 2.0 2026 (avant juillet)
DeepSeek R1 671 B 37 B ~136 Go MIT Fin 2024
DeepSeek V3.2 671 B 37 B ~136 Go MIT Décembre 2025
DeepSeek V4 Flash 284 B 13 B Non spécifié MIT Avril 2026
DeepSeek V4 Pro 1 600 B 49 B Non spécifié MIT 12 août 2026
Gemma 4 26B-A4B 26 B 4 B Non spécifié Apache 2.0 2 avril 2026
Gemma 4 31B 31 B 31 B (dense) Non spécifié Apache 2.0 2 avril 2026
Llama 4 Scout 109 B Non spécifié Non spécifié Open source (Meta) 2026
Muse Glimmer 30 B 30 B (dense) ~24 Go Apache 2.0 10-11 août 2026
Mistral Small 3.1 24 B 24 B (dense) ~16 Go Apache 2.0 Mars 2025
Phi-4 14B 14 B 14 B (dense) ~8 Go MIT 2025
Gemma 3 27B 27 B 27 B (dense) ~16 Go Gemma Mars 2025
Kimi K3 2 800 B 104,2 B Non spécifié Open-weights 16 juillet 2026
Qwen3.8-Max 2 400 B 95 B Non spécifié Open-weights 3 août 2026
GLM-5.3 753 B Non spécifié Non spécifié Open-weights (différé) 14 août 2026
Hy4 Preview 770 B 49 B Non spécifié Open source 28 août 2026

Sources : techsy.io, computingforgeeks.com, huggingface.co, benchlm.ai, unite.ai, geotoolbox.ai, opensourceforu.com, techgenyz.com, the-agent-report.com

Observations :

  • Les modèles MoE (Qwen 3 235B, DeepSeek V4 Pro/Flash, Kimi K3, Qwen3.8-Max, GLM-5.3, Hy4) sont les plus économes en calcul par token, mais leur VRAM totale reste élevée à cause des paramètres totaux.
  • Les modèles denses sous 20B (Qwen3-8B, Phi-4, Gemma 4 4B) peuvent tourner sur une seule carte grand public (8-16 Go VRAM).
  • Muse Glimmer est le nouveau champion du local : 30B, Apache 2.0, tourne sur 24 Go de VRAM, multimodal et agentique.
  • Les géants Kimi K3, Qwen3.8-Max et Hy4 nécessitent une infrastructure multi-nœuds ou le cloud — ils ne sont pas destinés au matériel local.
  • Aucune donnée de vitesse d’inférence (tokens/s) n’est fournie par les sources pour ces modèles. Les classements de « rapidité » sont qualitatifs, sauf pour DSpark et les frameworks d’inférence (voir section 3).

3. Performances et benchmarks : ce que les chiffres disent (et ne disent pas)

Scores de qualité (MMLU, HumanEval, BenchLM, benchmarks spécialisés)

Les seuls benchmarks chiffrés dans les sources concernent des modèles antérieurs à 2026, rapportés par techsy.io :

Source : siliconflow.com
Modèle MMLU HumanEval
Llama 3.3 70B (déc. 2024) 86,0 88,4
Qwen 2.5 72B (sept. 2024) 85,0+ 86,6
DeepSeek-V3 (déc. 2024) 87,1 82,6
Mistral Small 3.1 (mars 2025) 80,6 88,4
Gemma 3 27B (mars 2025) ~78,6 87,8

Pour les modèles de 2026 (Qwen3, Gemma 4, DeepSeek V4), aucun score MMLU/HumanEval n’est fourni par les sources. Le classement de techsy.io place Qwen 3 235B-A22B en tête pour le raisonnement et le code, et DeepSeek R1 en deuxième pour le raisonnement profond et les maths, mais sans métrique précise.

En revanche, le classement BenchLM d’août 2026 apporte des données chiffrées : Qwen3.8-Max mène à 79/100, suivi de dots3-note Preview (68,8) et Ornith-1.5-397B (68,5). Le classement compare 205 modèles open-weight au 21 août 2026, avec des scores de capacité mesurée (BenchAlign v5).

Pour les géants récents, quelques chiffres émergent :

  • Kimi K3 : Terminal-Bench score de 84,6 % (selon les benchmarks officiels), DeepSWE 70 points, GPQA élevé. Ces chiffres sont auto-déclarés par Moonshot et n’ont pas encore été tous vérifiés indépendamment.
  • GLM-5.3 : CyberGym 84,5 % (tête du benchmark, devant Claude Sonnet 5 et GPT-5.6 Sol), DeepSWE 66,9, Terminal-Bench 3.0 passant de 4,6 % à 28,3 % grâce au post-training. Ces résultats sont documentés par aireiter.com et the-agent-report.com.
  • Hy4 Preview : les benchmarks indépendants sont encore rares, mais Tencent annonce des performances de niveau frontier sur le codage et la recherche. Le modèle est déjà accessible sur OpenRouter.
  • Ox Alpha : ce modèle furtif, apparu le 20 août sur OpenRouter, impressionne les développeurs par ses capacités en code et en agents autonomes. Son origine est inconnue (certains soupçonnent un laboratoire chinois), et il restera gratuit jusqu’au 27 août. Aucun benchmark officiel n’est disponible, mais les retours communautaires sont élogieux.

Benchmarks d’inférence : vLLM vs TensorRT-LLM vs SGLang

Le blog Spheron propose un cadre de décision pour choisir son framework d’inférence en 2026. Les trois principaux concurrents se distinguent par leurs compromis :

  • vLLM : le plus flexible, avec un écosystème mature (PagedAttention, compatibilité avec la plupart des modèles). Idéal pour les déploiements variés et le throughput élevé.
  • TensorRT-LLM : optimisé pour les GPU NVIDIA, avec la latence la plus faible sur du matériel professionnel. Nécessite une compilation spécifique par modèle.
  • SGLang : excelle pour les workloads agentiques complexes grâce à son gestionnaire de radix attention, qui réduit la surcharge de calcul pour les requêtes répétitives.

DeepSeek DSpark, quant à lui, se positionne comme une couche d’accélération supplémentaire, compatible avec vLLM et SGLang, avec des gains de throughput de +51 % à +400 % selon les configurations (benchmarks de juillet 2026 sur A100 et H100).

Ce que les chiffres ne disent pas

Aucune source ne fournit de mesures de latence p50/p99 ou de tokens/s pour les modèles géants (Kimi K3, Qwen3.8-Max, Hy4) en conditions réelles. Les classements de « rapidité » sont qualitatifs, basés sur l’architecture MoE et les annonces des laboratoires. Pour des données fiables, il faudra attendre les benchmarks indépendants de la communauté (comme ceux de la LM Arena ou de BenchLM) sur les prochains mois.


4. Sécurité et écosystème : les enjeux de 2026

La faille NemoClaw : quand le garde du corps devient la faille

En août 2026, les chercheurs de Cyera’s Oasis Identity Research ont mis au jour une faille aussi ironique que redoutable : NemoClaw, le wrapper de sécurité signé Nvidia censé protéger les agents OpenClaw, contient lui-même une vulnérabilité critique. Via l’API Ollama, un attaquant peut empoisonner durablement les modèles LLM utilisés par les agents. Cette faille illustre les risques de l’écosystème open source : les outils de sécurité ne sont pas à l’abri, et la surface d’exposition (réseau, documents, données d’entraînement) est vaste. Les recommandations des experts incluent le durcissement des configurations Ollama, la surveillance des appels API et la validation des données d’entraînement.

Ray Summit 2026 : le RL post-training force la convergence

Le Ray Summit 2026, qui s’est tenu fin août à San Francisco, a marqué un tournant : le RL post-training (apprentissage par renforcement après l’entraînement initial) impose désormais des infrastructures open source unifiées. La co-localisation avec la vLLM Conference sous le même toit reflète un changement structurel : les frameworks d’inférence et d’orchestration convergent pour supporter les workloads de fine-tuning et de post-training. Pour les entreprises, cela signifie que les outils open source (Ray, vLLM, SGLang) deviennent des briques essentielles, au même titre que les modèles eux-mêmes.

Outils de fine-tuning : Axolotl et compagnie

Le fine-tuning reste un pilier de l’écosystème open source. Axolotl, par exemple, supporte plus de 100 modèles, avec un support multimodal natif (LLaMA-Vision, Qwen2-VL, Pixtral). Un fine-tuning de Llama-3.1 8B en QLoRA (2 époques, 512 tokens, A100 40 Go) prend environ 5,8 heures. Les batch sizes typiques vont de 1 à 4, et les formats de quantification (GGUF, AWQ, GPTQ, FP8) permettent d’adapter les modèles à des contraintes matérielles variées.

Ox Alpha : le mystère qui intrigue

Depuis le 20 août, un modèle de raisonnement gratuit sans éditeur connu tourne sur OpenRouter. Ox Alpha, spécialisé dans le code et les agents autonomes, a impressionné les développeurs par ses performances. Son origine est inconnue — certains soupçonnent un laboratoire chinois — et il restera accessible gratuitement jusqu’au 27 août. Ce phénomène rappelle que l’écosystème open source est aussi un terrain de jeu pour l’expérimentation et le mystère, mais il soulève des questions de confiance et de sécurité.


Conclusion : l’open source a gagné la guerre des modèles, la bataille de l’infrastructure commence

En septembre 2026, l’open source a définitivement gagné la guerre des modèles : des géants comme Kimi K3, Qwen3.8-Max, GLM-5.3, Hy4 et DeepSeek V4 Pro rivalisent avec les meilleurs systèmes propriétaires, à des prix cassés. Mais la bataille de l’infrastructure ne fait que commencer. La vitesse d’inférence, la latence et le coût par requête deviennent les critères décisifs pour le déploiement en production. Les frameworks comme vLLM, TensorRT-LLM, SGLang et DSpark se livrent une concurrence féroce, et la quantification reste un passage obligé pour faire tourner des modèles de 100 milliards sur du matériel accessible.

Source : tech-insider.org

Pour les entreprises et les développeurs, le choix d’un modèle ne peut plus se faire sur le seul score MMLU. Il faut considérer l’architecture (MoE vs dense), la VRAM nécessaire, la licence, l’écosystème d’outils et les performances d’inférence. Les classements comme BenchLM et les benchmarks communautaires sont des points de départ, mais les tests en conditions réelles restent indispensables. L’open source a gagné la guerre des modèles — la bataille de l’infrastructure commence, et elle promet d’être tout aussi passionnante.


Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *