Magazine LLM Opensource · 4 September 2026Open source 2026 : DeepSeek V4, Kimi K3, Qwen 3.6, GLM-5.3 et Muse Glimmer — le match à cinq qui a rebattu les cartes
Cinq modèles, cinq philosophies, un même objectif : détrôner les poids lourds propriétaires. DeepSeek V4 a ouvert le bal en avril, Kimi K3 a répondu en juillet avec un mastodonte multimodal, Qwen 3.6 a joué la carte de la sobriété, GLM-5.3 a surgi en août sur le terrain du codage agentique et de la cybersécurité, et Meta a surpris tout le monde avec Muse Glimmer, un modèle agentique 30B pensé pour tourner sur un PC. Voici ce qui les distingue vraiment, au-delà des fiches techniques, et comment choisir selon vos besoins réels.
Août 2026 : le quatuor (et plus) qui a fait basculer l’open-source
Il y a encore deux ans, l’idée que des modèles à poids ouverts puissent rivaliser avec les fleurons propriétaires sur des benchmarks de codage relevait de la foi militante. En août 2026, c’est un fait établi. DeepSeek V4 Pro, Kimi K3, Qwen 3.6, GLM-5.3 et Muse Glimmer dominent les classements open-weights, et l’écart avec GPT-5.5 ou Claude Opus 4.8 s’est réduit à une peau de chagrin — sur 95 % des benchmarks, DeepSeek V4 égale les modèles propriétaires, selon les données compilées par Codersera en juillet 2026.
Le basculement s’est opéré en l’espace de quelques mois. DeepSeek a frappé la première fin avril 2026 avec sa V4, déclinée en deux versions (Pro et Flash), toutes deux sous licence MIT. Alibaba a répondu dans la foulée avec Qwen 3.6, disponible en deux gabarits (27B dense et 35B-A3B MoE), sous Apache 2.0. Puis Moonshot AI a dégainé en juillet avec Kimi K3, un modèle de 2,8 trillions de paramètres au total, multimodal et doté d’une licence propriétaire restrictive. Le 11 août, Meta a publié Muse Glimmer, un modèle agentique de 30 milliards de paramètres sous licence Apache 2.0, accompagné d’un manifeste de 6 500 mots signé Mark Zuckerberg plaidant pour l’IA open-weight. Et le 14 août, Z.ai a lâché GLM-5.3, un MoE de 743 milliards de paramètres qui a immédiatement dominé les benchmarks de codage et de cybersécurité.
Ce qui frappe, c’est le rythme. Cinq générations majeures en cinq mois, des budgets de calcul qui n’ont rien à envier à ceux d’OpenAI ou d’Anthropic (bien qu’aucune source officielle ne publie les FLOPs exacts), et une communauté open-source qui a appris à intégrer ces modèles en quelques semaines. Les classements de référence comme BenchLM ou LLM-Stats ont dû être mis à jour à plusieurs reprises pour suivre le rythme. Le paysage a changé de nature : l’open-source n’est plus l’alternative économique, il est devenu le terrain où se joue l’innovation la plus visible.
La preuve par les chiffres : en juin 2026, les modèles chinois représentaient déjà 61 % du trafic développeur sur OpenRouter, selon les données agrégées par la plateforme. DeepSeek V4 Flash était le modèle le plus utilisé au monde avec 619 milliards de tokens par jour, devant Hy3 Preview de Tencent (451B) et MiniMax M3 (447B). Les éditeurs américains (OpenAI, Anthropic, Google) ont perdu quarante points de part de marché en douze mois, passant d’environ 70 % à 30 % des tokens. L’open-source n’est plus une promesse : c’est le marché.
Fiche d’identité : 1,6T, 2,8T, 753B, 35B, 30B — cinq philosophies, cinq gabarits
Avant de comparer les performances, posons les bases. Chaque modèle incarne une stratégie différente, tant par la taille que par l’architecture.

| DeepSeek V4 Pro | DeepSeek V4 Flash | Kimi K3 | Qwen3.6-27B | Qwen3.6-35B-A3B | GLM-5.3 | Muse Glimmer | |
|---|---|---|---|---|---|---|---|
| Sortie | Avril 2026 (prod. 12 août) | Avril 2026 | Juillet 2026 | Avril 2026 | Avril 2026 | 14 août 2026 | 11 août 2026 |
| Paramètres totaux | 1,6 trillion | 284 milliards | 2,8 trillions | 27 milliards | 35 milliards | 743 milliards | 30 milliards |
| Paramètres actifs | 49 milliards | 13 milliards | 104 milliards | 27 milliards | 3 milliards | ~30 milliards (est.) | 30 milliards |
| Architecture | MoE + sparse attention | MoE + sparse attention | MoE (896 experts) | Dense, attention hybride | MoE, attention hybride | MoE | Dense, agentique |
| Contexte natif | 1M tokens | 1M tokens | 1M tokens | 262K tokens | 262K tokens | 1M tokens | 128K tokens |
| Extension contexte | — | — | — | 1M via YaRN | 1M via YaRN | — | — |
| Modalités | Texte | Texte | Texte + Image + Vidéo | Multimodal | Multimodal | Texte | Multimodal |
| Licence | MIT | MIT | Custom (restrictive) | Apache 2.0 | Apache 2.0 | Open-weight (poids différés) | Apache 2.0 |
Sources : ComputingForGeeks, Codersera, TechVerdict, the-agent-report.com, contextstudios.ai
Cinq philosophies se dessinent. DeepSeek mise sur l’efficacité : un modèle massif (1,6T) mais seulement 49 milliards de paramètres actifs par passage, grâce à une architecture MoE couplée à une attention sparse. Kimi K3 pousse la logique à l’extrême avec 2,8T de paramètres et 896 experts, dont 104 milliards seulement sont sollicités à chaque inférence — un ratio actif/total parmi les plus agressifs du marché. Qwen, à l’inverse, choisit la sobriété : son plus gros modèle open-weights ne dépasse pas 35 milliards de paramètres, avec seulement 3 milliards actifs pour la version MoE. Une philosophie "edge-first" qui vise les déploiements locaux. GLM-5.3 de Z.ai réutilise la base MoE de 743 milliards de paramètres de GLM-5.2, sans aucun nouveau paramètre — tout est dans le post-entraînement. Enfin, Muse Glimmer de Meta est un modèle dense de 30B, spécifiquement conçu pour les agents et le déploiement local sur PC ou Mac.
Notons au passage une clarification nécessaire : le "Qwen 3.5" que certains attendaient n’existe pas. Alibaba a directement publié Qwen 3.6 en avril 2026, et son successeur Qwen3.7-Max (mai 2026) est resté en closed-weight. La version 3.6 reste donc le flagship open-weights de la famille, même si Qwen3.8-Max (2,4T paramètres, MoE) a été annoncé comme le nouveau flagship propriétaire de la marque.
Benchmarks : qui code le mieux, qui raisonne le plus loin ?
C’est ici que les choses se corsent. DeepSeek V4 Pro est le seul des trois premiers à avoir publié des scores complets sur les benchmarks de référence — et ils sont impressionnants. Mais GLM-5.3 a débarqué avec des chiffres tout aussi solides, et Muse Glimmer apporte une dimension agentique nouvelle.
| Benchmark | DeepSeek V4 Pro | Kimi K3 | Qwen 3.6 | GLM-5.3 | Muse Glimmer |
|---|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | Non publié | Non publié | Non publié | Non publié |
| LiveCodeBench | 93,5 | Non publié | Non publié | Non publié | Non publié |
| MMLU-Pro | 87,5 (égalité avec GPT-5.5) | Non publié | Non publié | Non publié | Non publié |
| GPQA Diamond | 90,1 % | Non publié | Non publié | Non publié | Non publié |
| CyberGym | Non publié | Non publié | Non publié | 84,5 % | Non publié |
| DeepSWE | Non publié | Non publié | Non publié | 66,9 | Non publié |
| Terminal-Bench 3.0 | Non publié | Non publié | Non publié | 28,3 % | Non publié |
Sources : Codersera, TechVerdict, aireiter.com, the-agent-report.com
Le 80,6 % sur SWE-bench Verified, confirmé par deux sources indépendantes, place DeepSeek V4 Pro au niveau des meilleurs modèles propriétaires pour la résolution de tickets GitHub réels. Le 87,5 sur MMLU-Pro, à égalité avec GPT-5.5 selon Codersera, confirme une solide culture générale. Et le 90,1 % sur GPQA Diamond — un benchmark de raisonnement de niveau doctorat — suggère une capacité de raisonnement profond qui dépasse le simple copier-coller de patterns.
Mais l’absence de scores publics pour Kimi K3 et Qwen 3.6 est en soi un signal. Pour Kimi K3, cela peut s’expliquer par sa sortie récente (juillet 2026) : les équipes n’ont pas encore eu le temps de publier des évaluations indépendantes. Pour Qwen 3.6, c’est plus surprenant — Alibaba a historiquement communiqué des benchmarks détaillés. Cette discrétion pourrait refléter une stratégie différente : plutôt que de viser les sommets des classements génériques, Qwen 3.6 semble optimisé pour des cas d’usage spécifiques (edge, déploiement local) où les benchmarks classiques sont moins pertinents.
GLM-5.3, lui, a publié des scores ciblés qui en disent long sur sa stratégie. Son 84,5 % sur CyberGym, un benchmark de cybersécurité, le place en tête devant Claude Sonnet 5 et GPT-5.6 Sol. Son 66,9 sur DeepSWE (un benchmark de résolution de tickets GitHub) et son 28,3 % sur Terminal-Bench 3.0 — contre 4,6 % pour la version précédente — montrent une progression spectaculaire obtenue uniquement par le post-entraînement, sans aucun nouveau paramètre. C’est la démonstration que l’architecture n’est plus le seul facteur : le post-training est devenu le champ de bataille décisif.
Il faut aussi mentionner que Codersera classe Kimi K2.6 (le prédécesseur de K3) comme le meilleur modèle open-weights avec un score de 54 sur l’Artificial Analysis Index, mais le place 15 points derrière DeepSeek V4 Pro sur SWE-bench Verified. Si K3 suit la même trajectoire d’amélioration que ses prédécesseurs, il pourrait combler une partie de l’écart — mais nous n’avons aucune donnée pour le confirmer.
Sous le capot : MoE massif, attention sparse, routage hybride, post-training roi
Les chiffres de paramètres ne racontent qu’une partie de l’histoire. Ce qui distingue vraiment ces modèles, c’est leur architecture interne, et les choix faits par chaque équipe ont des conséquences concrètes sur l’expérience d’utilisation.

DeepSeek V4 combine MoE et sparse attention. La partie MoE est classique : seuls 49 milliards de paramètres sur 1,6 trillion sont activés à chaque token. L’innovation vient de la sparse attention, qui compresse les tokens de manière sélective au lieu de tous les traiter de façon uniforme. Concrètement, cela permet de gérer un contexte de 1M tokens sans explosion du coût computationnel. DeepSeek a d’ailleurs publié en juin 2026 un framework complémentaire, DSpark, qui améliore le throughput de 51 à 52 % en production (et jusqu’à +400 % selon les configurations), avec une dégradation de qualité inférieure à 0,3 % de BLEU. Ce framework, sous licence MIT, est compatible avec vLLM et SGLang — un écosystème mature qui facilite l’adoption. La version production de V4 Pro, désignée V4 Pro 0813, est sortie de preview le 12 août 2026, après près de quatre mois de test.
Kimi K3 pousse le MoE à un niveau inédit avec 896 experts. C’est deux à trois fois plus que la plupart des modèles concurrents. L’avantage théorique : une spécialisation plus fine des experts, chaque expert pouvant se concentrer sur un domaine très précis. Le risque : un routage plus complexe, qui peut dégrader les performances si le mécanisme de sélection n’est pas parfaitement calibré. Moonshot AI a également intégré la multimodalité (texte, image, vidéo) directement dans l’architecture, ce qui en fait le seul des cinq à gérer nativement la vidéo.
Qwen 3.6 opte pour l’attention hybride, une approche qui combine attention full (sur les tokens récents) et attention sparse (sur les tokens anciens). C’est une solution pragmatique pour les modèles de petite taille : elle permet d’atteindre un contexte natif de 262K tokens, extensible à 1M via YaRN, sans le coût quadratique d’une attention complète. Pour un modèle de 27B, c’est un choix judicieux qui équilibre qualité et consommation de ressources.
GLM-5.3 est le cas le plus intéressant d’un point de vue stratégique : Z.ai a réutilisé la base MoE de 743 milliards de paramètres de GLM-5.2, sans aucun nouveau paramètre. Toute la valeur ajoutée vient du post-entraînement, qui a fait passer Terminal-Bench 3.0 de 4,6 % à 28,3 % et propulsé le modèle en tête du benchmark CyberGym avec 84,5 %. C’est la preuve que l’architecture n’est plus le seul facteur de performance : le post-training est devenu le champ de bataille décisif, comme l’a confirmé le Ray Summit 2026, où l’infrastructure de RL post-training a cessé d’être un assemblage de bricolage pour devenir un standard industriel.
Muse Glimmer de Meta est un modèle dense de 30B, conçu spécifiquement pour les agents. Son architecture intègre des mécanismes de raisonnement multi-étapes et une gestion native des appels d’outils, ce qui le distingue des LLM classiques. Il est optimisé pour le déploiement local : il tourne sur une RTX 5090 comme sur un MacBook M4 Max, et sa licence Apache 2.0 en fait le choix naturel pour les entreprises qui veulent éviter les restrictions d’usage.
En pratique, ces différences se traduisent par des comportements distincts. Sur un contexte de 1M tokens, DeepSeek V4, Kimi K3 et GLM-5.3 peuvent traiter des documents entiers (manuels techniques, codebases complètes, transcriptions de réunions) sans découpage. Qwen 3.6, avec son contexte natif de 262K, est déjà confortable pour la plupart des usages RAG, mais devra recourir à YaRN pour les cas extrêmes — avec un léger risque de dégradation de la qualité sur les très longues séquences. Muse Glimmer, avec ses 128K tokens, est plus limité mais largement suffisant pour des tâches agentiques typiques.
Le vrai terrain : vitesse d’inférence, quantification et fine-tuning
Les benchmarks académiques ne disent rien de la réalité d’un déploiement en production. Voici ce que les équipes techniques doivent savoir.
Vitesse d’inférence. Les données OpenRouter de juin 2026 donnent une indication précieuse : DeepSeek V4 Flash est le modèle le plus utilisé au monde avec 619 milliards de tokens par jour, ce qui témoigne d’une excellente performance en production. DeepSeek V4 Pro suit avec 300B tokens/jour. Kimi K2.6 (le prédécesseur de K3) est à environ 150B tokens/jour. Ces volumes réels sont plus éloquents que n’importe quel benchmark de laboratoire. Le framework DSpark de DeepSeek améliore significativement les performances en production (+51 à +52 % de throughput, avec des gains de latence de 57 à 78 % sur V4 Pro et 60 à 85 % sur V4 Flash selon les configurations), ce qui donne un avantage certain à l’écosystème DeepSeek pour les déploiements à grande échelle.
Quantification. Là encore, pas de données spécifiques publiées pour ces modèles. Les repères génériques de 2026 restent valables : un modèle 70B en FP16 pèse environ 140 Go, en FP8 environ 70 Go, en AWQ/GPTQ 4-bit environ 35-40 Go. Pour DeepSeek V4 Pro (1,6T total), même en INT4, la VRAM nécessaire dépasserait les 200 Go — hors de portée des GPU grand public. En revanche, les versions actives (49B) permettent une inférence sur des clusters de 2-4 GPU H100 en FP8. Kimi K3, avec 104B actifs, nécessitera au minimum 4-8 GPU haut de gamme. GLM-5.3, avec ses 743B de paramètres totaux, se situe dans la même catégorie que DeepSeek V4 Pro. Qwen 3.6, avec ses 3B actifs pour la version MoE, peut tourner sur un GPU grand public en FP16 (environ 70 Go pour le 27B dense, moins pour la version MoE). Muse Glimmer, avec ses 30B denses, tient dans environ 60 Go en FP16, ce qui le rend compatible avec une RTX 5090 ou un MacBook M4 Max.
Fine-tuning. Les cinq modèles supportent les approches standard (LoRA, QLoRA). DeepSeek V4 bénéficie de l’écosystème le plus mature grâce à sa licence MIT et à la compatibilité avec des outils comme Axolotl (qui supporte plus de 100 modèles). Qwen 3.6, sous Apache 2.0, est également bien intégré. Muse Glimmer, sous Apache 2.0, est déjà supporté par Unsloth, qui propose des notebooks de fine-tuning dédiés. GLM-5.3, avec ses poids différés, devrait être intégré rapidement. Kimi K3, avec sa licence custom, pourrait poser des problèmes pour les cas d’usage commerciaux — nous y reviendrons.
Coût d’exploitation. Les prix API publiés par Codersera pour DeepSeek V4 sont remarquablement bas : 0,435 $ par million de tokens en entrée et 0,87 $ en sortie pour le Pro ; 0,14 $ en entrée et 0,28 $ en sortie pour le Flash. Ces tarifs, s’ils sont confirmés (une autre source les conteste partiellement), rendent l’inférence de qualité propriétaire accessible à des coûts défiant toute concurrence. Sur OpenRouter, DeepSeek V4 Pro est d’ailleurs proposé à un prix nettement inférieur à celui de Kimi K3, tout en offrant le même contexte de 1M tokens. Pour Kimi K3, Qwen 3.6 et GLM-5.3, aucun prix API public n’est disponible — les déploiements se feront principalement en self-hosted.
Coding, RAG, edge, agentique, cybersécurité : le match par cas d’usage
Chaque modèle a son terrain de prédilection. Voici une synthèse pour les praticiens.

| Cas d’usage | DeepSeek V4 Pro | Kimi K3 | Qwen 3.6 | GLM-5.3 | Muse Glimmer |
|---|---|---|---|---|---|
| Codage agentique | Excellent (SWE-bench 80,6 %) | Prometteur, non confirmé | Bon | Excellent (DeepSWE 66,9, Terminal-Bench 28,3 %) | Bon (agents locaux) |
| Cybersécurité | Non évalué | Non évalué | Non évalué | Excellent (CyberGym 84,5 %) | Non évalué |
| RAG long contexte | Excellent (1M tokens) | Excellent (1M tokens) | Bon (262K natif, 1M via YaRN) | Excellent (1M tokens) | Moyen (128K) |
| Edge / local | Non (trop lourd) | Non (trop lourd) | Excellent (3B actifs) | Non (trop lourd) | Excellent (30B, RTX 5090, MacBook) |
| Multimodal | Non | Oui (texte, image, vidéo) | Oui | Non | Oui |
| Agents autonomes | Bon | Bon | Moyen | Excellent (codage agentique) | Excellent (conçu pour) |
Pour le codage agentique, DeepSeek V4 Pro et GLM-5.3 sont les deux meilleurs choix. Le premier grâce à ses scores SWE-bench et LiveCodeBench, le second grâce à sa progression spectaculaire sur Terminal-Bench et DeepSWE, obtenue uniquement par le post-entraînement. GLM-5.3 est particulièrement adapté aux tâches de cybersécurité, un domaine où il domine les modèles propriétaires.
Pour le RAG long contexte, DeepSeek V4 Pro, Kimi K3 et GLM-5.3 excellent avec leur contexte natif de 1M tokens. Qwen 3.6 est un bon compromis pour des usages plus légers, avec son contexte de 262K extensible à 1M.
Pour l’edge et le déploiement local, Qwen 3.6 (3B actifs) et Muse Glimmer (30B) sont les seuls viables. Muse Glimmer a l’avantage d’être spécifiquement conçu pour les agents et de tourner sur du matériel grand public, ce qui en fait le choix naturel pour les PME soucieuses de RGPD et de souveraineté des données.
Pour les agents autonomes, Muse Glimmer est le plus spécialisé, avec son architecture pensée pour le raisonnement multi-étapes et les appels d’outils. GLM-5.3 est également très performant sur les tâches agentiques de codage, comme en témoigne son score Terminal-Bench.
Le contexte qui change tout : la guerre des prix et la domination chinoise
Au-delà des fiches techniques, un phénomène de fond mérite d’être souligné : la domination chinoise sur l’open-source. En juin 2026, les modèles chinois représentaient 61 % du trafic développeur sur OpenRouter, contre environ 30 % pour les modèles américains. DeepSeek, Xiaomi, MiniMax, Tencent et Alibaba trustent le top 8 des éditeurs. Cette bascule s’explique par une combinaison de facteurs : des prix défiant toute concurrence (DeepSeek V4 Pro à 0,435 $/M tokens en entrée), des licences permissives (MIT, Apache 2.0) et une qualité qui n’a plus rien à envier aux modèles propriétaires.
La réponse américaine est venue de Meta avec Muse Glimmer, un modèle agentique 30B sous Apache 2.0, accompagné d’un manifeste de Mark Zuckerberg plaidant pour l’IA open-weight. C’est un signal fort : même les géants américains reconnaissent que l’open-source est devenu le terrain où se joue l’innovation. Mais il faudra plus qu’un modèle de 30B pour inverser la tendance face à des laboratoires chinois qui publient des modèles de 700 milliards de paramètres à un rythme effréné.
Un autre phénomène mérite l’attention : l’émergence de modèles "stealth" comme Ox Alpha, apparu sur OpenRouter le 20 août 2026 sans éditeur connu, et qui impressionne les développeurs par ses capacités en codage et en agents autonomes. Son origine reste inconnue, certains suspectant un laboratoire chinois. Ce genre de fuite anonyme serait impensable il y a deux ans — c’est le signe que l’open-source est devenu un espace de concurrence féroce où l’innovation ne suit plus les canaux traditionnels.
Sources
- ComputingForGeeks — Open Source LLM Comparison
- Codersera — Best Open Source LLM 2026
- Codersera — DeepSeek V4 Alternatives
- TechVerdict — Best Non-Cloud LLMs 2026
- Unite.ai — DeepSeek V4 Pro Leaves Preview
- Techbooky — DeepSeek V4-Pro Price War
- The Agent Report — GLM-5.3 Post-Training
- Aireiter — GLM-5.3 Benchmarks
- Cybersecurity News — Z.ai GLM-5.3
- Context Studios — Muse Glimmer
- ITdaily — Meta Muse Glimmer
- SFTPMAC — OpenRouter Classement Juin 2026
- QwenCloud — Qwen3.8-Max
- Hugging Face — Qwen3.6-27B
- Unsloth — GitHub
- Ray Summit 2026 — RL Post-Training
- Business Insider — Ox Alpha
- IT Social — Ox Alpha
Article recherché et rédigé automatiquement · Magazine Electrosens