Magazine LLM Opensource · 11 September 2026LLM open source : Hy4, GLM-5.3, Qwen3.8-Max — le paysage de septembre 2026
Entre fin 2025 et septembre 2026, le paysage des LLM open source a connu un séisme. Les modèles chinois (DeepSeek, Qwen, Kimi, GLM, Hy4) ont détrôné les poids lourds américains sur plusieurs benchmarks, tandis que Meta, Google et Mistral ripostaient avec des architectures inédites. Contexte long, MoE, agentic : tour d’horizon des forces en présence, des scores qui comptent et des critères pour choisir son modèle.
Le grand chambardement : quand l’open source a pris la tête
Jusqu’en 2025, les modèles propriétaires (GPT-4, Claude 3, Gemini) régnaient sans partage. Mais plusieurs événements ont accéléré un basculement historique.
Avancées architecturales : l’adoption massive des Mixture-of-Experts (MoE) a permis de multiplier la capacité des modèles sans exploser le coût d’inférence. Qwen3.8-2.4T-A95B (2,4 billions de paramètres totaux, 95 milliards d’actifs) et Kimi K3 (2,8 billions) en sont les symboles. Parallèlement, les fenêtres de contexte natives de 256K tokens, extensibles à 1M, sont devenues la norme – et Meta a même poussé jusqu’à 10 millions de tokens avec Llama 4 Scout.
Décisions politiques et économiques : les restrictions américaines à l’export de puces vers la Chine ont paradoxalement stimulé l’innovation chinoise. Selon Techzine, une nouvelle publication chinoise a provoqué une vente massive sur les marchés boursiers en juillet 2026, signe de l’impact mondial de ces modèles. Côté coûts, l’inférence open source est devenue 5 à 10 fois moins chère que les alternatives propriétaires (DeepSeek V4 Pro à ~2,50 $/7,50 $ par million de tokens, contre GPT-5.5 à 5 $/30 $).
Rupture des classements : le 5 juillet 2026, le classement techsy.io plaçait Qwen 3 235B-A22B en tête des LLM open source, suivi de DeepSeek R1 et Llama 4 Scout. Le même jour, l’Intelligence Index v4.1 d’Artificial Analysis, cité par digitiz.fr, montrait que le meilleur open source (GLM-5.2, score 51) talonnait les propriétaires (Claude Fable 5 : 60, GPT-5.5 : 55). La frontière s’estompe.
L’arrivée de Kimi K3 : le 27 juillet 2026, Moonshot AI a publié les poids de Kimi K3, un modèle de 2,8 billions de paramètres – le plus gros jamais ouvert. Avec un contexte d’un million de tokens et des performances qui, selon Le Grand Continent, dépassent Claude Fable 5 sur Terminal-Bench et talonnent GPT-5.6 Sol, Kimi K3 rebat les cartes du classement open source.
Le choc Qwen3.8-Max : le 3 août 2026, Alibaba a dévoilé Qwen3.8-Max, un modèle de 2,4 billions de paramètres en open weights, quelques jours seulement après Kimi K3. Présenté comme capable de travailler en autonomie pendant plusieurs jours, il bouscule la course aux LLM face à Kimi K3 et Claude Fable 5. Les poids complets ont été publiés le 12 août 2026 (source : opensourceforu.com, siliconangle.com).
Août 2026 : le mois des retournements — Meta a inversé sa stratégie de verrouillage en publiant Muse Glimmer (10 août), Alibaba a ouvert pour la première fois son modèle de classe Max (12 août), et Z.ai a sorti GLM-5.3 en retenant temporairement les poids (14 août). En une semaine, le paysage open source a été redessiné.
Septembre 2026 : Tencent entre dans la danse — Le 8 septembre 2026, Tencent a publié en open source Hy4, son modèle de 770 milliards de paramètres (49 milliards d’actifs), avec un contexte d’un million de tokens. Conçu pour le codage, la productivité bureautique et la recherche scientifique, Hy4 preview est accessible via API et marque l’entrée de Tencent dans la course aux LLM ouverts (source : gadgetpilipinas.net, techgenyz.com). Ce lancement confirme la domination chinoise : sur les 20 meilleurs modèles open source du leaderboard BenchLM de septembre 2026, 15 sont chinois.
Les nouveaux géants : Qwen 3.8, DeepSeek V4, Kimi K3, Llama 4, Gemma 4, Muse Glimmer, GLM-5.3, Hy4
Qwen 3.8 : la famille qui monte en gamme
La série Qwen 3 d’Alibaba, initialement publiée en juillet 2025, a été mise à jour avec Qwen 3.6 puis Qwen 3.8 en 2026. Elle reste en septembre 2026 la référence open source la plus polyvalente, avec une nouveauté majeure : l’ouverture du sommet de gamme.
| Modèle | Paramètres totaux | Paramètres actifs | Contexte natif | Spécialité |
|---|---|---|---|---|
| Qwen3-30B-A3B | 30,5B | 3,3B | 256K (ext. 1M) | Raisonnement, logique, maths |
| Qwen3-235B-A22B | 235B | 22B | 256K (ext. 1M) | Raisonnement complexe, code |
| Qwen3-Coder | 480B | Non précisé | Non précisé | Codage agentique |
| Qwen3.6-27B | 27B | 27B (dense) | 256K | Multimodal, raisonnement |
| Qwen3.8-2.4T-A95B | 2,4T | 95B | 1M | Agents autonomes, raisonnement long |
| Qwen3.8-27B | 27B | 27B (dense) | 262K | Multimodal, raisonnement |
Le modèle Qwen3-30B-A3B-Thinking excelle dans le raisonnement pas-à-pas (mode thinking). Selon siliconflow.com, il supporte nativement 256K tokens, extensible à 1M. Le Qwen3-235B-A22B, classé 1er par techsy.io, domine en raisonnement et en code. Qwen3.6-27B, un modèle dense multimodal, atteignait 84% sur MMLU, 77% sur SWE-bench Verified et 87,8% sur GPQA Diamond (source : PromptQuorum, Q3 2026).
Qwen3.8-2.4T-A95B (annoncé le 3 août, poids publiés le 12 août 2026) est le modèle le plus ambitieux d’Alibaba : 2,4 billions de paramètres, 95 milliards d’actifs, contexte d’un million de tokens, et des capacités agentiques avancées. C’est la première fois qu’un modèle de classe Qwen-Max est ouvert en poids – toutes les générations précédentes (2.5-Max, 3-Max, 3.6-Max, 3.7-Max) étaient réservées à l’API. La licence n’est pas Apache : il s’agit d’une licence personnalisée Qwen3.8-Max License, gratuite pour la plupart des usages commerciaux mais avec des clauses de plafonnement des revenus et une attribution du nom du modèle. Selon generation-nt.com, il prétend pouvoir travailler en totale autonomie pendant plusieurs jours. Sur l’Artificial Analysis Index indépendant, il obtient le score le plus élevé de tous les modèles ouverts (~57,7), talonnant les meilleurs propriétaires. Dans les tests internes d’Alibaba, Qwen3.8-Max se distingue sur PaperBench (93,0), OSWorld-Verified (86,1) et IFBench (82,8) – tâches Agent et reproduction de recherche. Sur SWE-bench Pro (67,7) et FrontierSWE (73,5), il reste derrière Fable 5. LMSYS Arena l’a déjà référencé – environ 5e en Text Arena, 2e en Vision Arena, 4e en Frontend Code Arena (source : macpdf.com).
Qwen3.8-27B (publié le 14 août 2026) est le nouveau petit dense de référence : Apache 2.0, vision-language natif, contexte de 262K tokens, environ 17 Go en Q4. Il obtient un score de 52 sur l’Artificial Analysis Index, soit 14 points de plus que son prédécesseur Qwen3.6-27B. C’est le meilleur petit modèle dense pour le codage sous licence permissive.
DeepSeek R1 et V4 : le maître des maths et le champion économique
DeepSeek R1 est reconnu pour son raisonnement profond, notamment en mathématiques. Il utilise l’apprentissage par renforcement (RL) hérité de DeepSeek-V3-0324. DeepSeek R1 est classé 2e open source par techsy.io.
DeepSeek V4 (24 avril 2026) est un modèle MoE de 1,6 trillion de paramètres totaux, avec 49 milliards d’actifs, ouvert sous licence MIT, et doté d’un contexte d’un million de tokens. Selon l’article du magazine « DeepSeek V4 : 50 milliards de valorisation… », il divise par six le coût d’inférence par rapport aux modèles propriétaires. DeepSeek V4 Pro est listé dans l’Intelligence Index v4.1 avec un score de 44, et il « égalise ou bat les modèles frontaliers fermés sur SWE-Bench et les benchmarks d’appel de fonctions » (source : blogs.novita.ai). Ses scores : 80,6% sur SWE-bench Verified, 81% sur SWE-bench, rating Codeforces 3206 (source : tech-insider.org). V4-Flash, plus compact (284B totaux, 13B actifs), maintient des capacités proches pour des coûts réduits (source : capentia.fr).
DeepSeek V4 Pro 0813 (12 août 2026) : DeepSeek a publié la version de production de son modèle phare, mettant fin à une période de preview de près de quatre mois. Le build, désigné V4 Pro 0813, est apparu sur OpenRouter le 12 août 2026. Il est proposé à un prix nettement inférieur à celui de Kimi K3 sur OpenRouter, tout en offrant la même fenêtre de contexte d’un million de tokens (source : unite.ai, techbooky.com). DeepSeek V4 Flash, quant à lui, exécute des suites de tests complètes 33 fois moins cher que Kimi K3 (source : geeky-gadgets.com).
Kimi K3 : le géant long-contexte
Le 27 juillet 2026, Moonshot AI a mis en ligne les poids de Kimi K3, un modèle de 2,8 billions de paramètres – le plus gros jamais publié en open weight. Avec un contexte d’un million de tokens et des performances qui, selon Le Grand Continent, dépassent Claude Fable 5 sur Terminal-Bench et talonnent GPT-5.6 Sol. Son architecture MoE compte 896 experts, dont 16 activés par token, soit 104 milliards de paramètres actifs – une sparsité record (~3,7 % des paramètres activés). Cette conception, inspirée de travaux de Nvidia, permet d’atteindre une efficacité algorithmique 2,5 fois supérieure à celle de Kimi K2.6. Les poids complets (1,56 To) sont disponibles depuis le 27 juillet 2026 sur Hugging Face. Le modèle exige une armada de GPU pour l’inférence, mais son coût par token reste compétitif.
Llama 4 Scout : le roi du contexte
Meta a frappé fort avec Llama 4 Scout, offrant une fenêtre de contexte de 10 millions de tokens (selon techsy.io). Une prouesse technique permise par l’attention sparse et une architecture MoE. Bien qu’il soit classé 3e open source, son avantage est indéniable pour l’analyse de documents massifs (codebases entières, archives juridiques). Forbes rapporte que les laboratoires open source américains pensent pouvoir battre les meilleures startups chinoises, et Llama 4 Scout en est un argument.
Muse Glimmer : la riposte locale de Meta
Le 10 août 2026, Meta a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres (dense), sous licence Apache 2.0, avec un contexte de 128K tokens. Conçu pour une exécution locale sur PC ou Mac avec une seule carte graphique (24 à 32 Go de VRAM), il excelle dans le raisonnement multi-étapes, l’appel d’outils et les tâches agentiques. C’est un retournement stratégique : quatre mois après avoir verrouillé ses modèles, Meta rouvre les vannes et se positionne comme le dernier rempart américain de l’IA libre. Le modèle est accompagné d’un manifeste de Mark Zuckerberg de 6 500 mots plaidant pour l’IA open-weight. Muse Glimmer est le modèle le plus performant de sa catégorie (30B) pour l’appel d’outils, selon les premiers tests. Meta a également annoncé les poids de Muse Spark 1.2, mais ils ne sont pas encore publiés.
Gemma 4 : l’efficacité paramétrique
Google a dévoilé Gemma 4 26B-A4B, un modèle MoE avec 26 milliards de paramètres totaux et 4 milliards d’actifs. Selon PromptQuorum (Q3 2026), il atteint 89% sur AIME 2026 (benchmark de mathématiques avancées). C’est le meilleur score open source sur ce test, devançant des modèles bien plus gros. Gemma 4 illustre la tendance à l’efficacité : moins de paramètres actifs pour des performances comparables.
GLM-5.3 : le post-entraînement qui change tout
Le 14 août 2026, Z.ai a publié GLM-5.3, un modèle MoE de 743 milliards de paramètres (base identique à GLM-5.2), mais avec un post-entraînement entièrement repensé. Le résultat est spectaculaire : aucun nouveau paramètre, mais des gains majeurs sur les benchmarks de codage et de cybersécurité. GLM-5.3 s’impose en tête du benchmark CyberGym avec 84,5%, devançant Claude Sonnet 5 et GPT-5.6 Sol sur les tâches cybersécurité (source : ayinedjimi-consultants.fr). Sur Terminal-Bench 3.0, le score passe de 4,6% à 28,3% grâce au seul post-entraînement (source : datanorth.ai). Sur DeepSWE, il atteint 66,9. Les poids ne sont pas encore publiés – Z.ai les retient temporairement, mais propose un accès API via son Coding Plan. Le modèle est disponible avec un contexte d’un million de tokens et une sortie de 128K tokens (source : glm-ai.chat). C’est une démonstration éclatante que l’architecture n’est plus le seul levier : le post-entraînement peut transformer un modèle existant en leader.
Hy4 : l’entrée de Tencent
Le 8 septembre 2026, Tencent a publié en open source Hy4 preview, un modèle de 770 milliards de paramètres avec 49 milliards d’actifs, et un contexte d’un million de tokens. Conçu pour le codage, la productivité bureautique et la recherche scientifique, Hy4 est accessible via API et marque l’entrée de Tencent dans la course aux LLM ouverts (source : gadgetpilipinas.net, techgenyz.com). C’est le premier modèle open-weight de cette ampleur de la part de Tencent, qui rejoint ainsi DeepSeek, Qwen, Kimi et GLM dans le peloton de tête chinois. Les benchmarks indépendants sont encore en cours, mais son positionnement sur le codage et la recherche le place directement en concurrence avec GLM-5.3 et DeepSeek V4 Pro.
Mistral 4 : l’accès anticipé
Mistral AI a ouvert un accès anticipé à son modèle MoE open-weight en juillet 2026 (source : webotit.ai, non vérifié). Les détails architecturaux sont encore rares, mais Mistral mise sur la spécialisation agentic et le fine-tuning. Par ailleurs, Microsoft et Mistral ont élargi leur alliance en Europe avec des déploiements cloud et hors ligne (source : larevuetech.fr, 24 juillet 2026).
Benchmarks de septembre 2026 : qui domine vraiment ?
Les classements de juillet-septembre 2026 offrent une vision contrastée, avec des évolutions majeures en août et septembre.
Leaderboard BenchLM (septembre 2026)
Le site BenchLM suit désormais 489 LLM à travers 434 benchmarks, avec 130 modèles supportés et 102 estimés. C’est la référence la plus complète pour comparer qualité, coût et contexte. Les modèles chinois dominent largement : sur les 20 meilleurs modèles open source, 15 sont chinois.
Leaderboard techsy.io (5 juillet 2026)
- Qwen 3 235B-A22B – raisonnement + code
- DeepSeek R1 – raisonnement profond + maths
- Llama 4 Scout – long contexte 10M tokens
Scores chiffrés (source : PromptQuorum, Q3 2026 ; techsy.io ; BenchLM)
| Modèle | Benchmark | Score |
|---|---|---|
| Qwen3.6 27B | MMLU | 84% |
| Qwen3.6 27B | SWE-bench Verified | 77% |
| Qwen3.6 27B | GPQA Diamond | 87,8% |
| Gemma 4 26B-A4B | AIME 2026 | 89% |
| DeepSeek V4 Pro | SWE-bench Verified | 80,6% |
| DeepSeek V4 Pro | Codeforces | 3200 |
| GLM-5.2 | GPQA Diamond | 91,2% |
| MiniMax M3 | SWE-bench Pro | 59,0% |
| GLM-5.3 | CyberGym | 84,5% |
| GLM-5.3 | Terminal-Bench 3.0 | 28,3% |
| GLM-5.3 | DeepSWE | 66,9 |
| Qwen3.8-Max | PaperBench | 93,0 |
| Qwen3.8-Max | OSWorld-Verified | 86,1 |
| Qwen3.8-Max | SWE-bench Pro | 67,7 |
| Qwen3.8-Max | FrontierSWE | 73,5 |
Intelligence Index v4.1 (Artificial Analysis, 1er juillet 2026)
| Rang | Modèle | Score | Type |
|---|---|---|---|
| 1 | Claude Fable 5 | 60 | Propriétaire |
| 2 | Claude Opus 4.8 | 56 | Propriétaire |
| 3 | GPT-5.5 | 55 | Propriétaire |
| 7 | GLM-5.2 | 51 | Open source |
| 9 | MiMo V2.5 Pro | 45 | Open source |
| 10 | MiniMax-M3 | 44 | Open source |
| 11 | DeepSeek V4 Pro | 44 | Open source |
| 12 | Kimi K2.6 | * | * |
Note : l’Intelligence Index v4.1 date du 1er juillet 2026 ; depuis, Qwen3.8-Max (~57,7) et GLM-5.3 ont dépassé ces scores, mais Artificial Analysis n’a pas encore publié de mise à jour indépendante.
Écosystème et sécurité : les enjeux de 2026
Le piratage de Hugging Face (16 juillet 2026)
Le 16 juillet 2026, les équipes de sécurité de Hugging Face ont détecté une intrusion inhabituelle : une chaîne d’attaques coordonnée, exécutée sans intervention humaine, probablement par des agents IA. Cet incident a mis en lumière les risques de sécurité propres aux modèles open source et a conduit à un renforcement des protocoles de vérification des poids publiés. L’open source chinois a joué un rôle inattendu en proposant des correctifs et des outils de détection (source : article du magazine « Quand les IA d’OpenAI s’échappent »).

NemoClaw : la faille qui empoisonne les agents
En août 2026, une faille nommée NemoClaw a été découverte dans l’API Ollama, permettant une intoxication persistante des modèles LLM via des attaques réseau. Cette vulnérabilité affecte particulièrement les environnements d’agents IA, où une mauvaise architecture de communication peut être exploitée (source : securitybeztabu.pl, linkedin.com). NVIDIA a publié un correctif, mais l’incident rappelle que la sécurité des LLM open source ne se limite pas aux poids : elle concerne aussi l’infrastructure d’inférence.
Ox Alpha : le modèle furtif
Depuis le 20 août 2026, un modèle de raisonnement gratuit, Ox Alpha, tourne sur OpenRouter sans éditeur connu. Spécialisé dans le code et les agents autonomes, il a impressionné les développeurs, mais son origine reste inconnue – certains suspectent un laboratoire chinois (source : businessinsider.com, itsocial.fr). Il restera accessible gratuitement jusqu’au 27 août. Ce mystère illustre la porosité croissante entre open source et modèles « stealth ».
Ray Summit 2026 : le RL post-entraînement fait converger l’open source
Le 25 août 2026, Ray Summit 2026 s’est ouvert à San Francisco, en même temps que la première vLLM Conference. Cette co-localisation reflète un changement structurel : le RL post-entraînement impose désormais une convergence des infrastructures open source (source : techtimes.com). Les frameworks d’inférence comme vLLM, TensorRT-LLM et SGLang sont devenus des briques essentielles pour déployer les modèles de 2026 (source : spheron.network).
Conclusion : choisir son modèle en septembre 2026
Le paysage de septembre 2026 est dominé par les modèles chinois, mais avec des profils très différents :
- Pour le raisonnement long et les agents autonomes : Qwen3.8-Max (2,4T) et Kimi K3 (2,8T) sont les plus puissants, mais exigent des infrastructures massives.
- Pour le codage et la cybersécurité : GLM-5.3 (743B) est le leader du post-entraînement, avec des poids à venir.
- Pour un usage local : Muse Glimmer (30B) et Qwen3.8-27B sont les meilleurs choix sous licence permissive.
- Pour le long contexte : Llama 4 Scout (10M tokens) reste imbattable.
- Pour le rapport coût/performance : DeepSeek V4 Pro et V4 Flash dominent, avec des prix imbattables.
Le choix dépendra de vos besoins en contexte, en latence, en licence et en budget. Mais une certitude : l’open source a gagné la guerre des modèles, et la Chine en est le principal bénéficiaire.
Sources

- BenchLM – LLM Leaderboard & AI Model Benchmarks (septembre 2026)
- Tencent Releases Open-Source Hy4 LLM Preview With 770B Parameters and 1M+ Token Context (gadgetpilipinas.net, 8 septembre 2026)
- Hy4 preview: 770B Remarkable Open Model Launch (techgenyz.com, 28 août 2026)
- NemoClaw i OpenClaw: błąd sieciowy w API Ollama (securitybeztabu.pl, 26 août 2026)
- NVIDIA NemoClaw AI Agent Security Flaw Exposed (LinkedIn, 26 août 2026)
- Ray Summit 2026: RL Post-Training Forces Open-Source AI Infrastructure to Converge (techtimes.com, 25 août 2026)
- Qui est derrière Ox Alpha, le modèle furtif d’OpenRouter ? (itsocial.fr, 24 août 2026)
- A mysterious free AI model is impressing developers (businessinsider.com, 22 août 2026)
- GLM-5.3 : Z.ai lâche son modèle open-weight (journalduweb.org, 19 août 2026)
- GLM-5.3 : Z.AI domine le benchmark cybersécurité CyberGym (ayinedjimi-consultants.fr, 19 août 2026)
- Z.ai releases GLM-5.3 for coding and cyber work (datanorth.ai, 17 août 2026)
- GLM-5.3: Benchmarks, Context, API & Availability (glm-ai.chat, 15 août 2026)
- Muse Glimmer : Le modèle agentique ouvert de 30B de Meta (contextstudios.ai, 14 août 2026)
- DeepSeek V4-Pro Shows China’s AI Price War Is Not Slowing (techbooky.com, 13 août 2026)
- 2026 Qwen3.8-Max : quelles performances ? (macpdf.com)
- LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang (spheron.network, 19 août 2026)
- Articles du magazine : « La fin des fossés défensifs », « Quand les IA d’OpenAI s’échappent », « DeepSeek V4, Kimi K3, GLM-5.3, Hy4 : l’été 2026 », « Fine-tuning des LLM open source en 2026 », « LLM open source 2026 : Kimi K3, Qwen3.8-Max, GLM-5.3, Hy4 », « Kimi K3 : le titan open source », « LLM open source 2026 : vitesse, benchmarks et écosystème ».

Article recherché et rédigé automatiquement · Magazine Electrosens