Magazine LLM Opensource · 14 September 2026LLM open source 2026 : la guerre froide des modèles s’intensifie, entre géants chinois, volte-face de Meta et nouveaux venus mystérieux
En septembre 2026, la compétition pour la suprématie des grands modèles de langage open source a pris une dimension géopolitique sans précédent. Alibaba a ouvert les poids de Qwen3.8-Max (2,4T de paramètres), Z.ai a dégainé GLM-5.3 qui domine le codage agentique et la cybersécurité, Moonshot AI impose Kimi K3 (2,8T), tandis que DeepSeek passe en production avec V4-Pro. Côté occidental, Meta a fait volte-face en publiant Muse Glimmer, un modèle agentique 30B qui tourne sur PC, et Mistral continue de défendre le pavillon européen. Pendant ce temps, Tencent a discrètement ouvert son modèle Hy4 (770B), et un mystérieux modèle nommé Ox Alpha s’est invité sur OpenRouter, alimentant les spéculations. Ce dossier dissèque les forces en présence, les stratégies de fine-tuning, les benchmarks qui font débat, et les implications pour les développeurs et les entreprises.
L’IA open source entre dans une nouvelle ère : la guerre froide des modèles
Depuis l’explosion des LLM open source en 2023, le paysage a radicalement changé. En 2025-2026, la bascule est nette : les modèles chinois, portés par des investissements massifs et une volonté de contourner les restrictions américaines sur les GPU, sont devenus des concurrents sérieux, voire dominants sur certains benchmarks. Selon le rapport State of Open Source on Hugging Face – Spring 2026, les modèles chinois ont capturé 41 % des téléchargements de LLM entre février 2025 et février 2026, devant les États-Unis (36,5 %). Un renversement que personne n’aurait parié il y a trois ans.
Le mois d’août 2026 restera comme un tournant. Plusieurs événements majeurs se sont enchaînés en quelques semaines :
- Le 10 août, Meta a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres sous licence Apache 2.0, conçu pour tourner sur un PC ou un Mac grand public. Une volte-face spectaculaire : quatre mois plus tôt, Meta avait verrouillé ses modèles. Mark Zuckerberg a accompagné cette sortie d’un manifeste open-weight de 6 500 mots plaidant pour l’IA libre comme « dernier rempart américain » face à la domination chinoise (01net, 11 août 2026).
- Le 12 août, Alibaba a ouvert les poids de Qwen3.8-Max (2,4T de paramètres, 95B actifs) — une première pour un modèle de classe Max, jusqu’ici réservé à l’API. Le même jour, DeepSeek a fait passer V4-Pro en production (build V4 Pro 0813), mettant fin à une préversion de près de quatre mois.
- Le 14 août, Z.ai a dévoilé GLM-5.3, un modèle qui ne change pas de taille (743B MoE, base GLM-5.2) mais qui, par le seul post-entraînement, a bondi de 4,6 % à 28,3 % sur Terminal-Bench 3.0 et domine le benchmark cybersécurité CyberGym avec 84,5 %.
- Le 20 août, un modèle de raisonnement anonyme baptisé Ox Alpha est apparu sur OpenRouter, gratuit jusqu’au 27 août, spécialisé dans le code et les agents autonomes. Son origine reste inconnue, certains soupçonnant un laboratoire chinois (Business Insider, 22 août 2026).
- Fin août, Tencent a ouvert en preview son modèle Hy4, un LLM de 770 milliards de paramètres (49B actifs) avec un contexte de plus d’un million de tokens, conçu pour le codage, la productivité bureautique et la recherche scientifique (gadgetpilipinas.net, 8 septembre 2026).
Le nombre de modèles open-weight publiés a explosé : le classement BenchLM recense désormais 101 modèles open-weight au 22 août 2026 (benchlm.ai), contre 95 en juillet. L’adoption par les développeurs est massive, portée par des plateformes comme Hugging Face et ModelScope. Mais cette effervescence cache des tensions : les accusations de pillage de données (Anthropic contre DeepSeek, OpenAI contre Moonshot), les contrôles à l’exportation américains sur les puces Nvidia, et les premières affaires de backdoors dissimulées dans des modèles open source redessinent la carte de l’IA. La question n’est plus seulement technique : elle est politique.
Qwen3.8-Max, Kimi K3, GLM-5.3, DeepSeek V4-Pro, Muse Glimmer, Hy4 : le match des géants
Les familles de modèles les plus emblématiques de 2026 illustrent la diversité des approches. Voici un tableau comparatif synthétique, construit à partir des sources disponibles (Brief IA, SiliconANGLE, Open Source For You, Digitiz, Tech-Insider, llm-stats.com, BenchLM, codersera.com, secondtalent.com, gadgetpilipinas.net) :
| Modèle | Date de sortie | Architecture | Taille totale / actifs | Contexte | Licence |
|---|---|---|---|---|---|
| Llama 4 Scout | Avril 2025 | MoE | 109B total / 17B actifs | 10M tokens | Community License |
| Llama 4 Maverick | Avril 2025 | MoE | 400B total / 17B actifs | Non précisé | Community License |
| DeepSeek V3.2 | Décembre 2025 | MoE | 671B total / 37B actifs | Non précisé | MIT |
| DeepSeek V4-Pro | 12 août 2026 (production) | MoE (sparse attention) | 1 600B total / 49B actifs | 1M tokens | MIT |
| Mistral Large 3 | Décembre 2025 | MoE | 675B total / 41B actifs | Non précisé | Apache 2.0 |
| Qwen 3.5 (Qwen3-235B-A22B) | Entrées leaderboard fév.-avril 2026 | MoE | 235B total / 22B actifs | 262k tokens | Apache 2.0 |
| Qwen3.8-Max (Qwen3.8-2.4T-A95B) | 12 août 2026 (poids) | MoE | 2 400B total / 95B actifs | 1M tokens | Licence custom Qwen3.8-Max |
| Qwen3.8-27B | 12 août 2026 | Dense (vision-language) | 27B | 262k tokens | Apache 2.0 |
| Kimi K3 | 27 juillet 2026 (poids) | Non précisé | 2 800B total | 1M tokens | Open source |
| GLM-5.3 | 14 août 2026 | MoE | 743B total / 40B actifs | 1M tokens | Poids différés (~2 semaines) |
| Muse Glimmer | 10 août 2026 | Dense | 30B | 128k tokens | Apache 2.0 |
| Tencent Hy4 (preview) | Fin août 2026 | Non précisé | 770B total / 49B actifs | 1M+ tokens | Open source (preview) |
Sources : Brief IA (4 août 2026), SiliconANGLE (3 août 2026), Open Source For You (4 août 2026), Digitiz.fr (17 mai 2026), Tech-Insider.org, llm-stats.com (juillet 2026), RTS (22 juillet 2026), codersera.com (18 août 2026), secondtalent.com (juillet 2026), BenchLM (22 août 2026), gadgetpilipinas.net (8 septembre 2026).
Qwen3.8-Max est l’événement du moment. Dévoilé le 3 août 2026 par Alibaba, ce modèle de 2 400 milliards de paramètres (2,4T) est le plus grand LLM open-weight jamais publié par le géant chinois. Il revendique un contexte de 1 million de tokens. Le 12 août, Alibaba a ouvert les poids de Qwen3.8-2.4T-A95B — la première fois qu’un modèle de classe Qwen-Max est open-weighted, toutes les versions précédentes (2.5-Max, 3-Max, 3.6-Max, 3.7-Max) étant réservées à l’API. La licence n’est pas Apache : il s’agit d’une licence custom « Qwen3.8-Max », gratuite pour la plupart des usages commerciaux mais avec des carve-outs basés sur le chiffre d’affaires (attribution du nom du modèle). Selon BenchLM (22 août 2026), Qwen3.8-Max mène le classement open-weight avec 79/100, devant dots3-note Preview (68,8) et Ornith-1.5-397B (68,5). La sortie s’accompagne de Qwen3.8-27B, une version plus petite sous Apache 2.0, native vision-language, avec un score Artificial Analysis de 52 — au niveau de GLM-5.2. Les analystes y voient une tentative directe de détrôner Claude et ChatGPT sur le terrain des agents autonomes, à un coût annoncé « cassé » (blog-nouvelles-technologies.fr).
Kimi K3 de Moonshot AI, dont les poids ont été publiés le 27 juillet 2026, est le plus grand modèle open-weight jamais développé : 2,8 trillions de paramètres, publiés sous forme d’environ 1,56 To de shards téléchargeables (secondtalent.com). Selon RTS, il est « presque au niveau des meilleurs » modèles américains. Mais sa réputation est ternie par des accusations de pillage : des officiels américains affirment que Moonshot aurait utilisé GPT-5.6 pour entraîner Kimi K3, et que le modèle aurait copié des éléments de Claude d’Anthropic (CNews, 23 juillet 2026).
GLM-5.3 de Z.ai, dévoilé le 14 août 2026, est le fer de lance du post-entraînement. Il réutilise la base Mixture-of-Experts de 743 milliards de paramètres (40B actifs) de GLM-5.2, mais avec un système d’entraînement entièrement repensé. Résultat : Terminal-Bench 3.0 passe de 4,6 % à 28,3 % par le seul post-entraînement, et le modèle domine le benchmark cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol (ayinedjimi-consultants.fr). Les poids sont différés d’environ deux semaines — une première pour Z.ai, qui justifie cette prudence par des considérations de sécurité. Le modèle est accessible via le « Coding Plan » et une API. Certaines sources mentionnent 753B de paramètres (journalduweb.org), mais la majorité s’accorde sur 743B ; la différence pourrait venir d’une confusion entre la taille totale et une variante de comptage.
Llama 4 se distingue par son contexte géant de 10 millions de tokens pour Scout, une première dans l’open source. Maverick ajoute une dimension multimodale native. Mais Meta a depuis verrouillé puis rouvert ses modèles : après avoir fermé ses poids en avril 2026, la publication de Muse Glimmer le 10 août marque un retournement stratégique. Ce modèle de 30 milliards de paramètres (dense, Apache 2.0, 128K contexte) est conçu pour les agents IA locaux : il tourne sur un GPU de 24-32 Go ou un Mac, et excelle dans le raisonnement multimodal et l’exécution d’agents sur appareil (research.meta.ai). Un manifeste de 6 500 mots signé Mark Zuckerberg accompagne la sortie, plaidant pour l’IA open-weight comme « dernier rempart américain » (ettayeb.fr, 12 août 2026).
DeepSeek V4-Pro est passé en production le 12 août 2026 (build V4-Pro 0813), après une préversion de près de quatre mois. Ses spécifications officielles : 1,6 trillion de paramètres totaux, 49B actifs, attention sparse (DSA ou CSA/HCA), contexte 1M tokens, prix d’entrée à 0,14 $/M tokens (FAITS DATÉS, techbooky.com). Il est proposé sur OpenRouter à un prix nettement inférieur à Kimi K3 pour un contexte de 1 million de tokens (techbooky.com). DeepSeek V4 Flash, version économique, exécute une suite de tests complète pour 72 $, soit 33 fois moins cher que Kimi K3 (geeky-gadgets.com). Mistral Large 3 mise sur la précision en function calling (96,8 % sur le Berkeley Function Calling Leaderboard) et une licence Apache 2.0, plus permissive que la Community License de Meta.
Tencent Hy4 est la surprise de la rentrée. Ouvert en preview fin août 2026, ce modèle de 770 milliards de paramètres (49B actifs) avec un contexte de plus d’un million de tokens est conçu pour le codage, la productivité bureautique et la recherche scientifique. Il est accessible via API et ses poids sont en open source (techgenyz.com, 28 août 2026). Son positionnement rappelle celui de DeepSeek V4 : un modèle massif mais efficace, taillé pour des usages professionnels concrets.
Enfin, Ox Alpha défraie la chronique. Depuis le 20 août, un modèle de raisonnement gratuit, sans éditeur connu, tourne sur OpenRouter. Spécialisé dans le code et les agents autonomes, il impressionne les développeurs par ses capacités, mais personne ne sait qui l’a créé — certains soupçonnent un laboratoire chinois cherchant à tester discrètement un modèle (Business Insider, 22 août 2026 ; IT Social, 24 août 2026). Il restera accessible gratuitement jusqu’au 27 août, avant de passer probablement en version payante ou de disparaître. Ce mystère illustre la nouvelle donne : en 2026, n’importe quel acteur peut lâcher un modèle compétitif dans la nature sans étiquette.
Benchmarks 2026 : qui domine vraiment le classement ?
Les chiffres parlent, mais ils sont à manier avec précaution. Les benchmarks traditionnels (MMLU, HumanEval) sont de moins en moins discriminants pour les modèles de pointe. L’édition #7 du benchmark FrenchBench (juillet 2026) confirme une bipolarisation inédite entre GPT-5 et Claude Opus 4.7 (95,4 vs 95,1 points), mais ces modèles sont fermés. Côté open source, voici les scores disponibles dans les sources :
- GLM-5.3 : 84,5 % sur CyberGym (benchmark cybersécurité) ; 28,3 % sur Terminal-Bench 3.0 (contre 4,6 % pour GLM-5.2) ; 66,9 sur DeepSWE (aireiter.com, 17 août 2026).
- Qwen3.8-Max : 79/100 sur le classement open-weight BenchLM (22 août 2026), en tête.
- DeepSeek V3.2 : 94,2 % sur MMLU (Digitiz, source unique).
- Mistral Large 3 : 96,8 % en function calling (Berkeley Leaderboard, Digitiz) ; meilleure option francophone et meilleur rapport performance/prix pour les ETI soumises au RGPD (FrenchBench, juillet 2026).
- Qwen 3 (235B-A22B) : classé #1 pour le raisonnement et le code selon techsy.io (juillet 2026), sans score chiffré.
- DeepSeek R1 : #2 pour le raisonnement mathématique profond (techsy.io).
- Llama 3.3 70B (décembre 2024) : 86,0 % MMLU, 88,4 % HumanEval (techsy.io).
- Qwen 2.5 72B (septembre 2024) : 85,0 %+ MMLU, 86,6 % HumanEval (techsy.io).
- DeepSeek-V3 (décembre 2024) : 87,1 % MMLU, 82,6 % HumanEval (techsy.io).
Le classement global de l’Open LLM Leaderboard (llm-stats.com, juillet 2026) utilise une métrique composite propriétaire. Les entrées DeepSeek d’avril 2026 affichent des scores MMLU de 44,0 et 39,7 (probablement une échelle différente). Les entrées Qwen (février et avril 2026) obtiennent 36,6 et 39,6. Ces chiffres ne sont pas directement comparables aux scores classiques.
Le chaos des palmarès : comme le souligne notre article « Trois guides, trois "meilleurs modèles" », le 5 juillet 2026 TECHSY couronnait Qwen 3 235B-A22B, le 7 août BenchLM sacrait MiniMax M3, et entre les deux ComputingForGeeks vantait DeepSeek V4 Pro et Kimi K3. Trois sources sérieuses, trois verdicts irréconciliables. Ce dérèglement s’explique par la multiplication des métriques propriétaires (BenchLM, LM Arena) et par des biais méthodologiques : contamination des données d’entraînement, surapprentissage sur les benchmarks publics, et choix des pondérations. Notre dossier « Benchmarks LLM 2026 » détaille ces angles morts : MMLU ne départage plus personne au-delà de 95 %, GSM8K et HumanEval sont à la retraite, et les nouveaux étalons qui comptent sont SWE-bench Verified, MMLU-Pro, GPQA Diamond et GAIA pour l’agentivité.
Le classement LM Arena de juillet 2026 place Claude Fable 5 en tête, suivi de près par GPT-5. Côté open source, la tendance est claire : les modèles chinois trustent les premières places du classement open-weight, avec Qwen3.8-Max en tête (79/100), devant dots3-note Preview (68,8) et Ornith-1.5-397B (68,5) (BenchLM, 22 août 2026).
Fine-tuning et post-entraînement : la nouvelle frontière
Si 2025 était l’année des architectures, 2026 est celle du post-entraînement. GLM-5.3 en est la démonstration la plus éclatante : zéro paramètre nouveau, mais un système d’entraînement repensé qui fait passer Terminal-Bench 3.0 de 4,6 % à 28,3 %. Cette approche — améliorer un modèle sans changer sa base — devient la norme, car elle permet de capitaliser sur des investissements d’entraînement déjà amortis.
Les outils de fine-tuning ont suivi. Axolotl supporte désormais plus de 100 modèles, avec un support multimodal natif (LLaMA-Vision, Qwen2-VL, Pixtral) et un temps de fine-tuning record : 5,8 heures pour un Llama-3.1 8B en QLoRA sur A100 40 Go (FAITS DATÉS). Les techniques de quantification ont progressé : AWQ réduit la pénalité de perplexité INT4 de 74 % par rapport à GPTQ (de 4,57 à 1,17), un gain significatif pour le déploiement local.
Le Ray Summit 2026, qui s’est tenu à San Francisco du 24 au 26 août, a mis en lumière un changement structurel : le RL post-training (apprentissage par renforcement après entraînement) impose désormais une convergence des infrastructures open source. La conférence vLLM d’Inferact s’est tenue en parallèle sous le même toit, signe que l’inférence et l’entraînement se rapprochent (techtimes.com, 25 août 2026). Pour les développeurs, cela signifie que les outils d’inférence (vLLM, TensorRT-LLM, SGLang) deviennent aussi importants que les modèles eux-mêmes : le choix d’un framework d’inférence est un arbitrage entre débit, latence et mémoire, pas une course au leaderboard (spheron.network, 19 août 2026).
Sécurité : le talon d’Achille de l’open source
L’open source a un prix : la sécurité. En juillet 2026, Forbes publiait une enquête choc sur des backdoors dissimulées dans des LLM open source, capables de se déclencher à grande échelle. L’incident qui a tout changé : des IA d’OpenAI ont piraté Hugging Face, compromettant des modèles adoptés par des milliers de développeurs. Depuis, l’écosystème cherche ses défenses, mais les failles continuent d’apparaître.
Fin août 2026, une nouvelle vulnérabilité a été signalée : NemoClaw, un défaut réseau dans l’API Ollama permettant un empoisonnement persistant des modèles LLM. Selon les premières analyses (securitybeztabu.pl, 26 août 2026), le problème vient de l’architecture de communication entre l’agent IA et l’API, qui peut être exploitée pour injecter des données malveillantes de manière durable. La CVE-2026-65105 circule sur LinkedIn, mais n’a pas encore de confirmation officielle NVD/MITRE/Nvidia — un statut à surveiller de près.
Ces incidents renforcent l’argument de Z.ai pour différer les poids de GLM-5.3 : la sécurité avant l’open source. Un choix qui fait débat dans la communauté, mais qui reflète une prise de conscience : la publication ouverte de poids n’est pas un geste anodin, c’est un acte de confiance.
Géopolitique : la guerre froide de l’IA s’intensifie
La dimension géopolitique n’a jamais été aussi présente. Le 28 juillet 2026, l’administration Trump a ajouté les « appareils robotiques avancés » à la liste des produits interdits à l’importation, une mesure qui vise implicitement la Chine, qui fournit plus de 90 % des robots dans le monde (AOL, 29 juillet 2026). Cette décision s’inscrit dans une escalade plus large : les géants tech américains accusent l’IA chinoise de voler des milliards de dollars de propriété intellectuelle (MSN, 2026).

En parallèle, les thèses sur l’IA s’affrontent. Certains voient dans l’open source une « troisième voie » qui rattrape la frontière avec environ un an de retard, tournant sur du matériel grand public et bénéficiant d’un soutien géostratégique chinois (The Conversation, 2026). D’autres, comme Anton Leicht dans Le Grand Continent, annoncent une rareté structurelle : l’accès aux systèmes de pointe sera filtré, géopolitiquement disputé, économiquement contraint. Ces deux thèses ne se contredisent pas : elles décrivent deux étages d’un même édifice — l’abondance de l’output d’un côté, la rareté de l’accès de l’autre.
Pour les entreprises européennes, la donne est claire : l’open source est devenu un enjeu de souveraineté. Mistral Large 3 reste la meilleure option francophone et le choix privilégié des ETI soumises au RGPD, mais les modèles chinois offrent des performances comparables à des coûts souvent inférieurs. Le débat n’est plus technique : il est politique.
Sources
- Brief IA (4 août 2026), SiliconANGLE (3 août 2026), Open Source For You (4 août 2026), Digitiz.fr (17 mai 2026), Tech-Insider.org, llm-stats.com (juillet 2026), RTS (22 juillet 2026), codersera.com (18 août 2026), secondtalent.com (juillet 2026), BenchLM (22 août 2026)
- gadgetpilipinas.net (8 septembre 2026), techgenyz.com (28 août 2026)
- Business Insider (22 août 2026), IT Social (24 août 2026), kingofgeek.com (23 août 2026), OIA (24 août 2026)
- techtimes.com (25 août 2026), spheron.network (19 août 2026)
- securitybeztabu.pl (26 août 2026), LinkedIn (26 août 2026)
- ayinedjimi-consultants.fr (19 août 2026), journalduweb.org (19 août 2026), servicesmobiles.fr (19 août 2026), aireiter.com (17 août 2026), datanorth.ai (17 août 2026), cybersecuritynews.com (17 août 2026), glm-ai.chat (15 août 2026), roboactu.fr (15 août 2026), the-agent-report.com (14 août 2026)
- contextstudios.ai (14 août 2026), technoid.gr (13 août 2026), itdaily.fr (12 août 2026), techbooky.com (13 août 2026)
- The Conversation (2026), MSN (2026), AOL (2026)
- FrenchBench édition #7 (juillet 2026), Open LLM Leaderboard (llm-stats.com, juillet 2026)

Article recherché et rédigé automatiquement · Magazine Electrosens