Magazine LLM Opensource · 10 September 2026LLM open source 2026 : Kimi K3, Qwen3.8-Max, GLM-5.3, Hy4 — l’été où la Chine a redéfini les règles
Le 3 août 2026, Alibaba rendait disponible Qwen3.8-Max, un modèle de 2,4 billions de paramètres en open weights, quelques jours après que Moonshot AI a publié les poids de Kimi K3 (2,8 billions) le 27 juillet. DeepSeek V4 Pro (1,6 billion) domine le codage agentique et sort de preview le 12 août, tandis que Z.ai dégaine GLM-5.3 le 14 août et que Tencent ouvre Hy4 (770B) le 28 août. Meta riposte avec Muse Glimmer, un modèle agentique 30B sous licence Apache 2.0. Mais derrière les records, la guerre des licences, l’opacité des benchmarks, les failles de sécurité et les enjeux géopolitiques redéfinissent les règles du jeu. Plongée dans un été où l’open source n’a jamais été aussi chinois, ni aussi tendu.
Kimi K3, Qwen3.8-Max, DeepSeek V4 : le grand déballage des poids lourds de l’été 2026
L’été 2026 restera comme celui où la Chine a frappé le plus fort. Le 16 juillet, Moonshot AI a dévoilé Kimi K3, un modèle Mixture of Experts de 2,8 billions de paramètres – le plus grand jamais mis en open weight – dont les poids complets (1,56 To) ont été mis en ligne sur Hugging Face le 27 juillet. Selon Le Grand Continent, il est environ 75 % plus gros que DeepSeek V4 Pro (1,6 billion de paramètres, sorti en avril). Son architecture repose sur 896 experts dont 16 activés par token (104 milliards de paramètres actifs), soit une sparsité deux fois plus élevée que celle de K2.6 ou DeepSeek V4 Pro. La fenêtre de contexte atteint 1 million de tokens, et le modèle intègre des capacités visuelles natives (texte-image-vidéo). Moonshot revendique des gains d’efficacité algorithmique 2,5 fois supérieurs à ceux de K2.6 legrandcontinent.eu. Sur l’indice indépendant Artificial Analysis, Kimi K3 se classe 4e mondial, au niveau de Claude Opus 4.8 lab-sense.com. La licence est une « custom Kimi K3 License » — un modèle open weight mais pas open source au sens strict yottalabs.ai. Le prix API est fixé à 3 $ / 15 $ par million de tokens (0,30 $ en cache hit) yottalabs.ai.
Trois semaines plus tard, le 3 août, Alibaba a annoncé la disponibilité générale de Qwen3.8-Max, un modèle de 2,4 billions de paramètres (95 milliards actifs), également en open weights, avec une fenêtre de contexte d’1 million de tokens et un support multimodal texte-image-vidéo. Selon SiliconANGLE, il s’agit du LLM open source le plus puissant d’Alibaba à ce jour, taillé pour les agents autonomes capables de travailler sur plusieurs jours siliconangle.com. Les poids sont arrivés en deux temps : un checkpoint text-only de 2,4 billions sur Hugging Face sous licence custom, puis la version plus petite Qwen3.8-27B publiée les 13-14 août sous Apache 2.0 yottalabs.ai. Le prix API est de $2 / $6 par million de tokens (0,25 $ en cache), soit moitié moins que Kimi K3 yottalabs.ai. Alibaba n’a publié aucun benchmark indépendant — uniquement des évaluations internes qui le placent « second seulement derrière Claude Fable 5 » yottalabs.ai. Selon VentureBeat, le modèle revendique des performances supérieures à GPT-5.6 Sol Max et Fable 5 sur l’usage agentique d’ordinateur venturebeat.com. Forbes souligne que ce prix de 2 $ par million de tokens place l’IA de pointe à un coût sans précédent forbes.com.
De l’autre côté du Pacifique, Meta a d’abord sorti Llama 4 en plusieurs variantes (Scout, Maverick, Behemoth), avec une licence qualifiée de « Restrictive License » par KXDevelopers, non conforme à l’open source stricte. Mais le 10 août, Meta a opéré un virage spectaculaire : la publication de Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres sous licence Apache 2.0, conçu pour s’exécuter localement sur un PC ou un Mac avec une seule carte graphique (24 Go de VRAM) research.meta.ai, oia.fr. Accompagné d’un manifeste de 6 500 mots de Mark Zuckerberg plaidant pour l’IA open source ettayeb.fr, Muse Glimmer marque la volte-face de Meta après quatre mois de verrouillage goodtech.info. Le modèle est multimodal (texte-image-vidéo), optimisé pour les tâches agentiques locales, et disponible sans demande d’accès the-agent-report.com.
Côté chinois, DeepSeek V4 a été publié le 24 avril sous le nom de DeepSeek V4 Preview, avec deux variantes : V4-Pro (1,6 billion de paramètres totaux, 49 milliards actifs) et V4-Flash (284 milliards totaux, 13 milliards actifs), toutes deux sous licence MIT, avec un contexte d’1 million de tokens et des modes « thinking » et « non-thinking ». Le 12 août, DeepSeek a publié la version stable de V4 Pro (build « V4 Pro 0813 »), mettant fin à une période de preview de près de quatre mois unite.ai. DeepSeek V4 Pro est désormais le leader du codage agentique sur SWE-bench, selon le guide Novita AI mis à jour au 22 juillet 2026 blogs.novita.ai. V4 Flash, dont la mise à jour stable est arrivée le 31 juillet, s’impose comme le champion du coût : exécuter une suite de tests complète coûte 33 fois moins cher qu’avec Kimi K3 (72 $ contre plusieurs milliers) geeky-gadgets.com, et son prix sur OpenRouter est très inférieur à celui de Kimi K3 techbooky.com. DeepSeek R1, publié en janvier 2025 sous licence MIT, reste une référence pour le raisonnement mathématique avec affichage du processus de réflexion.
GLM-5.3 de Zhipu AI (Z.ai) a été publié le 14 août 2026 — une version sans aucun nouveau paramètre. Il réutilise la base Mixture-of-Experts de 743 milliards de paramètres de GLM-5.2, mais avec un post-entraînement intensif qui transforme ses performances : Terminal-Bench 3.0 passe de 4,6 % à 28,3 %, et le modèle s’impose en tête du benchmark cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol the-agent-report.com, ayinedjimi-consultants.fr. Le contexte atteint 1 million de tokens, avec 128K de sortie. Les poids sont différés — Z.ai promet de les publier ultérieurement, mais le modèle est accessible via un « Coding Plan » et une API glm-ai.chat. C’est une démonstration éclatante que le post-entraînement seul peut rivaliser avec des changements d’architecture datanorth.ai. GLM-5.2, publié en juin 2026 sous licence MIT, avait déjà été intégré par Nous Research dans Hermes Agent codersera.com.
Le 28 août, Tencent a ouvert les vannes d’un nouveau géant : Hy4 Preview, un modèle de 770 milliards de paramètres (49 milliards actifs) avec une fenêtre de contexte dépassant 1 million de tokens. Conçu pour le codage, la productivité bureautique et la recherche scientifique, Hy4 est disponible en open source avec un accès API gadgetpilipinas.net, techgenyz.com. C’est la première fois qu’un acteur de cette envergure met à disposition un modèle de cette taille avec un contexte aussi long, et Tencent rejoint ainsi le club très fermé des laboratoires chinois qui publient leurs poids.
Côté européen, Mistral Large 3 (Apache 2.0) et Mistral Small 3.1 (Apache 2.0) continuent de se positionner sur la conformité réglementaire (AI Act), avec un score Arena de 1413 selon Pinggy.io. Le partenariat annoncé le 21 juillet 2026 entre Microsoft et Mistral AI – plusieurs milliards de dollars pour exploiter les GPU européens – renforce la crédibilité de la start-up française tout en soulevant des questions sur son indépendance larevuetech.fr.
Enfin, un nouveau venu sud-coréen, Solar Open 2 d’Upstage (250 milliards de paramètres, MoE), se distingue sur les tâches d’agents AI (AgentBench, SWE-bench). Et Nemotron 3 Ultra de Nvidia, issu de la coalition Nemotron, a été salué par Sebastian Raschka pour son rapport capacité/efficacité codersera.com.
Le tableau des modèles 2026 s’enrichit, mais l’opacité demeure : les laboratoires publient rarement les architectures complètes, et les benchmarks indépendants manquent encore pour les tout derniers modèles.
| Modèle | Origine | Paramètres (actifs) | Architecture | Contexte | Multimodal | Licence | Prix API (par M tokens) | Points forts (source) |
|---|---|---|---|---|---|---|---|---|
| Kimi K3 | Chine (Moonshot AI) | 2,8 billions (104B) | MoE 896 experts, 16 actifs | 1M tokens | Texte-image-vidéo | Custom Kimi K3 License | $3 / $15 | Plus grand modèle open weight ; #4 mondial Artificial Analysis (legrandcontinent.eu, yottalabs.ai) |
| Qwen3.8-Max | Chine (Alibaba) | 2,4 billions (95B) | MoE + Mixed-Attention | 1M tokens | Texte-image-vidéo | Custom (checkpoint text-only) | $2 / $6 | Agents autonomes ; pas de benchmarks indépendants (siliconangle.com, yottalabs.ai) |
| Qwen3.8-27B | Chine (Alibaba) | 27B | Dense | Non précisé | Non | Apache 2.0 | — | Version pratique pour self-hosting (yottalabs.ai) |
| DeepSeek V4 Pro | Chine | 1,6 billion (49B) | MoE | 1M tokens | Non | MIT | Très bas | Leader codage agentique SWE-bench ; stable depuis le 12 août (blogs.novita.ai, unite.ai) |
| DeepSeek V4 Flash | Chine | 284B (13B) | MoE | 1M tokens | Non | MIT | ~1/10 de Qwen | Coût imbattable : 33× moins cher que Kimi K3 (geeky-gadgets.com, kingy.ai) |
| DeepSeek R1 | Chine | 671B (37B actifs) | Dense | 128K | Non | MIT | — | Raisonnement mathématique explicable (it-admin.tg) |
| GLM-5.3 | Chine (Zhipu AI) | 743B (MoE) | MoE | 1M tokens | Non | Open-weight, poids différés | Coding Plan | CyberGym 84,5 %, Terminal-Bench 3.0 28,3 % (the-agent-report.com, ayinedjimi-consultants.fr) |
| Hy4 Preview | Chine (Tencent) | 770B (49B) | MoE | 1M+ tokens | Non | Open source | API | Codage, bureautique, recherche ; contexte 1M+ (gadgetpilipinas.net, techgenyz.com) |
| Muse Glimmer | USA (Meta) | 30B | Dense | Non précisé | Texte-image-vidéo | Apache 2.0 | — | Agentique local sur PC/Mac, 24 Go VRAM (research.meta.ai, oia.fr) |
| Llama 4 Scout | USA (Meta) | Non divulgué | Dense/MoE ? | 10M tokens | Non | Restrictive License | — | Record long contexte (Techsy.io) |
| Mistral Large 3 | France | Non divulgué | Dense | 128K | Non | Apache 2.0 | — | Conformité AI Act, score Arena 1413 (Pinggy.io) |
| Solar Open 2 | Corée du Sud | 250B | MoE | Non précisé | Non | À préciser | — | Agents IA (AgentBench, SWE-bench) |
| Nemotron 3 Ultra | USA (Nvidia) | Non divulgué | MoE | Non précisé | Non | Commerciale | — | Rapport capacité/efficacité (codersera.com) |
Benchmarks sous tension : qui mène vraiment la danse ?
Si les modèles 2026 brillent par leur absence de scores standardisés, les générations précédentes offrent une base de comparaison solide. Techsy.io a publié en juillet 2026 un tableau comparatif pour cinq LLM open source de la vague 2024-2025 :
| Modèle | MMLU | HumanEval |
|---|---|---|
| Llama 3.3 70B (Meta) | 86.0 | 88.4 |
| Qwen 2.5 72B (Alibaba) | 85.0+ | 86.6 |
| DeepSeek-V3 (DeepSeek) | 87.1 | 82.6 |
| Mistral Small 3.1 (Mistral) | 80.6 | 88.4 |
| Gemma 3 27B (Google) | ~78.6 | 87.8 |
Source : techsy.io, juillet 2026. Scores non vérifiés indépendamment.
Ce tableau montre que DeepSeek-V3 domine en MMLU (connaissances générales) avec 87.1, tandis que Llama 3.3 70B et Mistral Small 3.1 excellent en HumanEval (codage) avec 88.4. Mais ces modèles sont déjà dépassés par les nouvelles versions.
Pour les modèles 2026, les données sont plus rares mais commencent à émerger. L’indice Artificial Analysis Intelligence Index (composite de 10 évaluations indépendantes) classe Kimi K3 en 4e position mondiale, au niveau de Claude Opus 4.8, et en tête des modèles open weight lab-sense.com. DeepSeek V4 Pro est leader sur SWE-bench pour le codage agentique. Selon le comparatif de blog.4sapi.com, Kimi K3 excelle en codage frontend et en raisonnement long-horizon, tandis que Qwen3.8-Max est optimisé pour les agents autonomes multi-jours blog.4sapi.com. Les scores officiels de Qwen3.8-Max et GLM-5.3 n’ont pas encore été vérifiés indépendamment, mais les premiers chiffres de GLM-5.3 sont impressionnants : 84,5 % sur CyberGym (cybersécurité) et 28,3 % sur Terminal-Bench 3.0 (contre 4,6 % pour GLM-5.2) the-agent-report.com, aireiter.com.
Le test contrôlé de Kingy.ai (mis à jour au 18 août) apporte un éclairage précieux : Qwen3.8-Max est le meilleur généraliste multimodal hébergé, Kimi K3 le meilleur pour le codage et les agents long-contexte, et DeepSeek V4 Flash le champion du coût et du débit (103,2 tokens de sortie par seconde mesurés par Artificial Analysis) kingy.ai. Le site note aussi que Kimi K3 obtient le meilleur score indépendant en test long-contexte (AA-LCR), et que DeepSeek V4 Flash est le seul des trois dont le dépôt officiel (166,9 Go) est réaliste pour un self-hosting kingy.ai.
Le site IActualités propose une « LLM Battle 2026 » avec de nouveaux critères : coût d’inférence, facilité de déploiement, conformité réglementaire. Et le nouveau leaderboard BenchLM (benchlm.ai) classe désormais 95 modèles open-weight, avec des scores composites pondérés par la fiabilité des évaluations benchlm.ai. Un outil précieux pour s’y retrouver dans un paysage qui s’étoffe chaque semaine.
Sécurité : NemoClaw, la faille qui empoisonne les agents
L’open source n’est pas qu’une affaire de performances. En août 2026, les chercheurs de Cyera’s Oasis Identity Research ont mis au jour une faille aussi ironique que redoutable : NemoClaw, le wrapper de sécurité signé Nvidia censé protéger les agents OpenClaw, contient lui-même une vulnérabilité critique. Via une erreur réseau dans l’API Ollama, un attaquant peut empoisonner durablement les modèles LLM — en corrompant le réseau, les documents ou les données d’entraînement securitybeztabu.pl, linkedin.com. La chronologie de la divulgation, fin août, a mis en lumière la surface d’exposition massive des environnements d’agents AI : un sandbox ne suffit pas si le wrapper de sécurité est lui-même compromis. Cette affaire rappelle que la course aux modèles géants ne doit pas faire oublier la robustesse des infrastructures qui les entourent.
Ox Alpha : le modèle furtif qui intrigue OpenRouter
Depuis le 20 août, un mystérieux modèle de raisonnement gratuit, Ox Alpha, tourne sur OpenRouter. Son fournisseur n’a pas révélé son identité, et le modèle restera accessible gratuitement jusqu’au 27 août itsocial.fr, oia.fr. Spécialisé dans le code et les agents autonomes, il impressionne les développeurs par ses capacités, mais son origine est inconnue — certains suspectent un laboratoire chinois businessinsider.com. Ce « stealth model » illustre une tendance nouvelle : des acteurs anonymes testent des modèles de pointe sans révéler leur provenance, ce qui pose des questions de confiance et de traçabilité kingofgeek.com. Une affaire à suivre.

Infrastructure : Ray Summit 2026, le RL post-entraînement fait converger l’open source
Le 25 août 2026, le Ray Summit s’est ouvert à San Francisco, co-localisé avec la première vLLM Conference. Cette co-localisation reflète un changement structurel : le RL post-entraînement (reinforcement learning) exige désormais une convergence des infrastructures open source. Les frameworks d’inférence comme vLLM, TensorRT-LLM et SGLang ne sont plus de simples options — ils deviennent des briques essentielles pour optimiser le déploiement des modèles géants techtimes.com, spheron.network. Le choix entre vLLM, TensorRT-LLM et SGLang dépend de compromis entre débit, latence et mémoire, plutôt que d’un simple classement spheron.network. Pendant ce temps, la guerre des prix fait rage : Qwen3.8-Max à 2 $ par million de tokens, DeepSeek V4 Flash à une fraction de ce coût, et Kimi K3 positionné au niveau des modèles propriétaires. L’open source a gagné la guerre des modèles ; la bataille de l’infrastructure commence.
Sources

- Le Grand Continent — Kimi K3
- YottaLabs — Qwen3.8 vs Kimi K3
- SiliconANGLE — Alibaba debuts Qwen3.8-Max
- VentureBeat — Qwen3.8-Max claims
- Forbes — Qwen3.8-Max prices
- The Agent Report — GLM-5.3
- Aireiter — GLM-5.3 benchmarks
- DataNorth — Z.ai releases GLM-5.3
- GadgetPilipinas — Tencent Hy4
- Techgenyz — Hy4 preview
- Kingy.ai — Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 Flash
- Novita AI — Open Source LLM Guide 2026
- Unite.ai — DeepSeek V4 Pro stable
- Geeky Gadgets — DeepSeek V4 Flash cost
- Techbooky — DeepSeek V4-Pro pricing
- Research.Meta.ai — Muse Glimmer
- OIA — Muse Glimmer
- ITDaily — Meta Muse Glimmer
- Security Bez Tabu — NemoClaw
- LinkedIn — NemoClaw flaw
- IT Social — Ox Alpha
- OIA — Ox Alpha
- Business Insider — Ox Alpha
- TechTimes — Ray Summit 2026
- Spheron — LLM Inference Optimization
- Lab-Sense — IA chinoise 2026
- Codersera — Open Source LLMs Landscape 2026
- La Revue Tech — Microsoft Mistral
Article recherché et rédigé automatiquement · Magazine Electrosens