Electrosens R&D
Electrosens Magazine LLM Opensource · 14 September 2026

LLM open source en septembre 2026 : Hy4, GLM-5.3, Kimi K3 et la guerre froide des modèles s’intensifie

Les classements de septembre 2026 sont formels : jamais autant de modèles open source n’ont tutoyé les meilleurs systèmes propriétaires. Alibaba a ouvert les poids de Qwen3.8-2.4T-A95B (2,4 billions de paramètres, 95 milliards actifs) le 12 août, Moonshot AI a publié Kimi K3 (2,8 billions de paramètres) fin juillet, Z.ai a dégainé GLM-5.3 le 14 août, Meta est revenu dans la course avec Muse Glimmer, un modèle agentique 30B qui tourne sur un simple PC, et Tencent a ouvert Hy4, un MoE de 770 milliards de paramètres. Huit prétendants se disputent désormais le trône, portés par des architectures MoE toujours plus efficaces, des fenêtres de contexte vertigineuses et des licences de plus en plus permissives — même si certains poids restent temporairement retenus. Mais derrière les scores flatteurs, la réalité du déploiement, des besoins matériels et des cas d’usage reste très contrastée. Ce comparatif détaillé vous aide à y voir clair.

L’année 2025 avait vu l’open source franchir un cap avec des modèles comme DeepSeek-V3, Qwen 2.5 ou Llama 3.3, capables de rivaliser avec GPT-4 sur de nombreux benchmarks. En septembre 2026, le paysage a encore basculé, et à un rythme que même les observateurs les plus attentifs peinent à suivre. La multiplication des architectures Mixture-of-Experts (MoE), l’allongement des contextes jusqu’à 10 millions de tokens, et l’émergence de nouveaux acteurs chinois (DeepSeek, Alibaba, Moonshot AI, Zhipu AI, Tencent) ont créé un marché foisonnant, mais aussi plus difficile à décoder. Selon une analyse de Realmoon.ai, les modèles open source ont désormais rattrapé leurs concurrents propriétaires sur 95 % des benchmarks, et le choix se joue désormais sur le coût réel, la confidentialité et la capacité à fine-tuner, pas sur la performance brute. Pour les développeurs et les entreprises, le choix d’un LLM open source ne se résume plus à un seul chiffre : il dépend du matériel disponible, du cas d’usage, de la licence et de la maturité de l’écosystème.

Les prétendants au trône : portrait-robot des modèles qui comptent

En septembre 2026, huit modèles open source dominent les classements et les discussions de la communauté. Leurs caractéristiques techniques sont résumées dans le tableau ci-dessous, établi à partir des sources disponibles et vérifiées en août-septembre 2026. Attention : le paysage évolue chaque mois — entre avril et mai 2026, Moonshot a publié Kimi K2.6, Z.ai a sorti GLM-5.1, DeepSeek a lancé V4 Pro et V4 Flash, Xiaomi a dévoilé MiMo-V2.5-Pro, MiniMax a ouvert M2.7, Google a publié Gemma 4, Alibaba a sorti Qwen 3.6, et Ant Group a dévoilé Ring-2.6-1T (source codersera.com, mai 2026). En juin, GLM-5.2 et Kimi K2.7 Code HighSpeed sont arrivés. Le 26 juillet, Moonshot a publié Kimi K3 (2,8 billions de paramètres). Le 4 août, Alibaba a annoncé Qwen3.8-Max, dont les poids ont finalement été ouverts le 12 août sous une licence personnalisée. Le 10 août, Meta a publié Muse Glimmer. Le 14 août, Z.ai a dégainé GLM-5.3, dont les poids sont retenus environ deux semaines. Et fin août, Tencent a ouvert Hy4 en preview.

Modèle Éditeur Taille (paramètres) Architecture Fenêtre de contexte Licence Points forts clés
Qwen3.8-2.4T-A95B Alibaba 2,4 billions totaux, 95 milliards actifs MoE 1 million de tokens Personnalisée (Qwen3.8-Max License) Premier modèle de classe Max ouvert par Alibaba ; taillé pour les agents autonomes longue durée ; poids ouverts le 12 août 2026
Kimi K3 Moonshot AI 2,8 billions totaux, 104 milliards actifs MoE (896 experts) 1 million de tokens Personnalisée (open weight) Plus gros modèle open weight jamais créé ; multimodal texte + image + vidéo ; publié le 26 juillet 2026
DeepSeek V4 Pro DeepSeek 1,6 billion total, 49 milliards actifs MoE + sparse attention 1 million de tokens MIT Meilleur rapport qualité-prix, excellent en code et raisonnement ; 80,6 % sur SWE-Bench Verified ; version production V4 Pro 0813 le 12 août
GLM-5.3 Z.ai (Zhipu) 753 milliards (base GLM-5.2) MoE 1 million de tokens Poids retenus ~2 semaines Domine le benchmark cybersécurité CyberGym (84,5 %) ; Terminal-Bench 3.0 passé de 4,6 à 28,3 % par le seul post-entraînement ; 2 400 vulnérabilités trouvées
Hy4 (preview) Tencent 770 milliards totaux, 49 milliards actifs MoE 1 million+ de tokens Open source (preview) Codage, productivité bureautique et recherche scientifique ; API accessible ; publié fin août 2026
Qwen3.6-235B-A22B Alibaba 235 milliards totaux, 22 milliards actifs MoE 32K tokens (extensible 131K) Apache 2.0 Champion multilingue (119 langues), très déployé en auto-hébergé, licence permissive
Llama 4 Maverick Meta Non précisé (plusieurs variantes) MoE Jusqu’à 10M tokens (Scout) Personnalisée (restrictions commerciales) Écosystème mature, contexte record, native multimodalité
Muse Glimmer Meta 30 milliards (dense) Dense 128K tokens Apache 2.0 Modèle agentique multimodal qui tourne sur un PC (24-32 Go VRAM) ; publié le 10 août 2026

Sources : computingforgeeks.com (août 2026, tableau maître vérifié) pour les spécifications techniques ; codersera.com (18 août 2026) pour les mises à jour d’août ; tech-insider.org (2026) pour les benchmarks SWE-Bench ; realmoon.ai (juillet 2026) pour les performances relatives ; the-agent-report.com (14 août 2026) pour GLM-5.3 ; research.meta.ai (10 août 2026) pour Muse Glimmer ; gadgetpilipinas.net et techgenyz.com (28 août 2026) pour Hy4.

Détails complémentaires :

  • Qwen3.8-2.4T-A95B : annoncé le 4 août 2026 par Alibaba, ce modèle de 2,4 billions de paramètres avec fenêtre de contexte de 1 million de tokens est présenté comme capable de travailler en autonomie pendant plusieurs jours (source generation-nt.com). Ses poids ont été ouverts le 12 août 2026, ce qui en fait le plus gros modèle open source jamais publié — devant Kimi K3. Attention : la licence n’est pas Apache 2.0 mais une licence personnalisée « Qwen3.8-Max License », gratuite pour la plupart des usages commerciaux mais avec des carve-outs liés aux revenus (attribution du nom du modèle, etc.) — selon codersera.com (18 août 2026). C’est la première fois qu’un modèle de la classe Qwen-Max est ouvert (tous les précédents Max étaient API-only). Alibaba a aussi publié Qwen3.8-27B (Apache 2.0, vision-langage natif, 262K contexte, score Artificial Analysis 52 — niveau GLM-5.2).
  • Kimi K3 : publié le 26 juillet 2026 par Moonshot AI, c’est le plus gros modèle open weight jamais créé : 2,8 billions de paramètres, 896 experts MoE dont 16 actifs (104 milliards actifs), contexte de 1 million de tokens, multimodal (texte, image, vidéo). Ses scores indépendants ne sont pas encore disponibles, mais les premiers tests suggèrent qu’il rivalise avec les meilleurs modèles américains (source journaldugeek.com). Une controverse existe : des officiels américains l’accusent d’avoir « pillé » le modèle d’Anthropic détenu par Google (source cnews.fr, 23 juillet 2026). Moonshot a également publié Kimi K2.6 en mai (leader de l’Artificial Analysis Intelligence Index à 54) et Kimi K2.7 Code HighSpeed en juin.
  • DeepSeek V4 Pro : successeur de DeepSeek-V3 (décembre 2024, MMLU 87,1, HumanEval 82,6). L’architecture MoE + sparse attention permet d’activer seulement 49 milliards de paramètres sur 1,6 billion, réduisant drastiquement les besoins en calcul. Il est considéré comme le meilleur générateur de code open source en 2026, avec 80,6 % sur SWE-Bench Verified (source tech-insider.org). La version production V4 Pro 0813 est sortie le 12 août 2026, mettant fin à une période de prévisualisation de près de quatre mois (source unite.ai). DeepSeek a également publié DSpark, un framework d’inférence par décodage spéculatif qui réduit la latence jusqu’à 85 % sur V4-Flash (source techtimes.com, 27 juin 2026). Une variante V4 Flash (284B totaux, 13B actifs) est disponible pour les usages plus légers — et coûte 33× moins cher que Kimi K3 pour exécuter une suite de tests (source geeky-gadgets.com, 11 août 2026). Sur OpenRouter, V4-Pro est positionné à 0,14 $/M tokens, bien en dessous de Kimi K3 (source techbooky.com, 13 août 2026).
  • GLM-5.3 : publié par Z.ai le 14 août 2026, ce modèle ne change pas de taille — il réutilise la base MoE de 753 milliards de paramètres de GLM-5.2 — mais tout vient du post-entraînement. Résultat : il domine le benchmark cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol (source ayinedjimi-consultants.fr, 19 août 2026). Sur Terminal-Bench 3.0, il passe de 4,6 à 28,3 % par le seul post-entraînement (source datanorth.ai, 17 août 2026) — le meilleur score open source sur ce benchmark de scripting en ligne de commande (source siliconangle.com, 14 août 2026). Score DeepSWE : 66,9 (source aireiter.com). Selon Z.ai, le modèle a déjà trouvé plus de 2 400 vulnérabilités dans 269 projets logiciels, dont environ la moitié de sévérité moyenne ou supérieure — y compris une faille dans un code vieux de 40 ans (source siliconangle.com). Les poids sont retenus environ deux semaines — une décision motivée par la sécurité (source the-agent-report.com). Z.ai propose un programme d’audit gratuit (source servicesmobiles.fr). Le post-entraînement a utilisé des sandboxes simulant des postes de développeurs, avec des exercices pouvant prendre plusieurs jours, ce qui a amélioré la capacité du modèle sur les tâches long-horizon (source siliconangle.com).
  • Hy4 (preview) : Tencent a ouvert fin août 2026 son modèle Hy4 en preview, un MoE de 770 milliards de paramètres dont 49 milliards actifs, avec une fenêtre de contexte dépassant 1 million de tokens. Conçu autour du codage, de la productivité bureautique et de la recherche scientifique, il est accessible via API (source gadgetpilipinas.net, techgenyz.com, 28 août 2026). C’est le premier modèle open source majeur de Tencent dans cette catégorie, et il élargit encore le front chinois.
  • Muse Glimmer : publié par Meta le 10 août 2026, c’est un modèle agentique multimodal de 30 milliards de paramètres (dense), sous licence Apache 2.0, avec 128K de contexte. Il tourne sur une seule GPU de 24-32 Go ou sur un Mac (source research.meta.ai, contextstudios.ai). Accompagné d’un manifeste de Mark Zuckerberg de 6 500 mots plaidant pour l’IA open-weight (source ettayeb.fr). C’est un retournement : Meta avait verrouillé ses modèles quatre mois plus tôt (source 01net.com, 11 août 2026).
  • Qwen3.6-235B-A22B : modèle MoE d’Alibaba, avec 22 milliards de paramètres actifs. Support natif de 119 langues, dont le français. Licence Apache 2.0, ce qui en fait un choix sûr pour les entreprises. Selon noqta.tn, Qwen3 a détrôné Llama comme LLM auto-hébergé le plus déployé en 2026.
  • Llama 4 Maverick : Meta propose plusieurs variantes, dont Llama 4 Scout avec une fenêtre de contexte record de 10 millions de tokens. La licence personnalisée interdit l’usage pour concurrencer Meta, ce qui peut être un frein pour certaines entreprises. Llama 4 Maverick est le modèle phare pour la multimodalité native.

Modèle complémentaire notable : GPT-OSS-120B (OpenAI, août 2025, Apache 2.0) : 117B paramètres totaux / 5,1B actifs, contexte 128K, MMLU 90 %, GPQA ~80 %, pass@1 code 62 %. Fonctionne sur un GPU de 80 Go (source : unite.ai). Bien que moins récent, il reste pertinent pour les tâches généralistes — et il représente la première incursion d’OpenAI dans l’open source depuis GPT-2.

Le mystère Ox Alpha : depuis le 20 août, un modèle de raisonnement gratuit sans éditeur connu tourne sur OpenRouter, sous le nom d’Ox Alpha. Spécialisé dans le code et les agents autonomes, il impressionne les développeurs, mais son origine reste inconnue — certains suspectent un laboratoire chinois (source businessinsider.com, 22 août 2026 ; itsocial.fr, 24 août 2026). Il restera accessible gratuitement jusqu’au 27 août, selon la plateforme. Ce qui est vérifié : ses performances en code et en raisonnement ; ce qui ne l’est pas : son identité et ses conditions d’utilisation (source oia.fr, 24 août 2026). Un épisode qui illustre la porosité croissante entre open source et modèles « stealth ».

Benchmarks 2026 : que valent vraiment les scores ?

Les benchmarks indépendants manquent de standardisation en 2026. L’Intelligence Index d’Artificial Analysis, mis à jour régulièrement, propose un score composite unique. Les scores pour les modèles open source (source codersera.com, mai 2026, et ayinedjimi-consultants.fr, juillet 2026) sont :

Taille totale des modèles (milliards de paramètres)Qwen3.8-2.4T-A95B2400milliardsKimi K32800milliardsDeepSeek V4 Pro1600milliardsGLM-5.3753milliardsHy4770milliardsQwen3.6-235B-A22B235milliardsMuse Glimmer30milliards
Modèle Score Intelligence Index
Kimi K2.6 54
GLM-5.1 51
DeepSeek V4 Pro 50
Qwen3.6-235B-A22B 48
Llama 4 Maverick 45
MiMo-V2.5-Pro 45
MiniMax-M2.7 44

Note : ces scores sont composites et ne sont pas directement comparables aux benchmarks classiques (MMLU, HumanEval). Aucun score Intelligence Index n’est disponible pour Kimi K3, GLM-5.3, Qwen3.8-2.4T-A95B, Hy4 ou Muse Glimmer dans les sources fournies. À titre de comparaison, Claude Fable 5 (propriétaire) obtient 60 points (source ayinedjimi-consultants.fr, juillet 2026).

Pour donner une échelle, rappelons les scores de modèles plus anciens (source techsy.io, 5 juillet 2026) :

Modèle (date de publication) MMLU HumanEval
Llama 3.3 70B (déc. 2024) 86,0 88,4
DeepSeek-V3 (déc. 2024) 87,1 82,6
Qwen 2.5 72B (sept. 2024) 85,0+ 86,6
Mistral Small 3.1 (mars 2025) 80,6 88,4
Gemma 3 27B (mars 2025) ~78,6 87,8

Ce que disent les analyses de 2026 :

  • Raisonnement complexe : DeepSeek V4 Pro et GLM-5.3 battent Claude 5 et GPT-5 dans certains domaines scientifiques et en code (source realmoon.ai). Kimi K2.6 est leader sur les tâches agentiques longues. Kimi K3, selon les premiers tests, « est presque au niveau des meilleurs » modèles américains (source journaldugeek.com).
  • Génération de code : DeepSeek V4 Pro est considéré comme le meilleur générateur de code open source, avec 80,6 % sur SWE-Bench Verified (source tech-insider.org). GLM-5.3 a montré des progrès spectaculaires en codage long-horizon : +50 % sur le benchmark interne de Z.ai par rapport à GLM-5.2, et le meilleur score open source sur Terminal-Bench 3.0 (source siliconangle.com, 14 août 2026). Hy4 de Tencent vise également le codage et la recherche scientifique (source techgenyz.com).
  • Cybersécurité : GLM-5.3 domine CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol (source ayinedjimi-consultants.fr). Il a déjà trouvé plus de 2 400 vulnérabilités dans 269 projets (source siliconangle.com). C’est le premier modèle open source à s’imposer aussi nettement sur ce terrain.
  • Saturation des benchmarks classiques : MMLU frôle les 95 % pour GPT-5, trois modèles obtiennent 100 % à AIME 2025, et la communauté s’accorde : ces tests ne départagent plus personne. Les nouveaux étalons sont SWE-bench Verified, GPQA Diamond, MMLU-Pro, et les benchmarks agentic comme BrowseComp, OSWorld et TAU-Bench (source : article « Benchmarks LLM 2026 : le grand tri »).

Fine-tuning et post-entraînement : la nouvelle frontière

Le post-entraînement est devenu le principal levier de différenciation en 2026. GLM-5.3 en est l’illustration la plus frappante : zéro nouveau paramètre, mais un passage de 4,6 à 28,3 % sur Terminal-Bench 3.0, et une domination sur CyberGym (source datanorth.ai, the-agent-report.com). Z.ai a automatisé une partie du workflow : des pipelines génèrent des signaux de récompense, et des « judge agents » vérifient que les exercices sont résolubles avant de les donner au modèle (source siliconangle.com).

Le Ray Summit 2026 (24-26 août, San Francisco) a confirmé cette tendance : le RL post-training force désormais l’infrastructure open source à converger. La première conférence vLLM s’est tenue en parallèle sous le même toit, signe que l’inférence et l’entraînement se rapprochent structurellement (source techtimes.com, 25 août 2026).

Pour le fine-tuning classique, les outils ont mûri : Axolotl supporte plus de 100 modèles, avec un support multimodal natif (LLaMA-Vision, Qwen2-VL, Pixtral). Un fine-tuning Llama-3.1 8B en QLoRA (2 époques, 512 tokens, A100 40 Go) prend 5,8 heures (source : faits datés 2026). Les batch sizes typiques restent de 1 à 4.

Sécurité : le talon d’Achille de l’open source

La sécurité est devenue un argument commercial et un champ de bataille. GLM-5.3 a été conçu explicitement pour la cybersécurité, avec des résultats impressionnants sur CyberGym (84,5 %) et 2 400 vulnérabilités trouvées dans des projets réels (source siliconangle.com). Z.ai propose même un programme d’audit gratuit (source servicesmobiles.fr).

Source : techsy.io

Mais l’open source a aussi ses failles. Le 26 août 2026, une vulnérabilité a été signalée dans l’API réseau d’Ollama, permettant un empoisonnement persistant des modèles LLM dans les environnements d’agents IA (NemoClaw/OpenClaw). La faille, baptisée CVE-2026-65105, circule sur LinkedIn mais n’a pas encore de confirmation officielle NVD/MITRE/Nvidia (source securitybeztabu.pl, linkedin.com, 26 août 2026). Un rappel que l’écosystème open source, s’il est plus transparent, n’est pas plus sûr par nature.

L’AI Act européen est entré en application pour les règles de transparence le 2 août 2026 — un cadre réglementaire que les éditeurs open source doivent désormais intégrer (source : faits datés 2026).

Écosystème et outils : l’infrastructure suit

L’écosystème open source s’est considérablement étoffé. Côté inférence, le match entre vLLM, TensorRT-LLM et SGLang se joue désormais sur des compromis précis : débit, latence, mémoire — pas sur un chiffre de leaderboard (source spheron.network, 19 août 2026). DSpark de DeepSeek (décodage spéculatif, MIT) réduit la latence jusqu’à 85 % sur V4-Flash, avec un delta BLEU inférieur à 0,3 % (source techtimes.com, 27 juin 2026 ; faits datés 2026). Le framework est en production sur V4-Flash et V4-Pro.

Côté matériel, les GPU B200/GB200 sont disponibles depuis le premier trimestre 2026, et des clusters de plus de 50 000 GPU existent chez CoreWeave (source : faits datés 2026). Les modèles de 70B en FP16 pèsent 140 Go, mais en GGUF Q4_K_M, ils tombent à 40-45 Go — ce qui les rend déployables sur des machines raisonnables (source : faits datés 2026).

Géopolitique : la guerre froide de l’IA s’intensifie

La dimension géopolitique est devenue centrale. Quinze des vingt premiers modèles de l’Artificial Analysis ranking sont chinois (source : faits datés, août 2025 — tendance confirmée en 2026). Les accusations de « pillage » de modèles (Kimi K3 vs Anthropic/Google, source cnews.fr) et les volte-face de Meta (verrouillage puis réouverture avec Muse Glimmer) montrent que l’open source est un champ de bataille stratégique.

Source : digitiz.fr

Tencent entre dans la danse avec Hy4, portant à quatre le nombre de géants chinois (Alibaba, DeepSeek, Moonshot, Z.ai, Tencent) à publier des modèles ouverts majeurs en 2026. Pendant ce temps, OpenAI reste marginal avec GPT-OSS-120B, et Google n’a pas encore ouvert de modèle de la taille de ses concurrents.

Conclusion : que choisir en septembre 2026 ?

Le choix d’un LLM open source en septembre 2026 dépend avant tout du cas d’usage :

  • Agents autonomes longue durée : Qwen3.8-2.4T-A95B (Alibaba) ou Kimi K3 (Moonshot) — les deux plus gros, avec 1M de contexte.
  • Code et cybersécurité : GLM-5.3 (Z.ai) — le spécialiste post-entraîné, ou DeepSeek V4 Pro pour le meilleur rapport qualité-prix.
  • Usage local sur PC/Mac : Muse Glimmer (Meta) — 30B dense, Apache 2.0, tourne sur 24-32 Go VRAM.
  • Multilingue et licence permissive : Qwen3.6-235B-A22B (Apache 2.0, 119 langues).
  • Recherche et productivité : Hy4 (Tencent) — le nouveau venu.
  • Écosystème mature : Llama 4 Maverick (Meta) — malgré une licence restrictive.

La performance brute ne départage plus : c’est le coût réel, la confidentialité, la licence et la capacité à fine-tuner qui font la différence. Et avec l’arrivée de modèles « stealth » comme Ox Alpha, le paysage pourrait encore se compliquer.

Sources

Source : ayinedjimi-consultants.fr
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *