Electrosens R&D
Electrosens Magazine LLM Opensource · 16 September 2026

GLM-5.1, GLM-5.2, GLM-5.3 : comment Z.ai a fait basculer la hiérarchie mondiale de l’IA open source

Le 7 avril 2026, Z.ai (ex-Zhipu AI) publiait sur Hugging Face les poids de GLM-5.1, un modèle Mixture-of-Experts de 744 milliards de paramètres sous licence MIT. Avec un score de 58,4 % sur SWE-Bench Pro, il devenait le premier modèle open source à surpasser tous les modèles propriétaires sur un benchmark de codage réel. Cinq mois plus tard, l’onde de choc s’est transformée en raz-de-marée : GLM-5.2 puis GLM-5.3, DeepSeek V4-Pro, Kimi K3, Qwen3.8-Max, Muse Glimmer et Hy4 ont enchaîné, et la hiérarchie mondiale de l’IA open source s’en trouve profondément redessinée. Retour sur un séisme et sur ses répliques.


Le coup de tonnerre de Z.ai : GLM-5.1 détrône les géants propriétaires sur le code

En ce mois de septembre 2026, l’écosystème des LLM open source a pris l’habitude des surprises venues de Chine. Mais l’annonce de Z.ai – l’entreprise anciennement connue sous le nom de Zhipu AI, officiellement rebaptisée en 2025 – a provoqué une onde de choc. Le 7 avril 2026, les poids du modèle GLM-5.1 ont été mis en ligne sur Hugging Face sans fanfare, accompagnés d’une simple note de version : « GLM-5.1 est désormais disponible sous licence MIT. » En 72 heures, la communauté mondiale des développeurs a réalisé l’ampleur de l’événement.

GLM-5.1 a obtenu un score de 58,4 % sur le benchmark SWE-Bench Pro, devançant GPT-5.4 d’OpenAI (57,7 %), Claude Opus 4.6 d’Anthropic (57,3 %) et Gemini 3.1 Pro de Google (54,2 %). C’est la première fois dans l’histoire de l’IA qu’un modèle open source surpasse l’ensemble des modèles fermés sur un benchmark mesurant la capacité à résoudre de vrais bugs logiciels dans des dépôts open source. Les chiffres, rapportés par plusieurs sources (IALANews, AINChina, AlgeriaTech, VentureBeat, NeuralLL), sont désormais publics et vérifiables.

Ce qui frappe d’emblée, c’est la stratégie de Z.ai : publier les poids du modèle sous licence MIT, permettant un déploiement local gratuit, sans frais d’API. Dans un marché dominé par des API coûteuses et des modèles fermés, cette ouverture radicale attire les regards. « C’est un signal fort », commente l’analyste Pareekh Jain, cité par Computerworld. « Pour la première fois, un modèle open source revendique la première place sur un benchmark d’ingénierie logicielle aussi exigeant. »

Mais cinq mois plus tard, le paysage a déjà changé. GLM-5.1 n’est plus seul en tête : il a ouvert une brèche dans laquelle se sont engouffrés DeepSeek, Moonshot AI, Alibaba, Tencent et même Meta. Pour comprendre la portée de ce basculement, il faut d’abord saisir ce que représente SWE-Bench Pro.

SWE-Bench Pro : le test qui change la donne pour l’ingénierie logicielle

Pour comprendre l’ampleur de l’annonce, il faut décortiquer ce qu’est SWE-Bench Pro. Contrairement aux benchmarks classiques de génération de code (HumanEval, MBPP) qui testent des fonctions isolées, SWE-Bench Pro évalue la capacité d’un modèle à résoudre des bugs réels issus de dépôts GitHub, à générer des correctifs complets et à effectuer des tâches d’ingénierie logicielle complexes. Développé par des chercheurs de Princeton et d’OpenAI, il présente au modèle des dépôts entiers et des issues réelles provenant de projets open source en production, et mesure si le correctif de l’agent résout l’issue lorsque les tests sont exécutés.

Scores SWE-Bench ProGLM-5.262.1%GLM-5.158.4%GPT-5.457.7%Claude Opus 4.657.3%Gemini 3.1 Pro54.2%GLM-555.1%

Les scores publiés par Z.ai et confirmés par les sources web sont les suivants :

Modèle Score SWE-Bench Pro
GLM-5.2 (Z.ai) 62,1 %
GLM-5.1 (Z.ai) 58,4 %
GPT-5.4 (OpenAI) 57,7 %
Claude Opus 4.6 (Anthropic) 57,3 %
Gemini 3.1 Pro (Google) 54,2 %
GLM-5 (prédécesseur) 55,1 %

Sources : IALANews, AINChina, AlgeriaTech, VentureBeat, GitHub zai-org/GLM-5.

L’écart de 0,7 point entre GLM-5.1 et GPT-5.4 peut sembler modeste, mais il est statistiquement significatif sur un benchmark aussi exigeant. Surtout, GLM-5.1 est le premier modèle chinois et le premier modèle open-weight à dominer ce classement. Notons que GLM-5.2, dévoilé mi-juillet 2026 (et non fin juin comme certaines rumeurs l’avaient annoncé), atteint un score encore plus élevé de 62,1 % sur le même benchmark, avec une fenêtre de contexte de 1 million de tokens (source VentureBeat, MSN, GitHub, SiliconANGLE). Cette progression rapide suggère une dynamique d’amélioration continue.

Il faut néanmoins nuancer : sur le composite élargi incluant Terminal-Bench 2.0 et NL2Repo, Claude Opus 4.6 conserve une légère avance (57,5 contre 54,9 pour GLM-5.1), comme le souligne NeuralLL. « Bat Claude » est exact sur SWE-Bench Pro, pas sur tous les benchmarks de code. Mais le symbole reste fort : la frontière entre open source et propriétaire vient de bouger.

La « journée de travail de 8 heures » pour l’IA : comment GLM-5.1 code en autonomie pendant des heures

L’innovation la plus frappante de GLM-5.1 n’est pas seulement son score, mais sa capacité à maintenir des performances sur de longues séquences d’itérations. Z.ai introduit le concept de « 8-hour work day » pour l’IA : assigner un ticket le matin et recevoir une solution optimisée le soir, après des centaines d’expériences autonomes.

L’exemple phare donné par l’entreprise est éloquent : sur une tâche d’optimisation d’une base de données vectorielle, GLM-5.1 a réalisé plus de 600 itérations et 6 000 appels d’outils, atteignant 21 500 requêtes par seconde – soit six fois le meilleur résultat obtenu en une session standard de 50 tours. « C’est comme si l’IA pouvait travailler sans relâche, explorer des centaines de pistes et affiner sa solution au fil des heures », commente Pareekh Jain.

Lors d’une démonstration rapportée par IALANews, le modèle a construit de A à Z un environnement de bureau fonctionnel comprenant un navigateur de fichiers, un terminal, un éditeur de texte et même des jeux interactifs, en peaufinant itérativement le design et la logique d’interaction. Cette approche change la donne pour les workflows de développement. Au lieu de prompts isolés, les développeurs peuvent confier des tâches complexes à un agent qui les exécute en arrière-plan, comme un stagiaire infatigable. Concrètement, cela ouvre la voie à des agents autonomes capables de :

  • Corriger des bugs dans une base de code entière en une journée.
  • Refactorer des modules entiers avec des tests de régression.
  • Optimiser des performances système par exploration systématique.

Cependant, il faut noter que ce concept repose sur les affirmations de Z.ai. Aucune étude indépendante n’a reproduit ces résultats. L’analyste Charlie Dai, également cité par Computerworld, souligne que « la tendance vers des agents longue durée est réelle, mais la fiabilité des correctifs générés reste un défi majeur ».

Architecture et spécifications techniques : ce que l’on sait de GLM-5.1, GLM-5.2 et GLM-5.3

Sur le plan technique, les sources disponibles sont désormais plus précises que lors de l’annonce initiale. GLM-5.1 est une mise à niveau post-entraînement de GLM-5, le modèle Mixture-of-Experts que Z.ai avait publié plus tôt en 2026. Voici les spécifications clés, rapportées par VentureBeat, IALANews, NeuralLL, SiliconANGLE et la documentation développeur de Z.ai :

Source : infoworld.com
  • Paramètres totaux : ~744 milliards (MoE) pour GLM-5.1 ; GLM-5.2 et GLM-5.3 passent à 753 milliards (certaines sources mentionnent 743 ou 754, la différence venant probablement de la méthode de comptage des paramètres d’embedding).
  • Paramètres actifs par passe avant : ~40 milliards (architecture MoE avec routage dynamique).
  • Fenêtre de contexte : 202 752 tokens (~200K) pour GLM-5.1, portée à 1 million de tokens pour GLM-5.2 et GLM-5.3, avec une sortie maximale de 128 000 tokens pour GLM-5.3.
  • Licence : MIT pour GLM-5.1 et GLM-5.2 (usage commercial, modification, redistribution tous autorisés) ; poids différés pour GLM-5.3 (accès via API et « Coding Plan » payant).
  • Dates de publication : GLM-5.1 le 7 avril 2026 ; GLM-5.2 mi-juillet 2026 ; GLM-5.3 le 14 août 2026.
  • Infrastructure d’entraînement : entièrement sur des puces Huawei Ascend 910B avec le framework MindSpore, sans aucun GPU Nvidia ou AMD.
  • Optimisation : explicitement conçu pour le travail agentique à long horizon, avec maintien autonome de l’alignement sur un objectif sur des tâches allant jusqu’à environ huit heures et des milliers d’appels d’outils.

GLM-5.2 ajoute la technique IndexShare (réutilisation du même indexeur sur quatre couches d’attention sparse, réduisant les FLOPs par token de 2,9× à 1M de contexte). Son score de 62,1 % sur SWE-Bench Pro et de 81,0 % sur Terminal-Bench 2.1 (contre 62,0 % pour GLM-5.1) en fait un outil redoutable pour les développeurs. Sur Terminal-Bench 2.1, il se place à quelques points de Claude Opus 4.8 (85,0 %), tout en restant devant Gemini 3.1 Pro.

Ce qui est confirmé pour les trois versions :

  • GLM-5.1 et GLM-5.2 sous licence MIT : les poids sont publiés et peuvent être déployés localement.
  • Conception spécifique pour l’ingénierie logicielle agentique : le modèle est optimisé pour des séquences longues d’appels d’outils.
  • Disponible via des plateformes de développement (Hugging Face, etc.).

Cette opacité relative contraste avec les pratiques d’autres modèles open source comme DeepSeek ou Qwen, qui publient des papiers techniques détaillés. Pour l’instant, les GLM restent des boîtes noires performantes. Les chercheurs et développeurs devront se contenter des affirmations de Z.ai en attendant une documentation plus complète.

GLM-5.3 : Z.ai frappe encore, et vise la cybersécurité

Le 14 août 2026, Z.ai a dégainé GLM-5.3, un modèle de 753 milliards de paramètres (MoE) qui réutilise la base de GLM-5.2 sans aucun nouveau paramètre, uniquement par post-entraînement. Cette version marque un tournant : elle s’impose en tête du benchmark CyberGym avec un score de 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol sur les tâches cybersécurité. Sur DeepSWE, elle atteint 66,9 points. Surtout, le post-entraînement seul fait passer Terminal-Bench 3.0 de 4,6 % à 28,3 % – une progression spectaculaire qui démontre la puissance de l’optimisation ciblée.

Selon SiliconANGLE, GLM-5.3 a déjà trouvé plus de 2 400 vulnérabilités dans 269 projets logiciels, dont environ la moitié avec une sévérité moyenne ou supérieure. L’une d’elles se trouve dans un code vieux de 40 ans. Le post-entraînement a été réalisé dans des sandboxes simulant des postes de travail de développeurs, avec des exercices pouvant prendre plusieurs jours, ce qui a amélioré la capacité du modèle à gérer des tâches à long horizon. Un « juge agent » vérifiait que les défis étaient solubles avant de les soumettre au modèle.

GLM-5.3 conserve la fenêtre de contexte de 1 million de tokens et une sortie maximale de 128 000 tokens. Les poids ne sont pas encore publics : Z.ai les a différés, privilégiant un accès via son « Coding Plan » payant. L’entreprise accompagne cette sortie d’un programme d’audit gratuit, un signal fort sur la place que l’IA chinoise veut prendre en cybersécurité. « GLM-5.3 est le fleuron post-entraîné de Z.ai », résume le site Aireiter, qui publie des tableaux de benchmarks complets.

Cette sortie intervient alors que Z.ai talonne Kimi K3 au sommet des classements open source, selon le Journal du Web. La stratégie de Z.ai est claire : dominer le terrain du codage agentique et de la cybersécurité, deux marchés en pleine explosion.

Open source contre propriétaire : le rapport de force s’est déplacé

La confrontation entre GLM-5.1/5.2/5.3 et les modèles propriétaires américains était inévitable. Mais depuis avril, le rapport de force a basculé. Le 24 avril 2026, DeepSeek a lâché en open source deux modèles — V4-Pro et V4-Flash — dont les spécifications donnent le vertige : 1,6 billion de paramètres, 49 milliards actifs, et un score de 81 % sur SWE-bench qui défie GPT-5.5 et Claude Opus 4.7. Fin juillet, Moonshot AI a dévoilé Kimi K3, présenté comme le plus grand modèle open source jamais développé, presque au niveau des meilleurs modèles américains. Début août, Alibaba a annoncé Qwen3.8-Max, un modèle de 2,4 billions de paramètres avec 1 million de tokens de contexte, taillé pour les agents autonomes. Fin août, Tencent a ouvert Hy4, un modèle de 770 milliards de paramètres avec 49 milliards actifs et 1 million de tokens de contexte, conçu pour le codage, la productivité bureautique et la recherche scientifique.

Source : businessinsider.com

Voici un tableau comparatif actualisé en septembre 2026 :

Critère GLM-5.3 (Z.ai) GLM-5.2 (Z.ai) DeepSeek V4-Pro Qwen3.8-Max (Alibaba) Hy4 (Tencent) GPT-5.4 (OpenAI)
Licence Poids différés (API) MIT (open source) Open source Poids ouverts annoncés Open source Propriétaire (API)
Paramètres 753B (MoE) ~753B (MoE) 1,6T (MoE, 49B actifs) 2,4T 770B (49B actifs) Non divulgué
Score SWE-Bench Pro Non communiqué 62,1 % (confirmé) 81 % (SWE-bench) Non communiqué Non communiqué 57,7 %
Fenêtre de contexte 1M tokens 1M tokens 1M tokens 1M tokens 1M tokens Non divulgué

Sources : SiliconANGLE, Techgenyz, gadgetpilipinas.net, VentureBeat, IALANews.

DeepSeek V4-Pro se distingue par une guerre des prix agressive : sur OpenRouter, il est proposé à 0,14 $/M tokens en entrée et 0,87 $/M tokens en sortie (build V4 Pro 0813 du 12 août 2026), bien en dessous de Kimi K3, tout en offrant la même fenêtre de contexte d’un million de tokens. Cette stratégie de prix, couplée à des performances de premier plan, accélère l’adoption des modèles open source dans les entreprises.

L’écosystème en septembre 2026 : une guerre froide des modèles qui s’intensifie

Au-delà des géants chinois, l’écosystème open source s’est enrichi de nouveaux entrants majeurs. Meta a fait son retour avec Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres sous licence Apache 2.0, conçu pour une exécution locale sur appareils. Publié le 13-14 août 2026, il excelle dans le raisonnement multimodal et les tâches d’agents, marquant un virage stratégique de Meta vers l’open source local (source VentureBeat, MSN).

Côté outils, l’intégration des modèles open source dans les environnements de développement s’accélère. Cline Desktop, l’application open-source dédiée aux modèles open-weight, propose désormais gratuitement DeepSeek V4 Flash, GLM 5.3 Flash et Laguna S 2.1, avec un débogage au niveau du dépôt, capable de tracer des exceptions avalées à travers plusieurs fichiers (source blockchain.news). Cette intégration permet aux développeurs de bénéficier d’une analyse locale de code sans dépendance au cloud, réduisant les coûts de licence des modèles propriétaires.

Le fine-tuning n’est pas en reste. Unsloth, avec sa version Dynamic 3.0 GGUFs, pousse la quantification dynamique à un niveau inédit, permettant de fine-tuner des MoE géants sur du matériel grand public. Selon les analyses de Blent.ai et Sales-Hacking, Unsloth offre jusqu’à 2× plus rapide et 70 % de mémoire en moins par rapport aux implémentations traditionnelles, avec une note de 9,5/10 pour l’optimisation mémoire. C’est devenu l’outil de référence pour les développeurs indépendants et les petites équipes.

Les moteurs d’inférence open source ont également convergé : vLLM, SGLang et TensorRT-LLM dominent, avec des débits de 1 850 à 2 100 tok/s sur H100. Le Ray Summit 2026, qui s’est tenu du 24 au 26 août à San Francisco, a mis en évidence la convergence de l’infrastructure open source autour du RL post-entraînement, avec la première conférence vLLM co-localisée.

Enfin, le mystérieux Ox Alpha, apparu sur OpenRouter le 20 août 2026, a captivé la communauté : un modèle de raisonnement gratuit, sans éditeur connu, impressionnant en code et en raisonnement, dont l’origine reste spéculative (certains indices pointent vers un laboratoire chinois, possiblement Zhipu/Z.ai, Xiaomi ou Meituan). Ce « modèle fantôme » illustre la vitalité et l’opacité croissante de l’écosystème open source.

Conclusion : une nouvelle ère pour l’IA open source

En cinq mois, l’IA open source est passée du statut de challenger à celui de leader sur les benchmarks de codage. GLM-5.1 a ouvert la brèche, GLM-5.2 et GLM-5.3 l’ont élargie, et DeepSeek, Qwen, Kimi, Hy4 et Muse Glimmer ont confirmé la tendance. La frontière entre open source et propriétaire s’est déplacée : les modèles ouverts dominent désormais le codage agentique, la cybersécurité et le raisonnement long-horizon, tout en restant compétitifs sur les prix.

Source : computerworld.com

Reste une question : les géants propriétaires américains (OpenAI, Anthropic, Google) sauront-ils répondre ? Pour l’instant, leurs modèles conservent des avantages sur certains benchmarks composites, mais la dynamique est clairement du côté de l’open source. Comme le résume un analyste cité par Computerworld : « La guerre froide des modèles s’intensifie, et l’open source a désormais les moyens de la mener. »

Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *