Magazine LLM Opensource · 13 September 2026Classements LLM 2026 : pourquoi les palmarès se contredisent (et comment s’en servir)
Le 5 juillet 2026, TECHSY couronne Qwen 3 235B-A22B. Le 7 août, BenchLM sacre MiniMax M3. Le 14 août, Z.ai dégaine GLM-5.3 et domine le benchmark cybersécurité CyberGym. Le 10 août, Meta publie Muse Glimmer, un agent 30B qui tourne sur un PC. Fin août, Tencent ouvre Hy4 preview et un modèle fantôme nommé Ox Alpha intrigue la communauté. Trois semaines, trois verdicts irréconciliables, et un lecteur qui se demande si ces classements mesurent vraiment quelque chose. Ce dossier dissèque les méthodologies, les biais et les angles morts de ces palmarès — et propose une grille de lecture pratique pour ceux qui doivent choisir un modèle pour de vrai.
Le grand dérèglement des palmarès
Il y a un paradoxe savoureux dans l’écosystème des LLM open source en cet été 2026 : plus les guides se multiplient, moins ils s’accordent. Prenez quatre publications sérieuses, publiées à quelques semaines d’intervalle. TECHSY, média tech francophone, met à jour son classement le 5 juillet et place Qwen 3 235B-A22B en tête, suivi de DeepSeek R1, avec une mention spéciale pour Llama 4 Scout sur les très longs contextes. BenchLM, leaderboard indépendant, classe au 7 août 96 modèles open-weight et désigne MiniMax M3 comme leader avec un score composite BenchAlign v5 de 68,8/100, devant Hy3 de Tencent (67,9) et GLM-5.1 de Z.AI (66,9). ComputingForGeeks, dans sa révision d’août, met en avant DeepSeek V4 Pro pour sa densité remarquable (49B paramètres actifs sur 1,6T) et Kimi K3 pour sa fenêtre d’un million de tokens. Et le 14 août, Z.ai lance GLM-5.3, qui s’impose en tête du benchmark CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol sur les tâches cybersécurité — sans publier ses poids.
Quatre sources, quatre « meilleurs modèles » différents, et pourtant aucune n’a tort. C’est là tout le problème : ces classements ne répondent pas aux mêmes questions. L’un évalue des capacités de raisonnement sur des benchmarks classiques, l’autre agrège des scores composites propriétaires, le troisième valorise l’architecture et la faisabilité matérielle, le quatrième mesure des compétences spécialisées (code long-horizon, cybersécurité). Comparer leurs verdicts revient à comparer les notes d’un examen de mathématiques, d’un entretien d’embauche, d’un test de condition physique et d’un exercice de pentest pour départager des candidats à un poste de développeur.
Ce dossier ne cherche pas à trancher — ce serait un exercice vain. Il propose plutôt de comprendre pourquoi ces classements divergent, ce qu’ils mesurent réellement, et comment s’en servir sans se faire piéger.
Pourquoi tout le monde publie son classement en 2026
La prolifération soudaine de guides et de palmarès n’est pas un hasard. Elle répond à une tempête parfaite : une avalanche de sorties majeures et la faillite silencieuse des benchmarks historiques.
Côté sorties, le premier semestre 2026 a été d’une densité inédite. DeepSeek a lancé V4 Pro et V4 Flash en avril (1,6T et 284B paramètres, tous deux en licence MIT avec une fenêtre d’un million de tokens). Alibaba a suivi le même mois avec Qwen3.6-27B et Qwen3.6-35B-A3B, puis a dévoilé début août Qwen3.8-Max, un modèle de 2,4T paramètres aux poids ouverts annoncés. Z.AI a sorti GLM-5 en février (744B, 40B actifs) puis GLM-5.2 en juin (743B, ~40B actifs, contexte 1M), et enfin GLM-5.3 le 14 août — sans changer de base, mais avec un post-entraînement qui a tout changé. Moonshot AI a dévoilé Kimi K3 fin juillet, un modèle de 2,8T paramètres avec 104B actifs et 896 experts MoE, rendu plus largement accessible le 27 juillet. Meta, après quatre mois de verrouillage, a publié le 10 août Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres sous licence Apache 2.0, conçu pour tourner sur un PC ou un Mac avec 24 Go de VRAM. Fin août, Tencent a ouvert Hy4 preview, un modèle de 770B paramètres (49B actifs) avec contexte d’un million de tokens, orienté code, productivité bureautique et recherche scientifique. Sans oublier les modèles propriétaires qui écrasent les benchmarks — Claude Fable 5, GPT-5.6, Gemini 3 Pro — et qui rappellent que l’open source doit constamment justifier sa pertinence.
Face à cette déferlante, les repères traditionnels se sont effondrés. MMLU, le benchmark roi des années 2023-2024, est saturé : les leaders dépassent 90 %, et les écarts entre modèles se mesurent désormais en décimales sans signification statistique. HumanEval, l’étalon du code, connaît le même sort. Les nouveaux benchmarks censés prendre le relais — GPQA Diamond, AIME 2026, SWE-Bench Verified, BFCL — ne sont pas encore standardisés. Chaque média choisit le sien, avec son harness, ses prompts, sa température. Résultat : des scores qui ne sont pas comparables d’une source à l’autre, et des classements qui se contredisent.
Il ne faut pas négliger non plus la dimension économique. Publier un classement, c’est capter une audience assoiffée de repères. Pour un fournisseur de GPU cloud comme Novita ou Thunder Compute, c’est aussi une manière de diriger les lecteurs vers les modèles qui tournent bien sur leur infrastructure. Pour un média tech, c’est du trafic et de la crédibilité. La course aux guides est aussi une course à l’audience — et personne n’a intérêt à publier un « classement » qui dirait : « tout dépend de votre cas d’usage ».
Sous le capot des six sources
Examinons ce que chaque source mesure vraiment. TECHSY, dans sa mise à jour du 5 juillet, fournit des scores MMLU et HumanEval pour cinq modèles — mais pas les plus récents. Llama 3.3 70B (86,0 en MMLU, 88,4 en HumanEval), Qwen 2.5 72B (85,0+, 86,6), DeepSeek-V3 (87,1, 82,6), Mistral Small 3.1 (80,6, 88,4), Gemma 3 27B (~78,6, 87,8). Ce sont des modèles de 2024 et 2025. Le classement final, lui, couronne Qwen 3 235B-A22B et DeepSeek R1 — des modèles plus récents — mais sans fournir les scores qui justifient ce choix. Aucune méthodologie n’est documentée : pas de version de lm-eval-harness, pas de température, pas de longueur de contexte testée. C’est un classement éditorial habillé de chiffres.
ComputingForGeeks prend le parti inverse : un tableau de spécifications méticuleux, re-vérifié contre les fiches officielles des modèles en août 2026, avec des tests maison (CPU tests en mars 2026 sur Ubuntu 24.04, mesures de DeepSeek V4 Flash et Kimi K3 en août). Paramètres totaux, paramètres actifs, type d’attention, fenêtre de contexte, licence, date de sortie : tout y est. Mais aucun score de benchmark. Le site répond à la question « quels modèles existent et que peut-on en faire ? », pas à « lequel est le plus intelligent ? ».
Koul, le blog d’Eliott Bidault-Hervouet, adopte une troisième approche : rappeler la définition OSI de l’IA open source publiée en octobre 2024, et affirmer que le choix d’un modèle en 2026 se joue sur la licence, le coût d’hébergement et la conformité — pas sur un score. C’est un positionnement salutaire, mais qui laisse le lecteur sans réponse concrète sur les performances.
Restent les acteurs aux intérêts plus directs. Novita, Tensoria et Thunder Compute sont des fournisseurs d’infrastructure GPU. Leurs guides privilégient naturellement des critères pratiques : latence, coût par token, facilité de déploiement, compatibilité avec les frameworks d’inférence. Ces critères sont précieux — ce sont ceux qui comptent en production — mais ils sont aussi orientés : un modèle qui tourne mal sur leur hardware a peu de chances d’être recommandé.
Aucune de ces sources ne documente la version de lm-eval-harness utilisée, la longueur de contexte testée pour chaque score, ou la pondération des benchmarks. C’est le point aveugle commun : les chiffres sont présentés comme des faits bruts, alors qu’ils dépendent de choix méthodologiques invisibles.
| Source | Type | Critères principaux | Modèles couverts | Méthodologie documentée |
|---|---|---|---|---|
| TECHSY (juil. 2026) | Média tech | Scores MMLU/HumanEval, classement éditorial | 2024-2025 + Qwen 3 235B | Non |
| BenchLM (août 2026) | Leaderboard indépendant | Score composite BenchAlign v5 | 96 modèles open-weight | Partielle (composite propriétaire) |
| ComputingForGeeks (août 2026) | Blog technique | Spécifications, tests maison | 2025-2026 | Oui (specs re-vérifiées) |
| Koul (2026) | Blog communautaire | Licence, coût, conformité | Non exhaustif | Non |
| Novita / Tensoria / Thunder Compute | Fournisseurs GPU | Latence, coût/token, déploiement | Modèles récents | Partielle |
| datavlab | Blog technique | Cadre de décision production | Modèles récents | Partielle |
Les quatre biais qui faussent les comparaisons
Derrière les divergences de classement se cachent quatre mécanismes bien identifiés, qui faussent les comparaisons même quand les sources sont de bonne foi.

La contamination des données d’entraînement. Les benchmarks publics comme GPQA Diamond ou MMLU-Pro sont devenus des corpus d’entraînement. Les modèles récents sont entraînés sur ces questions — parfois volontairement, parfois par contamination accidentelle via le web — et leurs scores s’effondrent dès qu’on les teste sur des variantes inédites. C’est un problème connu depuis 2024, mais il s’est aggravé avec la course aux leaderboards. Un score de 77,3 % sur GPQA Diamond, comme celui attribué à o4-mini par un blog en juillet 2026, ne signifie pas grand-chose si le modèle a pu voir ces questions pendant son entraînement.
La sur-optimisation sur les tests populaires. AIME 2026, le benchmark de mathématiques olympiques, est devenu un passage obligé. Les équipes entraînent leurs modèles pour maximiser ce score précis, parfois au détriment de la généralisation. Un modèle qui excelle sur AIME peut échouer sur des problèmes mathématiques plus simples mais formulés différemment. Les classements qui s’appuient sur ces benchmarks récompensent la capacité à réussir le test, pas la capacité à raisonner.
La variance d’évaluation. La température, les prompts, le nombre de few-shot examples, la longueur de contexte testée : chaque paramètre peut faire varier les résultats de plusieurs points. Un modèle qui obtient 86,0 en MMLU avec un prompt soigneusement optimisé peut tomber à 83 avec un prompt standard. Sans documentation précise du protocole, deux scores comparables peuvent provenir de conditions radicalement différentes.
Le décalage générationnel. C’est le biais le plus structurel. TECHSY compare des modèles de 2024-2025 (DeepSeek R1, Llama 3.3) quand ComputingForGeeks intègre ceux de 2026 (DeepSeek V4, Qwen 3.6, Kimi K3). Les écarts de classement sont alors purement temporels : un modèle de 2026 est presque toujours meilleur qu’un modèle de 2024, quelle que soit la métrique. Comparer les deux revient à comparer un smartphone de l’année à un modèle de trois ans plus tôt.
Étude de cas : GLM-5.3, le post-entraînement qui change la donne
Le 14 août 2026, Z.ai a dévoilé GLM-5.3, un modèle qui ne change pas de taille mais change de métier. Même base que GLM-5.2 — un MoE de 743 milliards de paramètres, 1M de contexte, 128K de sortie — mais tout vient du post-entraînement. Les gains sont spectaculaires sur les tâches agentiques : Terminal-Bench 3.0 passe de 4,6 % à 28,3 % grâce au seul post-entraînement. Sur le benchmark cybersécurité CyberGym, GLM-5.3 s’impose avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol. Sur DeepSWE, il atteint 66,9, un score qui le place au niveau des meilleurs modèles propriétaires.
Ce qui est remarquable, c’est que Z.ai n’a pas publié les poids. Le modèle est disponible via le GLM Coding Plan et ZCode, avec une API générale « coming soon ». Les poids sont différés — une stratégie qui rappelle que l’open source n’est pas binaire : entre les poids immédiats et le code fermé, il existe tout un spectre de diffusion. Z.ai a également lancé un programme d’audit gratuit, un signal fort sur la place que l’IA chinoise veut prendre en cybersécurité.
Ce cas illustre parfaitement la thèse de ce dossier : un classement qui ne tient compte que des modèles aux poids disponibles (comme BenchLM) exclut GLM-5.3, tandis qu’un classement qui intègre les modèles accessibles par API (comme ComputingForGeeks) l’inclut. Les deux sont défendables, mais ils ne répondent pas à la même question.
Muse Glimmer : Meta revient dans la course
Le 10 août 2026, Meta a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres sous licence Apache 2.0, conçu pour tourner sur un PC ou un Mac avec 24 Go de VRAM. Après quatre mois de verrouillage, Meta revient dans le jeu open source avec une proposition claire : l’agent local. Muse Glimmer excelle dans le raisonnement multimodal et l’exécution d’actions sur l’appareil — une réponse directe aux modèles propriétaires qui exigent le cloud.

Son intérêt ne réside pas dans un score de benchmark, mais dans sa faisabilité matérielle. Avec 30B de paramètres, il tient dans la mémoire d’une machine de bureau moderne, ce qui en fait un candidat sérieux pour les déploiements edge, les agents personnels et les environnements où la souveraineté des données est non négociable. C’est un modèle qui ne cherche pas à battre GPT-5.6 sur MMLU, mais à rendre l’agentique accessible sans passer par une API.
Hy4 preview : Tencent entre dans la danse
Fin août 2026, Tencent a ouvert Hy4 preview, un modèle de 770 milliards de paramètres avec 49B actifs et une fenêtre de contexte d’un million de tokens. Orienté code, productivité bureautique et recherche scientifique, Hy4 preview est disponible via API et en open source. Son architecture MoE dense en actifs le place dans la même catégorie que DeepSeek V4 et Kimi K3, avec une promesse de coût d’inférence maîtrisé.
Sa sortie confirme une tendance lourde de 2026 : les laboratoires chinois ne se contentent plus de suivre — ils définissent le rythme. DeepSeek, Alibaba, Z.ai, Moonshot, et maintenant Tencent : cinq acteurs majeurs ont publié des modèles de plus de 700B paramètres en six mois, tous avec des licences permissives ou des poids différés. La guerre des prix observée sur OpenRouter, où DeepSeek V4-Pro est proposé bien en dessous de Kimi K3 pour une fenêtre de contexte équivalente, n’est pas près de s’arrêter.
Ox Alpha : le fantôme d’OpenRouter
Le 20 août 2026, un modèle de raisonnement anonyme nommé Ox Alpha est apparu sur OpenRouter, accessible gratuitement jusqu’au 27 août. Son fournisseur n’a pas révélé son identité. Les développeurs qui l’ont testé rapportent des performances impressionnantes en code et en tâches agentiques, certains suspectant un laboratoire chinois, d’autres un exercice de communication d’une entreprise américaine. Business Insider a enquêté sans parvenir à identifier l’origine.

Ce mystère est en soi un symptôme. Dans un écosystème où les classements se contredisent, un modèle sans éditeur connu mais aux performances remarquables devient un test de Rorschach : chacun y projette ses attentes et ses craintes. Ox Alpha rappelle aussi que la réputation d’un modèle ne se construit plus seulement sur des benchmarks, mais sur la confiance — et que l’anonymat, en IA, est rarement un bon signe.
Ce que les palmarès ne disent pas
Au-delà des scores, quatre dimensions échappent systématiquement aux classements.
La robustesse et la sécurité. En juillet 2026, Forbes a publié une enquête choc sur des backdoors dissimulées dans des LLM open source, capables de se déclencher à grande échelle. L’incident NemoClaw — une faille dans l’API Ollama permettant d’empoisonner durablement les modèles — a montré que la sécurité est devenue un critère de choix, pas une option. Aucun leaderboard ne mesure la résistance d’un modèle à l’exfiltration de données ou aux injections de prompts. GLM-5.3, avec son programme d’audit gratuit, tente de transformer cet angle mort en argument commercial.
La souveraineté et la conformité. L’AI Act européen est entré en application pour ses règles de transparence le 2 août 2026. Les entreprises doivent désormais documenter leurs modèles, leurs données d’entraînement et leurs usages. Un classement qui ignore la licence et la provenance des données est inutilisable pour une DSI européenne. C’est le point que Koul martèle à juste titre : le choix d’un modèle en 2026 se joue d’abord sur la conformité, pas sur un score.
Le coût total de possession. Un modèle de 2,8T paramètres comme Kimi K3 peut être excellent sur les benchmarks, mais son inférence exige des clusters de GPU que peu d’organisations peuvent s’offrir. À l’inverse, un modèle de 30B comme Muse Glimmer tourne sur un PC de bureau. Les classements qui ne pondèrent pas par le coût d’inférence sont des exercices académiques. Les fournisseurs GPU comme Novita ou Tensoria le savent bien : c’est leur argument principal.
La fraîcheur des données. Un classement publié en juillet peut être obsolète en août. Entre le 5 juillet et le 14 août 2026, pas moins de six modèles majeurs sont sortis ou ont été mis à jour. Les palmarès qui ne datent pas précisément leurs mesures — ou qui comparent des modèles de générations différentes — induisent en erreur.
Comment choisir son modèle en septembre 2026 : une grille pratique
Face à ce chaos informationnel, voici une méthode en cinq étapes, fondée sur les critères que les sources les plus sérieuses convergent à recommander.
1. Définir le cas d’usage, pas le benchmark. Un modèle de code long-horizon (GLM-5.3, DeepSeek V4 Pro) n’est pas un modèle de recherche multimodale (Kimi K3) ni un agent local (Muse Glimmer). Commencez par lister les tâches concrètes : génération de code, analyse de documents, agents autonomes, cybersécurité, etc.
2. Vérifier la faisabilité matérielle. Pour chaque candidat, calculez le coût d’inférence : paramètres actifs, VRAM nécessaire, latence. Un modèle de 770B avec 49B actifs (Hy4) peut être plus économique qu’un modèle de 70B dense. Les guides de Tensoria et les tests maison de ComputingForGeeks sont ici vos meilleurs alliés.
3. Examiner la licence et la conformité. Depuis le 2 août 2026, l’AI Act impose des obligations de transparence. Vérifiez la licence (MIT, Apache 2.0, licence personnalisée), la provenance des données d’entraînement et les conditions de diffusion des poids. Un modèle aux poids différés (GLM-5.3) n’offre pas les mêmes garanties qu’un modèle aux poids immédiats (DeepSeek V4).
4. Tester sur vos propres données. Les benchmarks publics sont contaminés et saturés. La seule mesure fiable est un test sur un échantillon représentatif de vos données, avec un protocole documenté (température, prompts, contexte). C’est ce que recommandent les équipes qui déploient en production.
5. Surveiller la sécurité. L’enquête Forbes de juillet et l’incident NemoClaw ont montré que les backdoors sont une menace réelle. Privilégiez les modèles issus de laboratoires établis, auditez les poids si possible, et isolez les déploiements sensibles.
Conclusion : les palmarès sont des outils, pas des verdicts
Les classements de LLM open source en 2026 se contredisent parce qu’ils mesurent des choses différentes, avec des méthodes différentes, sur des générations différentes de modèles. Ce n’est pas un bug, c’est une caractéristique d’un écosystème en pleine explosion.
La bonne nouvelle, c’est que cette diversité est saine : elle reflète la richesse d’un marché où les choix se multiplient. La mauvaise nouvelle, c’est qu’elle exige du lecteur un travail critique que les palmarès ne font pas à sa place. Aucun score ne remplacera une définition précise du besoin, une vérification de la faisabilité matérielle et un test sur ses propres données.
En septembre 2026, l’open source n’a jamais été aussi proche des meilleurs modèles propriétaires — et jamais aussi difficile à départager. C’est le prix de l’abondance.
Sources
- GLM-5.3 : Z.ai lâche son modèle open-weight au prix de la version précédente et talonne Kimi K3 au sommet des classements (19 août 2026)
- GLM-5.3 : Z.AI domine le benchmark cybersécurité CyberGym (19 août 2026)
- Avec GLM-5.3, Z.ai lie enfin IA ouverte et cybersécurité (19 août 2026)
- GLM-5.3 : benchmarks, tarifs et accès au nouveau modèle de Z.ai (17 août 2026)
- Z.ai releases GLM-5.3 for coding and cyber work (17 août 2026)
- Z.ai Unveils GLM-5.3 with Major Enhancements for Coding and Cybersecurity (17 août 2026)
- GLM-5.3: Z.ai Tops the Open Coding Leaderboard on Post-Training Alone (14 août 2026)
- Muse Glimmer : Le modèle agentique ouvert de 30B de Meta qui fonctionne sur votre appareil (14 août 2026)
- Meta lance Muse Glimmer : une IA open-source pour les agents IA locaux (12 août 2026)
- Hy4 preview: 770B Remarkable Open Model Launch (28 août 2026)
- Tencent Releases Open-Source Hy4 LLM Preview With 770B Parameters and 1M+ Token Context (8 septembre 2026)
- Ox Alpha, le modèle IA « stealth » qui intrigue : ce qui est vérifié, ce qui ne l’est pas (24 août 2026)
- A mysterious free AI model is impressing developers. And nobody knows who made it. (22 août 2026)
- NemoClaw i OpenClaw: błąd sieciowy w API Ollama umożliwia trwałe zatrucie modeli LLM (26 août 2026)
- Ray Summit 2026: RL Post-Training Forces Open-Source AI Infrastructure to Converge (25 août 2026)
- LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework (19 août 2026)
- 5 Meilleurs LLM Open Source (septembre 2026)
- LLM Open-Source : 3 LLM open-source à utiliser dans vos futurs projets de Machine Learning en 2026
- Top serveurs d’inférence LLM open-source en 2026
Article recherché et rédigé automatiquement · Magazine Electrosens