Magazine LLM Opensource · 12 September 2026Benchmarks LLM 2026 : le grand tri entre tests saturés, nouveaux étalons et pièges de la contamination
GPT-5 frôle les 95 % sur MMLU, trois modèles obtiennent 100 % à l’épreuve mathématique AIME 2025, et pourtant la communauté s’accorde : ces tests ne disent plus grand-chose de la qualité réelle d’un modèle. En 2026, le paysage des benchmarks LLM a profondément changé. Entre saturation des anciens étalons, émergence de nouvelles épreuves plus discriminantes et prise de conscience des phénomènes de contamination, les praticiens doivent revoir leur grille de lecture. Cet article dresse un état des lieux des tests qui comptent encore, de ceux qu’il faut enterrer, et des pièges à éviter pour choisir le bon modèle selon son usage.
MMLU à 95 % : quand le benchmark roi ne départage plus personne
Il fut un temps où le Massive Multitask Language Understanding (MMLU) était la référence absolue pour comparer les capacités générales des LLM. En 2026, ce temps est révolu. Les scores des modèles les plus avancés s’y tassent dans une fourchette si étroite que la différence n’est plus statistiquement significative. Selon le classement composite FrenchBench (édition #7, juillet 2026), GPT-5 atteint 95,4 % et Claude Opus 4.7 pointe à 95,1 % — un écart de 0,3 point qui ne reflète aucune différence pratique pour l’utilisateur final. D’autres sources confirment cette saturation : l’article de learn-prompting.fr (avril 2026) indique que les modèles frontier plafonnent entre 89 et 91 % sur MMLU, et que le test ne discrimine plus les meilleurs. Le même phénomène touche l’épreuve de mathématiques AIME 2025 : trois modèles obtiennent un score parfait de 100 %. Lorsque le plafond est atteint par plusieurs concurrents, le benchmark perd son pouvoir discriminant.
Cette saturation n’est pas une surprise. Les chercheurs l’avaient anticipée dès 2024, et le Stanford HAI AI Index 2024 pointait déjà le risque de contamination des données d’entraînement. En 2026, le constat est clair : MMLU et AIME 2025 sont des vétérans honorables, mais plus des étalons fiables. Comme le résume neowin.academy : « MMLU teste les connaissances générales. HumanEval teste l’écriture de fonctions Python isolées. GPQA teste les questions de doctorat. Tous ces benchmarks mesurent une compétence très étroite, et les modèles 2026 y atteignent un plafond proche du score humain. Plus moyen de différencier les modèles sur ces tests. »
Le guide datavlab.ai (2026) confirme cette lecture : « MMLU et MMLU-Pro restent utiles pour mesurer une base de connaissances générale et une certaine capacité de raisonnement », mais ils ne suffisent plus à départager les modèles de pointe. Les équipes sérieuses doivent désormais croiser plusieurs épreuves et construire leurs propres évaluations de production.
Le cimetière des tests : GSM8K, HumanEval, AIME… quels sont les vétérans à la retraite ?
Au-delà de MMLU, d’autres benchmarks historiques ont rejoint le cimetière des tests saturés. GSM8K (problèmes de mathématiques scolaires) et HumanEval (génération de code) étaient encore cités comme références il y a deux ans. Aujourd’hui, les modèles les plus performants les survolent. Les sources consultées ne fournissent pas de chiffres précis pour ces deux tests en 2026, mais le consensus de la communauté est clair : ils ne permettent plus de départager les modèles frontier. Sur Reddit, un fil de discussion intitulé « I made a list of every AI benchmark that still has signal in 2025-2026 (and the ones that are completely dead) » liste GSM8K et HumanEval parmi les « morts ». Le guide datavlab.ai le confirme sans détour : « HumanEval est dépassé ».
Les causes sont multiples. D’abord, la contamination des données d’entraînement : des questions de ces benchmarks publics ont été intégrées dans les corpus d’apprentissage de modèles comme GPT-4, Claude 3.5 ou Gemini 1.5, comme le rappelle le glossaire de kezify.com. Ensuite, le surapprentissage (overfitting) : les équipes de recherche optimisent explicitement leurs modèles pour maximiser les scores sur ces tests, au détriment de la généralisation. Enfin, la simplicité relative des épreuves : GSM8K et HumanEval mesurent des compétences de base que les LLM modernes maîtrisent désormais avec une fiabilité proche de 100 %.
Le cas d’AIME 2025 est emblématique : trois modèles à 100 %, c’est la preuve que le test n’est plus assez difficile. Les concepteurs de benchmarks l’ont bien compris : AIME 2026 a été conçu pour relever le niveau, et il figure désormais dans la matrice de référence recommandée par plusieurs sources. L’état des lieux de ayinedjimi-consultants.fr (mars 2026) souligne que les méthodologies actuelles « peinent à capturer les risques opérationnels réels — injection de prompt, empoisonnement des données d’entraînement, extraction de modèles — désormais observés en production ».
SWE-bench Verified, GPQA Diamond, MMLU-Pro : les nouveaux étalons qui font la différence
Face à la saturation des anciens tests, une nouvelle génération de benchmarks a émergé, conçue pour rester discriminante même pour les modèles les plus avancés. Leur point commun : ils sont plus difficiles, plus récents, et souvent construits pour résister à la contamination.
SWE-bench Verified est devenu l’étalon-or pour l’évaluation des capacités de code et d’agentivité. Il mesure la capacité d’un modèle à résoudre des bugs réels issus de dépôts GitHub, en autonomie. Les scores de mai 2026 publiés par neowire.academy montrent un delta massif et représentatif : Claude Opus 4.6 à 67 %, GPT-5 à 69 %, Sonnet 4.6 à 58 %, Gemini 3 Pro à 52 %. Ce benchmark est particulièrement apprécié des praticiens car il simule des tâches de développement réalistes. Claude Mythos 5 fait encore mieux avec 93,9 % sur SWE-Bench, selon le classement de juillet 2026 d’ayinedjimi-consultants.fr. Le guide datavlab.ai note que « SWE-Bench Verified s’améliore » et le recommande comme référence pour les tâches de code.
GPQA Diamond est un test de connaissances expertes de niveau doctoral, conçu par des chercheurs en IA. Il évalue le raisonnement profond dans des domaines spécialisés (physique, chimie, biologie). Le modèle o4-mini y atteint 77,3 %, meilleur score absolu de l’édition selon l’article de ayinedjimi-consultants.fr. Claude Mythos 5, un autre modèle, obtient 93,8 % sur ce même test — un écart significatif qui montre que GPQA Diamond discrimine encore bien. À titre de comparaison, 65 % des experts humains échouent à ces questions de niveau doctoral. datavlab.ai confirme que « GPQA progresse » et reste un indicateur pertinent pour le raisonnement expert.
MMLU-Pro est une version durcie de MMLU, avec des questions à choix multiples plus complexes et moins susceptibles d’avoir été vues pendant l’entraînement. Il fait partie de la matrice de référence 2026 recommandée par quelllm.fr, aux côtés de HumanEval+, AIME 2026, SWE-bench Verified, RULER 128k et GPQA Diamond. datavlab.ai note que « MMLU-Pro monte » et le positionne comme un complément utile à MMLU pour les évaluations de connaissances générales.
Le tableau ci-dessous résume les scores disponibles pour ces nouveaux étalons :
| Benchmark | Modèle leader (score) | Source |
|---|---|---|
| SWE-bench Verified | Claude Opus 4.6 (67 %) | neowire.academy |
| SWE-bench Verified | GPT-5 (69 %) | neowire.academy |
| SWE-bench Verified | Sonnet 4.6 (58 %) | neowire.academy |
| SWE-bench Verified | Gemini 3 Pro (52 %) | neowire.academy |
| SWE-Bench | Claude Mythos 5 (93,9 %) | ayinedjimi-consultants.fr |
| GPQA Diamond | o4-mini (77,3 %) | ayinedjimi-consultants.fr |
| GPQA Diamond | Claude Mythos 5 (93,8 %) | ayinedjimi-consultants.fr |
| AIME 2024 | DeepSeek R1 671B (~79 % pass@1) | quellm.fr |
| AIME 2024 | Llama 3.1 405B (~23 % pass@1) | quellm.fr |
| BenchLM | Claude Opus 5 (85,88/100) | ayinedjimi-consultants.fr |
Note : les scores pour MMLU-Pro, RULER 128k et AIME 2026 ne sont pas fournis dans les sources disponibles.
BrowseComp, OSWorld, TAU-Bench : les benchmarks agentic qui montent
L’essor des agents autonomes en entreprise a propulsé les benchmarks dits « agentic » au premier plan. Contrairement aux tests de Q&A statiques, ces benchmarks évaluent la capacité d’un LLM à exécuter des tâches complexes en plusieurs étapes, en interagissant avec des outils (shell, navigateur, API).

BrowseComp, publié par OpenAI en 2024, teste la capacité d’un modèle à trouver de l’information précise sur le web en naviguant de manière autonome : « navigue, lis, recoupe les sources, formule la réponse ». Les 1266 questions exigent typiquement 5 à 15 actions de navigation. Scores de mai 2026 : GPT-5 avec Operator à 64 %, Claude Sonnet 4.6 avec son agent web à 51 %, Gemini 3 Pro à 47 %. Pour les cas d’usage de recherche concurrentielle, veille ou due diligence, c’est le benchmark à regarder.
OSWorld teste la capacité d’un agent à utiliser un système d’exploitation complet (Linux ou macOS) : ouvrir des fichiers, éditer du texte, manipuler des images, créer des fichiers tabulaires, naviguer dans des applications. 369 tâches sur 9 catégories. Scores de mai 2026 : Claude (avec Computer Use 2.0) à 38 %, GPT-5 (avec Operator) à 42 %, Gemini 3 Pro à 24 %. C’est le benchmark de l’agent qui « bosse » comme un humain devant un ordinateur. datavlab.ai le cite explicitement parmi les tests à connaître pour évaluer les capacités d’usage ordinateur.
TAU-Bench complète le tableau en testant des scénarios plus variés : planification, recherche d’information, utilisation d’outils. La communauté open source s’est emparée de ces benchmarks. Des plateformes comme llm-stats.com ou benchlm.ai comparent des centaines de modèles sur SWE-bench et d’autres tests agentic. Le retour d’expérience des développeurs est unanime : un bon score sur SWE-bench Verified est bien mieux corrélé à la performance réelle en production qu’un score parfait sur HumanEval.
Pour les praticiens, intégrer un benchmark agentic dans leur processus de sélection est devenu indispensable, surtout s’ils déploient des agents autonomes (assistants de code, chatbots métier, RAG avancés). Le coût d’évaluation reste modéré : environ 5 modèles × 200 cas × 5 prompts = 5 000 runs LLM, selon kezify.com.
Multimodal et long contexte : les tests qui montent (MMMU, variation-in-a-haystack)
L’évaluation des capacités multimodales et de gestion de longs contextes a connu des avancées majeures en 2026. Les anciens tests comme needle-in-a-haystack (qui consiste à retrouver une information dans un long document) sont jugés insuffisants : ils ne mesurent qu’une forme basique de récupération d’information, sans évaluer la compréhension fine.
Le test variation-in-a-haystack le remplace avantageusement. Il introduit des variations dans le contenu du document (contradictions, informations multiples, distracteurs) pour tester la capacité du modèle à raisonner sur l’ensemble du contexte. Selon learn-prompting.fr, Gemini 3 Pro prend l’avantage au-delà de 200 000 tokens, ce qui suggère que ce benchmark discrimine encore les modèles sur la gestion des très longs contextes. Les nouveaux modèles comme Hy4 de Tencent (sorti le 8 septembre 2026) poussent la fenêtre à 1 million de tokens, ce qui rend ce type d’évaluation d’autant plus pertinent.
Côté multimodal, MMMU (Massive Multi-discipline Multimodal Understanding) et VisIT-Bench sont les références citées par kezify.com. MMMU couvre des questions à travers plusieurs disciplines (art, ingénierie, médecine) avec des entrées visuelles et textuelles. VisIT-Bench se concentre sur la compréhension d’images et de vidéos. Un modèle récent, VideoChat3, a même surpassé GPT-5 sur le video grounding (ancrage vidéo) selon une annonce de juillet 2026 (source MSN). Ce modèle open source a publié sa stack d’entraînement complète, ce qui en fait un concurrent sérieux pour les tâches vidéo. datavlab.ai recommande MMMU pour évaluer les capacités multimodales générales.
Pour les praticiens, le choix d’un benchmark multimodal dépend du type de données traitées : MMMU pour des questions générales, VisIT-Bench pour des images, VideoChat3 pour des vidéos. Aucun score chiffré n’est disponible dans les sources pour ces benchmarks sur les modèles leaders, mais leur simple existence montre que le domaine progresse.
Contamination, surapprentissage, manipulation : comment les modèles trichent (et comment les démasquer)
La course aux benchmarks a ses travers. La contamination des données d’entraînement est le plus connu : des questions de benchmarks publics (MMLU, GSM8K, HumanEval) se retrouvent dans les corpus d’apprentissage, ce qui gonfle artificiellement les scores. Kezify.com cite explicitement GPT-4, Claude 3.5 et Gemini 1.5 comme ayant potentiellement vu ces questions pendant leur entraînement. En 2026, le problème est suffisamment grave pour que des benchmarks « anti-contamination » soient développés.

LiveBench et LiveCodeBench sont des suites de tests mises à jour régulièrement avec de nouvelles questions, rendant la contamination impossible. SimpleBench propose des problèmes simples mais inédits, conçus pour éviter toute fuite. Ces outils sont recommandés par quellm.fr comme compléments aux benchmarks statiques. L’état des lieux de ayinedjimi-consultants.fr (mars 2026) insiste sur la nécessité d’une « lecture critique des classements au-delà des scores bruts », en particulier dans les contextes de cybersécurité où les LLM sont désormais utilisés en défense comme en attaque.
Un autre piège est le surapprentissage : certains modèles sont optimisés pour maximiser un score spécifique, au détriment de la robustesse. Par exemple, un modèle peut exceller sur MMLU mais échouer sur des tâches simples non vues en entraînement. Le guide datavlab.ai recommande de construire des évaluations personnalisées sur ses propres données pour prédire la qualité réelle en production.
La sécurité est devenue un critère de sélection à part entière. En août 2026, une faille nommée NemoClaw a été identifiée dans l’API Ollama : elle permet un empoisonnement persistant des modèles via des agents. Cet incident, relayé par securitybeztabu.pl et LinkedIn, illustre que les benchmarks ne mesurent pas la robustesse face aux attaques. Les modèles comme GLM-5.3 de Z.ai (sorti le 14 août 2026) intègrent désormais des scores de cybersécurité dans leurs fiches techniques : GLM-5.3 domine le benchmark CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol, selon ayinedjimi-consultants.fr. C’est un signal fort : la sécurité devient un argument de vente, et les benchmarks spécialisés émergent.
L’open source bouscule les classements : GLM-5.3, Hy4, Muse Glimmer et les nouveaux venus
Le paysage des benchmarks en 2026 ne peut pas être compris sans évoquer les modèles qui les font évoluer. L’open source a pris la tête sur plusieurs tableaux, et les classements de septembre 2026 en témoignent.
GLM-5.3 de Z.ai, sorti le 14 août 2026, est un cas d’école : il réutilise la base Mixture-of-Experts de 743 milliards de paramètres de GLM-5.2, sans aucun nouveau paramètre, et améliore ses scores par le seul post-entraînement. Terminal-Bench 3.0 passe de 4,6 % à 28,3 %, et DeepSWE atteint 66,9. Le modèle domine CyberGym avec 84,5 % et se positionne en tête du classement open coding, selon the-agent-report.com et aireiter.com. Les poids sont diffusés progressivement, mais l’API est accessible via le Coding Plan.
Hy4 de Tencent, dévoilé le 8 septembre 2026, est un modèle open-source de 770 milliards de paramètres (49 milliards actifs) avec une fenêtre de contexte de 1 million de tokens. Conçu pour le codage, la productivité bureautique et la recherche scientifique, il est disponible en preview avec accès API, selon gadgetpilipinas.net et techgenyz.com. Son arrivée confirme la tendance : les modèles chinois dominent les classements de septembre 2026, avec 15 modèles chinois dans le top 20 de l’Artificial Analysis ranking (août 2025).
Muse Glimmer de Meta, publié le 14 août 2026, est un modèle agentique multimodal de 30 milliards de paramètres sous licence Apache 2.0. Conçu pour une exécution locale sur PC ou Mac, il excelle dans le raisonnement multimodal et les tâches agentiques, selon contextstudios.ai et itdaily.fr. Il représente la tendance des modèles compacts capables de fonctionner sur des appareils grand public.
Enfin, le mystérieux Ox Alpha, apparu sur OpenRouter le 20 août 2026, a impressionné les développeurs par ses capacités en code et en agents autonomes, sans que son origine soit connue. Certains suspectent un laboratoire chinois, mais rien n’est confirmé, selon businessinsider.com et oia.fr. Ce modèle gratuit restera accessible jusqu’au 27 août, et son cas illustre la difficulté de vérifier l’origine et la sécurité des modèles open source.
Ces nouveaux venus ne changent pas seulement les classements : ils imposent de nouveaux benchmarks. Le Ray Summit 2026 (24-26 août) a mis en avant la convergence de l’infrastructure open source autour du RL post-training, avec la première conférence vLLM co-localisée, selon techtimes.com. L’optimisation de l’inférence (vLLM, TensorRT-LLM, SGLang) devient aussi importante que les scores bruts, comme le souligne spheron.network.
Conclusion : choisir son benchmark en 2026
En septembre 2026, aucun benchmark unique ne suffit pour choisir un LLM. Les anciens étalons (MMLU, GSM8K, HumanEval, AIME 2025) sont saturés ou contaminés. Les nouveaux (SWE-bench Verified, GPQA Diamond, MMLU-Pro, BrowseComp, OSWorld, CyberGym) offrent une meilleure discrimination, mais chacun mesure une compétence spécifique. Le guide datavlab.ai le résume bien : « Un test de cholestérol ne mesure pas la tension artérielle. Un électrocardiogramme ne mesure pas la capacité pulmonaire. De la même façon, chaque benchmark LLM répond à une question précise. »

Pour les praticiens, la démarche recommandée est triple :
- Croiser plusieurs benchmarks couvrant les compétences clés : connaissances (MMLU-Pro), raisonnement (GPQA Diamond), code (SWE-bench Verified), agentivité (BrowseComp, OSWorld), multimodal (MMMU), long contexte (variation-in-a-haystack).
- Construire ses propres évaluations sur ses données métier, comme le recommandent datavlab.ai et tensoria.fr.
- Vérifier la sécurité des modèles open source, notamment après l’incident NemoClaw et les backdoors révélées par Forbes en juillet 2026.
Le coût d’évaluation reste un facteur : le point de bascule entre API et déploiement local se situe entre 50 000 et 100 000 requêtes quotidiennes, selon ayinedjimi-consultants.fr (mars 2026). Les modèles open source couvrent désormais la quasi-totalité des cas d’usage professionnels, mais le GPU n’est jamais gratuit.
Enfin, gardons en tête que les benchmarks ne sont que des indicateurs. Comme le rappelle tensoria.fr : « Les performances sur MMLU ou HumanEval ne prédisent pas ce que le modèle fera sur vos documents internes, dans votre langue métier, avec vos contraintes d’infrastructure. » Le bon benchmark est celui qui prédit la performance réelle dans votre contexte — et cela ne se trouve dans aucun classement tout fait.
Sources
- Benchmark LLM Mars 2026 : Etat des Lieux Complet — ayinedjimi-consultants.fr, mars 2026
- Benchmarks LLM 2026 : choisir le bon modèle IA — datavlab.ai, 2026
- LLM open source entreprise 2026 : comparatif complet — Tensoria, 2026
- AI & LLM Benchmarks 2026: Rankings, Scores & Results — llm-stats.com, 2026
- Qwen détrône Llama : le LLM auto-hébergé le plus déployé en 2026 — noqta.tn, 2026
- Open Source LLM Leaderboard 2026 — vellum.ai, 2026
- Tencent Releases Open-Source Hy4 LLM Preview With 770B Parameters — 8 septembre 2026
- Hy4 preview: 770B Remarkable Open Model Launch — Techgenyz, 28 août 2026
- NemoClaw i OpenClaw: błąd sieciowy w API Ollama — Security Bez Tabu, 26 août 2026
- NVIDIA NemoClaw AI Agent Security Flaw Exposed — LinkedIn, 26 août 2026
- Ray Summit 2026: RL Post-Training Forces Open-Source AI Infrastructure to Converge — 25 août 2026
- Qui est derrière Ox Alpha, le modèle furtif d’OpenRouter ? — IT SOCIAL, 24 août 2026
- Ox Alpha, le modèle IA « stealth » qui intrigue — OIA, 24 août 2026
- A mysterious free AI model is impressing developers — Business Insider, 22 août 2026
- GLM-5.3 : Z.ai lâche son modèle open-weight — 19 août 2026
- GLM-5.3 : Z.AI domine le benchmark cybersécurité CyberGym — 19 août 2026
- GLM-5.3 : benchmarks, tarifs et accès — 17 août 2026
- Z.ai releases GLM-5.3 for coding and cyber work — 17 août 2026
- GLM-5.3: Z.ai Tops the Open Coding Leaderboard on Post-Training Alone — 14 août 2026
- Muse Glimmer : Le modèle agentique ouvert de 30B de Meta — 14 août 2026
- Meta lance Muse Glimmer : une IA open-source pour les agents IA locaux — 12 août 2026
- DeepSeek V4-Pro Shows China’s AI Price War Is Not Slowing — 13 août 2026
- LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang — 19 août 2026
Article recherché et rédigé automatiquement · Magazine Electrosens