Electrosens R&D
Electrosens Magazine LLM Opensource · 21 September 2026

LLM open source en septembre 2026 : le classement TECHSY à l’épreuve d’un marché en ébullition

Le 5 juillet 2026, un site jusqu’alors inconnu, TECHSY, publie un classement des meilleurs LLM open source. Qwen 3 235B-A22B y détrône DeepSeek R1 et Llama 4 Scout complète le podium. Problème : aucun score de benchmark n’est fourni pour ces trois modèles, et la méthodologie reste floue. Deux mois et demi plus tard, le paysage a radicalement changé : Alibaba a dévoilé Qwen3.8-Max (2,4 trillions de paramètres), Moonshot AI a lancé Kimi K3, DeepSeek a publié V4 Pro, Z.ai a sorti GLM-5.3, Meta a lâché Muse Glimmer, Tencent a ouvert Hy4, et un mystérieux modèle nommé Ox Alpha a tourné sur OpenRouter. Entre engouement légitime et prudence nécessaire, ce décryptage actualisé vous aide à y voir clair.

Le classement qui bouscule la hiérarchie : TECHSY entre en scène

Le 5 juillet 2026, le blog techsy.io publie en français et en anglais un article intitulé « Meilleurs LLM open source 2026 ». Son auteur, TECHSY, n’a aucun antécédent documenté dans l’évaluation de modèles de langage. Pas de page « À propos », pas de références à des travaux antérieurs. Pourtant, le classement qu’il propose fait rapidement le tour des réseaux : Qwen 3 235B-A22B y est sacré numéro un, devant DeepSeek R1 et Llama 4 Scout. DeepSeek V3, Mistral Large 3, Gemma 3 27B et Phi-4 Reasoning complètent la liste, mais sans scores détaillés pour les trois premiers.

Ce qui attire l’attention, c’est l’absence de toute vérification indépendante. L’article ne cite aucune source primaire (papier de recherche, repository GitHub, évaluation tierce). Il se contente d’afficher un tableau « aperçu des benchmarks » pour cinq modèles plus anciens : Llama 3.3 70B, Qwen 2.5 72B, DeepSeek-V3, Mistral Small 3.1 et Gemma 3 27B. Les scores MMLU et HumanEval sont donnés, mais sans préciser les conditions de test (few-shot ou zero-shot, prompts, température). Rien non plus sur la pondération qui a permis de classer les modèles.

Malgré cette opacité, le classement TECHSY a le mérite de poser une question centrale : qui sont vraiment les meilleurs LLM open source en septembre 2026 ? Et surtout, sur quels critères peut-on les départager ? Car depuis le 5 juillet, l’écosystème a connu des bouleversements majeurs qu’aucun classement statique ne peut ignorer.

Top 3 : les nouveaux maîtres du jeu… sans notes ?

Le podium de TECHSY est intrigant. En première position, Qwen 3 235B-A22B – un modèle Mixture of Experts (MoE) de la famille Qwen, avec 235 milliards de paramètres dont 22 milliards activés par token. En deuxième, DeepSeek R1, le modèle de raisonnement de DeepSeek, réputé pour ses performances en mathématiques et en code. En troisième, Llama 4 Scout, vanté pour son contexte de 10 millions de tokens.

Taille des principaux modèles open source (en milliards de paramètres)Kimi K32800milliards de paramètresQwen3.8-Max2400milliards de paramètresGLM-5.3753milliards de paramètresQwen 3 235B-A22B235milliards de paramètres

Mais voilà : aucun de ces trois modèles ne voit ses scores MMLU ou HumanEval publiés dans l’article. Le tableau de référence ne concerne que des modèles plus anciens (publiés entre septembre 2024 et mars 2025). Comment TECHSY a-t-il déterminé que Qwen 3 surpasse DeepSeek R1 ? Mystère. L’article affirme que « les trois premiers modèles open source atteignent les performances de GPT-4 sur le code et les mathématiques », mais sans fournir de chiffres de comparaison.

Cette absence de données chiffrées pour le top 3 contraste avec la précision apparente des scores des modèles secondaires : Llama 3.3 70B obtiendrait 86,0 en MMLU et 88,4 en HumanEval ; DeepSeek-V3 87,1 en MMLU et 82,6 en HumanEval. Mais d’où viennent ces chiffres ? Sont-ils reproduits par TECHSY ou simplement compilés à partir de publications officielles ? Rien ne permet de le savoir.

La méthode TECHSY : un classement sans filet

Si l’on gratte un peu, la méthodologie de TECHSY soulève plusieurs questions.

Absence de protocole. Aucune information sur les réglages des benchmarks : le MMLU a-t-il été évalué en 5-shot ou en zero-shot ? Quelle température ? Quels prompts système ? Ces détails peuvent faire varier les scores de plusieurs points. Sans eux, les chiffres sont difficilement reproductibles.

Pas de pondération explicite. Le classement général mêle-t-il MMLU et HumanEval ? Avec quels coefficients ? Pourquoi Qwen 3 235B-A22B est-il premier alors que ses scores ne sont pas donnés ? On peut supposer que TECHSY a utilisé d’autres critères (contexte, coût, licence), mais rien n’est dit.

Définition floue de l’open source. L’article utilise le terme « open source » sans le définir. Il liste les licences (Llama Community License, Qwen License, MIT, Apache 2.0, Gemma Terms of Use), mais aucun des modèles cités ne satisfait pleinement la définition de l’Open Source Initiative (OSI) : les données d’entraînement ne sont jamais disponibles, et certains poids ne sont que partiellement ouverts. Le terme « open-weight » serait plus juste, mais TECHSY ne fait pas la distinction.

Fiabilité des scores. Les valeurs rapportées (MMLU 86,0 pour Llama 3.3, 87,1 pour DeepSeek-V3) sont-elles exactes ? Sans source primaire, impossible de le vérifier. D’autres classements, comme le Open LLM Leaderboard de Hugging Face, utilisent des protocoles standardisés et reproductibles. TECHSY ne s’y réfère pas.

Le paysage a bougé : Qwen3.8-Max, Kimi K3, DeepSeek V4 Pro, GLM-5.3, Muse Glimmer, Hy4

Le principal défaut du classement TECHSY, au-delà de sa méthodologie, est d’être déjà obsolète un mois après sa publication. Voici ce qui s’est réellement passé depuis.

Source : techsy.io

Qwen3.8-Max : le géant d’Alibaba (poids toujours attendus)

Le 19 juillet 2026, Alibaba a présenté en avant-première Qwen3.8-Max, son plus grand modèle open source à ce jour, avec 2,4 trillions de paramètres et un contexte de 1 million de tokens. Le modèle est passé en disponibilité générale sur Alibaba Cloud Model Studio début août, selon l’annonce officielle de Qwen. Les poids sont promis pour Hugging Face et ModelScope « la semaine prochaine », ce qui les situerait autour du 10 août — mais au 3 août, ils n’étaient pas téléchargeables, comme le note APIDog. Le modèle est taillé pour les agents autonomes capables de travailler « en totale autonomie pendant plusieurs jours », une capacité jusqu’ici presque exclusive aux modèles propriétaires, comme le souligne Generation-nt. Une version plus petite, Qwen3.8-27B, est également annoncée. À la mi-septembre, les poids du Max restent toujours introuvables sur les dépôts publics, ce qui alimente les critiques sur un « open source » qui n’en serait pas vraiment.

Kimi K3 : le rival de Moonshot AI, poids livrés

Kimi K3 a été lancé le 16 juillet 2026 par Moonshot AI. Selon Unite.AI, il s’agit d’un modèle de 2,8 trillions de paramètres avec vision native et contexte de 1 million de tokens. Contrairement à Qwen3.8-Max, les poids ont été livrés : ils sont apparus sur Hugging Face le 27 juillet sous forme de version MXFP4 de 594 Go. Selon Journal du Geek, cette IA chinoise « rivalise avec certains des meilleurs modèles américains ». Le modèle est aussi au centre d’une polémique : des officiels américains l’accusent d’avoir « pillé le modèle d’Anthropic détenu par Google », rapporte CNews le 23 juillet. Une affaire qui rappelle que la frontière entre open source et propriétaire est parfois poreuse.

DeepSeek V4 Pro : le fleuron sort de preview

Côté DeepSeek, la famille s’est étoffée. DeepSeek V4 est sorti le 24 avril 2026 et égale les modèles propriétaires sur 95 % des benchmarks. Surtout, DeepSeek V4 Coder est classé meilleur générateur de code devant GPT-5 et Claude 5, sous licence MIT. Et le 12 août 2026, DeepSeek a publié la version de production de son modèle phare, DeepSeek V4 Pro, mettant fin à une période de preview de près de quatre mois. Le build, désigné V4 Pro 0813, est apparu le 12 août, selon Unite.AI. Selon Techbooky, DeepSeek V4-Pro est proposé à un prix nettement inférieur à Kimi K3 sur OpenRouter, tout en offrant la même fenêtre de contexte d’un million de tokens. Le 27 juin, DeepSeek a aussi ouvert le code de DSpark, un système d’inférence qui améliore le throughput de 51 à 400 % selon les configurations, avec une dégradation de qualité inférieure à 0,3 % en BLEU, et des checkpoints pré-entraînés pour Qwen3 et Gemma 4. Une avancée majeure pour le déploiement en production, compatible avec vLLM et SGLang.

GLM-5.3 : Z.ai domine le codage agentique par le seul post-entraînement

Le 14 août 2026, Z.ai a sorti GLM-5.3, un modèle MoE de 753 milliards de paramètres (743B selon The Agent Report) qui réutilise la base de GLM-5.2 sans aucun nouveau paramètre. Le post-entraînement seul a suffi à faire passer Terminal-Bench 3.0 de 4,6 % à 28,3 %, selon DataNorth. Le modèle s’impose en tête du benchmark cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol, selon Ayi NEDJIMI Consultants. Il atteint aussi 66,9 sur DeepSWE. Les poids sont différés, mais le modèle est accessible via le Coding Plan de Z.ai. C’est un signal fort sur la place que l’IA chinoise veut prendre en cybersécurité, comme le note Services Mobiles. Selon Journal du Web, GLM-5.3 est proposé au prix de la version précédente, ce qui le rend particulièrement compétitif face à Kimi K3.

Muse Glimmer : Meta rejoue la carte de l’open source

Le 11 août 2026, Meta a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres à poids ouverts sous licence Apache 2.0, conçu pour une exécution locale sur PC et Mac. Selon Context Studios, il excelle dans le raisonnement multimodal et l’agentique embarquée. Attention toutefois : l’enveloppe mémoire annoncée par Meta est de 24 Go ou 32 Go une fois le cache KV et l’encodeur visuel comptés, ce qui dépasse les 20 Go de poids seuls en quantification 4 bits, comme le précise N-3DS. Sur une carte de 22 Go, ça ne passe pas. La publication est accompagnée d’un manifeste open-weight de 6 500 mots de Mark Zuckerberg plaidant pour l’IA ouverte, selon Ettayeb. C’est un revirement notable après une période de verrouillage — Meta avait fermé la porte à l’open source le 8 avril 2026 avec Muse Spark (propriétaire, API seulement), comme le souligne Goodtech.info. Google DeepMind a de son côté publié le 23 juillet Gemma 4, qui forme avec Gemini 3.6 Flash et 3.5 Flash-Lite « une pile à trois niveaux pour agents IA », selon APIMart.

Hy4 : Tencent entre dans la danse

Le 8 septembre 2026, Tencent a publié en open source Hy4 preview, son dernier modèle de langage, avec 770 milliards de paramètres dont 49 milliards actifs et un contexte de 1 million de tokens, selon Gadget Pilipinas et Techgenyz. Conçu autour du codage, de la productivité bureautique et de la recherche scientifique, Hy4 est accessible via API. C’est le troisième acteur chinois majeur (après Alibaba et Moonshot AI) à franchir le cap du trillion de paramètres ou presque. Son arrivée confirme que la bataille de l’open source se joue désormais à Pékin autant qu’à San Francisco.

Ox Alpha : le modèle furtif qui a fait parler de lui

Entre le 20 et le 27 août 2026, un modèle de raisonnement anonyme baptisé Ox Alpha a tourné sur OpenRouter, accessible gratuitement. Son fournisseur n’a pas révélé son identité, selon IT Social. Spécialisé dans le code et les agents autonomes, il a impressionné les développeurs, mais son origine est restée inconnue — certains suspectaient un laboratoire chinois, rapporte Business Insider. OIA a fait le tri entre ce qui était vérifié et ce qui relevait de la spéculation. Depuis, le modèle a disparu de la plateforme, laissant planer le mystère. Un cas d’école pour rappeler que l’open source n’est pas synonyme de transparence.

La sécurité au premier plan : la faille NemoClaw et l’OWASP

L’été 2026 a aussi été marqué par des alertes de sécurité qui concernent directement l’écosystème open source. Le 26 août, une faille dans l’API Ollama a été documentée sous le nom de NemoClaw (ou OpenClaw) : elle permettrait un empoisonnement persistant des modèles LLM via une erreur de conception dans l’architecture de communication, selon Security Bez Tabu. Un article circule sur LinkedIn attribuant à cette faille le numéro CVE-2026-65105, mais aucune confirmation officielle NVD/MITRE/Nvidia n’a été publiée à ce jour, comme le note Rezwan Tarin. La prudence s’impose donc : si le risque est réel, les détails techniques restent à valider.

Cette alerte s’inscrit dans un contexte plus large. Le 3 août 2026, l’OWASP a publié la troisième édition de son Top 10 des risques des applications à grands modèles de langage, désormais construite sur des incidents réels plutôt que sur l’expertise seule. Les vecteurs d’attaque critiques identifiés incluent l’empoisonnement des données, la supply chain Hugging Face et les fuites de contexte. L’open source, en première ligne de ces risques, doit passer de la confiance à la vérification.

L’infrastructure converge : Ray Summit et le RL post-training

Le 25 août 2026, le Ray Summit s’est ouvert à San Francisco, avec la première conférence vLLM organisée en parallèle sous le même toit, selon TechTimes. Cette co-localisation reflète un changement structurel : le RL post-training (apprentissage par renforcement après l’entraînement initial) impose désormais une convergence de l’infrastructure open source. Les frameworks d’inférence comme vLLM, SGLang et TensorRT-LLM doivent s’adapter à des charges de travail qui ne sont plus de la simple génération, mais des boucles d’entraînement et d’évaluation continues. Pour choisir le bon outil, le framework de décision de Spheron compare vLLM, TensorRT-LLM et SGLang en fonction des compromis throughput/latence/mémoire.

Source : digitiz.fr

Les LLM locaux : ce qui tourne vraiment sur votre GPU

Pendant que les géants se disputent les trillions de paramètres, une autre bataille se joue sur les machines des développeurs. Le classement des LLM locaux de AI-master.dev (juin 2026) place DeepSeek V4 Pro (Max) en tête avec 88 points sur l’Open LLM Leaderboard, suivi de Kimi K2.6 (85) et GLM-5.1 (83). Pour les configurations modestes, Qwen3.6-27B (publié le 22 avril 2026) est le meilleur compromis performance/VRAM : il tient en environ 17 Go de VRAM en Q4_K_M, confortable sur une RTX 4090, selon N-3DS. Le MoE Qwen3.6-35B-A3B (3 milliards de paramètres actifs, publié le 16 avril) le complète côté agentique. Les deux restent en Apache 2.0.

Un RTX 3060 12 Go suffit pour des modèles jusqu’à 27B en 4-bit ; un RTX 4090 24 Go ouvre l’accès aux 70B+. Côté outils, Ollama reste la référence pour lancer un modèle local en une commande, devant LM Studio (interface graphique) et vLLM (production).

Le fine-tuning : les outils qui comptent

TECHSY, le même site qui a publié le classement controversé, a également sorti un guide des outils de fine-tuning nettement plus solide. Le classement est dominé par Unsloth (framework open-source, Apache 2.0, 53,9K étoiles GitHub), qui offre un entraînement 2-5x plus rapide et 35 % de VRAM en moins grâce à ses noyaux Triton personnalisés. Suivent LLaMA-Factory (débutants, support de modèles le plus large), RunPod (cloud GPU à partir de 0,41 €/h), Hugging Face TRL (RLHF, DPO, alignement) et Axolotl (pipelines de production reproductibles). Ce guide confirme la tendance de fond : en 2026, le fine-tuning local est devenu accessible — une RTX 4070 Ti et un après-midi suffisent pour un modèle 7B — mais le vrai coût s’est déplacé vers la curation des données.

Source : benchlm.ai

Comparaison avec les arènes établies : LM Arena, BenchLM, Artificial Analysis

Pour évaluer la crédibilité du classement TECHSY, il faut le confronter aux références reconnues. Le 25 juillet 2026, Ayi NEDJIMI Consultants a publié son benchmark mensuel qui compile LM Arena (ELO), BenchLM et GPQA. Claude Fable 5 y domine avec un score de 60 sur l’Intelligence Index v4.1 d’Artificial Analysis, et un Elo de 1507 sur LM Arena. Les modèles open source y figurent en bonne place : GLM-5.2 (score 51, rang 7), Qwen3.7 Max (46, rang 11), MiMo V2.5 Pro (45, rang 12), MiniMax-M3 (44, rang 13), DeepSeek V4 Pro (44, rang 14) et Kimi K2.6 (43, rang 15). Depuis, GLM-5.3 a probablement grimpé, mais aucune mise à jour consolidée n’a été publiée à la mi-septembre.

Le site BenchLM propose un leaderboard de 95 modèles open-weight, mis à jour en juillet 2026, avec des critères de benchmark, licence, taille, contexte, quantification et besoins de déploiement. C’est une ressource autrement plus complète que le tableau de TECHSY. Le site dev-ai.fr publie également un top 25 des LLM open source avec tableau VRAM, contexte, licences et benchmarks, ainsi qu’un guide de sélection par profil.

Aucun de ces classements ne place Qwen 3 235B-A22B en tête. Les modèles qui dominent sont plus récents : DeepSeek V4 Pro, GLM-5.3, Kimi K3. Le classement TECHSY, s’il a le mérite d’avoir attiré l’attention sur l’open source, pèche par son opacité méthodologique et son obsolescence rapide. En septembre 2026, la question n’est plus de savoir qui est « le meilleur » — elle est de choisir le bon modèle pour le bon usage, avec des benchmarks reproductibles et des poids réellement téléchargeables.

Conclusion : l’open source, entre effervescence et vérification

L’été 2026 restera comme celui où l’open source a définitivement rattrapé les modèles propriétaires — du moins sur le papier. Qwen3.8-Max, Kimi K3, DeepSeek V4 Pro, GLM-5.3, Muse Glimmer, Hy4 : jamais autant de modèles ouverts ou open-weight n’avaient été publiés en si peu de temps. Mais cette effervescence s’accompagne de défis : des poids qui tardent à arriver (Qwen3.8-Max), des polémiques sur l’origine des entraînements (Kimi K3), des failles de sécurité dans l’infrastructure (NemoClaw), et des classements dont la méthodologie laisse à désirer (TECHSY).

La leçon est double. D’abord, l’open source n’est pas un label magique : il faut vérifier les licences, les poids, les benchmarks. Ensuite, le paysage évolue si vite qu’un classement statique est obsolète en quelques semaines. Les ressources comme BenchLM, le Open LLM Leaderboard de Hugging Face ou les benchmarks mensuels d’Ayi NEDJIMI Consultants sont plus fiables que les blogs sans méthodologie. En septembre 2026, la vraie question n’est plus « quel est le meilleur modèle ? » mais « quel modèle, pour quel usage, avec quelles garanties ? »

Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *