Magazine LLM Opensource · 10 September 2026DeepSeek V4, Kimi K3, GLM-5.3, Hy4 : l’été 2026 a redéfini la hiérarchie des LLM open source
Le 24 avril 2026, DeepSeek dévoilait V4, un modèle Mixture-of-Experts de 1,6 trillion de paramètres totaux, ouvert sous licence MIT, avec une fenêtre de contexte d’un million de tokens et des performances annoncées proches des meilleurs modèles propriétaires. À un coût d’inférence six à sept fois inférieur à celui de Claude Opus 4.7 ou GPT-5.5, ce modèle chinois a relancé la compétition open-source et posé des questions géopolitiques inédites. Quatre mois plus tard, l’écosystème a encore basculé : DeepSeek a levé 50 milliards de dollars, Kimi K3 (2,8 billions de paramètres) a été publié en open weight le 27 juillet, Qwen3.8-Max (2,4 billions) a suivi le 3 août, Meta a riposté le 10 août avec Muse Glimmer, un modèle agentique 30B conçu pour tourner sur un simple PC, et Z.ai a dégainé GLM-5.3 le 14 août. Fin août, Tencent a ouvert à son tour Hy4 (770B) en preview. Plongée dans ce qui restera comme le tournant de l’année 2026 pour les LLM ouverts.
De Hangzhou à la domination : comment DeepSeek a construit un rival open-source aux GAFAM
DeepSeek est une entreprise chinoise basée à Hangzhou, spécialisée dans la recherche en intelligence artificielle. Si les détails précis sur son équipe fondatrice et son financement restent peu documentés publiquement, la société s’est imposée en moins de deux ans comme un acteur incontournable des LLM open-source. La chronologie des versions est éloquente : après DeepSeek V2 et V3, puis le modèle de raisonnement R1, DeepSeek a enchaîné avec V4 Preview le 24 avril 2026, comme l’a rapporté Le Monde. Cette accélération s’inscrit dans une stratégie chinoise d’ouverture des modèles, en réponse directe aux restrictions d’exportation américaines sur les puces NVIDIA haut de gamme.
DeepSeek utilise notamment des puces Huawei (les Ascend 910B) pour contourner les limitations, comme le rapporte une analyse de la RTS. Cette dépendance au matériel chinois n’est pas anodine : elle permet à DeepSeek de maintenir une capacité d’entraînement malgré l’embargo, mais soulève aussi des questions sur la performance relative de ces puces face aux H100 ou B200 américaines. L’entreprise a néanmoins réussi à pré-entraîner V4 sur plus de 32 trillions de tokens en précision mixte FP4 et FP8, un exploit technique qui témoigne d’une optimisation logicielle poussée.
La stratégie open-source de DeepSeek est claire : en publiant les poids sous licence MIT, elle cherche à capter la communauté des développeurs mondiaux, à créer un écosystème autour de ses modèles, et à s’imposer comme une alternative crédible aux GAFAM. Comme le souligne un article de Forbes, cette approche « reshape the open-source AI race » en offrant des performances quasi état-de-l’art à un coût dérisoire. Mais ce choix n’est pas sans controverse, comme nous le verrons plus loin.
Valorisation record en juin 2026 — Le 17 juin 2026, DeepSeek a clôturé un tour de financement à une valorisation de 50 milliards de dollars, selon France 24 et Creati.ai. Cette levée, la plus importante pour une start-up chinoise d’IA, confirme la confiance des investisseurs dans la capacité de DeepSeek à rivaliser avec OpenAI et Anthropic. Elle intervient alors que la Chine représente 74 % des brevets mondiaux en IA (rapport Stanford 2026), contre 12 % pour les États-Unis, et que l’écart de performance entre les meilleurs modèles américains et chinois n’est plus que de 2,7 %.
V4 Pro quitte la preview le 12 août — Après près de quatre mois de phase de prévisualisation, DeepSeek a publié le 12 août 2026 la version de production de son modèle phare, désignée V4 Pro 0813, comme l’a rapporté Unite.ai. Cette sortie marque la fin de la période de preview et officialise le passage en production d’un modèle qui a déjà conquis une large base d’utilisateurs. Le même jour, DeepSeek a également confirmé que son alias API deepseek-v4-pro pointe désormais vers cette version stable, mettant fin à une période de transition qui avait semé la confusion chez certains développeurs (source : elser.ai).
DeepSeek Harness, le rival open source de Claude Code — Le 12 août également, DeepSeek a lancé Harness, un outil open source concurrent direct de Claude Code, en même temps que la mise à disposition de V4-Pro sur son API avec des prix revus à la hausse (source : VentureBeat). Harness permet aux développeurs d’exécuter des agents de codage autonomes en local, s’appuyant sur V4-Pro ou V4-Flash, et s’inscrit dans la stratégie de DeepSeek de contrôler toute la chaîne, du modèle à l’outillage. Ce lancement a été salué par la communauté open source comme une étape importante vers la démocratisation des agents de programmation, jusqu’ici dominés par les solutions propriétaires comme Claude Code ou GitHub Copilot.
1 000 milliards de paramètres, 49 milliards actifs : plongée dans l’architecture MoE de V4
DeepSeek V4 repose sur une architecture Mixture-of-Experts (MoE) qui permet d’activer seulement une fraction des paramètres totaux pour chaque token traité. Le modèle se décline en deux variantes :
| Variante | Paramètres totaux | Paramètres actifs | Fenêtre de contexte | Sortie max |
|---|---|---|---|---|
| V4-Pro | 1,6 trillion | 49 milliards | 1 million tokens | 384 000 tokens |
| V4-Flash | 284 milliards | 13 milliards | 1 million tokens | 384 000 tokens |
Les sources s’accordent sur ces chiffres (deepseek.fr, akaor.fr, deepseek-fr.ai, wavect.io). Le nombre exact d’experts dans le MoE n’est pas divulgué, mais le mécanisme de routage est optimisé par un nouveau système d’attention baptisé DeepSeek Sparse Attention. Cette attention hybride combine une attention dense locale (HCA) et une attention sparse globale (CSA), permettant de gérer efficacement la fenêtre de contexte d’un million de tokens sans explosion du coût mémoire.
La gestion du contexte long repose vraisemblablement sur des techniques de RoPE (Rotary Position Embedding) et de cache mémoire optimisé, bien que les détails précis ne soient pas confirmés indépendamment. DeepSeek propose deux modes de fonctionnement : Thinking (raisonnement pas à pas, similaire à la chaîne de pensée) et Non-Thinking (réponse directe). Cette flexibilité permet d’adapter le comportement du modèle selon la tâche.
Le pré-entraînement a été réalisé en précision mixte FP4 et FP8, ce qui réduit considérablement l’empreinte mémoire et accélère l’inférence. Les poids sont publiés sur Hugging Face sous licence MIT, permettant à quiconque de télécharger et d’exécuter le modèle localement. Le dépôt officiel de V4 Flash pèse 166,9 Go, ce qui en fait de loin le plus léger des trois géants chinois — Kimi K3 exige environ 1,56 To de stockage et Qwen3.8-Max n’est pas en reste (source : kingy.ai, wavect.io).
Compatibilité avec les outils de fine-tuning — DeepSeek V4 est nativement supporté par les frameworks de fine-tuning les plus populaires de 2026. Unsloth, par exemple, permet de fine-tuner V4-Flash avec LoRA sur du matériel grand public (8 Go de VRAM suffisent pour des adaptations légères), tandis que des plateformes comme SiliconFlow offrent des pipelines de fine-tuning en trois étapes (upload, config, déploiement) avec des vitesses d’inférence jusqu’à 2,3 fois plus rapides que la moyenne du marché. Les méthodes paramétriques matures — LoRA, QLoRA, DoRA — sont désormais les trois piliers du fine-tuning efficace, permettant d’adapter des modèles géants sur du matériel accessible : avec QLoRA, un modèle 7B se fine-tune sur un simple RTX 3090 (environ 6 Go de VRAM), et un 70B sur 48 Go.
Benchmarks : que valent vraiment les scores annoncés par DeepSeek ?
DeepSeek a communiqué des résultats de benchmarks impressionnants, mais il faut les prendre avec précaution en l’absence de vérification indépendante exhaustive. Voici les scores revendiqués par l’entreprise, compilés à partir de plusieurs sources (NxCode, deepseekv.pro, VentureBeat) :
- SWE-bench : 81 % (V4-Pro) – un score qui place le modèle au niveau des meilleurs modèles de codage.
- Codeforces : 3206 (V4-Pro) – un niveau compétitif, dépassant de nombreux modèles propriétaires.
- MMLU-Pro : égal à GPT-5.4 selon studeria.fr.
- HumanEval : non précisé dans les sources, mais les performances en programmation sont saluées comme les meilleures du marché open-source.
DeepSeek affirme que V4-Pro surpasse Claude Sonnet 4.5 et approche Claude Opus 4.5, tandis que V4 Pro Max (une variante non encore sortie) dépasserait GPT-5.2 et Gemini 3.0-Pro, tout en restant légèrement en dessous de GPT-5.4 et Gemini 3.1-Pro (source : akaor.fr). Ces comparaisons sont toutefois basées sur les propres benchmarks de DeepSeek, et non sur des classements tiers comme LMSys Chatbot Arena ou le leaderboard Hugging Face.
Un point important : les conditions de test (few-shot, température, nombre d’échantillons) ne sont pas documentées dans les sources accessibles. Il est donc difficile d’évaluer la robustesse de ces scores. Néanmoins, plusieurs analystes indépendants (VentureBeat, TechCrunch) confirment que DeepSeek V4 « closes the gap with frontier models », avec un retard estimé à 3-6 mois sur les meilleurs modèles propriétaires. En attendant les résultats du LMSys Chatbot Arena, ces chiffres doivent être considérés comme prometteurs mais non définitifs.
Concurrence chinoise : l’été 2026 a tout changé — Depuis juillet 2026, la hiérarchie a été bouleversée. Le 16 juillet, Moonshot AI a dévoilé Kimi K3, un modèle de 2,8 billions de paramètres — le plus gros jamais publié en open weight — avec 896 experts dont 16 activés (104 milliards de paramètres actifs). Ses poids complets (1,56 To) ont été mis en ligne sur Hugging Face le 27 juillet. Selon les benchmarks, Kimi K3 dépasse Fable 5 sur Terminal-Bench et talonne GPT-5.6 Sol. Le 3 août, Alibaba a riposté avec Qwen3.8-Max, un modèle de 2,4 billions de paramètres en open weights, avec une fenêtre de 1 million de tokens et des capacités multimodales avancées. DeepSeek V4 reste néanmoins le leader incontesté du codage agentique, avec un score SWE-bench qui n’a pas encore été égalé par ses rivaux chinois.
GLM-5.3, le challenger qui monte — Le 14 août 2026, Z.ai (laboratoire pékinois) a publié GLM-5.3, un modèle MoE de 743 milliards de paramètres (753B selon certaines sources) qui réutilise la base de GLM-5.2 sans aucun nouveau paramètre, mais avec un post-entraînement intensif. Les résultats sont spectaculaires : Terminal-Bench 3.0 passe de 4,6 % à 28,3 % grâce au seul post-entraînement, et le modèle s’impose en tête du benchmark de cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol (sources : the-agent-report.com, ayinedjimi-consultants.fr). GLM-5.3 est proposé au même prix que la version précédente, avec un accès via le Coding Plan de Z.ai, et ses poids doivent être publiés ultérieurement. Ce modèle illustre une tendance majeure de 2026 : le post-entraînement (RL, fine-tuning ciblé) devient aussi important que la taille du modèle de base.
Le verdict des tests indépendants d’août — Un comparatif contrôlé mené par Kingy.ai le 3 août 2026, mis à jour le 18 août avec les checkpoints publiés et les prix API directs, tranche sans appel : Qwen3.8-Max est le meilleur généraliste multimodal hébergé, Kimi K3 est le plus fort en codage et en contexte long, et DeepSeek V4 Flash est le champion du coût et du débit — et de très loin. Selon ce test, DeepSeek V4 Flash coûte environ un huitième à un dixième du prix de Qwen sur un scénario type, même pendant les fenêtres de pointe. Pour l’auto-hébergement, DeepSeek est aussi le moins irréaliste des trois, avec sa licence MIT et son dépôt officiel de 166,9 Go, bien plus léger que ceux de Kimi ou Qwen. Le même comparatif souligne que Kimi K3 obtient le meilleur score indépendant en test de contexte long (AA-LCR) et que DeepSeek V4 Flash atteint 103,2 tokens de sortie par seconde dans les tests d’Artificial Analysis.
Le choc des prix : comment DeepSeek divise par six le coût d’inférence
L’argument le plus frappant de DeepSeek V4 est son coût d’inférence. Selon VentureBeat, le modèle coûte 1/6e du prix de Claude Opus 4.7 ou GPT-5.5. Un article de Numerama avance même un facteur 7 fois moins cher que Claude Opus 4.6. Les prix API exacts pour V4-Pro et V4-Flash ne sont pas publiés dans les sources, mais la comparaison est éloquente :

| Modèle | Coût estimé par million de tokens (sortie) | Facteur vs DeepSeek |
|---|---|---|
| DeepSeek V4-Pro | ~3-4 $ (estimation basée sur les facteurs annoncés) | 1x |
| Claude Opus 4.6/4.7 | ~25 $ (source : deepseek.fr) | 6-7x |
| GPT-5.5 | non précisé, mais similaire à Opus | ~6x |
Cette différence s’explique par plusieurs optimisations logicielles : quantification FP4/FP8, utilisation de frameworks comme vLLM et TensorRT-LLM, et une architecture MoE qui réduit le nombre de paramètres actifs. La configuration matérielle minimale pour l’inférence serveur n’est pas spécifiée, mais un modèle de 49 milliards de paramètres actifs peut tourner sur un seul GPU H100 (80 Go) avec une quantification adaptée, tandis que V4-Flash (13B actifs) est accessible sur du matériel plus modeste.
La guerre des prix s’intensifie — Selon TechBooky, DeepSeek V4-Pro est désormais proposé sur OpenRouter à un prix très inférieur à celui de Kimi K3, tout en offrant la même fenêtre de contexte d’un million de tokens. Geeky-Gadgets rapporte que DeepSeek V4 Flash peut exécuter une suite de tests complète pour seulement 72 dollars, soit 33 fois moins cher que Kimi K3 pour la même charge. Cette guerre des prix a un effet direct sur l’adoption : les startups et les entreprises moyennes peuvent désormais déployer des agents de codage et des assistants IA à une fraction du coût des solutions propriétaires.
Les autres poids lourds de l’été : Muse Glimmer, Hy4, Ox Alpha
Muse Glimmer (Meta) — Le 10 août 2026, Meta a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres à poids ouverts sous licence Apache 2.0. Conçu pour une exécution locale sur PC ou Mac, il excelle dans le raisonnement multimodal et l’orchestration d’agents autonomes (sources : contextstudios.ai, itdaily.fr, technoid.gr). Avec Muse Glimmer, Meta prend le contrepied de la course aux très gros modèles : plutôt que de rivaliser sur la taille, l’entreprise mise sur l’efficacité et la portabilité. Le modèle tourne sur un simple PC avec 16 Go de VRAM, ce qui le rend accessible à une large communauté de développeurs. C’est une réponse directe à la tendance des modèles géants chinois, et une reconnaissance que le futur de l’IA passe aussi par l’edge computing.
Hy4 (Tencent) — Le 28 août 2026, Tencent a ouvert en preview Hy4, son modèle de langage de 770 milliards de paramètres (49B actifs) avec une fenêtre de contexte d’un million de tokens, conçu pour le codage, la productivité bureautique et la recherche scientifique (sources : gadgetpilipinas.net, techgenyz.com). Hy4 est accessible via API et ses poids doivent être publiés progressivement. Ce lancement confirme que les géants chinois de l’Internet (Alibaba, Tencent, Moonshot, Z.ai, DeepSeek) considèrent tous l’open source comme un levier stratégique pour capter la communauté mondiale des développeurs.
Ox Alpha, le modèle furtif — Depuis le 20 août 2026, un mystérieux modèle de raisonnement nommé Ox Alpha tourne sur OpenRouter, gratuitement, sans éditeur connu. Spécialisé dans le code et les agents autonomes, il impressionne les développeurs par ses performances, mais son origine reste inconnue — certains suspectent un laboratoire chinois (sources : businessinsider.com, itsocial.fr, oia.fr, kingofgeek.com). Ox Alpha restera accessible gratuitement jusqu’au 27 août, puis son sort est incertain. Ce phénomène illustre une nouvelle dynamique : des modèles de très haute qualité circulent de manière anonyme, brouillant les cartes de la traçabilité et de la confiance.
Sécurité : NemoClaw, la faille qui empoisonne les agents
L’été 2026 a aussi été marqué par une découverte inquiétante : NemoClaw, une faille de sécurité dans l’API Ollama qui permet un empoisonnement persistant des modèles LLM dans les environnements d’agents IA (source : securitybeztabu.pl). Cette vulnérabilité, révélée fin août, exploite une mauvaise architecture de communication entre les agents et les modèles : un attaquant peut injecter des instructions malveillantes qui persistent au-delà de la session, compromettant durablement les décisions de l’agent. NVIDIA a confirmé l’existence de la faille et travaille sur un correctif (source : linkedin.com).

Cette découverte a des implications majeures pour l’écosystème open source : les modèles à poids ouverts sont particulièrement exposés, car leur exécution locale et leur intégration dans des pipelines personnalisés échappent souvent aux garde-fous des API managées. Les experts recommandent désormais de segmenter les environnements d’agents, de valider systématiquement les sorties des modèles, et de mettre à jour les frameworks d’orchestration (LangChain, CrewAI, etc.) pour détecter les injections persistantes.
Écosystème : Ray Summit 2026, le RL post-entraînement fait converger l’open source
Le 25 août 2026, le Ray Summit 2026 s’est ouvert à San Francisco, en même temps que la première vLLM Conference sous le même toit. Cette co-localisation n’est pas anodine : elle reflète un changement structurel dans l’infrastructure open source, désormais dominée par les besoins du RL post-entraînement (source : techtimes.com). Les frameworks d’inférence (vLLM, TensorRT-LLM, SGLang) convergent vers des optimisations communes : gestion dynamique des lots, quantification adaptative, et support natif des architectures MoE. Le choix entre vLLM, TensorRT-LLM et SGLang dépend désormais de compromis précis entre débit, latence et mémoire, comme l’explique un guide de Spheron (source : spheron.network).
Cette convergence profite directement aux modèles open source : les optimisations développées pour un modèle (comme DeepSeek V4) sont rapidement portées aux autres (Kimi K3, Qwen3.8-Max, GLM-5.3), créant un cercle vertueux d’amélioration continue. Le RL post-entraînement, qui était encore l’apanage des laboratoires propriétaires en 2025, est désormais accessible aux équipes open source grâce à des frameworks comme Ray RLlib et des recettes publiées par les laboratoires chinois.
Conclusion : l’open source a gagné la guerre des modèles, la bataille de l’infrastructure commence
L’été 2026 restera comme le moment où l’open source a définitivement rattrapé — et parfois dépassé — les modèles propriétaires. DeepSeek V4, Kimi K3, Qwen3.8-Max, GLM-5.3, Hy4 et Muse Glimmer offrent une diversité de choix inédite, avec des licences permissives (MIT, Apache 2.0) et des prix imbattables. La Chine a pris une avance considérable dans l’ouverture des poids, tandis que Meta tente de se repositionner avec des modèles edge efficaces.

Mais la bataille n’est pas terminée : elle se déplace vers l’infrastructure. Le déploiement de modèles de 2,8 billions de paramètres exige des clusters de GPU que peu d’organisations peuvent se permettre. Les optimisations logicielles (quantification, MoE, inférence distribuée) deviennent le nerf de la guerre, et les frameworks comme vLLM, SGLang et Ray sont les nouveaux champs de bataille. La faille NemoClaw rappelle aussi que l’open source n’est pas exempt de risques de sécurité, et que la confiance doit se construire par la transparence et l’audit.
Une chose est sûre : en septembre 2026, aucun laboratoire ne peut plus ignorer l’open source. La question n’est plus de savoir si les modèles ouverts égaleront les modèles propriétaires, mais quand ils les dépasseront — et qui contrôlera l’infrastructure qui les fait tourner.
Sources
- VentureBeat — DeepSeek Harness launches as open source rival to Claude Code
- Reuters — Alibaba unveils its largest AI model yet
- Forbes — Why Kimi K3 Signals A Convergence Toward Open-Weight Models
- MSN — Une nouvelle IA fait trembler les géants : qui est Kimi K3
- Techgenyz — Hy4 preview: 770B Remarkable Open Model Launch
- GadgetPilipinas — Tencent Releases Open-Source Hy4 LLM Preview
- Security Bez Tabu — NemoClaw i OpenClaw: błąd sieciowy w API Ollama
- LinkedIn — NVIDIA NemoClaw AI Agent Security Flaw Exposed
- TechTimes — Ray Summit 2026: RL Post-Training Forces Open-Source AI Infrastructure to Converge
- IT Social — Qui est derrière Ox Alpha, le modèle furtif d’OpenRouter ?
- OIA — Ox Alpha, le modèle IA « stealth » qui intrigue
- KingOfGeek — Ox Alpha, c’est quoi ?
- Business Insider — A mysterious free AI model is impressing developers
- JournalDuWeb — GLM-5.3 : Z.ai lâche son modèle open-weight
- Ayinedjimi Consultants — GLM-5.3 : Z.AI domine le benchmark CyberGym
- Services Mobiles — Avec GLM-5.3, Z.ai lie enfin IA ouverte et cybersécurité
- Spheron — LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang
- Aireiter — GLM-5.3 : benchmarks, tarifs et accès
- DataNorth — Z.ai releases GLM-5.3 for coding and cyber work
- Cybersecurity News — Z.ai Unveils GLM-5.3
- GLM-AI Chat — GLM-5.3: Benchmarks, Context, API & Availability
- RoboActu — Z.ai présente GLM-5.3 pour le codage agentique
- ContextStudios — Muse Glimmer : Le modèle agentique ouvert de 30B de Meta
- The Agent Report — GLM-5.3: Z.ai Tops the Open Coding Leaderboard on Post-Training Alone
- Technoid — Muse Glimmer : la nouvelle IA open source dotée de Meta Power
- ITdaily — Meta lance Muse Glimmer
- TechBooky — DeepSeek V4-Pro Shows China’s AI Price War Is Not Slowing
- SiliconFlow — Fine-tuning platforms
- Noqta — Fine-tuning LLMs : LoRA, QLoRA, guide 2026
Article recherché et rédigé automatiquement · Magazine Electrosens