Magazine LLM Opensource · 17 September 2026DeepSeek V4, six mois après : le modèle open source qui a déclenché la guerre des prix de l’IA
Le 24 avril 2026 restera comme une date charnière dans l’histoire des modèles de langage. Ce jour-là, DeepSeek a lâché en open source deux modèles — V4-Pro et V4-Flash — dont les spécifications donnent le vertige : 1,6 billion de paramètres au total pour le premier, une fenêtre de contexte d’un million de tokens, et des performances annoncées au niveau des meilleurs modèles fermés. Six mois plus tard, le modèle n’a pas seulement survécu à l’été le plus concurrentiel de l’histoire de l’IA open source : il est passé en production, a déclenché une guerre des prix sans précédent, et se retrouve désormais talonné par une nouvelle génération de modèles chinois — Hy4 de Tencent, GLM-5.3 de Z.ai, Qwen3.8-Max d’Alibaba — sans oublier les surprises comme Ox Alpha. Retour sur un lancement surprise, ses implications techniques, économiques et géopolitiques, et ce qu’il change concrètement pour les équipes qui veulent l’adopter.
24 avril 2026 : le jour où DeepSeek a retourné le jeu
Il y a des lancements qui s’annoncent avec des campagnes marketing des mois à l’avance, des keynotes, des conférences de presse. Et puis il y a ceux qui tombent comme un couperet, sans prévenir. Le 24 avril 2026 appartient à la seconde catégorie. Ce jeudi-là, DeepSeek a publié simultanément deux modèles — V4-Pro et V4-Flash — en open source, sans cérémonie ni rapport technique détaillé. La nouvelle a fait l’effet d’une bombe dans la communauté, d’autant plus que la sortie coïncidait avec la semaine de lancement de GPT-5.5 chez OpenAI, comme le rapportent plusieurs médias spécialisés.
Le timing n’a probablement rien d’un hasard. En publiant le même jour qu’OpenAI, DeepSeek a réussi un coup de communication redoutable : capter l’attention des développeurs au moment même où le géant américain espérait monopoliser les gros titres. Les blogs spécialisés français — Capentia, Dedimarco, Maestria — ont tous relayé l’information dans les heures qui ont suivi, avec un mélange d’enthousiasme et de prudence. « DeepSeek V4 défie à nouveau les géants de l’IA », titrait Maestria. « Le modèle chinois qui bouscule l’écosystème », renchérissait Capentia. « DeepSeek V4, le nouveau cauchemar des IA américaines, vient d’arriver », surenchérissait Presse-citron. Le Monde, 01net et Leptidigital ont également couvert l’événement, confirmant l’ampleur médiatique du lancement. Forbes, dans une analyse publiée quatre jours plus tard, soulignait que DeepSeek V4 et Qwen étaient en train de redessiner la course à l’IA open source.
Les chiffres annoncés donnent le vertige. V4-Pro affiche 1 600 milliards de paramètres totaux (1,6 billion), dont 49 milliards activés par inférence grâce à une architecture Mixture of Experts (MoE). V4-Flash, la version plus légère, revendique 284 milliards de paramètres totaux pour 13 milliards actifs. Les deux modèles supportent une fenêtre de contexte d’un million de tokens — un standard désormais pour les services officiels de DeepSeek, souligne Dedimarco. La licence est la MIT, la plus permissive qui soit. Autrement dit : tout le monde peut télécharger, modifier, commercialiser ces modèles sans restriction.
Les réactions de la communauté ne se sont pas fait attendre. Sur Reddit, le fil r/LocalLLaMA consacré aux meilleurs modèles locaux d’avril 2026 mentionne immédiatement les deux variantes. Les premiers tests informels fleurissent sur les réseaux sociaux, certains utilisateurs parvenant à faire tourner V4-Flash sur du matériel grand public grâce à la quantification. Mais l’enthousiasme s’accompagne d’un questionnement légitime : que valent vraiment ces chiffres annoncés ? Aucun rapport technique officiel n’a été publié par DeepSeek à ce jour, et les benchmarks proviennent de sources tierces aux méthodologies parfois opaques. C’est tout l’objet de ce décryptage.
Six mois plus tard, le modèle n’a pas disparu des radars. Bien au contraire : le classement BenchLM de juillet 2026, qui compare 95 modèles open-weight, le place toujours parmi les références, aux côtés de Qwen3.8-Max (2,4 billions de paramètres, sorti début août 2026) et de Kimi K3 (Moonshot AI, fin juillet 2026). La course aux modèles ouverts chinois s’est emballée, et DeepSeek V4 en est l’un des piliers.
12 août 2026 : V4-Pro passe en production, avec des capacités agentiques renforcées
L’information est passée presque inaperçue au milieu de l’été, mais elle est majeure pour les équipes qui hésitaient à adopter le modèle en production. Le 12 août 2026, DeepSeek a officiellement publié la version de production de son modèle phare, mettant fin à une période de prévisualisation qui aura duré près de quatre mois. La build, désignée « V4 Pro 0813 », est apparue ce jour-là sur les canaux officiels, comme le rapporte Unite.ai.
Le site officiel de DeepSeek confirme la nouvelle : « La version officielle de DeepSeek-V4-Pro a été publiée, avec des capacités d’agent significativement améliorées et un support pour l’API Responses et l’intégration Codex. Elle est désormais pleinement disponible sur le web, l’application mobile et l’API. » Concrètement, cela signifie que le modèle n’est plus une promesse de laboratoire : il est prêt pour l’intégration dans des workflows réels, avec des interfaces standardisées (Responses API, compatible Codex) qui facilitent le branchement sur les outils existants. Les modèles ont d’ailleurs été optimisés pour fonctionner avec des outils agents populaires comme Claude Code et OpenClaw, comme le souligne InfoWorld.
Cette sortie de production répond à une critique récurrente des premiers mois : V4-Pro était impressionnant sur le papier, mais son intégration en production restait complexe, faute d’outillage mature. Avec cette build, DeepSeek adresse le problème frontalement — un signal fort envoyé aux entreprises qui attendaient une version stable avant de s’engager.
Cette évolution s’accompagne d’une autre annonce majeure : l’ouverture fin juin 2026 du code de DSpark, un moteur d’inférence accélérée développé avec l’Université de Pékin. DSpark promet jusqu’à 85 % d’accélération sur V4 sans perte de qualité (delta BLEU inférieur à 0,3 %), et des gains de throughput de +51 % à +400 % selon les configurations en production. Compatible avec vLLM et SGLang, il fournit des checkpoints pré-entraînés pour d’autres modèles comme Qwen3 et Gemma 4. Une brique de plus dans l’écosystème DeepSeek, qui ne cesse de s’étoffer.
La guerre des prix : quand DeepSeek casse les prix de 75 %
Si la mise en production de V4-Pro a marqué les esprits, c’est aussi parce qu’elle s’est accompagnée d’une annonce qui a fait trembler toute l’industrie : une baisse de prix de 75 % sur l’API du modèle. Comme le rapporte InfoWorld, les tarifs initiaux allaient de 0,0145 $ par million de tokens (cache hit) à 3,48 $ par million de tokens de sortie. Après révision, V4-Pro coûte désormais à partir de 0,003625 $ par million de tokens (cache hit) et jusqu’à 0,87 $ par million de tokens de sortie. Le prix officiel de l’API a été ajusté à un quart du prix original après la fin de la promotion, le 31 mai 2026 à 15h59 UTC.
Cette baisse n’est pas qu’un coup marketing. Comme l’explique Sanchit Vir Gogia, analyste en chef chez Greyhound Research : « V4-Pro a été conçu pour réduire le coût de l’inférence sur de longs contextes, fonctionnant à environ un quart du calcul par token et un dixième de l’empreinte mémoire de son prédécesseur sur de très longs contextes. C’est pourquoi la baisse de prix est permanente plutôt que promotionnelle. Ce n’est pas une remise. C’est un gain d’efficacité répercuté. »
Les chiffres actuels confirment cette stratégie agressive : 0,14 $ par million de tokens en entrée et 0,87 $ par million de tokens en sortie (selon les données d’août 2026). Un positionnement qui place DeepSeek loin devant ses concurrents américains sur le rapport performance/prix, et qui a contraint OpenAI, Anthropic et Google à revoir leurs propres tarifs. Comme le souligne Neil Shah, vice-président chez Counterpoint Research : « D’un point de vue des capacités pures, DeepSeek V4-Pro a effectivement comblé l’écart de performance sur des tâches critiques comme les mathématiques complexes et le raisonnement, tout en menant agressivement le marché sur l’ouverture et les coûts d’inférence. »
Cette guerre des prix a été l’un des thèmes centraux de l’été 2026. Techbooky notait dès le 13 août que V4-Pro était proposé bien en dessous de Kimi K3 sur OpenRouter, tout en offrant la même fenêtre de contexte d’un million de tokens. Une pression qui s’est encore accentuée avec l’arrivée de nouveaux concurrents.
1,6 billion de paramètres, 49 milliards actifs : plongée dans l’architecture MoE de V4
Comme son prédécesseur V3, DeepSeek V4 repose sur une architecture Mixture of Experts. Le principe est connu : au lieu d’activer l’intégralité des paramètres du réseau pour chaque token traité, le modèle ne sollicite qu’un sous-ensemble d’experts spécialisés, sélectionnés par un mécanisme de routage. Cela permet d’augmenter considérablement la capacité totale du modèle sans faire exploser le coût de calcul par inférence.

Les chiffres de V4-Pro sont éloquents : 1 600 milliards de paramètres au total, mais seulement 49 milliards activés par token. Le ratio est d’environ 1/33, ce qui place le modèle dans la lignée des grands MoE récents. V4-Flash suit la même logique avec 284 milliards de paramètres totaux et 13 milliards actifs. Ces ordres de grandeur sont cohérents avec ce que l’on observe chez les concurrents — Hy4 de Tencent, par exemple, affiche 770 milliards de paramètres totaux pour 49 milliards actifs, un ratio similaire. Les sources disponibles ne précisent pas le nombre d’experts par couche ni la stratégie de routage exacte (top-k, load balancing, etc.).
Là où les sources divergent, c’est sur le mécanisme d’attention utilisé pour gérer les très longs contextes. Capentia évoque un « DeepSeek Sparse Attention (DSA) », tandis que Dedimarco parle d’une « Hybrid Attention Architecture » combinant « Compressed Sparse Attention (CSA) » et « Heavily Compressed Attention (HCA) ». Deux acronymes différents pour décrire probablement des mécanismes proches — l’attention sparse étant devenue la norme pour traiter des contextes d’un million de tokens sans explosion quadratique du coût de calcul. Mais cette divergence terminologique illustre un problème plus large : l’absence de publication technique officielle de la part de DeepSeek. Les blogs s’appuient sur des fuites, des interviews ou des documents partiels, et les noms exacts des mécanismes restent incertains.
Ce qui est clair, c’est l’ambition : tenir un contexte d’un million de tokens tout en maîtrisant les coûts. Dedimarco avance des chiffres spectaculaires — V4-Pro utiliserait seulement 27 % des FLOPs de V3.2 et 10 % du KV cache sur un contexte d’un million de tokens. Ces données, si elles se confirment, représenteraient un bond significatif en efficacité. Mais elles proviennent d’une source unique, sans protocole de mesure détaillé. Il faut donc les prendre avec précaution, même si la direction est crédible : l’attention sparse est précisément conçue pour réduire la mémoire nécessaire au cache des clés et valeurs.
Un point mérite d’être souligné : l’abandon apparent du Multi-head Latent Attention (MLA) qui faisait la particularité de V3. Aucune des sources consultées ne mentionne MLA pour V4. Il est possible que DeepSeek ait remplacé ce mécanisme par les nouvelles formes d’attention sparse évoquées ci-dessus, ou que les termes aient changé. Sans document officiel, difficile de trancher. Ce flou technique n’est pas anodin : il complique la tâche des équipes qui souhaitent comprendre finement le fonctionnement du modèle avant de l’intégrer en production.
Un autre aspect technique mérite l’attention : selon DeepSeek.fr, V4 intègre des modes Thinking et Non-Thinking sélectionnables par requête — l’utilisateur peut décider si le modèle réfléchit en interne ou répond directement. Une fonctionnalité qui rapproche le modèle des usages agentiques où le contrôle du temps de raisonnement est crucial. La même source évoque une meilleure continuité conversationnelle, les conclusions étant prises en compte de manière plus fiable au fil de plusieurs messages utilisateur, un point faible jusque-là courant chez les modèles de langage.
Codeforces 3206, SWE-bench 81% : ces benchmarks qui défient GPT-5.5 et Claude Opus 4.7
Venons-en aux chiffres qui ont fait le tour du web. Selon Dedimarco, V4-Pro obtiendrait un score de 3206 sur Codeforces (contre 3168 pour GPT-5.4), 93,5 sur LiveCodeBench, et 80,6 % sur SWE-bench Verified — un score très proche des 80,8 % de Claude Opus 4.6. D’autres sources, comme NxCode, évoquent 81 % sur SWE-bench. Ces performances placent le modèle chinois au niveau des meilleurs modèles fermés, du moins sur le papier. Les données consolidées confirment ces ordres de grandeur : 3206 sur Codeforces et 81 % sur SWE-bench Verified, avec une performance relative qui égale les modèles propriétaires sur 95 % des benchmarks.
Mais il faut résister à l’ivresse des chiffres. Aucun de ces benchmarks n’a été vérifié de manière indépendante. Les sources sont des blogs spécialisés qui relaient des données fournies par DeepSeek ou par des tests non publiés. Les conditions de test — prompting, outils utilisés, température d’échantillonnage, nombre d’essais — ne sont jamais précisées. Or, sur des benchmarks comme SWE-bench, la différence entre 80 % et 81 % peut tenir à un détail de protocole. La prudence s’impose d’autant plus que les modèles de comparaison mentionnés (GPT-5.4, Opus 4.6) ne correspondent pas exactement aux dernières versions en date (GPT-5.5, Opus 4.7, GPT-5.6 Sol), ce qui rend les comparaisons difficiles à interpréter.
Ce que l’on peut affirmer avec une relative confiance, c’est que DeepSeek V4 se situe dans la même ligue que les modèles fermés les plus récents sur les tâches de code et de résolution de problèmes. C’est déjà considérable pour un modèle open source. Les scores de 3206 sur Codeforces ou 81 % sur SWE-bench, même s’ils sont à prendre avec des pincettes, indiquent un niveau de compétence qui était encore impensable pour un modèle ouvert il y a deux ans. Le fait que ces chiffres soient relayés par plusieurs sources indépendantes — même si elles se copient parfois — suggère qu’ils ne sont pas purement fantaisistes.
Depuis, la concurrence s’est encore durcie. Fin juillet 2026, Moonshot AI a dévoilé Kimi K3, présenté comme le plus grand modèle open source jamais développé, capable de rivaliser avec les meilleurs modèles américains. Début août, Alibaba a riposté avec Qwen3.8-Max, un modèle de 2,4 billions de paramètres avec 1 million de tokens de contexte et des poids ouverts. Et le 14 août, Z.ai a lancé GLM-5.3, un modèle MoE de 753 milliards de paramètres qui s’impose en tête du benchmark de cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol. Surtout, GLM-5.3 démontre que le post-entraînement seul peut transformer un modèle : Terminal-Bench 3.0 passe de 4,6 % à 28,3 % sans aucun nouveau paramètre, en réutilisant la base MoE de 743 milliards de GLM-5.2.
Septembre 2026 : un écosystème en ébullition
Six mois après le lancement de V4, le paysage de l’IA open source a été complètement redessiné. Le 8 septembre 2026, Tencent a ouvert à son tour les poids de Hy4, un modèle de 770 milliards de paramètres (49 milliards actifs) avec un contexte d’un million de tokens, conçu pour le codage, la productivité bureautique et la recherche scientifique. Une sortie qui confirme que les géants chinois de l’Internet — après DeepSeek, Alibaba, Moonshot AI et Z.ai — considèrent désormais l’open source comme un axe stratégique majeur.

Meta n’est pas en reste : le 14 août, la firme de Menlo Park a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres à poids ouverts sous licence Apache 2.0, conçu pour une exécution locale sur appareil. Une réponse directe à la tendance des petits modèles efficaces qui se multiplient dans l’écosystème.
Et puis il y a les surprises. Depuis le 20 août, un modèle de raisonnement anonyme baptisé Ox Alpha tourne sur OpenRouter, accessible gratuitement jusqu’au 27 août. Personne ne connaît son origine — certains soupçonnent un laboratoire chinois — mais ses performances en code et en agents autonomes impressionnent les développeurs. Business Insider, qui a enquêté, n’a pas réussi à identifier son créateur. Un mystère qui alimente les spéculations sur l’existence de modèles « stealth » en préparation.
Cette effervescence s’accompagne d’une maturation des outils d’inférence. La première conférence vLLM s’est tenue fin août 2026 en parallèle du Ray Summit, reflétant la convergence des infrastructures open source autour du post-entraînement par renforcement (RL). Les moteurs comme vLLM 0.26, SGLang et TensorRT-LLM se disputent le marché de l’inférence MoE, avec des gains de performance significatifs pour servir des modèles de plus en plus gros.
Côté européen, l’écosystème open source continue de se structurer. L’accord Microsoft-Mistral annoncé le 21 juillet 2026 — plusieurs milliards de dollars pour que le géant américain exploite les GPU européens de la start-up française — a confirmé que l’open source n’est plus un choix idéologique mais une réalité industrielle. Mistral, qui a sécurisé 200 mégawatts de puissance de calcul et vise 1 gigawatt d’ici 2030, place ses modèles (Mistral Medium 3.5, OCR 4) dans l’écosystème Microsoft, tandis que Solar Open 2 d’Upstage (250 milliards de paramètres MoE, sorti le 23 juillet) tente de s’imposer sur le terrain des agents IA.
Verdict : DeepSeek V4, un pari gagnant mais déjà concurrencé
Six mois après son lancement surprise, DeepSeek V4 a tenu ses promesses. Le modèle est passé en production, ses prix ont cassé le marché, et ses performances le placent dans la même ligue que les meilleurs modèles fermés. Mais l’avance chinoise se joue désormais à plusieurs : DeepSeek, Alibaba, Z.ai, Moonshot AI et Tencent se livrent une concurrence féroce qui profite aux utilisateurs — des poids toujours plus ouverts, des prix toujours plus bas, des contextes toujours plus longs.
Pour les équipes qui hésitent encore, la question n’est plus de savoir si un modèle open source peut rivaliser avec les géants propriétaires. Elle est de savoir lequel choisir parmi une offre pléthorique. DeepSeek V4-Pro conserve des arguments solides : maturité de production, écosystème d’outils (DSpark, intégration Codex), prix agressifs et licence MIT. Mais GLM-5.3 le talonne sur le code et la cybersécurité, Qwen3.8-Max le dépasse en taille, et Hy4 arrive avec la puissance de distribution de Tencent.
Une chose est sûre : l’été 2026 restera dans les annales comme le moment où l’IA open source a cessé d’être une alternative pour devenir la norme. Et DeepSeek V4 en a été le détonateur.
Sources

- InfoWorld — DeepSeek’s steep V4-Pro price cut escalates AI pricing war
- Forbes — China’s DeepSeek V4 And Qwen Reshape The Open-Source AI Race
- Techbooky — DeepSeek V4-Pro Shows China’s AI Price War Is Not Slowing
- Techgenyz — Hy4 preview: 770B Remarkable Open Model Launch
- Gadget Pilipinas — Tencent Releases Open-Source Hy4 LLM Preview With 770B Parameters and 1M+ Token Context
- The Agent Report — GLM-5.3: Z.ai Tops the Open Coding Leaderboard on Post-Training Alone
- SiliconANGLE — Z.ai debuts GLM-5.3 with long-horizon coding, cybersecurity upgrades
- Context Studios — Muse Glimmer: Le modèle agentique ouvert de 30B de Meta
- Business Insider — A mysterious free AI model is impressing developers
- IT Social — Qui est derrière Ox Alpha, le modèle furtif d’OpenRouter ?
- TechTimes — Ray Summit 2026: RL Post-Training Forces Open-Source AI Infrastructure to Converge
- Coin Academy — Microsoft-Mistral : l’accord à plusieurs milliards
- IT Daily — Microsoft et Mistral investissent des milliards dans l’infrastructure européenne
Article recherché et rédigé automatiquement · Magazine Electrosens