Electrosens R&D
Electrosens Magazine LLM Opensource · 16 September 2026

Qwen3.8-Max et la descendance Qwen : l’open source a-t-il enfin détrôné les géants propriétaires ?

Depuis le 29 avril 2025, Qwen3 d’Alibaba Cloud s’est imposé comme une référence de l’open source. Architecture Mixture of Experts, contexte 128K, licence Apache 2.0 : les promesses étaient nombreuses. Mais en août 2026, l’écosystème a été bouleversé à trois reprises : d’abord par Qwen3.5, une famille de huit modèles nativement multimodaux dont le 9B détrône des géants treize fois plus gros, puis par Qwen3.6, une mise à jour orientée codage agentique et stabilité, et enfin par Qwen3.8-Max, un modèle de 2,4 billions de paramètres aux poids ouverts annoncés, capable de travailler en autonomie pendant seize jours et vendu à un prix cassé. Plongée dans les innovations architecturales, les benchmarks vérifiés et les outils de fine-tuning qui rendent ces modèles accessibles sur du matériel grand public.


Pourquoi Qwen3 (et sa descendance) fait trembler l’open source en 2026

L’année 2025 a marqué un tournant dans l’écosystème des grands modèles de langage open source. Alibaba Cloud, déjà connu pour sa famille Qwen, a dévoilé Qwen3 le 29 avril 2025 sous licence Apache 2.0 – une licence permissive autorisant une utilisation commerciale sans restriction. Cette annonce a immédiatement attiré l’attention des développeurs et des entreprises, car Qwen3 promettait de concilier performances de pointe et accessibilité sur du matériel grand public.

Mais l’histoire ne s’est pas arrêtée là. Le 16 février 2026, Alibaba a publié Qwen3.5, une famille de huit modèles open-weight allant de 0,8B à 397B de paramètres, tous sous licence Apache 2.0, tous nativement multimodaux (texte, image, vidéo), et reposant sur une architecture hybride mêlant attention linéaire et transformeurs classiques. Le déploiement s’est échelonné entre le 16 février et le 2 mars 2026, comme le détaille Qwen-AI.com. Parmi eux, Qwen3.5-9B, un modèle de seulement 9 milliards de paramètres, surpasse selon RoboActu le modèle open source d’OpenAI GPT-oss-120B (120 milliards de paramètres) sur plusieurs benchmarks clés, tout en pouvant fonctionner sur un simple ordinateur portable. C’est un rapport de taille de 13 pour 1.

Puis, dans le courant du printemps 2026, Alibaba a déployé Qwen3.6, une mise à jour intermédiaire qui, selon OpenLM.ai, « priorise la stabilité et l’utilité réelle » en réponse aux retours de la communauté. Cette version améliore notamment le codage agentique (gestion des workflows front-end et raisonnement au niveau du dépôt) et introduit une fonctionnalité de préservation de la pensée (thinking preservation) qui conserve le contexte de raisonnement à travers l’historique de conversation, réduisant les coûts de développement itératif.

Et l’histoire continue. Le 3 août 2026, Alibaba a dévoilé Qwen3.8-Max, un modèle de 2,4 billions de paramètres avec une fenêtre de contexte d’un million de tokens, dont les poids ouverts sont annoncés pour une sortie imminente aux côtés d’un Qwen3.8-27B, selon Open Source For You et SiliconANGLE. Ce nouveau géant prétend travailler en autonomie pendant plusieurs jours – Alibaba a démontré un projet de codage de 16 jours sans intervention humaine – une capacité jusqu’ici presque exclusive aux modèles propriétaires les plus avancés, comme le rapporte Génération NT.

Mais le plus spectaculaire est peut-être le prix. Alibaba a fixé le tarif de Qwen3.8-Max à 2 dollars par million de tokens en entrée et 6 dollars par million en sortie via Model Studio, selon TechRepublic et Forbes. C’est 60 % moins cher que GPT-5.6 Sol pour l’entrée non cachée et 80 % moins cher pour la sortie. Une guerre des prix qui rappelle celle déclenchée par DeepSeek V4, dont le prix d’entrée est tombé à 0,14 $/M tokens en août 2026.

L’enjeu est crucial : jusqu’alors, fine-tuner un modèle de plusieurs dizaines de milliards de paramètres nécessitait des clusters de GPU professionnels (A100, H100). Avec Qwen3.5 et ses successeurs, la promesse est de pouvoir adapter un modèle performant sur une simple RTX 4090, voire une RTX 3060 grâce aux techniques de quantification. Mais cette promesse tient-elle vraiment la route ? Pour le savoir, il faut examiner en détail l’architecture, les benchmarks disponibles, et surtout l’écosystème de fine-tuning qui s’est constitué autour de cette famille.


Architecture : de Qwen3 à Qwen3.8, le saut vers l’hybride, la multimodalité native et l’échelle

Qwen3 n’était pas une simple mise à jour incrémentale de Qwen2.5. Le rapport technique arXiv 2505.09388, cité par DEV-AI, révélait des choix architecturaux radicaux. Qwen3.5 va beaucoup plus loin, avec une refonte complète, et Qwen3.8-Max pousse l’échelle à un niveau inédit.

Taille des modèles comparés (paramètres)Qwen3.5-9B9Milliards de paramètresGPT-oss-120B120Milliards de paramètresQwen3.8-Max2400Milliards de paramètres

Qwen3 : les fondations MoE

Qwen3 a été pré-entraîné sur 36 trillions de tokens, soit le double des 18T de Qwen2.5. Cette quantité de données, couplée à un support de 119 langues (contre 29 pour Qwen2.5), en faisait l’un des modèles les plus multilingues jamais publiés à l’époque. Les versions MoE de Qwen3 (Qwen3-30B-A3B et Qwen3-235B-A22B) utilisaient 128 experts avec 8 experts actifs par token, sans experts partagés. Cette sparse activation réduisait considérablement le coût de calcul en inférence : seuls 3,3 milliards de paramètres actifs pour la version 30B, et 22 milliards pour la version 235B.

Modèle Paramètres totaux Paramètres actifs Experts Experts actifs/token
Qwen3-30B-A3B 30,5B ~3,3B 128 8
Qwen3-235B-A22B 235B ~22B 128 8

Qwen3.5 : l’architecture hybride Gated Delta + MoE

Qwen3.5 marque une rupture. Selon le dépôt GitHub officiel et le guide complet de Qwen-AI.com, la famille repose sur une architecture hybride combinant des Gated Delta Networks (une forme d’attention linéaire plus efficace en mémoire) avec un Mixture-of-Experts parcimonieux. Résultat : moins de calculs pour de meilleures performances, un gain direct en latence et en coût d’inférence. L’inférence long-contexte est dramatiquement accélérée – jusqu’à 19x à 256K tokens selon Qwen-AI.com.

La famille complète compte huit modèles open-weight :

Modèle Type Usage recommandé
Qwen3.5-0.8B Dense Edge, embarqué
Qwen3.5-2B Dense Mobile, chat, résumé
Qwen3.5-4B Dense Agents légers, contexte 262K
Qwen3.5-9B Dense Raisonnement, laptop standard
Qwen3.5-27B Dense Écriture créative, raisonnement complexe
Qwen3.5-35B-A3B MoE 196 tok/s sur RTX 4090
Qwen3.5-122B-A10B MoE Qualité/rapidité, serveur
Qwen3.5-397B-A17B MoE Flagship, multi-GPU

La multimodalité native : la vraie révolution

Ce qui distingue le plus Qwen3.5 de la génération précédente, c’est la fusion précoce : plutôt que d’ajouter un encodeur visuel sur un modèle texte existant (comme c’était le cas pour Qwen3-VL), Alibaba a entraîné Qwen3.5 avec des tokens texte et image mélangés dès le départ. Chaque modèle – même le 0.8B – gère les images et les vidéos nativement, sans variante « VL » séparée. Concrètement, le modèle 4B peut lire des éléments d’interface, compter des objets dans une vidéo ou analyser un document, des tâches qui nécessitaient jusqu’ici des modèles dix fois plus grands, rapporte RoboActu.

Le GitHub officiel confirme également une couverture linguistique étendue à 201 langues et dialectes, contre 119 pour Qwen3. L’entraînement a par ailleurs intégré du RL scalable dans des environnements à un million d’agents, avec des distributions de tâches progressivement complexes, pour une robustesse accrue en conditions réelles.

Qwen3.6 : la stabilité et le codage agentique

Entre Qwen3.5 et Qwen3.8, Alibaba a publié Qwen3.6, une version qui ne révolutionne pas l’architecture mais qui affine l’expérience développeur. Selon OpenLM.ai, Qwen3.6 « priorise la stabilité et l’utilité réelle » avec deux améliorations majeures :

  • Agentic Coding : le modèle gère les workflows front-end et le raisonnement au niveau du dépôt avec plus de fluidité et de précision.
  • Thinking Preservation : une nouvelle fonctionnalité qui conserve le contexte de raisonnement à travers l’historique de conversation, ce qui réduit les coûts lors des itérations de développement.

Cette version est un pont pragmatique entre l’innovation de Qwen3.5 et l’échelle de Qwen3.8, répondant directement aux retours de la communauté.

Qwen3.8-Max : le géant d’août 2026

Annoncé le 3 août 2026, Qwen3.8-Max pousse la logique à l’extrême. Selon Open Source For You et MarkTechPost, il s’agit du modèle le plus capable de la famille Qwen à ce jour, avec :

  • 2,4 billions de paramètres au total, soit environ 7 fois plus que le plus grand Qwen3.5 (397B).
  • 95 milliards de paramètres actifs par requête (architecture MoE).
  • Fenêtre de contexte de 1 million de tokens (plus de 200 pages de texte ou environ 100 heures de vidéo en une seule requête).
  • Sortie maximale de 131 000 tokens.
  • Poids ouverts annoncés pour la semaine suivant l’annonce, aux côtés du plus petit Qwen3.8-27B, plus efficace en matériel.
  • Prix de lancement : 2 $/M tokens en entrée, 6 $/M en sortie via Model Studio.

Alibaba n’a pas divulgué l’architecture complète, mais les versions précédentes utilisaient le mécanisme d’attention Gated DeltaNet, qui offre une mise à l’échelle linéaire pour réduire la croissance du calcul et de la mémoire lors de longs contextes. Nvidia a précédemment souligné que cette approche combine la règle de mise à jour gated et la règle delta pour améliorer le traitement long-contexte.

En interne, Alibaba a démontré que Qwen3.8-Max a complété un projet de codage de 16 jours sans intervention humaine et un workflow d’optimisation de conception de puces impliquant plus de 500 étapes. Le modèle est disponible immédiatement via Alibaba Cloud.

Selon VentureBeat, Qwen3.8-Max revendique des performances supérieures à GPT-5.6 Sol Max et Claude Fable 5 sur l’usage agentique d’ordinateur (agentic computer use). Une affirmation audacieuse qui devra être confirmée par des benchmarks indépendants.


Benchmarks : ce que les chiffres vérifiés disent vraiment (septembre 2026)

Les performances brutes de Qwen3 étaient souvent citées avec prudence. Le blog chats-llm.com avançait un score de 88% sur MMLU et 92% sur HumanEval. Depuis, des benchmarks indépendants ont émergé, notamment pour Qwen3.5, et les chiffres sont plus solides.

Qwen3.5-9B : le petit qui bat les géants

Les résultats publiés par l’équipe Qwen, relayés par RoboActu, sont sans appel :

Benchmark Qwen3.5-9B GPT-oss-120B (OpenAI) Gemini 2.5 Flash-Lite
GPQA Diamond (raisonnement doctoral) 81,7% 80,1%
MMMU-Pro (raisonnement visuel) 70,1% 59,7%
Compréhension vidéo 84,5% 74,6%

Le 9B surpasse donc GPT-oss-120B sur le GPQA Diamond, un benchmark de raisonnement de niveau doctoral, tout en étant 13 fois plus petit. Sur la compréhension vidéo, même le 4B (83,5%) distance Gemini 2.5 Flash-Lite (74,6%).

Le guide Qwen-AI.com confirme que le 9B « bat GPT-OSS-120B sur de multiples benchmarks de connaissance ». Ces chiffres sont cohérents avec l’analyse de La Gazette IA et de GoodTech, qui soulignent que ces performances s’expliquent par l’architecture Gated Delta + MoE parcimonieux.

Qwen3.8-Max : des chiffres internes à confirmer

Pour Qwen3.8-Max, les benchmarks indépendants n’existent pas encore – le modèle vient d’être annoncé. Alibaba a publié des évaluations internes montrant des résultats supérieurs à GPT-5.6 Sol Max et Claude Fable 5 sur l’agentic computer use, mais ces chiffres restent à vérifier par des tiers. Le modèle est disponible via API depuis le 3 août, et les poids ouverts devraient permettre des tests indépendants dans les semaines à venir.

Le contexte concurrentiel : GLM-5.3, Hy4, DeepSeek V4

Qwen3.8-Max n’est pas seul sur le marché. Le 14 août 2026, Z.ai a publié GLM-5.3, un modèle MoE de 743 milliards de paramètres qui réutilise la base de GLM-5.2 sans nouveau paramètre, mais avec un post-entraînement massif. Selon The Agent Report, GLM-5.3 a fait passer Terminal-Bench 3.0 de 4,6 % à 28,3 % et domine le benchmark cybersécurité CyberGym avec 84,5 %, devant Claude Sonnet 5 et GPT-5.6 Sol, rapporte ayinedjimi-consultants.fr. Ses poids sont différés, mais le modèle est accessible via API.

Tencent a également ouvert Hy4 preview le 28 août 2026, un modèle de 770 milliards de paramètres avec 49B actifs et un contexte d’un million de tokens, orienté codage, productivité bureautique et recherche scientifique, selon Techgenyz et gadgetpilipinas.net.

DeepSeek V4 Pro, sorti le 24 avril 2026, continue de casser les prix avec 0,14 $/M tokens en entrée, tout en égalant les modèles propriétaires sur 95 % des benchmarks, selon techbooky.com.

Ce paysage montre que l’open source n’est plus un choix de second rang : en septembre 2026, les meilleurs modèles ouverts rivalisent avec les fleurons propriétaires sur le code, le raisonnement et la cybersécurité.


Fine-tuning : rendre Qwen3.5 accessible sur du matériel grand public

La promesse de Qwen3.5 est de permettre un fine-tuning efficace sur une simple RTX 4090. Pour cela, l’écosystème a développé des outils spécifiques, notamment la quantification dynamique.

Source : apidog.com

Unsloth Dynamic 3.0 GGUFs : la quantification qui s’adapte

Unsloth a poussé la quantification dynamique à un niveau inédit avec Dynamic 3.0 GGUFs. L’idée : au lieu d’appliquer une quantification uniforme à toutes les couches, on adapte la précision à chaque couche en fonction de sa sensibilité. Résultat : une réduction de la pénalité de perplexité INT4 par rapport à GPTQ de 74 % (de 4,57 à 1,17), selon les données du magazine. Concrètement, cela permet de fine-tuner un MoE de 35B sur une RTX 4090 avec une qualité proche du FP16.

Les frameworks : Unsloth vs Axolotl vs TRL vs LLaMA-Factory

Le choix du framework dépend du besoin :

Framework Points forts Limites
Unsloth Quantification dynamique, vitesse, support GGUFs Moins flexible pour les architectures exotiques
Axolotl Support de plus de 100 modèles, multimodal natif (LLaMA-Vision, Qwen2-VL, Pixtral) Courbe d’apprentissage plus raide
TRL (Hugging Face) Intégration native avec l’écosystème HF, RLHF Performances moindres sur MoE
LLaMA-Factory Interface Web, scripts prêts à l’emploi Moins adapté aux très gros modèles

Pour un fine-tuning QLoRA de Qwen3.5-9B sur une RTX 4090, Unsloth Dynamic 3.0 permet de descendre sous les 10 Go de VRAM avec une qualité quasi identique au FP16. C’est un changement de paradigme : les développeurs individuels peuvent désormais adapter des modèles de pointe sans cluster.

Guide pratique : fine-tuner Qwen3.5-9B en local

  1. Installer Unsloth : pip install unsloth
  2. Charger le modèle en 4 bits : from unsloth import FastLanguageModel; model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.5-9B-bnb-4bit")
  3. Ajouter LoRA : model = FastLanguageModel.get_peft_model(model, r=16, lora_alpha=32, lora_dropout=0.05)
  4. Préparer le dataset : au format Alpaca ou ShareGPT
  5. Lancer l’entraînement : avec un batch size de 1 à 4, 2 époques, sur une RTX 4090 (24 Go), le fine-tuning prend environ 2 heures.

Pour les MoE plus gros comme Qwen3.5-35B-A3B, la quantification dynamique d’Unsloth permet de descendre à ~12 Go de VRAM, rendant le fine-tuning possible sur une RTX 4080.


Inférence : vLLM, SGLang et TensorRT-LLM pour servir Qwen3.8-Max

Une fois fine-tuné, il faut servir le modèle. En 2026, trois moteurs dominent : vLLM (Berkeley), SGLang (Stanford) et TensorRT-LLM (NVIDIA). Selon le magazine, les débits mesurés sur H100 atteignent 1 850 tok/s pour vLLM, 1 920 pour SGLang et 2 100 pour TensorRT-LLM sur des modèles denses. Pour les MoE comme Qwen3.8-Max, le choix du moteur est crucial : SGLang excelle sur les longs contextes grâce à RadixAttention, tandis que TensorRT-LLM offre la meilleure latence grâce à son moteur compilé.

Le test du MoE est particulièrement exigeant : DeepSeek V4, GLM-5.3, Qwen3.8-Max et Hy4 changent la donne. vLLM a introduit PagedAttention pour gérer la mémoire KV efficacement, mais SGLang et TensorRT-LLM ont chacun leurs optimisations. Pour les équipes IT, le choix se résume souvent à un arbitrage entre flexibilité (vLLM), performance long-contexte (SGLang) et optimisation matérielle (TensorRT-LLM).


L’écosystème en septembre 2026 : une guerre froide des modèles

Le paysage de l’IA open source en septembre 2026 est dominé par une concurrence féroce entre laboratoires chinois et américains :

Source : dev-ai.fr
  • Alibaba : Qwen3.8-Max (2,4T, 95B actifs) et Qwen3.5 (8 modèles)
  • Z.ai : GLM-5.3 (743B, post-entraînement massif, CyberGym 84,5 %)
  • Tencent : Hy4 preview (770B, 49B actifs)
  • DeepSeek : V4 Pro (1,6T, 49B actifs, prix cassés)
  • Google : Gemma 4 12B (architecture unifiée sans encodeurs)
  • Meta : Muse Glimmer (30B agentique, Apache 2.0, exécution locale)
  • OpenAI : GPT-oss-120B (open source, mais dépassé par Qwen3.5-9B)

Cette guerre a un effet direct sur les prix : les API ouvertes cassent les tarifs des modèles propriétaires. Qwen3.8-Max à 2 $/M tokens en entrée, DeepSeek V4 à 0,14 $/M : les entreprises peuvent désormais déployer des modèles de niveau frontière pour une fraction du coût des solutions propriétaires.

Ox Alpha : le mystère qui plane

Le 20 août 2026, un modèle de raisonnement anonyme nommé Ox Alpha est apparu sur OpenRouter, gratuit pendant une semaine, impressionnant les développeurs en code et raisonnement. Son origine est inconnue – certains soupçonnent un laboratoire chinois (Zhipu, Xiaomi ou Meituan) d’après l’analyse du tokenizer, rapporte Business Insider. Ce phénomène illustre la nouvelle réalité : l’open source est devenu si compétitif que des acteurs choisissent l’anonymat pour tester leurs modèles sans révéler leur identité.


Verdict : Qwen3.8-Max, un tournant pour l’open source

En septembre 2026, la question n’est plus de savoir si l’open source peut rivaliser avec les modèles propriétaires – c’est fait. Qwen3.8-Max, avec ses 2,4 billions de paramètres, ses poids ouverts annoncés et son prix cassé, représente un tournant historique. Pour la première fois, un modèle de niveau frontière est accessible à la fois via API à un coût réduit et potentiellement en auto-hébergement.

Les défis restent considérables : faire tourner un modèle de 2,4T paramètres exige une infrastructure massive, et les benchmarks indépendants manquent encore. Mais la tendance est claire : l’open source a gagné la guerre des capacités, et la guerre des prix ne fait que commencer.

Pour les développeurs et les entreprises, le message est simple : en 2026, il n’y a plus d’excuse pour payer le prix fort des API propriétaires. Qwen3.5, GLM-5.3, Hy4 et DeepSeek V4 offrent des performances comparables, voire supérieures, pour une fraction du coût – et avec la liberté de fine-tuner et de déployer sur sa propre infrastructure.


Sources

Source : siliconflow.com
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *