Electrosens R&D
Electrosens Magazine LLM Opensource · 18 September 2026

Llama 4, dix-huit mois après : que valent Scout et Maverick face à DeepSeek V4, GLM-5.3 et Qwen3.8-Max ?

Meta a dévoilé en avril 2025 sa famille Llama 4, première génération de modèles open source à architecture mixture-of-experts (MoE) et multimodalité native. Avec trois variantes aux profils radicalement différents – Scout, Maverick et Behemoth – le choix pouvait sembler complexe. Dix-huit mois plus tard, le paysage s’est clarifié : Behemoth n’a jamais été publié, Scout s’impose pour les tâches à très long contexte, et Maverick reste un polyvalent performant mais exigeant. Mais l’écosystème a bougé : DeepSeek V4, Qwen3.8-Max, Kimi K3 et GLM-5.3 sont arrivés entre-temps, redéfinissant les rapports de force. Et Meta a depuis surpris en publiant Muse Glimmer, un modèle agentique 30B pensé pour le local. Cet article dissèque chaque modèle, confronte les chiffres disponibles et vous aide à décider en fonction de votre matériel, de votre budget et de vos cas d’usage.

Llama 4 débarque : trois cerveaux, une seule famille

Le 5 avril 2025, Meta a lancé Llama 4, sa première famille de modèles ouverts exploitant une architecture mixture-of-experts (MoE). Contrairement aux modèles denses classiques, un MoE active seulement une fraction de ses paramètres à chaque token, ce qui promet une meilleure efficacité calculatoire pour une capacité totale élevée. Llama 4 se décline en trois variantes :

  • Scout : 17 milliards de paramètres actifs, 109 milliards totaux, 16 experts, fenêtre de contexte de 10 millions de tokens.
  • Maverick : 17 milliards de paramètres actifs, 400 milliards totaux, 128 experts, fenêtre de contexte de 1 million de tokens.
  • Behemoth : 288 milliards de paramètres actifs, 2 000 milliards totaux, initialement annoncé comme « encore en entraînement ».

Tous les modèles sont multimodaux : ils acceptent en entrée du texte, des images et des vidéos, et produisent du texte. Scout et Maverick sont disponibles en open source (poids ouverts) sur Llama.com et Hugging Face. Behemoth, lui, n’a jamais été publié publiquement. En mai 2026, plusieurs sources (dont Codersera) rapportent que son développement a été abandonné en raison de problèmes de routage MoE et d’attention par blocs. Meta n’a pas officiellement confirmé, mais le modèle est considéré comme « shelved » — il sert encore de modèle enseignant pour distiller Scout et Maverick, selon Singularity Moments, mais n’est pas accessible au public.

Depuis, Meta a élargi sa gamme avec Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres à poids ouverts sous licence Apache 2.0, publié le 14 août 2026. Conçu pour une exécution locale, il excelle dans le raisonnement multi-tours et l’utilisation d’outils, selon Context Studios et Technoid. Ce positionnement « local-first » répond directement à la demande croissante de modèles pouvant tourner sur des postes de travail individuels, sans dépendance au cloud.

L’enjeu pour les développeurs et les entreprises en 2026 est clair : faut-il miser sur Scout pour sa fenêtre de contexte record, sur Maverick pour ses performances générales, sur Muse Glimmer pour l’agentique embarquée, ou se tourner vers les alternatives chinoises qui ont émergé depuis ? Ce comparatif détaillé vous aide à trancher.

Scout, Maverick, Behemoth : la fiche technique qui change tout

Avant de plonger dans les benchmarks, un tableau récapitulatif des spécifications officielles s’impose. Les chiffres proviennent des annonces Meta et des guides communautaires (ExplainX, Singularity Moments, Codersera, Baeseokjae, Journaldunet).

Paramètres totaux des modèles (en milliards)Scout109milliards de paramètresMaverick400milliards de paramètresGLM-5.3743milliards de paramètresHy4770milliards de paramètresDeepSeek V41600milliards de paramètresQwen3.8-Max2400milliards de paramètres
Caractéristique Scout Maverick Behemoth Muse Glimmer
Paramètres actifs 17B 17B 288B 30B (total)
Paramètres totaux 109B 400B 2T 30B
Nombre d’experts 16 128 – (non publié) – (dense)
Fenêtre de contexte 10M tokens 1M tokens Non publiée Non précisée
Multimodalité Texte, image, vidéo Texte, image, vidéo Texte, image, vidéo Texte, image
Disponibilité Open source (poids) Open source (poids) Jamais publié (shelved mai 2026) Open source (Apache 2.0)
Licence Llama 4 Community License Llama 4 Community License Apache 2.0

L’architecture MoE explique les différences de mémoire et de vitesse. Avec seulement 17B paramètres actifs, Scout et Maverick ont des besoins en VRAM comparables à ceux d’un modèle dense de 17B – en théorie. Mais Maverick, avec ses 128 experts, nécessite de charger l’intégralité des 400B paramètres en mémoire (même si seuls 17B sont utilisés à chaque pas). En pratique, cela signifie une empreinte mémoire bien plus élevée que Scout, qui n’a que 16 experts.

La fenêtre de contexte de Scout (10M tokens) reste l’une des plus longues jamais proposées dans un modèle open source, dépassant largement les 128K ou 1M tokens de la plupart des concurrents. Maverick plafonne à 1M tokens, ce qui reste confortable pour la majorité des usages. À titre de comparaison, le Qwen3.8-Max d’Alibaba, sorti en août 2026, propose également 1M tokens de contexte, mais avec 2,4 trillions de paramètres totaux. Le Hy4 de Tencent, dont l’aperçu a été ouvert le 28 août 2026, affiche 770B paramètres (49B actifs) et 1M+ tokens de contexte, selon Techgenyz.

Benchmarks : les promesses de Meta à l’épreuve des chiffres

Meta a communiqué des scores officiels pour Maverick uniquement. Scout et Behemoth n’ont pas de résultats publiés. Voici les chiffres disponibles :

  • Maverick : MMLU-Pro : 80,5 % ; HumanEval : 85,5 % (source : Neowin, Singularity Moments).
  • Scout : aucun score officiel.
  • Behemoth : aucun score (modèle non publié).

Meta affirme que Maverick « surpasse GPT-4o » sur certains benchmarks, mais sans fournir de comparaison chiffrée détaillée. Aucune source indépendante n’a encore reproduit ces résultats. Les benchmarks comme GSM8K, MATH ou GPQA ne sont pas mentionnés dans les documents officiels.

Le guide API de Baeseokjae (2026) avance des chiffres plus élevés pour Maverick : 91,8 % sur MMLU, 91,5 % sur HumanEval et 74,2 % sur SWE-bench. Ces scores, s’ils étaient confirmés, placeraient Maverick au niveau des meilleurs modèles fermés de 2025. Mais ils ne correspondent pas aux chiffres officiels de Meta et aucune source indépendante ne les a reproduits. Nous les signalons donc avec prudence.

En l’absence de scores pour Scout, il est difficile de le positionner. Son architecture plus légère (16 experts) suggère des performances inférieures à Maverick, mais sa fenêtre de contexte géante le rend unique pour des tâches spécifiques.

Comparaison avec les concurrents 2026 : le paysage a radicalement changé depuis avril 2025. Le DeepSeek V4, sorti le 24 avril 2026, affiche 1,6 trillion de paramètres totaux (49B actifs) et des scores impressionnants : Codeforces 3206, SWE-bench 81 %. Passé en production le 12 août 2026 (build V4 Pro 0813), il est désormais disponible à 0,14 $/M tokens en entrée et 0,87 $/M en sortie. Le Qwen3.8-Max d’Alibaba (août 2026) revendique 2,4T paramètres et une autonomie de plusieurs jours pour les agents. Le Kimi K3 de Moonshot AI (juillet 2026) est présenté comme « presque au niveau des meilleurs ». Plus récemment, GLM-5.3 de Z.ai (14 août 2026) a fait sensation : basé sur la même architecture MoE de 743 milliards de paramètres que GLM-5.2, il atteint 84,5 % sur le benchmark cybersécurité CyberGym et 66,9 sur DeepSWE, grâce au seul post-entraînement. Face à ces géants, Maverick (400B totaux) fait figure de poids moyen. Sur le leaderboard BenchLM de juillet 2026, qui classe 95 modèles open-weight, les modèles chinois dominent largement le haut du classement.

Constat : les benchmarks indépendants manquent cruellement pour Llama 4. Les praticiens doivent aborder les chiffres de Meta avec prudence, d’autant que les conditions de test (prompts, few-shot, etc.) ne sont pas détaillées. La prudence est d’autant plus de mise que DeepSeek, Qwen et Z.ai publient des scores détaillés et reproductibles, ce qui renforce leur crédibilité.

Mémoire et inférence : qui tient dans votre GPU ?

Les données concrètes de consommation VRAM et de vitesse d’inférence sont rares dans les sources. Voici ce qui est établi :

Source : codersera.com
  • Scout (17B actifs, 109B totaux) peut fonctionner sur un seul GPU Nvidia H100 avec des poids en pleine précision (FP16) – source : ExplainX, Singularity Moments. Avec une quantification 4-bit (Q4_K_M), il tient sur un GPU grand public 24 Go comme le RTX 4090 (source : ExplainX). Singularity Moments précise que la version 4-bit quantifiée tient dans 24–48 Go de VRAM. Aucun chiffre précis de VRAM (en Go) n’est donné, ni de temps d’inférence (tokens/s).
  • Maverick (17B actifs, 400B totaux, 128 experts) : aucune information sur la VRAM nécessaire. On peut supposer qu’il nécessite au moins 2 à 3 fois plus de mémoire que Scout en raison des 400B paramètres totaux à charger. Un H100 avec 80 Go pourrait suffire en FP16, mais c’est une extrapolation.
  • Behemoth : shelved, donc aucune donnée d’inférence pertinente.
  • Muse Glimmer (30B dense) : conçu pour le local, il peut tourner sur un GPU grand public avec quantification, selon Context Studios. Aucun chiffre précis de VRAM n’est fourni.

Pour donner des ordres de grandeur utiles, rappelons les tailles de fichiers typiques en 2026 : un modèle 70B en FP16 pèse environ 140 Go, en FP8 environ 70 Go, en GGUF Q4_K_M environ 40-45 Go. Un modèle 13B en FP16 pèse environ 26 Go. Scout, avec ses 109B totaux, devrait peser autour de 55-60 Go en FP16 et environ 20-25 Go en Q4_K_M – cohérent avec la mention d’un fonctionnement sur RTX 4090.

Côté frameworks, Scout et Maverick sont disponibles via Ollama (commandes ollama pull llama4:scout et ollama pull llama4:maverick d’après Singularity Moments). Les versions quantifiées (GGUF, AWQ, GPTQ) ne sont pas documentées, mais la mention de Q4_K_M pour Scout suggère une compatibilité avec llama.cpp. Le guide de N-3DS (2026) recommande d’ailleurs de choisir son modèle en fonction de son GPU : pour un RTX 4090, Scout quantifié est jouable ; pour Maverick, même en 4-bit, la mémoire nécessaire dépasse probablement 24 Go – un H100 ou un A100 80 Go est recommandé. Aucun temps d’inférence n’étant fourni, difficile d’estimer la latence.

Pour les déploiements en production, l’écosystème d’inférence a convergé en 2026 autour de vLLM, SGLang et TensorRT-LLM, comme le souligne le comparatif de Spheron (août 2026). Le Ray Summit 2026 (24-26 août) a d’ailleurs co-organisé la première conférence vLLM, marquant l’importance de ces outils pour le post-entraînement RL et l’inférence à grande échelle.

Cas d’usage : du chatbot local à l’agent industriel

Les sources communautaires (ExplainX, Singularity Moments, Baeseokjae, LightXtremeVPN) esquissent des cas d’usage pour chaque modèle.

Scout est recommandé pour :

  • L’analyse de documents longs : avec 10M tokens de contexte, il peut raisonner sur des livres entiers, des codebases complètes ou des rapports financiers de plusieurs milliers de pages.
  • L’ingénierie logicielle : analyse de dépôts GitHub entiers, génération de code contextuelle.
  • Le déploiement local : grâce à sa faible empreinte mémoire (quantifié 4-bit sur RTX 4090), il convient aux postes de travail individuels.
  • Les workflows à très haut débit : son architecture à 16 experts le rend rapide et adapté à la production (chat, résumé, classification).

Maverick est conçu pour :

  • Les tâches multimodales en temps réel : description d’images, analyse de vidéos courtes, assistants visuels.
  • L’assistant généraliste : chat, rédaction, résumé, traduction.
  • Les agents autonomes : sa capacité à gérer 1M tokens de contexte et ses 128 experts le rendent potentiellement adapté aux workflows multi-tours complexes, avec un support natif du tool use (function calling) intégré.
  • Le raisonnement complexe : ses 400B paramètres totaux lui donnent une profondeur de connaissances supérieure à Scout.

Muse Glimmer cible l’agentique embarquée : assistants personnels, automatisation de tâches sur poste de travail, raisonnement multi-tours avec outils, le tout en local sous licence Apache 2.0. C’est une alternative crédible pour les développeurs qui veulent éviter les API cloud.

Behemoth était initialement destiné à la génération de code à très grande échelle et à l’analyse de documents massifs, mais son abandon rend ces cas d’usage caducs.

Exemple concret : un cabinet d’avocats souhaitant analyser des milliers de pages de contrats pourrait utiliser Scout en local (sur un serveur équipé d’un H100) pour extraire des clauses, sans envoyer de données sensibles dans le cloud. Une startup de vision par ordinateur pourrait employer Maverick pour décrire en temps réel des flux vidéo, à condition de disposer d’un GPU suffisant. Un développeur indépendant pourrait déployer Muse Glimmer sur un Mac Studio pour un assistant de codage local.

Attention : depuis l’arrivée de DeepSeek V4, Qwen3.8-Max et GLM-5.3, ces cas d’usage sont disputés. DeepSeek V4, avec ses 49B actifs et son prix de 0,14 $/M tokens en entrée, offre un rapport performance/prix redoutable. Qwen3.8-Max, avec ses 2,4T paramètres et son autonomie agentique de plusieurs jours, vise directement les workflows complexes. GLM-5.3, avec son post-entraînement ciblé code et cybersécurité, talonne Kimi K3 au sommet des classements open-weight. Le guide de Novita (août 2026) recommande d’ailleurs DeepSeek V4 Pro pour le codage agentique, Kimi K2.6 pour les agents de codage, et GLM-5.1 pour les workflows d’outils longue durée – autant d’options qui concurrencent directement Llama 4.

Enfin, la sécurité n’est pas à négliger : une étude de juillet 2026 (arXiv 2607.00333) a montré que cinq frameworks d’agents IA open source pour Android, dont AppAgent et Mobile-Agent-v3, peuvent être détournés par du texte invisible à l’écran pour exécuter des commandes arbitraires. Si vous déployez des agents basés sur Llama 4 ou d’autres modèles, vérifiez la robustesse de votre couche d’orchestration.

Sources

Source : aifirstfounders.com
Source : singularitymoments.com
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *