Magazine LLM Opensource · 11 September 2026Magistral, un an après : le modèle de raisonnement de Mistral face à l’explosion de l’open source en 2026
En juin 2025, Mistral AI dévoilait Magistral, sa première famille de modèles de raisonnement open-weight, avec la promesse de rivaliser avec les meilleurs modèles propriétaires. Quinze mois plus tard, l’écosystème des LLM open source a été bouleversé par des géants comme Kimi K3 (2,8 billions de paramètres), DeepSeek V4 (1,6 trillion) ou Qwen3.8-Max (2,4 billions), tandis que Meta a lancé Muse Glimmer et que Z.ai a sorti GLM-5.3. Que reste-t-il de la promesse de Magistral ? Entre scores toujours solides sur AIME 2024, licence Apache 2.0 et déploiement local, ce modèle de 24 milliards de paramètres trouve-t-il encore sa place ? Décryptage et mise à jour.
Mistral frappe fort… puis le monde change
Mistral AI a toujours joué la carte de l’open-weight, de Mistral 7B à Mixtral 8x7B, puis Mistral Small 3. Mais avec Magistral, la start-up française visait un nouveau segment : le raisonnement avancé. Présenté le 10 juin 2025 (TechCrunch), Magistral se déclinait en deux versions : Magistral Small (24 milliards de paramètres, dense, sous licence Apache 2.0) et Magistral Medium (version entreprise, poids non divulgués, accessible via API et Le Chat). L’objectif : combler l’écart avec les modèles propriétaires de pointe, tout en restant ouvert.
Mais dès 2026, la concurrence s’est intensifiée de manière spectaculaire. Comme le détaille notre article « LLM open source : Hy4, GLM-5.3, Qwen3.8-Max — le paysage de septembre 2026 », le paysage a connu un séisme :
- Moonshot AI a publié Kimi K3 (2,8 billions de paramètres, poids ouverts) le 27 juillet 2026, présenté comme le plus grand modèle open source jamais développé. Notre analyse six mois après confirme que les poids complets (1,56 To) sont en ligne depuis le 26 juillet.
- DeepSeek a sorti DeepSeek V4 (1,6 trillion, licence MIT) le 24 avril 2026, avec une fenêtre de contexte d’un million de tokens, puis DeepSeek V4 Pro le 12 août 2026, marquant la fin de la période de prévisualisation et poursuivant la guerre des prix chinoise (Techbooky).
- Alibaba a dévoilé Qwen3.8-Max (2,4 billions de paramètres) le 3 août 2026, avec poids ouverts annoncés.
- Meta a publié Muse Glimmer le 12 août 2026, un modèle agentique multimodal de 30 milliards de paramètres sous licence Apache 2.0, conçu pour fonctionner localement sur PC et Mac (ITdaily, ContextStudios).
- Z.ai a lancé GLM-5.3 le 14 août 2026, un modèle MoE de 753 milliards de paramètres qui réutilise la base de GLM-5.2 sans nouveau paramètre, mais avec un post-entraînement massif (The Agent Report). Il s’impose en tête du benchmark cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol (Ayinedjimi).
- Tencent a ouvert Hy4 en preview le 8 septembre 2026, un modèle de 770 milliards de paramètres avec 49 milliards actifs et un contexte d’un million de tokens, orienté code, productivité bureautique et recherche scientifique (Gadgetpilipinas, Techgenyz).
- Google a peaufiné Gemini 3.x et lancé Gemma 4.
Dans ce contexte, Magistral Small (24B) peut sembler modeste. Pourtant, sa spécialisation dans le raisonnement et sa licence permissive lui confèrent une niche précieuse, notamment pour les déploiements locaux et les applications sensibles à la confidentialité. Comme le rappelait TechCrunch dès juin 2025, Magistral est « adapté à un large éventail de cas d’usage en entreprise, des calculs structurés à la logique programmatique, en passant par les arbres de décision et les systèmes à base de règles ».
« Magistral Small est conçu pour être exécuté localement sur un RTX 4090 ou un Mac avec 16-24 Go de RAM », rappelle la documentation d’Unsloth. Une promesse toujours d’actualité, alors que les modèles géants exigent des clusters de GPU.
Il faut aussi noter que Mistral a renforcé son partenariat avec Microsoft en juillet 2026, avec des déploiements cloud et hors ligne en Europe, ce qui élargit les canaux de distribution de ses modèles. Cette collaboration, non confirmée par des sources indépendantes, reste à surveiller.
24 milliards de paramètres et un raisonnement transparent : ce que l’on sait (et ce que l’on ignore) de l’architecture
Les détails techniques de Magistral restent partiels, mais plusieurs éléments sont confirmés par les sources officielles et les articles de presse.
Ce que l’on sait
| Caractéristique | Magistral Small | Magistral Medium |
|---|---|---|
| Paramètres | 24 milliards (dense, pas de MoE) | Non divulgué |
| Licence | Apache 2.0 | Propriétaire (API) |
| Benchmark AIME2024 (single) | 70,7 % | 73,6 % |
| AIME2024 (majority voting @64) | 83,3 % | 90 % |
| Support multilingue | 8 langues (anglais, français, espagnol, arabe, allemand, italien, russe, chinois simplifié) | Idem |
| Fonctionnalités | Raisonnement par chaîne de pensée (CoT) avec balises <thinking> |
Idem + Réponses Flash, mode réflexion |
Magistral Small est un modèle dense de 24B, contrairement à Mixtral qui utilisait un mélange d’experts. L’entraînement a été réalisé par apprentissage par renforcement (RL) à partir de Mistral Medium 3 pour la version Medium, tandis que Small a bénéficié de données « cold-start » issues de Medium. Le raisonnement est explicite : le modèle génère d’abord une réflexion interne entre balises <thinking>, puis produit la réponse finale. Une approche qui rappelle les modèles o1 d’OpenAI ou DeepSeek R1.
TechCrunch notait d’ailleurs que, comme les autres modèles de raisonnement (o3 d’OpenAI, Gemini 2.5 Pro de Google), Magistral « travaille les problèmes étape par étape pour une meilleure cohérence et fiabilité dans des domaines comme les mathématiques et la physique ».
Ce que l’on ignore
- Taille du contexte : la documentation d’Unsloth mentionne une fenêtre de 128k tokens pour Magistral-Small-2509 (mise à jour de septembre 2025 avec vision), mais précise que les performances se dégradent au-delà de 40k tokens. La version initiale de Magistral (annoncée en juin 2025) pourrait avoir des caractéristiques différentes.
- Type d’attention : rien n’est dit sur l’utilisation de GQA, sliding window ou autre mécanisme.
- Données d’entraînement : volume, nature, durée, cluster GPU – tout reste sous silence.
- Innovations par rapport à Mistral 7B ou Mixtral : Mistral n’a pas publié de comparatif architectural.
Mistral semble avoir fait le choix de la transparence sur les performances, mais pas sur les détails d’infrastructure. Une stratégie qui laisse la communauté sur sa faim.
AIME 2024 : le benchmark qui fait la différence – mais que valent les scores sans MMLU ni GSM8K ?
Le seul benchmark officiellement communiqué par Mistral est AIME 2024 (American Invitational Mathematics Examination), un test de raisonnement mathématique complexe. Les scores annoncés sont les suivants :
| Modèle | Score unique | Majority voting (@64) |
|---|---|---|
| Magistral Medium | 73,6 % | 90 % |
| Magistral Small | 70,7 % | 83,3 % |
Ces chiffres sont impressionnants : 90 % avec vote majoritaire place Magistral Medium au niveau des meilleurs modèles de raisonnement. Mais pourquoi Mistral a-t-il choisi uniquement AIME 2024 ? Plusieurs raisons possibles :
- Spécialisation : Magistral est un modèle de raisonnement, pas un généraliste. Les benchmarks classiques comme MMLU (culture générale), GSM8K (maths simples) ou HumanEval (code) ne reflètent pas sa force.
- Comparaison avantageuse : AIME 2024 est un benchmark difficile, où les modèles propriétaires comme GPT-4o ou Claude 3.5 obtiennent des scores autour de 50-60 % (selon des sources non officielles). En choisissant ce terrain, Mistral se positionne comme leader.
- Manque de données : peut-être que les performances sur d’autres benchmarks sont moins bonnes, et Mistral préfère mettre en avant son point fort.
« Aucun score sur MMLU, GSM8K, HumanEval ou HellaSwag n’est rapporté dans les sources fournies », confirme l’analyse des documents. Une absence qui interroge : un modèle de raisonnement doit aussi être évalué sur sa capacité à généraliser.
Depuis 2026, d’autres modèles open-weight ont publié des scores sur des benchmarks variés. Par exemple, DeepSeek V4 affiche des performances de premier plan sur MMLU-Pro et HumanEval, et Kimi K3 dépasse Claude Fable 5 sur Terminal-Bench. Le leaderboard BenchLM de juillet 2026 classe 95 modèles open-weight, et les modèles chinois dominent largement le haut du classement. GLM-5.3 a fait un bond spectaculaire sur Terminal-Bench 3.0, passant de 4,6 % à 28,3 % grâce au seul post-entraînement (DataNorth), et s’impose sur CyberGym avec 84,5 %. Magistral, lui, reste cantonné à AIME 2024 – un choix qui le distingue mais limite les comparaisons directes.
Il faut aussi noter qu’AIME a atteint un plafond : en 2026, trois modèles non nommés ont atteint 100 % sur AIME 2025, signe que ce benchmark sature. La pertinence d’AIME comme différenciateur diminue donc, même si les scores de Magistral datent de 2025.
Magistral face aux ténors : GPT-4o, Claude 3.5, Gemini 1.5 Pro – une comparaison en pointillé
Les sources ne fournissent aucune comparaison chiffrée directe entre Magistral et les modèles propriétaires. TechCrunch notait dès juin 2025 que, sur GPQA Diamond et AIME, Magistral Medium « sous-performe Gemini 2.5 Pro et Claude Opus 4 », et qu’il échoue à surpasser Gemini 2.5 Pro sur LiveCodeBench. Mistral se contente d’affirmer que Magistral Medium « rivalise avec les meilleurs modèles de raisonnement », sans citer de noms ni de scores.

Ce que l’on peut dire :
- Positionnement : Magistral est un modèle de raisonnement, pas un assistant généraliste. Il est optimisé pour les tâches multi-étapes, la logique et les mathématiques. GPT-4o et Claude 3.5 sont plus polyvalents.
- Réponses Flash : Mistral annonce des vitesses d’inférence jusqu’à 10× plus rapides que ChatGPT pour Magistral Medium. Une affirmation non vérifiée par un tiers indépendant.
- Mode réflexion : une fonctionnalité pour les conversations multi-tours, comparable au « mode réflexion » de certains modèles chinois.
En l’absence de benchmarks communs, il est impossible de dire si Magistral surpasse vraiment GPT-4o ou Claude 3.5. Le seul indicateur fiable est AIME 2024, mais cela ne suffit pas pour juger de la compétitivité globale.
Depuis juillet 2026, le leaderboard LLM Stats classe les modèles selon un score composite. Magistral n’y apparaît pas dans le top 15, dominé par des modèles propriétaires (OpenAI, Anthropic) et quelques open-weight comme GLM-5.2 (Zhipu AI, 753B, open source) ou Kimi K3 (Moonshot AI, 2,8T, poids ouverts). Le classement de juillet 2026 place Claude Fable 5 en tête (score AAI de 60), suivi de GPT-5.6, Kimi K3 et Gemini 3 Pro. Magistral Small, avec ses 24B, ne peut rivaliser en puissance brute, mais reste pertinent pour les usages locaux.
« Magistral Small est un modèle de 24B qui peut être exécuté localement, ce qui le rend attractif pour les développeurs soucieux de confidentialité. Mais ses performances en conditions réelles restent à démontrer. »
Apache 2.0 : une licence permissive qui change la donne – mais jusqu’où ?
Magistral Small est publié sous licence Apache 2.0, l’une des plus permissives du monde open-source. Cela signifie :
- Utilisation commerciale sans restriction
- Redistribution et modification
- Fine-tuning et distillation autorisés
- Pas de clause d’exclusion de responsabilité spécifique à l’IA
Cette licence contraste avec les modèles concurrents :
| Modèle | Licence | Restrictions |
|---|---|---|
| Magistral Small | Apache 2.0 | Aucune |
| Llama 4 (Meta) | Licence personnalisée | Restrictions pour les utilisateurs > 700M mensuels |
| Gemma 4 (Google) | Licence personnalisée | Interdiction d’utilisation pour certaines applications |
| Qwen3.8-Max (Alibaba) | Poids ouverts annoncés | Restrictions commerciales selon la version |
| DeepSeek V4 | MIT | Aucune (MIT) |
| Kimi K3 | Open weight | Restrictions d’usage commercial |
| Muse Glimmer (Meta) | Apache 2.0 | Aucune |
| GLM-5.3 (Z.ai) | Poids différés | Annoncés pour plus tard |
| Hy4 (Tencent) | Open source | Preview |
« Magistral Small est l’un des rares modèles de raisonnement open-weight de cette taille à être sous Apache 2.0 », souligne un article de cometapi. DeepSeek R1, par exemple, est sous MIT – également très permissif. La différence tient surtout à la stratégie : Mistral mise sur une licence ultra-permissive pour attirer les développeurs, tandis que DeepSeek combine MIT avec une version enterprise.
Cependant, Magistral Medium reste propriétaire. Mistral adopte donc une stratégie duale : un modèle open-weight pour la communauté, une version plus puissante pour les clients payants. Une approche similaire à celle de Meta avec Llama (open-weight mais licence personnalisée) ou de DeepSeek (MIT pour V4, mais pas pour tous).
Déploiement et usages : ce que Mistral annonce, ce que la communauté n’a pas encore testé
Magistral Small est disponible en téléchargement sur Hugging Face et peut être exécuté localement. Magistral Medium est accessible via l’API de Mistral et l’application Le Chat. Les fonctionnalités avancées incluent :

- Réponses Flash : inférence accélérée pour les requêtes simples.
- Mode réflexion : pour les conversations complexes nécessitant plusieurs étapes de raisonnement.
- Support multilingue : 8 langues (anglais, français, espagnol, arabe, allemand, italien, russe, chinois simplifié) – certaines sources mentionnent 24 langues pour la version 2509.
Ce qui manque
- Aucun cas d’usage concret documenté : pas de déploiement sur Azure, AWS, GCP, ni d’intégration SaaS. Cependant, le partenariat renforcé avec Microsoft (annoncé en juillet 2026) pourrait changer la donne, avec des déploiements cloud et hors ligne en Europe.
- Pas de fine-tuning validé : la communauté n’a pas encore publié de guide complet de fine-tuning pour Magistral, contrairement à d’autres modèles comme Qwen3.8-Max ou DeepSeek V4 Pro. Notre article sur le fine-tuning en 2026 ne mentionne d’ailleurs pas Magistral parmi les modèles recommandés, préférant Kimi K3, Qwen3.8-Max, DeepSeek V4 Pro, GLM-5.3, Hy4 et Muse Glimmer.
Le contexte de l’écosystème en septembre 2026
L’écosystème open source a connu des bouleversements majeurs depuis la sortie de Magistral. Notre article sur l’incident de sécurité Hugging Face rapporte qu’une intrusion coordonnée a été détectée le 16 juillet 2026, exécutée sans intervention humaine par une chaîne d’attaques. Cet incident a paradoxalement renforcé la riposte de l’open source chinois. Par ailleurs, la faille NemoClaw (août 2026) dans l’API Ollama permet un empoisonnement persistant des modèles LLM dans les environnements agents (Security Bez Tabu, LinkedIn). Ces événements rappellent que le déploiement local de modèles comme Magistral Small n’est pas exempt de risques de sécurité.
Enfin, le Ray Summit 2026 (25 août 2026) a mis en évidence une convergence structurelle : le RL post-entraînement impose désormais une infrastructure open source unifiée (TechTimes). Magistral, entraîné par RL, s’inscrit dans cette tendance, même si Mistral n’a pas publié ses outils d’entraînement.
Conclusion : une niche préservée, mais un leadership éclipsé
Quinze mois après sa sortie, Magistral Small conserve des atouts indéniables : une licence Apache 2.0, une taille adaptée au déploiement local, et des scores honorables sur AIME 2024. Mais le paysage a radicalement changé. Les géants chinois (DeepSeek, Qwen, Kimi, GLM, Hy4) dominent désormais les benchmarks, comme le détaille notre article « La fin des fossés défensifs » : en deux ans, l’avantage compétitif des modèles propriétaires s’est volatilisé, et l’open source a gagné la guerre des modèles.
Magistral n’est plus un leader, mais il reste un choix pertinent pour les développeurs qui privilégient la confidentialité, la permissivité de licence et la simplicité de déploiement. Comme le résume notre analyse du paysage de septembre 2026, le choix d’un modèle dépend désormais de critères précis : taille, licence, benchmarks ciblés, coût d’inférence. Sur ces critères, Magistral Small conserve une place – modeste, mais réelle – dans un écosystème où les modèles de 24B côtoient des titans de 2,8 billions de paramètres.
Sources

- TechCrunch – Mistral releases a pair of AI reasoning models (10 juin 2025)
- Magazine – LLM open source : Hy4, GLM-5.3, Qwen3.8-Max — le paysage de septembre 2026
- Magazine – La fin des fossés défensifs : quand l’open source a gagné la guerre des modèles
- Magazine – Quand les IA d’OpenAI s’échappent : le piratage de Hugging Face
- Magazine – DeepSeek V4, Kimi K3, GLM-5.3, Hy4 : l’été 2026 a redéfini la hiérarchie des LLM open source
- Magazine – Fine-tuning des LLM open source en 2026
- Magazine – Kimi K3 : le titan open source de Moonshot AI à l’épreuve des faits
- Gadgetpilipinas – Tencent Releases Open-Source Hy4 LLM Preview (8 septembre 2026)
- Techgenyz – Hy4 preview: 770B Remarkable Open Model Launch (28 août 2026)
- Security Bez Tabu – NemoClaw i OpenClaw (26 août 2026)
- LinkedIn – NVIDIA NemoClaw AI Agent Security Flaw Exposed (26 août 2026)
- TechTimes – Ray Summit 2026: RL Post-Training Forces Open-Source AI Infrastructure to Converge (25 août 2026)
- IT Social – Qui est derrière Ox Alpha, le modèle furtif d’OpenRouter ? (24 août 2026)
- OIA – Ox Alpha, le modèle IA « stealth » qui intrigue (24 août 2026)
- Business Insider – A mysterious free AI model is impressing developers (22 août 2026)
- Journal du Web – GLM-5.3 : Z.ai lâche son modèle open-weight (19 août 2026)
- Ayinedjimi – GLM-5.3 : Z.AI domine le benchmark cybersécurité CyberGym (19 août 2026)
- DataNorth – Z.ai releases GLM-5.3 for coding and cyber work (17 août 2026)
- The Agent Report – GLM-5.3: Z.ai Tops the Open Coding Leaderboard on Post-Training Alone (14 août 2026)
- ContextStudios – Muse Glimmer : Le modèle agentique ouvert de 30B de Meta (14 août 2026)
- ITdaily – Meta lance Muse Glimmer (12 août 2026)
- Techbooky – DeepSeek V4-Pro Shows China’s AI Price War Is Not Slowing (13 août 2026)
Article recherché et rédigé automatiquement · Magazine Electrosens