Magazine LLM Opensource · 17 September 2026Solar Open 2, six semaines après : le pari agentique d’Upstage face à GLM-5.3, Muse Glimmer et Hy4
Le 23 juillet 2026, Upstage dévoilait Solar Open 2, un LLM open source de 250 milliards de paramètres en architecture Mixture of Experts, spécifiquement conçu pour les tâches d’agents AI. Avec un contexte d’un million de tokens, seulement 15 milliards de paramètres activés par inférence et une licence dérivée d’Apache 2.0 autorisant l’usage commercial, ce modèle promettait de combler une lacune cruciale : la fiabilité dans la planification, l’utilisation d’outils et le raisonnement multi-étapes, tout en restant déployable sur seulement deux GPU H200. Mais que vaut vraiment ce modèle face à une concurrence qui s’est considérablement densifiée depuis — Meta a publié Muse Glimmer le 14 août, Z.ai a enchaîné avec GLM-5.3, et Tencent vient de lâcher Hy4 en preview début septembre ? Plongée dans une sortie qui pourrait redéfinir — ou non — la démocratisation des agents IA open source.
L’agent IA open source a-t-il trouvé son moteur ? Upstage entre en scène
Depuis l’explosion des LLM en 2023, le monde open source a vu émerger des modèles généralistes impressionnants : les séries DeepSeek, Qwen, Mistral, Llama, et plus récemment GLM-5.3 de Z.ai, Kimi K3 de Moonshot AI ou encore Hy4 de Tencent. Pourtant, un domaine restait en retrait : la capacité à fonctionner comme des agents autonomes capables de planifier des tâches complexes, d’utiliser des outils externes (API, bases de données, code) et d’enchaîner des raisonnements multi-étapes sans perdre le fil. Les modèles existants, bien que performants sur des benchmarks classiques (MMLU, GSM8K), montraient des limites flagrantes dès qu’il s’agissait d’interagir avec un environnement dynamique sur plusieurs tours.
C’est dans ce contexte qu’Upstage, une entreprise sud-coréenne fondée par d’anciens chercheurs de Naver et Kakao, a dévoilé Solar Open 2 le 23 juillet 2026, selon un article du Seoul Economic Daily et confirmé par le blog officiel d’Upstage. Le modèle est présenté comme « le premier LLM open source taillé pour les agents AI » et s’inscrit dans le cadre du projet gouvernemental sud-coréen « sovereign AI foundation model », dont Upstage est l’organisation pilote. L’ambition est claire : offrir aux développeurs un moteur agentique open source, capable de rivaliser avec les solutions propriétaires comme GPT-5.4 ou Claude 4.6, mais en restant libre et modifiable.
Pourquoi Upstage ? L’entreprise n’est pas une inconnue : elle a déjà publié Solar Open en janvier 2026, un modèle qui a servi de base. Avec Solar Open 2, elle passe à l’échelle supérieure en misant sur une architecture Mixture of Experts (MoE) de 250 milliards de paramètres, mais en n’en activant que 15 milliards par inférence — un ratio d’activation de seulement 6 %, ce qui permet de réduire drastiquement les besoins en calcul. Le modèle supporte trois langues : anglais, coréen et japonais, ce qui reflète l’ancrage asiatique d’Upstage mais limite son usage global.
Le problème que Solar Open 2 prétend résoudre est bien réel : les LLM généralistes, même les plus récents comme DeepSeek V4 Pro (1,6 trillion de paramètres MoE) ou Qwen3.8-Max (2,4T, annoncé début août 2026), peinent à suivre des instructions complexes dans un contexte agentique. Par exemple, un agent doit pouvoir appeler une API météo, analyser le résultat, puis décider d’envoyer un email — tout en gérant les erreurs et en conservant le contexte. Les benchmarks comme IFBench (instruction following), MCP-Atlas (tool calling), APEX-Agents (évaluation agentique complète) ou Ko-GDPval (tâches industrielles coréennes) mesurent précisément ces capacités, et les scores des modèles open source y sont souvent inférieurs à ceux des modèles propriétaires. Solar Open 2 veut inverser la tendance.
250B de raisonnement, 15B activés : plongée dans l’architecture MoE de Solar Open 2
Le modèle est hébergé sur Hugging Face sous le nom upstage/Solar-Open2-250B. Les tags indiquent clairement : solar_open2, Mixture of Experts, English, Korean, Japanese. Un rapport technique a été publié sur arXiv (2607.20062) le 23 juillet 2026, fournissant des détails supplémentaires. Voici ce que l’on sait désormais avec certitude :
- Architecture : Mixture of Experts (MoE). Dans un MoE, seuls certains sous-modèles (experts) sont activés à chaque token, ce qui permet d’atteindre une grande capacité totale (250B) tout en maintenant un coût d’inférence raisonnable. Solar Open 2 active seulement 15 milliards de paramètres par inférence, soit un ratio d’activation de 6 %. C’est l’un des plus efficaces du marché : DeepSeek V4 Pro active environ 49B sur 1,6T (3 %), Mixtral 8x22B active ~39B sur 141B (27,6 %). Solar Open 2 se positionne donc comme un modèle très efficient.
- Contexte : jusqu’à 1 million de tokens, obtenu grâce à une attention hybride qui entrelace une couche d’attention softmax classique toutes les trois couches d’attention linéaire. C’est un atout majeur pour les tâches agentiques qui nécessitent de conserver un historique long (conversations, code, logs). À titre de comparaison, DeepSeek V4 Pro offre 128K, Qwen3.8-Max 1M (mais avec 2,4T paramètres), Kimi K3 1 million (avec 2,8T paramètres), et le récent Hy4 de Tencent pousse à 1M+ avec 770B. Solar Open 2 rejoint donc le club très fermé des modèles à très long contexte avec un ratio efficacité/taille remarquable.
- Déploiement : avec quantification, le modèle peut tourner sur deux GPU NVIDIA H200 (80 Go chacun). Sans quantification, il nécessite probablement 4 à 8 GPU. Le CEO Kim Sung-hun a déclaré : « Alors que certains modèles récents nécessitent 16 GPU B200, Solar Open 2 est conçu pour fonctionner avec seulement deux. » C’est un argument fort pour les entreprises souhaitant déployer en local.
- Langues : anglais, coréen, japonais. Pas de support natif pour le français, l’espagnol, l’allemand, etc. Cela limite son utilisation pour des agents multilingues, contrairement à Qwen3.6 (Apache 2.0) qui excelle en RAG multilingue et supporte plus de 200 langues et dialectes dans sa version 3.5.
- Licence : la licence est désormais connue. Il s’agit de la Upstage Solar License, une licence dérivée d’Apache 2.0 qui permet l’utilisation commerciale et le développement de dérivés fine-tunés. C’est un point crucial pour les entreprises : elles peuvent intégrer Solar Open 2 dans leurs produits sans restriction majeure, et même créer leurs propres versions fine-tunées propriétaires.
Méthode d’entraînement innovante : la Multi-teacher On-Policy Distillation (MOPD)
L’un des aspects les plus intéressants de Solar Open 2 est sa méthode d’entraînement, détaillée dans le rapport technique. Plutôt que d’entraîner un modèle généraliste puis de l’évaluer sur des tâches agentiques, Upstage a inversé le processus :
- Douze spécialistes de domaine ont été entraînés sur des scénarios agentiques ciblés : tool calling, codage, flux de travail sur documents bureautiques, raisonnement multi-étapes.
- Ces spécialistes ont ensuite été consolidés en un seul modèle via la Multi-teacher On-Policy Distillation (MOPD), une technique de distillation où le modèle final apprend des politiques de plusieurs enseignants en conditions réelles (on-policy).
Cette approche explique pourquoi Solar Open 2 excelle sur les benchmarks agentiques : il a été conçu dès le départ pour ce type de tâches, et non pas adapté après coup.
Comparaison avec les architectures concurrentes (mise à jour septembre 2026) :
| Modèle | Paramètres totaux | Architecture | Paramètres activés | Contexte max | Licence | Langues |
|---|---|---|---|---|---|---|
| Solar Open 2 | 250B | MoE | 15B | 1M | Upstage Solar (dérivée Apache 2.0) | EN, KO, JA |
| DeepSeek V4 Pro | 1,6T | MoE | ~49B | 128K | Proche MIT | Multi |
| DeepSeek V4 Flash | ~200B ? | MoE | ~15B ? | 128K | Proche MIT | Multi |
| Qwen3.8-Max | 2,4T | MoE | Non précisé | 1M | Poids ouverts (annoncé) | Multi |
| Qwen3.6 | ~72B (dense) ou MoE ? | Dense/MoE | Variable | 128K | Apache 2.0 | Multi |
| Kimi K3 | 2,8T | MoE (896 experts) | Non précisé | 1M | Personnalisée (usage commercial possible) | Multi |
| GLM-5.3 | 753B | MoE | Non précisé | 1M | MIT | Multi |
| GLM-5.1 | 744B | MoE | Non précisé | 131K | MIT | Multi |
| GLM-4.5-Air | 106B | MoE | 12B | 131K | MIT | Multi |
| Muse Glimmer | 30B | Dense | 30B | 128K ? | Apache 2.0 | Multi |
| Hy4 (Tencent) | 770B | MoE | 49B | 1M+ | Open source (détails à confirmer) | Multi |
| MiniMax-01 | 456B | MoE (Lightning Attention) | Non précisé | 4M | Poids ouverts | Multi |
| Mixtral 8x22B | 141B | MoE | ~39B | 64K | Apache 2.0 | Multi |
Sources : Hugging Face, communiqués officiels, Novita AI Guide 2026, LightXtreme VPN, SiliconFlow, arXiv 2607.20062, Enera, Techgenyz, Eigent.
Le choix du MoE avec un ratio d’activation très bas (6 %) est judicieux : il permet d’atteindre une grande capacité sans exploser les coûts d’inférence. Le contexte d’un million de tokens est un différenciateur clé face à DeepSeek V4 Pro (128K) et Qwen3.6 (128K). Seuls Kimi K3, Qwen3.8-Max, GLM-5.3 et Hy4 offrent un contexte similaire, mais avec des modèles bien plus lourds (2,8T, 2,4T, 753B et 770B respectivement). MiniMax-01 pousse même le contexte à 4 millions de tokens, mais avec 456B de paramètres et une architecture Lightning Attention spécifique.
APEX-Agents 16,6, Ko-GDPval 86,8 : les scores chiffrés de Solar Open 2
Upstage a bien publié des résultats de benchmarks chiffrés, et des analyses indépendantes commencent à émerger. Voici les données compilées à partir des sources OpenSourceForU, Sedaily, Upstage blog et Enera :
- APEX-Agents (évaluation agentique complète) : 16,6 – le score le plus élevé de sa catégorie, devant DeepSeek-V4-Flash (13,4) et MiMo-V2.5 (13,2).
- Ko-GDPval (benchmark coréen pour tâches industrielles) : 86,8, essentiellement à égalité avec DeepSeek-V4-Pro (86,9), un modèle de 1,6 trillion de paramètres plus de six fois plus gros.
- IFBench (instruction following) : Solar Open 2 surpasse DeepSeek V4 Flash et Mistral Medium 3.5.
- MCP-Atlas (tool calling) : idem, meilleur que V4 Flash et Mistral Medium 3.5.
- MMLU-Pro (connaissances générales) : meilleur que V4 Flash et Mistral Medium 3.5.
- LiveCodeBench (codage) : meilleur que V4 Flash et Mistral Medium 3.5.
- Moyenne des benchmarks coréens : supérieure à GPT-5.4 mini et Claude Haiku 4.5.
Ces résultats sont impressionnants, mais il faut les prendre avec précaution : ils sont fournis par Upstage lui-même. Des benchmarks indépendants (par exemple sur la LM Arena ou Artificial Analysis) n’ont pas encore été publiés à la date de cet article. Le rapport technique arXiv (2607.20062) fournit néanmoins des détails méthodologiques sur les conditions d’évaluation.
Comparaison avec les concurrents sur les benchmarks agentiques :
| Benchmark | Solar Open 2 | DeepSeek V4 Flash | Mistral Medium 3.5 | Cohere Command A+ | GPT-5.4 mini | Claude Haiku 4.5 |
|---|---|---|---|---|---|---|
| APEX-Agents | 16,6 | 13,4 | N/A | N/A | N/A | N/A |
| Ko-GDPval | 86,8 | Comparable à V4 Pro (86,9) | N/A | N/A | Inférieur | Inférieur |
| IFBench | Supérieur | Inférieur | Inférieur | N/A | N/A | N/A |
| MCP-Atlas | Supérieur | Inférieur | Inférieur | N/A | N/A | N/A |
| MMLU-Pro | Supérieur | Inférieur | Inférieur | N/A | N/A | N/A |
| LiveCodeBench | Supérieur | Inférieur | Inférieur | N/A | N/A | N/A |
Sources : Upstage, Sedaily, OpenSourceForU, Enera.
À noter que DeepSeek V4 Flash, souvent cité comme concurrent direct, a depuis été rejoint par des modèles plus récents. GLM-5.3, sorti le 14 août 2026, affiche des scores impressionnants sur le codage agentique : Terminal-Bench 3.0 à 28,3 % (contre 4,6 % pour GLM-5.2, soit un gain de 6x par le seul post-entraînement) et CyberGym à 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol sur les tâches cybersécurité. Ces chiffres, rapportés par DataNorth et Cybersecurity News, montrent que la compétition sur le terrain agentique s’intensifie sérieusement.
Le paysage a changé en six semaines : GLM-5.3, Muse Glimmer, Hy4 et les autres
Depuis la sortie de Solar Open 2, le 23 juillet, le marché des LLM open source a connu une accélération spectaculaire. Trois événements majeurs redessinent la carte :

GLM-5.3 : Z.ai frappe fort sur le codage et la cybersécurité
Le 14 août 2026, Z.ai (ex-Zhipu AI) a publié GLM-5.3, un modèle MoE de 753 milliards de paramètres sous licence MIT. Particularité remarquable : cette version ne contient aucun nouveau paramètre — elle réutilise la base de GLM-5.2 (743B) et n’apporte que du post-entraînement. Pourtant, les gains sont spectaculaires : Terminal-Bench 3.0 passe de 4,6 % à 28,3 %, et le modèle s’impose en tête du benchmark cybersécurité CyberGym avec 84,5 %, devant Claude Sonnet 5 et GPT-5.6 Sol. Z.ai propose également un programme d’audit gratuit, un signal fort sur la place que l’IA chinoise veut prendre en cybersécurité. Les poids sont annoncés comme « différés », mais l’accès API est immédiat via le Coding Plan. (SiliconANGLE, The Agent Report)
Muse Glimmer : Meta répond avec un modèle 30B on-device
Le même jour, Meta a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres à poids ouverts sous licence Apache 2.0. Conçu pour une exécution locale, il excelle dans le raisonnement multi-étapes et fonctionne sur un simple appareil. C’est une réponse directe à la tendance des modèles massifs : pour beaucoup de tâches agentiques du quotidien, un modèle compact et efficace peut suffire. (Context Studios)
Hy4 : Tencent entre dans la course avec 770B
Début septembre 2026, Tencent a open-sourcé Hy4 preview, un modèle de 770 milliards de paramètres avec 49B actifs et un contexte de 1M+ tokens, conçu autour du codage, de la productivité bureautique et de la recherche scientifique. Avec une API accessible et des poids ouverts, Hy4 vient directement concurrencer GLM-5.3 et DeepSeek V4 Pro sur le terrain du codage agentique. (Techgenyz, Gadget Pilipinas)
Ox Alpha : le mystère qui intrigue
Depuis le 20 août, un modèle de raisonnement gratuit sans éditeur connu tourne sur OpenRouter sous le nom Ox Alpha. Spécialisé dans le code et les agents autonomes, il impressionne les développeurs — certains soupçonnent un laboratoire chinois. Son fournisseur n’a pas révélé son identité, et le modèle restera accessible gratuitement jusqu’au 27 août. (Business Insider, OIA)
Qwen détrône Llama : le basculement structurel
Au-delà des sorties individuelles, le rapport State of AI 2026 de Runpod, publié en mars 2026, confirme un basculement majeur : Qwen d’Alibaba Cloud a officiellement dépassé Llama de Meta comme le LLM auto-hébergé le plus déployé au monde, sur une plateforme qui dessert plus de 500 000 développeurs dans 183 pays. Llama 4 affiche une adoption quasi nulle en production, et vLLM est devenu le standard de facto pour le serving, propulsant 40 % de tous les endpoints LLM. (Noqta)
Verdict : Solar Open 2, un pari pertinent mais déjà concurrencé
Six semaines après sa sortie, Solar Open 2 tient-il ses promesses ? Sur le papier, oui : son ratio efficacité/taille (250B totaux, 15B actifs) reste l’un des meilleurs du marché, son contexte d’un million de tokens est un atout réel pour les agents, et sa licence permissive facilite l’adoption en entreprise. Les scores annoncés sur APEX-Agents et Ko-GDPval sont solides, même s’ils restent à confirmer par des benchmarks indépendants.
Mais le paysage a radicalement changé depuis le 23 juillet. GLM-5.3 a démontré que le post-entraînement seul pouvait produire des gains spectaculaires sur le codage agentique, sans toucher aux paramètres. Muse Glimmer a montré qu’un modèle 30B pouvait suffire pour de nombreuses tâches on-device. Et Hy4 de Tencent, avec ses 770B et son contexte 1M+, vient directement concurrencer Solar Open 2 sur son terrain de prédilection — avec 49B actifs, certes plus que les 15B d’Upstage, mais avec une couverture linguistique et fonctionnelle plus large.
Le vrai différenciateur de Solar Open 2 reste son ancrage coréen et son intégration dans le projet « sovereign AI » sud-coréen. Pour les entreprises de la région, c’est un atout. Pour le reste du monde, la concurrence est désormais féroce : entre GLM-5.3 (MIT, 753B), Hy4 (770B, open source), Qwen3.8-Max (2,4T, poids ouverts) et MiniMax-01 (456B, 4M de contexte), les développeurs ont l’embarras du choix.
En septembre 2026, la guerre froide des modèles open source s’est intensifiée à un point tel qu’aucun acteur ne peut plus dominer seul. Solar Open 2 a ouvert une brèche importante — celle des agents IA open source efficaces et déployables — mais il devra compter avec des rivaux qui ont appris vite. Le pari d’Upstage est loin d’être perdu, mais il est désormais clairement disputé.
Sources

- Upstage blog — Solar Open 2
- Seoul Economic Daily — Upstage unveils Solar Open 2
- OpenSourceForU — Upstage releases open-source Solar Open 2
- Enera — Upstage Solar Open 2 agentic enterprise model
- arXiv 2607.20062 — Solar Open 2 technical report
- Novita AI Guide 2026
- SiliconFlow — Best open source LLM for agent workflow
- SiliconANGLE — Z.ai debuts GLM-5.3
- The Agent Report — GLM-5.3 tops open coding leaderboard
- DataNorth — Z.ai releases GLM-5.3
- Cybersecurity News — Z.ai unveils GLM-5.3
- Context Studios — Muse Glimmer
- Techgenyz — Hy4 preview 770B
- Gadget Pilipinas — Tencent Hy4
- Eigent — MiniMax-01 4M context
- Noqta — Qwen détrône Llama
- Business Insider — Ox Alpha
- OIA — Ox Alpha, ce qui est vérifié
- vLLM docs — Tool calling
Article recherché et rédigé automatiquement · Magazine Electrosens