NVIDIA DGX Spark · 6 September 2026DGX Spark en septembre 2026 : les LLM open source qui tournent vraiment sur GB10, le fine-tuning BF16 et les clusters multi-nœuds
Le NVIDIA DGX Spark, avec son SoC GB10 Grace Blackwell et ses 128 Go de mémoire unifiée, promettait de démocratiser l’inférence et le fine-tuning de grands modèles de langage en local. Un an et demi après son lancement, les mises à jour logicielles de l’été 2026, l’arrivée de modèles open-weight spécialement optimisés (DeepSeek V4 Flash 0731, Ant Ling-3.0-Flash, Poolside Laguna S 2.1) et les retours de la communauté permettent enfin de dresser un bilan honnête : quels modèles tiennent vraiment leurs promesses, à quelles vitesses, et comment en tirer le meilleur parti — en solo comme en cluster.
La révolution silencieuse du calcul local : pourquoi 2026 est l’année du LLM open-source sur DGX Spark
L’année 2026 marque un tournant dans la démocratisation des grands modèles de langage. Alors que les géants du cloud continuent de proposer des API coûteuses et parfois opaques, une vague de modèles open-source de haute qualité a envahi le paysage. Mistral Small 4 (119B), DeepSeek V4 Flash 0731, GLM 5.2, Kimi K2.7, Qwen 3.6, Ant Ling-3.0-Flash, Poolside Laguna S 2.1… les noms s’accumulent, et avec eux, la promesse d’une IA souveraine, exécutée sur son propre matériel.
Le NVIDIA DGX Spark incarne cette ambition. Annoncé comme une station de travail personnelle capable de faire tourner des modèles à 200 milliards de paramètres, il s’adresse aux développeurs, chercheurs et PME qui veulent contrôler leurs données, réduire leurs coûts et expérimenter sans limite. Mais entre les communiqués officiels et la réalité des benchmarks, il y a un fossé que nous allons explorer.
Les enjeux sont clairs : performance, confidentialité, coût. Un LLM open-source bien choisi, correctement quantifié et déployé sur un DGX Spark peut rivaliser avec les services cloud pour de nombreuses tâches, tout en garantissant que les données ne quittent jamais la machine. Encore faut-il savoir quel modèle choisir, comment le configurer et à quels résultats s’attendre.
DGX Spark : la fiche technique qui change la donne
Le DGX Spark repose sur le superchip NVIDIA GB10 Grace Blackwell, combinant un CPU à 20 cœurs ARM Neoverse V2 et un GPU Blackwell d’environ 6 144 cœurs CUDA avec support FP4. Sa mémoire unifiée LPDDR5X de 128 Go, offrant une bande passante de 273 Go/s, est le véritable atout : elle permet de charger des modèles bien plus volumineux que ce que permettrait une carte graphique classique, limitée à 16 ou 24 Go de VRAM. Le tout dans un format compact de 150×150×50,5 mm pour 1,2 kg, avec une consommation d’environ 170 W.
| Caractéristique | DGX Spark | RTX 4080 (référence) | Mac Studio (M4 Ultra) |
|---|---|---|---|
| Mémoire unifiée | 128 Go LPDDR5X (273 Go/s) | 16 Go GDDR6X | 64 Go (ou 128 Go) unifiée |
| Capacité max. modèles | 200 Mds paramètres (NVFP4) | ~13 Mds (quantifié) | ~30–70 Mds (selon RAM) |
| Prix (2026) | 4 699 $ (NVIDIA) | ~1 200 $ (carte seule) | ~4 000–7 000 $ |
| TDP | ~170 W | 320 W | ~60 W (selon config) |
| Format | Mini-PC (1,2 kg) | Carte graphique | Tour ou mini |
Le prix a été révisé à 4 699 $ en avril 2026, contre 3 999 $ initialement, en raison de contraintes d’approvisionnement mémoire. Un investissement conséquent, mais qui inclut tout le nécessaire : CPU, GPU, mémoire, stockage et alimentation. Il faut toutefois noter que des clones licenciés existent : l’ASUS Ascent GX10 est généralement 500 à 1 000 $ moins cher, avec une qualité de finition perçue supérieure, et d’autres OEM (MSI EdgeXpert, Acer DGX) proposent des variantes fonctionnellement identiques (même puce GB10). Le verdict communautaire de mai 2026 reste néanmoins partagé : 70 à 80 % des acheteurs de mini-PC IA préfèrent le AMD Ryzen AI Halo (Strix Halo) pour son rapport performance/prix, mais le DGX Spark conserve l’avantage décisif de l’écosystème CUDA complet.
Le guide de configuration outilsia.fr précise que la machine tourne sous DGX OS (basé sur Ubuntu Server 24.04 ARM), avec CUDA 13.0, cuDNN, NCCL, Docker et le NVIDIA Container Toolkit préinstallés — on peut lancer son premier LLM en quelques minutes après le premier démarrage. Point important : le DGX Spark n’a pas de connecteur HDMI/DisplayPort utilisable ; c’est une machine headless conçue pour être pilotée via SSH ou interface web depuis une autre machine.
NVIDIA a également annoncé une collaboration avec llama.cpp, apportant une optimisation spécifique qui améliorerait les performances d’exécution des modèles de pointe de 35 % en moyenne. Le format NVFP4 (NVIDIA Floating Point 4-bit) permet de compresser les modèles jusqu’à 70 % sans perte d’intelligence, selon la communication officielle. Ces chiffres, bien que non vérifiés de manière indépendante, laissent entrevoir un potentiel énorme pour l’inférence locale.
Les mises à jour logicielles de l’été 2026 ont apporté une gestion mémoire améliorée, une meilleure prise en charge des modèles MoE et des optimisations pour les clusters multi-nœuds. NVIDIA a également publié le 21 juillet 2026 une preview de CUDA 13.4 pour Windows on Arm, ouvrant la voie aux futures machines RTX Spark. Ce kit natif Arm64 permettra aux développeurs de préparer leurs applications pour la plateforme RTX Spark, dont les deux variantes du processeur N1X ont été confirmées par les pilotes. ASUS et MSI lanceront leurs PC portables RTX Spark dès l’automne 2026, avant Acer et Gigabyte dont les mini-PC sont attendus début 2027.
Les modèles stars de 2026 : Mistral Small 4, DeepSeek V4 Flash 0731, GLM 5.2, Kimi K2.7, Ant Ling-3.0-Flash et leurs concurrents
Le paysage des LLM open-source en 2026 est dominé par des architectures variées : transformeurs denses, mixture-of-experts (MoE), modèles quantifiés nativement. Voici un tableau comparatif mis à jour avec les informations des sources web récentes.
| Modèle | Architecture | Paramètres totaux | Paramètres actifs | Quantification supportée | Particularité |
|---|---|---|---|---|---|
| Mistral Small 4 | MoE (128 experts, 4 actifs) | 119 Mds | 6,5 Mds | NVFP4 (natif) | Multilingue, raisonnement configurable, contexte 256k, licence Apache 2.0 |
| DeepSeek V4 Flash 0731 | MoE optimisé | 284 Mds | 13 Mds | NVFP4, MXFP4, GGUF (Q8, Q4) | Variante rapide pour DGX Spark, très bon en agentique, optimisé pour cluster 2 Spark |
| GLM 5.2 | Transformer dense | 744 Mds | – | BF16, FP8, NVFP4 | Qualité maximale, raisonnement, code |
| Kimi K2.7 | MoE | 1000 Mds | ~30 Mds | MXFP4 | Agentique, appels d’outils, MCP |
| Ant Ling-3.0-Flash | MoE (attention hybride KDA/MLA) | 124 Mds | 5 Mds | NVFP4, FP8 | Contexte 256K extensible à 1M, débit estimé 15-20 tok/s sur Spark |
| Poolside Laguna S 2.1 | MoM (256 experts) | 118 Mds | ~? | FP8, BF16 | Modèle de codage open-weight, rivalise avec des modèles 10× plus gros |
| Qwen 3.6 | Transformer dense | 4 à 31 Mds | – | BF16, FP8, GGUF | Compact, une seule carte, idéal TPE |
| Gemma 4 | Transformer dense | 4 à 31 Mds | – | BF16, FP8, GGUF | Compact, une seule carte |
| Llama 3.1 8B | Transformer dense | 8 Mds | – | BF16, FP8, GGUF | Référence pour les petits modèles |
| Mistral 7B v0.3 | Transformer dense | 7 Mds | – | BF16, FP8, GGUF | Très rapide sur DGX Spark |
Mistral Small 4 est un modèle hybride publié par Mistral AI en mars 2026. Il unifie en un seul point de contrôle trois familles de modèles — Instruct, Reasoning (anciennement Magistral) et Devstral — offrant ainsi une polyvalence exceptionnelle pour un usage général. Son architecture MoE le rend particulièrement efficace : 119 milliards de paramètres au total, mais seulement 6,5 milliards actifs par token, avec 128 experts dont 4 actifs à chaque inférence. Il accepte texte et images en entrée, et sa fenêtre de contexte de 256k tokens le rend adapté aux tâches longues. La version quantifiée en NVFP4, créée en collaboration avec les équipes vLLM et Red Hat via llm-compressor, réduit significativement la mémoire requise : les poids occupent environ 66 Go, ce qui tient parfaitement dans les 128 Go du DGX Spark.
DeepSeek V4 Flash 0731 est la dernière variante optimisée de DeepSeek V4, conçue pour l’inférence rapide sur DGX Spark. Avec 284 milliards de paramètres totaux et seulement 13 milliards actifs, il délivre des performances agentiques de niveau frontière, soit 10× moins de paramètres actifs que Claude Opus, selon flowtivity.ai. Son dépôt GitHub est Mjxkill/deepseek-v4-flash-2x-dgx-spark. Les forums NVIDIA rapportent qu’en configuration double DGX Spark, le modèle atteint 30 tok/s par défaut, et qu’un changement de configuration permet de restaurer un taux d’acceptation élevé. La version GGUF Q8 (UD-Q8_K_XL) pèse 162 Go, seulement 7 Go de plus que la Q4 (UD-Q4_K_XL), ce qui permet une exécution en précision quasi complète sur un cluster de deux Spark. Une reproduction indépendante sur un seul Spark est documentée dans le projet emiluzelac/deepseek-v4-flash-0731-on-one-dgx-spark.
GLM 5.2 domine l’indice d’intelligence des modèles ouverts selon le comparatif 2026 de QDNA. Avec 744 milliards de paramètres, il nécessite une quantification poussée pour tenir sur un seul DGX Spark, mais reste un choix de premier ordre pour les organisations exigeantes.
Kimi K2.7 est un modèle orienté agentique, avec une forte capacité d’appels d’outils et de protocole MCP. Il est particulièrement adapté au développement d’agents autonomes.
Ant Ling-3.0-Flash (124B-A5B) est un modèle MoE récent d’Ant Group, sorti le 23 juillet 2026, avec une architecture d’attention hybride (KDA et MLA dans un ratio 5:1). Seulement 5 milliards de paramètres actifs par token, ce qui le rend très efficace. Son contexte natif de 256K tokens est extensible à 1M. Les premiers tests informels sur DGX Spark rapportent un débit de 15 à 20 tokens par seconde, comme le mentionne le forum NVIDIA.
Poolside Laguna S 2.1 est un modèle de codage open-weight de 118 milliards de paramètres, utilisant une architecture MoM (Mixture of MoE) avec 256 experts. Publié le 23 juillet 2026, il est présenté comme le modèle ouvert le plus puissant de l’Occident pour le codage, rivalisant avec des modèles dix fois plus gros. Les analyses d’ai-manual.ru détaillent son architecture : token-choice router, softplus gating et 256 experts.
Qwen 3.6 et Gemma 4 sont des modèles compacts (4 à 31 milliards de paramètres) parfaits pour les TPE et l’inférence en périphérie. Ils tournent sans problème sur un seul DGX Spark avec des quantifications légères.
Le choix entre dense et MoE dépend de la tâche. Les modèles denses (Llama, Mistral 7B, Qwen 3.6) sont plus simples à déployer et souvent plus rapides pour des contextes courts. Les MoE (Mistral Small 4, DeepSeek V4 Flash 0731, GLM 5.2, Kimi K2.7, Ant Ling-3.0-Flash) offrent un meilleur rapport performance/paramètres, mais nécessitent une quantification soignée pour tenir dans 128 Go.
Benchmarks réels : vitesse d’inférence, consommation mémoire et qualité sur DGX Spark
Les chiffres disponibles proviennent de sources tierces : explainx.ai, franksworld.com, glukhov.org, haruni.net, dev.to, et des articles du magazine. Le benchmark de référence DevToolStack a passé 17 LLM au crible sur le GB10.

Performances d’inférence (tok/s) sur DGX Spark
| Modèle | Outil | Prompt (tok/s) | Génération (tok/s) |
|---|---|---|---|
| GPT-OSS 120B (NVFP4) | Ollama | 1159 | 41 |
| GPT-OSS 120B (MXFP4) | Ollama | – | 35–80+ (selon contexte) |
| Mistral Small 4 119B (NVFP4) | vLLM | – | ~40 (estimation) |
| DeepSeek V4 Flash 0731 (1 Spark) | moteur CUDA custom | 1000 | 59 (multi-agent serving) |
| DeepSeek V4 Flash 0731 (2 Spark, NVFP4) | Ollama | 1250 | 30 par défaut, améliorable |
| Llama 3.1 8B | vLLM | – | 45,2 |
| Llama 3.1 8B | Ollama | – | 38,7 |
| Mistral 7B v0.3 | vLLM | – | 52,8 |
| Mistral 7B v0.3 | Ollama | – | 45,3 |
| CodeLlama 13B | vLLM | – | 28,4 |
| Qwen 2.5 7B | vLLM | – | 49,1 |
| Modèle 1,5B (non nommé) | Ollama (NVFP4) | – | 61,73 |
| Modèle 14B (NVFP4) | Ollama | – | 20,19 |
| Ant Ling-3.0-Flash 124B (estimation) | – | – | 15–20 |
À titre de comparaison, le même GPT-OSS 120b sur RTX 4080 (16 Go VRAM, déchargement CPU à 78 %) atteint 969 tok/s en prompt et 12,45 tok/s en génération. Sur Mac Studio, la génération chute de 34 à 6 tok/s avec l’augmentation de la taille du contexte. Le DGX Spark domine donc nettement, grâce à sa mémoire unifiée et à l’optimisation NVFP4. DeepSeek V4 Flash 0731, en particulier, tire parti du cluster à deux Spark pour atteindre des vitesses record, comme indiqué dans le README officiel et confirmé par les retours du forum NVIDIA. Le blog officiel vLLM du 1er juin 2026 apporte des précisions importantes sur l’architecture : le Spark utilise une mémoire unifiée qui permet de charger des modèles bien plus volumineux que ce que permettrait une carte graphique classique.
Fine-tuning : LoRA, QLoRA et full fine-tune sur un seul Spark
L’un des atouts majeurs du DGX Spark est sa capacité à fine-tuner des modèles de grande taille en local, sans passer par le cloud. NVIDIA fournit un pipeline complet via NeMo AutoModel, avec des recettes pré-configurées pour ARM64 et l’architecture Blackwell.
Le guide officiel détaille les étapes : vérification de l’installation CUDA (nvcc –version), accès GPU (nvidia-smi), puis lancement d’un conteneur Docker nvcr.io/nvidia/nemo-automodel:26.02 avec les flags --gpus all et --ulimit memlock=-1. Les recettes d’entraînement se trouvent dans /opt/Automodel/examples/llm_finetune/ et couvrent le full fine-tuning (SFT), le PEFT avec LoRA et QLoRA.
La communauté a confirmé des résultats impressionnants : le fine-tuning d’un modèle 70B en FP16 sans quantification est possible sur un seul Spark, grâce aux 128 Go de mémoire unifiée. C’est la « killer feature » mise en avant par le guide outilsia.fr : là où une RTX 4090 24 Go ne peut fine-tuner qu’en QLoRA 4-bit, le Spark permet un full fine-tune en précision native pour des modèles jusqu’à 70B.
Les frameworks qui fonctionnent : NeMo (officiel), Unsloth, LLaMA Factory, et les outils PEFT/TRL classiques. Pour les modèles plus petits (7B-14B), le fine-tuning complet est trivial. Pour les très gros modèles (200B+), le partitionnement des poids avec NeMo, vLLM et TensorRT-LLM permet de répartir la charge sur plusieurs Spark en cluster.
Clusters multi-nœuds : de 200 à 700 milliards de paramètres
Le clustering de DGX Spark est devenu une réalité en 2026. NVIDIA a publié des optimisations pour les clusters multi-nœuds, et la communauté a documenté des configurations à deux et quatre nœuds. Le câblage utilise des liens 10GbE (1,25 Go/s théoriques) ou 100 GbE selon les configurations, avec des câbles approuvés comme l’Amphenol NJAAKK-N911 (400 mm, 32 AWG).

DeepSeek V4 Flash 0731 est l’exemple le plus documenté : en configuration double Spark, il atteint 30 tok/s par défaut, et un changement de configuration permet de restaurer un taux d’acceptation élevé. Le partitionnement des poids avec NeMo permet de faire tourner des modèles jusqu’à 700 milliards de paramètres sur un cluster de quatre Spark.
Pour la gestion de flotte, Progress Software a annoncé le 30 juillet 2026 la compatibilité de sa plateforme Chef Enterprise Management avec le DGX Spark, à 189 $ par an et par système. Cette intégration agentless (protocole JSON) répond au défi de l’échelle pour les entreprises qui déploient des dizaines de Spark.
Perspectives : RTX Spark et l’écosystème Windows
L’arrivée de CUDA 13.4 pour Windows on Arm (preview du 21 juillet 2026) ouvre la voie aux machines RTX Spark, avec deux variantes du processeur N1X confirmées par les pilotes. ASUS et MSI lanceront leurs PC portables RTX Spark dès l’automne 2026, avant Acer et Gigabyte dont les mini-PC sont attendus début 2027. Cette extension de l’écosystème devrait encore élargir l’adoption des LLM open-source en local.
Sources

- NVIDIA DGX Spark — page officielle
- Blog NVIDIA — DGX Spark et DGX Station alimentent les derniers modèles open-source
- NeMo AutoModel — instructions de fine-tuning
- OutilsIA — DGX Spark : 10 réglages IA locale
- Glukhov.org — DGX Spark vs Mac Studio vs RTX-4080
- DevToolStack — Benchmark 17 LLM sur GB10
- Forum NVIDIA — DeepSeek V4 Flash 0731 sur 1 Spark
- Forum NVIDIA — Agent Serving sur 2× DGX Spark
- Flowtivity.ai — DeepSeek V4 Flash 0731 sur Dual DGX Spark
- DeepWiki — emiluzelac/deepseek-v4-flash-0731-on-one-dgx-spark
- DeepWiki — bidual/awesome-dgx-spark
- Kingy.ai — Run DeepSeek V4 Flash 0731 Locally
- SysKB — NVIDIA DGX Spark : Specs et usages
- Les Numériques — Puce Nvidia RTX Spark sur Windows 11
- Clubic — NVIDIA RTX Spark : ASUS et MSI
- Mundowin — NVIDIA lance le premier kit CUDA 13.4 pour Windows Arm
- vLLM blog — DGX Spark
- ai-manual.ru — Famille Laguna : architecture MoM
- Habr.com — Poolside Laguna S 2.1
- ai-stat.ru — Laguna S 2.1
- Aimadetools — Best Open-Weight Coding Models 2026
- Lalaten du blog — DGX Spark vs RTX 5090
Article recherché et rédigé automatiquement · Magazine Electrosens