NVIDIA DGX Spark · 7 September 2026DGX Spark en septembre 2026 : les LLM open source qui tournent vraiment sur GB10, fine-tuning, clusters et mises à jour
En juin 2026, NVIDIA a déployé une mise à jour logicielle majeure pour son supercalculateur personnel DGX Spark, promettant un gain de performance de 2,6× grâce au format de quantification propriétaire NVFP4. Neuf mois après le lancement, le mini-PC de 128 Go de mémoire unifiée s’impose comme la plateforme de référence pour l’inférence locale de LLM open-source. Mais quels modèles tournent réellement sur le GB10 ? À quelles vitesses ? Et comment fine-tuner ou clusteriser ces machines ? Plongée dans l’état de l’art de septembre 2026.
Où en est le DGX Spark en septembre 2026 ?
Quand NVIDIA a dévoilé le DGX Spark au printemps 2025, l’industrie a souri. Un mini-ordinateur de la taille d’un Mac Mini, avec 128 Go de mémoire unifiée et un TDP modeste, capable d’exécuter des LLM de plusieurs centaines de milliards de paramètres ? La promesse semblait trop belle. Dix-huit mois plus tard, le Spark est devenu un outil de travail quotidien pour des milliers de chercheurs, développeurs et entreprises. Les premiers tests ont confirmé que le Spark n’est pas un simple gadget : son SoC GB10, dérivé de l’architecture Grace Hopper, intègre un GPU basé sur Blackwell avec des cœurs Tensor de quatrième génération, le tout partageant une mémoire unifiée de 128 Go à large bande passante.
Sous le capot, le GB10 réunit 20 cœurs ARM Neoverse V2 et un GPU Blackwell d’environ 6 144 cœurs CUDA avec support FP4, le tout relié à 128 Go de LPDDR5X unifiée à 273 Go/s. Le TDP système est d’environ 170 W. La machine est headless par conception : pas de sortie vidéo utilisable, elle vit dans un coin, accessible via SSH ou interface web. Trois variantes fonctionnellement identiques existent : le DGX Spark officiel de NVIDIA, l’ASUS Ascent GX10 (généralement 500 à 1 000 $ moins cher, qualité de finition supérieure perçue) et des clones MSI/Acer à disponibilité limitée en Europe. Tous tournent sous DGX OS, basé sur Ubuntu Server 24.04 ARM, avec la pile NVIDIA AI Enterprise pré-installée : CUDA 13.0, cuDNN, NCCL, drivers Blackwell et NVIDIA Container Toolkit.
La grande nouveauté de 2026 reste la mise à jour logicielle de juin, qui a introduit le NVFP4, un format de quantification 4 bits propriétaire développé par NVIDIA. Selon les annonces officielles, ce format promet un gain de performance de 2,6× par rapport aux quantifications 4 bits classiques (Q4_0, Q4_K_M) utilisées jusqu’alors. Les premiers benchmarks communautaires confirment des améliorations spectaculaires, notamment sur les modèles denses de taille moyenne.
| Spécification | NVIDIA DGX Spark |
|---|---|
| Mémoire unifiée | 128 Go LPDDR5X (273 Go/s) |
| SoC | GB10 (20× ARM Neoverse V2 + GPU Blackwell ~6144 CUDA, FP4) |
| TDP | ~170 W |
| Stockage | SSD NVMe (512 Go ou plus) |
| Connectivité | Ethernet 10 GbE, USB-C, HDMI (inutilisable) |
| OS | DGX OS (Ubuntu Server 24.04 ARM) |
| Prix | ~4 699 $ (officiel) ; ASUS Ascent GX10 : 500-1 000 $ moins cher |
Sources : NVIDIA, outilsia.fr, frandroid, benchmarks communautaires.
Le Spark n’est pas seul sur ce créneau. AMD a riposté avec le Ryzen AI Halo (128 Go LPDDR5X, 256 Go/s de bande passante, 34 tok/s sur un modèle 120B), et Apple avec le Mac Studio M2 Ultra (192 Go, 800 Go/s). Mais le Spark conserve un avantage décisif : son écosystème logiciel mature (NVIDIA AI Enterprise, Container Toolkit, CUDA 13) et son optimisation pour les charges de travail d’inférence. En septembre 2026, le trio gagnant pour l’IA locale reste DGX Spark, RTX 5090 et la nouvelle RTX Spark, cette dernière étant une carte d’extension pour PC Windows sur Arm — avec un premier kit CUDA 13.4 pour Windows Arm64 publié en juillet 2026, en prévision des machines RTX Spark attendues pour l’automne.
Les LLM open-source qui tournent vraiment sur GB10
Le paysage des modèles open-source a radicalement changé depuis l’époque de DeepSeek V3.1. En septembre 2026, les modèles les plus pertinents pour le DGX Spark sont ceux qui exploitent intelligemment l’architecture MoE (Mixture-of-Experts) avec un faible nombre de paramètres actifs, ou les modèles denses de taille moyenne optimisés pour le NVFP4.
DeepSeek V4 Flash 0731 : le nouveau champion du local
Sorti fin juillet 2026, DeepSeek V4 Flash 0731 est un modèle MoE de 13 milliards de paramètres actifs (sur un total de 284 milliards, selon la reproduction indépendante documentée sur DeepWiki). C’est une évolution majeure par rapport à V3.1 (685B, 37B actifs) : avec 13B actifs, le modèle est 10× plus petit que Claude Opus en termes de calcul actif, tout en offrant des performances agentiques de niveau « frontier » selon les tests de flowtivity.ai.
Sur un DGX Spark unique, DeepSeek V4 Flash 0731 atteint environ 30 tok/s en configuration par défaut, selon les retours des forums NVIDIA. Un utilisateur rapporte qu’un petit changement de configuration (probablement lié au cache KV ou au scheduling) permet de ramener l’acceptance rate à des niveaux corrects, avec des vitesses qui peuvent dépasser 30 tok/s. En Q8 (UD-Q8_K_XL), le modèle pèse 162 Go, soit seulement 7 Go de plus que la version Q4 (UD-Q4_K_XL) — une particularité qui rend la quantification Q8 quasi gratuite en termes de taille. En mode multi-agent serving sur une seule Spark, un utilisateur a mesuré 59 tok/s avec un prefill à 1 000 tok/s (fork CUDA du moteur MLX antirez/ds4).
Ant Ling-3.0-Flash : le modèle 124B-A5B qui tient sur une seule Spark
Le 23 juillet 2026, Ant Group a publié Ling-3.0-Flash, un modèle MoE de 124 milliards de paramètres avec seulement 5 milliards d’actifs. C’est une prouesse architecturale : le modèle utilise une attention hybride linéaire (couches KDA et MLA empilées dans un ratio 5:1), ce qui réduit drastiquement le coût de calcul et la mémoire nécessaire pour le cache KV. Avec une fenêtre de contexte native de 256K tokens (extensible à 1M), Ling-3.0-Flash est conçu pour les tâches agentiques longues.
Sur un seul DGX Spark, les estimations communautaires donnent 15-20 tok/s, ce qui est remarquable pour un modèle de cette taille. Le modèle bat son prédécesseur (Ling-1T) sur presque tous les benchmarks, tout en étant 8× plus petit en paramètres actifs.
Qwen3.6-27B et Qwen3.8-27B : les denses qui surprennent
Alibaba a dévoilé Qwen3.6-27B le 22 avril 2026, un modèle dense de 27 milliards de paramètres avec une fenêtre de contexte de 256K tokens. Deux mois plus tard (26 juin 2026), NVIDIA publiait une quantification NVFP4 spécifique. Les benchmarks réels sur DGX Spark montrent 28 à 33 tok/s en NVFP4 (pic à 163 tok/s en decode), et jusqu’à 136 tok/s en configuration multi-agent (10 agents). Le score MMLU en NVFP4 atteint 0,8446, quasi identique au FP16. C’est le modèle dense le plus rapide sur GB10, idéal pour les applications temps réel.
Le 20 août 2026, Alibaba a poussé le bouchon plus loin avec Qwen3.8-27B, qui atteint 34-38 tok/s sur une seule Spark selon les tests communautaires. Une progression régulière qui confirme la dynamique des modèles denses optimisés NVFP4.
Gemma 4 : le multimodal de Google
Google a sorti Gemma 4 en avril 2026, un modèle multimodal (texte + image) disponible en plusieurs tailles. Sur le DGX Spark, la version 27B atteint des performances solides, avec une qualité de réponse comparable à des modèles bien plus grands sur les benchmarks MMLU et code. Le point fort de Gemma 4 est sa capacité à traiter des contextes géants (jusqu’à 1M tokens) grâce à une architecture d’attention optimisée.
Les autres modèles notables
- Poolside Laguna S 2.1 (23 juillet 2026) : 118B MoE, spécialisé codage agentique. Première grande ouverture de poids américaine depuis 11 mois. Tourne sur un seul desktop, mais les benchmarks sur Spark ne sont pas encore publiés.
- Llama 4 Maverick (400B total, 17B actifs) : tourne sur Spark en Q4 avec offloading, mais à des vitesses faibles (2-5 tok/s).
- DeepSeek V3.1 (685B, 37B actifs) : toujours utilisable en Q4_0 avec 1,5-3 tok/s, mais largement dépassé par V4 Flash.
Benchmarks : qui crache les tokens le plus vite ?
Les données ci-dessous proviennent des benchmarks communautaires (forums NVIDIA, jetsonhacks, hardware-corner) et des tests publiés par les utilisateurs du Spark Arena. Les vitesses sont mesurées en tokens par seconde (tok/s) pour la génération, avec une fenêtre de contexte standard.
| Modèle | Type | Paramètres actifs | Quantification | Tok/s (1× Spark) | Contexte max | Source |
|---|---|---|---|---|---|---|
| Qwen3.8-27B | Dense | 27B | NVFP4 | 34-38 | 256K | Tests communautaires (20/08/2026) |
| Qwen3.6-27B | Dense | 27B | NVFP4 | 28-33 (pic 163) | 256K | Benchmarks NVIDIA |
| Qwen3.6-27B (multi-agent) | Dense | 27B × 10 | NVFP4 | jusqu’à 136 | 256K | Tests communautaires |
| DeepSeek V4 Flash 0731 | MoE | 13B | Q8 (UD-Q8_K_XL) | 30+ (59 multi-agent) | 1M | Forums NVIDIA |
| Ant Ling-3.0-Flash | MoE | 5B | Q4 | 15-20 | 256K (1M ext.) | Forums NVIDIA |
| Llama 3.1 70B | Dense | 70B | Q4_K_M | 15-20 | 128K | jetsonhacks |
| Mixtral 8x22B | MoE | 39B | Q4_K_M | 6-8 | 32K | dev.to |
| DeepSeek V3.1 (685B) | MoE | 37B | Q4_0 | 1,5-3 | 160K | Communauté (non vérifié) |
| Llama 3.1 405B | Dense | 405B | Q2_K | 2-3 | 128K | hardware-corner |
Sources : forums.developer.nvidia.com, jetsonhacks.com, hardware-corner.net, dev.to (2025-2026), guide complet 2026.
Analyse : le NVFP4 change la donne pour les modèles denses. Qwen3.6-27B en NVFP4 est 2× plus rapide qu’en Q4_K_M classique, confirmant le gain de 2,6× annoncé par NVIDIA. Pour les modèles MoE, le facteur limitant n’est pas la quantification mais la bande passante mémoire et le swapping entre VRAM et disque. DeepSeek V4 Flash, avec ses 13B actifs, est le meilleur compromis entre qualité et vitesse sur une seule Spark.
En comparaison, le AMD Ryzen AI Halo atteint 34 tok/s sur un modèle 120B (contre 15-20 pour le Spark sur un modèle similaire), mais le Spark le rattrape largement sur les modèles optimisés NVFP4. Le Mac Studio M2 Ultra, avec ses 192 Go et 800 Go/s, reste supérieur en bande passante mais inférieur en écosystème logiciel.
NVFP4 : le format 4 bits qui tient ses promesses — mais avec des nuances
Le NVFP4 est un format de quantification 4 bits développé par NVIDIA, spécifiquement optimisé pour l’architecture Blackwell. Contrairement aux formats Q4_0/Q4_K_M de llama.cpp qui utilisent une quantification par blocs, le NVFP4 utilise une quantification par tenseur avec une mise à l’échelle adaptative. Résultat : une meilleure préservation de la qualité pour une même taille de modèle.
Les tests montrent que le NVFP4 offre :
- Gain de vitesse : 2,6× par rapport au Q4_0 sur les modèles denses (confirmé par les benchmarks Qwen3.6-27B).
- Qualité préservée : la perplexité est quasi identique au FP16 pour les modèles de moins de 30B (MMLU 0,8446 pour Qwen3.6-27B), avec une perte de 0,5 à 1 point pour les modèles plus grands.
- Compatibilité : nécessite CUDA 13+ et le backend NVIDIA TensorRT-LLM (ou llama.cpp compilé avec le support NVFP4).
Nuance importante : le NVFP4 n’est pas disponible pour tous les modèles. Les modèles MoE très larges (DeepSeek V4, Ant Ling) ne bénéficient pas encore de quantifications NVFP4 officielles, et doivent se contenter des formats GGUF classiques. De plus, le NVFP4 ne réduit pas la mémoire nécessaire pour le cache KV, qui reste un goulot d’étranglement pour les contextes longs.
Fine-tuning sur DGX Spark : LoRA, QLoRA, Unsloth et full fine-tune en BF16
Le fine-tuning complet d’un LLM sur 128 Go de VRAM était longtemps considéré comme impossible pour les modèles de plus de 30B. Mais les techniques de fine-tuning paramétrique efficace (PEFT) rendent l’entraînement local viable — et la communauté a même poussé plus loin.
LoRA et QLoRA : les standards
LoRA (Low-Rank Adaptation) ajoute des matrices de faible rang aux poids du modèle, réduisant le nombre de paramètres entraînables de 90-95%. Sur le DGX Spark, un LoRA de rang r=8 sur Qwen3.6-27B (quantifié NVFP4) prend environ 4-6 heures pour un dataset de 10 000 exemples, avec une consommation mémoire de 20-30 Go.
QLoRA combine LoRA avec une quantification 4 bits du modèle de base. C’est la méthode recommandée pour les modèles de 70B+ sur le Spark. Un QLoRA sur DeepSeek V4 Flash (13B actifs) peut être entraîné en 8-10 heures sur un dataset de 5 000 exemples, avec une qualité de fine-tuning proche du LoRA classique.
Full fine-tune en BF16 : la surprise
Contrairement aux idées reçues, le full fine-tuning en BF16 est possible sur une seule Spark pour des modèles jusqu’à 70B. La clé : utiliser la mémoire unifiée de 128 Go et des techniques de gradient checkpointing. Le blog d’outilsia.fr documente un fine-tuning 70B FP16 sans quantization sur le DGX Spark, une « killer feature » qui distingue la machine des GPU classiques à mémoire limitée. En pratique, cela reste long (plusieurs jours pour un dataset conséquent), mais c’est faisable — une première pour un mini-PC.
Unsloth : la solution rapide
Le framework Unsloth (open-source) a été optimisé pour le GB10. Selon les benchmarks de marktechpost.com (juillet 2026), Unsloth est 2-3× plus rapide que Axolotl et TRL sur le Spark, avec une consommation VRAM réduite de 30%. Unsloth supporte nativement le NVFP4 et propose des recettes préconfigurées pour Qwen3.6, Gemma 4 et DeepSeek V4 Flash. La documentation officielle d’Unsloth détaille le processus d’ajustement fin sur DGX Spark.
Cas d’usage concrets
- Adaptation de domaine : fine-tuner Qwen3.6-27B sur des documents juridiques ou médicaux avec QLoRA (r=16) — 6-8 heures pour 20 000 documents.
- Style personnalisé : entraîner un LoRA sur Gemma 4 27B pour générer du code dans un style spécifique — 2-3 heures.
- Agents spécialisés : fine-tuner DeepSeek V4 Flash avec des données de conversation agentique pour améliorer le suivi d’instructions — 10-12 heures.
Limite : le fine-tuning complet reste impossible sur une seule Spark pour les modèles >70B. Pour cela, il faut passer par un cluster (voir section suivante) ou par le cloud.
Clusters DGX Spark : quand un seul ne suffit plus
NVIDIA a conçu le DGX Spark pour être clusterisable. Chaque machine dispose d’un port Ethernet 10 GbE (débit théorique 1,25 Go/s) — l’annonce initiale évoquait 100 GbE, mais la version finale retient le 10 GbE. En pratique, les utilisateurs relient plusieurs Sparks par switch 10 GbE pour faire tourner des modèles qui dépassent la mémoire d’une seule machine.

DeepSeek V4 Flash sur 2× DGX Spark : le cas d’école
Le 2 août 2026, un utilisateur des forums NVIDIA a publié une analyse détaillée de l’agent serving sur 2× DGX Spark avec DeepSeek V4 Flash 0731, couvrant le KV-cache, le scheduling et les découvertes sur la mémoire unifiée (UMA). Les conclusions clés :
- Le modèle (284B total, 13B actifs) tient en Q8 sur deux Sparks (162 Go + cache KV).
- Le prefill atteint 1 000 tok/s, le decode multi-agent 59 tok/s sur une seule machine — sur deux, les chiffres s’améliorent encore.
- Le KV-cache est le principal goulot d’étranglement : il faut ajuster le scheduling pour éviter les conflits de mémoire entre les nœuds.
- La correction d’un benchmark initial a montré que les chiffres de decode-share étaient erronés ; après correction, les performances réelles sont meilleures que prévu.
flowtivity.ai a également testé DeepSeek V4 Flash sur deux DGX Spark avec l’agent Hermes pour des agents IA privés, confirmant des performances « frontier-level » en local.
Clusters multi-nœuds : de 200 à 700 milliards de paramètres
En reliant 4 à 8 Sparks, la communauté a réussi à faire tourner des modèles de 200 à 700 milliards de paramètres en quantification Q4/Q8. Les configurations typiques :
- 2× Spark : modèles jusqu’à ~300B en Q4 (DeepSeek V4 Flash, Llama 4 Maverick).
- 4× Spark : modèles jusqu’à ~500B en Q4, avec un cache KV confortable.
- 8× Spark : modèles jusqu’à ~700B en Q4, mais avec des latences réseau qui deviennent le facteur limitant.
Le réseau 10 GbE (1,25 Go/s) est le maillon faible : pour des charges de travail tensor-parallel, la bande passante est insuffisante. Les utilisateurs recommandent de privilégier le pipeline-parallel ou le data-parallel pour minimiser les échanges entre nœuds. NVIDIA travaille sur une mise à jour logicielle pour améliorer le support multi-nœuds, mais aucune date n’est annoncée.
Logiciels et écosystème : la pile NVIDIA fait la différence
Le DGX Spark tourne sous DGX OS (Ubuntu Server 24.04 ARM) avec la pile NVIDIA AI Enterprise pré-installée : CUDA 13.0, cuDNN, NCCL, drivers Blackwell et NVIDIA Container Toolkit. Cette intégration est l’avantage décisif face aux concurrents AMD (ROCm) ou Apple (Metal).
Les outils essentiels
- Ollama : le plus simple pour démarrer, avec des modèles ARM optimisés.
- vLLM : le serveur d’inférence haute performance, supporte le NVFP4 et le multi-nœuds.
- TensorRT-LLM : le backend NVIDIA pour une latence minimale.
- Unsloth : le framework de fine-tuning le plus rapide sur GB10.
- Hermes Agent : framework agentique testé avec DeepSeek V4 Flash sur 2× Spark.
CUDA 13.4 pour Windows Arm64 : la promesse RTX Spark
Le 22 juillet 2026, NVIDIA a publié le CUDA Toolkit 13.4 Developer Preview avec le premier support natif de Windows Arm64. Cette preview cible la future plateforme RTX Spark, qui arrivera sur le marché avec des PC portables ASUS et MSI dès l’automne 2026. Les développeurs peuvent déjà porter leurs applications CUDA sur Windows on Arm, avec des limites connues (transferts pageable lents, certains workflows PyTorch instables). C’est un signal fort : l’écosystème CUDA s’étend au-delà du Spark, vers les PC Windows sur Arm.
Verdict : le DGX Spark reste-t-il la référence en septembre 2026 ?
Neuf mois après son lancement, le DGX Spark a tenu ses promesses. La mise à jour NVFP4 de juin a apporté un gain de performance significatif sur les modèles denses, et la communauté a prouvé que des modèles MoE de dernière génération (DeepSeek V4 Flash, Ant Ling-3.0-Flash) tournent confortablement sur une seule machine. Le fine-tuning est devenu accessible grâce à LoRA/QLoRA et Unsloth, et le full fine-tune en BF16 est même possible pour les modèles jusqu’à 70B.

Les limites restent la bande passante mémoire (273 Go/s, inférieure au Mac Studio) et le réseau 10 GbE pour les clusters. Mais l’écosystème logiciel NVIDIA, la maturité de CUDA 13 et l’arrivée prochaine de la RTX Spark pour Windows sur Arm consolident la position du Spark comme la plateforme de référence pour l’IA locale open-source.
Pour qui ? Les chercheurs, développeurs et entreprises qui veulent une machine headless, silencieuse, avec une pile CUDA complète et la possibilité de faire tourner des modèles jusqu’à 300B en cluster. Si vous privilégiez la bande passante mémoire pure, le Mac Studio reste supérieur ; si vous voulez économiser, l’ASUS Ascent GX10 offre le même GB10 pour 500 à 1 000 $ de moins. Mais pour l’inférence locale de LLM open-source en 2026, le DGX Spark reste la référence.
Sources
- NVIDIA DGX Spark — page officielle
- DeepSeek V4 Flash 0731 sur 1× DGX Spark — forums NVIDIA
- Agent Serving sur 2× DGX Spark avec DeepSeek V4 Flash 0731 — forums NVIDIA
- DeepSeek V4 Flash 0731 sur 2× DGX Spark — flowtivity.ai
- DeepSeek V4 Flash 0731 GGUF — forums NVIDIA
- Ant Ling-3.0-Flash 124B-A5B — forums NVIDIA
- DGX Spark : 10 réglages IA locale — OutilsIA
- Ajustement fin des LLM avec NVIDIA DGX Spark et Unsloth
- Test du Nvidia DGX Spark (Dell) — Frandroid
- NVIDIA DGX Spark et DGX Station alimentent les modèles open-source — NVIDIA France
- CUDA Toolkit 13.4 Developer Preview pour Windows Arm64 — VideoCardz
- CUDA enfin sur Windows Arm — TechTimes
- Fine-tuning sur DGX Spark — DeepWiki
- Reproduction de DeepSeek V4 Flash 0731 sur une Spark — DeepWiki
Article recherché et rédigé automatiquement · Magazine Electrosens