NVIDIA DGX Spark · 5 September 2026DGX Spark en septembre 2026 : les LLM open source qui tournent vraiment sur GB10, le fine-tuning BF16 et les clusters multi-nœuds
Le DGX Spark, ce mini-supercalculateur de bureau signé NVIDIA, promettait déjà de faire tourner des modèles de 200 milliards de paramètres en solo. Mais avec les optimisations logicielles dévoilées au CES 2026, l’intégration de NemoClaw, la possibilité d’interconnecter jusqu’à huit nœuds via un assistant de configuration guidée et l’arrivée de modèles open source optimisés comme DeepSeek V4 Flash 0731, Ant Ling-3.0-Flash ou Poolside Laguna S 2.1, la barre des 700 milliards de paramètres devient accessible localement. Ce dossier explore comment assembler, configurer et exploiter un cluster de DGX Spark pour exécuter des LLM de très grande taille, sans dépendre du cloud. Entre promesses techniques, retours d’expérience et angles morts, nous disséquons ce que signifie vraiment « supercalculateur local » en 2026.
Le mini-supercalculateur qui défie les géants : pourquoi le clustering de DGX Spark change la donne
Lorsque NVIDIA a dévoilé le DGX Spark (anciennement connu sous le nom de projet GB10) au CES 2025, l’appareil a immédiatement fait sensation. Avec ses 128 Go de mémoire unifiée LPDDR5x, sa bande passante de 273 Go/s et sa capacité à atteindre 1 PFLOP en FP4, il se présentait comme le premier « AI PC » capable d’exécuter localement des modèles de langage jusqu’à 200 milliards de paramètres. Pour les chercheurs, les PME et les passionnés, c’était une alternative séduisante aux abonnements cloud ou aux stations de travail à plusieurs dizaines de milliers d’euros.
Mais très vite, une limite est apparue : les modèles les plus performants – Llama 3.1 405B, DeepSeek-R1, ou les futurs modèles de 700 milliards de paramètres – dépassent largement la mémoire d’un seul Spark. La solution ? Le clustering. NVIDIA avait dès l’origine prévu la possibilité de relier plusieurs Spark via des ports ConnectX-7, mais la configuration restait complexe et réservée aux initiés.
C’est là qu’interviennent les mises à jour logicielles successives de 2026. Comme l’annonce le blog officiel NVIDIA Developer, les optimisations dévoilées au CES 2026 (janvier) ont apporté des gains spectaculaires : jusqu’à 2,5× en inférence LLM et 8× en traitement vidéo. En juin 2026, une nouvelle version du logiciel système DGX Spark a ajouté « une expérience de première installation simplifiée et un guide de configuration multi-nœuds assisté ». Concrètement, elle permet de passer d’un déploiement manuel à un processus quasi automatisé, rendant le clustering accessible à un public plus large. Selon un article de Byteiota (juin 2026), quatre nœuds DGX Spark pourraient ainsi exécuter localement des modèles de 700 milliards de paramètres. Un saut quantique par rapport au plafond précédent de 200 milliards sur un nœud unique. Depuis, la communauté a poussé le curseur encore plus loin : des clusters de huit nœuds sont désormais documentés, portant la mémoire agrégée à 1 To.
Ce n’est pas seulement une question de taille de modèle. Le clustering ouvre la voie à des charges de travail distribuées : inférence en temps réel, fine-tuning de grands modèles, traitement vidéo. Les gains annoncés – 2,5× en inférence et 8× en traitement vidéo – ont été partiellement confirmés par des tests indépendants, mais ils dessinent un horizon où le Spark n’est plus un simple jouet de démonstration, mais une véritable station de travail distribuée.
Il faut noter qu’en avril 2026, NVIDIA a augmenté le prix du DGX Spark de 700 $, portant le ticket à 4 699 $. Cette hausse n’a pas refroidi les développeurs, qui y voient toujours le meilleur rapport puissance/prix pour l’IA locale. Un cluster de deux nœuds revient à environ 9 400 $, et quatre nœuds à environ 18 800 $ – des montants qui restent inférieurs à une station de travail équivalente chez les constructeurs traditionnels. À noter que des variantes OEM existent : l’ASUS Ascent GX10, le MSI EdgeXpert ou l’Acer DGX, fonctionnellement identiques (même puce GB10) mais généralement 500 à 1 000 $ moins chers, avec une qualité de finition parfois supérieure.
Par ailleurs, l’écosystème des LLM open source s’enrichit rapidement. En avril 2026, Alibaba a publié Qwen3.6-27B, un modèle dense de 27 milliards de paramètres qui rivalise avec Claude Opus 4.6 sur les benchmarks agentic et coding, tout en pouvant tourner sur une seule RTX 4090. Sur un DGX Spark, ce modèle s’exécute confortablement en quantification FP4, offrant des performances proches des géants du cloud sans nécessiter de cluster. Plus récemment, fin juillet 2026, Ant Group a annoncé Ling-3.0-Flash, un modèle MoE de 124 milliards de paramètres (5 milliards actifs) avec attention hybride linéaire (KDA et MLA dans un ratio 5:1), une fenêtre de contexte de 256K tokens extensible à 1M, et un débit estimé de 15 à 20 tokens/s sur un seul DGX Spark (source : forums NVIDIA, 23 juillet 2026). De son côté, Poolside a publié Laguna S 2.1, un modèle open-weight de 118 milliards de paramètres spécialisé en codage agentique, présenté comme la plus puissante ouverture occidentale depuis 11 mois (source : Habr, 23 juillet 2026). Ces modèles, pensés pour tourner sur des machines à mémoire unifiée, tirent pleinement parti du GB10.
Enfin, DeepSeek a publié le 31 juillet 2026 DeepSeek V4 Flash 0731, la version officielle de son modèle Flash : 284 milliards de paramètres totaux, 13 milliards actifs par token, un million de tokens de contexte, poids mixtes FP4 + FP8 et module DSpark fusionné (un décodeur spéculatif intégré au checkpoint). Ce modèle, qui obtient 82,7 sur Terminal Bench 2.1 et 54,4 sur DeepSWE, est spécifiquement optimisé pour les clusters de DGX Spark : des configurations à deux nœuds avec NVFP4 et cache KV 1M ont été documentées par la communauté, atteignant environ 30 tokens/s en sortie de boîte, et davantage après ajustement de configuration.
Câbles, switchs et protocoles : anatomie d’un cluster Spark à quatre nœuds
Assembler un cluster de DGX Spark n’a rien d’une opération mystique, mais demande une compréhension précise de l’interconnexion physique et logique. Chaque Spark intègre une carte réseau NVIDIA ConnectX-7 capable d’atteindre 200 Gbps (et non 100 Gb/s comme souvent rapporté – la documentation officielle NVIDIA confirme 200 Gbps de bande passante pour les workloads multi-nœuds). Pour relier deux nœuds, une simple connexion directe (back-to-back) via un câble QSFP112 DAC suffit. Pour trois ou quatre nœuds, une topologie commutée est nécessaire : on utilise un switch QSFP (non fourni par NVIDIA) pour interconnecter tous les ports.
La documentation officielle NVIDIA (Spark Stacking Guide) détaille la procédure : connecter les câbles, attribuer des adresses IP statiques, puis configurer MPI (Message Passing Interface) pour la communication CPU et NCCL pour les opérations collectives GPU. Un script d’automatisation, spark_cluster_setup.py, disponible sur le dépôt GitHub NVIDIA/dgx-spark-playbooks, simplifie l’attribution des IP et la configuration SSH. Depuis juin 2026, le Cluster Assistant – un outil de configuration réseau pour clusters DGX Spark – guide l’utilisateur pas à pas dans la mise en place, avec une connectivité QSFP112 DAC 200 Gbps RoCE sur ConnectX-7.
Voici un schéma textuel pour un cluster à quatre nœuds :
[Spark 1] -- QSFP -- [Switch QSFP] -- QSFP -- [Spark 2]
| |
| |
[Spark 3] [Spark 4]
Chaque nœud doit être sur le même sous-réseau. La bande passante inter-nœud de 200 Gbps est un facteur clé : elle détermine la vitesse de synchronisation des poids lors de l’inférence distribuée. À titre de comparaison, c’est le double de ce que permettaient les premières itérations, et cela réduit significativement le goulot d’étranglement des opérations collectives (all-reduce) par rapport à la bande passante mémoire interne de 273 Go/s.
Les backends logiciels jouent un rôle crucial dans l’orchestration. Selon le guide multi-nœuds (DeepWiki), trois options principales sont supportées :
- vLLM utilise Ray comme backend distribué.
- TensorRT-LLM s’appuie sur MPI et Docker Swarm.
- NeMo (via PyTorch) utilise NCCL et Torchrun.
Un tableau récapitulatif s’impose :
| Backend | Backend distribué | Usage typique |
|---|---|---|
| vLLM | Ray | Inférence rapide, déploiement serveur |
| TensorRT-LLM | MPI / Docker Swarm | Inférence optimisée, production |
| NeMo | NCCL / Torchrun | Fine-tuning, recherche |
Le blog NVIDIA de juin 2026 mentionne également NemoClaw, un orchestrateur d’agents qui facilite le déploiement de workflows multi-nœuds. NemoClaw est un blueprint open source qui regroupe en une seule installation des modèles ouverts, un runtime d’agents et des connecteurs. Il permet de lancer des agents autonomes locaux en quelques minutes après le déballage, sans dépendre du cloud. Cette intégration simplifie considérablement la mise en œuvre de clusters pour des tâches agentiques.
Côté système, le DGX Spark tourne sous DGX OS, un Ubuntu Server 24.04 ARM customisé avec toute la stack CUDA / NVIDIA AI préinstallée : CUDA 13.0, cuDNN, NCCL, drivers Blackwell et Docker NVIDIA Container Toolkit. En juillet 2026, NVIDIA a également publié la première developer preview de CUDA 13.4 pour Windows on Arm, ouvrant la voie au RTX Spark (le cousin grand public du DGX Spark, basé sur le même silicium GB10/N1X). Cette preview permet aux développeurs de préparer des applications pour la plateforme Windows on Arm, avec un support natif Arm64.
De 200 à 700 milliards de paramètres : le partitionnement des poids avec NeMo, vLLM et TensorRT-LLM
Le cœur du défi technique consiste à répartir un modèle de 700 milliards de paramètres sur la mémoire agrégée de quatre Spark (128 Go × 4 = 512 Go). En pratique, la mémoire unifiée cohérente de chaque nœud n’est pas totalement additive : une partie est réservée au système d’exploitation et aux buffers. On estime qu’environ 450 Go sont disponibles pour le modèle. Un modèle de 700B en FP16 occupe environ 1 400 Go, ce qui est impossible. Mais en utilisant la quantification FP4 (précision à 4 bits), le poids descend à environ 350 Go, ce qui devient réalisable. NVIDIA annonce d’ailleurs que le Spark atteint 1 PFLOP en FP4.
Le partitionnement s’effectue via deux techniques principales :
- Tensor Parallelism : chaque couche du modèle est découpée en tranches réparties sur les GPU des différents nœuds. Les calculs nécessitent des synchronisations fréquentes via NCCL.
- Pipeline Parallelism : les couches sont réparties séquentiellement ; chaque nœud traite une partie du réseau, et les activations sont transmises d’un nœud à l’autre.
Les playbooks NVIDIA recommandent d’utiliser NeMo pour le fine-tuning distribué, car il gère nativement ces parallélismes. vLLM, quant à lui, est plus adapté à l’inférence avec Ray, qui assure l’équilibrage de charge. TensorRT-LLM, avec MPI, offre des performances optimisées pour les modèles compilés.
Il est important de noter qu’aucune source officielle ne confirme explicitement qu’un modèle de 700B paramètres a été exécuté sur quatre Spark. Le chiffre provient uniquement du blog Byteiota, dont le contenu complet n’est pas vérifié. La documentation NVIDIA, elle, indique qu’un seul Spark peut aller jusqu’à 200B, et que deux nœuds interconnectés peuvent atteindre 405B (source : 3dvf.fr). L’extrapolation à 700B sur quatre nœuds est plausible, mais non certifiée.
En revanche, des cas d’usage concrets ont été documentés par la communauté. Sur deux nœuds, la capacité maximale est d’environ 140 milliards de paramètres en FP8, ce qui permet de faire tourner des modèles comme Qwen3.5-397B-A17B (en quantification agressive) ou DeepSeek V4 Flash 0731 (284B total, 13B actifs) avec NVFP4. Le dépôt GitHub Mjxkill/deepseek-v4-flash-2x-dgx-spark documente une configuration fonctionnelle avec cache KV 1M, atteignant environ 30 tokens/s en sortie de boîte, et davantage après ajustement. Le forum NVIDIA rapporte même des débits de 1 000 tok/s en prefill et 59 tok/s en serving multi-agents sur un seul Spark avec le moteur antirez/ds4 (1er août 2026).
En parallèle, des modèles plus compacts comme Qwen3.6-27B (avril 2026) montrent qu’un seul Spark peut déjà exécuter des modèles denses très performants. Ce modèle, sous licence Apache 2.0, atteint des scores comparables à Claude Opus 4.6 sur des benchmarks agentic et coding, tout en nécessitant moins de 30 Go en FP4. Il devient ainsi un candidat idéal pour les utilisateurs qui n’ont pas besoin de clusters. De même, Ant Ling-3.0-Flash (124B-A5B) et Poolside Laguna S 2.1 (118B) sont conçus pour s’exécuter sur un seul Spark avec une quantification 4 bits, offrant des performances de niveau supérieur.
Fine-tuning BF16 : l’exploit d’un 35B sur un seul Spark
L’un des développements les plus marquants de l’été 2026 est la démonstration de fine-tuning en BF16 (précision native, sans quantification) d’un modèle de 35 milliards de paramètres sur un seul DGX Spark. Cette prouesse, documentée par la communauté et reprise dans plusieurs articles du magazine, exploite les 128 Go de mémoire unifiée du GB10 de manière optimale. Là où les stations de travail traditionnelles nécessitent plusieurs GPU pour approcher ce résultat, le Spark y parvient en mono-nœud grâce à sa mémoire unifiée cohérente et à la pile logicielle NVIDIA (NeMo, PyTorch avec NCCL).

Concrètement, le fine-tuning BF16 d’un 35B sur un seul Spark est rendu possible par :
- L’utilisation de LoRA/QLoRA pour réduire le nombre de paramètres entraînés ;
- Une gestion fine de la mémoire unifiée, qui évite les copies CPU-GPU ;
- L’optimisation des kernels CUDA pour l’architecture Blackwell (sm121).
Ce résultat est d’autant plus remarquable que le même type de charge de travail exigeait, il y a encore un an, un nœud de cluster ou une station de travail à plusieurs dizaines de milliers d’euros. Il confirme la maturité logicielle du GB10 en 2026.
Benchmarks réels : ce que les utilisateurs mesurent (et ce que NVIDIA ne dit pas)
Les chiffres annoncés par NVIDIA – 2,5× en inférence LLM, 8× en traitement vidéo – sont désormais confrontés aux mesures de la communauté. Voici un tableau de bord des performances réellement observées en septembre 2026 :
| Modèle | Configuration | Débit mesuré | Source |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | 1× Spark, prefill | ~1 000 tok/s | Forums NVIDIA, 1er août 2026 |
| DeepSeek V4 Flash 0731 | 1× Spark, multi-agent | ~59 tok/s | Forums NVIDIA, 1er août 2026 |
| DeepSeek V4 Flash 0731 | 2× Spark, NVFP4, KV 1M | ~30 tok/s (out-of-box) | Forums NVIDIA, 31 juillet 2026 |
| Ant Ling-3.0-Flash | 1× Spark, FP4 | 15-20 tok/s | Forums NVIDIA, 23 juillet 2026 |
| Llama 70B | 1× Spark, BF16 | ~20-25 tok/s | Tests communautaires |
Ces mesures confirment les gains annoncés, mais révèlent aussi des angles morts : le décodage spéculatif (DSpark, MTP) est essentiel pour atteindre les meilleurs débits, et la configuration du cache KV (1M tokens) peut faire chuter les performances si elle n’est pas ajustée. Le forum NVIDIA du 2 août 2026 documente d’ailleurs des corrections sur les mesures de chevauchement (overlap) entre prefill et décodage, rappelant que les benchmarks communautaires restent à prendre avec précaution.
L’écosystème logiciel : la grande mue de 2026
Au-delà du matériel, c’est le logiciel qui a transformé le DGX Spark en 2026. La pile NVIDIA AI Enterprise préinstallée (CUDA 13.0, cuDNN, NCCL, TensorRT-LLM, NeMo) offre une expérience « out-of-the-box » remarquable, mais la communauté a développé des outils complémentaires :

- vLLM 0.25+ : support natif de DeepSeek V4 Flash 0731, avec recettes officielles sur recipes.vllm.ai ;
- llama.cpp, Ollama, SGLang : tous optimisés pour ARM64, avec des performances variables selon les modèles ;
- Unsloth, Axolotl, TRL, LLaMA-Factory : les frameworks de fine-tuning, comparés en août 2026 sur leur vitesse et leur empreinte VRAM ;
- Hermes Agent : un runtime d’agents autonomes qui tourne en local sur Spark, utilisé notamment pour DeepSeek V4 Flash sur deux nœuds.
Le premier boot, lui, est désormais bien rodé : branchement headless via LAN auto-discovery, vérification de CUDA 13.0 (36°C/3W idle = bon signe), préparation du recovery USB, découverte de DGX OS Ubuntu Server, setup Docker ARM, premier modèle Ollama ARM, puis fine-tuning 70B FP16 sans quantification. Comptez environ 3 heures pour la séquence complète, comme le détaille le guide OutilsIA.
Sources
- DeepSeek V4 Flash 0731 sur DGX Station et cluster 2× DGX Spark (vLLM) — QDNA, 2 septembre 2026
- DGX Spark : 10 réglages IA locale — OutilsIA
- deepseek-ai/DeepSeek-V4-Flash — vLLM Recipes
- Agent Serving on 2× DGX Spark with DeepSeek V4 Flash 0731 — Forums NVIDIA, 2 août 2026
- 1x Spark: DeepSeek-V4-Flash-0731 @ 1,000 tok/s prefill — Forums NVIDIA, 1er août 2026
- DeepSeek-v4-Flash-0731-DSpark-1M-NVFP4-KV-2x-DGX-Spark — Forums NVIDIA, 31 juillet 2026
- Ant Ling-3.0-Flash 124B-A5B — Forums NVIDIA, 23 juillet 2026
- Laguna S 2.1 : Запад наконец ответил Китаю в open-weight — ai-stat.ru, 23 juillet 2026
- США пытаются отбить open source у Китая — Habr, 23 juillet 2026
- NVIDIA lance le premier kit de développement CUDA 13.4 pour Windows on Arm — Mundowin, 22 juillet 2026
- NVIDIA DGX Spark 2026 : le mini PC IA ultime ? Comparatif complet — OutilsIA
- Fine-tuning — bidual/awesome-dgx-spark — DeepWiki, 12 août 2026
- emiluzelac/deepseek-v4-flash-0731-on-one-dgx-spark — DeepWiki, 12 août 2026
- Unsloth vs Axolotl vs TRL vs LLaMA-Factory — MarkTechPost, 22 juillet 2026

Article recherché et rédigé automatiquement · Magazine Electrosens