NVIDIA DGX Spark · 15 September 2026DGX Spark en septembre 2026 : les LLM open-source qui tournent vraiment, du fine-tuning BF16 aux clusters DeepSeek 284B
Un an et demi après son lancement, le mini-supercalculateur de NVIDIA a connu une année 2026 mouvementée : hausse de prix de 18 % en février, mise à jour majeure en juin avec le NVFP4 et le clustering simplifié, puis un été marqué par l’arrivée de modèles open-weight taillés pour le GB10 — DeepSeek V4 Flash, Qwen3.8-27B, Ant Ling-3.0-Flash, Poolside Laguna S 2.1 — et par la clarification du rôle de NemoClaw, finalement bien différent de ce que laissaient entendre les premières annonces. À l’automne 2026, le DGX Spark n’est plus une simple promesse de salon : c’est une machine de production qui fait tourner des modèles de 120 à 400 milliards de paramètres, se clusterise en deux ou quatre nœuds, et dont l’écosystème logiciel a explosé. Décryptage de ce qui a vraiment changé entre février et septembre 2026.
De 3 999 à 4 699 dollars : une hausse qui a accéléré la maturation logicielle
Il faut se souvenir du contexte. Lancé en octobre 2025 à 3 999 dollars, le DGX Spark s’est imposé comme la machine de référence pour l’IA locale : un boîtier desktop de 140 W embarquant le SoC Grace Blackwell GB10, 128 Go de mémoire LPDDR5x unifiée et une puissance théorique d’un pétaflop en FP4. Une promesse séduisante : faire tourner des modèles jusqu’à 200 milliards de paramètres en inférence et en fine-tuner jusqu’à 70 milliards, le tout sur un bureau. Mais la réalité des premiers mois a été plus nuancée.
En février 2026, NVIDIA a augmenté le prix de 18 %, le faisant passer à 4 699 dollars, officiellement en raison de tensions d’approvisionnement en mémoire LPDDR5x. Cette hausse a été vécue comme une douche froide par une communauté qui commençait à pointer les limites de la machine : une bande passante mémoire de 273 Go/s jugée étroite pour les très gros modèles, un réseau inter-nœuds plafonné à 200 Gb/s effectifs (la faute au bus PCIe Gen5 x4), et une stack logicielle encore immature pour l’exploitation en cluster. Sur les forums NVIDIA, GitHub et Reddit, les retours se sont accumulés : des utilisateurs frustrés par des configurations réseau complexes, des temps de génération décevants sur les modèles 70B et une documentation jugée incomplète.
La réponse de NVIDIA est arrivée en juin 2026, sous la forme d’une mise à jour logicielle et matérielle d’ampleur. Au menu : l’activation pleine du format NVFP4 sur les cœurs Tensor de cinquième génération, un clustering multi-nœuds simplifié (de 2 à 8 machines) et un nouveau framework baptisé NemoClaw. Dans le même temps, l’annonce du RTX Spark — une plateforme pour laptops Windows grand public utilisant la même puce GB10 — a confirmé la stratégie : NVIDIA veut démocratiser l’IA locale, mais en segmentant clairement l’offre entre le DGX Spark professionnel et le RTX Spark grand public. Une manière de justifier le positionnement tarifaire du premier, tout en préparant le terrain pour le second.
Quatre mois plus tard, à l’automne 2026, le constat est nettement plus positif : la machine a gagné en maturité, les correctifs logiciels se sont enchaînés (notamment en juillet pour dompter les OOM — out-of-memory — qui plombaient l’expérience), et les modèles open-weight récents ont été conçus pour tirer parti du GB10. Les benchmarks indépendants affluent enfin, et ils sont bien meilleurs que ceux d’octobre 2025. Restent les limites structurelles — bande passante mémoire, réseau — mais l’écosystème a appris à les contourner.
NVFP4 sous le capot : le 1 PFLOP du GB10 enfin exploité, mais la mémoire reste le juge de paix
Le cœur de la mise à jour de juin 2026, c’est le NVFP4. Ce format de quantification en virgule flottante 4 bits, développé par NVIDIA, n’est pas une simple réduction de précision : il s’appuie sur une implémentation matérielle native dans les cœurs Tensor de cinquième génération du GB10. Là où le FP8 et le BF16 nécessitent des conversions et des calculs en virgule flottante plus coûteux, le NVFP4 exploite directement les unités de calcul 4 bits, doublant théoriquement le débit par rapport au FP8.
NVIDIA annonce un gain de performance allant jusqu’à 2,6 fois en débit pour l’inférence et le fine-tuning. Concrètement, cela signifie que des modèles comme Llama 3.1 70B, Qwen 2.5 72B ou Mistral Large — qui peinaient à dépasser quelques tokens par seconde en génération — peuvent désormais tourner dans des conditions acceptables en local, à condition d’accepter la quantification NVFP4. Les premiers testeurs rapportent une stabilité correcte, sans dégradation visible de la qualité sur des tâches courantes. Les mesures de perplexité commencent à arriver : pour Qwen3.6-27B, le score MMLU en NVFP4 est de 0,8446, un niveau tout à fait honorable pour une quantification 4 bits.
| Format | Précision | Débit relatif (annoncé) | Usage typique |
|---|---|---|---|
| BF16 | 16 bits | 1× | Fine-tuning, inférence haute précision |
| FP8 | 8 bits | ~1,3× | Inférence standard, entraînement mixte |
| NVFP4 | 4 bits | ~2,6× | Inférence à grande vitesse, modèles très volumineux |
Mais attention à ne pas surinterpréter. Le gain de 2,6× est un chiffre théorique, mesuré dans des conditions idéales. En pratique, la bande passante mémoire de 273 Go/s reste le facteur limitant pour la génération de tokens — un point que nous détaillerons plus loin. Le NVFP4 est un excellent outil pour le prefill (le calcul des tokens d’entrée), mais il ne fait pas des miracles sur le decode, qui reste contraint par la mémoire. C’est un coup de polish, certes, mais un coup de polish qui débloque des usages réels, notamment pour les modèles de 70 à 100 milliards de paramètres.
Benchmarks réels : Qwen3.8-27B, DeepSeek V4 Flash, Laguna S 2.1 — les modèles qui changent la donne
Parlons chiffres, car c’est là que le bât blesse — et que les choses ont radicalement évolué. Les benchmarks publiés par LMSYS en octobre 2025 montraient des performances spectaculaires en prefill : sur Llama 3.1 8B, le DGX Spark atteignait 10 256 tokens par seconde, un score comparable à celui du RTX Pro 6000 Blackwell. Mais ce chiffre, souvent mis en avant par NVIDIA, masquait une réalité plus contrastée : en génération (le decode), le même modèle plafonnait entre 20 et 368 tokens par seconde selon la configuration, et Llama 3.1 70B ne dépassait pas 2,7 tokens par seconde.
À l’automne 2026, le paysage a changé du tout au tout. Les modèles open-weight récents ont été conçus pour tirer parti du GB10, et les benchmarks indépendants se multiplient. Voici les chiffres les plus significatifs, issus des forums NVIDIA, des blogs spécialisés et des tests du magazine :
| Modèle | Paramètres | Débit sur 1× DGX Spark | Débit sur 2× DGX Spark | Source |
|---|---|---|---|---|
| Qwen3.8-27B | 27B | 34-38 tok/s (défaut), 48 tok/s (optimisé) | — | blog.openzeka.com, codersera |
| Qwen3.6-27B | 27B | 28-33 tok/s (session unique), 163 tok/s (peak decode) | — | faits datés 2026 |
| DeepSeek V4 Flash 0731 | 284B total / 13B actifs | ~30 tok/s (défaut), 59 tok/s (multi-agent), 1 000 tok/s prefill | ~30 tok/s (config modifiée) | forums NVIDIA, flowtivity.ai |
| Ant Ling-3.0-Flash | 124B-A5B (5B actifs) | 15-20 tok/s | — | forums NVIDIA |
| Poolside Laguna S 2.1 | 118B (MoE) | — | — | aimadetools, habr |
| Nemotron 120B MoE | 120B | ~34 tok/s (avec NVFP4) | — | NVIDIA / tests internes |
| Llama 3.1 70B | 70B | 2,7 tok/s (FP8) | — | void.ma (oct 2025) |
Le cas le plus intéressant est celui de Qwen3.8-27B, sorti en août 2026. Ce modèle de 27 milliards de paramètres, noté 52 sur l’Artificial Analysis Intelligence Index — premier de sa catégorie parmi les modèles open-weight — tourne à 48 tok/s sur un seul DGX Spark d’après le blog OpenZeka (26 août 2026), et à 34-38 tok/s en configuration par défaut. C’est un bond spectaculaire par rapport aux 2,7 tok/s de Llama 3.1 70B un an plus tôt. Le modèle supporte le speculative decoding MTP (Multi-Token Prediction), et sa variante Qwen3.8-Flash-Next MTP atteint 83 à 138 tok/s avec une accélération de 1,67× et zéro perte de qualité, selon les tests du 2 septembre 2026.
DeepSeek V4 Flash 0731 mérite aussi une attention particulière. Sorti le 31 juillet 2026, ce modèle open-weight de 284 milliards de paramètres au total mais seulement 13 milliards d’actifs (MoE) — 10× plus petit que Claude Opus en actifs — a été conçu pour le GB10. Sur un seul DGX Spark, les utilisateurs rapportent 1 000 tok/s en prefill et 59 tok/s en serving multi-agent (1er août 2026, forums NVIDIA). En configuration par défaut, il plafonne à 30 tok/s, mais une simple modification de configuration ramène l’acceptance à un niveau correct (31 juillet 2026). Le checkpoint officiel est en FP4+FP8 mixte : les poids des experts MoE sont stockés en FP4, le reste (attention, norm, router) en FP8. Une variante NVFP4 (nvidia/DeepSeek-V4-Flash-NVFP4) est également disponible, re-quantifiée par NVIDIA ModelOpt pour les GPU Blackwell.
Poolside Laguna S 2.1 (118B, MoE) est la première grande réponse occidentale aux modèles chinois open-weight : sortie le 23 juillet 2026, elle est présentée comme la plus puissante ouverture de poids occidentale depuis 11 mois, spécialisée en codage agentique. Elle tient dans un seul desktop, mais les benchmarks sur DGX Spark restent rares à ce jour.
Enfin, Ant Ling-3.0-Flash (124B-A5B, 5B actifs) tourne à 15-20 tok/s sur un Spark, un débit modeste mais utilisable pour de l’agentique.
Fine-tuning : l’exploit BF16 d’un 35B sur un seul Spark, et la maturité des outils
Le fine-tuning a longtemps été le parent pauvre du DGX Spark. Les premières tentatives se heurtaient à la bande passante mémoire et à une stack logicielle immature. En septembre 2026, la donne a changé : une démonstration remarquée a montré qu’il est possible d’affiner un modèle de 35 milliards de paramètres en pleine précision BF16, sans quantification, sur un seul Spark.

L’astuce ? Éviter le piège du mmap : le chargement par défaut des poids via memory-mapping fait planter le DGX Spark en OOM (out-of-memory) à cause de la fragmentation de la mémoire unifiée. La parade consiste à utiliser une méthode de chargement séquentiel qui évite la quantification forcée et permet de tenir un modèle 35B en BF16 dans les 128 Go unifiés. C’est un contournement logiciel, pas une modification matérielle, mais il change radicalement l’usage possible de la machine.
Les outils de référence pour le fine-tuning sur GB10 sont désormais bien identifiés : PyTorch DDP/FSDP pour le distribué, Unsloth pour la rapidité d’itération, et LLaMA-Factory pour la flexibilité. La documentation communautaire s’est étoffée — le wiki DeepWiki consacré au DGX Spark couvre désormais les workflows de fine-tuning en détail, avec des focus sur le Superchip GB10 (sm121) et ses 128 Go de mémoire unifiée.
Attention toutefois : le fine-tuning BF16 d’un 35B est un exploit, pas une routine. Pour les modèles plus gros, la quantification NVFP4 reste la voie royale, et le fine-tuning distribué sur cluster (DDP/FSDP) commence à peine à être documenté avec des benchmarks sérieux.
Clusters : 2 nœuds pour 284B, 4 nœuds pour 700B, mais avec quelles limites ?
La seconde grande nouveauté de juin 2026, c’est le clustering multi-nœuds. NVIDIA a revu sa copie pour rendre l’assemblage de plusieurs DGX Spark nettement plus simple. Le matériel, lui, n’a pas changé : chaque machine embarque une carte réseau intelligente ConnectX-7 avec deux baies QSFP56 à l’arrière. La subtilité, c’est que la bande passante effective est plafonnée à 200 Gb/s (soit 25 Go/s) à cause des liaisons PCIe Gen5 ×4 — une seule baie suffit donc pour atteindre cette limite. La seconde baie sert à la flexibilité de topologie, pas à doubler le débit.
Trois configurations sont documentées. La première, la plus simple : une liaison directe 200 Gb/s entre deux nœuds, idéale pour un cluster de deux machines. La deuxième : une topologie en anneau utilisant deux ports à 100 Gb/s chacun, sans commutateur, permettant de chaîner plusieurs Sparks. La troisième : une configuration à rôles partagés, où un port est dédié au clustering et l’autre au stockage NVMe-oF, pour mutualiser les données entre nœuds.
| Topologie | Ports utilisés | Débit | Usage recommandé |
|---|---|---|---|
| Liaison directe | 1× 200 Gb/s | 200 Gb/s | Cluster 2 nœuds |
| Anneau | 2× 100 Gb/s | 100 Gb/s par lien | Cluster 3-8 nœuds |
| Rôles partagés | 1× 100 Gb/s + 1× 100 Gb/s | 100 Gb/s + NVMe-oF | Stockage distribué + cluster |
Les capacités annoncées sont impressionnantes : avec deux nœuds, on atteint 256 Go de mémoire unifiée et une capacité théorique d’environ 140 milliards de paramètres en FP8 ; avec quatre nœuds, on parle de 512 Go et de modèles jusqu’à 700 milliards. Et les démonstrations récentes confirment la tendance : DeepSeek V4.1 Flash tourne sur 4 DGX Sparks (vidéo YouTube, septembre 2026), et le cas d’usage le plus documenté reste DeepSeek V4 Flash 0731 sur 2× DGX Spark — un déploiement d’agents IA privés avec Hermes Agent, décrit en détail sur les forums NVIDIA et chez flowtivity.ai (2 août 2026). Les retours mentionnent des enseignements concrets sur le KV-cache, le scheduling et l’utilisation de la mémoire unifiée (UMA).
Ce qui manque encore, c’est une mesure officielle de latence inter-nœuds en microsecondes, ainsi qu’un support pleinement documenté des configurations à 4 et 8 nœuds. Les tests indépendants, comme celui mené par StorageReview sur un cluster de deux Sparks (Dell, Gigabyte, HP), confirment que la liaison directe fonctionne bien pour l’inférence distribuée, mais les benchmarks d’entraînement distribué (PyTorch DDP/FSDP) restent rares. La prudence s’impose : ces chiffres sont des capacités annoncées, pas des performances mesurées.
Logiciels et écosystème : vLLM, Atlas, Uzu, llama.cpp, Ollama — le match de la maturité
L’écosystème logiciel a explosé en 2026, et c’est sans doute le changement le plus important. En septembre 2026, le paysage des moteurs d’inférence sur GB10 est le suivant :

- vLLM : le moteur de référence pour la production. Il ne tourne pas « out of the box » sur le GB10 — il faut une compilation adaptée — mais les recettes officielles existent désormais, y compris pour DeepSeek V4 Flash avec support du contexte 1M, du speculative decoding DSpark et des poids FP4+FP8. La page recipes.vllm.ai documente les quatre checkpoints (FP8 0731, FP8 Preview, NVFP4, DSpark) et leurs variantes.
- Atlas : le moteur maison de NVIDIA, optimisé pour le GB10, avec un support NVFP4 natif. C’est l’option la plus simple pour démarrer, mais la moins flexible.
- Uzu : un moteur émergent qui a fait sensation avec son implémentation du speculative decoding, d’abord pour Qwen3.6-27B, puis pour Qwen3.8-27B et Muse Glimmer (3 septembre 2026). Sur les puces Apple M5, il surperforme MTPLX ; sur GB10, les premiers tests sont prometteurs.
- llama.cpp : l’incontournable, avec le support GGUF et le MTP pour Qwen3.8-Flash-Next (83 à 138 tok/s, 2 septembre 2026).
- Ollama : la simplicité absolue, idéal pour découvrir, moins adapté aux charges lourdes.
En complément, LiteLLM et llama-swap forment un duo redoutable pour transformer les 128 Go du Spark en multiplexeur de modèles : on peut charger plusieurs petits modèles en parallèle et router les requêtes, une approche très prisée pour l’agentique. Côté CUDA, la version 13.4 est désormais bien supportée, et TensorRT-LLM a reçu des optimisations spécifiques pour le GB10. NVIDIA a également annoncé le 3 septembre 2026 une simplification de l’IA locale sur tous ses GPU avec 24+ Go de VRAM, avec des optimisations pour vLLM et llama.cpp — une bonne nouvelle pour l’écosystème dans son ensemble.
NemoClaw : le framework d’agents autonomes, pas un outil de fine-tuning
C’est sans doute la brique la plus attendue par la communauté — et la plus mal comprise. NemoClaw, présenté en juin 2026 comme un framework d’orchestration pour le DGX Spark, est en réalité un framework d’agents autonomes, conçu pour déployer des agents IA sécurisés et gouvernés, et non un outil de fine-tuning distribué. Les sources officielles de NVIDIA le décrivent ainsi : « Déployez des agents autonomes plus sécurisés à disponibilité permanente pour mettre en œuvre des workflows concrets avec des blueprints ouverts. » NemoClaw centralise une vaste sélection de blueprints ouverts pour la création d’agents autonomes, c’est-à-dire des systèmes d’IA toujours actifs et spécialisés dans un domaine à même de raisonner, de planifier et d’agir pour une exploitation dans des workflows concrets.
Concrètement, NemoClaw intègre des fonctionnalités de contrôle des environnements d’exécution (via NVIDIA OpenShell), de routage des modèles, d’exécution des compétences, de gestion des états et d’observabilité. Il s’appuie sur des composants existants — NVIDIA Agent Toolkit, NVIDIA Nemotron, NVIDIA NeMo — et permet d’exécuter des agents Hermes capables de s’auto-optimiser, en combinant la boucle de compétences et de mémoire de Nous Research avec les contrôles d’exécution d’OpenShell. Les développeurs peuvent s’appuyer sur des agents à disponibilité permanente qui apprennent de l’expérience, réutilisent des workflows fructueux et opèrent avec des barrières de confidentialité, de sécurité et d’inférence plus strictes.
Sur le DGX Spark, NemoClaw est particulièrement pertinent : avec 128 Go de mémoire unifiée et jusqu’à 1 pétaflop de calcul IA, un seul Spark peut exécuter l’intégralité de la pile NemoClaw — y compris Nemotron 120B MoE — localement. Le CLI NemoClaw (nemoclaw v1.0.0-preview) s’installe en une commande et crée une structure de projet avec des fichiers de configuration (nemoclaw.yaml), des politiques de sandbox (OpenShell), de réseau et de confidentialité (Privacy Router). Les blueprints incluent des agents spécialisés qui collaborent avec des agents généralistes de pointe, tout en maintenant le contrôle des actions sensibles et l’accès aux données conformément à la politique fixée.
Il faut donc corriger une idée reçue : NemoClaw n’est pas un framework de fine-tuning distribué, ni un moteur d’inférence à part entière. C’est un outil de gouvernance et d’orchestration d’agents, qui s’appuie sur des composants existants (vLLM, PyTorch, Nemotron) plutôt que de les remplacer. Les premiers retours, notamment sur les forums NVIDIA, saluent une nette simplification du déploiement d’agents, mais signalent aussi une documentation encore lacunaire sur les cas d’usage avancés. Pour le fine-tuning distribué, il faut se tourner vers PyTorch DDP/FSDP, Unsloth ou LLaMA-Factory, qui restent les outils de référence.
Le concurrent : AMD Strix Halo, le choix de 70-80 % des acheteurs
Il serait malhonnête de parler du DGX Spark sans évoquer son principal concurrent : l’AMD Ryzen AI Halo (Strix Halo), qui équipe des mini-PC comme le Framework Desktop ou le GMKtec EVO-X2. Avec 128 Go de LPDDR5X, une bande passante de 256 Go/s (légèrement inférieure aux 273 Go/s du GB10), un TDP de 55 W (120 W en boost) et un prix de 3 999 $, il fait tourner gpt-oss-120B à 34 tok/s — un score comparable au DGX Spark — pour 700 $ de moins.
Selon les données du magazine, 70 à 80 % des acheteurs de mini-PC IA en mai 2026 ont choisi Strix Halo plutôt que le DGX Spark. Les raisons : un prix plus bas, une disponibilité immédiate via plusieurs constructeurs (Framework, GMKtec, Acer), et un écosystème Windows/Linux dual-boot plus familier. Le DGX Spark conserve des avantages : le NVFP4 natif, le support NVIDIA de premier ordre (CUDA, TensorRT-LLM, NemoClaw), et une carte réseau ConnectX-7 intégrée qui facilite le clustering. Mais la concurrence est réelle, et elle pousse NVIDIA à innover plus vite.
Verdict : une machine enfin mûre, mais avec des limites structurelles assumées
Un an et demi après son lancement, le DGX Spark a tenu une grande partie de ses promesses. Les modèles MoE récents (DeepSeek V4 Flash, Qwen3.8-27B) tournent à des vitesses utilisables, le fine-tuning BF16 d’un 35B est possible avec les bonnes astuces, le clustering 2× et 4× fonctionne pour l’inférence distribuée, et l’écosystème logiciel (vLLM, Atlas, Uzu, llama.cpp, Ollama) a atteint une maturité respectable.
Reste les limites structurelles : la bande passante mémoire de 273 Go/s plafonne le decode, le réseau 200 Gb/s effectif bride l’entraînement distribué, et le prix de 4 699 $ reste élevé face à un Strix Halo à 3 999 $. Mais pour les développeurs qui veulent une machine de production pour l’agentique, l’inférence locale de gros modèles MoE et le fine-tuning haute précision, le DGX Spark est désormais un choix défendable — à condition d’accepter ses compromis.
La suite ? NVIDIA prépare la DGX Station pour Windows (GB300, 1 000 milliards de paramètres annoncés, lancement au quatrième trimestre 2026), qui éclipsera le Spark sur le papier. Mais à 4 699 $, le Spark reste la porte d’entrée la plus accessible vers l’IA locale sérieuse. Et avec l’arrivée de modèles toujours plus efficients (Qwen3.8, DeepSeek V4.1 Flash), il a encore de beaux jours devant lui.
Sources
- NVIDIA DGX Spark — page officielle
- DeepSeek V4 Flash — vLLM Recipes
- Qwen3.8-27B on DGX Spark — 48 tok/s (OpenZeka, 26 août 2026)
- DeepSeek V4 Flash 0731 sur 1× DGX Spark — forums NVIDIA (1er août 2026)
- Agent Serving sur 2× DGX Spark avec DeepSeek V4 Flash 0731 — forums NVIDIA (2 août 2026)
- DeepSeek V4 Flash 0731 sur Dual DGX Spark — flowtivity.ai (2 août 2026)
- Speculative decoding dans Uzu (3 septembre 2026)
- Qwen3.8-Flash-Next MTP : 1.67x speedup (2 septembre 2026)
- NVIDIA simplifie l’IA locale sur GPU 24+ GB VRAM (3 septembre 2026)
- Laguna S 2.1 — habr.com (23 juillet 2026)
- DeepWiki — Fine-tuning sur DGX Spark (12 août 2026)
- DeepWiki — DeepSeek V4 Flash 0731 sur un DGX Spark (12 août 2026)
- DGX Station for Windows — SiliconANGLE (1er juin 2026)
- DGX Spark vs RTX 5090 — blog.lalatendu.info (23 juillet 2026)
- DeepSeek V4 Flash expliqué — Ilisai
- DeepSeek-V4 : comment l’exécuter localement — Unsloth
- DGX Spark : 10 réglages IA locale — OutilsIA
Article recherché et rédigé automatiquement · Magazine Electrosens