NVIDIA DGX Spark · 6 September 2026DGX Spark en septembre 2026 : les LLM open source qui tournent vraiment sur GB10, le fine-tuning BF16 et les clusters multi-nœuds
Septembre 2026. Le DGX Spark de NVIDIA approche de son premier anniversaire, et le paysage des LLM open source a radicalement changé. Fini le temps où l’on se contentait de faire tourner un Llama 70B en Q4 avec 15 tokens/s. Aujourd’hui, la mini-station à 128 Go de mémoire unifiée accueille des modèles de diffusion capables de générer 256 jetons en parallèle, des MoE de 124 milliards de paramètres qui tiennent sur une seule machine, et se regroupe en clusters de 2, 4 voire 8 nœuds pour atteindre 700 milliards de paramètres. Plongée au cœur de la stack LLM open source qui tient vraiment la route sur GB10.
Le choc d’avril : pourquoi le DGX Spark a pris 700 $ de plus
Avant d’entrer dans le vif du sujet, un rappel s’impose. En avril 2026, NVIDIA a revu le prix du DGX Spark à la hausse : +700 $, portant le ticket à 4 699 $. Une décision qui n’a pas refroidi les développeurs, mais qui a repositionné la machine face à des concurrents comme le Mac Studio M5 Ultra ou les mini-PC AMD Strix Halo. Les variantes OEM — ASUS Ascent GX10, MSI EdgeXpert, Acer DGX — restent généralement 500 à 1 000 $ moins chères, comme le souligne OutilsIA, qui note aussi que 70 à 80 % des acheteurs de mai 2026 préféraient le Strix Halo pour un usage généraliste. Mais pour le fine-tuning intensif, vLLM optimisé et la recherche ML, le DGX Spark garde un avantage décisif : l’écosystème CUDA complet.
GB10 en 2026 : un an et demi de maturité logicielle
Sous le capot, rien n’a changé : la NVIDIA GB10 Grace Blackwell Superchip (sm121) associe 20 cœurs ARM Neoverse V2 à un GPU Blackwell d’environ 6 144 cœurs CUDA avec support FP4, le tout adossé à 128 Go de LPDDR5X unifiée à 273 Go/s et un TDP système d’environ 170 W. La machine tourne sous DGX OS, un Ubuntu Server 24.04 ARM, avec la pile NVIDIA AI Enterprise pré-installée : CUDA 13.0, cuDNN, NCCL, drivers Blackwell et Docker NVIDIA Container Toolkit. C’est cette maturité logicielle — acquise en dix-huit mois — qui fait la différence. Comme le rappelle Programmez!, NVIDIA a même annoncé pour l’automne 2026 une version Windows de sa plateforme DGX, avec une puce GB3000, élargissant encore l’attractivité de la gamme.
La révolution diffusion : quand les LLM génèrent en parallèle
Il y a des annonces qui passent inaperçues et qui méritent pourtant le détour. Le 20 mai 2026, la page recherche de NVIDIA s’enrichissait d’une publication sobrement intitulée « Nemotron-Labs-Diffusion : Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation » — un titre de papier académique qui cache une petite révolution. Sept semaines plus tard, le 7 juillet 2026, le preprint correspondant était déposé sur arXiv sous l’identifiant 2607.05722, et les poids du modèle apparaissaient sur Hugging Face sous licence NVIDIA Open Model License, une licence commerciale qui autorise une utilisation en entreprise.
Mais ce n’était que le début. Le 10 août 2026, Google DeepMind a riposté avec DiffusionGemma, un modèle ouvert expérimental conçu pour une génération de texte exceptionnellement rapide — et NVIDIA l’a immédiatement optimisé pour ses plateformes, y compris le DGX Spark. Plutôt que de générer du texte un mot à la fois, DiffusionGemma débruite jusqu’à 256 jetons par étape au lieu d’en prédire un à la fois. Basé sur Gemma 4, un modèle de mélange d’experts de 26 milliards de paramètres qui n’active que 3,8 milliards par étape, il associe une tête de diffusion à l’architecture Gemma 4 de Google. Les performances annoncées : jusqu’à 4× plus rapides que la génération autorégressive classique sur du matériel local. Et surtout, c’est un modèle à poids ouverts sous licence permissive Apache 2.0, qui s’exécute entièrement sur RTX et DGX Spark — sans cloud, ni coût par jeton — avec une prise en charge immédiate dans Hugging Face Transformers, vLLM et Unsloth.
Cette double annonce marque un tournant : la diffusion, longtemps cantonnée aux modèles d’images, s’impose comme une voie crédible pour l’inférence LLM locale. Et le DGX Spark, avec ses 128 Go de mémoire unifiée, est en première ligne.
Nemotron-Labs-Diffusion : le tri-mode qui bouscule l’autorégression
Pour comprendre ce que fait Nemotron-Labs-Diffusion, il faut oublier un instant le réflexe conditionnel qui domine l’inférence des LLM depuis GPT-2. Dans un modèle auto-régressif classique, chaque token est généré en conditionnant sur tous les précédents — une chaîne séquentielle qui borne le débit par la latence d’une seule passe avant. Tri-Mode, lui, peut basculer entre trois modes de génération à l’inférence, sans aucun changement de poids :

- Mode auto-régressif (AR) : le fonctionnement classique, token après token, utile pour les tâches où la précision séquentielle prime.
- Mode diffusion : la séquence est d’abord entièrement masquée, puis toutes les positions sont affinées simultanément, passe après passe. Les tokens à haute confiance sont « engagés » à chaque itération, ce qui permet de générer des blocs entiers en parallèle.
- Mode auto-spéculation : le module diffusion génère un brouillon (draft) complet en parallèle, puis le module AR vérifie ce brouillon en une seule passe. C’est le mécanisme de « self-drafting » — le modèle se draft lui-même, sans modèle auxiliaire externe.
Cette dernière propriété est cruciale. Les techniques de décodage spéculatif classiques (comme Medusa ou Eagle) nécessitent un modèle draft séparé, souvent plus petit, entraîné spécifiquement pour proposer des candidats. Tri-Mode élimine ce besoin : le draft et la vérification sont deux facettes du même réseau de neurones, entraîné conjointement pour les deux tâches. D’après TechTimes, qui a analysé le preprint, le processus de diffusion est multi-passes : il part d’une séquence masquée, raffine toutes les positions simultanément, et n’engage que les tokens dont la confiance est suffisante avant de repartir pour une nouvelle passe de raffinement.
Un détail intrigue : TechTimes affirme que l’architecture part du modèle de base Ministral3 de Mistral AI. Cette information n’est pas confirmée par la page officielle de NVIDIA, et aucune autre source indépendante ne la corrobore. Si elle se vérifie, cela signifierait que NVIDIA a pris un modèle auto-régressif existant et l’a ré-entraîné avec un objectif conjoint AR-diffusion, en adaptant probablement le tokenizer et les mécanismes d’attention pour supporter la génération non auto-régressive. Mais ces adaptations techniques ne sont documentées nulle part dans les sources disponibles — un manque qui laisse la place à toutes les spéculations.
5,9× plus de tokens par passe : décryptage des chiffres de performance
Les chiffres annoncés par NVIDIA sont alléchants. Sur la page officielle, on apprend que Nemotron-Labs-Diffusion-8B décode 5,9× plus de tokens par forward pass que Qwen3-8B, avec une meilleure précision. TechTimes arrondit à « six fois plus de tokens », et les deux sources concordent sur un débit 4× supérieur sur le benchmark SPEED-Bench, exécuté avec SGLang sur un GPU GB200. L’analyse « speed-of-light » menée par NVIDIA va encore plus loin : elle suggère un potentiel de 76,5 % de tokens en plus par forward pass par rapport à l’auto-spéculation avec un échantillonneur optimal.
Ces chiffres méritent d’être lus avec discernement. D’abord, le preprint arXiv du 7 juillet 2026 n’a pas encore été évalué par les pairs, et TechTimes le mentionne explicitement. Ensuite, aucune réplication indépendante n’existe à ce jour sur d’autres matériels — les benchmarks ont été réalisés sur un GB200, une puce data center qui n’a rien à voir avec une DGX Spark. Enfin, les sources ne s’accordent pas entre elles : CreativeAINews évoque un facteur 3× là où NVIDIA et TechTimes annoncent 4× à 6×. Cette discordance suggère que les conditions de mesure (quantification, longueur de séquence, batch size) influencent fortement les résultats.
Ce qui est certain, c’est que le mécanisme d’auto-spéculation change la donne théorique. Dans un décodage spéculatif classique, le draft model propose des candidats et le modèle principal les vérifie ; le gain dépend du taux d’acceptation des tokens proposés. Avec Tri-Mode, le draft et la vérification partagent les mêmes poids, ce qui devrait en théorie améliorer la cohérence entre les deux — le draft « sait » ce que le vérificateur acceptera. C’est élégant, mais cela reste à prouver sur des charges de travail réelles.
DiffusionGemma sur DGX Spark : ce que dit NVIDIA
Contrairement à Nemotron-Labs-Diffusion, DiffusionGemma bénéficie d’une optimisation officielle NVIDIA pour le DGX Spark. Le blog NVIDIA du 10 août 2026 est explicite : le modèle « s’exécute entièrement sur RTX et DGX Spark — sans cloud, ni coût par jeton ». Les fonctionnalités clés :

- Génération parallèle : débruite jusqu’à 256 jetons par étape au lieu d’un à la fois.
- Basé sur Gemma 4 : MoE de 26 milliards de paramètres, 3,8 milliards actifs par étape.
- Performances jusqu’à 4× plus rapides : là où la génération pour un utilisateur unique stagne généralement — sur du matériel local.
- Ouvert et local : licence Apache 2.0, prise en charge immédiate dans Hugging Face Transformers, vLLM et Unsloth.
Le modèle est disponible sur Hugging Face sous la référence nvidia/diffusiongemma-26B-A4B-it-NVFP4, avec une quantification NVFP4 pensée pour les GPU NVIDIA. C’est un signal fort : NVIDIA ne se contente plus de publier des papiers de recherche, il optimise activement des modèles de diffusion tiers pour sa plateforme.
Les modèles qui tournent vraiment sur GB10 en septembre 2026
Au-delà de la diffusion, le paysage des LLM open source sur DGX Spark s’est considérablement enrichi cet été. Voici les modèles qui font l’actualité :
DeepSeek V4 Flash 0731
Sorti fin juillet 2026, DeepSeek V4 Flash 0731 est un modèle MoE optimisé avec 13 milliards de paramètres actifs (sur ~284 milliards au total, selon la reproduction indépendante documentée sur DeepWiki). Il est conçu pour l’inférence locale et les agents IA privés. Sur un cluster de 2× DGX Spark, les utilisateurs des forums NVIDIA rapportent des performances intéressantes : le modèle atteint environ 30 tok/s en configuration par défaut, mais un changement de configuration (détaillé sur les forums) permet de remonter le taux d’acceptation et d’améliorer significativement le débit. Mieux : sur un seul Spark, un utilisateur a mesuré 1 000 tok/s en préfill et 59 tok/s en serving multi-agents avec un backend CUDA maison (source). Une quantification Q8 (UD-Q8_K_XL) à 162 Go est recommandée pour une précision sans perte, seulement 7 Go de plus que la Q4 (source).
Ant Ling-3.0-Flash 124B-A5B
Publié le 23 juillet 2026 par Ant Group, ce modèle de 124 milliards de paramètres avec 5 milliards actifs (A5B) bat leur précédent modèle 1T sur presque tous les benchmarks. Il utilise une attention hybride linéaire native : couches KDA et MLA empilées dans un ratio 5:1. Avec une fenêtre de contexte de 256K tokens (extensible à 1M), il tourne sur un seul DGX Spark à environ 15-20 tok/s — un exploit pour un modèle de cette taille (source). C’est le candidat idéal pour ceux qui veulent un modèle de très grande capacité sans passer au cluster.
Poolside Laguna S 2.1
Le 23 juillet 2026, Poolside a publié Laguna S 2.1, un modèle open-weight de 118 milliards de paramètres spécialisé en codage agentique. Présenté comme « la plus puissante ouverture occidentale depuis 11 mois », il bat des concurrents dix fois plus gros sur les benchmarks de codage (source). Son architecture MoM (Mixture-of-Memory) avec routeur token-choice et 256 experts le rend particulièrement efficace pour les tâches de programmation. Il tient dans un seul desktop — et donc potentiellement sur un DGX Spark, même si les benchmarks spécifiques GB10 ne sont pas encore publiés.
Les classiques toujours solides
Qwen3-8B reste une référence pour le débit brut, et Llama 4 8B (Q4) continue de bénéficier d’un écosystème logiciel mature. Mais l’arrivée de modèles spécialisés (codage, agents) et de modèles de diffusion change la donne : le choix ne se limite plus à « quel modèle fait 70B », mais à « quel modèle pour quel usage ».
Benchmarks réels : le tableau de bord de septembre 2026
Voici les chiffres mesurés ou rapportés par la communauté sur DGX Spark (configuration standard, 128 Go, pile logicielle NVIDIA de septembre 2026) :

| Modèle | Taille | Débit (tok/s) | Contexte | Notes |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | ~284B (13B actifs) | ~30 (2× Spark, défaut) → 59 (1× Spark, multi-agent) | 128K | Q8 à 162 Go recommandé |
| Ant Ling-3.0-Flash | 124B-A5B | 15-20 (1× Spark) | 256K (ext. 1M) | MoE hybride linéaire |
| DiffusionGemma | 26B-A4B | jusqu’à 4× plus rapide que AR | — | NVFP4, Apache 2.0 |
| Nemotron-Labs-Diffusion-8B | 8B | 50-70 (est. auto-spec) | — | Tri-mode, SGLang |
| Qwen3-8B | 8B | ~40-50 | — | Référence classique |
| Llama 4 8B (Q4) | 8B | ~95-110 (sur M5 Max) | — | Écosystème mature |
Sources : forums NVIDIA (DeepSeek V4 Flash, Ant Ling), blog NVIDIA (DiffusionGemma), nos estimations pour Nemotron-Labs-Diffusion.
Il faut noter que les chiffres de Nemotron-Labs-Diffusion sur DGX Spark restent des estimations : aucun benchmark indépendant n’existe encore sur GB10, les tests officiels ayant été réalisés sur GB200. La bande passante mémoire limitée du GB10 (comparée à un GB200) réduit mécaniquement l’avantage du parallélisme en mode diffusion, qui est particulièrement gourmand en accès mémoire.
Clusters DGX Spark : 2, 4, 8 nœuds, le réseau qui change tout
L’une des évolutions majeures de 2026 est la maturation du clustering. NVIDIA a publié une documentation complète sur la connexion de plusieurs DGX Spark via les ports 10GbE (débit théorique de 1,25 Go/s) — une annonce initiale de 100 GbE ayant été revue à la baisse, comme le rappellent les faits datés. En pratique, les clusters de 2, 4 ou 8 nœuds permettent de partitionner des modèles de 200 à 700 milliards de paramètres avec NeMo, vLLM et TensorRT-LLM. Le câble approuvé est l’Amphenol NJAAKK-N911 (400 mm, 32 AWG).
Les retours d’expérience sur les forums montrent que le clustering fonctionne bien pour l’inférence distribuée, mais que le fine-tuning multi-nœuds reste délicat : la bande passante réseau est le facteur limitant. Pour les charges de travail agentiques, un cluster de 2× Spark avec DeepSeek V4 Flash 0731 offre un excellent compromis, comme le détaille Flowtivity : 13B actifs, 10× plus petit que Claude Opus, avec Hermes Agent pour des agents privés on-premise.
Fine-tuning BF16 : l’exploit d’un 35B sur un seul Spark
Le fine-tuning local est l’autre grande avancée de 2026. Grâce à la mémoire unifiée de 128 Go et au support FP4, il est possible d’affiner un modèle de 35 milliards de paramètres en BF16 sur un seul DGX Spark, sans quantification. La documentation DeepWiki détaille les workflows : utilisation de LoRA/QLoRA, intégration avec Unsloth, et gestion du cache KV pour éviter les OOM. Unsloth propose d’ailleurs un guide complet pour affiner des LLM sur DGX Spark, avec des gains de vitesse significatifs par rapport aux méthodes classiques.
L’exploit BF16 d’un 35B sur un seul Spark a été confirmé par plusieurs utilisateurs : avec une configuration soignée (batch size adapté, gradient checkpointing), on peut affiner un modèle de cette taille en quelques heures. C’est un argument décisif face au Mac Studio, qui ne supporte pas CUDA et doit passer par MLX.
L’écosystème logiciel : la grande mue de 2026
La pile logicielle a considérablement évolué. Outre CUDA 13.0 et DGX OS, on note l’arrivée de CUDA 13.4 pour Windows sur Arm (première version préliminaire publiée le 22 juillet 2026), qui prépare l’arrivée des PC portables RTX Spark d’ASUS et MSI à l’automne (source). SEGA prend déjà en charge cette plateforme. Côté moteurs d’inférence, vLLM, llama.cpp, Ollama et SGLang sont tous optimisés pour ARM64, avec des performances comparables à x86 pour la plupart des modèles.
Le benchmark de Glukhov confirme que le DGX Spark surpasse le Mac Studio sur les charges CUDA-native, mais reste derrière sur les modèles MLX-optimisés. Le choix de la machine dépend donc avant tout de l’écosystème logiciel que vous utilisez.
Sources
- NVIDIA DGX Spark — page officielle
- Programmez! — actualités DGX Spark
- OutilsIA — 10 réglages IA locale sur DGX Spark
- Unsloth — Fine-tuning LLM avec DGX Spark
- StorageReview — performances CES 2026
- NVIDIA Blog — DGX Spark et modèles open source
- Glukhov — DGX Spark vs Mac Studio vs RTX 4080
- Frandroid — les deux premières machines NVIDIA
- Forums NVIDIA — DeepSeek V4 Flash 0731 sur 1× Spark
- Forums NVIDIA — DeepSeek V4 Flash 0731 sur 2× Spark
- Forums NVIDIA — Ant Ling-3.0-Flash 124B-A5B
- DeepWiki — awesome-dgx-spark
- DeepWiki — reproduction DeepSeek V4 Flash sur 1× Spark
- Flowtivity — DeepSeek V4 Flash sur 2× DGX Spark
- Les Numériques — RTX Spark sur Windows 11
Article recherché et rédigé automatiquement · Magazine Electrosens