NVIDIA DGX Spark · 9 September 2026DGX Spark en septembre 2026 : les LLM open-source qui tournent vraiment, du fine-tuning 8B aux clusters DeepSeek 284B
Et si un modèle de 8 milliards de paramètres, affûté par un full fine-tuning sur une machine de bureau à 3 500 $, pouvait rivaliser avec des géants comme Llama 70B sur des tâches de raisonnement ? C’est le pari que permet le NVIDIA DGX Spark, et les premiers retours de la communauté ouvrent une voie inédite pour la recherche en IA locale. Loin des clusters cloud coûteux, cette station de travail personnelle redéfinit ce qu’un petit modèle peut accomplir quand on lui donne les bons outils. Mais en septembre 2026, le DGX Spark n’est plus seulement une machine à fine-tuner des 8B : il exécute désormais des modèles MoE de 118 à 124 milliards de paramètres sur un seul nœud, agrège deux machines pour faire tourner DeepSeek V4 Flash-0731 (284B, 13B actifs), et bénéficie d’un écosystème logiciel mature (vLLM, TensorRT-LLM, Unsloth, Atlas) avec CUDA 13.4 en approche pour Windows on Arm. Plongée dans la plateforme qui démocratise l’IA open-source locale.
Le paradoxe du petit modèle… et l’explosion des grands
Jusqu’à récemment, le full fine-tuning d’un modèle de 8 milliards de paramètres (8B) était l’apanage des centres de données. Pour entraîner un Llama 3.1-8B sur l’ensemble de ses poids, il fallait au minimum plusieurs GPU A100 80 Go en parallèle, une infrastructure réseau rapide, et un budget de location qui pouvait dépasser les 10 000 $ par mois. Les stations de travail grand public, même équipées d’une RTX 4090 (24 Go de VRAM), restaient bloquées : la mémoire vidéo insuffisante interdisait de charger le modèle complet en précision 16 bits, et les techniques de réduction (LoRA, QLoRA) imposaient un compromis sur la qualité finale.
Le NVIDIA DGX Spark, dévoilé début 2025 et disponible depuis quelques mois, a cassé ce plafond de verre. Avec son SoC Grace Blackwell GB10, il embarque 128 Go de mémoire unifiée LPDDR5x, une bande passante de 273 Go/s, et une puissance théorique de 1 PFLOP en FP4 (512 TFLOPS en INT8) – le tout dans un format desktop d’environ 170 W TDP, pour environ 3 000–3 500 $ HT (3 200–3 800 € TTC selon SKU) outilsia.fr. Certains revendeurs affichent toutefois des prix plus élevés, jusqu’à environ 4 700 $ pour des configurations complètes explainx.ai. Cette mémoire unifiée, partagée entre CPU ARM 20 cœurs Neoverse V2 et GPU Blackwell, permet de charger un modèle 8B en FP16 (environ 16 Go de poids) avec de la marge pour les gradients, les optimiseurs et les données d’entraînement. Soudain, le full fine-tuning d’un modèle de raisonnement devient réalisable sur un bureau.
Mais en septembre 2026, le paysage a changé. Des modèles open‑weight comme Laguna S 2.1 (118B paramètres, architecture MoE), Ant Ling-3.0-Flash (124B-A5B) et Nemotron 3 Nano (30B MoE) tournent nativement sur le DGX Spark grâce à la quantification NVFP4 et aux optimisations des moteurs d’inférence. Mieux : DeepSeek V4 Flash-0731, un géant de 284B paramètres (13B actifs), s’exécute sur un cluster de deux DGX Spark avec des performances étonnantes flowtivity.ai. Le paradoxe s’inverse : ce n’est plus seulement le petit modèle spécialisé qui bat les géants, mais la plateforme elle-même qui rend les géants accessibles localement.
Anatomie d’une machine à raisonner : le GB10 sous la loupe (mise à jour septembre 2026)
Le cœur du DGX Spark est le SoC Grace Blackwell GB10, une architecture qui fusionne un CPU ARM à 20 cœurs Neoverse V2 (Grace) et un GPU basé sur l’architecture Blackwell (environ 6 144 cœurs CUDA, support FP4). Mais ce qui intéresse le fine-tuneur, c’est la mémoire unifiée : 128 Go LPDDR5x accessibles à la fois par le CPU et le GPU, sans copie explicite. Cette caractéristique est le vrai game-changer.
| Spécification | DGX Spark (GB10) | RTX 5090 | Mac Studio M4 Ultra |
|---|---|---|---|
| Mémoire | 128 Go unifiée | 32 Go VRAM | 64–128 Go unifiée |
| Bande passante | 273 Go/s | ~1 800 Go/s | ~800 Go/s |
| Précision native | FP4 (1 PFLOP), INT8 (512 TFLOPS) | FP4 (nouvelle génération) | FP16 (~31 TFLOPS) |
| TDP | ~170 W | 575 W | ~60 W |
| Prix | ~3 500 $ (jusqu’à 4 700 $) | ~2 000 $ | ~4 000–7 000 $ |
Tableau 1 : Comparaison des spécifications clés pour le fine-tuning. Sources : void.ma, outilsia.fr, iaboutique.fr, blog.lalatendu.info.
La bande passante de 273 Go/s est le principal goulot d’étranglement pour les gros modèles, comme le souligne l’analyse de Void.ma. Cependant, pour un modèle 8B en full fine-tuning, elle est suffisante : les poids (16 Go en FP16) et les gradients (16 Go) tiennent dans la mémoire, et les transferts entre CPU et GPU sont évités grâce à l’unification. En comparaison, une RTX 5090 avec 32 Go de VRAM peut charger un 8B en FP16, mais les buffers d’entraînement dépassent rapidement cette capacité ; il faut recourir à la précision mixte INT8 ou au sharding. Le Mac Studio M4 Ultra offre jusqu’à 128 Go unifiés, mais sa bande passante (~800 Go/s) et son GPU moins performant en INT8/FP4 limitent les vitesses d’entraînement iaboutique.fr.
La précision native FP4 du GB10 est une nouveauté prometteuse. Avec 1 PFLOP théorique, elle pourrait permettre d’entraîner des modèles en 4 bits sans perte excessive, réduisant encore la mémoire nécessaire. Cependant, à ce jour, les frameworks de fine-tuning (PyTorch, Hugging Face) ne supportent pas nativement le FP4 pour l’entraînement ; son usage est pour l’instant cantonné à l’inférence via TensorRT-LLM et vLLM. Les mises à jour récentes du DGX Spark (juin 2026) introduisent le support NVFP4 pour l’inférence et le serving, avec des gains de throughput notables chatforest.com. Pour le fine-tuning, la précision mixte FP16/INT8 reste la voie royale.
Écosystème logiciel : vLLM, TensorRT-LLM, Unsloth, Atlas et CUDA 13.4
En septembre 2026, le DGX Spark bénéficie d’un écosystème logiciel mature et en constante évolution. Voici les outils incontournables :
-
vLLM : officialise son support natif du DGX Spark en juin 2026 vllm.ai. Permet d’exécuter des modèles comme Laguna S 2.1 (118B) avec une latence inférieure à 100 ms par token grâce au PagedAttention et à la quantification FP4. Les benchmarks de la Spark Arena montrent un throughput de 15–20 tok/s pour Laguna S 2.1 en FP4, contre 2–3 tok/s pour un 70B dense sur la même machine ia-vox-magazine.com. Le blog officiel vLLM recommande de laisser
--gpu-memory-utilizationavec de la marge pour le système et le cache KV, et de garder--max-num-seqsbas, le Spark étant taillé pour le small-batch vllm.ai. Depuis la version 0.25, vLLM supporte nativement DeepSeek V4 Flash-0731 avec son module DSpark fusionné qdna.fr. -
TensorRT-LLM : le moteur d’inférence optimisé NVIDIA, désormais compatible avec le GB10. Il compile les modèles en un format optimisé pour le GPU Blackwell, exploitant les cœurs FP4 et INT8. Les gains par rapport à llama.cpp peuvent atteindre 40 % sur les modèles denses void.ma. La liste des modèles supportés officiellement s’est élargie en août 2026 (voir section modèles).
-
Unsloth : framework de fine-tuning LoRA/QLoRA, mis à jour pour le DGX Spark. Permet de fine-tuner un modèle 8B en LoRA en moins de 2 heures, et un full fine-tuning en 40–60 heures (voir section dédiée). Supporte le gradient checkpointing et DeepSpeed ZeRO-2 promptquorum.com. La version 2026.5.5 apporte des gains de vitesse de 2x par rapport à la baseline PyTorch, avec ~60 % de mémoire en moins local-llm.net. Le dépôt GitHub reste actif avec une UI locale pour entraîner et exécuter LLMs et modèles de diffusion github.com/unslothai/unsloth.
-
Axolotl : l’alternative YAML-driven pour les pipelines de fine-tuning multi-GPU. Là où Unsloth excelle en mono-GPU, Axolotl (version 0.16.1) prend en charge FSDP et DeepSpeed pour les clusters dev.to. Pour un cluster de DGX Spark, Axolotl est souvent préféré pour sa reproductibilité.
-
Atlas : le nouveau venu qui fait parler de lui. Écrit en Rust, sans dépendances Python/PyTorch, il se compile en moins de 2 minutes et promet un speedup de 2.8x par rapport à vLLM stock sur le GB10. Il atteint 100 tok/s sur Qwen3.6-35B en FP8 et 82 tok/s sur Qwen3-Next-80B. Pas de support multi-nœuds, mais une gestion mémoire unifiée via Kernel Hypercompilation. Installation :
uvx sparkrun setuppuissparkrun run @atlas/qwen3.6-35b-a3b-nvfp4. -
CUDA 13.4 : préinstallé sur le DGX OS (basé Ubuntu Server 24.04 ARM). NVIDIA a publié le 21 juillet 2026 un Developer Preview de CUDA 13.4 pour Windows on Arm, ciblant les futures machines RTX Spark techtimes.com. Cela prépare le portage des applications vers les PC Windows ARM équipés de puces RTX Spark. Sur le DGX Spark, les premiers retours indiquent une température idle de 36°C et une consommation de 3W, signe d’une excellente gestion thermique outilsia.fr.
-
Ollama : support ARM natif, permet de déployer des modèles en quelques commandes. Idéal pour les tests rapides.
-
llama.cpp : toujours actif, mais les performances sont inférieures à vLLM et TensorRT-LLM sur le GB10. Reste utile pour les modèles quantifiés en GGUF, notamment les nouvelles quantifications UD-Q8_K_XL pour DeepSeek V4 Flash forums.developer.nvidia.com.
-
Speculative decoding : la ruse qui change tout. Le GB10, colosse aux pieds de mémoire, plafonne en décodage natif à quelques tokens par seconde sur les très gros modèles. Le speculative decoding (draft model + vérification) permet de multiplier le débit par 2 à 3× sans sacrifier un token de qualité. vLLM, TensorRT-LLM et llama.cpp l’implémentent tous, avec des gains mesurés de 1,67× sur Qwen3.8-Flash-Next via Multi-Token Prediction banandre.com. Sur DeepSeek V4 Flash, le module DSpark fusionné dans le checkpoint joue précisément ce rôle qdna.fr.
Les modèles open‑weight stars du DGX Spark en septembre 2026
Le DGX Spark n’est plus limité aux modèles de moins de 10B. Grâce à l’architecture MoE et à la quantification NVFP4, il peut exécuter des modèles de 118 à 124B paramètres sur un seul nœud. Voici les modèles qui dominent les discussions de la communauté :
Laguna S 2.1 (118B MoE)
Sorti le 21 juillet 2026 par Poolside, Laguna S 2.1 est le premier grand modèle open‑weight américain depuis 11 mois. Avec 118B paramètres (architecture Mixture of Experts, 16 experts, 2 actifs par token), il tient dans 128 Go de mémoire unifiée grâce à la quantification FP4. Ses performances en codage (HumanEval pass@1 : 82 %, SWE-bench : 68 %) surpassent tous les modèles ouverts précédents, et rivalisent avec GPT-4o sur les tâches de programmation habr.com. Sur le DGX Spark, il atteint 15–20 tok/s en FP4 via vLLM, et 8–10 tok/s en FP16 (avec sharding mémoire) ia-vox-magazine.com.
Ant Ling-3.0-Flash (124B-A5B)
Sorti le 23 juillet 2026 par Ant Group, Ling-3.0-Flash est un modèle MoE de 124B paramètres avec 5B actifs (A5B). Il bat leur précédent modèle 1T sur presque tous les benchmarks, grâce à une architecture hybride linéaire-attention (couches KDA et MLA empilées 5:1) forums.developer.nvidia.com. Sur un seul DGX Spark, il atteint 15–20 tok/s en NVFP4, ce qui en fait un excellent candidat pour le codage et l’agentique local.
DeepSeek V4 Flash-0731 (284B, 13B actifs)
Le géant. DeepSeek a publié le 31 juillet 2026 la version officielle de son modèle Flash : 284 milliards de paramètres totaux, 13 milliards actifs par token, un million de tokens de contexte, poids mixtes FP4 + FP8 et module DSpark fusionné (décodeur spéculatif intégré au checkpoint). Les 48 fichiers safetensors pèsent 167 Go sur Hugging Face (relevé du 2 septembre 2026) qdna.fr. Sur un seul DGX Spark, des retours de la communauté rapportent 1 000 tok/s en prefill et 59 tok/s en serving multi-agents forums.developer.nvidia.com. En cluster de deux DGX Spark (256 Go agrégés, lien QSFP 200 Gb/s), il atteint des performances étonnantes pour l’agentique privée flowtivity.ai. Pour une exécution en précision lossless, la quantification UD-Q8_K_XL (162 Go) ne dépasse que de 7 Go la version Q4 forums.developer.nvidia.com.
Qwen3.8-27B : le nouveau champion du rapport qualité/performance
Sorti en août 2026 par Alibaba, Qwen3.8-27B est un modèle dense de 27 milliards de paramètres. Avec un score de 52 sur l’Artificial Analysis Intelligence Index, il se classe premier de sa catégorie parmi les modèles open-weight blog.openzeka.com. Sur le DGX Spark, il atteint 48 tok/s en NVFP4 via vLLM, et 34–38 tok/s en conditions réelles [faits datés 2026-08-20]. C’est le choix recommandé pour ceux qui veulent un modèle dense performant sans passer aux MoE.
Nemotron 3 Nano (30B MoE)
La famille Nemotron 3 de NVIDIA couvre du Nano (30B MoE) à l’Ultra. Le Nano, sorti en avril 2026, tourne nativement sur le DGX Spark avec un excellent rapport qualité/ressources. Il est particulièrement adapté aux agents autonomes et aux workflows de codage assisté.
Fine-tuning : Unsloth, LoRA, QLoRA et full fine-tune en BF16
Le fine-tuning reste la killer feature du DGX Spark. Avec 128 Go de mémoire unifiée, la machine permet ce qu’aucune station de travail grand public ne pouvait faire avant : le full fine-tuning d’un modèle 8B en BF16, sans quantification ni sharding.
Unsloth : la vitesse avant tout
Unsloth domine le fine-tuning mono-GPU. Ses kernels CUDA custom (attention, cross-entropy loss, RMS normalization, RoPE embeddings) éliminent les inefficacités de l’implémentation PyTorch standard. Résultat : 2× plus rapide que la baseline, avec ~60 % de mémoire en moins local-llm.net. Sur le DGX Spark, un LoRA sur modèle 8B se termine en moins de 2 heures ; un full fine-tuning en BF16 prend 40–60 heures selon la taille du dataset. Unsloth supporte DPO, ORPO et KTO pour l’alignement, et exporte en GGUF, safetensors ou adaptateurs LoRA.
Axolotl : la reproductibilité pour les clusters
Axolotl (version 0.16.1) est le choix des équipes qui veulent des pipelines reproductibles et multi-GPU. Configuré en YAML, il prend en charge FSDP et DeepSpeed, ce qui le rend indispensable pour les clusters de DGX Spark. Là où Unsloth excelle en mono-GPU, Axolotl gère la complexité des environnements distribués dev.to.
Full fine-tuning en BF16 : la promesse tenue
Le full fine-tuning d’un 8B en BF16 est la démonstration la plus spectaculaire du DGX Spark. Les poids (16 Go), les gradients (16 Go) et les optimiseurs (AdamW : 32 Go) tiennent dans les 128 Go de mémoire unifiée, avec de la marge pour les données. C’est ce qu’aucune RTX 5090 (32 Go VRAM) ne peut faire sans recourir à la précision mixte INT8 ou au sharding. La communauté rapporte des résultats convaincants : un modèle 8B fine-tuné en full sur le Spark rivalise avec des modèles 10× plus gros sur des tâches de raisonnement spécialisées.
Le RL entre en scène
Les articles du magazine signalent que le reinforcement learning (RL) ouvre de nouvelles possibilités sur le Spark. Unsloth supporte désormais DPO/ORPO/KTO, et les premiers retours indiquent que le RLHF sur modèle 8B est réalisable en moins de 24 heures sur la machine.
Clusters DGX Spark : de 2 à 100 nœuds
Le DGX Spark n’est pas seulement une machine autonome : c’est aussi un nœud de calcul pour clusters. NVIDIA a officialisé le support multi-nœuds en juin 2026, et la communauté a poussé l’expérimentation bien au-delà.

Le cluster 2× DGX Spark : le sweet spot
Deux DGX Spark reliés par un lien QSFP 200 Gb/s agrègent 256 Go de mémoire unifiée. C’est la configuration la plus populaire pour faire tourner DeepSeek V4 Flash-0731 (284B) avec des performances d’agentique privée convaincantes flowtivity.ai. Les retours de la communauté sur les forums NVIDIA détaillent les réglages de KV-cache, de scheduling et les findings UMA (Unified Memory Architecture) pour optimiser le serving multi-agents forums.developer.nvidia.com.
Au-delà de 2 nœuds
Les articles du magazine évoquent des clusters allant jusqu’à 100 nœuds pour des workloads d’entreprise. La gestion se fait via Progress Chef Enterprise Management, qui automatise le déploiement et la configuration à grande échelle. Pour le fine-tuning distribué, Axolotl avec FSDP/DeepSpeed est le framework de référence.
Le lien réseau : attention au goulot
Le lien 10GbE théorique plafonne à 1,25 Go/s, ce qui est très inférieur à la bande passante mémoire locale (273 Go/s). Pour les workloads qui nécessitent beaucoup de communication inter-nœuds (fine-tuning distribué), c’est le principal facteur limitant. En revanche, pour l’inférence (serving), le lien QSFP 200 Gb/s des configurations récentes est largement suffisant.
Perspectives : CUDA 13.4 sur Windows on Arm et la concurrence
NVIDIA prépare l’avenir avec CUDA 13.4 pour Windows on Arm, dont le Developer Preview est sorti le 21 juillet 2026 techtimes.com. Cela ouvre la voie à des machines RTX Spark sous Windows, élargissant encore l’écosystème.
La concurrence, elle, ne dort pas. L’AMD Ryzen AI Max+ 395 (Strix Halo) offre 128 Go LPDDR5X à 256 Go/s pour 3 999 $, et fait tourner gpt-oss-120B à 34 tok/s [faits datés 2026]. Le verdict communautaire de mai 2026 donnait 70–80 % de préférence au Strix Halo pour les usages généralistes, mais le DGX Spark reste le choix CUDA-only pour le fine-tuning intensif et vLLM optimisé outilsia.fr. Les mini-PC Acer et Gigabyte, attendus début 2027, devraient encore élargir le marché.
Conclusion : la promesse tenue, et amplifiée
Un an et demi après son lancement, le DGX Spark a tenu sa promesse initiale — et l’a dépassée. Ce n’est plus seulement la machine qui permet le full fine-tuning d’un 8B sur un bureau : c’est la plateforme qui exécute des MoE de 118–124B sur un seul nœud, agrège deux machines pour DeepSeek V4 Flash (284B), et bénéficie d’un écosystème logiciel en pleine maturité. Le paradoxe du petit modèle s’est inversé : ce n’est plus le modèle qui bat les géants, c’est la plateforme qui rend les géants accessibles localement. Pour les chercheurs, les développeurs et les entreprises soucieuses de souveraineté numérique, le DGX Spark est devenu, en septembre 2026, la référence de l’IA open-source locale.

Sources
- OutilsIA — DGX Spark : 10 réglages IA locale (2026)
- QDNA — DeepSeek V4 Flash 0731 sur DGX Station et cluster 2× DGX Spark (vLLM)
- vLLM Blog — vLLM DGX Spark (juin 2026)
- Flowtivity — DeepSeek V4 Flash 0731 on Dual DGX Spark
- Forums NVIDIA — 1x Spark: DeepSeek-V4-Flash-0731 @ 1,000 tok/s prefill
- Forums NVIDIA — Agent Serving on 2× DGX Spark
- Forums NVIDIA — DeepSeek-v4-Flash 0731 GGUF
- Forums NVIDIA — Ant Ling-3.0-Flash 124B-A5B
- Habr — Laguna S 2.1 (juillet 2026)
- Local-LLM.net — Unsloth vs Axolotl (2026)
- Dev.to — Unsloth vs axolotl 2026
- TechTimes — CUDA lands on Windows ARM (juillet 2026)
- OpenZeka — Qwen3.8-27B on DGX Spark (août 2026)
- Banandre — Qwen3.8-Flash-Next MTP (septembre 2026)
- Void.ma — NVIDIA DGX Spark : analyse production IA
- Iaboutique — DGX Spark vs Mac Studio
- Blog.lalatendu.info — DGX Spark vs RTX 5090 (2026)
- Chatforest — DGX Spark June 2026 Update
- GitHub — unslothai/unsloth
- ExplainX — NVIDIA DGX Spark Local LLM Best Setup 2026
Article recherché et rédigé automatiquement · Magazine Electrosens