Electrosens R&D
Electrosens NVIDIA DGX Spark · 13 September 2026

DGX Spark en septembre 2026 : les LLM open-source qui tournent vraiment, du fine-tuning BF16 aux clusters DeepSeek 284B

À l’automne 2026, le DGX Spark de NVIDIA n’est plus une simple promesse de salon : c’est une machine de production qui fait tourner des modèles de 120 à 400 milliards de paramètres, se clusterise en deux ou quatre nœuds, et se prête au fine-tuning en BF16 sans quantification. Mais entre les benchmarks marketing et la réalité des 273 Go/s de bande passante, entre les moteurs d’inférence qui s’accumulent (vLLM, Atlas, Uzu, llama.cpp) et les mises à jour qui corrigent enfin les OOM, que vaut vraiment cette station à 4 699 $ ? Plongée dans l’écosystème LLM open-source du GB10, chiffres vérifiés à l’appui.


Le GB10 en chiffres : 128 Go unifiés, 1 petaFLOP, mais un prix qui a grimpé

Le DGX Spark, dévoilé au CES 2025 sous le nom de Project DIGITS, est le premier boîtier compact de NVIDIA dédié à l’IA locale. Son cœur : le SoC GB10 Grace Blackwell, qui marie un CPU ARM 20 cœurs (10 Cortex-X925 + 10 Cortex-A725) à un GPU Blackwell de 6 144 cœurs CUDA, des Tensor Cores de 5e génération, et surtout 128 Go de mémoire LPDDR5x unifiée. Une configuration qui promet de charger des modèles jusqu’à 200 milliards de paramètres en local, grâce à une bande passante mémoire de 273 Go/s et une puissance de calcul IA culminant à 1 000 TOPS (1 petaFLOP en FP4 avec sparsité). Le tout dans un format de 150×150×50,5 mm, pour une consommation maximale de 240 W — même si la plupart des usages réels se situent autour de 170 W, comme le note OutilsIA.

Côté prix, le chemin a été mouvementé. Annoncé à 3 999 $ US lors de sa mise en vente le 15 octobre 2025, le DGX Spark a vu son tarif grimper à 4 699 $ US le 27 février 2026, selon AI Multiple, en raison de contraintes d’approvisionnement en mémoire. Ce prix est confirmé par plusieurs sources récentes : BetterClaw indique 4 699 $ en juillet 2026, et ExplainX évoque environ 4 679 $. En Europe, les estimations tournent entre 3 000 et 5 000 € TTC, avec une fourchette plus précise de 3 200 à 3 800 € TTC en France (source : OutilsIA.fr). Un investissement conséquent, mais qui inclut la machine, l’alimentation et le système d’exploitation DGX OS (Ubuntu 24.04 customisé).

Depuis mai 2026, trois variantes matérielles coexistent, fonctionnellement identiques (même puce GB10) : le NVIDIA DGX Spark officiel, le ASUS Ascent GX10 (clone licencié, généralement 500 à 1 000 $ moins cher, qualité de finition supérieure perçue), et les MSI EdgeXpert / Acer DGX (autres OEM, dispo limitée en Europe). Les mini-PC Acer et Gigabyte sont attendus pour début 2027. Tous tournent sous DGX OS avec le stack NVIDIA AI Enterprise pré-installé : CUDA 13.0, cuDNN, NCCL, drivers Blackwell et NVIDIA Container Toolkit.

Face à lui, le cloud propose des instances GPU à la demande : une A100 (80 Go) tourne autour de 3 à 5 $ de l’heure, une H100 (80 Go) entre 5 et 8 $, et une L40S (48 Go) environ 2 à 4 $. Pour une PME qui traite 1 million de tokens par jour, la facture mensuelle peut vite atteindre plusieurs centaines de dollars. Mais le cloud offre l’élasticité : on paie ce qu’on consomme, sans engagement.

Spécification DGX Spark Instance cloud typique (A100 80 Go)
Prix d’achat / coût horaire ~4 700 $ (unique) ~3-5 $/h
Mémoire 128 Go LPDDR5x unifiée 80 Go HBM2e
Bande passante mémoire 273 Go/s 2 039 Go/s
Puissance FP16 (approx.) ~50 TFLOPS (estimation) 312 TFLOPS (Tensor Core)
Consommation 170-240 W 400 W (sans refroidissement)
Modèles max (FP4) 200B paramètres 70B en FP16, 200B+ en quantized

Le premier constat saute aux yeux : le DGX Spark n’est pas un H100 de poche. Sa bande passante mémoire, 273 Go/s, est sept fois inférieure à celle d’une A100 (2 039 Go/s). C’est le principal goulot d’étranglement pour l’inférence de modèles volumineux. Mais il compense par une mémoire unifiée généreuse et un coût fixe.


Benchmarks réels : de 38 à 163 tokens/s selon le modèle et le moteur

Les benchmarks indépendants publiés depuis l’été 2026 permettent de se faire une idée précise des performances. Attention : les chiffres varient considérablement selon le runtime utilisé (vLLM, llama.cpp, TensorRT-LLM, Atlas, Uzu) et la quantification.

Source : morgannriu.fr

Sur un modèle 30B quantifié (type Llama 3 30B Q4), le DGX Spark atteint plus de 2 000 tokens/s en prefill (traitement du prompt) et entre 50 et 85 tokens/s en décodage (génération). Ces chiffres, issus d’un benchmark communautaire rapporté par CloudMagazin, le placent au même niveau qu’un Mac Mini M4 Pro et qu’une machine AMD Strix Halo sur le même modèle.

Pour des modèles plus gros, les performances s’effondrent logiquement. Selon les benchmarks LMSYS rapportés par Ixtria.ch :

  • Llama 3.1 8B : ~50-60 tokens/s en génération
  • Llama 3.1 70B : ~8-10 tokens/s
  • Modèles 120B+ : ~3-5 tokens/s

Mais les choses ont radicalement changé avec les modèles récents et les moteurs optimisés. Un test d’AI Multiple (juin 2026) sur GPT-OSS 120B donne 1 723 tokens/s en prefill et 38,55 tokens/s en génération – bien supérieur aux 124 tokens/s d’une configuration 3×RTX 3090. Le moteur Atlas, écrit en Rust, revendique 82 tokens/s sur Qwen3-Next-80B (été 2026) grâce à sa « Kernel Hypercompilation » – un chiffre impressionnant, mais qui reste à reproduire de manière indépendante.

Les modèles MoE (Mixture of Experts) récents sont particulièrement adaptés au GB10. Le Ant Ling-3.0-Flash 124B-A5B, sorti le 23 juillet 2026 par Ant Group, ne mobilise que 5B de paramètres actifs par token. Selon les tests non officiels rapportés sur les forums NVIDIA, il tournerait à 15-20 tokens/s sur un seul DGX Spark – un débit très correct pour un modèle de cette taille.

Le DeepSeek V4 Flash 0731, sorti le 31 juillet 2026, est le nouveau champion local. Ce MoE de 284 milliards de paramètres (13B actifs par token) avec un contexte d’un million de tokens et des poids mixtes FP4+FP8 (167 Go sur Hugging Face, relevé du 2 septembre 2026) tourne sur un seul Spark. Un test de la communauté (forums NVIDIA, 1er août 2026) rapporte 1 000 tokens/s en prefill et 59 tokens/s en serving multi-agents avec le moteur antirez/ds4. En configuration par défaut, il atteint environ 30 tokens/s, mais une modification de configuration (acceptance rate) le fait remonter à plus de 40 tokens/s, comme le documente un utilisateur des forums NVIDIA. La version Q8 (UD-Q8_K_XL, 162 Go) permet un fonctionnement en pleine précision sans perte, seulement 7 Go de plus que la Q4.

Les modèles Qwen récents excellent aussi sur le GB10. Le Qwen3.8-27B, sorti en août 2026, atteint 48 tokens/s sur un DGX Spark selon OpenZeka (test du 26 août 2026), avec un score de 52 sur l’Artificial Analysis Intelligence Index – premier de sa classe parmi les poids ouverts. Le Qwen3.6-27B (sorti le 22 avril 2026, version NVFP4 le 26 juin 2026) offre un pic de décodage à 163 tokens/s et une vitesse de génération de 28-33 tokens/s en session unique, 136 tokens/s avec 10 agents simultanés. Le support Multi-Token Prediction (MTP) pour Qwen3.8-Flash-Next, annoncé le 2 septembre 2026, fait passer le débit de 83 à 138 tokens/s en GGUF, sans perte de qualité (vérification exacte).

Le moteur Uzu a également ajouté le speculative decoding début septembre 2026, d’abord pour Qwen3.6 27B, avec un support de Qwen3.8 27B et Muse Glimmer annoncé. Sur les puces Apple M5, il surpasse MTPLX, mais les performances sur GB10 restent à documenter.

Comparons avec le cloud : une instance A100 (80 Go) peut générer 50-100 tokens/s sur un Llama 3 70B Q4 (selon les benchmarks de PromptQuorum), et une H100 monte à 100-200 tokens/s. L’écart est d’un facteur 5 à 20 en faveur du cloud pour les modèles lourds.

Modèle DGX Spark (tokens/s) Cloud A100 (tokens/s) Cloud H100 (tokens/s)
Llama 3.1 8B Q4 50-60 150-250 200-400
Llama 3.1 70B Q4 8-10 50-100 100-200
GPT-OSS 120B Q4 38,55 30-60 (estimation) 60-120 (estimation)
Ant Ling 124B-A5B 15-20 40-80 (estimation) 80-160 (estimation)
DeepSeek V4 Flash 0731 30-59 60-100 (estimation) 120-200 (estimation)
Qwen3.8-27B 48 100-150 (estimation) 200-300 (estimation)
Qwen3.6-27B (NVFP4) 28-33 (163 pic) 80-120 (estimation) 150-250 (estimation)

Sources : LMSYS, CloudMagazin, AI Multiple, PromptQuorum, forums NVIDIA, OpenZeka. Les chiffres cloud sont des ordres de grandeur issus de benchmarks publics.

Le verdict est clair : pour les modèles de moins de 30B, le DGX Spark offre un débit tout à fait acceptable pour un usage interactif (chat, RAG). Pour les 70B et plus, le cloud reste nettement plus rapide, sauf si l’on se contente de 8-10 tokens/s – ce qui peut suffire pour des tâches batch ou de l’analyse asynchrone. Mais avec les MoE récents (Ant Ling, DeepSeek V4 Flash, Qwen3.8), le Spark devient viable pour des usages agentiques en local, comme le démontre le test de Flowtivity sur deux Spark avec Hermes Agent.


Fine-tuning : l’exploit BF16 d’un 35B sur un seul Spark, et la maturité des outils

Le fine-tuning local a longtemps été le parent pauvre du DGX Spark. En septembre 2026, la donne a changé. Une démonstration récente, rapportée par notre magazine, a réussi l’exploit de fine-tuner un modèle de 35 milliards de paramètres en BF16 (pleine précision, sans quantification) sur un seul DGX Spark. Le modèle en question, Qwen3.5-35B-A3B, est un MoE qui n’active que 3B de paramètres par token – une architecture idéale pour la mémoire unifiée de 128 Go.

L’astuce clé : éviter le piège du mmap (memory mapping), qui fait planter le DGX Spark par défaut lors du chargement de gros modèles. En utilisant une astuce de chargement séquentiel, les 35B en BF16 (environ 70 Go) tiennent dans les 128 Go, laissant de la place pour l’optimiseur et le cache KV. La procédure, documentée dans notre article dédié, utilise Docker, Unsloth et des hyperparamètres LoRA précis. Résultat : un fine-tuning LoRA complet en quelques heures sur une machine de bureau.

Ce n’est pas un cas isolé. Le test FLUX 1-dev sur 40 images (rapporté dans notre article sur la mise à jour de juillet 2026) montre que le fine-tuning en conditions réelles fonctionne, avec des OOM (out of memory) désormais maîtrisés grâce aux correctifs de la mise à jour de juillet. Un test plus récent (novembre 2025, blog Mikihands) a comparé des adaptateurs LoRA FLUX 1-dev 12B générés sur DGX Spark avec 250, 500, 750 et 1 000 étapes, avec une consommation de seulement 90 W pendant l’apprentissage – une preuve de l’efficacité énergétique du GB10 pour ce type de charge.

La documentation communautaire s’est étoffée : le référentiel bidual/awesome-dgx-spark sur DeepWiki couvre désormais les workflows de fine-tuning sur GB10 (sm121) et sa mémoire unifiée de 128 Go. NVIDIA a également publié un guide officiel avec Unsloth pour l’ajustement fin des LLM sur DGX Spark, confirmant la maturité de la pile logicielle.

Les frameworks de fine-tuning ont également mûri. Un comparatif récent de MarkTechPost (juillet 2026) oppose Unsloth, Axolotl, TRL et LLaMA-Factory sur la vitesse, la VRAM et le multi-GPU. Unsloth reste le choix privilégié sur le Spark pour sa légèreté et sa compatibilité avec les MoE récents. Pour les clusters, le gain est mesuré : sur un cluster de deux DGX Spark, le fine-tuning QLoRA d’un Llama 3 70B voit son temps divisé par 1,8 par rapport à un seul nœud (source : notre article cluster).


Clusters DGX Spark : 2 nœuds pour 284B, 4 nœuds pour 700B, mais avec quelles limites ?

NVIDIA annonçait dès 2025 la possibilité de relier deux DGX Spark via ConnectX-7. En septembre 2026, les retours d’expérience concrets existent enfin. Notre magazine a documenté un cluster de deux Spark capable de faire tourner Qwen3.5-397B-A17B (397 milliards de paramètres, 17B actifs) et DeepSeek V4 Flash 0731 en conditions réelles. La Dre Dyson, ingénieure IA, a passé six mois à câbler l’ensemble : deux Spark reliés par QSFP112 DAC 200 Gbps RoCE sur ConnectX-7 (câble Amphenol NJAAKK-N911 approuvé, 400 mm, 32 AWG), avec un outil de configuration réseau nommé Cluster Assistant (sorti en juin 2026).

Source : youtube.com

Les résultats sont encourageants mais nuancés. Sur Qwen3.5-397B-A17B, le cluster atteint un débit utilisable pour de l’interaction asynchrone (quelques tokens/s), et surtout une inférence concurrente ×2 : deux requêtes simultanées sur deux modèles différents, chacun sur son nœud. Le gain en scalabilité est loin d’être linéaire pour un modèle unique partitionné – la bande passante inter-nœuds de ~12,5 Go/s (100 GbE) reste le facteur limitant, contre 900 Go/s en NVLink sur un cluster H100.

Pour DeepSeek V4 Flash 0731, le cluster de deux Spark est particulièrement pertinent : avec 256 Go de mémoire agrégée, on peut charger le modèle en Q8 (162 Go) avec un cache KV généreux. Le test de Flowtivity (2 août 2026) démontre des performances agentiques de niveau « frontier » avec Hermes Agent, grâce aux 13B de paramètres actifs – dix fois moins que Claude Opus. Un retour des forums NVIDIA (2 août 2026) nuance toutefois les chiffres de débit partagé : une relecture du benchmark d’overlap a révélé trois défauts de mesure, et les conclusions initiales sur le decode-share étaient trop optimistes. La prudence reste de mise sur les chiffres exacts, mais la faisabilité est confirmée.

Le coût matériel d’un cluster de 2 nœuds est de ~9 400 $ (2× 4 699 $ + câbles QSFP), et de ~18 800 $ pour 4 nœuds. NVIDIA annonce une capacité de ~700 milliards de paramètres pour un cluster de 4 Spark (juin 2026), mais aucun benchmark public ne confirme ce chiffre à ce jour. En pratique, le cluster de 2 nœuds est viable pour des modèles MoE de 300-400B en quantification agressive, ou pour exécuter plusieurs modèles en parallèle.

Critère Cluster DGX Spark (2 nœuds) Cluster cloud H100 (8 nœuds)
Interconnexion ConnectX-7 (100 GbE) NVLink + InfiniBand (400 Gb/s)
Bande passante inter-nœuds ~12,5 Go/s ~900 Go/s (NVLink)
Scalabilité Faible (estimation <1,5×) Quasi linéaire
Temps de déploiement Permanent (achat) Quelques minutes
Coût pour 70B ~9 400 $ (2× DGX) ~40 $/h (8× H100)

Pour une startup en hypercroissance qui doit scaler rapidement, le cloud reste imbattable. Pour un laboratoire de recherche qui a besoin d’une capacité de calcul prévisible et constante, un cluster de DGX Spark peut être envisagé, mais avec des performances très en deçà d’un cluster H100.


Logiciels et écosystème : vLLM, Atlas, Uzu, llama.cpp, Ollama — le match de la maturité

Le DGX Spark est livré avec DGX OS (Ubuntu 24.04 customisé) et la pile CUDA complète, identique à celle des GPU cloud. Mais l’écosystème logiciel a connu des évolutions majeures en 2026.

vLLM, le moteur d’inférence le plus populaire, ne tourne pas « out of the box » sur le GB10 : il nécessite des wheels custom et une compilation adaptée au GPU Blackwell SM12.1. Une fois configuré, il offre les meilleures performances en prefill, mais sa gestion de la mémoire unifiée reste perfectible, avec des risques de fragmentation. La version 0.25 ou plus est requise pour DeepSeek V4 Flash 0731, avec les conteneurs NVIDIA NGC arm64. NVIDIA a annoncé début septembre 2026 des optimisations vLLM et llama.cpp pour ses plateformes RTX et DGX, simplifiant l’IA locale sur les GPU avec 24+ Go de VRAM.

llama.cpp reste le choix de la simplicité et de la fiabilité, avec un support MTP pour Qwen3.8-Flash-Next (83 à 138 tok/s en GGUF). C’est souvent le premier moteur qui fonctionne, et sa compatibilité avec les formats GGUF en fait un outil universel.

Atlas, le moteur Rust, a fait une entrée remarquée avec sa « Kernel Hypercompilation ». Il revendique 82 tokens/s sur Qwen3-Next-80B, mais son grand absent reste le fine-tuning : Unsloth et Axolotl comblent ce vide. Son installation se fait en deux minutes, un pari de simplicité qui séduit.

Uzu a ajouté le speculative decoding début septembre 2026, d’abord pour Qwen3.6 27B, avec un support de Qwen3.8 27B et Muse Glimmer annoncé. Sur les puces Apple M5, il surpasse MTPLX, mais les performances sur GB10 restent à documenter.

Ollama reste l’outil d’initiation par excellence, avec des modèles ARM pré-packagés. Pour les utilisateurs avancés, LiteLLM et llama-swap forment un duo puissant : ils transforment les 128 Go de mémoire unifiée en multiplexeur de modèles, permettant de servir plusieurs modèles simultanément sur le même Spark.

La mise à jour de juillet 2026 a corrigé les OOM (out of memory) qui empoisonnaient les sessions de fine-tuning. La mise à jour de septembre 2026 apporte des optimisations supplémentaires pour vLLM et llama.cpp sur les plateformes RTX et DGX, selon Wccftech. CUDA 13.4 est désormais disponible, avec TensorRT-LLM et le speculative decoding intégré.


Le concurrent : AMD Strix Halo, le choix de 70-80 % des acheteurs

Il serait malhonnête de ne pas mentionner le principal concurrent du DGX Spark : l’AMD Ryzen AI Max+ 395 (Strix Halo). Avec 128 Go LPDDR5X, une bande passante de 256 Go/s, 16 cœurs Zen 5, 40 CUs RDNA 3.5 et un TDP de 55-120 W, il offre des performances comparables pour un prix inférieur (3 999 $). Selon OutilsIA, 70-80 % des acheteurs en mai 2026 préfèrent le Strix Halo au DGX Spark, principalement pour son support Windows 11 natif et son prix plus bas. Sur GPT-OSS 120B, il atteint 34 tok/s contre 38,55 sur le Spark – un écart minime. Le AMD Ryzen AI Max+ PRO 495, attendu pour Q3 2026, supportera jusqu’à 192 Go de mémoire et des modèles de 300 milliards de paramètres.

Source : void.ma

Le choix entre les deux se résume à l’écosystème : CUDA et le stack NVIDIA complet (vLLM optimisé, TensorRT-LLM, NCCL) pour le Spark ; Windows 11, prix plus bas et polyvalence pour le Strix Halo. Pour un workflow CUDA-only spécifique (fine-tuning intensif, recherche ML), le Spark reste le choix logique.


Verdict : une machine enfin mûre, mais qui reste un choix de niche

En septembre 2026, le DGX Spark a tenu ses promesses. Les correctifs de juillet ont dompté les OOM, les moteurs d’inférence se sont multipliés (vLLM, Atlas, Uzu, llama.cpp), et les modèles MoE récents (DeepSeek V4 Flash 0731, Qwen3.8-27B, Ant Ling) exploitent enfin sa mémoire unifiée de 128 Go. Le fine-tuning BF16 d’un 35B sur un seul nœud est un exploit réel, et les clusters de deux Spark font tourner des modèles de 284 à 397 milliards de paramètres.

Mais les limites restent structurelles : la bande passante de 273 Go/s plafonne tout, la scalabilité multi-nœuds est faible, et le prix de 4 699 $ le place dans une catégorie où le cloud offre plus de puissance pour un coût d’usage comparable. Pour un développeur individuel ou une petite équipe qui veut la souveraineté numérique, c’est une machine remarquable. Pour une entreprise qui scale, le cloud reste imbattable.

Le DGX Spark n’est pas un H100 de poche. C’est un outil de précision pour ceux qui savent exactement ce qu’ils veulent en faire – et qui acceptent ses compromis.


Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *