Electrosens R&D
Electrosens NVIDIA DGX Spark · 31 August 2026

DGX Spark en août 2026 : DeepSeek V4 Flash 0731, fine-tuning BF16 et clusters enfin matures — le GB10 a-t-il tenu ses promesses ?

Un an et demi après son annonce au CES 2025, le DGX Spark de NVIDIA a-t-il enfin tenu ses promesses ? Entre benchmarks impressionnants sur les modèles MoE récents comme DeepSeek V4 Flash 0731 et Ant Ling-3.0-Flash, mises à jour logicielles qui décuplent les performances, clustering multi-nœuds enfin mature et fine-tuning BF16 d’un 35B sur un seul boîtier, le mini-supercalculateur s’impose comme la référence de l’IA locale. Mais les limites — bande passante réseau, débits de génération, prix en hausse — restent bien réelles. Plongée dans l’état des lieux complet, en août 2026.


Le rêve d’un cluster IA local : le DGX Spark a-t-il changé la donne ?

Quand NVIDIA a dévoilé le DGX Spark en 2025, l’appareil a fait l’effet d’une petite révolution. Pour la première fois, un ordinateur de bureau – compact, silencieux, consommant 240 W – promettait de faire tourner des modèles de langage de taille respectable sans dépendre du cloud. La puce GB10 Grace Blackwell, avec ses 20 cœurs ARM (10 Cortex-X925 + 10 Cortex-A725), son GPU Blackwell capable d’1 PFLOP en FP4 et ses 128 Go de mémoire unifiée LPDDR5X, offrait un terrain de jeu inédit aux développeurs, chercheurs et petites structures.

Mais très vite, une limite est apparue : la mémoire. 128 Go, c’est suffisant pour des modèles denses jusqu’à environ 200 milliards de paramètres en FP4, ou des MoE (Mixture of Experts) de 100 à 130 milliards. Pour aller au-delà – un Llama 3.1 405B, un DeepSeek-V3 671B – il fallait soit du cloud, soit… plusieurs DGX Spark. Or, au lancement, le clustering n’était pas supporté. Chaque Spark restait une île.

La donne a changé en juin 2026. NVIDIA a publié une mise à jour majeure du logiciel système, présentée au Computex 2026, qui introduit un assistant de configuration multi-nœuds dans l’application NVIDIA Sync. Soudain, relier deux, trois ou quatre Sparks via leurs ports QSFP est devenu une procédure guidée, presque aussi simple que de brancher un câble Ethernet. Le rêve d’un cluster IA local, modeste mais réel, prenait forme.

En août 2026, ce rêve est devenu une réalité tangible. Les retours d’expérience se multiplient, les benchmarks indépendants commencent à émerger, et des modèles récents comme DeepSeek V4 Flash 0731 (13B paramètres actifs) ou Ant Ling-3.0-Flash (124B-A5B) tournent nativement sur un ou deux Sparks. Le DGX Spark n’est plus une promesse : c’est une plateforme mature, avec ses forces et ses faiblesses documentées.


GB10, 128 Go, ConnectX-7 : anatomie d’une brique de cluster

Avant de parler de cluster, il faut comprendre ce qui se cache sous le capot d’un seul DGX Spark. Les spécifications, désormais bien documentées, en font une machine étonnamment dense.

Débit de génération (tok/s) sur un seul DGX SparkLlama 3.1 8B50tok/sLlama 3.1 70B8tok/sGPT-OSS-120B (MoE)25tok/sDeepSeek V4 Flash 073130tok/sQwen3-Next-80B82tok/s
Composant Détail
SoC NVIDIA Grace Blackwell GB10 (20 cœurs ARM : 10 Cortex-X925 + 10 Cortex-A725)
Mémoire unifiée 128 Go LPDDR5X, interface 256 bits, 4266 MHz, bande passante 273 Go/s
Puissance de calcul 1 PFLOP FP4 (1 000 TOPS en inférence)
Stockage 1 To ou 4 To NVMe M.2 avec auto-chiffrement
Réseau ConnectX-7 SmartNIC : 2 ports QSFP56 (200 Gb/s chacun), 1× RJ-45 10 GbE, Wi-Fi 7, Bluetooth 5.4
Connectivité 4× USB Type-C, 1× HDMI 2.1a, audio multicanal HDMI
Traitement vidéo 1× NVENC, 1× NVDEC
Consommation 240 W (max)
Prix ~3 999 $ au lancement, porté à ~4 699 $ en février 2026 (pénurie mémoire), ~4 679 $ selon les revendeurs en août 2026

Le cœur du système, c’est le ConnectX-7. Cette carte réseau intégrée gère deux baies QSFP56, chacune capable de 200 Gb/s en configuration Ethernet. Mais attention : la bande passante effective est limitée par le bus PCIe Gen5 x4 qui relie le ConnectX-7 au reste du système. En pratique, chaque port plafonne à 200 Gb/s, et l’agrégation des deux ports ne double pas la bande passante vers le CPU/GPU – elle sert surtout à offrir de la redondance ou des topologies spécifiques.

C’est cette limitation qui va conditionner toutes les performances du clustering. Pas de NVLink 5, pas d’InfiniBand NDR400, pas d’Ethernet 800G : le DGX Spark parle exclusivement Ethernet 200 Gb/s entre ses nœuds. Un choix pragmatique pour un appareil grand public, mais qui bride les ambitions.


Le guide officiel de clustering NVIDIA décrit plusieurs topologies. La plus simple : un câble QSFP112 DAC (400 Gb/s négocié à 200 Gb/s) entre deux Sparks, en liaison directe. Les câbles approuvés sont l’Amphenol NJAAKK-N911 et le Luxshare LMTQF022-SD-R, tous deux de 400 mm. Avec cette configuration, NVIDIA annonce qu’il est possible d’exécuter des modèles jusqu’à 405 milliards de paramètres – soit le double de la capacité d’un seul nœud.

Pour trois Sparks ou plus, deux options : une topologie en anneau où chaque Spark utilise un port à 100 Gb/s (l’autre port reste libre), ou l’utilisation d’un commutateur Ethernet 200 Gb/s. Le guide mentionne des playbooks « Connect Two Sparks », « Connect Three Sparks » et « Multi Sparks Through a Switch », mais sans détailler les performances attendues.

La communauté a depuis affiné ces topologies. Le guide de terrain publié par notre magazine en juillet 2026 distingue deux approches qui divisent les utilisateurs :

  • Full-mesh : chaque Spark est relié à tous les autres. Pour 4 nœuds, il faut 6 câbles. La bande passante est maximale, mais le câblage devient vite ingérable au-delà de 4 nœuds.
  • Étoile (via switch) : un commutateur Ethernet 200 Gb/s centralise les connexions. Plus simple à étendre, mais le switch devient un point de défaillance unique et ajoute de la latence.

Le firmware a également fait parler de lui. Les playbooks officiels ont connu plusieurs versions, et certains utilisateurs ont signalé des incohérences entre les versions documentées et celles réellement déployées. La chasse aux « versions fantômes » est devenue un sport communautaire, comme le relate notre dossier de juillet.

Ce qui frappe, c’est l’absence de benchmarks de latence ou de bande passante inter-nœuds dans les sources officielles. Les tests indépendants, comme celui de StorageReview, confirment la faisabilité technique mais ne fournissent pas de chiffres précis. Le blog byteiota.com évoque « Four Nodes, 700B Models Locally » sans donner de débit. Bref, on sait que ça marche, mais on ne sait pas à quelle vitesse.

Topologie Bande passante par lien Nombre de nœuds max documenté
Liaison directe 200 Gb 200 Gb/s 2
Anneau 2×100 Gb 100 Gb/s par lien 3+ (sans commutateur)
Full-mesh 200 Gb/s par lien 4 (6 câbles)
Via commutateur 200 Gb 200 Gb/s 4+ (limité par le nombre de ports du switch)

L’absence de NVLink est un vrai frein. Sur les DGX stations professionnelles, NVLink offre une bande passante de 900 Go/s entre GPU. Ici, on se contente de 25 Go/s (200 Gb/s) – un rapport de 1 à 36. Pour des modèles qui nécessitent un échange intensif de gradients ou d’activations, la latence réseau devient le goulot d’étranglement.


Performances réelles : les benchmarks qui changent la donne en août 2026

Sur un seul nœud

Les chiffres solides sur un seul nœud se sont considérablement enrichis depuis juin. Plusieurs sources s’accordent désormais sur des ordres de grandeur précis, notamment pour les modèles MoE récents.

Source : developer.nvidia.com
Modèle Débit (tok/s) Source
Llama 3.1 8B 50–60 Ixtria (benchmark LMSYS, SGLang)
Llama 3.1 70B 8–10 Ixtria
Llama 3.3 70B (dense) 3–4 IAboutique
GPT-OSS-120B (MoE) 25–35 (jusqu’à 80+ selon quantification) IAboutique / ExplainX
Modèles 120B+ denses 3–5 Ixtria
Modèle 30B (prefill) >2000 tok/s Cloudmagazin (benchmark communautaire)
Modèle 30B (decode) 50–85 tok/s Cloudmagazin
DeepSeek V4 Flash 0731 ~30 tok/s (par défaut), jusqu’à ~40 avec config Forums NVIDIA (juillet 2026)
Ant Ling-3.0-Flash (124B-A5B) 15–20 tok/s (estimé) Forums NVIDIA (juillet 2026)
Qwen3-Next-80B (via moteur Atlas) 82 tok/s Été 2026

La discordance sur le 70B (8-10 vs 3-4 tok/s) s’explique probablement par des différences de quantification, de framework ou de longueur de prompt. Ce qui est certain, c’est que les modèles MoE tirent mieux parti de la mémoire unifiée : avec 5B paramètres actifs par token, un GPT-OSS-120B atteint 25-35 tok/s, soit l’équivalent d’un petit modèle dense.

DeepSeek V4 Flash 0731 mérite une attention particulière. Ce modèle, sorti officiellement le 31 juillet 2026, ne compte que 13 milliards de paramètres actifs par token – dix fois moins que Claude Opus – tout en offrant des performances agentiques de niveau frontière (benchmark CyberGym : 76,7). Sur un DGX Spark, il atteint environ 30 tok/s en configuration par défaut, et un utilisateur des forums NVIDIA rapporte qu’un petit changement de configuration (pour restaurer l’acceptance rate) permet de dépasser ce chiffre. En quantification Q8 (UD-Q8_K_XL, 162 Go), il tient encore dans un seul Spark, mais il faut alors accepter un débit réduit. Le modèle totalise 284 milliards de paramètres, avec un contexte d’un million de tokens et des poids mixtes FP4 + FP8 (environ 83,4 Go sur Hugging Face). Le module DSpark, un décodeur spéculatif fusionné dans le checkpoint, est inclus.

Ant Ling-3.0-Flash, publié par Ant Group le 23 juillet 2026, est un autre candidat sérieux. Avec 124B paramètres totaux mais seulement 5B actifs (A5B), il bat son prédécesseur 1T sur presque tous les benchmarks, et tourne sur un seul Spark à 15-20 tok/s estimés. Son architecture hybride (KDA et MLA empilés 5:1) le rend particulièrement adapté à l’inférence locale. Son contexte natif de 256K tokens, extensible à 1M, en fait un outil précieux pour les tâches de long contexte.

Le cas du prefill et du decode

Un benchmark communautaire récent, relayé par notre dossier sur la mise à jour de juin 2026, révèle un écart spectaculaire entre prefill et génération : prefill à 10 000 tok/s, mais génération à 2,7 tok/s sur certains modèles lourds. Ce n’est pas une anomalie : c’est la conséquence directe de l’architecture mémoire unifiée. Le prefill est limité par le calcul (et le GB10 est puissant), tandis que le decode est limité par la bande passante mémoire (273 Go/s, bien en deçà des 800 Go/s d’un Mac Studio M2 Ultra). Pour des tâches de génération longue, ce déséquilibre peut être rédhibitoire.

Pour DeepSeek V4 Flash 0731, un utilisateur des forums NVIDIA a publié le 1er août 2026 un benchmark détaillé : 1 000 tok/s en prefill et 59 tok/s en multi-agent serving sur un seul Spark, grâce à un fork du moteur antirez/ds4 avec backend CUDA maison. Ces chiffres, bien supérieurs aux 30 tok/s par défaut, montrent le potentiel du matériel quand le logiciel est optimisé.

En cluster

Avec deux DGX Spark, la capacité mémoire double (256 Go), permettant d’accueillir des modèles jusqu’à 405B paramètres en FP4, ou ~140B en FP8. Mais quel débit ? Les premiers retours d’expérience commencent à émerger.

Un utilisateur des forums NVIDIA a publié début août 2026 un retour détaillé sur DeepSeek V4 Flash 0731 en configuration 2× DGX Spark avec KV-cache, scheduling et analyse UMA. Ses conclusions : le modèle tourne, mais le KV-cache et le scheduling deviennent les facteurs limitants. Un autre retour, via le dépôt GitHub Mjxkill/deepseek-v4-flash-2x-dgx-spark, documente une configuration fonctionnelle avec Hermes Agent pour des agents IA privés.

Le blog flowtivity.ai résume bien l’intérêt : « DeepSeek V4 Flash 0731 offre des performances agentiques de niveau frontière avec 13B paramètres actifs, 10× plus petit que Claude Opus. Nous l’exécutons sur deux DGX Spark avec Hermes Agent pour des agents IA privés et sur site. »

Pour les clusters de 4 ou 16 nœuds, le silence est encore quasi total. Aucune donnée de scalabilité, de latence ou de débit n’est disponible dans les sources consultées. La comparaison avec le cloud (A100, H100) est également absente. On peut supposer que le débit par token sera limité par la bande passante réseau, mais c’est une conjecture.

Configuration Capacité max (paramètres) Débit documenté
1 DGX Spark ~200B denses / 130B MoE Oui (voir tableau)
2 DGX Spark ~405B (FP4) / ~140B (FP8) Partiel (DeepSeek V4 Flash 0731)
4 DGX Spark ~700B (annoncé) Non
16 DGX Spark Non documenté Non

Logiciels et frameworks : NeMo, vLLM, llama.cpp et la nouvelle stack NemoClaw

Le clustering matériel n’est rien sans la pile logicielle. NVIDIA a bien compris le message et a considérablement étoffé son offre depuis juin 2026. La stack officielle repose sur les conteneurs NGC arm64, avec vLLM 0.25 ou plus comme moteur d’inférence de référence. Les recettes officielles pour DeepSeek V4 Flash 0731 sont disponibles sur vLLM Recipes, ce qui simplifie grandement le déploiement.

Côté fine-tuning, la solution Unsloth s’est imposée comme la plus accessible. Le tutoriel officiel propose un Dockerfile prêt à l’emploi basé sur nvcr.io/nvidia/pytorch:25.09-py3, avec CUDA 13.0, Triton compilé depuis la source pour Blackwell, et xformers adapté. L’installation se fait en quelques commandes :

sudo apt update && sudo apt install -y wget
wget -O Dockerfile "https://raw.githubusercontent.com/unslothai/notebooks/main/Dockerfile_DGX_Spark"
docker build -f Dockerfile -t unsloth-dgx-spark .

Le notebook de démonstration permet de faire du reinforcement learning sur gpt-oss 20B (jeu 2048) directement sur le Spark. Les benchmarks d’Unsloth montrent des débits impressionnants : 680 tok/s en batch 64 pour l’inférence, et 2 700 tok/s en prefill heavy – des chiffres qui placent le GB10 au niveau de solutions bien plus coûteuses.

NVIDIA a également publié des playbooks dédiés au fine-tuning distribué avec FSDP (Fully Sharded Data Parallel) pour les clusters multi-nœuds. Le guide de notre magazine sur le fine-tuning de production détaille les choix entre LoRA, QLoRA et full fine-tuning selon le modèle et le budget mémoire. L’exploit du moment : le fine-tuning BF16 d’un modèle 35B sur un seul Spark, rendu possible par l’utilisation de LoRA et une gestion fine de la mémoire unifiée.


Fine-tuning local : l’exploit BF16 d’un 35B sur un seul Spark

Le fine-tuning sur DGX Spark a fait basculer l’IA locale dans une nouvelle ère. Avec 128 Go de mémoire unifiée et un coût d’accès cloud annoncé à 0,65 $/heure, le Spark transforme un notebook de recherche en pipeline de production. Le tutoriel Unsloth mentionné plus haut montre comment ajuster finement des modèles comme gpt-oss 20B avec RL, mais la communauté est allée plus loin.

Source : outilsia.fr

En août 2026, plusieurs retours d’expérience confirment la faisabilité du fine-tuning BF16 d’un modèle 35B (par exemple Qwen2.5-32B ou un modèle MoE équivalent) sur un seul Spark. La clé : utiliser LoRA avec un rang adapté (16-32) et une quantification 4-bit pour les poids de base, tout en gardant les adaptateurs en BF16. Le résultat : une qualité proche du full fine-tuning, pour un coût mémoire maîtrisé.

Les outils disponibles se sont structurés : Unsloth pour la rapidité, Axolotl pour la flexibilité, PyTorch natif avec FSDP pour les puristes, et les playbooks NVIDIA pour les déploiements standardisés. Le comparatif de MarkTechPost (juillet 2026) place Unsloth en tête sur la vitesse, avec des gains de 2 à 3× par rapport à Axolotl sur le même matériel.

Pour les clusters, l’entraînement distribué avec FSDP sur plusieurs DGX Spark est documenté, mais les performances restent limitées par le réseau 200 Gb/s. Les échanges de gradients deviennent le goulot d’étranglement au-delà de 2 nœuds, et les gains en scalabilité sont loin d’être linéaires.


L’écosystème s’élargit : ASUS Ascent GX10, RTX Spark et la concurrence

Le DGX Spark n’est plus seul sur le marché. ASUS a lancé l’Ascent GX10, un mini-PC basé sur la même puce GB10, avec 128 Go de RAM et 1 PFLOP, vendu environ 3 000 $ – soit près de 1 000 $ de moins que le Spark. Les benchmarks publiés par OutilsIA montrent des performances identiques, avec un throughput de 680 tok/s en batch 64 et 2 700 tok/s en prefill. Le boîtier de 1,5 kg est conçu pour le bureau, et ASUS met en avant la confidentialité des données (pas de cloud).

Parallèlement, NVIDIA a décliné sa plateforme en version portable avec la puce RTX Spark, destinée aux PC portables Windows sur ARM. Les premiers modèles d’ASUS (ProArt P14 et P16) et MSI arriveront à l’automne 2026, avec Acer et Gigabyte dans un second temps (début 2027). La puce reprend l’architecture GB10 (20 cœurs ARM, 6 144 cœurs CUDA, 1 PFLOP FP4, 128 Go de mémoire unifiée) mais dans un format adapté au nomadisme. CUDA 13.4 pour Windows Arm64 est déjà disponible en preview, et SEGA l’a adopté.

Cette concurrence pousse NVIDIA à améliorer son offre. Le prix du DGX Spark a d’ailleurs baissé depuis le pic de février 2026 (4 699 $), pour se stabiliser autour de 4 679 $ chez les revendeurs – toujours plus cher que l’Ascent GX10, mais avec un écosystème logiciel plus mature.


Le contexte 2026 : quels modèles surveiller sur le Spark ?

Le paysage des modèles open-weight a considérablement évolué. Outre DeepSeek V4 Flash 0731 et Ant Ling-3.0-Flash, plusieurs autres modèles méritent l’attention :

Source : chatforest.com
  • Poolside Laguna S 2.1 (23 juillet 2026) : 118B paramètres, spécialisé codage, conçu pour tenir dans un desktop. Premier grand modèle open-weight américain depuis 11 mois, il rivalise avec les modèles chinois sur les benchmarks de code.
  • GLM 5.3 Flash : un modèle chinois économique, souvent comparé à DeepSeek V4 Flash pour son rapport performance/coût. Il tourne sur des configurations modestes, mais n’a pas encore été testé officiellement sur DGX Spark.
  • Qwen3-Next-80B : via le moteur Atlas, il atteint 82 tok/s sur un seul Spark, un excellent score pour un modèle de cette taille.

Le choix du modèle dépend de l’usage : pour des agents IA privés, DeepSeek V4 Flash 0731 est imbattable grâce à ses 13B actifs ; pour du codage, Laguna S 2.1 ou Ant Ling-3.0-Flash sont plus adaptés ; pour du long contexte, Ant Ling avec son 1M extensible est roi.


Verdict : le DGX Spark est-il enfin à la hauteur ?

Un an et demi après son lancement, le DGX Spark a tenu l’essentiel de ses promesses. Les performances sur les modèles MoE récents sont réelles, le clustering fonctionne (avec des limites documentées), et le fine-tuning local est devenu une option de production crédible. La maturité logicielle, portée par vLLM, Unsloth et les playbooks NVIDIA, a transformé un gadget de démonstration en outil de travail.

Mais les limites restent structurantes. La bande passante mémoire de 273 Go/s plafonne le decode, le réseau 200 Gb/s bride les clusters au-delà de 2 nœuds, et le prix (4 679 $) reste élevé pour un usage grand public. L’arrivée de concurrents comme l’ASUS Ascent GX10 à 3 000 $ et les portables RTX Spark va intensifier la pression.

Pour les développeurs, chercheurs et petites structures qui veulent garder leurs données en local, le DGX Spark est désormais une référence solide. Pour ceux qui ont besoin de scalabilité ou de très hauts débits, le cloud reste incontournable. Le compromis est clair : le Spark excelle là où l’IA locale a du sens – confidentialité, coût marginal nul, expérimentation rapide – et échoue là où elle n’a pas sa place – très grands modèles, entraînement distribué massif, latence minimale.

En août 2026, le DGX Spark n’est plus une promesse. C’est une plateforme mature, avec ses forces et ses faiblesses, qui a trouvé sa place dans l’écosystème de l’IA. Et c’est déjà beaucoup.


Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *