Electrosens R&D
Electrosens NVIDIA DGX Spark · 21 September 2026

DGX Spark en septembre 2026 : clusters, benchmarks réels et LLM open-source qui tournent vraiment sur le GB10

L’été 2026 restera comme la saison où le supercalculateur personnel est devenu une réalité tangible. NVIDIA a officialisé le support multi-nœuds pour le DGX Spark, promettant des modèles jusqu’à 700 milliards de paramètres en local. Mais entre la promesse marketing et la réalité du câblage, du firmware et des benchmarks enfin publiés, le chemin s’est éclairci — sans pour autant devenir une promenade de santé. Voici le guide de terrain que tout possesseur de DGX Spark attendait, mis à jour avec les retours de clusters réels et les modèles qui tournent vraiment en septembre 2026.


Le mirage des 700B : ce que promet NVIDIA, ce que la réalité du terrain confirme

Il y a des annonces qui électrisent une communauté. Celle de juin 2026 en fait partie : NVIDIA officialise le support multi-nœuds pour le DGX Spark, et avec lui la capacité annoncée de faire tourner des modèles jusqu’à 700 milliards de paramètres sur un cluster de quatre machines. La fièvre s’empare des forums, des blogs et des groupes Telegram. Le supercalculateur personnel, jusqu’ici réservé aux initiés et aux early adopters fortunés, devient soudain un objet de désir accessible — du moins sur le papier.

Car il faut bien le dire : la réalité du terrain ressemble davantage à un parcours du combattant qu’à une promenade de santé. Les premiers adoptants qui se sont lancés dans l’aventure du cluster 4× ont découvert un monde de câbles capricieux, de firmwares récalcitrants, de nœuds invisibles et de benchmarks introuvables. La documentation officielle existe, les playbooks aussi, mais leur mise en pratique réserve son lot de surprises.

Et depuis, les choses ont évolué plus vite que prévu. Le prix du DGX Spark a grimpé de 18 % en février 2026, passant de 3 999 à 4 699 dollars — une hausse qui a paradoxalement accéléré la maturation logicielle. La mise à jour de juin 2026 a apporté le support NVFP4 et un clustering simplifié, et les clusters peuvent désormais atteindre 8 nœuds. De nouveaux modèles open-source, comme DeepSeek V4 Flash 0731 ou Ant Ling-3.0-Flash, tournent sur un seul Spark avec des performances qui auraient semblé impossibles il y a un an.

Mais surtout, les benchmarks indépendants existent désormais. Fini les chiffres fantômes : des retours de clusters réels, comme celui de QDNA (mis en service en février 2026, modèles basculés en août 2026), documentent précisément ce qui tourne, à quelle vitesse, et avec quelles limites. Ce dossier n’a pas pour ambition de vous vendre du rêve, mais de vous outiller. Nous allons disséquer les architectures possibles, démonter les rumeurs techniques, compiler les retours d’expérience des premiers clusters, et tenter de répondre à la question qui fâche : ce cluster en vaut-il vraiment la peine ? Du câblage aux benchmarks, en passant par le fine-tuning et la facture finale, voici le guide complet.


Sur le dos de la bête : ConnectX-7, QSFP et le casse-tête des câbles approuvés

Avant de brancher quoi que ce soit, il faut comprendre ce qui se cache sous le capot. Chaque DGX Spark embarque un Superchip GB10 (architecture Grace Blackwell), 128 Go de mémoire LPDDR5x unifiée, un stockage NVMe de 1 To, et surtout une carte réseau ConnectX-7 de NVIDIA. C’est cette dernière qui rend le clustering possible, et c’est elle qui concentre l’essentiel des débats techniques.

Prix du DGX Spark (USD)Avant février 20263999USDAprès février 20264699USDAugmentation700USD

La documentation officielle de NVIDIA est formelle : le DGX Spark dispose de deux ports QSFP sur la face arrière, chacun supportant jusqu’à 200 Gb/s en Ethernet. Une précision qui tranche avec certaines sources tierces, comme 3DVF, qui annonçaient initialement du 100 GbE. La confusion est compréhensible : les premières communications de NVIDIA mentionnaient une connectivité "jusqu’à 100 Gb/s", et le port RJ-45 10GbE présent sur la machine a ajouté à la confusion. Mais la doc actuelle du hub de clustering est sans ambiguïté : 200 Gb/s par port QSFP, en configuration Ethernet uniquement — pas d’InfiniBand, pas de surprise.

Le corollaire immédiat : les câbles. NVIDIA a publié une liste très fermée de câbles DAC (Direct Attach Copper) approuvés pour l’interconnexion. Deux références reviennent systématiquement : l’Amphenol NJAAKK-N911 (400 mm, 32 AWG, gaine LSZH) et le Luxshare LMTQF022-SD-R (400 mm, 30 AWG). Une variante de l’Amphenol, le NJAAKK0006, existe pour la version 0,5 mètre. Rien d’autre. Pas de câbles optiques AOC, pas de transceivers 200GBase-SR4, pas de connecteurs MPO-12.

C’est ici qu’il faut démonter une rumeur tenace. Plusieurs blogs et fils de discussion évoquent l’utilisation de câbles MPO-12 avec breakout vers 4× QSFP28, ou de transceivers optiques pour étendre la distance entre les nœuds. Or, aucune de ces solutions n’apparaît dans la documentation officielle de NVIDIA. Le hub de clustering ne mentionne que les DAC QSFP112, point final. Cela ne signifie pas que ces alternatives sont impossibles — certains utilisateurs bricoleurs ont réussi à faire fonctionner des configurations optiques — mais elles sortent du cadre supporté, et les risques de comportements erratiques sont réels.

Élément Spécification officielle Source
Ports réseau 2× QSFP (ConnectX-7), 200 Gb/s chacun NVIDIA Documentation Hub
Câbles approuvés Amphenol NJAAKK-N911, Luxshare LMTQF022-SD-R NVIDIA Documentation Hub
Configuration réseau Ethernet uniquement NVIDIA Documentation Hub
Rumeurs MPO-12 / SR4 Non documentées, non supportées Absence dans la doc officielle

Le message est clair : pour un cluster fiable, on s’en tient aux DAC approuvés. C’est moins glamour, mais ça évite bien des nuits blanches.


Full-mesh, étoile ou 8 nœuds : le duel des topologies qui divise la communauté

Une fois les câbles en main, se pose la question de l’architecture réseau. Deux écoles s’affrontent : le full-mesh direct, où chaque nœud est relié à tous les autres, et l’étoile, où un switch centralise les connexions. Le choix n’est pas anodin, et il conditionne la scalabilité du cluster.

Pour 2 ou 3 nœuds, la réponse est simple : NVIDIA fournit des playbooks officiels de connexion directe. Le "Connect Two Sparks" et le "Connect Three Sparks" décrivent précisément comment relier les machines entre elles via leurs ports QSFP, sans switch intermédiaire. Cette configuration full-mesh fonctionne, et elle a l’avantage de la simplicité : pas de matériel supplémentaire, pas de configuration de switch, juste des câbles DAC entre les ports.

Mais le passage à 4 nœuds change la donne. Le revendeur Exxact, qui a publié un guide détaillé sur la construction d’un cluster 4×, est catégorique : "Les directives de clustering de NVIDIA supportent jusqu’à trois systèmes DGX Spark connectés avec des câbles directs. Mais quatre systèmes ou plus nécessitent un switch réseau managé." Cette affirmation est corroborée par l’existence du playbook officiel "Multi Sparks Through a Switch", qui décrit précisément la configuration avec un switch QSFP.

Pourquoi cette limite ? La réponse tient à la topologie des ports. Chaque DGX Spark n’a que deux ports QSFP. En full-mesh, chaque nœud doit se connecter à trois autres — impossible avec seulement deux ports. Pour 4 nœuds, il faut donc un switch, qui centralise les connexions et permet à chaque machine de communiquer avec toutes les autres via un seul lien.

Le playbook officiel pour 4 nœuds, mis à jour le 21 juillet 2026, précise les exigences : un switch QSFP avec au moins 4 ports QSFP56-DD (200 Gb/s chacun), et une mise à jour systématique de tous les systèmes vers la dernière version de l’OS et du firmware. Le choix du switch reste ouvert : NVIDIA ne recommande pas explicitement un modèle, mais la compatibilité RoCE v2 est essentielle pour tirer parti des performances du ConnectX-7. Certains utilisateurs évoquent le Spectrum-X de NVIDIA, d’autres utilisent des switchs Ethernet génériques compatibles RoCE v2 — avec des résultats variables.

Et la mise à jour de juin 2026 a élargi le spectre : les clusters peuvent désormais atteindre 8 nœuds, avec des topologies documentées pour 2 à 8 Sparks. Les retours des premiers utilisateurs de clusters 8×, rapportés sur les forums NVIDIA, indiquent que la scalabilité est réelle mais que la configuration réseau devient le facteur limitant — au-delà de 4 nœuds, la latence du switch et la qualité des câbles DAC font toute la différence.

Topologie Nœuds Switch requis Avantages Inconvénients
Full-mesh direct 2-3 Non Simple, pas de matériel additionnel Limité à 3 nœuds (2 ports QSFP par machine)
Étoile avec switch 4-8 Oui (4 ports QSFP56-DD min.) Scalable, configuration centralisée Coût additionnel, configuration plus complexe

La question du full-mesh "sans switch" pour 4 nœuds reste un sujet de débat. Certains bricoleurs ont tenté des configurations avec des câbles optiques et des transceivers pour contourner la limitation des ports, mais ces approches sortent du cadre supporté et les retours sont mitigés. La voie officielle — et la plus sûre — passe par le switch.


Le firmware qui fâche : playbooks officiels, mises à jour et la chasse aux versions fantômes

C’est le point qui fâche, et il mérite qu’on s’y attarde. Le playbook officiel pour le cluster 4 nœuds, mis à jour le 21 juillet 2026, est explicite : il exige de mettre à jour tous les systèmes vers la dernière version du système d’exploitation et du firmware avant de procéder au câblage et à la configuration. Une exigence logique en apparence, mais qui se heurte à un problème de taille : les numéros de version exacts de ces mises à jour sont introuvables.

Source : docs.ultralytics.com

On sait que DGX OS suit un calendrier de publication semestriel, autour de février et août. On sait aussi que la mise à jour de juin 2026 a officiellement activé le support multi-nœuds — c’est l’annonce qui a déclenché la fièvre estivale. Mais aucune note de version numérotée, aucun numéro de build précis pour DGX OS, CUDA ou le firmware du ConnectX-7 n’a été publié de manière vérifiable dans les sources disponibles. Les forums officiels de NVIDIA regorgent de questions à ce sujet, et les réponses des modérateurs restent évasives.

Cette opacité a des conséquences pratiques. Comment savoir si votre machine est à jour ? Comment vérifier que le firmware du ConnectX-7 est compatible avec le playbook 4 nœuds ? La réponse, pour l’instant, tient plus de l’empirisme que de la procédure documentée. Les utilisateurs expérimentés recommandent de vérifier les versions via les outils système (nvidia-smi pour le GPU, mstflint pour le firmware ConnectX-7), et de comparer avec les informations disponibles sur le hub de clustering. Mais sans numéros de référence officiels, la marge d’erreur est grande.

Un autre point mérite d’être souligné : la mise à jour de juin 2026 n’est pas la seule évolution logicielle récente. Le 21 juillet 2026, NVIDIA a publié la première developer preview de CUDA Toolkit 13.4 pour Windows sur Arm, ouvrant la voie aux machines RTX Spark. Un signe que l’écosystème logiciel s’élargit, mais aussi que les versions se multiplient — et avec elles, les risques d’incompatibilité.

Élément Date clé Statut
Mise à jour multi-nœuds Juin 2026 Annoncée, versions non vérifiées
Playbook 4 nœuds 21/07/2026 Documenté, exige mise à jour OS/firmware
DGX OS calendrier semestriel Février / Août Confirmé par source tierce
CUDA 13.4 preview Windows on Arm 21/07/2026 Developer preview publiée

En attendant des notes de version plus transparentes, la prudence est de mise : on ne monte pas un cluster 4× avec des machines qui n’ont pas été mises à jour, mais on ne se fie pas non plus aux rumeurs de forums pour valider une version.


Chiffres enfin publiés : les benchmarks qui changent la donne en août-septembre 2026

Parlons chiffres, puisque c’est ce qui intéresse tout le monde. Et bonne nouvelle : contrairement à ce qu’on pouvait lire en juin, les benchmarks indépendants existent désormais. Ils ne concernent pas encore un cluster 4× complet, mais les résultats sur un nœud unique — et même sur deux nœuds — sont déjà spectaculaires.

Sur un Spark seul, les performances mesurées sont désormais bien documentées. Le blog OpenZeka a publié le 26 août 2026 un benchmark de Qwen3.8-27B sur DGX Spark : 48 tokens/s en génération. Ce modèle de 27 milliards de paramètres, sorti le 13 août 2026, est dense, avec un contexte natif de 262 144 tokens. C’est un résultat remarquable pour une machine de bureau, et il place le Spark au niveau de configurations bien plus coûteuses.

Autre référence qui tourne sur un seul Spark : DeepSeek V4 Flash 0731, un modèle MoE de 284 milliards de paramètres (13 actifs) publié le 31 juillet 2026. Ses poids publiés en FP4 + FP8 atteignent 167 Go — trop pour les 128 Go de mémoire unifiée d’un seul Spark. Mais des reproductions indépendantes, comme celle documentée par DeepWiki (projet emiluzelac/deepseek-v4-flash-0731-on-one-dgx-spark), ont tenté l’aventure sur un nœud unique avec des résultats mitigés. La voie officielle pour ce modèle passe par le cluster.

C’est là qu’intervient l’étude de cas la plus intéressante de l’été : QDNA, une société française, a mis en service en février 2026 un cluster de trois DGX Spark — deux nœuds reliés en RDMA pour les modèles dont les poids dépassent 128 Go, et un troisième nœud seul pour un modèle compact. Depuis août 2026, les deux branches servent respectivement DeepSeek V4 Flash 0731 sur le cluster (284B, 167 Go de poids) et Qwen3.8-27B sur le mono-Spark (27B, 56 Go en BF16). La plateforme accepte des appels concurrents depuis plusieurs agents internes via LiteLLM et route chaque requête vers le modèle le plus adapté via un routeur sémantique.

Cette configuration valide une approche pragmatique : plutôt que de chercher à tout faire tenir sur un seul nœud, on répartit les modèles selon leur taille. Le cluster RDMA à deux nœuds gère les gros modèles MoE, le mono-Spark s’occupe des modèles denses. C’est exactement le genre de retour de terrain qui manquait en juin.

Et les modèles continuent d’arriver. Le 26 août 2026, Zhipu AI (zAI) et Alibaba ont respectivement présenté GLM-5.3 Flash (320B, 18B actifs) et Qwen-3.8 Flash Next (125B, 6B actifs, plus 51B d’embeddings n-grammes), tous deux avec un contexte jusqu’à 1 million de tokens. Ces modèles MoE, taillés pour l’inférence "ultra low-cost", sont exactement le genre de charges qui pourraient tourner sur un cluster Spark — même si les benchmarks sur GB10 ne sont pas encore publiés.

Modèle Paramètres Actifs Contexte Statut sur Spark
Qwen3.8-27B 27B dense 27B 262K 48 tok/s (mono-Spark, 26/08/2026)
DeepSeek V4 Flash 0731 284B MoE 13B 1M Cluster 2 nœuds RDMA (QDNA)
Qwen3.6-27B 27B dense 27B 256K NVFP4 depuis 26/06/2026
Ant Ling-3.0-Flash 124B-A5B 5B 256K (ext. 1M) 15-20 tok/s estimés (23/07/2026)
Qwen-3.8 Flash Next 125B MoE 6B 1M Annoncé 26/08/2026, benchmarks à venir
GLM-5.3 Flash 320B MoE 18B 1M Annoncé 26/08/2026, benchmarks à venir

Fine-tuning : l’exploit BF16 d’un 35B sur un seul Spark, et la maturité des outils

Le DGX Spark a fait basculer le fine-tuning local dans une nouvelle ère. Avec 128 Go de mémoire unifiée et une bande passante de 273 Go/s, la machine permet des choses qui relevaient de la science-fiction il y a deux ans. Le point culminant de cette maturation : le fine-tuning BF16 d’un modèle de 35 milliards de paramètres sur un seul Spark, un exploit documenté dans plusieurs retours d’expérience.

Source : blogs.nvidia.fr

Comment est-ce possible ? La clé réside dans la mémoire unifiée. Contrairement à un GPU classique avec sa VRAM limitée, le GB10 peut allouer dynamiquement la mémoire entre le CPU et le GPU. Pour un fine-tuning complet en BF16, un modèle de 35B nécessite environ 70 Go de poids + gradients + états d’optimiseur — ce qui tient dans les 128 Go, à condition de gérer soigneusement l’utilisation.

Les outils ont suivi. Unsloth, Axolotl et PyTorch natif sont tous utilisables sur le Spark, avec des playbooks NVIDIA dédiés. Le choix de l’outil dépend du modèle et du budget mémoire :

  • LoRA / QLoRA : le choix par défaut pour les modèles de 27B et plus. Permet de fine-tuner Qwen3.8-27B avec un budget mémoire réduit, en quelques heures.
  • Full fine-tuning BF16 : réservé aux modèles jusqu’à ~35B, avec une gestion mémoire rigoureuse. C’est l’exploit documenté.
  • DeepSpeed / FSDP : pour les modèles plus gros, en répartissant la charge sur plusieurs nœuds.

Le fine-tuning sur cluster reste plus délicat. Les playbooks NVIDIA pour 2-3 nœuds décrivent la configuration RDMA, mais les retours de terrain (comme celui de QDNA) montrent que la stabilité dépend fortement de la qualité du réseau et de la version du firmware. Pour du fine-tuning distribué, mieux vaut commencer avec des modèles déjà compatibles avec les frameworks distribués (comme DeepSeek V4 Flash via vLLM) plutôt que de se lancer dans du full fine-tuning multi-nœuds.


Clusters : 2 nœuds pour 284B, 4 nœuds pour 700B, mais avec quelles limites ?

La promesse marketing de NVIDIA — 700 milliards de paramètres sur 4 nœuds — est-elle tenue ? Les retours de terrain permettent de nuancer.

Sur 2 nœuds, la configuration est désormais bien maîtrisée. Le cas QDNA le prouve : DeepSeek V4 Flash 0731 (284B, 167 Go de poids) tourne sur un cluster RDMA à deux nœuds, avec LiteLLM pour router les requêtes. C’est la configuration la plus documentée et la plus stable.

Sur 4 nœuds, la promesse des 700B reste théorique. Aucun benchmark indépendant publié ne confirme un modèle de cette taille tournant en conditions réelles sur un cluster 4×. Les playbooks officiels existent, le matériel est prêt, mais les retours d’expérience manquent encore. Les premiers utilisateurs de clusters 8× rapportent des difficultés de configuration réseau qui limitent la scalabilité réelle.

La question du TCO (coût total de possession) reste centrale. Avec un prix de 4 699 $ par Spark (depuis février 2026), un cluster 4× revient à environ 18 800 $, plus le switch et les câbles. À cela s’ajoute le coût de l’électricité et de la maintenance. Comparé au cloud (annoncé à 0,65 $/heure pour un accès), l’investissement local se rentabilise sur le long terme pour les usages intensifs — mais il faut être conscient des limites.


Le Portable Computer de Perplexity : l’agent local qui change la donne

Le 26 août 2026, Perplexity et NVIDIA ont annoncé conjointement le Portable Computer, un agent d’IA 100 % local qui tourne sur le DGX Spark. L’annonce a fait grand bruit : zéro coût de token, aucune dépendance cloud, et une stack complète préconfigurée.

Source : void.ma

En pratique, le Portable Computer est un bundle logiciel + matériel qui transforme le Spark en agent IA out-of-the-box. Il exige 24 Go de mémoire vidéo minimum, ce que le Spark dépasse largement avec ses 128 Go. Les premiers benchmarks, publiés fin août 2026, montrent que Qwen3.8-27B tourne à 48 tok/s dans cette configuration — un résultat identique à celui obtenu sans le bundle, ce qui confirme que le Portable Computer est surtout un gain de simplicité, pas de performance.

Pour les gros modèles, Perplexity évoque le dual-Spark et la question du 405B. Mais là encore, les benchmarks indépendants manquent. Le Portable Computer est une avancée pour la démocratisation de l’IA locale, mais il ne change pas les fondamentaux : la taille des modèles reste limitée par la mémoire et la bande passante.


En septembre 2026, que faut-il vraiment retenir ?

Le DGX Spark a mûri. En un an et demi, la machine est passée du statut de curiosité technique à celui d’outil de production pour l’IA locale. Les benchmarks indépendants existent, les clusters fonctionnent, et les modèles open-source de pointe tournent avec des performances impressionnantes.

Les points clés à retenir :

  1. Le mono-Spark est redoutable : Qwen3.8-27B à 48 tok/s, fine-tuning BF16 d’un 35B, et une myriade de modèles MoE qui tiennent dans 128 Go.
  2. Le cluster 2 nœuds est mature : DeepSeek V4 Flash 0731 (284B) tourne en RDMA, avec des retours de terrain solides.
  3. Le cluster 4-8 nœuds reste pour les aventuriers : la promesse des 700B est réelle sur le papier, mais les benchmarks indépendants manquent encore.
  4. Le firmware reste le point noir : les numéros de version exacts sont introuvables, et la mise à jour est un prérequis non négociable.
  5. Les modèles arrivent plus vite que les benchmarks : GLM-5.3 Flash et Qwen-3.8 Flash Next, annoncés le 26 août 2026, n’ont pas encore de chiffres sur GB10.

Le DGX Spark n’est pas une machine parfaite. Mais en septembre 2026, c’est sans doute la meilleure façon de faire tourner des LLM open-source de pointe sur son bureau — à condition d’accepter ses caprices.


Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *