Electrosens R&D
Electrosens NVIDIA DGX Spark · 9 September 2026

DGX Spark en septembre 2026 : le cluster dual qui dompte les géants open-source, de Qwen3.8-27B à DeepSeek V4 Flash

Dre Dyson, ingénieur en IA passionné de souveraineté numérique, a passé six mois à tenter l’impossible : faire tourner le monstre Qwen3.5-397B-A17B — 397 milliards de paramètres — sur un cluster de deux NVIDIA DGX Spark. Entre promesses marketing et dures réalités techniques, son récit est une feuille de route pour tous ceux qui rêvent d’exécuter localement les plus gros modèles open-source. Mais depuis ses premiers tests, l’écosystème a bondi : l’arrivée de Qwen3.8-27B, le support natif NVFP4 dans vLLM 0.25+, les outils de gestion de flotte comme Progress Chef, et surtout le débarquement de DeepSeek V4 Flash-0731, d’Ant Ling-3.0-Flash et de MiniMax M2.7 transforment le paysage. Débit, latence, stabilité, coût : nous décryptons son expérience et ce qu’elle révèle sur l’état de l’art du calcul IA à domicile en septembre 2026.


Pourquoi un cluster de deux DGX Spark ? Le pari de la souveraineté numérique

En février 2026, Alibaba dévoilait Qwen3.5-397B-A17B, un modèle MoE (Mixture of Experts) de 397 milliards de paramètres dont seulement 17 milliards sont activés par token. Une architecture qui promet des performances comparables à un modèle dense de 200-300B, mais avec un coût d’inférence réduit. Pour Dre Dyson, consultant en IA travaillant sur des données médicales sensibles, l’enjeu était clair : ne plus dépendre des API cloud. « Chaque requête envoyée à OpenAI ou Anthropic est une fuite potentielle. Je voulais un système 100 % local, avec une latence maîtrisée et un contrôle total », explique-t-il dans son blog.

Son choix s’est porté sur deux DGX Spark, les mini-supercalculateurs de NVIDIA lancés en 2025. Chaque unité embarque un GB10 Grace Blackwell, 128 Go de mémoire unifiée LPDDR5x, et une connectivité NVLink à 900 Go/s. Le coût total : environ 12 000 € (deux Spark à 4 699 $ pièce, taxes et câblage inclus). Face à lui, l’alternative cloud : une instance AWS p4d.24xlarge (8 A100 80 Go) coûte environ 32 $/heure, soit 23 000 $ sur six mois d’utilisation intensive. Le calcul était vite fait.

Mais le modèle visé n’est pas un petit jouet. Qwen3.5-397B-A17B pèse 807 Go en FP16 (source Hugging Face). Même avec les 256 Go combinés des deux Spark, la quantification est indispensable. Dyson a choisi la NVFP4, une compression 4 bits propriétaire NVIDIA, qui réduit le modèle à environ 200 Go. « C’était le seul moyen de tenir dans la mémoire disponible, tout en gardant une qualité acceptable », précise-t-il.

Depuis, l’offre de modèles open-source s’est considérablement élargie. Qwen3.6-27B, le flagship dense de la famille Qwen3.6, utilise une attention hybride gated delta networks et supporte nativement 262 000 tokens de contexte. Sorti le 22 avril 2026 sous licence Apache 2.0, il surpasse le précédent flagship open-source Qwen3.5-397B-A17B sur tous les benchmarks de codage majeurs, tout en étant multimodal (images et vidéos) — le tout pour 27 milliards de paramètres (source Qwen). En quantification NVFP4, il tient dans un seul DGX Spark (moins de 17 Go en Q4, selon les benchmarks de vLLM Recipes). « C’est ironique : un modèle 14 fois plus petit que le 397B fait mieux en codage agentique et tient sur une seule machine », note Dyson.

Mais le vrai champion de l’été 2026, c’est Qwen3.8-27B, sorti en août 2026. Avec un score de 52 sur l’Artificial Analysis Intelligence Index, il se classe premier de sa catégorie parmi les modèles open-weight, et atteint 48 tok/s sur un seul DGX Spark selon les tests du blog OpenZeka (source OpenZeka). Les benchmarks communautaires du 20 août 2026 confirment une génération de 34 à 38 tok/s en conditions réelles, avec un support du speculative decoding MTP (Multi-Token Prediction) qui pousse le débit à 83-138 tok/s sur les formats GGUF optimisés (source banandre). « Qwen3.8-27B est le nouveau roi du rapport qualité/performance sur Spark », résume un utilisateur des forums NVIDIA.

Et voici le géant qui bouscule tous les classements : DeepSeek V4 Flash-0731. Ce modèle de 284 milliards de paramètres avec seulement 13 milliards d’actifs par token a été conçu pour tourner sur deux DGX Spark. Publié officiellement le 31 juillet 2026 sur Hugging Face, ses 48 fichiers safetensors pèsent 167 Go en poids mixtes FP4+FP8, avec un module DSpark (décodeur spéculatif fusionné dans le checkpoint) et un contexte d’un million de tokens (source QDNA). Selon les tests de la communauté NVIDIA, il atteint environ 30 tok/s sur un cluster dual-Spark avec une configuration adaptée, et jusqu’à 41 tok/s après ajustement du taux d’acceptation (source forums NVIDIA). « DeepSeek V4 Flash-0731 offre des performances agentiques de niveau frontière avec 13B paramètres actifs, soit 10 fois moins que Claude Opus », résume une analyse de Flowtivity (source Flowtivity). Sur un seul Spark, les chiffres sont encore plus impressionnants : 1 000 tok/s en prefill et 59 tok/s en multi-agent serving selon un test du 1er août 2026 (source forums NVIDIA).

D’autres modèles comme Laguna S 2.1 (118B MoE, 21B actifs) ou Nemotron 3 Nano (30B MoE) sont également optimisés pour le Spark, avec des performances remarquables en fine-tuning LoRA. Ant Ling-3.0-Flash, sorti le 23 juillet 2026 par Ant Group, est un autre candidat sérieux : 124B-A5B (5B actifs), il bat leur précédent modèle 1T sur presque tous les benchmarks, avec un débit estimé de 15-20 tok/s sur un seul DGX Spark (source forums NVIDIA).

Et MiniMax M2.7 s’impose comme le nouveau roi du travail agentique : environ 42 t/s sur cluster dual-Spark, selon les retours de la communauté (source forums NVIDIA). Un utilisateur précise : « C’est mon top pick pour le codage agentique, meilleure latence et concurrence que Qwen3.5-397B ». L’agent Hermes est régulièrement cité comme le compagnon idéal de ces modèles, avec un support NVIDIA officiel attendu dans les prochains mois.


Câbler l’impossible : architecture mémoire et réseau du cluster

Distribuer un modèle MoE de 397B sur deux nœuds n’a rien d’évident. Chaque token active seulement 17B paramètres, mais ces experts sont répartis aléatoirement dans le réseau. La clé : le tensor parallelism (TP) et le pipeline parallelism (PP) supportés par vLLM.

Taille des modèles (paramètres totaux)Qwen3.5-397B397milliards de paramètresDeepSeek V4 Flash284milliards de paramètresAnt Ling-3.0-Flash124milliards de paramètresQwen3.6-27B27milliards de paramètresQwen3.8-27B27milliards de paramètres

Dyson a opté pour une configuration TP=2, PP=1 : chaque couche du modèle est découpée en deux parties, une par Spark. Les activations et gradients circulent via NVLink, qui offre 900 Go/s de bande passante intra-nœud, mais seulement 50 Go/s via le réseau Ethernet 100 Gb/s (RDMA) entre les deux machines. « Le goulot d’étranglement, c’est l’interconnexion. NVLink est fulgurant à l’intérieur d’un Spark, mais entre les deux, on tombe à du 6,25 Go/s théorique, moins en pratique », explique-t-il. Les tests récents montrent qu’un lien QSFP 200 Gb/s est désormais recommandé pour les clusters dual-Spark, notamment pour DeepSeek V4 Flash (source QDNA).

La quantification NVFP4 a été un choix crucial. Elle divise la mémoire nécessaire par 4 par rapport au FP16, mais nécessite une version récente de vLLM (≥0.25.0 pour DeepSeek V4 Flash) et un support matériel spécifique (les DGX Spark le gèrent nativement). Dyson a dû compiler lui-même une version modifiée de vLLM 0.24.3 pour activer le NVFP4 distribué. Depuis, vLLM 0.25+ supporte officiellement le NVFP4 sur DGX Spark, comme le montrent les recettes pour Qwen3.6-27B et DeepSeek V4 Flash (source vLLM Recipes). Les utilisateurs peuvent désormais utiliser les conteneurs NVIDIA NGC arm64 sans compilation manuelle.

Composant Un Spark Cluster 2 Spark
VRAM totale (LPDDR5x unifiée) 128 Go 256 Go
Bande passante mémoire 273 Go/s 273 Go/s par nœud
Modèle FP16 (Qwen3.5-397B) 807 Go 807 Go
Modèle NVFP4 (estimation) ~200 Go ~200 Go
Bande passante inter-nœuds NVLink 900 Go/s RDMA 50 Go/s (Ethernet 100G) ou QSFP 200 Gb/s
Mémoire disponible après OS ~115 Go ~230 Go

Le tableau montre que même en NVFP4, le modèle occupe 200 Go, laissant seulement 30 Go pour le cache KV et les buffers. « J’ai dû limiter la fenêtre de contexte à 32 000 tokens, loin du million promis par l’API », regrette Dyson. En comparaison, Qwen3.6-27B en NVFP4 sur un seul Spark permet une fenêtre de 262 144 tokens avec --max-model-len 262144 et --gpu-memory-utilization 0.5 (source vLLM Recipes). Et DeepSeek V4 Flash-0731 supporte nativement 1M tokens de contexte sur le cluster dual-Spark, une première pour du matériel de bureau.

Côté logiciel, l’écosystème a mûri. Atlas, un moteur d’inférence écrit en Rust par une startup française, promet une accélération de 2,8x par rapport à vLLM stock sur le GB10, avec une installation en moins de 2 minutes (uvx sparkrun setup) et une exécution en une commande (sparkrun run @atlas/qwen3.6-35b-a3b-nvfp4). Il atteint 100 tok/s sur Qwen3.6-35B en FP8 et 82 tok/s sur Qwen3-Next-80B, sans dépendances Python ni PyTorch. Son point faible : pas de support multi-nœuds ni de fine-tuning. Pour du mono-Spark, c’est l’option la plus rapide du marché.

En parallèle, CUDA 13.4 fait son entrée : NVIDIA a publié une première version préliminaire pour Windows sur Arm, native à Arm64, ouvrant la voie aux futurs PC RTX Spark (source Techtimes). Bien que les DGX Spark tournent sous Linux, cette preview annonce une convergence logicielle entre les plateformes Grace Blackwell et les RTX Spark, avec des implications pour les développeurs qui veulent porter leurs pipelines.


Benchmarks sous tension : débit, latence et premiers tokens

Après des semaines de réglages, Dyson a obtenu des mesures stables sur Qwen3.5-397B-A17B. Voici les chiffres qu’il partage (extraits de son blog) :

Métrique Valeur (batch size=1) Valeur (batch size=4)
Débit (tokens/s) 2,3 tok/s 5,1 tok/s
Temps jusqu’au premier token (prompt 1k tokens) 8,7 s 12,4 s
Latence par token (génération) 435 ms 196 ms
Stabilité (taux d’échec) 2 % 8 %

Comparé aux performances annoncées par NVIDIA pour un seul DGX Spark sur Qwen3.6-27B (modèle dense 27B) — environ 45 tok/s en FP8 — le cluster est 10 à 20 fois plus lent. « C’est le prix à payer pour un modèle 10 fois plus gros », commente Dyson. Les benchmarks de Spark Arena (juillet 2026) confirment que Qwen3.6-27B atteint 40-50 tok/s sur un seul Spark en NVFP4, avec une latence de premier token inférieure à 2 secondes pour des prompts de 1k tokens. Les chiffres officiels d’Alibaba indiquent 28-33 tok/s en session unique, 136 tok/s avec 10 agents simultanés, et un pic de 163 tok/s en decode (source Qwen).

Mais l’arrivée de DeepSeek V4 Flash-0731 change la donne. Avec ses 13B paramètres actifs, il atteint environ 30 tok/s sur deux DGX Spark en NVFP4, selon les tests publiés sur les forums NVIDIA fin juillet 2026 (source). « Il y a une petite modification de config à faire pour retrouver le taux d’acceptation, mais une fois en place, c’est un monstre », témoigne un utilisateur. Les benchmarks communautaires plus récents, relayés par le magazine, poussent même ce chiffre à 41 tok/s sur deux nœuds avec la configuration ajustée. En Q8 (UD-Q8_K_XL), le modèle pèse 162 Go, soit seulement 7 Go de plus qu’en Q4 — un choix viable pour ceux qui privilégient la qualité (source forums NVIDIA). Sur un seul Spark, les performances en multi-agent serving atteignent 59 tok/s avec un prefill de 1 000 tok/s (source forums NVIDIA).

Qwen3.8-27B confirme sa supériorité sur le Spark : 48 tok/s en conditions optimales selon OpenZeka (source), avec un support MTP qui double presque le débit. Les tests du 20 août 2026 montrent 34-38 tok/s en usage réel, ce qui en fait le meilleur choix pour du mono-Spark.

Ant Ling-3.0-Flash (124B-A5B) atteint 15-20 tok/s sur un seul DGX Spark, un excellent compromis pour un modèle de cette taille (source forums NVIDIA).

Et MiniMax M2.7 s’impose comme le nouveau roi du travail agentique : environ 42 t/s sur cluster dual-Spark, selon les retours de la communauté (source forums NVIDIA). Un utilisateur précise : « C’est mon top pick pour le codage agentique, meilleure latence et concurrence que Qwen3.5-397B ». L’agent Hermes est régulièrement cité comme le compagnon idéal de ces modèles, avec un support NVIDIA officiel attendu dans les prochains mois.

Face au cloud, l’écart reste frappant. Une instance AWS p4d avec 8 A100 atteint 150 tok/s sur Qwen3.5-397B via API (source : Artificial Analysis, non vérifié). « Mais à 32 $/heure, je peux faire tourner mon cluster 24h/24 pendant 375 heures pour le même prix. Pour des tâches batch, le local est imbattable », calcule-t-il.

La fenêtre de contexte de 32k tokens limite les usages longs (analyse de documents juridiques de 500 pages impossible). Dyson a tenté d’activer le sliding window attention, mais le cache KV saturait la mémoire. Avec Qwen3.6-27B, la fenêtre native de 262k tokens ouvre des possibilités bien plus larges. Et DeepSeek V4 Flash-0731 est annoncé avec un support de 1M de tokens de contexte sur le cluster dual-Spark, une première pour du matériel de bureau.


Les 7 plaies du cluster : problèmes rencontrés et solutions durement gagnées

Le blog de Dyson liste une série de problèmes techniques, chacun résolu après des heures de debug. Depuis, l’écosystème a apporté des réponses à plusieurs de ces points :

Source : youtube.com
  1. Le goulot d’étranglement réseau : le lien Ethernet 100 Gb/s limite le TP=2. La solution : passer à un lien QSFP 200 Gb/s, désormais recommandé pour les clusters dual-Spark, notamment pour DeepSeek V4 Flash (source QDNA).

  2. La compilation manuelle de vLLM : résolue avec vLLM 0.25+ qui supporte officiellement le NVFP4 distribué sur DGX Spark. Les conteneurs NGC arm64 sont prêts à l’emploi.

  3. Le taux d’acceptation du speculative decoding : DeepSeek V4 Flash nécessite une petite modification de config pour retrouver le taux d’acceptation optimal. Une fois en place, le débit passe de 30 à 41 tok/s (source forums NVIDIA).

  4. La saturation du cache KV : avec 200 Go de modèle en NVFP4, il ne reste que 30 Go pour le cache. La solution : limiter la fenêtre de contexte ou utiliser des modèles plus petits comme Qwen3.8-27B qui tient en entier avec 262k tokens.

  5. La stabilité en batch : le taux d’échec passe de 2 % à 8 % en batch size=4. Les correctifs DSpark et les recettes MiaAI-Lab ont amélioré la robustesse.

  6. Le fine-tuning distribué : Unsloth permet désormais le fine-tuning jusqu’à 200B paramètres sur DGX Spark, avec gpt-oss-120b utilisant environ 68 Go de mémoire unifiée (source Unsloth). LLaMA Factory est une alternative populaire avec plus de 70 600 étoiles GitHub (source LLaMA Factory).

  7. La gestion de flotte : pour les clusters plus grands, Progress Chef Enterprise Management s’impose comme l’outil de référence pour gérer des parcs de DGX Spark, de 2 à 100 nœuds.


Fine-tuning : Unsloth, LoRA, QLoRA et full fine-tune en BF16

Le DGX Spark s’est imposé comme le terrain de jeu du fine-tuning local en 2026. Unsloth permet l’affinage local de LLMs jusqu’à 200 milliards de paramètres sur le DGX Spark. Avec 128 Go de mémoire unifiée, vous pouvez entraîner des modèles massifs tels que gpt-oss-120b, et exécuter ou déployer l’inférence directement sur le Spark (source Unsloth).

Comme montré à l’OpenAI DevDay, gpt-oss-20b a été entraîné avec RL et Unsloth sur DGX Spark pour gagner automatiquement à 2048. Après 1 000 étapes et 4 heures d’entraînement par RL, le modèle surpasse largement l’original sur 2048, et un entraînement plus long améliorerait encore les résultats. gpt-oss-120b utilisera environ 68 Go de mémoire unifiée, laissant de la place pour le cache et les buffers.

LLaMA Factory est devenu l’un des frameworks open-source les plus largement adoptés pour le fine-tuning en 2026, avec plus de 70 600 étoiles sur GitHub et une adoption par des organisations telles qu’Amazon, NVIDIA et Aliyun (source LLaMA Factory). Il supporte plus de 100 grands modèles de langage et modèles vision-langage sans écrire de code d’entraînement.

Le fine-tuning d’un modèle de 7B coûte moins de 5 $ en 2026 pour des exécutions de base, mais les flux de production nécessitent des configurations multi-GPU. Sur le Spark, QLoRA réduit les besoins d’un modèle de 7B à seulement 4 Go de mémoire, rendant le fine-tuning accessible à tous.


Clusters DGX Spark : de 2 à 100 nœuds

L’écosystème des clusters DGX Spark a explosé en 2026. Au-delà du dual-Spark de Dyson, des configurations allant jusqu’à 100 nœuds sont désormais déployées en entreprise. Les recettes MiaAI-Lab et les correctifs DSpark permettent de gérer des clusters hétérogènes avec des performances linéaires sur les modèles MoE.

Source : aiplatforms.ru

Le benchmark de référence reste DeepSeek V4 Flash-0731 sur 2× DGX Spark : 30-41 tok/s en NVFP4, avec un support de 1M tokens de contexte. Sur un seul Spark, les performances en multi-agent serving atteignent 59 tok/s, ce qui en fait une option viable pour des déploiements edge.

Pour la gestion d’entreprise, Progress Chef Enterprise Management s’impose comme l’outil standard, permettant de superviser des flottes de DGX Spark avec des fonctionnalités de déploiement, de monitoring et de mise à jour à distance.


Perspectives : vers une démocratisation du calcul IA local

Le paysage de septembre 2026 est radicalement différent de celui de février. Les modèles de 27B comme Qwen3.8-27B offrent des performances de niveau frontière sur un seul Spark, tandis que les géants MoE comme DeepSeek V4 Flash-0731 tiennent sur un cluster dual. Le fine-tuning est devenu accessible grâce à Unsloth et LLaMA Factory, et la gestion de flotte est industrialisée avec Progress Chef.

Les prochains mois s’annoncent passionnants : AMD Ryzen AI Halo (Strix Halo) propose une alternative à 3 999 $ avec 128 Go LPDDR5X et 256 Go/s de bande passante, atteignant 34 tok/s sur gpt-oss-120b (source comparatif). Les mini-PC Acer et Gigabyte, annoncés pour début 2027, devraient proposer des alternatives 500 à 1 000 $ moins chères que le Spark.

La souveraineté numérique n’est plus un rêve : elle tient dans un boîtier de 140 W, pour un coût inférieur à 5 000 $ par nœud. Et avec les modèles qui ne cessent de s’améliorer, le calcul IA à domicile n’a jamais été aussi proche des performances cloud.


Sources

Source : huggingface.co
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *