Electrosens R&D
Electrosens NVIDIA DGX Spark · 2 September 2026

DGX Spark en septembre 2026 : DeepSeek V4 Flash 0731, fine-tuning BF16 et clusters 8 nœuds — le GB10 a-t-il enfin tenu ses promesses ?

Le DGX Spark de NVIDIA s’est imposé comme la machine de référence pour l’inférence locale de grands modèles de langage. Mais entre les benchmarks communautaires, les mises à jour logicielles de l’été 2026, l’arrivée de modèles MoE toujours plus efficaces et la maturation des clusters multi-nœuds, difficile de s’y retrouver. Voici un tour d’horizon pratique, chiffré et sans langue de bois, pour tirer le meilleur de votre GB10.


Le GB10 en 2026 : pourquoi le DGX Spark est devenu la machine de référence des LLM open source

Quand NVIDIA a lancé le DGX Spark en 2025, beaucoup y voyaient un joujou de développeur, un « Mac mini pour l’IA » un peu gadget. Un an et demi plus tard, le constat est tout autre : cette petite boîte noire est devenue l’outil de travail quotidien d’une communauté grandissante de chercheurs, d’ingénieurs et d’indépendants qui veulent exécuter des LLM open source sans dépendre du cloud.

Le cœur de la machine, c’est le superchip Grace Blackwell GB10 : 128 Go de mémoire unifiée LPDDR5x, jusqu’à 4 To de stockage NVMe, et une capacité annoncée de 1 PetaFLOP en FP4. Ces spécifications, confirmées par NVIDIA et reprises dans la plupart des tests indépendants, placent le DGX Spark dans une catégorie à part : celle des machines capables de charger des modèles de 70B en quantification 4-bit, voire des MoE de 120B+, tout en restant dans un format de bureau silencieux et économe (150 × 150 mm, 1,2 kg, alimentation 240 W). Le tout pour un prix qui a nettement baissé depuis le lancement : environ 4 679 $ selon explainx.ai, même si les tarifs varient selon les revendeurs — on trouve des annonces entre 6 249 $ et 7 999 $ en Australie selon glukhov.org, et autour de 4 000 € en France d’après Capital.fr. La baisse par rapport aux 7 999 $ initiaux est réelle, mais il faut comparer les offres.

Le positionnement face aux alternatives est net. Le Mac Studio M5 Max d’Apple, avec ses 128 Go de mémoire unifiée et 614 Go/s de bande passante, reste un concurrent sérieux — les tests de iaboutique.fr comparent d’ailleurs les deux machines. Mais l’écosystème CUDA, la disponibilité d’Ollama, de vLLM, de TensorRT-LLM et des outils NVIDIA font pencher la balance pour ceux qui veulent une compatibilité maximale avec les frameworks open source. Côté PC, une RTX 5090 avec 32 Go de VRAM ne peut tout simplement pas charger un modèle 70B quantifié ; il faut un dual-GPU ou un cloud. Et le cloud, justement, coûte cher à l’usage : un DGX Spark s’amortit en quelques mois face à des instances GPU facturées à l’heure.

Attention toutefois aux comparaisons bâclées : un article de dev.to comparant le Spark au cloud cite « AWS g5.xlarge (A100) » comme instance de référence — or les instances AWS g5 utilisent des GPU A10G, pas des A100. Une erreur qui jette un doute sur la rigueur globale de l’article. Les comparaisons avec le cloud doivent donc être prises avec des pincettes.

Ce qui a changé depuis le lancement, c’est surtout la maturité logicielle et l’arrivée d’une nouvelle génération de modèles MoE spécialement adaptés à l’architecture GB10. Les playbooks NVIDIA se sont étoffés, les mises à jour de janvier et juillet 2026 ont apporté des améliorations de gestion mémoire, et la communauté a produit des outils de benchmark dédiés. Le DGX Spark n’est plus une curiosité : c’est une plateforme.

Les modèles qui tournent vraiment sur GB10 en septembre 2026

La question que tout nouveau propriétaire se pose : quel modèle lancer en premier ? La réponse a radicalement changé depuis 2025. L’arrivée de modèles MoE à activation clairsemée — où seuls quelques milliards de paramètres sont actifs par token — a transformé l’expérience utilisateur. Le GB10 récompense l’activation clairsemée et punit le décodage dense, comme le rappelle ai-muninn.com dans son guide de terrain de mi-2026.

Débits mesurés (tok/s) sur DGX Spark (sept. 2026)Qwen 3.6 35B A3B200tok/sGemma 4 26B-A4B108tok/sGPT-OSS 120B41.9tok/sAnt Ling-3.0-Flash17.5tok/sGemma 4 31B (FP16)16.5tok/sQwen 3.5 27B11.1tok/s70B dense (4-bit)11.5tok/s

Les champions du moment

DeepSeek V4 Flash 0731 est sans doute le modèle le plus discuté de l’été 2026. Publié officiellement le 31 juillet 2026 sur Hugging Face (deepseek-ai/DeepSeek-V4-Flash-0731), c’est un MoE de 284 milliards de paramètres totaux avec seulement 13 milliards actifs par token, un contexte d’un million de tokens, des poids mixtes FP4 + FP8 mesurés à environ 83,4 Go, et un module DSpark (décodeur spéculatif fusionné dans le checkpoint). Il offre des performances agentiques de niveau frontière tout en restant étonnamment léger. Les benchmarks publiés sur les forums NVIDIA sont impressionnants : 76,7 sur CyberGym, 54,4 sur DeepSwe, 54,2 sur NL2Repo et 82,7 sur Terminal-Bench 2.1. Sur un dual DGX Spark, il atteint des débits confortables — jusqu’à 30 tok/s en configuration par défaut, et davantage après ajustement du fichier de configuration, comme le rapporte un utilisateur des forums NVIDIA. Mieux : un développeur a réussi à le faire tourner sur un seul Spark avec un backend CUDA maison, atteignant 1 000 tok/s en prefill et 59 tok/s en multi-agent serving (voir ce fil). En quantification Q8 (UD-Q8_K_XL), le modèle pèse 162 Go, ce qui le rend jouable sur un cluster de deux Spark (256 Go de mémoire unifiée), mais pas sur une seule machine. Le guide complet de QDNA détaille les configurations pour Spark, cluster 2× Spark et DGX Station GB300.

Ant Ling-3.0-Flash (124B-A5B), sorti le 23 juillet 2026, est le nouveau chouchou des possesseurs de Spark unique. Avec seulement 5 milliards de paramètres actifs, ce modèle d’Ant Group bat leur précédent modèle 1T sur presque tous les benchmarks, selon les forums NVIDIA. Son architecture hybride linéaire-attention native (couches KDA et MLA empilées en ratio 5:1) le rend particulièrement adapté aux longues séquences, avec un contexte natif de 256K tokens extensible à 1M. Les estimations communautaires le placent entre 15 et 20 tok/s sur un seul DGX Spark. C’est le modèle à essayer en premier si vous n’avez qu’une machine.

Qwen 3.5 27B reste le couteau suisse de la plateforme. Selon le leaderboard BridgeBench (snapshot du 9 avril 2026), il obtient 76,3 % de taux de réussite global, avec 11,1 tok/s et un TTFT de 361 ms. Il domine le raisonnement (95,0 %) et la génération de code (75,0 %). C’est le choix par défaut pour un usage polyvalent sur le chemin Ollama simple.

GPT-OSS 120B (FP8) est le champion du débit : 41,9 tok/s, soit 3,8 fois plus que Qwen 3.5 27B, avec 74,0 % de taux de réussite. Il est le seul à dépasser 80 % en instruction-following. Mais il perd sur le raisonnement (86,7 %) et le code (70,0 %). Le compromis est clair : la qualité et le débit pointent dans des directions opposées sur le Spark.

Gemma 4 26B-A4B en NVFP4 est le nouveau choix par défaut recommandé par ai-muninn.com pour la mi-2026. Avec vLLM stock et le support natif de MTP (Multi-Token Prediction), il atteint 108 tok/s mesurés. L’ancien chemin communautaire (quant + patch) est désormais obsolète : tout est natif dans vLLM.

Qwen 3.6 35B A3B en NVFP4 est le roi de la vitesse : plus de 200 tok/s avec un tool-calling parfait, selon tokenstead.ai. C’est le choix idéal pour les agents et les usages interactifs.

Poolside Laguna S 2.1 (118B), sortie le 23 juillet 2026, est la première grande ouverture de poids américaine depuis 11 mois. Conçue pour le codage agentique, elle est présentée par habr.com comme « la plus puissante ouverture de l’Ouest ». Son architecture MoM avec routeur token-choice et 256 experts la rend compatible avec les machines à mémoire unifiée de 128 Go.

Ce qui ne marche pas (encore)

Les modèles denses de 31B restent un piège : Gemma 4 31B en FP16 plafonne à 16,5 tok/s avec un TTFT brutal de 10 secondes, ce qui le rend inutilisable en interactif. Les modèles denses de 70B en 4-bit tournent entre 8 et 15 tok/s — utilisables pour de la génération, mais pas pour du batch. Et comme le rappelle ai-muninn.com, NVFP4 n’est pas automatiquement plus rapide que FP8 sur GB10 : il faut tester au cas par cas.

Benchmarks réels : le tableau de bord de l’été 2026

Voici une synthèse des benchmarks indépendants publiés entre avril et septembre 2026, croisant BridgeBench, les tests communautaires des forums NVIDIA, les guides spécialisés et les mesures de DevToolStack (17 LLM testés sur GB10) et Conatus AI (vLLM bare-metal) :

Modèle Runtime Vitesse (tok/s) TTFT Taux de réussite Source
Qwen 3.6 35B A3B (NVFP4) vLLM 200+ tokenstead.ai
Gemma 4 26B-A4B (NVFP4) vLLM 108 ai-muninn.com
DeepSeek V4 Flash 0731 (1× Spark, backend CUDA) custom 59 (multi-agent) forums NVIDIA
GPT-OSS 120B (FP8) vLLM 41,9 498 ms 74,0 % BridgeBench
DeepSeek V4 Flash 0731 (2× Spark) vLLM 30+ 76,7 (CyberGym) forums NVIDIA
Qwen 3.5 27B (FP16) Ollama 11,1 361 ms 76,3 % BridgeBench
Ant Ling-3.0-Flash (124B-A5B) vLLM 15-20 forums NVIDIA
Gemma 4 31B (FP16) vLLM 16,5 10 153 ms 64,0 % BridgeBench
Mistral Small 4 (23,6B Q4) Ollama 4,7 2 910 ms 69,0 % BridgeBench

Leçon principale : le débit et la qualité pointent dans des directions opposées sur le Spark. GPT-OSS 120B stream 4 fois plus vite que Qwen 3.5 27B, mais perd sur le raisonnement et le code. Pour un usage agentique, les modèles à activation clairsemée (A3B, A4B, A5B) offrent le meilleur compromis.

Mémoire unifiée et FP4 : repousser les limites de contexte et de batch sans OOM

La mémoire unifiée de 128 Go est le superpouvoir du DGX Spark, mais elle a ses limites. Comprendre l’allocation mémoire est essentiel pour éviter les out-of-memory (OOM) et maximiser le contexte.

Source : dev.to

Prenons un modèle 7B en FP16 : il occupe environ 14 Go de poids. En 4-bit, il tombe à 3,5 Go. Le KV cache (qui stocke les clés et valeurs d’attention) croît linéairement avec la longueur du contexte : pour un contexte de 32K tokens sur un modèle 7B, il faut compter plusieurs Go supplémentaires. L’overhead CUDA (buffers, activations, fragmentation) ajoute encore quelques Go. Au final, un contexte de 128K tokens sur un 7B quantifié en 4-bit est jouable, mais il faut surveiller la mémoire de près.

Pour les modèles 70B en 4-bit (35 Go de poids), un contexte de 8K tokens est confortable, 32K devient tendu, et 128K nécessite des optimisations agressives (quantification du KV cache, gpu_memory_utilization réduit). Les MoE de 120B+ comme Ant Ling-3.0-Flash (124B, 5B actifs) occupent environ 60-70 Go en 4-bit, ce qui laisse de la place pour un contexte étendu — le modèle annonce d’ailleurs 256K tokens de contexte natif.

En pratique, les utilisateurs de la communauté recommandent de laisser au moins 10-15 % de mémoire libre pour éviter les OOM. Les réglages clés sont gpu_memory_utilization (dans vLLM, SGLang et TensorRT-LLM) et la quantification du KV cache (FP8 ou 4-bit). Le batch, lui, est limité par la somme des KV caches de toutes les requêtes simultanées : sur un 7B en 4-bit, un batch de 8 requêtes avec 4K tokens chacune est réaliste ; sur un 70B, il faut descendre à 2-4 requêtes.

Clusters DGX Spark : 2, 4, 8 nœuds, le réseau qui change tout

Le DGX Spark est une petite merveille de calcul, mais dès qu’on branche un deuxième Spark, la donne change. NVIDIA a officialisé le support multi-nœuds en 2026, promettant des modèles jusqu’à 700 milliards de paramètres sur un cluster de 8 machines. La réalité du terrain est plus nuancée.

Le talon d’Achille : un réseau Ethernet, pas du NVLink

Chaque Spark embarque un ConnectX-7 avec deux ports QSFP 200 Gb/s (Ethernet). Pas de NVLink entre les nœuds : la communication inter-Spark passe par le réseau, avec une latence et une bande passante bien inférieures à ce que permettrait un interconnect NVLink. Les tests communautaires montrent que le passage à l’échelle est loin d’être linéaire : sur 2 nœuds, DeepSeek V4 Flash 0731 tourne à 30 tok/s (contre 59 sur un seul avec le backend optimisé), et sur 4 nœuds, les gains supplémentaires sont marginaux pour les modèles qui tiennent déjà en mémoire sur 2 nœuds.

Topologies et câblage

Pour monter un cluster, il faut des câbles QSFP 200 Gb/s. La communauté a validé le câble Amphenol NJAAKK-N911 (400 mm, 32 AWG) comme fiable. Les topologies recommandées :

  • 2 nœuds : connexion directe entre les deux ports QSFP — suffisant pour DeepSeek V4 Flash 0731 en Q8 (162 Go).
  • 4 nœuds : topologie en étoile ou en anneau, avec un switch Ethernet 200 Gb/s. Les gains sont réels pour les modèles > 300 Go, mais le coût du switch peut dépasser celui d’un Spark.
  • 8 nœuds : NVIDIA promet des modèles jusqu’à 700B, mais en pratique, la bande passante inter-nœuds (200 Gb/s = 25 Go/s) devient le goulot d’étranglement. Les benchmarks communautaires montrent que les modèles MoE à activation clairsemée s’en sortent mieux que les denses, car ils échangent moins de données par token.

La boîte à outils : vLLM, SGLang, NemoClaw

Sur cluster, vLLM reste la référence, avec un support natif du multi-nœud via Ray. SGLang est une alternative prometteuse, mais moins mature sur ARM. La nouvelle stack NemoClaw (contraction de NeMo et Claw) commence à circuler dans la communauté, mais les retours sont encore anecdotiques. Le conteneur vLLM officiel tourne sous Ubuntu 26.04, et le dashboard Grafana officiel (ID 23991) permet un monitoring précis.

Fine-tuning local : l’exploit BF16 d’un 35B sur un seul Spark

La grande surprise de l’été 2026, c’est le fine-tuning en BF16 sur un seul DGX Spark. Grâce aux 128 Go de mémoire unifiée et aux optimisations de la pile logicielle (Unsloth, LLaMA-Factory, TRL), il est désormais possible d’affiner un modèle de 35 milliards de paramètres en précision native BF16, sans quantification. Les retours de la communauté sur les forums NVIDIA et les guides de DeepWiki confirment que le GB10 (sm121) gère le fine-tuning avec LoRA et QLoRA sans problème, et même le full fine-tuning pour des modèles jusqu’à 13B.

Source : github.com

Concrètement, un fine-tuning LoRA sur Qwen 3.5 27B en BF16 prend quelques heures sur un Spark, avec une consommation mémoire maîtrisée (le modèle en BF16 pèse ~54 Go, laissant ~70 Go pour l’optimiseur et les activations). Pour les modèles plus gros (70B+), il faut passer par la quantification 4-bit (QLoRA) ou par un cluster de 2 Spark. Les frameworks recommandés : Unsloth (le plus rapide sur ARM), LLaMA-Factory (le plus complet) et TRL (le plus standard). Le comparatif de MarkTechPost sur Unsloth vs Axolotl vs TRL vs LLaMA-Factory donne un bon aperçu des forces et faiblesses de chacun.

Les mises à jour de l’été 2026 : CUDA 13.4, vLLM natif et le mystérieux Atlas

Le 14 juillet 2026, NVIDIA a annoncé sur ses forums le déploiement progressif des mises à jour logicielles de juillet 2026 pour le DGX Spark, avec notamment des « améliorations de la gestion mémoire » (Improved Memory Management). Les systèmes partenaires basés sur GB10 peuvent accuser un léger retard de mise à jour — une information utile pour ceux qui utilisent des machines tierces.

Dans le même temps, l’écosystème a vu arriver CUDA 13.4, disponible en developer preview pour Windows on Arm depuis le 21 juillet 2026, avec un support natif Arm64 qui prépare l’arrivée des PC RTX Spark (techtimes.com, igorslab.de). Pour les utilisateurs Linux de DGX Spark, CUDA 13.x apporte des optimisations de la pile d’inférence, mais les gains chiffrés précis ne sont pas documentés dans les sources disponibles.

Côté vLLM, la grande nouvelle de l’été est le support natif de MTP (Multi-Token Prediction) et des quantifications NVFP4 sans patch communautaire. Le blog officiel vLLM du 1er juin 2026 documente ces avancées. Le conteneur vLLM tourne désormais sous Ubuntu 26.04, et le dashboard Grafana officiel (ID 23991) permet un monitoring précis.

Et puis il y a Atlas. Le nom circule dans les discussions communautaires comme un composant mystérieux des optimisations NVIDIA. En réalité, Atlas (atlasinference.io) est un moteur d’inférence écrit en Rust, spécifiquement conçu pour le DGX Spark. Les premiers retours mentionnent des gains de latence intéressants, mais le projet est encore jeune et la documentation limitée. À suivre.

Enfin, la mise à jour de janvier 2026 avait promis des gains spectaculaires : jusqu’à 2,5× en inférence LLM et 8× en traitement vidéo. Huit mois plus tard, ces chiffres sont en grande partie confirmés par les benchmarks communautaires, à condition d’activer le trio NVFP4 + TensorRT-LLM + décodage spéculatif. Le gain 8× vidéo, lui, reste plus difficile à reproduire en conditions réelles — il concerne surtout les pipelines de traitement vidéo avec des codecs spécifiques, pas l’inférence LLM.

Sources

Source : tokenstead.ai
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *