NVIDIA DGX Spark · 7 September 2026LLM open source sur NVIDIA DGX Spark en septembre 2026 : performances, fine-tuning, clusters et logiciels
En septembre 2026, le DGX Spark s’est imposé comme la référence de l’IA locale. Avec ses 128 Go de mémoire unifiée, son SoC GB10 Grace Blackwell et une pile logicielle en pleine maturité, il fait tourner des modèles de 27 à 284 milliards de paramètres. Cet article fait le point complet sur les modèles stars, les benchmarks mesurés, le fine-tuning, les clusters multi-nœuds et les logiciels qui font tourner la machine.
Introduction : où en est le DGX Spark en septembre 2026 ?
Depuis son lancement en septembre 2025, le DGX Spark — ce boîtier de la taille d’un Mac Mini embarquant 128 Go de mémoire unifiée LPDDR5X (273 Go/s) et une puce Grace Blackwell GB10 — s’est imposé comme la référence de l’inférence locale de grands modèles de langage. Le 1er juin 2026, NVIDIA a déployé une mise à jour logicielle majeure promettant un bond de 2,6× en performances, portée par trois innovations : le format de données NVFP4 (NVIDIA Floating Point 4), l’agent de sécurité NemoClaw, et le clustering multi-nœuds.
Trois mois plus tard, où en est-on ? Les premiers benchmarks indépendants confirment partiellement les chiffres, mais révèlent aussi des limites importantes — notamment sur le clustering, plafonné à 4 nœuds, et sur la variabilité des performances selon les modèles et les runtimes. Le prix, lui, a grimpé de 3 999 $ à 4 699 $ en février 2026, conséquence de la pénurie de mémoire. La version logicielle actuelle (juillet 2026) est la DGX OS 7.5.0 avec le driver 580.159.03 et CUDA 13.0.2 — des versions qui corrigent plusieurs problèmes de stabilité et améliorent la gestion mémoire.
En parallèle, NVIDIA prépare l’arrivée de la RTX Spark, une puce pour PC Windows sur ARM : ASUS et MSI lanceront leurs PC portables dès cet automne, avec une avance potentiellement décisive sur Acer et Gigabyte (dont les mini-PC arriveront début 2027). CUDA 13.4 est déjà en preview pour Windows sur Arm (22 juillet 2026). Cet article fait le point complet, chiffres à l’appui, avec les données les plus récentes disponibles.
Les modèles stars de 2026 sur DGX Spark
Qwen3.6-27B : le modèle dense qui redéfinit l’inférence locale
Le 22 avril 2026, Alibaba dévoilait Qwen3.6-27B, un modèle dense de 27 milliards de paramètres avec une architecture hybride (attention linéaire Gated DeltaNet + attention gated) et une fenêtre de contexte de 256K tokens. Deux mois plus tard, NVIDIA publiait une quantification NVFP4 sur Hugging Face (26 juin 2026), co-développée avec l’équipe vLLM pour les Tensor Cores FP4 natifs des GPU Blackwell.

Sur le DGX Spark, les testeurs communautaires rapportent 28 à 33 tokens/s en session unique sur la build NVFP4 via vLLM 0.24.0. Mais avec 10 agents parallèles, un développeur a atteint 136 tokens/s, avec un pic à 209 t/s. Le modèle atteint 163 tokens/s en peak decode sur matériel Blackwell.
En termes de qualité, la quantification NVFP4 obtient 0,8446 sur MMLU, quasi identique au FP8 (~0,84). Sur les benchmarks agentiques, le modèle se classe au niveau Sonnet 4.6 sur SWE-bench et Terminal-Bench, et bat Claude Opus 4.5 sur 7 des 12 benchmarks comparés. C’est une excellente nouvelle pour les utilisateurs locaux : la quantification 4 bits de NVIDIA ne sacrifie pas la qualité, du moins sur ce modèle.
Qwen3.8-27B : le nouveau venu d’août 2026
Le 20 août 2026, des utilisateurs du forum NVIDIA ont testé Qwen3.8-27B en NVFP4 avec SGLang et DSpark, obtenant 34 à 38 tokens/s en génération. Un runbook de service Blackwell (OrcaRouter) documente la version Uncensored en NVFP4, confirmant l’intérêt de la communauté pour ce modèle récent.
DeepSeek V4 Flash 0731 : le modèle MoE de 284B qui tourne sur une seule Spark
DeepSeek V4 Flash 0731 est un modèle MoE de 284 milliards de paramètres avec 13B actifs. Il a été conçu pour tourner sur une seule DGX Spark. Les benchmarks communautaires sont impressionnants :
- 1 000 tokens/s en prefill sur une seule Spark
- 59 tokens/s en multi-agent serving
- En Q8 (UD-Q8_K_XL), le modèle pèse 162 Go, seulement 7 Go de plus que la version Q4 — un excellent compromis qualité/mémoire
Sur deux DGX Spark, un utilisateur du forum NVIDIA a démontré un serving agentique avec Hermes Agent, atteignant des performances de niveau frontier avec 13B paramètres actifs, soit 10× plus petit que Claude Opus. Flowtivity confirme : « DeepSeek V4 Flash 0731 delivers frontier-level agentic performance with 13B active parameters, 10x smaller than Claude Opus. We run it on two NVIDIA DGX Sparks with Hermes Agent for private, on-prem AI. »
Ant Ling-3.0-Flash : le nouveau modèle rapide d’Ant Group
Le 23 juillet 2026, Ant Group a publié Ling-3.0-Flash, un modèle de 124B-A5B (124 milliards de paramètres, 5B actifs) avec attention hybride linéaire (couches KDA et MLA empilées 5:1). Il bat leur précédent modèle 1T sur presque tous les benchmarks. Le débit d’inférence estimé est de 15-20 tokens/s sur une seule Spark, avec un contexte natif de 256K extensible à 1M.
Poolside Laguna S 2.1 : la réponse occidentale
Le 23 juillet 2026, Poolside a publié Laguna S 2.1, un modèle de 118 milliards de paramètres pour le codage agentique. C’est la première grande ouverture de poids américaine depuis 11 mois. Avec une architecture MoM (Mixture-of-Models) à token-choice router, 256 experts et softplus-gating, elle bat des concurrents 10× plus grands et tient dans un seul desktop.
Les autres modèles à connaître
- Gemma 4 26B-A4B : 108 tokens/s en génération (vLLM natif)
- Mistral Small 4 119B : servi avec vLLM sur DGX Spark (guide Haruni, juillet 2026)
- GPT-OSS 120B : 38,55 tokens/s en génération, 1 723 tokens/s en prefill
- GLM 5.2, Kimi K2.7 : également compatibles
Benchmarks réels : vitesse d’inférence, consommation mémoire et qualité
Le tableau ci-dessous compile les chiffres les plus récents disponibles à ce jour :
| Format | Modèle | Prompt (tokens/s) | Génération (tokens/s) | Source |
|---|---|---|---|---|
| NVFP4 + MTP | Qwen3.6-35B-A3B | non communiqué | 97 (single) | LLMRequirements |
| NVFP4 | Qwen 3.6 27B | non communiqué | 163 (peak decode) | Kie.ai |
| NVFP4 | Qwen3.8-27B | non communiqué | 34–38 (SGLang + DSpark) | Forum NVIDIA (20 août 2026) |
| NVFP4 + MTP | Gemma 4 26B-A4B | non communiqué | 108 (mesuré, vLLM natif) | ai-muninn.com |
| MXFP4 | GPT-OSS 120B | 1 723 | 38,55 | aimultiple.com (citant LMSYS Org) |
| NVFP4 | Qwen3.6-27B | non communiqué | 28–33 (session unique) | Kie.ai |
| NVFP4 | Qwen3.6-27B | non communiqué | 136 (10 agents parallèles) | Wiselychen |
| Q8 | DeepSeek V4 Flash 0731 | 1 000 (prefill) | 59 (multi-agent) | Forum NVIDIA |
Le gain de 2,6× annoncé par NVIDIA est mesuré sur Qwen3.6-35B en combinant NVFP4 et Multi-Token Prediction (prédiction spéculative multi-tokens). Ce chiffre est cohérent avec les premiers tests indépendants : LLMRequirements rapporte 97 tokens/s en génération sur un seul DGX Spark avec Qwen3.6-35B-A3B en NVFP4, contre environ 37 tokens/s en FP8 — soit un ratio de 2,6× exactement.
Mais attention : le NVFP4 n’est pas automatiquement plus rapide que FP8 sur GB10. Comme le souligne le guide de référence ai-muninn.com (août 2026), « NVFP4 n’est pas automatiquement plus rapide que FP8 sur GB10 » — tout dépend du modèle, de la configuration et du runtime. Sur certains modèles denses, FP8 reste compétitif. La leçon : testez, ne supposez pas.
Par ailleurs, Kie.ai signale que les quantisations NVFP4 du modèle 35B-A3B semblent « cassées » dans certains benchmarks indépendants, notamment en workflows agentiques — un point à surveiller de près.
Fine-tuning sur DGX Spark : LoRA, QLoRA et full fine-tune en BF16
Le fine-tuning est un des points forts du DGX Spark grâce à ses 128 Go de mémoire unifiée. Les guides de référence (Unsloth, DeepWiki) documentent plusieurs approches.

LoRA et QLoRA : le choix de la simplicité
Avec Unsloth, le fine-tuning LoRA d’un modèle 7B prend environ 15 minutes sur une seule Spark. Pour les modèles plus grands (27B), QLoRA en NVFP4 permet de rester sous la barre des 128 Go. Le blog Unsloth (juin 2026) détaille le processus complet : installation, chargement du modèle en 4 bits, entraînement LoRA, et export vers GGUF ou vLLM.
Full fine-tune en BF16 : possible jusqu’à 70B
Grâce aux 128 Go de mémoire unifiée, un full fine-tune en BF16 est possible pour des modèles jusqu’à 70B. Le guide DeepWiki (12 août 2026) couvre l’implémentation technique sur GB10 (sm121), y compris la gestion du cache KV et les réglages de mémoire.
Le cas DeepSeek V4 Flash 0731
Le projet emiluzelac/deepseek-v4-flash-0731-on-one-dgx-spark (DeepWiki, 12 août 2026) documente la reproduction indépendante du fine-tuning de ce modèle de 284B sur une seule Spark. C’est une prouesse rendue possible par l’architecture MoE avec 13B actifs.
Fine-tuning en français : le cas Qwen3.6-27B
Un projet GitHub (Pablohassan/qwen3.6-27b-fr-nvfp4-dspark) documente un fine-tuning en français de Qwen3.6-27B sur DGX Spark : 18,56 tokens/s en requête unique (×2,6 vs non accéléré), avec une qualité statistiquement indistinguable de la référence FP8. En TP=2 sur deux Sparks, on atteint 28,79 tokens/s. C’est une démonstration concrète que le fine-tuning local en français est non seulement possible, mais performant.
Clusters multi-nœuds : de 200 à 700 milliards de paramètres
Le clustering est la fonctionnalité la plus attendue de la mise à jour de juin 2026. NVIDIA promettait un scaling multi-nœuds, mais les tests communautaires révèlent des limites.
Ce qui fonctionne : 2 nœuds avec DeepSeek V4 Flash
Le 2 août 2026, un utilisateur du forum NVIDIA a publié des résultats détaillés sur le serving agentique avec DeepSeek V4 Flash 0731 sur 2× DGX Spark : gestion du KV-cache, scheduling et découvertes sur la mémoire unifiée (UMA). Les résultats mont

Article recherché et rédigé automatiquement · Magazine Electrosens