NVIDIA DGX Spark · 7 September 2026DGX Spark en septembre 2026 : les LLM open source qui tournent vraiment sur GB10, fine-tuning, clusters et mises à jour
En juin 2026, NVIDIA a déployé une mise à jour logicielle majeure pour son supercalculateur personnel DGX Spark, promettant un gain de performance de 2,6× grâce au format de quantification NVFP4, une pile logicielle enrichie et un support de clustering étendu. Trois mois plus tard, l’écosystème a considérablement mûri : de nouveaux modèles open-source comme Ant Ling-3.0-Flash, DeepSeek V4 Flash 0731, Poolside Laguna S 2.1 ou encore Qwen3.8-27B tournent nativement sur le GB10, tandis que la preview de CUDA 13.4 pour Windows Arm prépare l’arrivée du RTX Spark. Mais que valent vraiment ces promesses ? Entre benchmarks réels, fine-tuning local et clusters multi-machines, tour d’horizon complet de l’IA locale en septembre 2026.
Où en est le DGX Spark en septembre 2026 ?
Le DGX Spark de NVIDIA a fait entrer l’inférence locale de modèles de grande taille dans une nouvelle ère. Ce mini-supercalculateur de bureau, propulsé par le chip GB10 Grace Blackwell, combine un CPU Arm à 20 cœurs et un GPU Blackwell avec jusqu’à 6 144 cœurs CUDA, le tout relié par un interconnect NVLink C2C à 273 Go/s de bande passante mémoire LPDDR5x. Avec 128 Go de mémoire unifiée, il promet d’exécuter en local des LLM de 120 milliards de paramètres — une promesse tenue, comme le montrent les benchmarks récents.
La mise à jour logicielle de juin 2026, déployée à l’occasion du GTC Taipei/Computex, a marqué un tournant. NVIDIA y annonçait un gain de performance de 2,6× grâce à trois piliers : le format de quantification propriétaire NVFP4, une pile logicielle enrichie et un support de clustering étendu. Les partenaires comme ASUS (avec l’Ascent GX10, désormais à environ 2 760 € en France contre 4 000 € au lancement) ont suivi le mouvement, même si leurs systèmes peuvent accuser un léger retard sur les mises à jour OTA.
L’expérience de première configuration a également été simplifiée : l’Out-of-Box-Experience (OOBE) permet désormais un démarrage plus rapide, et les mises à jour over-the-air ne sont plus installées par défaut lors de la configuration initiale, laissant l’utilisateur commencer à travailler immédiatement. Après le premier boot, le système dirige vers le site DGX Spark playbook, où le playbook NemoClaw est mis en avant pour un déploiement simplifié d’un agent local sandboxé. Comme le détaille le blog développeur NVIDIA, ce parcours permet de passer du déballage à un agent IA local en quelques minutes, hors téléchargement initial du modèle.
Un point crucial à comprendre : il n’existe pas de VRAM séparée sur le GB10. CPU et GPU partagent le même pool de 128 Go LPDDR5X via l’interconnect à 273 Go/s. Comme l’explique Tokios, lorsque vLLM alloue de la « mémoire GPU », il s’agit en réalité d’une portion du même pool utilisé par le système d’exploitation DGX, le runtime CUDA et vos applications. Il n’existe aucun mécanisme de sécurité type OOM killer : une fois le pool épuisé, le DGX Spark se fige au lieu de mettre fin au processus responsable. Une gestion fine de gpu_memory_utilization est donc essentielle.
NVFP4 : le format 4 bits qui tient ses promesses — mais avec des nuances
Le cœur de la mise à jour de juin 2026 est le format de quantification NVFP4, un format 4 bits à virgule flottante propriétaire de NVIDIA. Contrairement aux quantifications INT4 classiques, NVFP4 conserve une mantisse et un exposant, offrant une meilleure préservation de la précision pour les poids et activations des LLM. Sur le DGX Spark, ce format est accéléré nativement par les Tensor Cores de 5e génération, ce qui explique le gain de performance annoncé de 2,6×.
Les benchmarks réels confirment l’intérêt du format, mais avec des nuances. Sur le modèle Qwen3.6-27B, le débit atteint 28 à 33 tokens/s en NVFP4, selon les mesures de KIE.AI. En mode multi-agent, ce chiffre grimpe jusqu’à 136 tokens/s — un résultat impressionnant qui montre que le format brille particulièrement dans les scénarios où plusieurs requêtes sont traitées en parallèle.
Il faut toutefois nuancer les chiffres annoncés par NVIDIA. Le débit de 82 739 tokens/s publié par le constructeur correspond à un débit de mise au point global (prefill + batch), et non à l’inférence pour un seul utilisateur, comme le souligne Tokios. Les valeurs réelles en mono-utilisateur sont bien plus modestes, de l’ordre de 30 à 60 tokens/s selon les modèles.
Cependant, tous les modèles ne bénéficient pas également du NVFP4. Les modèles MoE (Mixture of Experts) comme Ant Ling-3.0-Flash ou DeepSeek V4 Flash, qui n’activent qu’une fraction de leurs paramètres à chaque token, voient des gains plus modestes. Pour ces modèles, la bande passante mémoire reste le facteur limitant, et le NVFP4 n’apporte qu’un avantage marginal par rapport à une quantification INT4 bien calibrée.
Les LLM open-source qui tournent vraiment sur GB10
L’été 2026 a été particulièrement riche en sorties de modèles open-source, et le DGX Spark est devenu la plateforme de référence pour les tester. Voici les modèles qui tournent réellement sur le GB10, avec leurs performances mesurées.
Qwen3.6-27B et Qwen3.8-27B : la famille dense qui surprend
Sorti le 22 avril 2026, Qwen3.6-27B est un modèle dense de 27 milliards de paramètres, taillé pour l’inférence locale. Sur le DGX Spark, il atteint 28 à 33 tokens/s en NVFP4, et jusqu’à 136 tokens/s en mode multi-agent. Sa quantification NVFP4 officielle est disponible depuis le 26 juin 2026, avec un score MMLU de 0,8446. Ses performances en codage, MMLU et SWE-bench en font un concurrent sérieux des modèles plus gros, et sa taille le rend idéal pour le fine-tuning local.
Mais la famille a déjà évolué : Qwen3.8-27B a été testé le 20 août 2026 et atteint 34 à 38 tokens/s sur DGX Spark, soit une progression notable par rapport à la 3.6. Cette version améliore encore la génération et le raisonnement, tout en conservant une fenêtre de contexte de 256K tokens. C’est désormais le modèle dense de référence pour qui veut un bon équilibre entre qualité et vitesse sur une seule Spark.
Ant Ling-3.0-Flash 124B-A5B : le MoE qui tient dans une Spark
Sorti le 23 juillet 2026, Ant Ling-3.0-Flash 124B-A5B est un modèle MoE d’Ant Group avec 124 milliards de paramètres totaux mais seulement 5 milliards d’actifs par token. Son architecture hybride combine attention linéaire KDA et MLA dans un ratio 5:1, avec une fenêtre de contexte native de 256K tokens extensible à 1M. Sur une seule DGX Spark, le débit est estimé entre 15 et 20 tokens/s — des chiffres non officiels mais prometteurs pour un modèle de cette taille. Il bat son prédécesseur de 1T paramètres sur presque tous les benchmarks, comme le rapportent les forums NVIDIA.
DeepSeek V4 Flash 0731 : le nouveau champion de l’agentique
La version DeepSeek V4 Flash 0731, sortie fin juillet 2026, a rapidement fait parler d’elle. Avec 13 milliards de paramètres actifs (sur 284 milliards totaux), elle offre des performances agentiques de niveau frontier, dix fois plus compactes que Claude Opus. Sur deux DGX Spark en cluster, elle atteint des débits impressionnants : 30 tokens/s en configuration par défaut, et davantage après ajustement de configuration, comme le détaille un post des forums NVIDIA. La version Q8 (UD-Q8_K_XL) pèse 162 Go, seulement 7 Go de plus que la Q4, ce qui la rend exécutable en quasi-lossless sur une Spark de 128 Go. Des analyses approfondies, comme celle de Flowtivity, montrent que ce modèle est particulièrement adapté aux agents IA privés et on-premise. Un utilisateur des forums NVIDIA rapporte même 1 000 tok/s en prefill et 59 tok/s en multi-agent serving sur une seule Spark avec un moteur CUDA maison.
Poolside Laguna S 2.1 : la réponse occidentale
Le 23 juillet 2026, Poolside a publié Laguna S 2.1, un modèle open-weight de 118 milliards de paramètres pour le codage agentique. Présenté comme la plus puissante ouverture occidentale depuis 11 mois, il bat des concurrents dix fois plus gros sur les benchmarks de codage et tient dans un seul desktop. Son architecture MoM (Mixture of Models) avec routeur token-choice, softplus-gating et 256 experts en fait un cas d’étude intéressant pour les utilisateurs de DGX Spark, même si les benchmarks sur GB10 sont encore rares.
Gemma 4 : le poids lourd de Google
Depuis avril 2026, Gemma 4 de Google fait vibrer la communauté. Ce modèle de niveau « frontier » tourne sur un seul GPU, et son alliance avec le DGX Spark a été largement documentée. L’installation se fait en 30 minutes, du téléchargement à la première inférence, et les benchmarks le placent en tête face à DeepSeek V4 Flash, Ant Ling et les autres nouveaux venus, notamment en multimodal et en contexte géant.
Mistral-Small-4-119B : le nouveau venu européen
Un autre modèle mérite l’attention : Mistral-Small-4-119B, servi avec vLLM sur DGX Spark. Comme le montre Haruni, ce modèle de 119 milliards de paramètres tourne correctement sur le GB10 grâce à l’optimisation NVFP4 et à une configuration fine de vLLM. C’est une alternative européenne crédible aux modèles chinois et américains pour l’inférence locale.
Benchmarks : qui crache les tokens le plus vite ?
Les benchmarks sur DGX Spark sous Linux sont désormais nombreux et précis. Voici un récapitulatif des débits mesurés en septembre 2026 :

| Modèle | Paramètres | Débit sur 1× DGX Spark | Notes |
|---|---|---|---|
| Qwen3.6-27B | 27B dense | 28-33 tok/s (NVFP4) | Jusqu’à 136 tok/s en multi-agent |
| Qwen3.8-27B | 27B dense | 34-38 tok/s | Testé le 20 août 2026 |
| Ant Ling-3.0-Flash | 124B MoE (5B actifs) | 15-20 tok/s (estimé) | 256K contexte, extensible 1M |
| DeepSeek V4 Flash 0731 | 284B (13B actifs) | ~30 tok/s (2× Spark) | Q8 en 162 Go, quasi-lossless |
| Gemma 4 | Variable | Variable | Multimodal, contexte géant |
| Mistral-Small-4-119B | 119B | ~20-25 tok/s (estimé) | Via vLLM optimisé |
La comparaison avec le RTX 5090, menée par le blog de Lalatendu, montre que le DGX Spark reste compétitif pour l’inférence de gros modèles grâce à sa mémoire unifiée de 128 Go, là où la RTX 5090 plafonne à 32 Go de GDDR7. Le duel avec l’AMD Ryzen AI Halo, documenté dans notre comparatif, donne un avantage au Spark sur les très gros modèles (34 tok/s contre 39 tok/s pour le Halo sur un modèle 120B, mais avec une meilleure stabilité et un écosystème CUDA bien plus mature).
Fine-tuning sur DGX Spark : LoRA, QLoRA et full fine-tune en BF16
Le fine-tuning local est l’un des usages les plus plébiscités du DGX Spark. Avec 128 Go de mémoire unifiée, il est possible de fine-tuner des modèles de 27B voire 70B en LoRA ou QLoRA sans difficulté, et même d’envisager un full fine-tune en BF16 pour les modèles jusqu’à 27B.
Prenons l’exemple de Qwen3.6-27B : en FP16, le modèle occupe environ 54 Go, laissant plus de 70 Go pour les activations et les gradients. Avec LoRA (rang 16-32), le fine-tuning sur un jeu de données de 10 000 exemples prend quelques heures. Les bibliothèques comme Hugging Face PEFT et bitsandbytes fonctionnent sans modification majeure sur Arm.
Unsloth s’est imposé comme l’outil de référence pour le fine-tuning sur DGX Spark, avec des gains de vitesse de 2 à 3× par rapport à TRL ou Axolotl, comme le détaille MarkTechPost. Sa compatibilité native avec Arm64 et son support du NVFP4 en font le choix naturel. Le guide officiel Unsloth propose des recettes clés en main pour fine-tuner Qwen3.6, Gemma 4 et d’autres modèles sur GB10. LLaMA-Factory reste une alternative solide pour les workflows plus complexes, tandis qu’Axolotl séduit par sa flexibilité de configuration.
Le fine-tuning de modèles MoE comme Ant Ling-3.0-Flash est plus délicat : seuls les experts actifs sont mis à jour, ce qui réduit le coût mais complique le réglage. Les premiers retours indiquent que LoRA sur les couches d’attention donne les meilleurs résultats.
Pour le full fine-tune en BF16, la mémoire unifiée de 128 Go permet de travailler sur des modèles jusqu’à 27B avec un batch raisonnable, mais il faut surveiller attentivement la consommation mémoire : le système d’exploitation, le runtime CUDA et les surcharges liées au contexte réduisent la quantité disponible pour le modèle. Le guide de Tokios recommande de calculer précisément le budget cache KV avant de lancer un entraînement.
Clusters DGX Spark : quand un seul ne suffit plus
La mise à jour de juin 2026 a considérablement amélioré le support des clusters. Le NVIDIA Sync Cluster Assistant, désormais disponible dans l’application NVIDIA Sync, permet de connecter jusqu’à 3 appareils sans switch réseau, et jusqu’à 4 avec un switch. La bibliothèque NCCL 2.30u1 ajoute le support de la topologie en anneau pour 3 systèmes DGX Spark, facilitant l’entraînement distribué et l’inférence multi-nœuds.

Les cas d’usage concrets se multiplient. Le déploiement de DeepSeek V4 Flash 0731 sur 2× DGX Spark, documenté sur les forums NVIDIA, montre des résultats impressionnants en matière de gestion du KV-cache et de scheduling. Les utilisateurs rapportent des débits de 30 tok/s et plus, avec une latence acceptable pour des agents conversationnels. Un post de suivi corrige toutefois certaines mesures initiales : les chiffres de decode-share étaient erronés, et une des conclusions a été révisée après réexamen du benchmark de chevauchement.
Pour les modèles de 120B+ comme Ant Ling-3.0-Flash, un cluster de 2 à 4 Spark permet d’atteindre des débits confortables tout en gardant une marge pour le contexte long. Le coût reste élevé (chaque Spark coûte environ 3 000 $), mais pour les équipes qui ont besoin d’inférence privée et de fine-tuning local, c’est une alternative sérieuse aux serveurs cloud.
Il faut noter que la connectivité réseau est un facteur clé : le lien 10GbE offre un débit théorique de 1,25 Go/s, bien en deçà de la bande passante mémoire interne. Les annonces initiales évoquaient 100 GbE, mais la réalité est plus modeste. Pour les modèles très volumineux, la répartition sur plusieurs nœuds doit donc être pensée en termes de pipeline parallèle plutôt que de parallélisme de données pur.
Stacks logicielles : vLLM, Ollama, llama.cpp et le nouveau venu Atlas
Le choix de la stack logicielle est crucial pour tirer le meilleur du DGX Spark. Cinq solutions dominent le paysage, et une sixième émerge.
vLLM reste la référence pour l’inférence à haute performance, avec un support natif du NVFP4 et du PagedAttention. Son throughput est le meilleur de sa catégorie, mais sa configuration est plus complexe. Le guide de Haruni montre comment servir Mistral-Small-4-119B avec vLLM sur DGX Spark, en ajustant gpu_memory_utilization et la taille du cache KV. Ollama séduit par sa simplicité : une commande suffit pour lancer un modèle, et la compatibilité avec les modèles GGUF est excellente. llama.cpp est le choix des puristes, avec un contrôle fin sur la quantification et l’utilisation de la mémoire.
LiteLLM s’impose comme une couche d’abstraction utile pour basculer entre différents backends, tandis que Llama Swap permet de charger et décharger dynamiquement des modèles en fonction des requêtes. Le nouveau venu Atlas fait forte impression : il atteint 82 tok/s sur Qwen3 Next 80B en été 2026, un chiffre remarquable qui le positionne comme un sérieux concurrent de vLLM pour les charges de travail intensives.
Côté gestion de flotte, Progress Chef entre dans l’arène pour administrer plusieurs DGX Spark, comme le détaille notre dossier sur la stack logicielle complète. Pour les agents locaux, NemoClaw de NVIDIA est désormais le blueprint de référence : il empaquette modèles open source, runtime d’agents et orchestration dans une installation unique, avec un parcours guidé depuis l’OOBE.
Perspectives : le RTX Spark et l’écosystème Windows
L’écosystème DGX Spark s’étend au-delà de Linux. NVIDIA a publié le 22 juillet 2026 la première preview de CUDA 13.4 pour Windows sur Arm, native à Arm64, permettant aux développeurs de préparer leurs applications pour le RTX Spark, la puce qui équipera les PC portables Windows sur ARM. ASUS et MSI lanceront leurs premiers modèles RTX Spark dès l’automne 2026, avant leurs concurrents Acer et Gigabyte, comme le rapportent Clubic et Les Numériques. Les pilotes confirment deux variantes du N1X. SEGA prend déjà en charge cette plateforme.

Cette évolution pourrait démocratiser l’inférence locale de modèles de grande taille sur le marché grand public, même si le DGX Spark reste la référence pour les développeurs et les chercheurs grâce à sa mémoire unifiée de 128 Go et son écosystème CUDA mature.
Conclusion
En septembre 2026, le DGX Spark s’est imposé comme la référence de l’IA locale. La mise à jour de juin a tenu ses promesses, le NVFP4 apporte un gain réel de performance, et l’écosystème logiciel a atteint une maturité remarquable. Les modèles open-source de 120B+ tournent désormais nativement sur une seule machine, et les clusters de 2 à 4 Spark permettent de passer à l’échelle pour les charges les plus lourdes.
Le fine-tuning local est devenu accessible : LoRA, QLoRA et même full fine-tune en BF16 sont possibles sur des modèles jusqu’à 27B, avec des outils comme Unsloth qui simplifient considérablement le processus. Les stacks logicielles se sont diversifiées, offrant des choix adaptés à chaque besoin, de la simplicité d’Ollama à la puissance de vLLM.
Reste à surveiller l’arrivée du RTX Spark sur Windows, qui pourrait élargir considérablement le marché de l’IA locale, et les prochaines générations de modèles open-source qui ne manqueront pas de repousser les limites de ce que peut faire une machine de bureau.
Sources
- NVIDIA DGX Spark — page officielle
- NVIDIA Developer Blog — Run Local AI Agents with Faster Models and Multi-Node Clustering
- Forums NVIDIA — DGX Spark Software Updates June 2026 Release
- Tokios — Réglage de la mémoire et tests de performance sur DGX Spark
- Unsloth — Fine-tuning des LLM avec NVIDIA DGX Spark
- Haruni — Servir Mistral-Small-4-119B avec vLLM sur DGX Spark
- Forums NVIDIA — Agent Serving on 2× DGX Spark with DeepSeek V4 Flash 0731
- Forums NVIDIA — DeepSeek V4 Flash 0731 DSpark 1M NVFP4 KV 2x DGX Spark
- Forums NVIDIA — 1x Spark: DeepSeek-V4-Flash-0731 @ 1,000 tok/s prefill
- Flowtivity — DeepSeek V4 Flash 0731 on Dual DGX Spark
- Forums NVIDIA — Ant Ling-3.0-Flash 124B-A5B
- KIE.AI — Benchmarks Qwen3.6-27B
- Blog de Lalatendu — DGX Spark vs RTX 5090
- MarkTechPost — Unsloth sur DGX Spark
- Clubic — NVIDIA RTX Spark : ASUS et MSI
- Les Numériques — Asus et MSI pour la puce Nvidia RTX Spark
- Mundowin — NVIDIA lance le premier kit de développement CUDA 13.4 Windows Arm
- ChatForest — NVIDIA DGX Spark June 2026 Update Builder Guide
Article recherché et rédigé automatiquement · Magazine Electrosens