Electrosens R&D
Electrosens NVIDIA DGX Spark · 6 September 2026

DGX Spark GB10 en 2026 : la stack logicielle complète pour LLM open source, du fine-tuning aux clusters

Le NVIDIA DGX Spark GB10 promet de faire tourner des LLM comme Llama 70B sur un bureau silencieux de 170 W. Mais entre LiteLLM, vLLM, Ollama, llama.cpp, Llama Swap et le nouveau venu Atlas, le choix de la stack logicielle est tout aussi crucial que le matériel. Avec les mises à jour de l’été 2026 — Cluster Assistant, NVFP4, DeepSeek V4 Flash 0731, Ant Ling-3.0-Flash, Poolside Laguna S 2.1 et Nemotron 3 — la donne change radicalement. Ce comparatif vous guide à travers les forces, faiblesses et cas d’usage de chaque solution, à partir des tests récents de la communauté et des annonces officielles NVIDIA.


Le DGX Spark GB10 : un mini-supercalculateur taillé pour les LLM locaux

Annoncé lors du GTC 2025 et expédié depuis fin 2025, le NVIDIA DGX Spark est un mini-PC desktop qui concentre une puissance de calcul inédite dans un format compact. Sa puce GB10 Grace Blackwell associe 20 cœurs ARM Neoverse V2 à un GPU Blackwell d’environ 6144 cœurs CUDA (architecture SM12.1), le tout relié à 128 Go de mémoire LPDDR5X unifiée avec une bande passante d’environ 273 Go/s. Le TDP de 170 W en fait une machine silencieuse, idéale pour un usage professionnel continu. Avec ses dimensions de 150 × 150 × 50,5 mm et son poids de 1,2 kg, il tient littéralement dans un tiroir (hackernoon.com).

Positionné comme une alternative au Mac Studio M4 Ultra (à partir de 5500 €) ou aux configurations dual RTX 3090, le DGX Spark vise les développeurs et chercheurs qui souhaitent exécuter localement des modèles de 70 milliards de paramètres, voire jusqu’à ~200 milliards en quantification 4-bit d’après la communauté. Son système d’exploitation est DGX OS, un Ubuntu Server 24.04 ARM préconfiguré avec le stack NVIDIA AI Enterprise (CUDA 13.0, cuDNN, NCCL, Docker NVIDIA Container Toolkit) — pas de Windows, pas de support officiel pour Claude Code (outilsia.fr).

Prix (mise à jour 2026) : le prix du DGX Spark a augmenté de 700 $ en février 2026, passant à 4 699 $ (source : hackernoon.com). Cette hausse s’explique par les contraintes mondiales d’approvisionnement en mémoire. Trois variantes principales existent, fonctionnellement identiques (même puce GB10) : le DGX Spark officiel NVIDIA, l’ASUS Ascent GX10 (généralement 500 à 1000 $ moins cher) et les clones MSI EdgeXpert / Acer DGX (outilsia.fr).

Capacité réelle : avec 128 Go de mémoire unifiée, le Spark peut adresser des modèles jusqu’à ~200 milliards de paramètres en quantification 4-bit. Un modèle 120B occupe environ 60-70 Go en Q4, laissant de la place pour le contexte et le système (explainx.ai).

Mais le matériel n’est qu’une partie de l’équation. Pour transformer cette machine en véritable serveur d’inférence ou en station de fine-tuning, il faut choisir la bonne pile logicielle. Et là, les options sont nombreuses.


Cinq solutions logicielles passées au crible (et une sixième qui émerge)

L’article de Dredyson (2026) a testé exhaustivement chaque maillon de la chaîne : application → proxy → swap → moteur d’inférence. Voici le rôle de chaque composant.

Source : optijara.ai

LiteLLM : le proxy API unifié

LiteLLM agit comme un point d’entrée unique compatible avec l’API OpenAI. Il permet de router les requêtes vers différents backends (vLLM, Ollama, llama.cpp) et de gérer les clés API, le rate limiting et le logging. Force : interopérabilité maximale. Faiblesse : overhead réseau et configuration supplémentaire.

Llama Swap : le gestionnaire de modèles

Llama Swap permet de charger et décharger dynamiquement des modèles en mémoire, optimisant l’utilisation des 128 Go unifiés. Idéal pour alterner entre plusieurs LLM sans redémarrer. Force : flexibilité. Faiblesse : nécessite une orchestration fine.

vLLM : le moteur d’inférence haute performance

vLLM est le champion du serving multi-utilisateurs. Il utilise le PagedAttention pour gérer efficacement la mémoire, supporte le tensor parallelism et les quantifications FP4/NVFP4. Force : débit élevé, scaling. Faiblesse : installation plus complexe, dépendances CUDA. NVIDIA recommande des flags spécifiques pour le Spark : --gpu-memory-utilization doit laisser de la marge pour le système et le cache KV, et --max-num-seqs doit rester bas car le Spark est conçu pour du small-batch (source : vllm.ai/blog/2026-06-01-vllm-dgx-spark).

llama.cpp : l’optimiseur CPU/GPU

llama.cpp est conçu pour fonctionner sur CPU avec des quantifications Q4_K_M, mais tire parti du GPU Blackwell via CUDA. Force : légèreté, compatibilité large. Faiblesse : performances inférieures à vLLM sur GPU pur. NVIDIA collabore activement avec l’équipe llama.cpp : les dernières optimisations apportent un gain moyen de 35 % sur les modèles récents exécutés sur DGX Spark, ainsi qu’un chargement des modèles accéléré (blogs.nvidia.com).

Ollama : la simplicité incarnée

Ollama résume l’installation à une commande. Il gère le téléchargement des modèles, le serving et une API compatible OpenAI. Force : prise en main immédiate. Faiblesse : moins de contrôle sur les paramètres d’inférence et le batch processing.

Atlas : l’inférence Rust pure, légère et prometteuse

Atlas est un moteur d’inférence écrit en Rust, spécialement optimisé pour le DGX Spark. Il promet une faible latence et une empreinte mémoire réduite, sans dépendre de CUDA ou de Python. Force : légèreté extrême, idéal pour les déploiements conteneurisés. Faiblesse : écosystème encore jeune, support de modèles limité (source : atlasinference.io). Les premiers tests communautaires de l’été 2026 montrent des débits impressionnants : 82 tokens/s sur Qwen3-Next-80B, ce qui le place au niveau de vLLM sur les modèles supportés.

Solution Rôle principal Facilité d’installation Compatibilité API OpenAI Support fine-tuning natif
LiteLLM Proxy/routeur Moyenne Oui Non (proxy)
Llama Swap Swap de modèles Moyenne Non Non
vLLM Moteur d’inférence Difficile Oui Non
llama.cpp Moteur CPU/GPU Facile Oui Non
Ollama Serveur complet Très facile Oui Oui (via Modelfile)
Atlas Moteur d’inférence Facile (Rust) Oui (prévu) Non

Benchmarks : qui crache les tokens le plus vite ?

Les premiers chiffres de performance pour le DGX Spark proviennent d’un article de dev.to (mrjhnsn, 2026). Ils comparent vLLM et Ollama sur des modèles récents en quantification standard.

Modèle vLLM (tok/s) Ollama (tok/s)
Llama 4 8B 45,2 38,7
Mistral 7B v0.4 52,8 45,3
CodeLlama 13B 28,4 24,8
Qwen 3 7B 49,1 42,9

vLLM devance Ollama de 15 à 20 % selon les modèles. La différence s’explique par l’optimisation mémoire de vLLM (PagedAttention) et son support natif du batching. Pour un usage mono-utilisateur, Ollama reste très honorable avec ~45 tok/s sur Mistral 7B v0.4.

Mise à jour été 2026 — NVFP4 et modèles 120B+ : NVIDIA a co-développé avec l’équipe vLLM des checkpoints quantifiés NVFP4 pour les modèles récents, tirant parti des cœurs FP4 natifs du Blackwell. Le format NVFP4 permet de compresser les modèles d’IA jusqu’à 70 % sans perte d’intelligence (blogs.nvidia.com). Les benchmarks communautaires montrent des débits de 35 à 80+ tok/s sur des modèles de classe GPT-OSS 120B selon la quantification et la longueur du prompt (explainx.ai).

Nouveaux modèles et leurs performances :

  • Ant Ling-3.0-Flash 124B-A5B : modèle MoE avec 5B paramètres actifs par token, architecture hybride linéaire (KDA et MLA), fenêtre de contexte 256K tokens (extensible à 1M). Sorti le 23 juillet 2026 par Ant Group, il bat leur précédent modèle 1T sur presque tous les benchmarks. Sur un seul DGX Spark, la communauté estime un débit de 15-20 tok/s (source : forums.developer.nvidia.com). Idéal pour les tâches de raisonnement et de code.
  • Poolside Laguna S 2.1 : modèle de 118B paramètres (MoM, 256 experts), open-weight, conçu pour le codage agentique. Sorti le 23 juillet 2026, c’est le premier grand modèle open-weight américain depuis 11 mois. Nécessite un cluster de 2 à 4 DGX Spark pour fonctionner en quantification 4-bit. Les benchmarks montrent qu’il surpasse des modèles 10× plus gros sur les tâches de code (source : habr.com).
  • DeepSeek V4 Flash 0731 : sorti le 31 juillet 2026, ce modèle open-weight avec 13B paramètres actifs offre des performances agentiques de niveau frontière, 10× plus petit que Claude Opus. En quantification Q8 (UD-Q8_K_XL), il pèse 162 Go — seulement 7 Go de plus que la version Q4 — et peut tourner en pleine précision sur un cluster de 2 DGX Spark. Sur une configuration dual Spark avec le bon réglage de config, il atteint 30 tok/s en sortie de boîte, et davantage après ajustement (source : forums.developer.nvidia.com). Des tests communautaires récents sur un seul Spark montrent même 1 000 tok/s en prefill et 59 tok/s en serving multi-agents avec un moteur CUDA dédié (forums.developer.nvidia.com).
  • Nemotron 3 : la famille de modèles NVIDIA récemment annoncée, optimisée pour tourner directement sur DGX Spark et DGX Station via les frameworks open-source (source : blogs.nvidia.com).

D’autres benchmarks sont en cours : Georgi Gerganov (créateur de llama.cpp) a publié des premiers résultats sur hardware-corner.net, mais sans chiffres précis dans les extraits. Spark Arena (spark-arena.com), un leaderboard communautaire, agrège les performances des stacks vLLM, SGLang, TensorRT-LLM et llama.cpp, mais les données n’étaient pas accessibles au moment de la rédaction.

L’impact de la quantification est crucial : le DGX Spark supporte NVFP4 (NVIDIA FP4) et Q4_K_M. Les modèles 70B peuvent tenir dans 128 Go avec une quantification 4-bit, avec des débits annoncés entre 35 et 80+ tok/s par la communauté (explainx.ai). Ces chiffres restent à confirmer par des tests indépendants.


Fine-tuning sur DGX Spark : LoRA, QLoRA et full fine-tune en BF16

L’un des atouts majeurs du DGX Spark est sa mémoire unifiée de 128 Go, qui permet d’effectuer du fine-tuning local sans avoir à transférer des données entre CPU et GPU. La solution la plus aboutie est fournie par Unsloth, qui a publié un tutoriel dédié.

Source : outilsia.fr

Le Dockerfile Unsloth pour DGX Spark est basé sur nvcr.io/nvidia/pytorch:25.09-py3 (CUDA 13.0). Il compile Triton depuis la source (commit c5d671f), installe xformers, bitsandbytes 0.48.0, transformers 4.56.2 et trl 0.22.2. Les variables d’environnement pointent vers CUDA 13.0 et TORCH_CUDA_ARCH_LIST='12.1' (architecture SM12.1 du GPU Blackwell).

Unsloth permet le fine-tuning LoRA/QLoRA, mais aussi l’apprentissage par renforcement (RL) avec OpenAI gpt-oss (modèle 20B). Un notebook Jupyter spécifique est fourni. C’est la seule stack qui intègre nativement le fine-tuning sur le Spark.

Comparaison Unsloth vs Axolotl vs TRL vs LLaMA-Factory (source : marktechpost.com) : Unsloth domine en vitesse et en simplicité pour LoRA/QLoRA, tandis que NeMo de NVIDIA offre un support enterprise avec des pipelines de fine-tuning complets. LLaMA-Factory reste une alternative flexible pour les expérimentations rapides, et TRL est le choix naturel pour l’apprentissage par renforcement.

Nouveauté 2026 : le fine-tuning BF16 en full precision — grâce aux 128 Go de mémoire unifiée, il est désormais possible de faire du full fine-tune sur des modèles 70B en BF16 sans quantification, une capacité qui était réservée aux clusters il y a encore un an. Les tests communautaires montrent que le Spark peut gérer un batch de 1 à 2 avec un modèle 70B en BF16, ce qui ouvre la porte à un fine-tuning de précision pour les cas d’usage spécialisés (outilsia.fr).


Clusters multi-nœuds : de 200 à 700 milliards de paramètres

Le vrai changement de paradigme de 2026, c’est le clustering. Deux DGX Spark reliés via leurs ConnectX-7 Smart NICs créent un pool mémoire de 256 Go capable de faire tourner des modèles jusqu’à 405 milliards de paramètres. En configuration quad-node — quatre unités interconnectées via un switch 200 GbE RoCE — on atteint 512 Go de mémoire unifiée et environ 4 pétaflops de calcul FP4 agrégé (hackernoon.com).

DeepSeek V4 Flash 0731 sur 2× DGX Spark : le cas d’usage le plus documenté. Avec 13B paramètres actifs, ce modèle offre des performances agentiques de niveau frontière en tournant sur deux Sparks. Les tests de la communauté montrent qu’avec le bon réglage de config (notamment le cache KV en NVFP4), on atteint 30 tok/s en sortie de boîte, et davantage après ajustement du scheduling (forums.developer.nvidia.com). Un retour d’expérience détaillé sur le serving d’agents avec Hermes Agent confirme la viabilité de cette configuration pour des déploiements privés et on-premise (flowtivity.ai).

Poolside Laguna S 2.1 sur 4× DGX Spark : avec 118B paramètres et 256 experts, ce modèle de codage agentique nécessite 2 à 4 Sparks en quantification 4-bit. Les benchmarks montrent qu’il surpasse des modèles 10× plus gros sur les tâches de code, ce qui en fait le choix idéal pour les équipes de développement qui veulent un assistant de code souverain (habr.com).

Le câblage : pour un cluster 4 nœuds, NVIDIA recommande un switch 200 GbE RoCE et des câbles approuvés comme l’Amphenol NJAAKK-N911 (400 mm, 32 AWG). Le débit théorique par lien 10GbE est de 1,25 Go/s, mais le ConnectX-7 permet d’aller bien au-delà avec le RoCE.


Gestion de flotte : Progress Chef entre dans l’arène

Le 30 juillet 2026, Progress Software annonçait la compatibilité de sa plateforme Chef Enterprise Management avec le NVIDIA DGX Spark, à un prix de 189 dollars par an et par système. Pour les entreprises qui commencent à déployer des flottes de Sparks, cette annonce comble un vide : la gestion de dizaines de machines headless ARM devient un vrai défi d’échelle.

Source : devtoolstack.mynewit.com

Chef apporte le provisionnement agentless via JSON, la gestion de configuration déclarative et l’orchestration de mises à jour. Face à Ansible, Base Command, Kubernetes et Slurm, Chef se distingue par sa légèreté et son intégration native avec DGX OS. Pour les clusters de recherche, Slurm reste la référence pour l’ordonnancement de jobs, tandis que Kubernetes s’impose pour les déploiements conteneurisés à grande échelle.


La révolution diffusion : quand les LLM génèrent en parallèle

L’été 2026 a vu émerger une nouvelle génération de modèles à architecture diffusion, qui bouscule le paradigme autorégressif. Nemotron-Labs-Diffusion de NVIDIA, en mode tri-mode, promet 5,9× plus de tokens par passe que les modèles autorégressifs classiques. Sur DGX Spark, cela se traduit par des débits d’inférence nettement supérieurs pour les tâches de génération longue.

DiffusionGemma est un autre exemple de cette tendance, optimisé par NVIDIA pour tourner sur le Spark. Ces modèles sont particulièrement adaptés aux charges de travail de génération de contenu où la latence est critique. Les premiers benchmarks communautaires montrent des gains de 2 à 3× sur les tâches de résumé et de rédaction par rapport aux modèles autorégressifs de même taille.


Conclusion : quelle stack choisir en septembre 2026 ?

Le paysage a radicalement changé depuis le lancement du Spark. Pour un usage simple, Ollama reste imbattable en simplicité. Pour du serving multi-utilisateurs, vLLM avec NVFP4 est le choix par défaut. Pour le fine-tuning, Unsloth domine, avec NeMo en option enterprise. Et pour les clusters, la combinaison vLLM + DeepSeek V4 Flash 0731 sur 2× Spark est le sweet spot actuel.

Le DGX Spark n’est plus une curiosité : c’est une plateforme mature, avec un écosystème logiciel qui a rattrapé — et parfois dépassé — ce que l’on trouvait dans le cloud il y a deux ans. Le prix de 4 699 $ reste élevé, mais pour les équipes qui veulent la souveraineté de leurs modèles, c’est devenu un investissement rationnel.


Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *