NVIDIA DGX Spark · 7 September 2026Les LLM open source sur NVIDIA DGX Spark en septembre 2026 : modèles stars, fine-tuning, clusters et mises à jour
En septembre 2026, le DGX Spark s’est imposé comme la référence de l’IA locale. Avec ses 128 Go de mémoire unifiée, son SoC GB10 Grace Blackwell et une pile logicielle en pleine maturité, il fait tourner des modèles de 200 à 700 milliards de paramètres — seul ou en cluster. DeepSeek V4 Flash 0731, Ant Ling-3.0-Flash, Gemma 4, Poolside Laguna S 2.1 : tour d’horizon des modèles qui tournent vraiment, des benchmarks mesurés par la communauté, des techniques de fine-tuning et des mises à jour logicielles de l’été 2026.
Le trio de 2026 : DGX Spark, RTX 5090 et RTX Spark
L’année 2026 marque un tournant dans la démocratisation des LLM locaux. Fini le temps où il fallait louer des clusters cloud pour faire tourner un modèle de 70 milliards de paramètres. NVIDIA propose désormais trois configurations matérielles qui couvrent un spectre allant de la station de travail dédiée à la carte graphique grand public, en passant par une variante mobile inédite.
Le DGX Spark (anciennement Project DIGITS) est une station IA compacte, présentée au CES 2025 et disponible depuis octobre 2025. Son prix a évolué : lancé à 3 999 $, il est passé à 4 699 $ en février 2026 (source : syskb.com, confirmé par deepresearch.ninja et LeCompute). En mai 2026, des variantes OEM comme l’ASUS Ascent GX10 se négocient 500 à 1 000 $ de moins, soit environ 3 000–3 500 $ HT (outilsia.fr). Avec son format de 150×150×50,5 mm pour 1,2 kg et une consommation de 240 W max (environ 170 W mesurés en charge selon LeCompute), il tient dans un sac à dos et se branche sur une prise standard. C’est la solution « tout-en-un » pour les développeurs, chercheurs et entreprises qui veulent exécuter des LLM localement sans se soucier de l’infrastructure.
La RTX 5090 est la carte graphique grand public la plus puissante de la génération Blackwell. Son prix varie selon les sources : entre 3 500 $ et 4 200 $ (deepresearch.ninja), tandis que float16.cloud l’estime entre 1 999 $ et 2 200 $ (prix grand public constaté). En Europe, la pénurie la pousse à 3 900–4 400 € (LeCompute). Elle dispose de 32 Go de VRAM GDDR7 avec une bande passante fulgurante de 1 792 Go/s. Destinée aux gamers, créateurs et passionnés d’IA, elle offre des performances d’inférence impressionnantes pour les modèles de taille moyenne, mais bute sur les très gros LLM faute de mémoire suffisante. Sa consommation atteint 575 W pour la carte seule (LeCompute).
Le RTX Spark est la grande surprise de 2026. Annoncé au Computex 2026, il reprend le même silicium GB10 que le DGX Spark, mais dans un format grand public, tournant sous Windows et disponible en notebooks ou en boîtier compact (source : morgannriu.fr). Les pilotes récemment publiés confirment deux variantes du processeur N1X (lesnumeriques.com), et NVIDIA a lancé le 20 juillet 2026 un kit de développement CUDA 13.4 natif pour Windows on Arm, permettant aux développeurs de préparer leurs applications pour RTX Spark avant même la sortie des machines (techtimes.com, igorslab.de, pausehardware.com). ASUS et MSI lanceront leurs PC portables RTX Spark dès cet automne, avant leurs concurrents Acer et Gigabyte (clubic.com, lesnumeriques.com). Son prix n’a pas encore été officiellement communiqué, mais les estimations le situent entre 2 500 $ et 3 000 $ (deepresearch.ninja).
| Caractéristique | DGX Spark | RTX 5090 | RTX Spark |
|---|---|---|---|
| SoC/GPU | GB10 Grace Blackwell (CPU ARM 20 cœurs + GPU Blackwell 6144 CUDA) | GPU Blackwell discret (GB202, 21 760 CUDA) | GB10 Grace Blackwell (identique DGX Spark) |
| Mémoire | 128 Go LPDDR5x unifiée | 32 Go GDDR7 | 128 Go LPDDR5x (estimé) |
| Bande passante mémoire | ~273 Go/s | 1 792 Go/s | ~273–301 Go/s (estimé) |
| Performance IA (FP4) | 1 pétaFLOP (1 000 TOPS) | Non précisé | Non précisé |
| TDP | 240 W max (~170 W mesurés) | 575 W (carte seule) | ~240 W (estimé) |
| Prix | 3 999 $ (oct. 2025) → 4 699 $ (fév. 2026) ; OEM dès ~3 000 $ | 1 999 $ MSRP, 2 999 $+ rue US, 3 900–4 400 € UE | Non annoncé (estimé 2 500–3 000 $) |
| OS | DGX OS (Ubuntu 24.04 custom) | Windows / Linux | Windows (CUDA 13.4 preview Arm64) |
Sources : deepresearch.ninja, float16.cloud, codersera.com, proxpc.com, llmrequirements.com, LeCompute, outilsia.fr
Architecture sous le capot : Grace Blackwell contre Blackwell pur
Le cœur du débat réside dans l’architecture. Le DGX Spark et le RTX Spark partagent le même superprocesseur NVIDIA GB10 Grace Blackwell. Il combine un CPU ARM 20 cœurs (10× Cortex-X925 + 10× Cortex-A725) avec un GPU Blackwell doté de 6 144 cœurs CUDA et des Tensor Cores de 5e génération supportant nativement le FP4 (source : morgannriu.fr, workstation.ma). Cette conception unifiée permet au CPU et au GPU de partager la mémoire via NVLink-C2C, offrant une latence réduite et une gestion simplifiée des données. Sous le capot, le DGX Spark tourne sous DGX OS, une distribution basée sur Ubuntu Server 24.04 ARM, avec le stack NVIDIA AI Enterprise pré-installé : CUDA 13.0, cuDNN, NCCL, drivers Blackwell et Docker NVIDIA Container Toolkit (outilsia.fr).
La RTX 5090, quant à elle, est un GPU Blackwell discret (architecture GB202) avec 21 760 cœurs CUDA. Elle ne dispose pas de CPU intégré ; elle doit être associée à un processeur hôte (Intel ou AMD) via PCIe Gen5. Ses Tensor Cores sont également de 5e génération, mais le support du FP4 n’est pas explicitement confirmé dans les sources. En revanche, sa bande passante mémoire est plus de six fois supérieure à celle du GB10 (1 792 Go/s contre 273 Go/s), ce qui lui confère un avantage décisif sur les modèles de taille modeste.
Le point clé : le DGX Spark et le RTX Spark peuvent exécuter des LLM jusqu’à 200 milliards de paramètres en local grâce à leur mémoire unifiée de 128 Go, tandis que la RTX 5090 est limitée à 32 Go de VRAM. Cependant, pour les modèles qui tiennent dans ces 32 Go, la RTX 5090 offre des débits d’inférence bien plus élevés grâce à sa bande passante mémoire massive. Comme le résume LeCompute : « la mémoire élimine, la bande passante classe ». LMSYS évalue d’ailleurs la capacité IA réelle du DGX Spark comme se situant entre une RTX 5070 et une 5070 Ti — pas dans la même ligue que la 5090 sur le calcul brut (codersera.com).
Le duel des mémoires : 128 Go unifiés contre 32 Go GDDR7
La mémoire est le nerf de la guerre pour l’inférence de LLM. Le DGX Spark dispose de 128 Go de LPDDR5x unifiée, partagée entre le CPU et le GPU via NVLink-C2C. La bande passante annoncée est de ~273 Go/s (source : workstation.ma, LeCompute, outilsia.fr). Cela permet de charger des modèles de très grande taille, comme GPT-OSS-120B (117 milliards de paramètres, MoE, 5,1 milliards d’actifs) qui occupe environ 65 Go en quantification MXFP4 (source : glukhov.org). En comparaison, le Mac Studio (modèle non précisé) avec sa mémoire unifiée voit ses performances se dégrader fortement lorsque le contexte augmente (34 tok/s puis 6 tok/s), alors que le DGX Spark maintient un débit stable de 41 tok/s en génération (source : glukhov.org citant un blog Ollama).
La RTX 5090, avec ses 32 Go de GDDR7 et 1 792 Go/s de bande passante, est un monstre de rapidité pour les modèles qui tiennent dans sa VRAM. Par exemple, Qwen3.6-27B (dense 27 milliards de paramètres, sorti en avril 2026) en AWQ-INT4 peut être inféré à 575 tok/s avec vLLM et une concurrence de 8 (source : deepresearch.ninja). Mais dès que le modèle dépasse 30 milliards de paramètres, il faut recourir au offloading CPU, ce qui dégrade sévèrement les performances. GPT-OSS-120B, par exemple, ne peut pas être chargé entièrement sur la RTX 5090 sans offloading, et les benchmarks disponibles ne montrent pas de résultat pour cette configuration.
Le RTX Spark, avec sa mémoire unifiée estimée à 128 Go et une bande passante de 273–301 Go/s, se positionne comme un compromis entre mobilité et capacité. Aucun benchmark indépendant n’est encore disponible, mais la publication du kit CUDA 13.4 pour Windows on Arm le 20 juillet 2026 permet déjà aux développeurs de porter leurs applications (techtimes.com, igorslab.de, mundowin.com). Les premiers portables ASUS et MSI arrivent à l’automne 2026 (clubic.com).
Benchmarks : qui crache les tokens le plus vite ?
Les chiffres parlent d’eux-mêmes. Voici un tableau comparatif des performances d’inférence mesurées par plusieurs sources indépendantes : deepresearch.ninja, float16.cloud, LeCompute, proxpc.com et les forums développeurs NVIDIA.

| Modèle | Configuration | DGX Spark | RTX 5090 |
|---|---|---|---|
| Qwen3.6-27B (dense 27B) | vLLM AWQ-INT4, concurrency 8 | 25–32 tok/s (llama.cpp MTP), ~15 tok/s (vLLM spec. dec.) | 575 tok/s |
| GPT-OSS-120B (MoE, 5.1B actifs) | MXFP4, Ollama | 39–54 tok/s (génération) | Impossible sans offload |
| GPT-OSS-20B | Concurrency 128/16 | ~50 tok/s (LMSYS) | ~205 tok/s (LMSYS) |
| Qwen3-VL-4B (vision-language) | Concurrency 128/16 | 1 237 tok/s | 1 005 tok/s |
| Typhoon2.5-Qwen3-4B | Concurrency 128/16 | 1 105 tok/s | 1 446 tok/s |
| DeepSeek V4 Flash 0731 (284B, 13B actifs) | vLLM, prefill | 1 000 tok/s (prefill), 59 tok/s (multi-agent serving) | Impossible (hors VRAM) |
| Génération d’image (Qwen-Image) | – | 98 s | 46 s |
| Génération vidéo (Wan2.2-5B) | – | 825 s | 344 s |
Sources : deepresearch.ninja, float16.cloud, LeCompute, forums.developer.nvidia.com (1er août 2026). Attention : les conditions de concurrence diffèrent entre les benchmarks (DGX Spark testé à concurrency 128, RTX 5090 à concurrency 16 chez float16.cloud).
Le constat est clair : sur les modèles de taille modeste (≤30B), la RTX 5090 écrase le DGX Spark en vitesse pure — de 3 à 10× selon la quantification et le runtime (deepresearch.ninja). Le mécanisme est simple : la génération de LLM relit l’intégralité des poids du modèle pour chaque token produit, donc le débit de sortie est plafonné par la vitesse de parcours de la mémoire, presque jamais par le calcul. La 5090 parcourt ses 32 Go à ~1 792 Go/s ; le Spark parcourt ses 128 Go à ~273 Go/s. Sur le même modèle, le ratio de débit suit le ratio de bande passante (LeCompute).
Mais dès que la mémoire devient un facteur limitant, le DGX Spark reprend l’avantage — et les modèles de plus de 30 milliards de paramètres ne tiennent tout simplement pas sur la RTX 5090. C’est là que le Spark brille : DeepSeek V4 Flash 0731, un MoE de 284 milliards de paramètres avec seulement 13 milliards d’actifs, atteint 1 000 tok/s en prefill et 59 tok/s en multi-agent serving sur un seul Spark (forums.developer.nvidia.com, 1er août 2026). Un exploit impossible sur la 5090.
Les modèles stars de 2026 sur DGX Spark
L’été 2026 a été particulièrement riche en sorties de modèles open-weight optimisés pour le GB10. Voici ceux qui tournent vraiment sur un seul DGX Spark, selon les retours de la communauté et les benchmarks publiés.
DeepSeek V4 Flash 0731 — le modèle événement de l’été. Avec ses 284 milliards de paramètres dont 13 milliards d’actifs, il offre des performances agentiques de niveau « frontier » avec un coût d’inférence 10× inférieur à Claude Opus (flowtivity.ai). Sur un seul Spark, il atteint 1 000 tok/s en prefill et 59 tok/s en multi-agent serving (forums.developer.nvidia.com). En quantification Q8 (UD-Q8_K_XL, 162 Go), il tourne en pleine précision sans perte (forums.developer.nvidia.com, 31 juillet 2026). Sur deux Sparks en cluster, les utilisateurs rapportent des résultats encore meilleurs avec un KV-cache optimisé et un scheduling adapté à la mémoire unifiée (forums.developer.nvidia.com, 2 août 2026).
Ant Ling-3.0-Flash — publié le 23 juillet 2026 par Ant Group, ce modèle de 124 milliards de paramètres avec 5 milliards d’actifs (124B-A5B) bat leur précédent modèle de 1 000 milliards sur presque tous les benchmarks (forums.developer.nvidia.com, 23 juillet 2026). Il utilise une attention hybride linéaire native (couches KDA et MLA empilées en ratio 5:1), avec un contexte natif de 256K extensible à 1M. Le débit d’inférence estimé sur un Spark est de 15–20 tok/s (forums.developer.nvidia.com). C’est actuellement le meilleur rapport performance/taille pour un seul Spark.
Gemma 4 — Google a dévoilé Gemma 4 en avril 2026, avec des variantes E2B, E4B, 26B et 31B, optimisées en collaboration avec NVIDIA pour les GPU de la marque, y compris le DGX Spark (blogs.nvidia.com). Les modèles 26B et 31B sont conçus pour les workflows de raisonnement haute performance et les agents, avec support natif de l’appel de fonction, des entrées multimodales intercalées (texte, image, vidéo, audio) et plus de 35 langues. Ils tournent efficacement sur le Spark pour des assistants de codage et des agents autonomes.
Poolside Laguna S 2.1 — sorti le 23 juillet 2026, ce modèle de 118 milliards de paramètres pour le codage agentique est présenté comme « la plus puissante modèle ouvert de l’Ouest » (habr.com, ai-stat.ru). Avec son architecture MoM (Mixture of Models) à 256 experts et un routeur token-choice, il tient dans un seul desktop et bat des concurrents 10× plus gros sur les benchmarks de codage.
Mistral Small 4, GLM 5.2, Kimi K2.7 — ces modèles de la génération 2026 tournent également sur le Spark, avec des performances variables selon la quantification et le runtime. Mistral Small 4 est particulièrement apprécié pour sa rapidité en inférence, tandis que GLM 5.2 et Kimi K2.7 excellent en raisonnement (aimadetools.com).
Fine-tuning sur DGX Spark : LoRA, QLoRA et full fine-tune en BF16
Le DGX Spark n’est pas qu’une machine d’inférence : c’est aussi une plateforme de fine-tuning redoutable. Grâce à ses 128 Go de mémoire unifiée, il permet de fine-tuner des modèles de 70 milliards de paramètres en FP16 sans quantification — une « killer feature » que les reviews anglo-saxonnes passent souvent sous silence (outilsia.fr).

Les techniques qui fonctionnent :
- LoRA (Low-Rank Adaptation) : la méthode la plus économique. Elle ajoute des matrices de faible rang aux poids du modèle, ne nécessitant que quelques Go de mémoire supplémentaire. Idéale pour adapter un modèle à un domaine spécifique (codage, médecine, droit) en quelques heures.
- QLoRA : la version quantifiée de LoRA, qui permet de fine-tuner des modèles encore plus grands en 4 bits. Sur le Spark, elle fonctionne avec des modèles jusqu’à 200 milliards de paramètres.
- Full fine-tune en BF16 : le Spark peut fine-tuner entièrement un modèle de 70B en BF16, ce qui était jusqu’ici réservé aux serveurs multi-GPU. C’est la méthode la plus coûteuse en temps mais la plus efficace pour des adaptations profondes.
Les outils qui marchent : NeMo (le framework NVIDIA), Unsloth (optimisé pour la vitesse), LLaMA Factory (interface unifiée pour LoRA/QLoRA), et Atlas (le nouveau venu de l’été 2026). La communauté rapporte des résultats concrets : fine-tuning de Llama 70B en BF16 sur un seul Spark en environ 24 heures pour un jeu de données de 10 000 exemples (deepwiki.com, 12 août 2026).
Le point crucial : le GB10 supporte nativement le FP4, ce qui accélère considérablement l’entraînement par rapport aux générations précédentes. Combiné à la mémoire unifiée de 128 Go, il offre un environnement de fine-tuning complet dans un format de 1,2 kg.
Clusters multi-nœuds : de 200 à 700 milliards de paramètres
L’une des évolutions majeures de 2026 est la mise en réseau des DGX Spark. NVIDIA a annoncé au CES 2026 une mise à jour qui multiplie par 2,5 les performances et par 8 la vitesse de génération vidéo (storagereview.com). Mais c’est surtout la capacité à former des clusters qui change la donne.
Le cluster 2× DGX Spark est la configuration la plus documentée. Avec DeepSeek V4 Flash 0731, les utilisateurs rapportent des résultats impressionnants en agent serving : le KV-cache est réparti entre les deux machines, le scheduling est optimisé pour la mémoire unifiée (UMA), et les conclusions sur l’overlap benchmark ont été corrigées après re-vérification (forums.developer.nvidia.com, 2 août 2026). Le débit multi-agent atteint des niveaux comparables à un serveur professionnel, pour une fraction du coût.
De 200 à 700 milliards de paramètres : selon les articles du magazine, un cluster de 4 à 8 DGX Spark permet d’exécuter des modèles de 200 à 700 milliards de paramètres en local. La connectivité réseau est assurée par le lien 10GbE intégré (débit théorique de 1,25 Go/s), avec une option 100 GbE pour les configurations avancées. Les benchmarks montrent que le scaling est quasi linéaire pour l’inférence, grâce à l’architecture NVLink-C2C et au support natif de NCCL.
Progress Chef est entré dans l’arène le 30 juillet 2026 : la plateforme Chef Enterprise Management est désormais compatible avec le DGX Spark, à 189 $ par an et par système (progress.com). Pour les entreprises qui déploient des flottes de Sparks, c’est la solution de gestion centralisée qui manquait : déploiement de configurations, mises à jour logicielles, surveillance des clusters.
La stack logicielle : mises à jour de l’été 2026
L’été 2026 a été marqué par des avancées logicielles majeures pour le DGX Spark.

CUDA 13.4 pour Windows on Arm — publié en preview le 20 juillet 2026, ce kit de développement natif Arm64 permet aux développeurs de préparer leurs applications pour le RTX Spark avant même la sortie des machines (techtimes.com, igorslab.de, mundowin.com). SEGA l’a déjà adopté pour ses outils (mundowin.com).
DGX OS — la distribution basée sur Ubuntu Server 24.04 ARM est arrivée à maturité. Elle inclut CUDA 13.0, cuDNN, NCCL, les drivers Blackwell et Docker NVIDIA Container Toolkit. Le premier boot headless se fait via LAN auto-discovery, et la séquence complète de configuration prend environ 3 heures (outilsia.fr).
Les runtimes — LiteLLM, vLLM, Ollama, llama.cpp et Llama Swap sont tous compatibles. Le nouveau venu Atlas émerge comme une alternative prometteuse pour la gestion de plusieurs modèles. Les benchmarks montrent que llama.cpp avec MTP (Multi-Token Prediction) offre les meilleurs débits sur le Spark pour les modèles quantifiés, tandis que vLLM excelle en concurrence élevée.
Le fine-tuning 70B FP16 sans quantization est désormais possible grâce aux optimisations de la pile NVIDIA AI Enterprise (outilsia.fr). C’est la fonctionnalité qui justifie le prix premium du Spark par rapport aux alternatives AMD.
Verdict : quelle machine pour quel usage ?
En septembre 2026, le choix se résume à trois cas d’usage :
- Vous voulez la vitesse pure sur des modèles ≤30B : la RTX 5090 est imbattable, avec des débits 3 à 10× supérieurs au Spark. Mais vous serez limité par les 32 Go de VRAM.
- Vous voulez exécuter des modèles de 100 à 700 milliards de paramètres, fine-tuner en BF16, ou monter un cluster : le DGX Spark est la seule option viable dans un format bureau. Son prix a baissé avec les variantes OEM (ASUS Ascent GX10 dès ~3 000 $).
- Vous voulez la mobilité avec Windows : le RTX Spark arrive à l’automne 2026, avec les portables ASUS et MSI. Même silicium, même mémoire, mais un écosystème Windows on Arm en cours de maturation.
Le DGX Spark a tenu sa promesse : démocratiser l’IA locale de niveau recherche. Avec DeepSeek V4 Flash 0731 à 1 000 tok/s en prefill, Ant Ling-3.0-Flash en 124B-A5B, et la possibilité de fine-tuner un 70B en FP16, il n’a plus
Article recherché et rédigé automatiquement · Magazine Electrosens