Electrosens R&D
Electrosens NVIDIA DGX Spark · 18 September 2026

DGX Spark en septembre 2026 : les LLM open-source qui tournent vraiment, du fine-tuning BF16 aux clusters DeepSeek 284B

Un an et demi après son annonce au CES 2025, le mini-supercalculateur de NVIDIA a-t-il enfin tenu ses promesses ? Entre benchmarks impressionnants sur les modèles MoE récents, mises à jour logicielles qui décuplent les capacités de clustering et un fine-tuning désormais possible en BF16 sur un seul nœud, la DGX Spark s’impose comme la référence de l’IA locale. Mais tout n’est pas rose : la bande passante mémoire reste le goulot d’étranglement, et le prix a grimpé de 18 % en février 2026. Tour d’horizon complet de l’écosystème en septembre 2026.


Un an et demi après : le DGX Spark est-il devenu la référence de l’IA locale ?

Lancée au CES 2025 avec la promesse de faire tourner des modèles à 400 milliards de paramètres sur un bureau, la DGX Spark a connu une trajectoire mouvementée. En février 2026, NVIDIA augmentait son prix de 18 %, passant la machine de 3 999 à 4 699 dollars — une décision qui a forcé la firme à accélérer ses mises à jour logicielles pour justifier l’investissement. Sept mois plus tard, le constat est sans appel : la machine est devenue un outil de production crédible, mais avec des nuances importantes. Les guides d’achat récents confirment un prix de détail autour de 4 679 dollars selon les revendeurs (explainx.ai), ce qui reste cohérent avec la hausse de février. En Australie, les prix atteignent 6 249 à 7 999 dollars selon les détaillants (glukhov.org).

Le cœur du système, le Grace Blackwell GB10, associe un CPU ARM à 20 cœurs Neoverse V2 et un GPU Blackwell avec 128 Go de mémoire unifiée LPDDR5x. Point crucial souvent mal compris : la bande passante mémoire est de ~273 Go/s, et non 1 To/s comme certains benchmarks marketing l’ont laissé entendre. Cette caractéristique fait de la bande passante le facteur limitant pour la génération de tokens, tandis que le prefill (traitement de la requête) est limité par le calcul. C’est ce qui explique les écarts spectaculaires entre les vitesses de prefill et de decode observés dans les benchmarks réels.

Côté logiciel, la mise à jour de juin 2026 a apporté le support du NVFP4 (quantification 4-bit native Blackwell), le clustering multi-nœuds via ConnectX-7 et l’outil Nemoclaw pour le fine-tuning distribué. En juillet, la mise à jour a corrigé des problèmes de stabilité et amélioré la gestion mémoire. Enfin, le 21 juillet 2026, NVIDIA a publié la première preview de CUDA 13.4 pour Windows sur Arm, ouvrant la voie aux PC RTX Spark — une évolution qui élargit considérablement l’écosystème (techtimes.com, igorslab.de). Les pilotes confirment deux variantes du N1X pour ces futurs PC (lesnumeriques.com).

Au CES 2026 (janvier), NVIDIA a présenté les dernières optimisations logicielles : le support NVFP4 pour les modèles de nouvelle génération, des gains de 35 % sur llama.cpp pour les modèles MoE, et une meilleure gestion de la mémoire unifiée (developer.nvidia.com).

En septembre 2026, NVIDIA poursuit son effort logiciel : la firme a annoncé le 3 septembre de nouvelles optimisations pour les GPU RTX et DGX, simplifiant l’IA locale sur les cartes de 24+ Go de VRAM tout en améliorant vLLM et llama.cpp (wccftech.com). Cette stratégie confirme que l’écosystème DGX Spark bénéficie d’un effet d’entraînement : chaque optimisation pour les RTX profite aussi au GB10.


MoE, mémoire unifiée et bande passante : l’architecture qui change tout

L’architecture mixture-of-experts (MoE) reste la clé pour faire tourner des modèles massifs sur une machine à mémoire unifiée. Le principe : seuls quelques experts sont activés par token, ce qui réduit drastiquement les paramètres actifs. C’est cette propriété qui rend possible l’exécution de modèles de 100 à 400 milliards de paramètres sur un simple bureau.

DGX Spark上的模型推理速度 (tok/s)DeepSeek V4 Flash 073140tok/sAnt Ling-3.0-Flash20tok/sQwen3.8-27B48tok/sQwen 3.6 35B A3B200tok/s

Sur la DGX Spark, la bande passante de ~273 Go/s est le facteur déterminant. Comme l’explique le guide pratique de Flaviu Vlaicu (vlaicu.io), « la bande passante est le goulot d’étranglement pour la génération de tokens, donc les modèles MoE avec peu de paramètres actifs tournent beaucoup plus vite que les modèles denses de même taille totale ». En clair : privilégiez les MoE.

Les modèles récents exploitent pleinement cette caractéristique. Le DeepSeek V4 Flash 0731, sorti fin juillet 2026, ne mobilise que 13 milliards de paramètres actifs par token — dix fois moins que Claude Opus — tout en offrant des performances de niveau « frontier » pour les agents IA. Avec 284 milliards de paramètres totaux (deepwiki.com), il tient en Q8 (162 Go) sur deux DGX Spark, ou en Q4 (155 Go) sur un seul nœud. Sur deux nœuds en cluster, il atteint des débits exploitables en production (voir section benchmarks). De son côté, Ant Ling-3.0-Flash, publié le 23 juillet 2026, est un modèle de 124 milliards de paramètres avec seulement 5 milliards d’actifs (124B-A5B), conçu pour tenir sur une seule Spark (forums.developer.nvidia.com).


Les modèles qui tournent vraiment sur le GB10 en septembre 2026

Modèle Paramètres totaux Paramètres actifs Contexte Faisabilité sur 1 Spark Faisabilité sur 2 Sparks
DeepSeek V4 Flash 0731 284B 13B 128K Oui (Q4 : 155 Go) Oui, confortable (Q8 : 162 Go)
Ant Ling-3.0-Flash 124B 5B 256K natif, 1M extensible Oui (FP8/INT4) Oui, très confortable
Qwen3.8-27B 27B 262K Oui (~21 Go en UD-Q4_K_XL) Oui
Qwen 3.6 35B A3B 35B 3B 256K Oui (NVFP4, 200+ tok/s) Oui
Llama 4 Scout 109B 17B 10M Oui (FP8/INT4) Oui
Llama 4 Maverick 400B 17B 1M Limité (latence experts) Oui (FP8)
Poolside Laguna S 2.1 118B Oui (Q4) Oui

Sources : forums.developer.nvidia.com, flowtivity.ai, aimadetools.com, habr.com, tokenstead.ai

DeepSeek V4 Flash 0731 est le modèle star de l’été 2026. Disponible en GGUF, il peut être exécuté en Q8 (162 Go) sur deux DGX Spark, ou en Q4 (155 Go) sur un seul nœud — bien que la version Q8 soit recommandée pour une qualité « lossless » (forums.developer.nvidia.com). Un utilisateur des forums NVIDIA rapporte avoir obtenu 30 tok/s par défaut, puis plus de 40 tok/s après une modification de configuration (forums.developer.nvidia.com). Le dépôt GitHub Mjxkill/deepseek-v4-flash-2x-dgx-spark documente la procédure complète. Une reproduction sur un seul nœud est également documentée (deepwiki.com). Le guide matériel de kingy.ai confirme que le modèle peut tourner localement, mais souligne que toutes les configurations ne conviennent pas (kingy.ai).

Ant Ling-3.0-Flash est un cas d’école : avec seulement 5B de paramètres actifs, il est conçu pour la DGX Spark. Selon les forums NVIDIA, il « bat leur précédent modèle 1T sur presque tous les benchmarks » tout en tournant sur une seule machine. Son architecture hybride linéaire (couches KDA et MLA empilées 5:1) lui permet d’atteindre des débits estimés entre 15 et 20 tok/s sur un Spark — une performance remarquable pour un modèle de cette taille (forums.developer.nvidia.com).

Qwen3.8-27B est le nouveau venu d’août 2026, qualifié de « the pick » par le guide de benchmarks Tokenstead : 88 en code, 89 en raisonnement, 94 en tool-calling, avec un contexte de 262K, le tout pour seulement ~21 Go en quantification UD-Q4_K_XL (tokenstead.ai). C’est le meilleur compromis qualité/empreinte actuel sur la Spark. Un test indépendant d’OpenZeka rapporte 48 tok/s sur DGX Spark avec ce modèle, et un score de 52 sur l’Artificial Analysis Intelligence Index, le classant premier de sa catégorie parmi les modèles open-weight (blog.openzeka.com). Le guide de Codersera détaille comment l’exécuter sur des GPU de 16 à 24 Go avec Ollama, LM Studio ou llama.cpp + MTP speculative decoding (codersera.com).

Llama 4, en revanche, est désormais considéré comme l’offre « legacy » de Meta. Behemoth n’a jamais été publié, et Maverick/Scout, bien que fonctionnels, sont surpassés par les modèles chinois sur la plupart des benchmarks de code et de raisonnement. Meta a lancé Muse Spark (avril 2026), un modèle fermé via API, en attendant Llama 5 (« Avocado ») prévu pour 2027.


Benchmarks réels : ce que valent vraiment les modèles open-source sur le GB10

Les tests communautaires de l’été 2026 fournissent enfin des données fiables. Le tableau ci-dessous synthétise les résultats obtenus avec différents moteurs d’inférence.

Source : codersera.com
Modèle Moteur Quantification Débit (tok/s) Prefill (tok/s) Source
Qwen 3.6 35B A3B NVFP4 optimisé NVFP4 200+ tokenstead.ai
Qwen3.8-27B llama.cpp UD-Q4_K_XL 48 blog.openzeka.com
Qwen3-Next-80B Atlas FP8 82 été 2026
DeepSeek V4 Flash 0731 (2 nœuds) llama.cpp Q8 30-40 forums NVIDIA, 31/07/2026
DeepSeek V4 Flash 0731 (1 nœud) moteur CUDA custom 59 (multi-agent) 1 000 forums NVIDIA, 01/08/2026
gpt-oss 120B vLLM FP8 ~39 ~1 720 runaihome.com
Llama 3.1 70B llama.cpp Q4 25-30 jetsonhacks.com
Ant Ling-3.0-Flash llama.cpp FP8 15-20 (est.) forums NVIDIA

Sources : dev.to, forums.developer.nvidia.com, runaihome.com, tokenstead.ai

Le constat est nuancé. D’un côté, le prefill à 10 000 tok/s annoncé par NVIDIA dans sa communication de juin 2026 est confirmé en conditions réelles pour les petits modèles — mais la génération reste limitée à 2,7 tok/s pour les très gros modèles en FP8 sur un seul nœud. C’est le compromis inévitable de la bande passante mémoire.

Le choix du moteur d’inférence est déterminant. Le test exhaustif de Dredyson (dredyson.com) compare vLLM, llama.cpp et Ollama sur la Spark. Verdict : vLLM est le plus rapide pour le prefill et la gestion mémoire, mais llama.cpp offre la meilleure compatibilité GGUF et un contrôle fin via le wrapper llm (décrit dans le playbook de vlaicu.io). Ollama reste le plus simple pour démarrer, mais ses performances sont inférieures. Atlas (82 tok/s sur Qwen3-Next-80B) est une alternative prometteuse, mais encore jeune. Uzu a récemment ajouté le décodage spéculatif, d’abord pour Qwen3.6 27B, avec le support de Qwen3.8 27B et Muse Glimmer à venir — sur les puces Apple M5, Uzu surpasse MTPLX, et l’implémentation est en cours d’adaptation pour le GB10 (trymirai.com). Le support MTP (Multi-Token Prediction) pour Qwen3.8-Flash-Next GGUF apporte un gain de 1,67x (de 83 à 138 tok/s) sans perte de qualité (banandre.com).

Les optimisations logicielles de NVIDIA ont apporté des gains significatifs : le support NVFP4 permet de réduire l’empreinte mémoire d’environ 40 % par rapport au FP8, et l’exécution de Qwen-235B en NVFP4 avec décodage spéculatif offre un gain de 2,6x par rapport au FP8 sur une configuration double DGX Spark (developer.nvidia.com). Les mises à jour de llama.cpp apportent en moyenne 35 % d’amélioration sur les modèles MoE.

Un benchmark récent sur un seul nœud avec DeepSeek V4 Flash 0731 rapporte 1 000 tok/s en prefill et 59 tok/s en serving multi-agent grâce à un moteur CUDA custom (forums.developer.nvidia.com) — des chiffres qui montrent le potentiel du GB10 quand le logiciel est optimisé. Un autre utilisateur a documenté ses résultats sur 2× DGX Spark avec DeepSeek V4 Flash 0731, corrigeant ses premières mesures de decode-share et partageant ses conclusions sur le KV-cache, le scheduling et la mémoire unifiée (forums.developer.nvidia.com).


Fine-tuning : l’exploit BF16 d’un 35B sur un seul Spark, et la maturité des outils

Le fine-tuning local a fait un bond en avant spectaculaire. Là où il fallait autrefois un cluster multi-GPU, la DGX Spark permet désormais d’affiner des modèles jusqu’à 200 milliards de paramètres grâce à ses 128 Go de mémoire unifiée, selon le tutoriel officiel d’Unsloth (unsloth.ai).

Le guide d’Enverge résume la situation : « Les 128 Go de la DGX Spark permettent d’affiner des modèles jusqu’à 30B en pleine précision ou 70B+ avec LoRA/QLoRA sur un seul GPU — sans sharding multi-GPU. Utilisez le full fine-tuning pour une qualité maximale avec suffisamment de données ; LoRA pour les grands modèles et l’itération rapide ; QLoRA quand la mémoire est serrée. L’accès cloud à 0,65 $/heure est ~4,5× moins cher par heure qu’un H100 pour le même travail » (spark.enverge.ai).

Le tutoriel Unsloth détaille le processus : gpt-oss-120b utilise environ 68 Go de mémoire unifiée, et après 1 000 étapes et 4 heures d’entraînement par RL, le modèle surpasse largement l’original sur le jeu 2048. Tous les notebooks Unsloth fonctionnent sur DGX Spark, y compris le notebook 120b — il suffit de supprimer les cellules d’installation. L’image Docker officielle est disponible sur le dépôt GitHub d’Unsloth (unsloth.ai).

Le projet pylox-fine-tune-pipeline propose une approche de production : un pipeline complet pour le fine-tuning et le déploiement on-premises, conçu pour la DGX Spark, avec des configurations standardisées pour les modèles 8B / 32B / 70B. L’architecture est « compliance-safe by design » : les données client ne quittent jamais la Spark, et le modèle local gpt-oss-120b gère l’enrichissement complet du corpus (github.com).

Le guide de terrain du magazine (« DGX Spark en 2026 : fine-tuning local, clusters et LLM open-source — le guide de terrain complet ») détaille les options : LoRA, QLoRA, full fine-tuning — le bon choix selon le modèle et le budget mémoire. Les outils comparés incluent Unsloth, Axolotl, PyTorch natif et les playbooks NVIDIA. Le verdict : Unsloth reste le plus simple pour démarrer, Axolotl offre plus de contrôle, et PyTorch natif est réservé aux utilisateurs avancés.


Clusters : 2 nœuds pour 284B, 4 nœuds pour 700B, mais avec quelles limites ?

Le clustering multi-nœuds est l’une des grandes avancées de 2026. La mise à jour de juin a apporté le support de ConnectX-7 (100 GbE), permettant de relier plusieurs DGX Spark en cluster. Les résultats sont impressionnants : avec 2 nœuds, on peut faire tourner DeepSeek V4 Flash 0731 en Q8 (162 Go) avec des débits de 30 à 40 tok/s. Avec 4 nœuds, les modèles jusqu’à 700 milliards de paramètres deviennent accessibles.

Source : aimadetools.com

Le guide de terrain du magazine documente ces configurations : « 2 nœuds pour 284B, 4 nœuds pour 700B ». Mais les limites sont réelles : la latence inter-nœuds via 10GbE (1,25 Go/s théorique) reste un facteur limitant pour les modèles qui nécessitent une synchronisation fréquente des experts. Les tests communautaires montrent que les modèles MoE avec peu de paramètres actifs (comme DeepSeek V4 Flash avec 13B actifs) se parallélisent bien, tandis que les modèles denses souffrent davantage de la latence.

Un utilisateur des forums NVIDIA a documenté ses résultats sur 2× DGX Spark avec DeepSeek V4 Flash 0731, partageant ses conclusions sur le KV-cache, le scheduling et la mémoire unifiée. Il a notamment corrigé ses premières mesures de decode-share, soulignant l’importance d’une configuration précise pour maximiser le débit (forums.developer.nvidia.com).

Le câble approuvé pour relier les nœuds est l’Amphenol NJAAKK-N911 (400 mm, 32 AWG), et l’annonce initiale de débit 100 GbE a été confirmée par les tests réels.


Logiciels et écosystème : vLLM, Atlas, Uzu, llama.cpp, Ollama — le match de la maturité

L’écosystème logiciel a considérablement mûri en 2026. Voici l’état des lieux en septembre :

vLLM reste le moteur de référence pour le prefill et la gestion mémoire. Ses performances sur gpt-oss 120B (~39 tok/s, ~1 720 tok/s en prefill) en font le choix des utilisateurs exigeants. Les optimisations NVIDIA de septembre 2026 améliorent encore son support sur les plateformes RTX et DGX (wccftech.com).

llama.cpp offre la meilleure compatibilité GGUF et un contrôle fin. Les mises à jour apportent en moyenne 35 % d’amélioration sur les modèles MoE. Le support MTP pour Qwen3.8-Flash-Next GGUF (1,67x de gain) montre la vitalité du projet (banandre.com).

Ollama reste le plus simple pour démarrer, mais ses performances sont inférieures. C’est le choix recommandé pour les débutants.

Atlas est l’alternative prometteuse : 82 tok/s sur Qwen3-Next-80B en FP8. Encore jeune, mais à surveiller.

Uzu a récemment ajouté le décodage spéculatif, d’abord pour Qwen3.6 27B, avec le support de Qwen3.8 27B et Muse Glimmer à venir. Sur les puces Apple M5, Uzu surpasse MTPLX, et l’implémentation est en cours d’adaptation pour le GB10 (trymirai.com).

Nemoclaw (outil NVIDIA pour le fine-tuning distribué) complète l’arsenal, avec le support NVFP4 pour les modèles de nouvelle génération.

Le Portable Computer de Perplexity, annoncé fin août 2026, mérite une mention : il transforme la DGX Spark en agent d’IA local clé en main, avec zéro coût de token pour les tâches locales. La plateforme « local-first » exige 24 Go de mémoire vidéo et fonctionne sur les GPU NVIDIA (zdnet.fr, hothardware.com). Le bundle inclut Qwen3.8 27B comme modèle par défaut, avec la possibilité de passer à des modèles plus gros sur configuration dual-Spark (programmez.com).


DGX Spark vs concurrence : le duel continue

Caractéristique DGX Spark (Founders) AMD Ryzen AI Halo ASUS Ascent GX10
Prix (juin 2026) 4 699 $ (après hausse de 18 %) 3 999 $ (2 To) 2 999 $ (1 To)
Puce GB10 Grace Blackwell Ryzen AI Max+ 395 GB10 Grace Blackwell
Mémoire / bande passante 128 Go LPDDR5x / 273 Go/s 128 Go LPDDR5X / 256 Go/s 128 Go LPDDR5x / 273 Go/s
Génération (gpt-oss 120B) ~39 tok/s ~34 tok/s ~39 tok/s
Prefill (prompt processing) ~1 720 tok/s ~340 tok/s ~1 720 tok/s
Stockage 4 To NVMe 2 To NVMe 1 To NVMe
Écosystème logiciel CUDA complet ROCm / Vulkan / Ollama CUDA complet

Source : runaihome.com

Source : serenitiesai.com

Le verdict du magazine (« DGX Spark vs Ryzen AI Halo : le duel des mini-supercalculateurs IA en 2026 ») reste d’actualité : le prefill fait toujours la différence, et l’écosystème CUDA reste l’atout majeur de NVIDIA. Mais AMD se rapproche, et le Ryzen AI Max+ PRO 495 (192 Go, Q3 2026) pourrait changer la donne pour les modèles jusqu’à 300 milliards de paramètres.

La DGX Station for Windows (GB300, annoncée le 1er juin 2026) éclipse la Spark en puissance pure, mais à un prix bien supérieur. Pour la plupart des utilisateurs, la Spark reste le meilleur rapport performance/prix pour l’IA locale.


Conclusion : la DGX Spark en septembre 2026, un outil de production enfin crédible

Un an et demi après son lancement, la DGX Spark a tenu ses promesses — avec des nuances. Les mises à jour logicielles de 2026 (NVFP4, ConnectX-7, Nemoclaw, CUDA 13.4 Windows on Arm) ont transformé la machine en outil de production crédible. Les modèles MoE récents (DeepSeek V4 Flash, Ant Ling-3.0-Flash, Qwen3.8-27B) exploitent pleinement l’architecture GB10, et le fine-tuning local est devenu une option sérieuse grâce à Unsloth et aux pipelines de production.

Mais la bande passante mémoire (~273 Go/s) reste le goulot d’étranglement fondamental, et le prix (4 699 $) n’est pas anodin. Pour ceux qui ont un workflow CUDA-only spécifique (fine-tuning intensif, vLLM optimisé, recherche ML), la DGX Spark est la référence. Pour les autres, le verdict communautaire de mai 2026 reste valable : 70-80 % des acheteurs préfèrent le Strix Halo d’AMD pour un usage général.

La question n’est plus « peut-on faire tourner des LLM sur la Spark ? » mais « quel modèle, avec quel moteur, et pour quel usage ? ». Et c’est précisément ce qui fait la maturité de l’écosystème.


Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *