Electrosens R&D
Electrosens NVIDIA DGX Spark · 8 September 2026

DeepSeek V4 Flash-0731, Laguna S 2.1, Ant Ling-3.0-Flash : ce qui tourne vraiment sur le DGX Spark en septembre 2026

Le 31 juillet 2026, DeepSeek a publié V4 Flash-0731, un MoE de 284 milliards de paramètres (13 milliards actifs) sous licence MIT. Un mois plus tard, la communauté a affiné les recettes : 1 000 tok/s en prefill sur un seul Spark, 41 tok/s en génération sur deux nœuds, et une flopée de modèles concurrents — Ant Ling-3.0-Flash, Poolside Laguna S 2.1 — qui tiennent eux aussi dans 128 Go. Pendant ce temps, NVIDIA a déployé NVFP4, CUDA 13.4 pour Windows Arm et l’outil PAIR. Tour d’horizon de ce qui tourne vraiment sur le GB10.


Un modèle de 284 milliards dans une tour de bureau

Il y a encore deux ans, faire tourner un modèle de cette envergure chez soi relevait de la science-fiction. Les modèles de pointe exigeaient des fermes de GPU, des refroidissements industriels et des budgets à six chiffres. Aujourd’hui, un DGX Spark — cette petite tour noire de la taille d’un Mac Studio, équipée du superchip GB10 Grace Blackwell — exécute DeepSeek V4 Flash-0731, un modèle Mixture-of-Experts de 284 milliards de paramètres, dont seuls 13 milliards sont actifs à chaque token généré. La machine, vendue autour de 4 000 € en France (environ 4 679 $ aux États-Unis selon ExplainX), tient sur un bureau. Le modèle, lui, tient dans ses 128 Go de mémoire unifiée — à condition de bien choisir sa quantification.

La sortie du 31 juillet 2026 marque un tournant discret mais significatif. DeepSeek V4 Flash-0731 remplace la version preview du même modèle, avec une licence MIT qui autorise usage commercial, modification et redistribution sans restriction. C’est un geste fort dans un paysage où les poids ouverts se multiplient, mais où les licences restent souvent restrictives. La fenêtre de contexte revendiquée d’un million de tokens — un chiffre officiel, non vérifié indépendamment — place ce modèle dans une catégorie que même les API propriétaires peinent à atteindre.

Ce qui frappe, ce n’est pas seulement la taille. C’est le fait que des utilisateurs individuels, des développeurs indépendants, des laboratoires modestes puissent désormais exécuter localement un modèle dont les benchmarks officiels rivalisent avec des systèmes propriétaires bien plus coûteux. La souveraineté des données, la confidentialité, la personnalisation : tout cela devient accessible à une échelle inédite. Et la démonstration faite par la communauté autour du DGX Spark — avec llama.cpp, vLLM, TensorRT-LLM et des recettes open source — prouve que l’infrastructure logicielle a suivi.

Anatomie d’un MoE nouvelle génération : 284B totaux, 13B actifs

DeepSeek V4 Flash-0731 repose sur une architecture Mixture-of-Experts. Concrètement, cela signifie que le modèle contient 284 milliards de paramètres au total, mais qu’à chaque token traité, seuls 13 milliards sont activés. C’est ce mécanisme qui rend possible l’exécution locale : la mémoire nécessaire pour les poids est celle de la quantification choisie, mais la charge de calcul par token reste celle d’un modèle de 13 milliards — bien plus légère.

Tailles des quantifications GGUF pour DeepSeek V4 Flash-0731UD-IQ2_M (2-bit)70GoUD-Q3_K_M (3-bit)90GoUD-Q4_K_XL (4-bit)155GoUD-Q8_K_XL (8-bit)162Go

L’architecture intègre également un module de décodage spéculatif dès la sortie, une fonctionnalité qui permet d’accélérer la génération en prédisant plusieurs tokens à la fois. Le support "b12x" mentionné dans les recettes communautaires suggère une organisation en douze experts, mais ce détail reste ambigu — les sources ne précisent pas s’il s’agit de douze experts actifs ou d’une autre configuration. Inutile de spéculer : ce qui compte, c’est que le décodage spéculatif est activé par défaut, avec des paramètres comme MTP_NUM_TOKENS=5 dans les configurations vLLM.

Comparé à DeepSeek V3 ou R1, les différences sont nettes sur plusieurs points : la fenêtre de contexte passe à 1M tokens (contre 128K pour V3), la licence devient MIT (V3 était sous licence DeepSeek, plus restrictive), et la date de sortie — 31 juillet 2026 — est postérieure de plusieurs mois. En revanche, aucune source fournie ne précise la taille du vocabulaire, ni ne compare directement V4 Flash à V3/R1 sur des benchmarks communs. Les chiffres officiels publiés par DeepSeek comparent V4 Flash à V4 Pro, GLM-5.2 et Opus-4.8 — pas à ses prédécesseurs. Une lacune qui invite à la prudence : les claims non vérifiés restent des claims.

Rappelons que la preview de V4 était sortie le 24 avril 2026, saluée par la presse comme un "sérieux flex" selon Counterpoint Research (CNBC), avec des performances jugées proches de GPT-5.4 et Gemini 3.1-Pro sur certains benchmarks (Al Jazeera). La version Flash-0731 en est l’aboutissement stabilisé.

DGX Spark : le GB10 et ses 273 Go/s de bande passante, l’arme secrète

Le DGX Spark n’est pas un PC comme les autres. Sous son capot, le superchip GB10 Grace Blackwell combine un CPU Grace à 20 cœurs et un GPU Blackwell avec 128 Go de mémoire unifiée LPDDR5X. La bande passante mémoire de 273 Go/s — un chiffre canonique du magazine — est le facteur déterminant pour l’inférence de LLM. En effet, la génération de tokens est limitée par la bande passante : plus elle est élevée, plus le modèle peut produire de tokens par seconde. À titre de comparaison, un PC classique avec une RTX 5090 offre une bande passante d’environ 1,8 To/s sur sa mémoire GDDR7, mais seulement 32 Go de VRAM — trop peu pour ce modèle. Le Mac Studio M2 Ultra, lui, atteint 800 Go/s mais avec 192 Go maximum, pour un prix nettement supérieur.

Le GB10 embarque également des cœurs tensoriels optimisés pour les calculs FP4 et FP8. Ces formats de précision réduite sont essentiels pour les quants basse précision : ils permettent de stocker les poids avec moins de bits tout en accélérant les calculs. C’est précisément ce qui rend possible l’exécution d’un modèle de 284B dans 128 Go. Sans ces cœurs, les quants 2-bit et 3-bit seraient beaucoup plus lents, voire inutilisables.

La machine est pensée pour ce cas d’usage : mémoire unifiée (pas de copie CPU-GPU), bande passante suffisante pour des modèles de 100-300B en basse précision, et un écosystème logiciel qui mûrit rapidement. En juin 2026, NVIDIA a déployé une mise à jour logicielle majeure promettant un gain de performance de 2,6× grâce au format de quantification propriétaire NVFP4, comme le rapporte notre état de l’art d’août 2026. Les mises à jour de juillet 2026 ont d’ailleurs amélioré la gestion mémoire, selon les forums NVIDIA. Le DGX Spark n’est pas un simple PC : c’est un nœud de calcul spécialisé, conçu pour l’IA locale.

Par ailleurs, NVIDIA prépare l’avenir avec la plateforme RTX Spark pour Windows on Arm : le CUDA Toolkit 13.4 en preview est sorti le 21 juillet 2026, offrant un chemin natif Arm64 pour les développeurs. Les premiers PC RTX Spark, portés par ASUS et MSI, arriveront à l’automne 2026 (Tom’s Hardware, Les Numériques). Cela élargira encore l’écosystème, même si ces machines ne remplaceront pas le DGX Spark pour les charges les plus lourdes.

Quantifier pour tenir dans 128 Go : le casse-tête des quants

Le problème est simple : le modèle en FP16 pèserait environ 568 Go — impossible. En FP8, environ 284 Go — toujours trop. Il faut donc quantifier. Les GGUF publiés par Unsloth le 31 juillet proposent plusieurs niveaux. Voici les tailles documentées :

Source : dev.classmethod.jp
Quantification Taille Tient dans 128 Go ?
UD-IQ2_M (2-bit dynamique) ~70 Go (estimation) Oui
UD-Q3_K_M (3-bit) ~90 Go (estimation) Oui
UD-Q4_K_XL (4-bit dynamique) 155 Go Non (sauf 2 nœuds)
UD-Q8_K_XL (8-bit dynamique) 162 Go Non (sauf 2 nœuds)

Les chiffres précis de 155 Go et 162 Go proviennent d’un post sur les forums NVIDIA, non vérifié indépendamment. Mais ils sont cohérents avec la physique : un modèle de 284B en 4-bit pèse environ 142 Go, plus le cache KV et les overheads. Le fait que le Q8 ne soit que 7 Go plus lourd que le Q4 est surprenant mais plausible — les quants dynamiques d’Unsloth optimisent la répartition des bits, et à cette échelle, la différence relative est faible.

Sur un seul DGX Spark, seuls les quants 2-bit et 3-bit passent. C’est un choix douloureux : la qualité de réponse en 2-bit est généralement inférieure à celle en 4-bit, mais c’est le prix à payer pour la mémoire. Les cœurs FP4/FP8 du GB10 atténuent la perte de vitesse, mais pas la perte de qualité. Les tests communautaires n’ont pas encore fourni de benchmarks indépendants comparant la qualité entre 2-bit et 3-bit sur ce modèle précis. En attendant, le consensus est que le 3-bit offre un meilleur compromis qualité/vitesse que le 2-bit, au prix d’une mémoire plus occupée. Pour le Q4, il faudra passer à deux nœuds (voir plus bas).

llama.cpp, vLLM, TensorRT-LLM : la guerre des runtimes fait rage

Les tests pratiques menés par Classmethod, un intégrateur japonais, constituent la référence actuelle. Sur un seul DGX Spark, avec llama.cpp et un quant 2-bit ou 3-bit, le modèle tourne. Les résultats sont encourageants : llama.cpp a surpassé le moteur dédié DwarfStar 4 en vitesse de génération. C’est une surprise — DwarfStar 4 est optimisé pour le GB10, tandis que llama.cpp est générique.

Mais il y a un revers : le temps de démarrage. llama.cpp a mis 6,5 minutes à charger le modèle, contre 17 secondes pour DwarfStar 4 — une différence de 22 fois. Ce chiffre, issu d’un seul test tiers, n’a pas été répliqué indépendamment. Il illustre néanmoins un trade-off classique : un moteur spécialisé charge plus vite, mais génère moins vite. Pour une utilisation interactive, DwarfStar 4 est plus agréable ; pour une génération longue, llama.cpp est plus performant.

Depuis, les chiffres précis sont arrivés. Sur un seul Spark, un utilisateur des forums NVIDIA rapporte 1 000 tok/s en prefill et 59 tok/s en multi-agent serving avec vLLM. Ces mesures, non vérifiées indépendamment, montrent que le GB10 peut encaisser des charges réelles d’agents. Le même utilisateur note un boost significatif avec reasoning_effort=max : le score hardmode du benchmark tool-eval passe de 60 % à 80 % (TC-70-84). C’est une donnée précieuse pour ceux qui veulent exploiter le raisonnement du modèle.

Côté NVIDIA, TensorRT-LLM reste l’option maison, avec des kernels optimisés et un support natif des modèles Nemotron, Llama, Qwen et DeepSeek sur Spark. La version 1.3.0rc13 est disponible via NGC. Le choix du runtime dépend de l’usage : vLLM pour le serving multi-agents, llama.cpp pour la simplicité, TensorRT-LLM pour la performance brute. La communauté Spark Arena, protocole de test standardisé, permet de comparer les modèles dans des conditions identiques.

Face aux géants : V4 Flash vs Llama 3.3 70B et Qwen 2.5 72B

La comparaison naturelle serait avec des modèles de taille similaire qui tiennent sur le même matériel. Llama 3.3 70B et Qwen 2.5 72B sont des références du marché, mais aucune source fournie ne les compare directement à V4 Flash sur DGX Spark. Les benchmarks officiels publiés par DeepSeek comparent V4 Flash à V4 Pro, GLM-5.2 et Opus-4.8 :

Source : huggingface.co
Benchmark V4 Flash-0731 V4 Pro Preview (réf.)
Terminal Bench 2.1 82.7 61.8
NL2Repo 54.2 non précisé
Cybergym 76.7 non précisé
DeepSWE 54.4 non précisé

Ces chiffres sont officiels, relayés par Classmethod et Flowtivity, mais non mesurés par des tiers indépendants. Ils montrent une progression nette par rapport à la preview, mais ne disent rien sur la comparaison avec Llama ou Qwen. Aucune donnée MMLU ou HumanEval n’est fournie — ces benchmarks classiques, pourtant standards, sont absents des sources. Il est donc impossible de conclure sur une supériorité qualitative.

Ce que l’on peut dire, c’est que V4 Flash offre un contexte bien plus long (1M tokens) que Llama 3.3 70B ou Qwen 2.5 72B, dont les fenêtres de contexte sont de l’ordre de 128K à 256K (non précisé dans les sources). Cette capacité est cruciale pour les agents IA qui doivent traiter de longs documents, des historiques de conversation ou des bases de code entières. En revanche, la latence de démarrage et la vitesse de génération en basse précision pourraient être moins bonnes que sur des modèles plus petits, mieux optimisés pour le matériel local. Sans benchmarks comparatifs, ces hypothèses restent des conjectures.

Les autres poids lourds du moment : Laguna S 2.1, Ant Ling-3.0-Flash, Qwen3.6

DeepSeek n’est plus seul sur le créneau. Le 23 juillet 2026, Poolside a publié Laguna S 2.1, un modèle de 118 milliards de paramètres (8,5B actifs) taillé pour le codage agentique, sous licence open-weight. Premier grand modèle ouvert américain depuis 11 mois, il tient dans un seul DGX Spark et revendique des performances supérieures à des modèles dix fois plus gros sur les benchmarks de code (Habr, ai-stat.ru). Les tests communautaires le placent en tête du classement Spark Arena pour les tâches de programmation, devant DeepSeek V4 Flash sur certains exercices.

Le même jour, Ant Group a sorti Ant Ling-3.0-Flash, un modèle 124B-A5B (124 milliards de paramètres, 5 milliards actifs) qui bat leur précédent modèle 1T sur presque tous les benchmarks, selon les forums NVIDIA. Son architecture hybride linéaire (couches KDA et MLA empilées 5:1) le rend particulièrement efficace sur un seul Spark, avec une vitesse de génération annoncée supérieure à 40 tok/s en 4-bit.

Côté chinois toujours, Alibaba a mis à jour sa gamme Qwen : le Qwen3.6-27B (sorti le 22 avril 2026, NVFP4 le 26 juin) atteint 136 tok/s en génération multi-agents et 28-33 tok/s en session unique sur Spark, avec un score MMLU de 0,8446 en NVFP4. La version Qwen3.8-27B (testée le 20 août 2026) pousse la génération à 34-38 tok/s. Ces modèles plus petits sont idéaux pour les usages interactifs où la latence prime.

Enfin, Meta a riposté avec Muse Spark 1.1 (8 avril 2026), mais ce modèle est propriétaire et payant — une rupture qui a paradoxalement stimulé l’écosystème open source, comme nous l’analysions dans notre article dédié.

Un seul Spark ou deux ? Le cluster DGX Spark et le décodage spéculatif

Pour ceux qui veulent plus que le 2-bit, la solution est de passer à deux DGX Spark. Une recette open source, publiée par MiaAI-Lab sur GitHub, détaille la configuration : vLLM en mode TP=2 (tensor parallelism), interconnexion 200 Gbps RoCE, et un cache KV partagé. Les résultats sont éloquents : 41 tok/s en génération sur deux nœuds avec le quant Q4, contre 59 tok/s en multi-agent sur un seul nœud en 3-bit — le gain de qualité justifie l’investissement pour les usages professionnels.

Source : github.com

Un retour d’expérience détaillé sur les forums NVIDIA (2 août 2026) confirme l’importance du cache KV et du scheduling : avec une config bien réglée, l’acceptance rate remonte de 30 tok/s à plus de 40 tok/s. L’auteur a corrigé ses premières mesures de decode-share, preuve que la communauté affine ses recettes en temps réel. Flowtivity a également publié une analyse montrant que les 13B actifs de V4 Flash changent la donne pour les agents privés : 10× plus petits que Claude Opus, ils tournent en local sur deux Sparks avec Hermes Agent.

NVIDIA pousse aussi son outil PAIR (annoncé le 3 septembre 2026) pour orchestrer l’IA locale sur ses machines, y compris en cluster. Combiné aux PC Spark pré-construits qui arriveront en octobre, l’écosystème desktop prend une nouvelle dimension.

Fine-tuning sur DGX Spark : LoRA, QLoRA, Unsloth et full fine-tune en BF16

Le DGX Spark n’est pas qu’une machine d’inférence : c’est aussi une plateforme de fine-tuning. Grâce à ses 128 Go de mémoire unifiée, on peut affiner des modèles de 70B en LoRA/QLoRA sans difficulté, et même tenter un full fine-tune en BF16 pour des modèles jusqu’à 30B. Le guide DeepWiki sur le fine-tuning DGX Spark (12 août 2026) détaille les workflows : chargement des poids en NVFP4, adaptation avec PEFT/LoRA, évaluation sur Spark Arena.

Unsloth reste l’outil de référence pour la communauté : ses quants dynamiques (UD-IQ2_M, UD-Q3_K_M, UD-Q4_K_XL) sont conçus pour tirer parti des cœurs FP4/FP8 du GB10. Pour un full fine-tune en BF16, la limite pratique se situe autour de 30-40B de paramètres, au-delà de laquelle la mémoire unifiée devient insuffisante. Les clusters de deux Sparks permettent d’étendre cette limite, mais la complexité de mise en œuvre augmente.

L’arrivée de PAIR simplifie l’orchestration : NVIDIA promet des pipelines de fine-tuning clé en main, avec support de LoRA et QLoRA, et une intégration native avec les modèles Nemotron. Les premiers retours de la communauté sont positifs, même si l’outil reste jeune.

Mises à jour logicielles : NVFP4, CUDA 13.4, PAIR

Le paysage logiciel du DGX Spark a considérablement évolué depuis janvier 2026. Récapitulons les jalons :

  • Juin 2026 : mise à jour majeure avec le format NVFP4, promettant un gain de 2,6× sur l’inférence. Les modèles Nemotron, Llama, Qwen et DeepSeek sont progressivement convertis.
  • 21 juillet 2026 : CUDA 13.4 en preview pour Windows on Arm, ouvrant la voie aux PC RTX Spark.
  • 23 juillet 2026 : annonce des PC RTX Spark par ASUS et MSI pour l’automne (Clubic, Les Numériques).
  • 3 septembre 2026 : annonce de PAIR, l’outil d’orchestration IA locale, et de la gamme de PC Spark pré-construits pour octobre.

Ces évolutions confirment la stratégie de NVIDIA : faire du DGX Spark le hub d’un écosystème plus large, du desktop au mini-cluster. Les utilisateurs de Windows ne sont pas oubliés, même si Linux reste la plateforme de prédilection pour les charges lourdes.

Verdict : que choisir en septembre 2026 ?

Le DGX Spark n’est plus une promesse : c’est une plateforme mature. Pour un usage individuel, un seul Spark avec DeepSeek V4 Flash en 3-bit ou Ant Ling-3.0-Flash en 4-bit offre un excellent compromis. Pour les professionnels exigeants, deux Sparks en cluster avec le Q4 de V4 Flash délivrent une qualité proche du cloud, en local. Les modèles plus petits (Qwen3.6-27B, Laguna S 2.1) restent pertinents pour les usages interactifs où la latence prime.

Les chiffres de performance annoncés — 1 000 tok/s en prefill, 41-59 tok/s en génération — sont impressionnants mais issus de tests communautaires non vérifiés indépendamment. La prudence reste de mise, mais la tendance est claire : l’IA locale de pointe est devenue une réalité accessible, et le GB10 en est le fer de lance.

Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *