Electrosens R&D
Electrosens NVIDIA DGX Spark · 7 September 2026

LLM open source sur NVIDIA DGX Spark en septembre 2026 : Gemma 4, DeepSeek V4 Flash, fine-tuning et clusters

Depuis que Google a dévoilé Gemma 4 en avril 2026, la promesse d’une intelligence artificielle de niveau « frontier » tournant sur un seul GPU fait vibrer la communauté. Mais c’est l’alliance avec le NVIDIA DGX Spark – ce mini-PC IA aux allures de station de travail de poche – qui pourrait bien changer la donne. Cinq mois plus tard, le paysage a radicalement évolué : DeepSeek V4 Flash 0731 tourne sur des clusters de deux Spark avec un décodeur spéculatif fusionné, Ant Ling-3.0-Flash promet 15-20 tok/s sur une seule machine, et les mises à jour logicielles de l’été ont transformé l’expérience. Nous avons passé au crible ce duo pour savoir s’il mérite vraiment son titre de nouveau roi de l’IA locale.


Gemma 4 + DGX Spark : le mariage qui change la donne de l’IA locale

En avril 2026, Google a officialisé Gemma 4, sa nouvelle famille de modèles ouverts sous licence Apache 2.0. Dans la foulée, NVIDIA annonçait que ces modèles seraient optimisés pour ses GPU, et en particulier pour le DGX Spark – ce « supercalculateur d’IA personnel » que la firme de Santa Clara décrit comme « le premier ordinateur de bureau conçu pour l’IA agentique ». La convergence de ces deux annonces a immédiatement suscité un engouement rare.

Pourquoi un tel intérêt ? Parce que Gemma 4 n’est pas un énième modèle open source. Google a mis l’accent sur le raisonnement, le codage, l’agentic AI (appel de fonctions) et le multimodal (vision, vidéo, audio). La famille se décline en quatre variantes, dont les caractéristiques précises sont désormais documentées par NVIDIA :

Modèle Architecture Paramètres totaux Paramètres actifs Contexte max Modalities
Gemma-4-31B Dense Transformer 31B 256K tokens Texte, vision, vidéo, audio
Gemma-4-26B-A4B MoE – 128 experts 26B 3,8B 256K tokens Texte, vision, vidéo, audio
Gemma-4-E4B Dense Transformer 7,9B (avec embeddings) 4,5B effectifs 128K tokens Texte, audio, vision, vidéo
Gemma-4-E2B Dense Transformer 5,1B (avec embeddings) 2,3B effectifs 128K tokens Texte, audio, vision, vidéo

Source : NVIDIA Developer Blog, « Bringing AI Closer to the Edge and On-Device with Gemma 4 ».

Les modèles E2B et E4B sont conçus pour une inférence ultra-efficace à faible latence à l’edge, fonctionnant complètement hors ligne avec une latence quasi nulle sur de nombreux appareils, y compris les modules Jetson Orin Nano. Les modèles 26B et 31B sont destinés aux workflows de raisonnement haute performance et au développement, avec un support natif de l’appel de fonctions et des capacités multimodales riches (reconnaissance d’objets, transcription vocale, analyse de documents et de vidéos). Google annonce un support multilingue natif de plus de 35 langues, avec un pré-entraînement sur plus de 140 langues.

Le DGX Spark, de son côté, n’est pas un simple PC. Équipé d’une mémoire unifiée de 128 Go et du superchip GB10 Grace Blackwell, il promet de faire tourner des modèles jusqu’à 200 milliards de paramètres. Son prix a légèrement évolué au fil des mois : fixé à 4 699 $ depuis avril 2026, il s’établit désormais autour de 4 679 $ selon les revendeurs en août 2026 (guide acheteur explainx.ai). Associé à Gemma 4, il devient le candidat idéal pour ceux qui veulent une IA de pointe sans dépendre du cloud.

Les enjeux sont clairs : souveraineté numérique, latence zéro, possibilité de travailler hors ligne, et contrôle total des données. Alors que les entreprises et les développeurs cherchent à échapper aux API coûteuses et aux risques de fuite, la combinaison Gemma 4 + DGX Spark apparaît comme une solution crédible.


Les spécifications officielles du DGX Spark sont désormais bien documentées. Le système embarque 128 Go de mémoire unifiée LPDDR5X, une bande passante suffisante pour charger des modèles de 31 milliards de paramètres en FP16 (environ 62 Go) tout en conservant de la place pour un contexte long. Le chip GB10 Grace Blackwell intègre un GPU Blackwell miniaturisé et un CPU Grace, le tout dans un boîtier silencieux de 170 W.

Vitesse d’inférence (tok/s) sur DGX SparkGemma 4 26B (vLLM NVFP52tok/sGemma 4 26B (Ollama Q440tok/sAnt Ling-3.0-Flash15tok/s

L’interconnect NVLink-C2C permet de relier deux DGX Spark pour l’inférence distribuée et le fine-tuning, via NCCL (source : build.nvidia.com/spark/nccl). Cette connectivité ouvre la voie au clustering, que nous aborderons plus loin. En pratique, le lien entre deux Spark s’effectue via un câble QSFP 200 Gb/s, une évolution notable par rapport aux premières annonces qui évoquaient du 100 GbE (qdna.fr).

Côté performance brute, le DGX Spark atteint environ 1 PFlops en précision mixte. En pratique, c’est l’équilibre entre mémoire, bande passante et consommation qui fait sa force. L’architecture Blackwell apporte un atout majeur : le format de données NVFP4, qui permet de compresser les modèles jusqu’à 70 % sans perte d’intelligence (blog NVIDIA).

Mises à jour logicielles de l’été 2026

Le 14 juillet 2026, NVIDIA a commencé à déployer les mises à jour logicielles du DGX Spark dans le cadre de la « July 2026 Release ». Les forums développeurs NVIDIA indiquent notamment une amélioration de la gestion de la mémoire (« Improved Memory Management »). Les systèmes partenaires basés sur le GB10 Grace Blackwell peuvent recevoir ces mises à jour avec un léger décalage. Cette mise à jour est cruciale pour les utilisateurs qui poussent les contextes longs et le fine-tuning : une meilleure gestion mémoire se traduit par moins de swaps et des sessions plus stables.

Parallèlement, NVIDIA a publié le CUDA Toolkit 13.4 en preview pour Windows on Arm (juillet 2026), ouvrant la voie aux futurs PC RTX Spark. Les développeurs peuvent dès maintenant compiler des applications natives Arm64, et SEGA l’a déjà adopté (techtimes.com, igorslab.de). Les premiers PC portables RTX Spark d’ASUS et MSI sont attendus dès l’automne 2026, avant Acer et Gigabyte qui visent début 2027 (clubic.com, lesnumeriques.com).

Enfin, la collaboration avec llama.cpp a porté ses fruits : NVIDIA annonce un gain de performance moyen de 35 % sur les modèles open-source exécutés sur DGX Spark, ainsi qu’un chargement accéléré des modèles (blog NVIDIA).


Installer Gemma 4 sur le Spark : du téléchargement à la première inférence en 30 minutes

L’installation de Gemma 4 sur le DGX Spark est facilitée par l’écosystème NVIDIA. Le blog officiel confirme que les modèles sont supportés dès le premier jour par des partenaires comme Ollama, llama.cpp et Unsloth. L’application OpenClaw permet de créer des assistants IA toujours actifs sur RTX PCs et DGX Spark.

Pour les développeurs, la procédure est simple. Avec Unsloth, quelques commandes suffisent :

pip install unsloth
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("google/gemma-4-26b-it")

Sur le DGX Spark, le chargement du modèle 26B en 4 bits (via bitsandbytes) prend environ 2 à 3 minutes. La première inférence est quasi instantanée – moins d’une seconde pour une question simple. En comparaison, sur un PC classique avec 32 Go de RAM et une RTX 4090, le même modèle nécessite une quantification plus agressive et peut saturer la mémoire.

Le choix de la stack logicielle fait une différence significative. Le benchmark d’AI Muninn montre que vLLM en NVFP4 atteint 52 tok/s sur Gemma 4 26B-A4B, contre 40 tok/s avec Ollama en Q4_K_M – soit 30 % d’écart sur la même machine (AI Muninn, avril 2026). La cause : les kernels Marlin, les CUDA graphs et un piège de répartition CPU/GPU dans Ollama. Pour une production, vLLM est donc recommandé ; pour une prise en main rapide, Ollama reste le plus simple.

Les outils NVIDIA comme NeMo et TensorRT-LLM sont également compatibles, mais leur installation requiert quelques étapes supplémentaires. Pour une première prise en main, Hugging Face Transformers + bitsandbytes reste le chemin le plus simple.


Benchmarks sous tension : Gemma 4 face à DeepSeek V4 Flash, Ant Ling et les nouveaux venus

Grâce au benchmark réalisé par AI Muninn (ai-muninn.com), nous disposons de chiffres précis pour Gemma 4 sur DGX Spark. Les tests mesurent la vitesse d’inférence et la consommation mémoire pour chaque variante, en différentes quantifications.

Source : blogs.nvidia.fr
Variante Quantification Tokens/s (prompt court) Mémoire utilisée Contexte max testé
E2B FP16 ~120 tok/s ~5 Go 256k tokens
E4B FP16 ~95 tok/s ~8 Go 256k tokens
E4B NVFP4 ~50 tok/s ~4 Go 256k tokens
26B NVFP4 (vLLM) ~52 tok/s ~18 Go 256k tokens
26B INT4 (Ollama) ~40 tok/s ~18 Go 256k tokens
31B NVFP4 ~7 tok/s ~22 Go 256k tokens

Source : AI Muninn Benchmark, avril-juillet 2026. Les valeurs sont indicatives et dépendent de la longueur du prompt et du batch size.

Le résultat le plus frappant concerne le Gemma 4 31B Dense : il plafonne à 7,0 tok/s en NVFP4, limité par la bande passante mémoire (273 GB/s). Le calcul théorique prédisait 4,4 tok/s ; la compression NVFP4 achète 60 % mais ne peut pas échapper au mur de la bande passante (AI Muninn). Pour ce modèle, mieux vaut choisir la variante MoE 26B.

En comparaison, un Llama 3.1 8B sur RTX 4090 atteint environ 60 tok/s en FP16, mais avec un contexte limité à 128k tokens. Gemma 4 26B en NVFP4 offre une vitesse comparable tout en supportant un contexte deux fois plus long et des capacités multimodales.

Les nouveaux modèles qui changent la donne en août-septembre 2026

Le paysage des LLM open-source a considérablement évolué depuis avril. Quatre modèles méritent une attention particulière pour les utilisateurs de DGX Spark :

DeepSeek V4 Flash 0731 — Sorti le 31 juillet 2026, ce modèle open-weight de 284 milliards de paramètres totaux (13 milliards actifs par token) est conçu pour l’agentic. Il embarque le module DSpark, un décodeur spéculatif fusionné dans le même checkpoint, et ses poids mixtes FP4 + FP8 pèsent 167 Go sur Hugging Face (48 fichiers safetensors, relevé du 2 septembre 2026) (qdna.fr). Sur un cluster de deux DGX Spark, il atteint 30 tok/s en configuration par défaut, et davantage avec un ajustement de configuration qui restaure l’acceptance (forums NVIDIA). En Q8 (UD-Q8_K_XL), il occupe 162 Go – trop pour un seul Spark, mais parfaitement adapté à un cluster 2×. Les premiers retours soulignent ses performances « frontier-level » pour les agents privés, avec un KV-cache et un scheduling efficaces sur UMA (flowtivity.ai). Un développeur a même réussi à le faire tourner sur un seul Spark avec un fork de l’engine MLX antirez/ds4 doté d’un backend CUDA maison : il rapporte 1 000 tok/s en prefill et 59 tok/s en multi-agent serving (forums NVIDIA, 1er août 2026). Une tentative de reproduction indépendante sur un seul Spark est documentée sur DeepWiki (emiluzelac/deepseek-v4-flash-0731-on-one-dgx-spark).

Ant Ling-3.0-Flash 124B-A5B — Annoncé le 23 juillet 2026 sur les forums NVIDIA, ce modèle MoE d’Ant Group (124 milliards de paramètres, 5 milliards d’actifs par token) utilise une attention hybride-linéaire native (couches KDA et MLA empilées dans un ratio 5:1). Il promet de battre leur précédent modèle 1T sur presque tous les benchmarks, avec un contexte maximal de 256K tokens extensible à 1M. Le débit estimé sur DGX Spark est de 15-20 tokens/s (non officiel) (forums NVIDIA).

Poolside Laguna S 2.1 — Sorti le 23 juillet 2026, ce modèle de 118 milliards de paramètres est présenté par Poolside comme « la plus puissante ouverture de modèle de l’Ouest » pour le codage agentique. Il utilise une architecture MoM (Mixture-of-Modalities) avec 256 experts et un routeur token-choice. Il tient dans un seul desktop et pourrait tourner sur le DGX Spark en quantification 4 bits, bien que les benchmarks officiels sur cette plateforme ne soient pas encore publiés (habr.com, ai-stat.ru).

Nemotron 4 (fuite) — Une fuite récente évoque un modèle open source de 1 000 milliards de paramètres chez NVIDIA, qui pourrait redéfinir les possibles sur les clusters DGX Spark (orcarouter.ai). À confirmer.

Ces modèles illustrent la vitalité de l’écosystème : en quelques mois, le DGX Spark est passé d’une machine dédiée aux modèles 30B à une plateforme capable d’héberger des MoE de 284B en cluster.


Fine-tuning sur DGX Spark : LoRA, QLoRA et full fine-tune en BF16

Le fine-tuning est l’un des usages les plus attendus du DGX Spark, et la documentation communautaire s’est étoffée. Le guide DeepWiki consacré au fine-tuning sur DGX Spark (bidual/awesome-dgx-spark) détaille les workflows sur le GB10 Grace Blackwell (sm121) avec ses 128 Go de mémoire unifiée.

LoRA et QLoRA : le chemin le plus sûr

Pour la plupart des cas d’usage, LoRA et QLoRA sont recommandés. Avec Unsloth, le fine-tuning d’un Gemma 4 26B en QLoRA (4 bits) prend environ 2 à 3 heures sur un seul Spark pour un jeu de données de 10 000 exemples, avec une consommation mémoire de 20 à 25 Go. Le guide officiel d’Unsloth pour le DGX Spark (unsloth.ai) confirme que la bibliothèque est optimisée pour le GB10 et gère automatiquement la répartition CPU/GPU.

Full fine-tune en BF16 : le mur de la mémoire

Le full fine-tune en BF16 d’un modèle 26B dense nécessite environ 62 Go pour les poids, plus les gradients et l’optimiseur – soit environ 150 Go au total, ce qui dépasse les 128 Go du Spark. En pratique, le full fine-tune n’est possible que pour des modèles de moins de 15B en BF16, ou en utilisant des techniques de gradient checkpointing agressives. Pour les modèles plus grands, la voie du cluster s’impose.

Les outils qui marchent

  • Unsloth : le plus simple, avec un support natif du GB10 et des kernels optimisés.
  • NeMo (NVIDIA) : la suite officielle, complète mais plus lourde à configurer.
  • LLaMA Factory : une alternative open source populaire, compatible avec le Spark.
  • bitsandbytes : pour la quantification 4 bits en amont du fine-tuning.

Le guide DeepWiki note que le fine-tuning sur Spark bénéficie de la mémoire unifiée pour charger de grands contextes, mais que la bande passante (273 Go/s) reste le facteur limitant pour les très longs séquences.


Clusters multi-nœuds : de 200 à 700 milliards de paramètres

La connectivité NVLink-C2C entre deux DGX Spark (via câble QSFP 200 Gb/s) ouvre la voie à des configurations cluster. Avec deux Spark (256 Go de mémoire agrégée), il est possible de charger des modèles jusqu’à 200-300 milliards de paramètres en quantification 4 bits. DeepSeek V4 Flash 0731 (284B, 167 Go de poids) tourne ainsi confortablement sur un cluster 2×, avec vLLM 0.25 ou plus et les conteneurs NVIDIA NGC arm64 (qdna.fr).

Source : blogs.nvidia.com

Pour les modèles encore plus grands, la DGX Station GB300 (748 Go de mémoire cohérente dont 252 Go HBM3e à 7,1 To/s) reste la référence, mais son prix la réserve aux laboratoires. Les clusters de Spark offrent un rapport performance/prix imbattable pour les agents privés et le fine-tuning distribué.

La gestion de flotte s’industrialise : Progress Chef Enterprise Management est compatible avec le DGX Spark depuis le 30 juillet 2026, à 189 $ par an et par système (article magazine). Pour les déploiements multi-nœuds, Chef permet de provisionner et configurer les Spark à l’échelle, en complément d’Ansible, Kubernetes ou Slurm.


Sources

Source : nvidia.com
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *