NVIDIA DGX Spark · 9 September 2026DGX Spark en 2026 : fine-tuning, clusters et LLM open-source — le guide complet Unsloth vs Axolotl, benchmarks et modèles qui tournent vraiment
Le NVIDIA DGX Spark a débarqué avec sa mémoire unifiée de 128 Go et son architecture Grace Blackwell, promettant de démocratiser le fine-tuning de LLMs à domicile. Un an et demi plus tard, la promesse est tenue — et amplifiée. Unsloth et Axolotl s’affrontent toujours, mais désormais avec des benchmarks concrets sur le Spark, un écosystème logiciel mature (vLLM, TensorRT-LLM, speculative decoding) et des modèles open-weight de classe frontière comme DeepSeek V4 Flash, Qwen3.8-27B ou Laguna S 2.1 qui tournent en local. Plongée au cœur de la bataille, avec les chiffres de septembre 2026.
DGX Spark : le terrain de jeu du fine-tuning local en 2026
Le NVIDIA DGX Spark n’est pas un PC comme les autres. Avec son superchip GB10 Grace Blackwell, il marie un processeur ARM (Grace) à un GPU Blackwell (architecture Hopper dérivée, compute capability sm_121) via une interconnexion NVLink-C2C à 900 Go/s, le tout partageant 128 Go de mémoire unifiée LPDDR5X (~273 Go/s de bande passante). Lancé officiellement au GTC Spring 2025 (sous le nom de code « Project DIGITS »), il est devenu disponible en octobre 2025 à 3 999 $, avant une hausse de 18 % en février 2026 : il s’affiche désormais à 4 699 $ (source : SysKB). Il se positionne comme le premier « mini-supercalculateur » personnel capable de faire tourner des modèles de langage de taille moyenne en local, sans passer par le cloud.
Pour le fine-tuning, cette architecture apporte à la fois des forces et des contraintes. La mémoire unifiée permet de charger des modèles de 70 milliards de paramètres en QLoRA sans saturer la VRAM – un luxe que même une RTX 5090 (32 Go) ne permet pas. Mieux : selon le tutoriel officiel d’Unsloth, on peut fine-tuner des modèles jusqu’à 200 milliards de paramètres sur le Spark, et gpt-oss-120b n’utilise qu’environ 68 Go de mémoire unifiée. Mais la bande passante mémoire reste inférieure à celle d’un H100 SXM dédié, et le compilateur CUDA doit être adapté à l’architecture ARM. Les premiers benchmarks d’inférence (Spark Arena, juillet 2026) montrent que le DGX Spark rivalise avec une RTX 5090 sur des modèles 7B-13B, mais avec une consommation électrique bien moindre. En fine-tuning, des benchmarks réels ont enfin été publiés, notamment par la communauté via le projet axolotl-dgx-spark (source : GitHub).
Depuis juin 2026, l’écosystème a franchi un cap : vLLM a officialisé son support natif du DGX Spark, et TensorRT-LLM propose désormais une liste complète de modèles supportés (voir notre guide dédié). Côté quantification, le format NVFP4 s’impose comme un standard pour le Spark, permettant de faire tourner des modèles MoE de 118B paramètres comme Laguna S 2.1 sur une seule machine. Et avec l’arrivée de DeepSeek V4 Flash-0731 (284B paramètres, 13B actifs) et d’Ant Ling-3.0-Flash (124B-A5B, sorti le 23 juillet 2026), le Spark peut désormais héberger des modèles de classe frontière en local – à condition de bien choisir son framework de fine-tuning.
Notons aussi l’arrivée du NVIDIA RTX Spark en juin 2026 : même puce GB10, mais positionné pour les laptops Windows grand public. Une preview de CUDA 13.4 pour Windows on Arm a été publiée le 22 juillet 2026, préparant le terrain pour une future version Windows du DGX Spark – mais pour l’instant, Linux reste la voie royale.
Unsloth vs Axolotl : deux visions du fine-tuning
Derrière ces deux frameworks se cachent des philosophies radicalement différentes. Unsloth est né sous la plume de Daniel et Michael Han (source : local-llm.net). Leur approche : optimiser chaque opération au niveau du noyau CUDA et Triton. Ils ont réécrit l’attention, la perte cross-entropy, la normalisation RMS et les embeddings RoPE avec une backpropagation manuelle et une fusion d’opérations. Résultat : des gains de vitesse annoncés de 2 à 5× par rapport à la baseline HuggingFace (dev.to), et une réduction mémoire allant jusqu’à 70 % (dev.to). Unsloth version 2026.5.5, sortie le 19 mai 2026, incarne cette quête de performance pure. Elle ajoute notamment le support de GRPO pour l’entraînement de modèles de raisonnement, une fonctionnalité devenue essentielle depuis DeepSeek-R1.
Mais Unsloth a considérablement élargi son périmètre en 2026. Le GitHub officiel montre désormais une application desktop native (Windows, macOS, Linux) et un support étendu : multi-GPU, AMD, Intel, Vulkan, entraînement de modèles de diffusion, TTS, embeddings, et intégration avec Claude Code, Codex et MCP pour les agents. Le fine-tuning n’est plus le seul terrain de jeu : Unsloth permet aussi de servir des modèles via une API compatible OpenAI, de faire du RAG et de la recherche web privée. Une démonstration marquante a eu lieu à l’OpenAI DevDay : gpt-oss-20b a été entraîné avec RL et Unsloth sur DGX Spark pour gagner automatiquement au jeu 2048 (source : Unsloth).
Axolotl, piloté par Wing Lian et une communauté active (source : local-llm.net), adopte une tout autre stratégie. Ici, tout passe par un fichier de configuration YAML. L’utilisateur décrit son modèle, son jeu de données, ses hyperparamètres, et Axolotl orchestre l’entraînement en s’appuyant sur l’écosystème HuggingFace. Pas de kernels custom, mais une flexibilité maximale : support natif du multi-GPU via FSDP et DeepSpeed, multi-node, et une palette de méthodes d’alignement (DPO, ORPO, GRPO, KTO, RLHF, IPO, RM, PRM…). La version 0.16.1, mentionnée en 2026, reste le couteau suisse du fine-tuning, avec un support natif des modèles multimodaux (LLaMA-Vision, Qwen2-VL, Pixtral) et des architectures MoE.
Pour le possesseur de DGX Spark, le choix se résume à un arbitrage : optimiser chaque watt de la machine avec Unsloth, ou exploiter toute la flexibilité d’Axolotl pour des expériences complexes. Mais désormais, des benchmarks concrets sur le Spark permettent de départager les deux.
Installation et compatibilité : le parcours du combattant ?
C’est ici que le bât blesse. Le DGX Spark tourne sous Ubuntu 22.04 avec des pilotes NVIDIA préinstallés (driver 580.159.03, CUDA 13.0), mais l’architecture ARM (Grace) peut surprendre. Unsloth a anticipé le problème : un Dockerfile officiel est fourni, basé sur nvcr.io/nvidia/pytorch:25.09-py3 (source : build.nvidia.com). Il compile Triton depuis la source (commit c5d671f…), xformers avec TORCH_CUDA_ARCH_LIST=12.1, et installe bitsandbytes==0.48.0, transformers==4.56.2, trl==0.22.2. En pratique, un simple docker build suivi de docker run suffit pour lancer un fine-tuning QLoRA en quelques minutes. Le tutoriel Unsloth détaille la procédure complète, y compris pour le RL sur gpt-oss-20b.
Pour Axolotl, en revanche, l’installation standard via pip install axolotl suppose un environnement CUDA classique (x86_64). Sur ARM, des problèmes de compilation de bitsandbytes ou de flash-attention peuvent survenir. Mais la communauté a réagi : le projet axolotl-dgx-spark (DJLougen) fournit un environnement conda optimisé (axfast) avec torch 2.9.1+cu130 pour aarch64, et une configuration qui résout les problèmes de ptxas (nécessité d’utiliser CUDA 13 pour cibler sm_121a). L’auteur du repo indique qu’il a fallu contourner l’absence de wheel flash-attn pour aarch64/Blackwell en utilisant kernels-community/flash-attn2 via transformers 5.x, ce qui fonctionne et est même 1,4× plus rapide que SDPA. Ainsi, une installation fluide est possible, mais elle demande plus de travail qu’avec Unsloth.
| Critère | Unsloth | Axolotl |
|---|---|---|
| Dockerfile officiel DGX Spark | Oui (nvcr.io/nvidia/pytorch:25.09) | Non (mais repo communautaire disponible) |
| Compilation Triton | Automatique (depuis source) | Optionnelle (via Liger kernels) |
| Installation simplifiée | Très bonne | Bonne avec le repo dédié |
| Risque de conflits ARM | Faible (testé par NVIDIA) | Modéré (résolu par le repo) |
Performances sous la loupe : vitesse et consommation mémoire
Les chiffres parlent d’eux-mêmes, et cette fois des benchmarks sur le DGX Spark existent. Le repo axolotl-dgx-spark a comparé une configuration Axolotl optimisée (flash-attn2 + Liger FLCE/RMSNorm/RoPE + LoRA Triton kernels) face à une configuration naive et face à Unsloth. Résultats :

- Axolotl optimisé est 1,83× plus rapide et consomme 3,1× moins de mémoire qu’une configuration naive.
- À petit batch, Unsloth est environ 1,45× plus rapide qu’Axolotl optimisé.
- Mais en augmentant le micro-batch (mbs32), l’écart se réduit : Axolotl atteint ~82 % de la vitesse d’Unsloth tout en utilisant 38 % de mémoire en moins (33 GiB contre 53 GiB). Comme Axolotl tient un batch plus grand dans la même RAM, à budget mémoire fixe, il peut égaler le débit effectif d’Unsloth.
Ces mesures ont été réalisées sur un DGX Spark (GB10, 121 GB unifiés, driver 580.159.03, CUDA 13.0) avec un modèle Qwen3-0.6B en QLoRA. L’auteur précise que le goulot d’étranglement est la bande passante mémoire (~273 GB/s), pas les FLOPs.
Les benchmarks antérieurs sur A100 (EVAL #003, cité par dev.to) montraient un gain de 1,8× pour Unsloth sur Llama-3.1 8B. Sur le Spark, les gains relatifs d’Unsloth restent significatifs, mais Axolotl optimisé réduit l’écart de manière impressionnante.
| Métrique | Unsloth (vs baseline) | Axolotl optimisé (vs baseline) |
|---|---|---|
| Gain vitesse (DGX Spark, petit batch) | ~1,45× | 1,83× (vs naive) |
| Gain vitesse (DGX Spark, batch moyen) | ~1,2× (estimé) | ~1,0× (parité effective) |
| Réduction mémoire (DGX Spark) | 60–70 % (annoncé) | 3,1× vs naive (soit ~68 %) |
| Benchmarks sur DGX Spark | Oui (tutoriel officiel, gpt-oss-120b) | Oui (repo GitHub) |
Pour un modèle 7B en QLoRA, les besoins VRAM sont d’environ 8 Go (source : promptquorum.com). Avec 128 Go de mémoire unifiée, le DGX Spark peut fine-tuner des modèles bien plus gros – jusqu’à 70B en QLoRA, voire 120B en quantification 4 bits. Le tutoriel Unsloth confirme : gpt-oss-120b utilise ~68 Go en fine-tuning, et après 1 000 étapes et 4 heures d’entraînement par RL, le modèle surpasse largement l’original sur le jeu 2048 (source : Unsloth).
Les modèles qui tournent vraiment sur le Spark en septembre 2026
L’écosystème open-source a explosé, et le Spark est devenu la plateforme de référence pour l’IA locale. Voici les modèles qui tournent réellement, avec les chiffres de septembre 2026 :
- Qwen3.8-27B (Alibaba, août 2026) : le nouveau champion du rapport qualité/performance. Sur DGX Spark, il atteint 48 tok/s en inférence (source : blog.openzeka.com). Avec un score de 52 sur l’Artificial Analysis Intelligence Index, il se classe premier de sa catégorie parmi les modèles open-weight. En NVFP4, il atteint 34-38 tok/s (test du 20 août 2026).
- DeepSeek V4 Flash-0731 (284B paramètres, 13B actifs) : le géant qui tient en cluster. Sur deux DGX Spark, un utilisateur a publié un retour d’expérience détaillé sur flowtivity.ai : en quantification NVFP4, le modèle atteint ~30 tok/s en sortie de boîte, et jusqu’à 59 tok/s en multi-agent serving avec un fork CUDA dédié (source : forums.developer.nvidia.com). Le prefill atteint 1 000 tok/s.
- Laguna S 2.1 (Poolside, 118B) : le roi du codage open-weight, sorti le 23 juillet 2026. Il tient sur un seul Spark en NVFP4.
- Nemotron 3 Nano (30B MoE, avril 2026) : la famille complète de NVIDIA, du Nano à l’Ultra, tourne sur le Spark.
- Ant Ling-3.0-Flash (124B-A5B, 23 juillet 2026) : le nouveau challenger chinois pour le codage.
Côté inférence, le speculative decoding est devenu un incontournable pour contourner le goulot de la bande passante mémoire. vLLM, TensorRT-LLM et llama.cpp l’implémentent tous, avec des gains de 1,5 à 2× sur les modèles MoE (voir notre guide dédié). Le support de la Multi-Token Prediction (MTP) s’étend : Qwen3.8-Flash-Next MTP atteint 83 à 138 tok/s avec une vérification exacte (source : banandre.com).
Fonctionnalités clés : du QLoRA au déploiement
Les deux frameworks supportent LoRA, QLoRA, et le fine-tuning complet. Mais au-delà, des différences émergent.

Unsloth intègre un export GGUF natif – un atout considérable pour ceux qui veulent déployer leur modèle fine-tuné sur llama.cpp ou Ollama. Axolotl nécessite une conversion séparée via un script ou un outil tiers. Unsloth propose également une interface web (Unsloth Studio) sous licence AGPL-3.0, tandis que le cœur reste Apache 2.0. Axolotl est entièrement Apache 2.0.
Côté méthodes d’alignement, Axolotl est imbattable : DPO, RLHF, ORPO, KTO, GRPO, IPO, RM, PRM… Unsloth se concentre sur les bases (DPO, ORPO, KTO, GRPO) mais avec moins de maturité. Pour un chercheur explorant de nouveaux algorithmes, Axolotl est indispensable.
Le gradient checkpointing et Flash Attention 2 sont supportés par les deux, mais Unsloth a l’avantage de les avoir intégrés dans ses kernels optimisés. Axolotl peut désormais utiliser Liger kernels (FLCE, RMSNorm, RoPE) pour combler l’écart, comme démontré dans le repo.
| Fonctionnalité | Unsloth | Axolotl |
|---|---|---|
| QLoRA | Oui (load_in_4bit) | Oui |
| Export GGUF | Intégré | Conversion séparée |
| Méthodes avancées | DPO, ORPO, KTO, GRPO | DPO, ORPO, GRPO, KTO, RLHF, IPO, RM, PRM |
| Interface web | Unsloth Studio (AGPL-3.0) | Non |
| Licence | Apache 2.0 (core) / AGPL-3.0 (Studio) | Apache 2.0 |
| Agents & outils | Claude Code, Codex, MCP | Non natif |
| RAG & recherche | Intégré (recherche web privée, auto-compaction) | Non natif |
| Multi-GPU gratuit | Non (Pro/Enterprise) | Oui (FSDP, DeepSpeed) |
Passage à l’échelle : clusters de DGX Spark et fine-tuning distribué
Le DGX Spark peut être utilisé en cluster : NVIDIA propose des solutions de mise en réseau (NVLink, InfiniBand) pour relier plusieurs unités. Les articles mutualisés du magazine (notamment « DGX Spark en cluster en 2026 : DeepSeek V4 Flash-0731, Laguna S 2.1 et l’écosystème LLM open source à maturité ») détaillent l’orchestration via Kubernetes, le GPU Operator, et des pipelines Kubeflow pour le fine-tuning distribué. En septembre 2026, des clusters de 2 à 100 nœuds sont documentés, avec des recettes MiaAI et des correctifs DSpark pour la mise en réseau.
Axolotl supporte nativement FSDP, DeepSpeed et le multi-node. Si vous disposez de plusieurs DGX Spark, vous pouvez lancer un entraînement distribué sur l’ensemble avec une configuration YAML unique. Unsloth, en revanche, limite le multi-GPU à sa version Pro/Enterprise payante (source : dev.to). La version gratuite ne supporte qu’un seul GPU (ou une seule carte). Une source (local-llm.net) mentionne un support expérimental récent, mais cela semble contradictoire. Dans le doute, pour un cluster de DGX Spark, Axolotl est le choix évident.
Cela dit, combien d’utilisateurs possèdent plusieurs DGX Spark ? La machine à 4 699 $ reste un investissement. Le fine-tuning sur une seule unité est plus réaliste, et dans ce cas, Unsloth peut suffire.
Cas concret : DeepSeek V4 Flash-0731 sur deux DGX Spark. Le 2 août 2026, un utilisateur a publié un retour d’expérience détaillé sur flowtivity.ai : il fait tourner DeepSeek V4 Flash 0731 (284B paramètres, 13B actifs) sur deux DGX Spark avec Hermes Agent pour des agents IA privés. En quantification NVFP4, le modèle atteint ~30 tok/s en sortie de boîte, et un correctif de configuration a porté l’acceptation à des niveaux bien supérieurs (source : forums.developer.nvidia.com). Un autre utilisateur a publié un fork CUDA d’antirez/ds4 qui atteint 1 000 tok/s en prefill et 59 tok/s en multi-agent serving sur un seul Spark (source : forums.developer.nvidia.com).
Le mot de la fin : quel framework choisir en septembre 2026 ?
Le DGX Spark a tenu sa promesse, et l’écosystème a atteint sa maturité. Pour le fine-tuning, le choix entre Unsloth et Axolotl dépend de votre profil :

- Vous voulez la simplicité et la vitesse brute : Unsloth. Le Dockerfile officiel, le support natif du Spark, et la démonstration RL sur gpt-oss-20b en font le choix le plus direct. L’export GGUF intégré et les fonctionnalités agents/RAG ajoutent une valeur considérable.
- Vous voulez la flexibilité maximale et le multi-GPU : Axolotl. Le repo communautaire axolotl-dgx-spark a résolu les problèmes d’installation, et les benchmarks montrent qu’optimisé, il rivalise avec Unsloth à budget mémoire fixe.
Et si vous hésitez encore : le Spark est désormais comparé au Mac Studio et au RTX-4080 dans des benchmarks indépendants (source : glukhov.org), et face au Ryzen Strix Halo 128 Go, le choix dépend de votre écosystème logiciel préféré (source : outilsia.fr). Mais pour le fine-tuning de LLM open-source, le DGX Spark reste la référence – et avec des modèles comme DeepSeek V4 Flash ou Qwen3.8-27B, la frontière entre local et cloud n’a jamais été aussi mince.
Sources
- Unsloth — Fine-tuning de LLM avec NVIDIA DGX Spark et Unsloth
- GitHub — unslothai/unsloth
- SysKB — NVIDIA DGX Spark : Specs, Usages et Comparaison
- NVIDIA — DGX Spark officiel
- GitHub — axolotl-dgx-spark (DJLougen)
- blog.openzeka.com — Qwen3.8-27B sur DGX Spark, 48 tok/s
- flowtivity.ai — DeepSeek V4 Flash 0731 sur Dual DGX Spark
- forums.developer.nvidia.com — 1x Spark : DeepSeek-V4-Flash-0731 @ 1 000 tok/s prefill
- forums.developer.nvidia.com — DeepSeek-v4-Flash-0731-DSpark-1M-NVFP4-KV-2x-DGX-Spark
- banandre.com — Qwen3.8-Flash-Next MTP
- glukhov.org — DGX Spark vs Mac Studio vs RTX-4080
- outilsia.fr — DGX Spark vs Ryzen Strix Halo
- wccftech.com — NVIDIA local AI support, vLLM & llama.cpp optimizations
Article recherché et rédigé automatiquement · Magazine Electrosens