NVIDIA DGX Spark · 8 September 2026DGX Spark vs MacBook Pro M5 Max en septembre 2026 : le duel des LLM open source locaux, clusters et mises à jour passés au crible
Deux visions s’affrontent pour faire tourner les LLM open source sans le cloud. D’un côté, le mini-PC NVIDIA DGX Spark, taillé pour l’inférence et le fine-tuning grâce à son GPU Blackwell et son écosystème CUDA mature. De l’autre, le MacBook Pro M5 Max d’Apple, fort de sa bande passante mémoire record et de son intégration logicielle. En septembre 2026, les benchmarks indépendants et les retours terrain permettent enfin de trancher : lequel choisir quand on veut exécuter DeepSeek V4 Flash-0731, Qwen 3.6, Ant Ling-3.0-Flash ou Poolside Laguna S 2.1 en local — et surtout, comment les faire travailler en cluster ? Plongée au cœur du duel, chiffres à l’appui.
2026, l’année où l’IA locale a deux visages
L’essor des modèles de langage open source a créé un besoin urgent de machines capables de les héberger sans dépendre du cloud. En 2026, deux champions émergent : le NVIDIA DGX Spark, un mini-PC basé sur le Superchip GB10 (annoncé au CES 2025, disponible depuis fin 2025), et le MacBook Pro M5 Max d’Apple, dévoilé au printemps 2026 avec sa nouvelle architecture Fusion. Tous deux promettent d’exécuter localement des modèles de plusieurs dizaines de milliards de paramètres, mais leurs philosophies diffèrent radicalement.
Le DGX Spark mise sur un GPU Blackwell dédié, 128 Go de mémoire unifiée LPDDR5X et un écosystème CUDA mature. Le M5 Max répond avec un CPU 18 cœurs (dont 6 « super » cœurs et 12 cœurs performance), jusqu’à 40 cœurs GPU et une bande passante mémoire de 614 Go/s – la plus élevée jamais vue sur un portable. Mais au-delà des fiches techniques, que valent-ils vraiment pour l’inférence, le fine-tuning et le déploiement en cluster ? Grâce aux benchmarks indépendants publiés en juin-juillet 2026 et aux retours terrain d’août-septembre, nous pouvons enfin comparer sur des bases solides.
Depuis, le paysage a encore évolué : DeepSeek a publié V4 Flash-0731 (284 milliards de paramètres, 13 actifs) fin juillet, Poolside a sorti Laguna S 2.1 (118B) le 23 juillet, et Ant Group a dévoilé Ling-3.0-Flash 124B-A5B le même jour. Autant de modèles que le DGX Spark peut faire tourner localement, souvent en cluster. Le M5 Max, lui, reste une machine solo — à moins de chaîner plusieurs MacBook, une option coûteuse et complexe.
Architecture : deux philosophies, une ambition commune
Tableau comparatif des spécifications clés
| Caractéristique | NVIDIA DGX Spark (GB10) | Apple M5 Max (MacBook Pro 16”) |
|---|---|---|
| CPU | 20 cœurs Arm (10 Cortex-X925 + 10 Cortex-A725) | 18 cœurs (6 super + 12 performance) |
| GPU | 48 cœurs Blackwell (5e gén. tensor cores) | Jusqu’à 40 cœurs GPU (avec matrices dédiées) |
| Mémoire unifiée | 128 Go LPDDR5X | 128 Go LPDDR5X |
| Bande passante mémoire | ~273 Go/s | 614 Go/s |
| Peak FP4 / FP8 | 1 PFLOP FP4 / 500 TFLOPS FP8 | ~70 TFLOPS FP16 (pas de FP4 natif) |
| Stockage | 4 To NVMe (chiffré auto) | 1 To – 8 To SSD |
| Réseau | ConnectX-7 200 Gbps (2 ports QSFP56/112) + 10 GbE | Thunderbolt 5 (10 GbE max) |
| TDP / Alimentation | ~1000 W (alimentation max) | ~270 W max |
| Prix de départ | ~4 000 – 4 700 $ selon canal | ~2 500 $ (MacBook Pro M5 Max 128 Go) / ~3 499 $ (Mac Studio M5 Max 128 Go) |
| OS | DGX OS (Ubuntu) | macOS |
| Pile logicielle | CUDA, cuDNN, TensorRT, NeMo | MLX, Metal, PyTorch (MPS), llama.cpp |
Sources : LinkedIn – Pappalardo, Skorppio Blog, thinksmart.life, dataxad.com

Le DGX Spark utilise un Superchip GB10 qui combine 20 cœurs CPU Arm (dix cœurs haute performance Cortex-X925 et dix cœurs efficaces Cortex-A725) et un GPU Blackwell à 48 cœurs. La mémoire unifiée LPDDR5X de 128 Go permet de charger des modèles jusqu’à 200 milliards de paramètres en local. De son côté, l’Apple M5 Max marque une rupture : il intègre pour la première fois des unités de multiplication matricielle dédiées dans le GPU, promettant ~70 TFLOPS FP16, selon l’analyse technique de Skorppio. Sa bande passante de 614 Go/s est un atout majeur pour les calculs d’inférence, souvent limités par la mémoire plutôt que par la puissance de calcul.
L’impact sur l’IA est direct : le DGX Spark mise sur le parallélisme massif du GPU Blackwell et des formats natifs FP4/FP8, tandis que le M5 Max capitalise sur une bande passante exceptionnelle et une intégration verticale du matériel. Les benchmarks confirment ces orientations.
Inférence : les premiers chiffres concrets départagent les deux machines
Grâce aux tests indépendants publiés en juin-juillet 2026, nous disposons désormais de mesures fiables pour plusieurs modèles populaires en quantification Q4.
Benchmarks d’inférence (Q4, single-stream)
| Modèle | DGX Spark (tokens/s) | Mac M5 Max (tokens/s) | Écart |
|---|---|---|---|
| Llama 4 8B | 110 – 125 | 95 – 110 | DGX +13 % |
| Qwen 3 32B | 50 – 62 | 40 – 50 | DGX +25 % |
| Llama 4 70B | 35 – 45 | 25 – 32 | DGX +40 % |
| gpt-oss 120B | 20 – 28 | 14 – 19 | DGX +45 % |
| Prefill (Llama 4 8B, prompt 4K) | ~1 200 tps | ~400 tps | DGX 3× |
Sources : presenc.ai, codersera.com
Le DGX Spark remporte tous les tests d’inférence, avec un écart qui se creuse à mesure que la taille du modèle augmente. La différence est particulièrement marquée sur le préfill (traitement des prompts longs), où le GPU Blackwell et TensorRT-LLM offrent un avantage de 3×. Le M5 Max, malgré sa bande passante supérieure, ne peut compenser le manque d’optimisations logicielles et de formats natifs basse précision.
Latence pour des prompts longs
Pour un prompt de 4k tokens, la latence est principalement dictée par le temps de préfill. Le DGX Spark, grâce à FlashAttention-2 et TensorRT-LLM, traite ces prompts trois fois plus vite que le M5 Max. En revanche, pour la génération (décodage), l’écart se réduit, le M5 Max profitant de sa bande passante pour charger rapidement les poids.
Conclusion partielle : le DGX Spark est clairement plus performant pour l’inférence, surtout sur les gros modèles et les longs contextes. Le M5 Max reste honorable, mais ne rivalise pas sur ce terrain.
Les gros modèles récents sur un seul DGX Spark
Le DGX Spark n’a pas attendu le M5 Max pour faire tourner les modèles les plus lourds. Fin juillet 2026, DeepSeek a publié la version officielle de V4 Flash-0731 : 284 milliards de paramètres au total, 13 milliards actifs par token, une fenêtre de contexte d’un million de tokens. Selon un test mené par Classmethod et rapporté sur les forums développeur NVIDIA, le modèle tourne sur un seul DGX Spark en quantification 2-bit ou 3-bit, avec llama.cpp qui surpasse le moteur dédié DwarfStar 4 en vitesse (environ 30 tokens/s en configuration par défaut, davantage après ajustement). Le démarrage est plus lent (6,5 minutes contre 17 secondes pour DwarfStar 4), mais en usage persistant, llama.cpp s’impose. Unsloth a publié le GGUF le jour même de la sortie, et une version Q8 (162 Go) permet une inférence lossless, seulement 7 Go plus lourde que la Q4.
Poolside a également sorti Laguna S 2.1 (118B paramètres) le 23 juillet 2026, présenté comme le premier grand open-weight américain depuis 11 mois. Les premiers retours terrain sur DGX Spark font état de débits entre 19 et 50 tokens/s selon la configuration, comme le rapporte notre article « Laguna S 2.1 sur DGX Spark : le roi du codage local passe à l’épreuve du terrain ». Enfin, Ant Group a dévoilé Ling-3.0-Flash 124B-A5B (5B actifs) le même jour, avec une architecture hybride KDA/MLA et une fenêtre de contexte native de 256K tokens (extensible à 1M). Les estimations non officielles des forums NVIDIA donnent 15-20 tokens/s sur un seul Spark.
Fine-tuning : le DGX Spark écrase la concurrence
Le fine-tuning est l’autre pilier de l’IA locale. Ici, l’avantage du DGX Spark est encore plus net grâce à son écosystème CUDA mature et au support natif du FP4/FP8.

Benchmarks de fine-tuning (LoRA et QLoRA)
| Workload | DGX Spark | Mac M5 Max | Écart |
|---|---|---|---|
| LoRA fine-tune Llama 4 8B (1 epoch, 50K samples) | ~3,5 heures | ~14 heures | DGX 4× |
| QLoRA fine-tune Qwen 3 32B | ~12 heures | Non testé (estimation >40h) | DGX >3× |
Sources : presenc.ai
Le DGX Spark bénéficie également d’accélérations logicielles record. Un post sur le forum développeur NVIDIA (2026) annonce un « Lossless 7.67× LoRA / 8.35× Full FT speedup for Qwen3.5 on DGX Spark (GB10 SM 121a) ». Cela signifie que, grâce à des optimisations via NeMo ou des kernels personnalisés, le DGX Spark peut entraîner un modèle Qwen3.5 près de 8 fois plus vite qu’une configuration de référence.
Capacités théoriques basées sur la mémoire
Avec 128 Go de mémoire unifiée, le DGX Spark peut potentiellement faire du full fine-tuning sur un modèle 7B en FP16 (nécessite ~28 Go). Pour un modèle 13B, on monte à ~52 Go, ce qui reste dans les limites. Un modèle 30B en FP16 nécessiterait ~120 Go, soit la quasi-totalité de la mémoire – possible avec des batch sizes très réduits. En LoRA/QLoRA, on peut viser des modèles de 70B paramètres (quantifiés en 4 bits).
Pour le M5 Max, les données de fine-tuning sont rares. La bande passante de 614 Go/s est un atout, mais l’écosystème logiciel (MLX, PyTorch MPS) est moins mature que CUDA pour l’entraînement. Les utilisateurs Mac devront probablement se contenter de LoRA sur des modèles de taille moyenne.
Écosystème logiciel : CUDA contre Metal, le match des frameworks
Tableau comparatif des piles logicielles
| Aspect | NVIDIA DGX Spark | Apple M5 Max |
|---|---|---|
| Framework principal | CUDA 12.x / 13.4 (Windows Arm preview), TensorRT-LLM, NeMo | Metal Performance Shaders, MLX |
| Support vLLM | Natif (via CUDA) | Partiel (via MPS backend) |
| Support llama.cpp | Oui (via CUDA ou Vulkan) | Oui (via Metal) |
| Conteneurs | NGC, Docker optimisé | Docker (limité), pas de conteneurs officiels |
| Maturité | Très mature (des années d’optimisation) | En progrès rapide, mais encore des bugs |
Le DGX Spark bénéficie de l’écosystème NVIDIA le plus complet. Le 21 juillet 2026, NVIDIA a publié une preview développeur de CUDA 13.4 pour Windows on Arm, permettant d’exécuter CUDA nativement sur le DGX Spark sous Windows, ce qui élargit encore les possibilités (voir l’article « CUDA sur Windows Arm : la preview qui change tout pour le DGX Spark et le RTX Spark »). Les frameworks comme vLLM et llama.cpp tournent nativement.
Apple riposte avec MLX, un framework open source développé par Apple pour l’apprentissage automatique sur ses puces. Il progresse vite, mais reste moins riche que CUDA. PyTorch MPS (Metal Performance Shaders) permet d’exécuter la plupart des modèles, mais certaines opérations ne sont pas encore optimisées. Pour un développeur solo, le DGX Spark offre une expérience « prête à l’emploi » bien supérieure.
Les runtimes en guerre : llama.cpp, vLLM, TensorRT-LLM, SGLang
La bataille des runtimes fait rage sur DGX Spark. En plus de llama.cpp et vLLM, SGLang gagne du terrain pour les workloads agentiques. Le 1er août 2026, un utilisateur a rapporté sur les forums NVIDIA avoir atteint 1 000 tok/s en prefill et 59 tok/s en multi-agent serving sur un seul Spark avec DeepSeek-V4-Flash-0731, en utilisant un fork CUDA de l’engine antirez/ds4. Ces chiffres montrent que le GB10, bien optimisé, peut rivaliser avec des serveurs bien plus chers.
Cluster et scalabilité : le DGX Spark fait équipe, le Mac reste seul
Interconnexion du DGX Spark
Le DGX Spark peut relier deux unités via ses cartes réseau ConnectX-7 (support RDMA over Ethernet). Pour une configuration à deux nœuds (256 Go), un simple câble DAC QSFP56 200G suffit, sans switch. Pour passer à 4 nœuds (512 Go), il faut un switch QSFP56 200G, mais l’investissement reste modeste comparé à un cluster GPU classique.

Recette éprouvée : DeepSeek V4 Flash-0731 sur 2× DGX Spark
Le 2 août 2026, un utilisateur a publié sur les forums NVIDIA une recette complète pour faire tourner DeepSeek V4 Flash-0731 sur deux DGX Spark avec vLLM, TP=2, speculative decoding DSpark et KV-cache NVFP4. Les résultats montrent une fenêtre de contexte de 1M tokens, avec des performances stables en multi-agent. Un autre test, rapporté par flowtivity.ai, confirme que les 13B actifs du modèle permettent de servir des agents privés avec une latence acceptable, même sur du matériel de bureau.
PAIR : l’orchestrateur local de NVIDIA
Le 3 septembre 2026, NVIDIA a officialisé PAIR, un outil d’orchestration pour l’IA locale sur ses machines, ainsi qu’une gamme de PC « Spark » pré-construits qui arriveront en octobre. PAIR simplifie le déploiement d’agents multi-modèles sur un ou plusieurs DGX Spark, en gérant le scheduling, le KV-cache et la répartition de charge. C’est un pas de plus vers la fin du tout-cloud, comme nous l’analysions dans notre article « NVIDIA PAIR et les PC Spark : la fin du tout-cloud a peut-être vraiment commencé ».
Les PC RTX Spark : l’écosystème s’élargit
NVIDIA a confirmé au SIGGRAPH 2026 que les premiers PC RTX Spark (versions grand public du GB10) seront commercialisés à l’automne 2026, avec ASUS et MSI en première ligne. Ces machines, prévues pour Windows on Arm, bénéficieront de la preview CUDA 13.4 et devraient démocratiser l’accès à l’IA locale. Les prix annoncés (autour de 4 000 $) restent élevés, mais la concurrence avec Apple et AMD (Ryzen AI Halo à 3 999 $) promet de faire baisser les coûts.
Conclusion : le DGX Spark reste le roi de l’IA locale, mais la donne change
En septembre 2026, le DGX Spark s’impose comme la référence pour exécuter des LLM open source en local. Ses performances en inférence, son écosystème CUDA mature et sa capacité à former des clusters en font le choix naturel pour les développeurs et les entreprises. Le MacBook Pro M5 Max, malgré sa bande passante record, reste une alternative séduisante pour un usage nomade, mais ne peut rivaliser sur les workloads intensifs.
Les mises à jour récentes — CUDA 13.4 Windows Arm, PAIR, les PC RTX Spark — renforcent encore la position de NVIDIA. Avec des modèles comme DeepSeek V4 Flash-0731, Laguna S 2.1 et Ling-3.0-Flash qui tournent sur un seul Spark, et des recettes éprouvées pour les clusters, l’IA locale n’a jamais été aussi accessible. Le tout-cloud n’est pas mort, mais il a désormais un rival sérieux.
Sources
- NVIDIA RTX Spark vs. Apple M5 Pro: The Unified Architecture Battle — HotHardware
- Tried running DeepSeek V4 Flash-0731 on a single DGX Spark with llama.cpp — Classmethod
- DeepSeek V4 Flash-0731 GGUF — Hugging Face
- DeepSeek V4 Flash-0731 sur 2× DGX Spark — GitHub MiaAI-Lab
- 1x Spark: DeepSeek-V4-Flash-0731 @ 1,000 tok/s prefill, 59 tok/s multi-agent serving — Forums NVIDIA
- Agent Serving on 2× DGX Spark with DeepSeek V4 Flash 0731 — Forums NVIDIA
- DeepSeek V4 Flash 0731 on Dual DGX Spark — Flowtivity
- Laguna S 2.1: Запад наконец ответил Китаю в open-weight — AI-Stat
- США пытаются отбить open source у Китая: вышла открытая модель Poolside Laguna S 2.1 — Habr
- Ant Ling-3.0-Flash 124B-A5B… new fast model for one Spark! — Forums NVIDIA
- NVIDIA lance le premier kit de développement CUDA 13.4 pour Windows Arm — Mundowin
- NVIDIA frappe fort : les premiers PC RTX Spark débarquent cet automne — Tom’s Hardware
- Asus et MSI dans les starting-blocks pour inaugurer la puce Nvidia RTX Spark — Les Numériques
- NVIDIA PAIR et les PC Spark : la fin du tout-cloud a peut-être vraiment commencé — Magazine Tech
Article recherché et rédigé automatiquement · Magazine Electrosens