NVIDIA DGX Spark · 15 September 2026DGX Spark vs Ryzen AI Halo : le duel des mini-supercalculateurs IA en 2026
Deux boîtiers compacts, 128 Go de mémoire unifiée, un même objectif : faire tourner des LLM open source de pointe sur votre bureau. Mais entre le NVIDIA DGX Spark et l’AMD Ryzen AI Halo, le choix n’a jamais été aussi serré — ni aussi complexe. Entre hausse de prix, mises à jour logicielles majeures, nouveaux modèles MoE ultra-efficaces et l’arrivée de concurrents inattendus, nous avons disséqué les deux machines pour vous aider à trancher en cette rentrée 2026.
Un marché en pleine explosion : l’IA locale est devenue un segment à part entière
Il y a encore deux ans, faire tourner un LLM de 70 milliards de paramètres sur sa machine personnelle relevait de la gageure. Les GPU grand public manquaient de mémoire, les cartes professionnelles coûtaient le prix d’une voiture, et le cloud semblait la seule voie raisonnable. En 2026, la donne a radicalement changé. Le marché mondial des stations de travail IA pèse désormais 18,6 milliards de dollars et croît à 16,3 % par an, selon les analyses de syskb.com. Au cœur de cette dynamique : le NVIDIA DGX Spark (puce GB10 Grace Blackwell) et l’AMD Ryzen AI Halo (APU Strix Halo, Ryzen AI Max+ 395), deux mini-PC IA qui promettent de démocratiser l’inférence locale de modèles à plusieurs centaines de milliards de paramètres.
Le contexte logiciel n’a jamais été aussi favorable. Les modèles open source récents sont conçus pour être efficaces sur du matériel à mémoire unifiée. DeepSeek V4 Flash 0731, sorti fin juillet 2026, ne mobilise que 13 milliards de paramètres actifs par token (sur 284 milliards au total) tout en rivalisant avec des modèles propriétaires bien plus gros — un choix idéal pour ces machines. Poolside Laguna S 2.1, dévoilée le 23 juillet 2026, atteint des performances impressionnantes en codage avec 118 milliards de paramètres et tient dans un seul desktop, comme le rapporte habr.com (en russe). Qwen3.8-27B d’Alibaba, sorti en août 2026, s’impose comme la référence de sa catégorie avec un score de 52 sur l’Artificial Analysis Intelligence Index, selon blog.openzeka.com.
Mais attention : si les deux machines partagent une même ambition, elles n’ont ni la même philosophie, ni les mêmes forces, ni le même public. Et en septembre 2026, le paysage s’est encore enrichi avec l’arrivée du RTX Spark, de la DGX Station for Windows et d’une future version AMD à 192 Go. Le duel est plus subtil qu’il n’y paraît.
Fiche technique : deux architectures, deux visions
Le tableau comparatif ci-dessous résume l’essentiel des caractéristiques officielles et des prix constatés en septembre 2026.
| Caractéristique | NVIDIA DGX Spark (Founders) | AMD Ryzen AI Halo (Strix Halo) | ASUS Ascent GX10 (variante DGX Spark) |
|---|---|---|---|
| Puce | GB10 Grace Blackwell Superchip | Ryzen AI Max+ 395 (Strix Halo APU) | GB10 (identique au Spark) |
| CPU | 20 cœurs Arm (10 Cortex-X925 + 10 A725) | 16 cœurs Zen 5 / 32 threads, 5,1 GHz | 20 cœurs Arm |
| GPU | Blackwell (sm121) | Radeon 8060S, 40 CUs RDNA 3.5, 2,9 GHz | Blackwell (sm121) |
| Mémoire unifiée | 128 Go LPDDR5X | 128 Go LPDDR5X (8 000 MT/s) | 128 Go LPDDR5X |
| Bande passante mémoire | 273 Go/s | 256 Go/s | 273 Go/s |
| Stockage | 4 To SSD | 2 To NVMe M.2 | 1 To SSD |
| Réseau | ConnectX-7 200 Gbps RoCE | 10 GbE | ConnectX-7 200 Gbps RoCE |
| OS supporté | Linux (DGX OS) | Windows 11 + Linux dual-boot | Linux |
| Prix (sept. 2026) | 4 699 $ (après hausse de 18 % en février) | 3 999 $ | 2 999 $ |
| Compute annoncé | ~1 PFLOP FP4 (constructeur) | ~112 TOPS INT4 (constructeur) | ~1 PFLOP FP4 (constructeur) |
Premier constat : les deux machines affichent une mémoire unifiée identique de 128 Go LPDDR5X. Ce n’est pas de la HBM3e comme sur les gros serveurs DGX, mais de la LPDDR5X, plus abordable et suffisante pour des modèles de 70 à 140 milliards de paramètres quantifiés. La bande passante diffère légèrement : 273 Go/s pour le GB10 contre 256 Go/s pour le Strix Halo. Un écart de 6 % qui, nous le verrons, a des conséquences disproportionnées sur certaines tâches.
Côté prix, la situation a considérablement évolué. Le DGX Spark Founders Edition a été lancé à 3 999 $ en octobre 2025, mais une pénurie de mémoire LPDDR5X et de NAND a poussé NVIDIA à augmenter son tarif de 18 % à 4 699 $ en février 2026. AMD, de son côté, positionne son Ryzen AI Halo à 3 999 $ avec un SSD de 2 To — un prix stable qui le rend mécaniquement plus attractif sur le papier. L’ASUS Ascent GX10, variante OEM du DGX Spark, casse les prix à 2 999 $, mais avec un stockage réduit à 1 To, ce qui peut s’avérer limitant pour les très gros modèles.
Notons que le Ryzen AI Halo, testé en profondeur par HotHardware et XDA Developers, se distingue par son format ultra-compact : 150 × 150 × 45,4 mm pour moins de 1,2 kg, avec un TDP qui peut être poussé à 120 W en boost. Un atout non négligeable pour qui manque de place.
Performances d’inférence : le prefill fait toujours la différence, mais les nouveaux modèles changent la donne
C’est le cœur du sujet. Les benchmarks disponibles, bien que rapportés par des vendeurs et la communauté (et explicitement non vérifiés en laboratoire indépendant), dressent un portrait contrasté. Sur le modèle gpt-oss 120B, les chiffres sont les suivants :
- Génération de tokens (decode) : ~34 tok/s sur le Ryzen AI Halo, ~39 tok/s sur le DGX Spark. L’écart est modeste, environ 15 %.
- Traitement de prompt (prefill) : ~340 tok/s sur l’AMD, ~1 720-1 723 tok/s sur le NVIDIA. Un écart d’un facteur 5 !
Ce contraste s’explique par l’architecture : la génération de tokens est limitée par la bande passante mémoire (256 vs 273 Go/s), tandis que le prefill est une tâche massivement parallèle qui dépend de la puissance de calcul brute. Le GB10 de NVIDIA, avec son ~1 PFLOP FP4, écrase le Strix Halo et ses ~112 TOPS INT4.
Mais en septembre 2026, les benchmarks sur les modèles récents sont encore plus parlants. Sur Qwen3.8-27B, le DGX Spark atteint 48 tok/s en génération, selon blog.openzeka.com (test du 26 août 2026). C’est nettement mieux que les 34-38 tok/s rapportés pour la version précédente Qwen3.6-27B. Mieux : avec le support du Multi-Token Prediction (MTP) pour Qwen3.8-Flash-Next, les utilisateurs rapportent des vitesses de 83 à 138 tok/s avec une vérification exacte, comme le détaille banandre.com (2 septembre 2026).
Sur DeepSeek V4 Flash 0731, les chiffres sont spectaculaires : un utilisateur du forum NVIDIA rapporte 1 000 tok/s en prefill et 59 tok/s en multi-agent serving sur un seul Spark (1er août 2026, forums.developer.nvidia.com). Avec une configuration NVFP4 et un ajustement de config, un autre testeur atteint 30 tok/s en sortie de boîte, mais remonte à plus de 40 tok/s après correction (forums.developer.nvidia.com).
Ces chiffres méritent d’être pris avec précaution — ils proviennent de blogs et forums tiers qui reconnaissent eux-mêmes ne pas avoir effectué de tests en laboratoire. Mais la cohérence entre les sources (runaihome.com, compute-market.com, forums NVIDIA) et la logique architecturale qui les sous-tend leur donnent une certaine crédibilité.
Écosystème logiciel : CUDA contre ROCm, le match reste inégal mais se resserre
Si les performances brutes sont importantes, le choix d’une machine repose souvent sur son écosystème logiciel. Et là, le combat reste déséquilibré, même si AMD progresse.

Le DGX Spark tourne exclusivement sous Linux (DGX OS) et bénéficie de l’écosystème CUDA complet : TensorRT-LLM, vLLM, PyTorch avec CUDA, et tous les outils de fine-tuning comme Unsloth ou Axolotl fonctionnent sans friction. NVIDIA a également publié le 21 juillet 2026 une preview du CUDA Toolkit 13.4 pour Windows on Arm, ouvrant la voie à une future compatibilité avec les machines RTX Spark — mais le DGX Spark lui-même reste Linux-only pour l’instant.
La mise à jour majeure de juin 2026 a apporté le support NVFP4 (floating point 4 bits NVIDIA), qui permet d’exploiter pleinement le 1 PFLOP FP4 du GB10. Combiné à vLLM et aux optimisations récentes, cela débloque des performances nettement supérieures sur les modèles récents. Le framework Uzu a également fait parler de lui : sa mise en œuvre du speculative decoding (décodage spéculatif) pour Qwen3.6-27B, annoncée le 3 septembre 2026 par trymirai.com, promet des gains significatifs sur les puces Apple M5, mais aussi sur d’autres architectures.
L’AMD Ryzen AI Halo, lui, s’appuie sur ROCm, Vulkan et Ollama. La prise en charge de ROCm s’est nettement améliorée, et le fait de pouvoir faire tourner Windows 11 nativement est un atout indéniable pour la polyvalence. Les utilisateurs rapportent toutefois des difficultés ponctuelles avec certains frameworks et une documentation moins fournie. Pour le développement IA, Linux reste la norme, et c’est là que CUDA conserve son avantage.
En pratique, un développeur habitué à CUDA trouvera le DGX Spark immédiatement familier. Tout fonctionne "out of the box". Avec le Ryzen AI Halo, il faudra parfois bricoler, chercher des solutions sur les forums, adapter des scripts. Rien d’insurmontable, mais cela demande du temps et de la patience.
Fine-tuning : l’exploit BF16 d’un 35B sur un seul Spark
Le fine-tuning, et plus particulièrement le QLoRA, est un usage de plus en plus courant chez les développeurs qui veulent adapter un modèle à leurs données. Et là, le DGX Spark a réalisé un exploit remarquable en 2026 : affiner un modèle de 35 milliards de paramètres en pleine précision BF16, sans quantification, sur une simple station de travail posée sur un bureau. C’est le pari relevé par une démonstration communautaire largement relayée, comme le détaille notre article « DGX Spark en septembre 2026 : fine-tuning BF16, clusters 2× et l’écosystème open-source qui explose ».
Cette prouesse repose sur une astuce de chargement cruciale : le piège du mmap. Par défaut, le chargement en mémoire mappée (mmap) fait planter le DGX Spark, forçant une quantification indésirable. La parade consiste à utiliser une méthode de chargement alternative qui évite la quantification et permet d’exploiter les 128 Go de mémoire unifiée à leur plein potentiel. C’est un exemple parfait de la maturité logicielle acquise par la plateforme en un an et demi.
Les outils de fine-tuning ont également gagné en maturité. Unsloth et Axolotl fonctionnent sans friction sur le GB10, et la puissance de calcul du GB10 permet des itérations plus rapides. Sur un cluster de deux DGX Spark, les tests montrent un gain de temps de fine-tuning d’un facteur 1,8 sur un modèle Llama 3 70B en Q-LoRA par rapport à un nœud unique — un chiffre significatif pour les équipes qui veulent itérer rapidement.
Pour l’AMD, le fine-tuning est possible via ROCm, mais les performances sont généralement inférieures et la compatibilité avec les frameworks de fine-tuning moins bien assurée. Les utilisateurs qui souhaitent faire du fine-tuning intensif devraient sérieusement considérer le DGX Spark.
Passer à l’échelle : le cluster, l’atout caché de NVIDIA
Un autre avantage majeur du DGX Spark réside dans sa capacité à être clusterisé. NVIDIA a conçu le GB10 pour fonctionner en réseau via ConnectX-7 (200 Gbps RoCE). Avec deux nœuds, on obtient 256 Go de mémoire unifiée et la capacité de faire tourner des modèles de ~284 milliards de paramètres en FP8 — c’est exactement ce que permet DeepSeek V4 Flash 0731 sur une configuration 2× DGX Spark, comme le démontre flowtivity.ai (2 août 2026). Avec quatre nœuds, on atteint 512 Go et ~700 milliards de paramètres.

L’outil Cluster Assistant, disponible depuis juin 2026, simplifie considérablement la configuration de ces clusters. Des dépôts GitHub comme Mjxkill/deepseek-v4-flash-2x-dgx-spark montrent que la communauté explore activement ces configurations. Sur deux DGX Spark, DeepSeek V4 Flash 0731 atteint des performances exploitables pour des agents privés, avec un KV-cache optimisé et une gestion fine du scheduling, comme le rapporte un post détaillé sur les forums NVIDIA (2 août 2026).
L’AMD Ryzen AI Halo, en revanche, ne dispose pas d’une solution de clustering aussi intégrée. Les interconnexions sont moins rapides (10 GbE au mieux), et l’écosystème logiciel pour le multi-nœuds est quasi inexistant. Si votre projet implique de passer à l’échelle, le choix est vite fait.
Le paysage évolue : RTX Spark, DGX Station, AMD PRO 495
En cette rentrée 2026, le duel Spark vs Halo n’est plus le seul à considérer. Trois nouveautés rebattent les cartes.
Le NVIDIA RTX Spark (annoncé en juin 2026) est une plateforme pour laptops Windows grand public, embarquant la même puce GB10 mais dans un positionnement radicalement différent : plus accessible, orienté consommation, avec une compatibilité Windows native. Il ne remplace pas le DGX Spark, mais il élargit l’écosystème GB10 à un public plus large.
La DGX Station for Windows (dévoilée le 1er juin 2026 au GTC Taipei) est un tout autre animal : un boîtier au format home cinéma qui promet de faire tourner des modèles à 1 000 milliards de paramètres, avec une puce GB300 et 20 pétaflops annoncés. À un prix bien plus élevé, elle vise les chercheurs et les équipes qui ont besoin de puissance sans passer par le rack. Notre article « DGX Station for Windows : le nouveau géant de bureau qui éclipse le DGX Spark ? » analyse en détail si elle justifie son prix face au Spark et au Mac Studio.
L’AMD Ryzen AI Max+ PRO 495 (prévu pour Q3 2026) promet 192 Go de mémoire maximale supportée et la capacité de faire tourner des modèles jusqu’à 300 milliards de paramètres. C’est la réponse directe d’AMD à la clusterisation de NVIDIA : une seule machine avec plus de mémoire plutôt que plusieurs nœuds. Les premiers tests devraient arriver dans les prochaines semaines.
Ces évolutions montrent que le marché de l’IA locale est en pleine effervescence, et que les positions peuvent changer rapidement.
Verdict : quel mini-PC pour quel profil ?
Après cette analyse, il apparaît clairement que ces deux machines ne s’adressent pas exactement au même public. Voici notre verdict nuancé, en tenant compte des évolutions récentes.

Pour le développeur local qui veut faire de l’inférence rapide sur des modèles open source, avec un budget serré : l’AMD Ryzen AI Halo est un excellent choix. Son prix de 3 999 $ est compétitif, sa capacité à faire tourner Windows 11 est un plus pour la polyvalence, et ses performances de génération de tokens sont proches de celles du DGX Spark. Le prefill plus lent sera un handicap si vous travaillez avec de très longs prompts, mais pour du chat, de la génération de code ou des résumés, il fera parfaitement l’affaire. D’ailleurs, selon notre enquête, 70 à 80 % des acheteurs de ce segment choisissent le Strix Halo — un chiffre qui s’explique par le rapport prix/performance et la flexibilité Windows.
Pour le chercheur ou le développeur qui veut faire du fine-tuning, de l’agentique complexe, ou qui prévoit de clusteriser : le DGX Spark est imbattable. Son écosystème CUDA, sa puissance de prefill, le support NVFP4 et sa connectivité réseau en font l’outil de choix. Le surcoût de 700 $ par rapport au Ryzen AI Halo (4 699 $ vs 3 999 $) est justifié par ces capacités supplémentaires. L’exploit du fine-tuning BF16 d’un 35B sur un seul nœud en est la preuve la plus éclatante.
Pour l’utilisateur edge ou le déploiement en entreprise avec un budget contraint : l’ASUS Ascent GX10 à 2 999 $ est une option très séduisante, à condition de surveiller son stockage limité (1 To). Il offre les mêmes capacités que le DGX Spark, mais avec moins d’espace pour les modèles.
Pour le passionné qui veut simplement expérimenter : les deux machines sont excellentes. Le choix se fera sur l’OS (Windows vs Linux) et sur l’envie de plonger dans l’écosystème CUDA ou ROCm. Mais si vous pouvez attendre un peu, l’AMD Ryzen AI Max+ PRO 495 avec 192 Go pourrait être une option encore plus intéressante pour les très gros modèles.
Il faut aussi garder à l’esprit que le marché évolue vite. Les modèles comme DeepSeek V4 Flash 0731, Qwen3.8-27B ou Laguna S 2.1 sont conçus pour être efficaces sur du matériel modeste. Dans un an, les besoins en puissance pourraient être moindres, et l’argument du prix pourrait peser encore plus lourd.
Conclusion : deux philosophies, un même objectif
Le duel entre le Ryzen AI Halo et le DGX Spark est finalement le reflet d’une opposition plus large entre AMD et NVIDIA. D’un côté, une approche pragmatique, ouverte à Windows, à un prix attractif, avec des performances honorables. De l’autre, une machine plus chère, plus spécialisée, mais dotée d’un écosystème logiciel inégalé et d’une capacité à passer à l’échelle.
En septembre 2026, l’IA locale est devenue une réalité accessible et mature. Que vous choisissiez l’une ou l’autre de ces machines, vous ferez un pas de géant par rapport aux solutions cloud ou aux GPU grand public. Le choix dépendra de vos priorités : la polyvalence et le budget, ou la performance et l’évolutivité.
Une chose est sûre : la bataille ne fait que commencer, et c’est nous, utilisateurs, qui en sortons gagnants.
Sources
- AMD Ryzen AI Halo vs NVIDIA DGX Spark 2026 – runaihome.com
- DGX Spark vs Strix Halo: Local AI in 2026 – compute-market.com
- Ryzen AI Halo Review: AMD’s DGX Spark And Mac Mini Challenger Tested – HotHardware
- AMD’s tiny Ryzen AI box does what Nvidia’s DGX Spark does at a fraction of the power – XDA Developers
- NVIDIA DGX Spark : spécifications et usages – syskb.com
- Qwen3.8-27B on DGX Spark – 48 tok/s – blog.openzeka.com
- Qwen3.8-Flash-Next MTP Is Here: 1.67x Speedup – banandre.com
- Speculative decoding in Uzu – trymirai.com
- 1x Spark: DeepSeek-V4-Flash-0731 @ 1,000 tok/s prefill – forums.developer.nvidia.com
- DeepSeek V4 Flash 0731 on Dual DGX Spark – flowtivity.ai
- Agent Serving on 2× DGX Spark with DeepSeek V4 Flash 0731 – forums.developer.nvidia.com
- Laguna S 2.1 : Poolside répond à la Chine – habr.com
- Fine-tuning sur DGX Spark – DeepWiki
- DeepSeek V4 Flash 0731 sur un seul DGX Spark – DeepWiki
- NVIDIA Brings Simplified Local AI Support To GPUs – wccftech.com
- DGX Spark vs RTX 5090 for AI and ML Coding – blog.lalatendu.info
Article recherché et rédigé automatiquement · Magazine Electrosens