Electrosens R&D
Electrosens NVIDIA DGX Spark · 30 August 2026

DGX Spark : quand NVIDIA lâche les rênes, l’écosystème s’emballe

Pendant des mois, le DGX Spark a été une promesse solitaire : une mini-station de 128 Go de mémoire unifiée, annoncée en janvier 2025, vendue uniquement par NVIDIA. Puis, le 18 mai 2025, au Computex, tout a basculé. Sept constructeurs — Acer, ASUS, Dell, GIGABYTE, HP, Lenovo et MSI — ont été désignés partenaires officiels. Un an plus tard, les premières machines arrivent, les portables se dévoilent, et la question n’est plus « qu’est-ce que le Spark ? » mais « lequel choisir pour faire tourner mes LLM open source ? » Bienvenue dans l’ère de la diversification.

La fin du monopole : quand NVIDIA lâche les rênes du DGX Spark

Il faut se souvenir de l’état d’esprit de janvier 2025. NVIDIA dévoile le DGX Spark, un mini-PC de bureau équipé du superchip GB10 Grace Blackwell, capable d’atteindre 1 pétaflop de calcul IA en FP4 et doté de 128 Go de mémoire unifiée. Le produit est séduisant, mais il est vendu exclusivement par NVIDIA, comme une console de luxe pour développeurs. Les premiers retours de la communauté sont enthousiastes : des utilisateurs parviennent à faire tourner des modèles comme DeepSeek V4 Flash 0731 sur une seule machine, avec des débits impressionnants — 1 000 tokens/s en préfill et 59 tokens/s en serving multi-agents, comme le rapporte un forum NVIDIA début août 2026. Mais l’offre reste verrouillée.

Puis vient le Computex, le 18 mai 2025. NVIDIA annonce officiellement que sept constructeurs — Acer, ASUS, Dell, GIGABYTE, HP, Lenovo et MSI — construiront des systèmes DGX Spark et DGX Station. C’est un basculement stratégique majeur. NVIDIA ne vend plus seul : il ouvre sa plateforme à l’écosystème PC traditionnel, exactement comme il l’a fait pour les cartes graphiques il y a vingt-cinq ans. Le communiqué, relayé par Nasdaq, précise que ces partenaires proposeront leurs propres designs, avec leurs propres châssis, leurs propres systèmes de refroidissement, leurs propres garanties.

Cette ouverture change la donne sur un point fondamental : le matériel n’est plus un argument de vente unique. Tous les partenaires utilisent la même puce GB10 (ou ses variantes). Ce qui différenciera les marques, ce sera l’écosystème logiciel, le support, la qualité de fabrication, et la politique de mise à jour. C’est une logique que les vétérans du PC connaissent bien : quand Intel a ouvert son architecture aux constructeurs, c’est le BIOS, le design et le support qui ont fait la différence entre un Dell et un Acer. On risque de revivre exactement la même histoire, mais avec des enjeux bien plus élevés : la compatibilité avec les stacks d’inférence comme vLLM ou Unsloth.

Il y a cependant une confusion naissante qu’il faut dissiper d’emblée. Les sources officielles parlent de « DGX Spark » pour le mini-PC, mais les constructeurs et la presse utilisent de plus en plus le terme « RTX Spark » pour désigner la plateforme, notamment pour les PC portables. Frandroid a d’ailleurs publié un article au titre évocateur : « Un seul silicium, trois étiquettes : on démêle le bazar entre RTX Spark, le nom de code N1X et le GB10 du DGX Spark ». Cette confusion n’est pas anodine : elle reflète une stratégie de marque floue de la part de NVIDIA, qui cherche à décliner sa technologie sur plusieurs segments — mini-PC, portables, stations de travail — sans harmoniser sa communication. Pour l’acheteur, c’est un piège : on peut croire acheter un « DGX Spark » et se retrouver avec un portable « RTX Spark » aux performances différentes, ou inversement.

GB10 sous toutes les coutures : 1 pétaflop, 128 Go, et une variante secrète à 18 cœurs

Le cœur de cette plateforme, c’est le superchip GB10 Grace Blackwell. Les spécifications sont désormais bien établies : un CPU ARM Nvidia Grace à 20 cœurs, un GPU Blackwell avec 6 144 cœurs CUDA, jusqu’à 1 pétaflop de calcul IA en FP4, et 128 Go de mémoire unifiée. Ces chiffres, confirmés par Les Numériques et Clubic, sont impressionnants pour une machine de bureau. Mais ce qui intéresse vraiment les utilisateurs de LLM open source, c’est la mémoire : 128 Go de mémoire unifiée, c’est la capacité de charger des modèles de 70 milliards de paramètres en quantisation 4 bits, voire des modèles plus gros en quantisation plus agressive. Pour donner un ordre d’idée, DeepSeek V4 Flash 0731, un modèle de 284 milliards de paramètres, peut être exécuté sur un seul DGX Spark en quantisation Q4 (environ 155 Go), comme le montre le projet d’émulation indépendante documenté sur DeepWiki. C’est un exploit que peu de machines de bureau peuvent revendiquer.

Source : lesnumeriques.com

Mais il y a une ombre au tableau : une seconde variante de la puce est évoquée par VideoCardz, rapportée par Clubic. Cette variante aurait 18 cœurs CPU et 5 120 cœurs CUDA, soit une configuration réduite par rapport à la version 20 cœurs / 6 144 cœurs. Qui l’aura ? Pourquoi ? Les rumeurs suggèrent qu’elle pourrait équiper les PC portables, où la dissipation thermique est plus contrainte. Un portable fin comme l’ASUS ProArt P14 (13,9 mm d’épaisseur) ne peut pas évacuer la chaleur d’un GPU à pleine puissance. Réduire le nombre de cœurs permet de baisser le TDP et de maintenir des performances soutenables. C’est une logique classique dans l’industrie : on ne met pas un i9 dans un ultrabook sans le brider.

L’impact sur les performances en inférence est potentiellement significatif. Moins de cœurs CUDA signifie moins de parallélisme, donc des débits de tokens plus faibles. Mais attention : pour l’inférence de modèles de type MoE (Mixture of Experts), le goulot d’étranglement est souvent la bande passante mémoire, pas le nombre de cœurs. Les 128 Go de mémoire unifiée sont partagés entre CPU et GPU, et la bande passante est le facteur limitant. Une réduction de 20 % du nombre de cœurs CUDA pourrait n’entraîner qu’une baisse de 10 à 15 % des performances en génération, tout en permettant un refroidissement plus efficace. C’est un compromis acceptable pour un portable.

Pour situer le positionnement, il faut comparer avec le DGX Station, le grand frère. Équipé du GB300 Grace Blackwell Ultra Desktop Superchip, il offre jusqu’à 20 pétaflops et 784 Go de mémoire unifiée, avec un ConnectX-8 SuperNIC à 800 Gb/s. C’est un monstre, destiné aux équipes de recherche qui veulent faire tourner des modèles de plusieurs centaines de milliards de paramètres en précision native. Le Spark, lui, est un outil de prototypage et d’inférence locale pour les modèles jusqu’à ~70B en Q4, ou les MoE jusqu’à ~300B en Q4. Entre les deux, il y a un fossé de prix et de performances, mais aussi d’usage : le Spark est conçu pour être posé sur un bureau, le Station pour être installé dans un rack.

Portables ProArt, convertibles MSI, mini-PC Acer : la guerre des formats est déclarée

L’automne 2026 marque le véritable lancement commercial de cette diversification. ASUS et MSI sont en première ligne, avec des PC portables. ASUS dévoile les ProArt P14 (H7407) et P16 (H7607), deux machines au design soigné : dalles OLED 120 Hz, luminosité de 1600 cd/m², Delta E < 1, définitions 3K pour le 14 pouces et 4K pour le 16 pouces. Les profils sont fins : 13,9 mm pour le P14 (1,48 kg), 12,9 mm pour le P16 (1,77 kg). Ce sont des machines de créateurs, pensées pour l’édition photo/vidéo autant que pour l’IA. MSI répond avec le Prestige N16 Flip AI+, un convertible équipé d’un stylet Nano Pen, d’une batterie de 99,9 Wh et d’une dalle 16 pouces UHD+ Tandem OLED. Là encore, le positionnement est clair : la mobilité et la flexibilité d’usage.

Ces choix de formats sont stratégiques. ASUS et MSI misent sur le fait que les développeurs et les chercheurs veulent emporter leur machine de démonstration, présenter leurs modèles en clientèle, travailler dans un café. Un portable avec 128 Go de mémoire unifiée, c’est un argument de vente énorme pour les consultants en IA. Mais il y a un revers : le refroidissement. Un châssis de 13,9 mm d’épaisseur ne peut pas contenir un système de dissipation digne d’un mini-PC. Les performances soutenues en inférence longue durée risquent d’être bridées par la thermique. C’est un point que les acheteurs devront surveiller : les benchmarks de la communauté sur les Sparks de bureau montrent des débits stables, mais qu’en sera-t-il sur un portable fin ?

Acer et Gigabyte, eux, préparent des mini-PC. C’est un choix plus conservateur, mais potentiellement plus pertinent pour l’inférence locale : un châssis plus grand permet un meilleur refroidissement, des ventilateurs plus silencieux, et une meilleure sustentation des performances. Acer a une longue expérience des mini-PC (la gamme Revo, par exemple), et Gigabyte est un habitué des cartes mères et des stations de travail. Leurs machines devraient arriver après les portables, probablement début 2027. Dell, Lenovo et HP, pourtant annoncés officiellement, n’ont pas encore dévoilé leurs designs. C’est un mystère : que préparent-ils ? Dell pourrait proposer un châssis de type Precision, avec un refroidissement renforcé et une garantie professionnelle. Lenovo pourrait décliner sa gamme ThinkStation. HP pourrait surprendre avec un design compact et modulaire. Mais rien n’est confirmé à ce jour.

Constructeur Format Modèle(s) Particularités Statut
ASUS Portable ProArt P14 (H7407), P16 (H7607) OLED 120 Hz, 1600 cd/m², 13,9/12,9 mm Confirmé, lancement automne 2026
MSI Portable convertible Prestige N16 Flip AI+ Stylet Nano Pen, batterie 99,9 Wh, Tandem OLED Confirmé, lancement automne 2026
Acer Mini-PC Non dévoilé Annoncé, lancement ultérieur
Gigabyte Mini-PC Non dévoilé Annoncé, lancement ultérieur
Dell Non dévoilé Annoncé officiellement, design inconnu
Lenovo Non dévoilé Annoncé officiellement, design inconnu
HP Non dévoilé Annoncé officiellement, design inconnu

vLLM, Unsloth et le spectre de la fragmentation : le logiciel fera-t-il la différence ?

C’est la grande question qui agite les forums depuis l’annonce du Computex : chaque constructeur va-t-il verrouiller son BIOS, son firmware ou ses pilotes ? Si ASUS décide de limiter l’accès à certains réglages de mémoire ou de refroidissement, les utilisateurs de vLLM ou d’Unsloth pourraient se retrouver avec des performances bridées, ou pire, des incompatibilités. L’histoire récente du PC nous a appris à nous méfier : les BIOS propriétaires, les verrouillages UEFI, les pilotes signés uniquement pour Windows, tout cela existe. Mais NVIDIA a un intérêt stratégique à imposer une certaine standardisation.

Source : clubic.com

Pour l’instant, les signaux sont plutôt rassurants. NVIDIA a publié le 22 juillet 2026 une première version préliminaire de CUDA 13.4 pour Windows sur Arm, native à Arm64. C’est un geste fort : cela signifie que les développeurs peuvent préparer leurs applications pour RTX Spark, et que SEGA l’a déjà prise en charge. Ce kit de développement est un signal clair que NVIDIA veut un écosystème ouvert, pas un jardin clos à la Apple. Les pilotes sont signés par NVIDIA, pas par les constructeurs, ce qui réduit le risque de fragmentation.

Reste la question du BIOS. Sur un PC classique, le BIOS est standardisé (UEFI, ACPI), et les constructeurs ne peuvent pas s’en écarter trop sans casser la compatibilité. Pour le Spark, la situation est différente : la plateforme est nouvelle, et NVIDIA pourrait laisser les constructeurs personnaliser certains paramètres (gestion thermique, profils de performance, overclocking mémoire). C’est une épée à double tranchant : d’un côté, cela permet aux constructeurs de différencier leurs machines ; de l’autre, cela crée des comportements variables qui compliquent la vie des développeurs. Un modèle qui chauffe plus qu’un autre, une mémoire qui se bride à 120 Go au lieu de 128, un ventilateur qui s’emballe sous charge : autant de petits problèmes qui peuvent transformer une expérience fluide en cauchemar.

La comparaison avec l’écosystème PC classique est éclairante. Quand Intel a lancé les processeurs Core, les constructeurs ont eu la liberté de concevoir des cartes mères différentes, mais le chipset et le BIOS étaient standardisés. Résultat : une compatibilité quasi universelle. Pour le Spark, NVIDIA doit jouer le même rôle : imposer un socle commun (pilotes, firmware, interface de gestion) tout en laissant les constructeurs s’exprimer sur le design. Si NVIDIA échoue, on assistera à une fragmentation à la Android, où chaque marque propose sa propre surcouche, avec des mises à jour inégales et des incompatibilités sournoises. Si NVIDIA réussit, on aura un écosystème à la Windows, où le matériel varie mais le logiciel est universel.

Tokens par seconde : ce que l’on sait (et ce qu’on ignore encore) des performances réelles

Il faut être honnête : à ce jour, aucune donnée indépendante n’a été publiée sur les tokens par seconde pour les nouvelles machines des constructeurs. Les benchmarks disponibles concernent le DGX Spark d’origine, celui vendu par NVIDIA. Et ils sont encourageants. Sur les forums NVIDIA, un utilisateur rapporte avoir atteint 1 000 tokens/s en préfill et 59 tokens/s en serving multi-agents avec DeepSeek V4 Flash 0731 sur un seul Spark. Un autre, avec deux Sparks en cluster, obtient des résultats encore meilleurs, avec des optimisations de KV-cache et de scheduling. Ant Ling-3.0-Flash, un modèle MoE de 124 milliards de paramètres avec 5 milliards d’actifs, tourne à 15-20 tokens/s sur un seul Spark, selon les retours de la communauté.

Ces chiffres sont à prendre avec précaution : ils proviennent d’utilisateurs passionnés, pas de laboratoires de test. Mais ils donnent une idée de ce que la plateforme peut faire. Pour un modèle de 70 milliards de paramètres en Q4, on peut s’attendre à des débits de l’ordre de 20 à 40 tokens/s en génération, ce qui est utilisable pour de l’interaction en temps réel, mais pas pour de la génération de masse. Pour des modèles plus petits (7B-13B), les débits devraient être bien plus élevés, probablement au-delà de 100 tokens/s.

La question des variantes de puces est cruciale. Si les portables ASUS et MSI sont équipés de la version 18 cœurs / 5 120 cœurs CUDA, leurs performances en inférence seront inférieures à celles du mini-PC d’origine. La différence pourrait être de l’ordre de 10 à 20 %, selon la nature du workload. Pour de l’inférence MoE, la bande passante mémoire étant le facteur limitant, l’écart pourrait être minime. Pour des modèles denses, en revanche, la réduction du nombre de cœurs CUDA se fera sentir. Et le refroidissement jouera un rôle majeur : un portable fin qui chauffe va brider ses fréquences, réduisant encore les performances. Les tests indépendants devront être menés dès la sortie des machines, avec des protocoles standardisés (mêmes modèles, mêmes quantisations, mêmes prompts).

Du Spark à la Station : 128 Go ou 784 Go, où placer le curseur de l’inférence locale ?

Le choix entre le Spark et la Station dépend d’un seul facteur : la taille des modèles que vous voulez faire tourner. Avec 128 Go de mémoire unifiée, le Spark peut charger des modèles jusqu’à environ 70 milliards de paramètres en Q4, ou des MoE jusqu’à 300 milliards en Q4. C’est suffisant pour la grande majorité des modèles open source actuels : Llama 3 70B, Mixtral 8x7B, DeepSeek V4 Flash, Ant Ling-3.0-Flash, Poolside Laguna S 2.1 (118B). Pour du fine-tuning de modèles 7B-13B, le Spark est largement suffisant, avec la possibilité de charger plusieurs modèles en parallèle.

Source : nasdaq.com

La Station, avec ses 784 Go, ouvre des horizons différents : des modèles de 400 milliards de paramètres en précision native, du multi-modèle intensif, des expériences de fine-tuning sur des modèles de 70B avec de grands lots. Mais elle coûte cher, et elle est encombrante. Pour un chercheur individuel ou une petite équipe, le Spark est un choix rationnel. Pour un laboratoire qui veut explorer les limites de l’open source, la Station est un investissement justifiable.

Besoin DGX Spark (128 Go) DGX Station (784 Go)
Inférence modèles 7B-13B Excellent (débits >100 tok/s) Surdimensionné
Inférence modèles 70B Q4 Bon (20-40 tok/s) Excellent
Inférence MoE 100-300B Q4 Correct (15-20 tok/s) Excellent
Fine-tuning 7B-13B Bon (avec LoRA/QLoRA) Excellent
Fine-tuning 70B Limité (nécessite QLoRA) Excellent
Multi-modèle simultané 2-3 modèles 10+ modèles
Prix ~3 000 $ (annonce initiale) Non précisé

Le prix est un autre facteur. Le Spark a été annoncé autour de 3 000 $, mais les versions constructeurs pourraient varier. ASUS et MSI, avec leurs portables haut de gamme (dalles OLED, châssis en alliage), risquent de facturer un premium. Acer et Gigabyte, avec leurs mini-PC, pourraient proposer des prix plus agressifs. Dell, avec sa gamme professionnelle, pourrait viser le haut de gamme. Il est encore trop tôt pour donner des fourchettes précises, mais on peut s’attendre à une fourchette de 2 500 à 4 500 $ selon les configurations.

Face aux alternatives, le Spark se positionne bien. Un Mac Studio avec M3 Ultra offre une mémoire unifiée comparable (jusqu’à 512 Go), mais à un prix nettement plus élevé, et avec un écosystème logiciel moins mature pour CUDA. Un PC avec RTX 5090 a une bande passante mémoire impressionnante, mais sa VRAM de 32 Go est un plafond dur pour les LLM. Le Spark, avec ses 128 Go de mémoire unifiée, est le seul à offrir ce rapport capacité/prix. C’est son principal argument de vente.

Guide d’achat 2026 : quelle machine pour quel usage LLM ?

Face à cette diversité naissante, comment choisir ? Tout dépend de votre profil d’utilisateur. Pour le chercheur qui fait du fine-tuning intensif, la stabilité et la garantie sont primordiales. Un mini-PC d’Acer ou de Gigabyte, avec un refroidissement robuste et une garantie standard, est un choix sûr. Le fine-tuning de modèles 7B-13B avec Unsloth ou LLaMA-Factory nécessite des sessions de plusieurs heures, parfois plusieurs jours. Une machine qui surchauffe ou qui se fige est inacceptable. Les portables, avec leur dissipation limitée, sont à éviter pour ce type d’usage.

Pour le développeur d’applications qui fait de l’inférence en continu, la priorité est la connectivité et la sustentation des performances. Il faut des ports Thunderbolt pour brancher des périphériques, un Ethernet 10GbE pour le clustering, et un système de refroidissement qui ne s’emballe pas sous charge. Les mini-PC sont ici supérieurs aux portables. Un modèle d’Acer ou de Gigabyte, avec un châssis ventilé, sera plus adapté qu’un ProArt P14, même si ce dernier est plus séduisant.

Pour le passionné, au budget limité, qui accepte les compromis, le choix est plus ouvert. Un portable ASUS ou MSI offre la flexibilité de travailler partout, au prix de performances potentiellement bridées. Un mini-PC d’entrée de gamme, s’il existe, pourrait être le meilleur rapport performance/prix. Il faut aussi considérer la politique de garantie et de support Linux de chaque marque. ASUS a une longue expérience du support Linux sur ses cartes mères, mais ses portables sont moins bien lotis. MSI est plus inégal. Dell, avec sa gamme Precision, a une excellente réputation pour le support Linux. Lenovo, avec ThinkStation, est également solide. HP est plus discret.

Critère ASUS MSI Acer Gigabyte Dell Lenovo HP
Format Portable Portable Mini-PC Mini-PC ? ? ?
Refroidissement Moyen (portable fin) Moyen (convertible) Bon (mini-PC) Bon (mini-PC) ? ? ?
Support Linux Bon (cartes mères) Moyen Moyen Bon Excellent (Precision) Bon (ThinkStation) Moyen
Garantie Standard Standard Standard Standard Pro (3-5 ans) Pro (3-5 ans) Pro (3-5 ans)
Prix estimé Premium Premium Modéré Modéré ? ? ?

Et maintenant, le cluster : quand plusieurs Sparks se mettent en réseau pour rivaliser avec le cloud

La fonctionnalité la plus excitante du DGX Spark, c’est sa capacité à former des clusters. NVIDIA a conçu la machine pour être mise en réseau : via ConnectX ou Ethernet haute vitesse, on peut combiner plusieurs Sparks pour obtenir une mémoire unifiée cumulée. Un cluster de 4 Sparks, c’est 512 Go de mémoire unifiée, suffisamment pour faire tourner des modèles de 300 milliards de paramètres en Q4, ou pour exécuter plusieurs modèles en parallèle. Les retours de la communauté sont prometteurs : un utilisateur rapporte avoir fait tourner DeepSeek V4 Flash 0731 sur deux Sparks avec des optimisations de KV-cache, atteignant des débits corrects pour du serving multi-agents.

Les logiciels de gestion de cluster sont déjà là : NVIDIA AI Enterprise, Slurm, Ray, et les frameworks maison comme Hermes Agent. La question est de savoir si les versions constructeurs seront compatibles avec ces outils. Si un constructeur décide de verrouiller son BIOS ou de limiter les fonctionnalités réseau, le clustering devient impossible. C’est un risque réel, mais NVIDIA a tout intérêt à l’éviter : le clustering est un argument de vente majeur pour les petites équipes qui veulent une alternative au cloud.

Cette diversification marque-t-elle le début de la fin du cloud pour l’inférence IA ? Pas encore. Le cloud reste indispensable pour les très gros modèles, les entraînements distribués, et les pics de charge. Mais pour le prototypage, l’inférence locale, et les applications sensibles à la confidentialité, le Spark et ses déclinaisons offrent une alternative crédible. Avec 128 Go de mémoire unifiée à moins de 4 000 $, on peut faire tourner des modèles qui, il y a deux ans, nécessitaient un serveur à 50 000 $. C’est une démocratisation, pas une révolution. Mais c’est une démocratisation qui change la donne pour des milliers de développeurs.

L’avenir dira si cette ouverture de l’écosystème sera une réussite ou un échec. Les signaux sont positifs : CUDA 13.4 pour Windows Arm, des benchmarks communautaires encourageants, des constructeurs qui s’engagent. Mais les pièges sont nombreux : fragmentation logicielle, verrouillage matériel, support inégal. Une chose est sûre : en 2026, le choix d’une machine pour faire tourner des LLM open source n’a jamais été aussi riche, et jamais aussi complexe. Le Spark n’est plus un produit, c’est une plateforme. Et les plateformes, on le sait, vivent ou meurent par leur écosystème.

Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *