NVIDIA DGX Spark · 17 September 2026Perplexity Portable Computer : la fin du cloud pour les agents IA ? Décryptage sur DGX Spark
C’est une petite boîte noire qui murmure à l’oreille de votre DGX Spark. Perplexity et Nvidia viennent d’annoncer conjointement le « Portable Computer », un agent d’IA 100 % local promettant zéro coût de token. Derrière le slogan marketing, se cache peut-être le premier vrai tournant vers une IA agentique qui n’a plus besoin du cloud pour exister. Décryptage d’une annonce qui pourrait bien redessiner la carte de l’inférence locale.
Une annonce qui sent le tournant
L’écosystème de l’IA locale a longtemps vécu dans l’ombre des géants du cloud. Les API d’OpenAI, d’Anthropic ou de Google dominaient le marché des agents, avec leurs coûts par token, leurs latences imprévisibles et leurs questions de souveraineté des données. Puis, discrètement, la donne a commencé à changer. Les modèles open weight ont franchi un cap qualitatif, et le matériel a suivi : le NVIDIA DGX Spark, avec son superchip GB10 et ses 128 Go de mémoire unifiée, a transformé ce qui était un rêve de passionné en une réalité tangible.
C’est dans ce contexte que Perplexity et Nvidia ont choisi de frapper fort. L’annonce, faite conjointement, du « Portable Computer » n’est pas un simple add-on logiciel de plus. C’est une déclaration d’intention : l’agent IA peut désormais vivre entièrement sur votre matériel, sans jamais avoir besoin de téléphoner à un serveur distant. Les sources concordent — HotHardware, ZDNET, VentureBeat — sur un point essentiel : ce produit est proposé gratuitement aux abonnés payants de Perplexity (Pro, Max, Enterprise Pro, Enterprise Max). Une stratégie de fidélisation audacieuse, qui transforme l’abonnement en licence d’utilisation d’un logiciel d’inférence locale.
Le timing n’est pas anodin. Nous sommes en septembre 2026, et l’IFA de Berlin a été le théâtre d’une démonstration de force de Nvidia autour de ses « one-click AI agents » et de sa plateforme RTX Spark. L’idée est simple : démocratiser l’IA locale en la rendant aussi simple à installer qu’une application de bureau. Le Portable Computer s’inscrit parfaitement dans cette logique. Il ne s’agit plus de bricoler des scripts Python, de compiler des kernels CUDA ou de jongler avec des dépendances. Perplexity promet un bundle clé en main : un modèle, un serveur et un harnais (harness), le tout préconfiguré pour fonctionner sur une liste précise de matériels.
Le Portable Computer en pratique : un bundle, pas une boîte magique
Il faut dissiper immédiatement un malentendu : le « Portable Computer » n’est pas un nouveau boîtier matériel. C’est un logiciel, un agent d’IA locale qui s’installe sur du matériel existant. Et la liste du matériel supporté est à la fois précise et exigeante. Selon HotHardware, il faut soit un NVIDIA GB10 (le superchip du DGX Spark, ou le Dell Pro Max qui l’embarque), soit un PC x86 sous Ubuntu équipé d’un GPU NVIDIA avec au moins 24 Go de VRAM — les RTX 3090, 4090 et 5090 étant explicitement cités. La prise en charge de Windows est promise pour septembre, mais au moment de la rédaction, Linux est le seul système d’exploitation pleinement opérationnel.

Cette exigence matérielle est logique. Un agent IA local, capable de raisonner, de planifier et d’exécuter des tâches, nécessite une mémoire conséquente pour loger le modèle et son contexte. Le choix du modèle initial est révélateur : Qwen3.8 27B, un modèle dense de 27 milliards de paramètres publié par Alibaba en août 2026. Pourquoi ce choix ? Parce qu’il représente le meilleur compromis actuel entre qualité de raisonnement et empreinte mémoire. Sur un DGX Spark, ce modèle tourne à des vitesses tout à fait honorables : les benchmarks communautaires publiés fin août 2026 (blog.openzeka.com) rapportent environ 48 tokens par seconde, tandis que d’autres tests indépendants (test du 20 août 2026) mesurent entre 34 et 38 tokens par seconde selon la configuration. Des chiffres qui rendent l’expérience utilisateur fluide, même si l’on est loin des vitesses de certaines API cloud.
| Modèle | Paramètres | Architecture | Support Portable Computer | Vitesse observée sur DGX Spark |
|---|---|---|---|---|
| Qwen3.8 27B | 27 Md | Dense | Initial (confirmé) | 34-48 tok/s (sources communautaires) |
| Nemotron 3.5 Lightning | 30 Md | MoE hybride | À venir (annoncé) | Non précisé |
| DeepSeek V4 Flash 0731 | 284 Md (13 Md actifs) | MoE | Non mentionné | 59 tok/s multi-agent sur dual Spark |
Le support futur de Nemotron 3.5 Lightning (30B, architecture MoE hybride) est annoncé par HotHardware. Ce choix est stratégique : les architectures MoE (Mixture of Experts) activent seulement une fraction des paramètres à chaque inférence, ce qui permet d’obtenir des performances élevées avec une empreinte mémoire réduite. C’est exactement le genre de modèle qui peut tirer parti des 128 Go de mémoire unifiée du GB10 tout en laissant de la place pour un large contexte.
Zéro coût de token : la promesse et ses limites
Le cœur de la proposition de valeur du Portable Computer tient en une formule choc : « zéro coût de token ». Perplexity l’affirme dans son blog technique officiel, cité par ZDNET : l’inférence locale ne génère aucun frais, et les données sensibles ne quittent pas l’appareil sans permission explicite. L’agent fonctionne dans un sandbox isolé, ce qui ajoute une couche de sécurité bienvenue pour les usages professionnels.
Cette promesse est-elle tenable ? Techniquement, oui. Lorsque le modèle tourne localement, il n’y a effectivement aucun appel API, donc aucun coût par token. Mais il faut nuancer. D’abord, le « zéro coût » ne concerne que l’inférence. L’abonnement Perplexity reste payant — c’est la condition d’accès au logiciel. Ensuite, la promesse de souveraineté des données doit être tempérée : si l’agent a besoin d’accéder à des outils externes (recherche web, API tierces, etc.), les données peuvent transiter par le réseau. Le sandbox isole le modèle, pas nécessairement toutes ses interactions.
Il y a aussi la question des performances. L’auteur de HotHardware, qui a testé le produit, note avec honnêteté que les performances brutes sont plus rapides sur une mémoire GPU dédiée avec plus de bande passante. Mais il souligne un point crucial : les fenêtres de contexte plus larges sont plus réalisables sur le DGX Spark grâce à son large pool de mémoire unifiée. C’est un arbitrage fondamental. Un GPU comme le RTX 5090, avec ses 32 Go de VRAM, offre une bande passante énorme mais une capacité limitée. Le GB10, avec ses 128 Go de mémoire unifiée, peut charger des contextes gigantesques — 256K tokens pour Qwen3.6 27B, par exemple — au prix d’une vitesse d’inférence légèrement inférieure.
| Critère | Cloud (API) | Local (DGX Spark + Portable Computer) |
|---|---|---|
| Coût par token | Oui, variable selon le modèle | Zéro (mais abonnement requis) |
| Latence | Réseau + serveur (variable) | Locale (déterministe) |
| Confidentialité | Dépend du fournisseur | Données sur l’appareil (sandbox) |
| Contexte maximal | Souvent limité par le plan | Limité par la RAM unifiée (128 Go) |
| Personnalisation | Limitée aux paramètres API | Fine-tuning possible localement |
Sur le terrain : Qwen3.8 27B et le DGX Spark, ce que disent les benchmarks
Pour évaluer sérieusement le Portable Computer, il faut regarder ce qui se passe réellement sur le matériel. Le DGX Spark, avec son GB10, est devenu une référence dans la communauté de l’IA locale. Les chiffres publiés en août 2026 sont éloquents. Le blog openzeka.com rapporte 48 tok/s pour Qwen3.8-27B, un score qui place ce modèle en tête de sa catégorie sur l’Artificial Analysis Intelligence Index (52 points). D’autres tests, datés du 20 août 2026, mesurent entre 34 et 38 tok/s. Cette variabilité s’explique par les configurations : température, longueur de contexte, activation du speculative decoding, etc.

Car c’est là que les choses deviennent intéressantes. La communauté ne cesse d’optimiser. Le 2 septembre 2026, une implémentation de Multi-Token Prediction (MTP) pour Qwen3.8-Flash-Next GGUF a été publiée, avec un speedup annoncé de 1,67x et des vitesses passant de 83 à 138 tok/s — mais sur du matériel différent, probablement des GPU plus puissants. Le 3 septembre, Nvidia a annoncé des optimisations pour ses GPU RTX et DGX, notamment dans vLLM et llama.cpp. L’écosystème logiciel progresse vite, et le DGX Spark en bénéficie directement.
Le point crucial pour un agent IA est la capacité à gérer des sessions multiples. Les tests de la communauté (forums.developer.nvidia.com, 1er août 2026) montrent que le DGX Spark peut servir plusieurs agents simultanément : avec DeepSeek V4 Flash 0731, un modèle MoE de 284 milliards de paramètres dont seulement 13 milliards sont actifs, on atteint 59 tok/s en multi-agent serving sur une configuration double Spark. C’est un chiffre remarquable, qui montre que la plateforme n’est pas limitée aux petits modèles.
Et pour les gros modèles ? Le dual-Spark et la question du 405B
La question que tout le monde se pose : peut-on faire tourner des modèles de 405 milliards de paramètres sur un DGX Spark ? La réponse est oui, mais avec des compromis. Les tests publiés par geeky-gadgets.com montrent que deux DGX Spark interconnectés peuvent exécuter un modèle 405B, mais les performances « trails cloud processing » — c’est-à-dire qu’elles restent inférieures à celles du cloud. C’est une nuance importante.
L’interconnexion entre deux Spark est un point technique délicat. Le DGX Spark dispose d’un lien 10GbE (1,25 Go/s de débit théorique), ce qui est correct mais loin des interconnexions haute vitesse des serveurs de données. Pour un modèle 405B, il faut sharder les poids entre les deux machines, et chaque communication entre les couches du modèle passe par ce lien. Le goulot d’étranglement est là : la bande passante mémoire de chaque Spark est de 273 Go/s (pour le GB10), mais l’interconnexion entre les deux n’atteint que 1,25 Go/s. C’est un facteur de 200 entre la bande passante interne et externe.
Les retours de la communauté sur le dual-Spark avec DeepSeek V4 Flash 0731 (forums.developer.nvidia.com, 2 août 2026) sont instructifs. L’un des utilisateurs a dû corriger ses mesures : « my decode-share numbers were wrong, and one of my conclusions was too ». La configuration requiert des ajustements fins, notamment sur le KV-cache et le scheduling. Un autre utilisateur (31 juillet 2026) rapporte qu’avec une petite modification de configuration, le modèle passe de 30 tok/s à une « acceptance rate » bien meilleure. Autrement dit, le dual-Spark fonctionne, mais il demande une expertise que le Portable Computer ne fournit pas encore.
Le logiciel de Perplexity, dans sa version initiale, ne supporte que Qwen3.8 27B. Il ne gère donc pas nativement le mode cluster. Pour l’instant, le Portable Computer est un produit mono-machine. C’est une limitation assumée, mais qui laisse la porte ouverte : si Perplexity étend son support aux configurations multi-nœuds, le produit deviendrait un sérieux concurrent des serveurs cloud pour les charges de travail agentiques lourdes.
Le TCO en question : local vs cloud, qui gagne vraiment ?
Analysons maintenant la dimension économique, souvent décisive. Le DGX Spark est commercialisé autour de 3000 $ (le prix exact n’est pas précisé dans nos sources, mais les alternatives comme l’Acer DGX sont annoncées 500 à 1000 $ moins chères). À ce coût matériel, il faut ajouter l’électricité, la maintenance et la dépréciation sur 3 ans. Un usage intensif — disons 8 heures par jour à pleine charge — consomme environ 100-150 W pour le Spark, soit 300-450 kWh par an. À 0,20 €/kWh, cela représente 60 à 90 € par an. La maintenance logicielle est quasi nulle pour un particulier, mais pour une entreprise, il faut compter le temps d’administration.

Comparons avec un usage cloud intensif. Pour un flux de travail agentique lourd, disons 1 million de tokens par jour (entrée + sortie), les API cloud facturent typiquement entre 1 et 5 $ par million de tokens selon le modèle et le fournisseur. Sur 3 ans (1095 jours), cela représente entre 1000 et 5500 $ par an, soit 3000 à 16500 $ sur la période. Le calcul est sans appel : pour un usage intensif, le local est rentabilisé en quelques mois. Pour un usage léger (moins de 100 000 tokens par jour), le cloud reste plus économique, car il évite l’investissement initial.
Mais le TCO ne fait pas tout. La valeur de la souveraineté des données, la latence déterministe, la possibilité de fine-tuner le modèle localement (le DGX Spark est documenté pour cela, avec des workflows sur le GB10) — ces avantages qualitatifs ne se chiffrent pas facilement. Les entreprises qui traitent des données sensibles (santé, finance, juridique) peuvent justifier un surcoût matériel pour éviter les fuites. Et avec l’arrivée de modèles comme DeepSeek V4 Flash 0731 (13B actifs, 284B total) qui tiennent sur un seul Spark en quantification Q8 (162 Go, seulement 7 Go de plus que la version Q4), la frontière entre le local et le cloud s’amincit chaque mois.
Un produit de niche ou un vrai tournant ?
Alors, le Portable Computer marque-t-il la fin du cloud pour les agents IA ? La réponse honnête est : pas encore, mais c’est un pas décisif dans cette direction. Le produit souffre de limitations évidentes : support mono-modèle au lancement, Linux uniquement (Windows en septembre), matériel exigeant (24 Go de VRAM minimum), et pas de mode cluster. C’est un produit pour passionnés et early adopters, pas pour le grand public.
Mais regardons la trajectoire. En un an, l’écosystème a explosé : des modèles open weight de qualité frontalière (Qwen3.8, DeepSeek V4, Nemotron 3.5), des optimisations logicielles qui doublent les performances (MTP, speculative decoding), et du matériel abordable avec 128 Go de mémoire unifiée. Le DGX Spark n’est plus seul : AMD propose le Ryzen AI Halo (128 Go LPDDR5X, 256 Go/s de bande passante, 3999 $) et Apple vend des Mac Studio M5 Ultra qui font tourner des modèles 120B à 34 tok/s. La concurrence est féroce, et c’est une excellente nouvelle pour les consommateurs.
Le Portable Computer de Perplexity a un avantage unique : il ne vend pas du matériel, il vend une expérience. En fournissant un bundle clé en main (modèle + serveur + harness), il abaisse la barrière d’entrée pour les développeurs et les entreprises qui veulent déployer des agents locaux sans expertise technique approfondie. C’est exactement ce que Nvidia cherche à faire avec ses « one-click AI agents » annoncés à l’IFA 2026. La synergie entre les deux entreprises est évidente.
La question n’est plus de savoir si l’IA agentique locale va devenir mainstream, mais quand. Les obstacles restants sont clairs : la bande passante mémoire des machines individuelles (273 Go/s pour le GB10, contre plusieurs To/s pour les GPU de数据中心), la capacité à exécuter des modèles de plus de 100 milliards de paramètres de manière fluide, et la gestion des configurations multi-nœuds. Mais chaque mois, ces obstacles reculent. Le dual-Spark fait tourner du 405B, certes avec des performances moyennes, mais il le fait. Les optimisations logicielles progressent plus vite que le matériel.
En attendant, le Portable Computer est un produit remarquable qui mérite l’attention. Il ne révolutionne pas le secteur du jour au lendemain, comme le titre de certains articles le suggère, mais il pose une pierre essentielle : celle de la simplicité. Si Perplexity étend le support aux modèles MoE comme Nemotron 3.5 Lightning, et si le support Windows arrive comme promis en septembre, le produit pourrait bien devenir le couteau suisse de l’agent IA local. Le cloud n’est pas mort, mais il vient de perdre un allié de poids : l’excuse de la complexité.
Sources
- Perplexity partners with Nvidia to launch Portable Computer, a fully local AI agent with zero token costs — VentureBeat
- Portable Computer est le nouvel agent d’IA locale de Perplexity — ZDNET
- NVIDIA And Perplexity Launch Portable Computer — HotHardware
- Perplexity’s Portable Computer launched — MSN
- Qwen3.8-27B on DGX Spark — 48 tok/s — OpenZeka
- Agent Serving on 2× DGX Spark with DeepSeek V4 Flash 0731 — NVIDIA Forums
- 1x Spark: DeepSeek-V4-Flash-0731 @ 1,000 tok/s prefill — NVIDIA Forums
- Dual NVIDIA DGX Sparks Run 405B AI But Trails Cloud Processing — Geeky Gadgets
- IFA 2026: NVIDIA is making your home into a connected experience with PAIR, RTX Spark and one-click AI agents — Digit
- NVIDIA Brings Simplified Local AI Support To NVIDIA GPUs Carrying 24+ GB VRAM — WCCFTech
- Speculative decoding in uzu — TryMirai
- Qwen3.8-Flash-Next MTP Is Here: 1.67x Speedup — Banandre
- DeepSeek-V4-Flash-0731-DSpark-1M-NVFP4-KV-2x-DGX-Spark — NVIDIA Forums
- DGX Spark vs RTX 5090 for AI and ML Coding: A Practical 2026 Comparison — Lalatendu Blog
Article recherché et rédigé automatiquement · Magazine Electrosens