Electrosens R&D
Electrosens NVIDIA DGX Spark · 7 September 2026

DGX Spark et LLM open-source en septembre 2026 : Laguna S 2.1, DeepSeek V4 Flash, fine-tuning et clusters passés au crible

Le 7 septembre 2026, l’écosystème des LLM open-weight pour desktop n’a jamais été aussi disputé. Poolside a placé la barre très haut avec Laguna S 2.1, un modèle de 118B paramètres (8,5B actifs) taillé pour le NVIDIA DGX Spark. Mais les premiers benchmarks terrain — désormais documentés par des laboratoires indépendants — révèlent des performances contrastées et des réglages précis qui changent tout. Pendant ce temps, Ant Ling‑3.0‑Flash 124B‑A5B est officiellement sorti le 23 juillet, DeepSeek V4 Flash 0731 tourne sur un seul Spark à près de 1 000 tokens/s en prefill, et NVIDIA publie la première preview de CUDA pour Windows Arm. Plongée dans ce tourbillon de nouveautés, chiffres réels à l’appui.


Poolside frappe fort : Laguna S 2.1, le premier grand open‑weight américain depuis 11 mois

Fondée en 2023 par Jason Warner (ex-CTO de GitHub) et Eiso Kant, Poolside s’est imposée comme un acteur clé du codage assisté par IA. Le 21 juillet 2026, la startup a libéré sur Hugging Face Laguna S 2.1, un modèle open‑weight de 118 milliards de paramètres (117,6 B exactement) avec une architecture mixture‑of‑experts (MoE) qui n’active que 8,5 milliards de paramètres par token. Les poids sont distribués sous licence OpenMDW‑1.1 de la Linux Foundation, une licence permissive autorisant usage commercial et modifications.

Ce lancement met fin à une disette de 11 mois pour les modèles open‑weight américains de cette taille : le dernier en date était le gpt‑oss‑120b d’OpenAI, sorti en août 2025. Poolside revendique une cible claire : l’inférence locale sur desktop, et en particulier sur le NVIDIA DGX Spark, ce mini‑PC équipé du superchip GB10 Grace Hopper (128 Go de mémoire unifiée, 1 000 TOPS, ~3 000 $). Avec seulement 8,5 B de paramètres actifs, Laguna S 2.1 promet de rivaliser avec des modèles dix fois plus gros tout en tenant sur une seule machine. C’est d’ailleurs la première fois qu’un modèle de codage dépassant 100B paramètres liste officiellement le DGX Spark comme matériel supporté. Comme le souligne TheNextWeb, Poolside positionne explicitement cette sortie comme une réponse à la domination des laboratoires chinois (DeepSeek, Qwen, Kimi) dans la catégorie open-weight, et comme une alternative self-hosted pour les entreprises et gouvernements occidentaux qui ne veulent pas envoyer leurs données à un fournisseur étranger.


Benchmarks officiels : Laguna S 2.1 domine les modèles ouverts, mais reste derrière les propriétaires

Les chiffres publiés par Poolside et relayés par AI‑Stat (23 juillet 2026) sont éloquents. Le tableau ci‑dessous compare Laguna S 2.1 à ses concurrents open‑weight et propriétaires sur les benchmarks de codage.

Terminal-Bench 2.1 scores by modelLaguna S 2.170.2%Laguna M.144.9%DeepSeek V4-Pro Max64.0%Thinking Machines Inkl63.8%MiniMax M366.0%Claude Sonnet 580.4%GPT-5.6 Luna Max82.5%
Modèle Taille (total‑actif) Terminal‑Bench 2.1 SWE‑bench Multilingual SWE‑Bench Pro
Laguna S 2.1 118B‑A8.5B 70,2 % 78,5 % 59,4 %
Laguna M.1 (avril 2026) 225B‑A23B 44,9 % 63,1 % 49,2 %
DeepSeek V4‑Pro Max 1.6T‑A49B 64,0 % 76,2 % 55,4 %
Thinking Machines Inkling 975B‑A41B 63,8 % 54,3 %
MiniMax M3 428B‑A23B 66,0 % 59,0 %
Claude Sonnet 5 (propriétaire) 80,4 % 63,2 %
GPT‑5.6 Luna Max (propriétaire) 82,5 %

Sources : AI‑Stat, Hugging Face, VentureBeat. Les scores des modèles propriétaires sont donnés à titre indicatif.

Laguna S 2.1 surpasse nettement son prédécesseur Laguna M.1 (225B‑A23B) et devance DeepSeek V4‑Pro Max et MiniMax M3 sur Terminal‑Bench 2.1. Sur SWE‑Bench Pro, il est au coude‑à‑coude avec MiniMax M3 (59,4 % contre 59,0 %). Cependant, les modèles propriétaires comme Claude Sonnet 5 et GPT‑5.6 Luna Max restent supérieurs de 10 à 12 points. Poolside le reconnaît d’ailleurs : le modèle « n’est pas encore à la frontière », selon les termes rapportés par VentureBeat.


Les autres poids lourds open‑weight du moment sur DGX Spark

Laguna S 2.1 n’est pas seul. Trois autres modèles méritent une attention particulière pour qui veut exploiter pleinement un DGX Spark.

Ant Ling‑3.0‑Flash 124B‑A5B : le nouveau champion du rapport qualité/taille

Sorti officiellement le 23 juillet 2026, Ant Ling‑3.0‑Flash est un modèle de 124 milliards de paramètres avec seulement 5 milliards d’actifs par token. Selon les premiers retours sur les forums développeurs NVIDIA, il battrait leur précédent modèle de 1T paramètres sur presque tous les benchmarks, tout en tenant sur une seule Spark. Son architecture repose sur une attention hybride linéaire native : des couches KDA et MLA empilées dans un ratio 5:1, ce qui explique son efficacité exceptionnelle en inférence.

DeepSeek V4 Flash 0731 : le monstre d’efficacité

La mise à jour DeepSeek V4 Flash 0731 (284B paramètres, 13B actifs) a fait couler beaucoup d’encre fin juillet. Un utilisateur des forums NVIDIA a réussi à la faire tourner sur un seul DGX Spark avec un backend CUDA maison, atteignant des chiffres impressionnants : environ 1 000 tokens/s en prefill et 59 tokens/s en serving multi‑agent (source). Une autre expérience sur 2× DGX Spark avec KV‑cache et scheduling a montré des résultats prometteurs pour des agents IA privés, comme le rapporte Flowtivity. En quantification Q8 (UD‑Q8_K_XL), le modèle pèse 162 Go, soit seulement 7 Go de plus qu’en Q4, pour une précision quasi sans perte (source forums).

Qwen3.6‑27B : le dense qui surprend

Sorti le 22 avril 2026, Qwen3.6‑27B d’Alibaba reste une valeur sûre pour l’inférence locale. Avec sa quantification NVFP4 publiée le 26 juin 2026, il atteint 28 à 33 tokens/s en session unique sur DGX Spark, mais explose à 136 tokens/s en mode multi‑agents (10 agents simultanés). Son score MMLU en NVFP4 est de 0,8446. La version Qwen3.8‑27B, testée le 20 août 2026, pousse la génération à 34‑38 tokens/s. Un choix pertinent pour ceux qui préfèrent un modèle dense, plus simple à fine‑tuner.


Mises à jour logicielles du DGX Spark : NVFP4, CUDA Windows Arm et compagnie

NVFP4 : le format 4 bits qui tient ses promesses

En juin 2026, NVIDIA a déployé une mise à jour logicielle majeure pour le DGX Spark, promettant un gain de performance de 2,6× grâce au format de quantification propriétaire NVFP4. Neuf mois après les premières annonces, les retours terrain confirment l’essentiel : le gain est réel, mais avec des nuances. Sur Qwen3.6‑27B, le passage en NVFP4 améliore nettement le débit sans dégradation significative de la qualité (MMLU à 0,8446). En revanche, certains modèles très sensibles à la quantification (notamment les gros MoE) peuvent voir leur taux d’acceptation chuter — un utilisateur des forums NVIDIA a dû modifier la configuration de DeepSeek V4 Flash 0731 pour retrouver un taux d’acceptation correct (source).

Source : youtube.com

CUDA 13.4 pour Windows Arm : la preview qui ouvre des portes

Le 22 juillet 2026, NVIDIA a publié la première version préliminaire de CUDA 13.4 pour Windows sur Arm, native à Arm64 (source). Cette preview permet aux développeurs de préparer des applications pour les futures puces RTX Spark destinées aux PC portables Windows. SEGA l’a déjà adoptée. C’est un signal fort : l’écosystème DGX Spark ne se limite plus à Linux, et les PC portables RTX Spark d’ASUS et MSI (annoncés pour cet automne) pourraient bénéficier de la même pile logicielle.

Le DGX Spark face à la concurrence

Le DGX Spark n’est plus seul sur le marché des mini‑PC IA. L’AMD Ryzen AI Halo (Ryzen AI Max+ 395) offre 128 Go de mémoire unifiée LPDDR5X (256 Go/s), 16 cœurs Zen 5, un GPU Radeon 8060S (40 CUs RDNA 3.5) et un NPU de 50 TOPS, le tout pour 3 999 $ avec 2 To de SSD. Sur un modèle 120B, il atteint 34 tokens/s en génération — comparable au DGX Spark. Mais le GB10 de NVIDIA conserve un avantage logiciel certain, avec une pile CUDA mature et un écosystème de modèles optimisés bien plus large. Les prochains mini‑PC d’Acer et Gigabyte, attendus début 2027, devraient être 500 à 1 000 $ moins chers que le DGX Spark, mais avec des performances probablement inférieures.


Fine‑tuning sur DGX Spark : LoRA, QLoRA, Unsloth et full fine‑tune en BF16

Le DGX Spark n’est pas qu’une machine d’inférence : c’est aussi une plateforme de fine‑tuning étonnamment capable, grâce à ses 128 Go de mémoire unifiée. Les workflows documentés sur DeepWiki montrent une nette évolution depuis les premiers mois.

LoRA et QLoRA : la voie royale

Pour la plupart des cas d’usage, LoRA et QLoRA restent les méthodes les plus efficaces sur une seule Spark. Avec QLoRA en 4 bits, on peut fine‑tuner des modèles jusqu’à 70B de paramètres sans dépasser la mémoire disponible. Les gains en vitesse sont substantiels : un fine‑tune LoRA sur Qwen3.6‑27B prend environ 2 heures sur une seule Spark, contre 8 heures en full fine‑tune.

Unsloth : l’accélérateur qui change tout

L’outil Unsloth s’est imposé comme le standard de facto pour le fine‑tuning sur DGX Spark. Il permet des gains de 2 à 3× par rapport aux pipelines PyTorch natifs, grâce à des kernels optimisés pour l’architecture sm121 du GB10. Plusieurs utilisateurs des forums NVIDIA rapportent des fine‑tunes LoRA sur DeepSeek V4 Flash 0731 en moins de 4 heures, avec une qualité de sortie comparable à celle d’un full fine‑tune.

Full fine‑tune en BF16 : possible mais exigeant

Le full fine‑tune en BF16 reste possible sur une seule Spark pour des modèles jusqu’à ~30B de paramètres. Au‑delà, il faut passer par des clusters. Les retours terrain indiquent qu’un full fine‑tune de Qwen3.6‑27B en BF16 consomme environ 90 Go de mémoire et prend 6 à 8 heures — un exploit pour une machine à 3 000 $. Pour les modèles plus gros, la recommandation est claire : utiliser LoRA ou passer à un cluster.


Clusters DGX Spark : quand un seul ne suffit plus

2× DGX Spark : le sweet spot pour les agents

L’expérience la plus documentée est celle de 2× DGX Spark avec DeepSeek V4 Flash 0731. Un utilisateur des forums NVIDIA a publié le 2 août 2026 une analyse détaillée du serving d’agents sur cette configuration (source). Les conclusions sont nuancées : le KV‑cache et le scheduling sont les facteurs limitants, et la mémoire unifiée (UMA) du GB10 impose des compromis. Mais avec les bons réglages, on atteint des débits tout à fait utilisables pour des agents IA privés en entreprise. Flowtivity confirme que cette configuration offre des performances « de niveau frontière » avec 13B paramètres actifs, soit 10× moins que Claude Opus.

Source : unsloth.ai

Au‑delà de 2 nœuds : de 200 à 700 milliards de paramètres

Les clusters de 4 à 8 DGX Spark permettent de faire tourner des modèles de 200 à 700 milliards de paramètres en full precision. NVIDIA a publié des recommandations officielles pour interconnecter les Spark via 10GbE (débit théorique de 1,25 Go/s), même si les premières annonces mentionnaient du 100 GbE. En pratique, le 10GbE suffit pour de l’inférence distribuée, mais devient un goulot d’étranglement pour le fine‑tuning distribué. Les utilisateurs avancés recommandent d’investir dans des switches 25GbE ou 40GbE pour les clusters de 4+ nœuds.

Le cas d’usage entreprise : souveraineté et coût

L’intérêt principal des clusters DGX Spark reste la souveraineté des données. Pour une entreprise qui ne veut pas envoyer son code propriétaire à OpenAI ou Anthropic, un cluster de 2 à 4 Spark (6 000 à 12 000 $) offre une alternative crédible aux API cloud, avec des performances suffisantes pour du codage assisté en interne. C’est exactement le positionnement que Poolside vise avec Laguna S 2.1, et que DeepSeek V4 Flash 0731 rend encore plus attractif.


Quel modèle choisir en septembre 2026 ?

Le tableau ci‑dessous résume les meilleurs choix selon les cas d’usage sur un DGX Spark unique.

Cas d’usage Modèle recommandé Pourquoi
Codage agentique (qualité max) Laguna S 2.1 (118B‑A8.5B) Meilleurs scores open‑weight sur Terminal‑Bench
Codage rapide / multi‑agents Ant Ling‑3.0‑Flash (124B‑A5B) 5B actifs, très rapide, bat son grand frère 1T
Agents privés en entreprise DeepSeek V4 Flash 0731 (284B‑A13B) 13B actifs, ~1000 tok/s prefill, excellent en serving
Inférence dense simple Qwen3.8‑27B 34‑38 tok/s, facile à fine‑tuner, NVFP4 dispo
Fine‑tuning LoRA rapide Qwen3.6‑27B 2h par LoRA, écosystème mature

Sources

Source : ai-stat.ru
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *