Electrosens R&D
Electrosens Magazine LLM Opensource · 17 September 2026

Nemotron-Labs-Diffusion : le tri-mode de NVIDIA qui bouscule l’inférence open source — entre prouesse technique et preuves encore préliminaires

Le 19 mai 2026, NVIDIA met en ligne sur Hugging Face les poids de Nemotron-Labs-Diffusion, une famille de modèles de langage capables de basculer entre trois modes de génération — autorégressif, diffusion et auto-spéculation — sans changer de poids. Le preprint arXiv, déposé le 7 juillet 2026, décrit un modèle qui décode 6× plus de tokens par forward pass que Qwen3-8B avec une précision comparable, et 4× plus de débit sur le benchmark SPEED-Bench. De quoi faire beaucoup de bruit dans un écosystème open source en pleine ébullition, marqué par les sorties de GLM-5.3, DeepSeek V4 ou encore Hy4. Mais à y regarder de près, les preuves restent préliminaires : aucun benchmark standard (MMLU, HumanEval, GSM8K) n’est fourni, les mesures sont réalisées sur un GPU propriétaire GB200 avec le moteur SGLang, et la licence, bien que commerciale, laisse des zones d’ombre sur les données d’entraînement. Entre avancée réelle et effet d’annonce, ce décryptage plonge dans l’architecture, les performances annoncées et les zones d’ombre d’un modèle qui pourrait — ou non — redéfinir l’inférence des LLM.


Introduction : Nemotron-Labs-Diffusion, une famille de modèles tri-mode

NVIDIA n’en est pas à son coup d’essai avec les modèles de diffusion pour le texte. Après Diffusion-LM et MDLM, la firme avait déjà publié le 1er juillet 2026 Nemotron-Labs-TwoTower, un LLM à diffusion open-weight de 60 milliards de paramètres (dont 3 milliards actifs par token grâce au MoE), pré-entraîné sur 25 000 milliards de tokens. TwoTower générait des tokens en parallèle par débruitage itératif, avec un débit annoncé 2,42× supérieur à un baseline autorégressif et 98,7 % de la qualité conservée.

Mais dès le 19 mai 2026, NVIDIA a mis en ligne sur Hugging Face une nouvelle famille : Nemotron-Labs-Diffusion. Le preprint arXiv 2607.05722, déposé le 7 juillet 2026, décrit une architecture unifiée qui peut basculer entre trois modes de génération sans recharger les poids. Contrairement à TwoTower, il ne s’agit pas d’un modèle MoE dédié à la diffusion, mais d’une architecture entraînée de zéro avec un objectif conjoint autorégressif (AR) et diffusion masquée.

La famille comprend des variantes de 3B, 8B et 14B paramètres, incluant des versions base, instruct et vision-langage. La variante 8B instruct est celle mise en avant dans les communications. Les poids sont disponibles sur Hugging Face sous la NVIDIA Open Model License, une licence commerciale, et le code source est ouvert sur GitHub. Le dépôt GitHub confirme la date de publication publique : 19 mai 2026 pour les modèles 3B/8B/14B base, instruct et vision-langage.

Ce changement d’échelle (8B au lieu de 60B) est crucial : il rend le modèle potentiellement accessible sur du matériel grand public, mais soulève aussi des questions sur la continuité avec TwoTower. Les sources disponibles indiquent qu’il s’agit d’une architecture distincte, entraînée de zéro avec un objectif conjoint AR-diffusion. L’annonce initiale remonte d’ailleurs au 20 mai 2026, comme en témoigne l’article de MarkTechPost, avant la mise en ligne du preprint sur arXiv en juillet.


Architecture en trois temps : autorégressif, diffusion et auto-spéculation

Le cœur de l’innovation réside dans l’entraînement conjoint sur deux objectifs, permettant au modèle de fonctionner en trois modes à l’inférence :

Accélération de l’inférence par méthodeNemotron-Labs-DiffusioTwoTower (diffusion pu2.42×MedusaLookahead1.5×DSpark (DeepSeek)1.85×
  • Mode autorégressif (AR) : génération séquentielle classique avec masque causal, identique à un LLM standard. Ce mode est adapté aux déploiements cloud à forte concurrence.
  • Mode diffusion pure : départ d’un bloc de tokens masqués, raffinement parallèle par étapes itératives avec attention bidirectionnelle. La séquence est partitionnée en blocs contigus ; au sein de chaque bloc, les tokens s’observent bidirectionnellement, tandis qu’entre les blocs l’attention reste causale, permettant de réutiliser le cache KV des blocs précédents. Un sampler entraîné prédit, pour chaque position masquée, si la prédiction top-1 du modèle à l’étape de débruitage courante est correcte ; les positions prédites comme correctes sont validées à cette étape, ce qui permet de valider plusieurs tokens par forward pass.
  • Mode hybride (self-speculation) : le modèle génère des candidats en mode diffusion, puis les valide en mode AR, agissant ainsi comme son propre draft model, sans modèle draft auxiliaire ni tête de prédiction séparée.

L’article de TechTimes précise que « les modèles de diffusion ont historiquement nécessité beaucoup plus de données d’entraînement pour égaler la qualité des modèles AR », mais que Google DeepMind a démontré une parité de qualité commerciale avec Gemini Diffusion dès mai 2025. NVIDIA s’inscrit dans cette lignée.

Le mode hybride, appelé self-speculation, fonctionne en deux temps :

  1. Le mode diffusion génère rapidement un bloc de tokens candidats (parallélisme).
  2. Le mode AR valide ces tokens un par un, en acceptant ou rejetant chaque candidat selon la probabilité jointe.

Cette approche élimine le besoin d’un modèle draft séparé, réduisant l’empreinte mémoire et simplifiant le déploiement. Selon le preprint, le taux d’acceptation de la self-speculation dépasse celui des méthodes de prédiction multi-tokens (MTP) et améliore l’efficacité réelle sur matériel. Une analyse « speed-of-light » suggère en outre un potentiel à long terme de la diffusion : jusqu’à 76,5 % de tokens supplémentaires par forward pass par rapport à la self-speculation avec un sampler optimal.

Le dépôt GitHub ajoute un détail intéressant : le mode linear_spec (self-spéculation linéaire) peut être utilisé avec une variante LoRA — un adaptateur de draft optionnel (--lora) qui permet d’attacher un adaptateur de draft au modèle. Cela suggère que NVIDIA explore déjà des variantes plus légères pour le drafting, même si le mode de base ne nécessite pas de modèle draft séparé.


Auto-drafting interne : le vrai gain de vitesse ou un effet d’annonce ?

Le principal argument de vente de Nemotron-Labs-Diffusion est l’auto-drafting. Les chiffres avancés par NVIDIA pour la variante 8B instruct sont les suivants :

  • 5,9× plus de tokens par forward pass qu’un modèle AR comparable (arrondi à 6× dans les communications, comme le titre de l’article TechTimes du 9 juillet 2026 : « NVIDIA’s New LLM Decodes 6x More Tokens Without an Auxiliary Draft Model »). La page de recherche NVIDIA indique « 5.9× more tokens per forward » avec « better accuracy », tandis que l’abstract arXiv parle de « 6× » avec « comparable accuracy » — une légère divergence qui mérite d’être notée.
  • 4× le débit (throughput) sur le benchmark SPEED-Bench de NVIDIA, en mode self-speculation, déployé avec le framework d’inférence SGLang sur un GPU GB200.

Ces résultats proviennent d’un préprint non encore peer-reviewé et non reproduit sur d’autres matériels. Pour mettre ces chiffres en perspective, comparons avec les méthodes de speculative decoding externes :

Méthode Type Accélération rapportée Qualité
Nemotron-Labs-Diffusion 8B (self-spec) Modèle unique 4× throughput (GB200 + SGLang) Comparable à Qwen3-8B (selon NVIDIA)
TwoTower (diffusion pure) Modèle dédié 2,42× vs AR 98,7 %
Medusa Têtes de draft additionnelles ~2× (variable) ~100 %
Lookahead Décodeur parallèle ~1,5× ~100 %
DSpark (DeepSeek) Draft model séparé 85 % plus rapide (V4) Delta BLEU < 0,3 %

Sources : TechTimes pour Nemotron-Labs-Diffusion, AI Weekly pour TwoTower, DeepSeek pour DSpark.

Le gain de 4× de Nemotron-Labs-Diffusion est mesuré sur un matériel propriétaire (GB200) avec SGLang, un moteur d’inférence qui, selon un benchmark récent, atteint 16 215 tok/s sur H100 avec Llama 3.1 8B aimultiple.com. Il est donc possible qu’une partie de l’accélération vienne de l’optimisation du moteur plutôt que de l’architecture elle-même. Sans benchmarks sur d’autres GPU (H100, A100, RTX), il est difficile d’isoler l’apport réel du modèle.

Un autre point d’interrogation : la perte de qualité sur les tâches de code et de mathématiques. Pour TwoTower, le score HumanEval passait de 79,27 à 75,58, et GSM8K de 92,49 à 90,14. Aucun chiffre n’est fourni pour Nemotron-Labs-Diffusion 8B, mais le preprint affirme une précision comparable à Qwen3-8B, sans donner de scores précis. L’abstract arXiv mentionne que le modèle « décode 6× plus de tokens par forward que Qwen3-8B avec une précision comparable », et la page de recherche NVIDIA précise « avec une meilleure précision » — une légère divergence qui mérite d’être notée.


Benchmarks sous tension : que valent vraiment les scores annoncés ?

Le tableau des performances disponibles est pour le moins lacunaire :

Source : ai-master.dev
Modèle HumanEval GSM8K MMLU Perplexité Throughput (tok/s)
Nemotron-Labs-Diffusion 8B Non communiqué Non communiqué Non communiqué Non communiqué 4× vs Qwen3-8B (GB200)
TwoTower (diffusion) 75,58 90,14 Non communiqué Non communiqué 2,42× vs AR
TwoTower (AR baseline) 79,27 92,49 Non communiqué Non communiqué
Qwen3-8B (AR) ~85 ~95 ~86 ~3,5 ~3 311 (H100, vLLM)
GLM-5.3 (753B MoE) Non communiqué Non communiqué Non communiqué Non communiqué Non communiqué
DeepSeek V4 (1,6T MoE) Non communiqué Non communiqué Non communiqué Non communiqué Non communiqué

Sources : TechTimes, AI Weekly, aimultiple.com pour Qwen3-8B.

On constate que Nemotron-Labs-Diffusion 8B n’a tout simplement pas de benchmarks standard (MMLU, HumanEval, GSM8K) dans les sources disponibles. Le seul chiffre est le gain de throughput, qui dépend fortement du matériel et du moteur d’inférence. En l’état, il est impossible de comparer la qualité du modèle à Qwen3-8B, GLM-5.3 ou DeepSeek V4.

DeepSeek DSpark, par exemple, revendique une accélération de 85 % sur V4 sans perte de qualité (delta BLEU < 0,3 %), avec des checkpoints pré-entraînés fournis pour Qwen3 et Gemma 4, et une compatibilité avec vLLM et SGLang. Si Nemotron-Labs-Diffusion veut rivaliser, il devra démontrer des performances au moins équivalentes sur des benchmarks standardisés.


De la GB200 à la RTX 4090 : le casse-tête du déploiement local

Un des attraits de l’open-weight est la possibilité de faire tourner le modèle localement. Avec 8 milliards de paramètres (variante instruct), Nemotron-Labs-Diffusion est bien plus léger que TwoTower (60B). Une estimation prudente :

  • Inférence en FP16 : ~16 Go de VRAM (8B × 2 octets).
  • Avec quantification 4 bits : ~4 Go.
  • Sur une RTX 4090 (24 Go VRAM) : possible en FP16, avec un débit estimé comparable à Qwen3-8B (~3 311 tok/s sur H100 avec vLLM, mais moins sur RTX).
  • Sur une RTX 5090 (32 Go) : confortable, même en FP16.

Cependant, le mode self-speculation nécessite de pouvoir exécuter les deux passes (diffusion et AR) séquentiellement, ce qui peut augmenter la latence perçue. Les benchmarks de NVIDIA ont été réalisés sur GB200 avec SGLang, un moteur d’inférence optimisé pour les GPU haute performance. Sur du matériel grand public, les gains pourraient être moindres.

Le dépôt GitHub mentionne également le support de SGLang sur DGX Spark, la station de travail IA de NVIDIA. Cela indique que NVIDIA cible d’abord les déploiements professionnels sur ses propres plateformes, avant le grand public.

À titre de comparaison, le choix du moteur d’inférence reste déterminant. Comme le rappelle un comparatif de Spheron publié en août 2026, vLLM, TensorRT-LLM et SGLang se distinguent par des compromis différents entre débit, latence et mémoire — et le routage MoE natif de vLLM 0.26, sorti cette année, a considérablement amélioré l’efficacité des modèles hybrides comme Llama 4 ou DeepSeek V4. Nemotron-Labs-Diffusion, avec son mode self-speculation, pourrait bénéficier de ces avancées, mais les benchmarks manquent encore pour le confirmer sur d’autres moteurs.


L’écosystème en septembre 2026 : une concurrence féroce sur tous les fronts

Nemotron-Labs-Diffusion arrive dans un paysage open source particulièrement dense. Depuis le printemps 2026, plusieurs acteurs majeurs ont redéfini les attentes :

Source : noqta.tn
  • DeepSeek V4 (24 avril 2026) : 1,6 trillion de paramètres dont 49 milliards actifs, score Codeforces de 3206 et SWE-bench à 81 %. Passé en production le 12 août 2026 avec des capacités agentiques renforcées, il a déclenché une guerre des prix, avec une entrée à 0,14 $/M tokens. Son architecture MoE + sparse attention en fait une référence pour l’inférence à grande échelle.
  • GLM-5.3 de Z.ai (14 août 2026) : 753 milliards de paramètres MoE, réutilisant la base de GLM-5.2 sans nouveau paramètre, mais avec un post-entraînement qui propulse Terminal-Bench 3.0 de 4,6 % à 28,3 %. Il domine le benchmark cybersécurité CyberGym avec 84,5 %, devant Claude Sonnet 5 et GPT-5.6 Sol. Ses poids sont différés, mais le modèle est accessible via API et Coding Plan.
  • Hy4 de Tencent (28 août 2026) : 770 milliards de paramètres avec 49 milliards actifs, contexte de 1 million de tokens, orienté code, productivité bureautique et recherche scientifique. Open source dès sa sortie.
  • Muse Glimmer de Meta (14 août 2026) : 30 milliards de paramètres, Apache 2.0, conçu pour l’exécution locale et le raisonnement multimodal agentique.
  • Solar Open 2 d’Upstage (23 juillet 2026) : 250 milliards de paramètres MoE, 15 milliards actifs, contexte d’un million de tokens, spécifiquement optimisé pour les tâches d’agents IA.

Dans ce contexte, Nemotron-Labs-Diffusion se distingue par son approche radicalement différente : plutôt que d’augmenter la taille ou le contexte, NVIDIA attaque le problème de l’efficacité d’inférence à basse concurrence — le régime typique des boucles agentiques et de l’inférence en périphérie. C’est un angle complémentaire, mais qui devra faire ses preuves face à des modèles déjà bien établis.


Verdict : une avancée prometteuse, mais des preuves à consolider

Nemotron-Labs-Diffusion est indéniablement une contribution intéressante à l’écosystème open source. L’idée d’un modèle unique capable de basculer entre trois modes de génération est élégante, et l’élimination du draft model séparé simplifie considérablement le déploiement du speculative decoding. Les gains annoncés — 6× de tokens par forward pass, 4× de throughput — sont spectaculaires, mais reposent sur des mesures préliminaires, réalisées sur un GPU propriétaire avec un moteur d’inférence spécifique.

Trois réserves majeures subsistent :

  1. Absence de benchmarks standard : aucun score MMLU, HumanEval ou GSM8K n’est fourni. Il est impossible de vérifier la qualité réelle du modèle par rapport à Qwen3-8B, GLM-5.3 ou DeepSeek V4.
  2. Reproductibilité limitée : les mesures sont faites sur GB200 avec SGLang. Sur du matériel grand public (RTX 4090, H100), les gains pourraient être nettement inférieurs.
  3. Licence et transparence : la NVIDIA Open Model License permet un usage commercial, mais les données d’entraînement restent opaques, et le modèle n’a pas été soumis à un audit indépendant.

En l’état, Nemotron-Labs-Diffusion est une preuve de concept prometteuse plutôt qu’une révolution confirmée. Si les résultats se reproduisent sur d’autres matériels et moteurs, et si les benchmarks standard sont publiés, ce modèle pourrait bien redéfinir l’inférence des LLM à basse concurrence. En attendant, la prudence reste de mise — comme toujours dans un écosystème où les effets d’annonce sont fréquents.


Sources

Source : youtube.com
Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *