Magazine LLM Opensource · 8 September 2026Tencent Hy4 Preview : le géant 770B open source qui redessine la carte de l’IA
Le 28 août 2026, Tencent a publié les poids de Hy4 Preview, un modèle de 770 milliards de paramètres avec une fenêtre de contexte dépassant le million de tokens. Pour la première fois, un acteur de cette envergure met à disposition de la communauté open source un modèle taillé pour la production, et pas seulement pour la démonstration. Décryptage de ce que ce géant change concrètement pour les praticiens — et de ce qui reste encore flou.
Le 28 août 2026, Tencent a ouvert les vannes d’un géant
L’annonce est tombée un vendredi, comme souvent dans le monde de l’IA. Le 28 août 2026, Tencent a publié Hy4 Preview, un modèle de langage de 770 milliards de paramètres totaux, avec une fenêtre de contexte supérieure à un million de tokens. La nouvelle a été relayée quasi simultanément par TechGenyz, Technode et GadgetPilipinas, avant que Forbes ne lui consacre un article le 31 août. Mais au-delà de la couverture médiatique, c’est la nature de la publication qui a fait l’effet d’un séisme : il ne s’agit pas d’une simple annonce marketing, mais d’une mise à disposition effective des poids du modèle.
Pour les praticiens, la différence est fondamentale. Depuis deux ans, les très gros modèles chinois — DeepSeek, Qwen, GLM — ont habitué la communauté à des publications open weight de plus en plus massives. Mais 770 milliards de paramètres, c’est un cran au-dessus. C’est le plus gros modèle open source jamais publié par un acteur de cette taille, et il arrive avec un positionnement clair : un outil de productivité pour les tâches quotidiennes, issu de la série Hunyuan, entraîné sur des données de spécialistes en ingénierie logicielle, gaming, finance et sécurité.
La communauté a réagi avec un mélange d’enthousiasme et de prudence. Enthousiasme, parce que l’échelle ouvre des possibilités inédites : du raisonnement long-contexte, de l’analyse de code à grande échelle, de l’agentique sérieuse. Prudence, parce que les benchmarks annoncés par Tencent sont pour l’instant des auto-évaluations, et que personne n’a encore validé les performances de manière indépendante. Le précédent GLM-5.3, sorti le 14 août 2026 par Z.ai, avait montré qu’un post-entraînement soigné pouvait transformer un modèle sans changer un seul paramètre — mais aussi que les chiffres officiels méritaient d’être vérifiés sur le terrain.
Ce qui est certain, c’est que Tencent ne fait pas dans la demi-mesure. Hy4 Preview n’est pas un modèle de démonstration : il est d’ores et déjà disponible sur plusieurs plateformes, de Yuanbao (le ChatGPT chinois de Tencent) à OpenRouter pour l’international, en passant par WorkBuddy, CodeBuddy et ima. Et l’entreprise affirme avoir utilisé le modèle pour optimiser son propre développement, avec un gain de débit de bout en bout de 31,8 %. Un chiffre à prendre avec précaution, mais qui témoigne d’une ambition : faire de Hy4 un outil de travail, pas un trophée.
770B de paramètres, 49B actifs : anatomie d’un MoE hors norme
Les spécifications techniques de Hy4 Preview, telles que relayées par les médias, dessinent un modèle à la démesure de son créateur. C’est un Mixture-of-Experts (MoE) de 770 milliards de paramètres totaux, dont seulement 49 milliards sont actifs par token. L’architecture, selon TechGenyz, compterait 78 couches, 256 experts routés et un expert partagé. Ces chiffres, issus d’une seule source tierce, n’ont pas encore été corroborés par une fiche technique officielle de Tencent — une lacune que les praticiens devront garder en tête.
Le ratio entre paramètres totaux et actifs est intéressant : 770B pour 49B actifs, soit un facteur d’environ 15,7. C’est dans la lignée des grands MoE récents, qui cherchent à maximiser la capacité tout en maîtrisant le coût d’inférence. Pour comparaison, GLM-5.3 de Z.ai repose sur une base MoE de 743 milliards de paramètres, et DeepSeek V4 Pro, sorti le 12 août 2026, propose également une architecture à experts. La tendance est claire : les très gros modèles ouverts sont désormais tous des MoE, car c’est la seule façon de concilier capacité et coût d’inférence raisonnable.
La fenêtre de contexte de plus d’un million de tokens est l’autre caractéristique marquante. Atteindre une telle longueur nécessite des techniques d’attention efficaces — RoPE (rotary position embeddings), attention sparse, sliding window — mais Tencent n’a pas divulgué sa recette exacte. Les sources disponibles ne mentionnent ni la topologie de l’attention, ni le volume de données d’entraînement, ni le budget de calcul. C’est un angle mort significatif : pour les praticiens qui voudront fine-tuner ou adapter le modèle, la connaissance de ces détails est cruciale.
Un point mérite d’être souligné : Tencent affirme que Hy4 Preview a été utilisé pour optimiser son propre développement, avec une amélioration de 31,8 % du débit de bout en bout. C’est une forme d’auto-amélioration qui rappelle les boucles de RL post-training évoquées au Ray Summit 2026, où l’infrastructure open source converge vers des cycles d’entraînement de plus en plus automatisés. Mais là encore, il s’agit d’une déclaration de Tencent, non vérifiée indépendamment.
| Modèle | Paramètres totaux | Paramètres actifs | Contexte | Date de sortie | Licence |
|---|---|---|---|---|---|
| Hy4 Preview (Tencent) | 770B | 49B | 1M+ tokens | 28 août 2026 | Non précisée |
| GLM-5.3 (Z.ai) | 743B (base MoE) | Non précisé | 1M tokens | 14 août 2026 | Poids différés |
| DeepSeek V4 Pro | Non précisé | Non précisé | 1M tokens | 12 août 2026 | Open source |
| Qwen3-8-Max (Alibaba) | Non précisé | Non précisé | Non précisé | Non précisé | Non précisée |
| Kimi K3 (Moonshot) | Non précisé | Non précisé | Non précisé | Non précisé | Non précisée |
Benchmarks : ce que l’on sait (et ce que l’on ignore)
Le point le plus délicat de cette sortie concerne les performances. Tencent a communiqué un score d’évaluation interne : sur 163 experts et 203 tâches d’ingénierie, Hy4 Preview obtiendrait une moyenne de 2,99 sur 4,00, devant GLM-5.3 (2,92) et Kimi K3 (2,94). Ces chiffres, rapportés par GadgetPilipinas, sont présentés comme issus d’une évaluation en aveugle. Mais ils restent une auto-évaluation, sans méthodologie détaillée ni validation indépendante.
Plus préoccupant : aucun score sur les benchmarks standards n’a été publié. Pas de MMLU, pas de GPQA, pas de HumanEval, pas d’AIME, pas de MATH. C’est un contraste frappant avec les sorties récentes de la concurrence. GLM-5.3, par exemple, a été accompagné de chiffres précis sur Terminal-Bench 3.0 (28,3 % après post-entraînement, contre 4,6 % avant) et sur CyberGym (84,5 %). DeepSeek V4 Pro a fait l’objet de tests indépendants sur OpenRouter. Pour Hy4, rien de tout cela.
Cette absence de benchmarks standardisés est problématique à plusieurs titres. D’abord, elle rend la comparaison avec les autres modèles difficile, voire impossible. Ensuite, elle alimente le scepticisme : un modèle de cette taille, annoncé avec un tel battage, devrait pouvoir produire des chiffres sur les évaluations classiques. Le fait que Tencent choisisse une évaluation interne, centrée sur des tâches d’ingénierie, suggère que le modèle a été optimisé pour des usages spécifiques — probablement le code et les agents — plutôt que pour exceller partout.
Il faut aussi noter que l’évaluation interne de Tencent ne couvre que des tâches d’ingénierie. C’est un choix assumé, cohérent avec le positionnement "productivité" du modèle. Mais pour les praticiens, cela signifie qu’il faudra tester Hy4 sur ses propres cas d’usage avant de se faire une opinion. Les plateformes comme OpenRouter, où le modèle est disponible, permettront de le faire rapidement. En attendant, la prudence est de mise : les chiffres de Tencent sont des promesses, pas des preuves.
VRAM, coûts, latence : le vrai prix d’un 770B
Venons-en au sujet que tout le monde redoute : le coût. Un modèle de 770 milliards de paramètres, c’est d’abord une question de mémoire. En BF16, les poids seuls représentent environ 1,54 téraoctets (770 milliards × 2 octets). En FP8, on descend à environ 770 gigaoctets. Ces ordres de grandeur, issus d’un calcul simple, donnent une idée de la difficulté : il faut au minimum une dizaine de GPU H100 80 Go pour charger les poids en FP8, et le double en BF16. Avec le contexte d’un million de tokens, le cache d’attention (KV cache) vient s’ajouter, et il peut facilement doubler ou tripler les besoins en mémoire.

Pour l’inférence, le coût par token dépend de nombreux facteurs : le nombre de GPU, l’interconnexion (NVLink, InfiniBand), la quantification, le framework. Tencent n’a publié aucun chiffre sur les coûts d’inférence de Hy4, ni sur les configurations matérielles recommandées. C’est une lacune majeure, d’autant que la concurrence communique de plus en plus sur ce terrain. DeepSeek V4 Pro, par exemple, est positionné à un prix très agressif sur OpenRouter, dans le cadre de la guerre des prix que se livrent les laboratoires chinois. GLM-5.3 est proposé au même tarif que la version précédente, un signal fort sur la volonté de Z.ai de démocratiser l’accès.
Pour les praticiens, le calcul est simple : un modèle de cette taille ne se déploie pas sur un poste de travail. Il faut un cluster, avec une interconnexion rapide, et une expertise en déploiement distribué. Le coût d’inférence par token sera probablement plus élevé que celui de modèles plus petits comme Qwen3-8-Max, mais le ratio paramètres actifs/paramètres totaux (49B/770B) joue en faveur de Hy4 : seuls 49 milliards de paramètres sont activés à chaque token, ce qui réduit la charge de calcul par rapport à un modèle dense de même taille.
Le fine-tuning, lui, est un tout autre défi. Adapter un modèle de 770B nécessite des ressources considérables, même avec des techniques comme LoRA ou QLoRA. Les praticiens devront probablement se tourner vers des approches de distillation : entraîner un modèle plus petit à reproduire les comportements de Hy4, plutôt que de fine-tuner le géant lui-même. C’est une piste que Tencent n’a pas explicitement encouragée, mais qui semble inévitable pour la plupart des équipes.
Rendre Hy4 exploitable : quantification et déploiement distribué
La question pratique est donc : comment faire tourner Hy4 en production ? Les techniques existent, mais elles demandent une certaine maîtrise. La quantification est la première étape. Le FP8 est devenu le standard de fait pour les très gros modèles, car il divise par deux les besoins en mémoire par rapport au BF16, avec une perte de qualité minime. Pour aller plus loin, l’INT4 est possible, mais avec des précautions : les études récentes montrent que l’AWQ (Activation-aware Weight Quantization) réduit la pénalité de perplexité de 74 % par rapport à GPTQ en INT4 (de 4,57 à 1,17). Un chiffre à garder en tête pour ceux qui voudraient pousser la compression.
Le déploiement distribué est l’autre brique essentielle. Pour un MoE de cette taille, plusieurs stratégies se combinent : le tensor parallelism (répartir les matrices de poids entre GPU), le pipeline parallelism (découper le modèle en couches), et surtout l’expert parallelism, qui est naturel pour les architectures à experts : chaque GPU héberge un sous-ensemble d’experts, et le routeur achemine les tokens vers les experts concernés. C’est cette dernière technique qui permet de tirer parti du ratio 49B/770B : seuls les experts actifs sont chargés en mémoire à chaque étape.
Les frameworks d’inférence ont beaucoup évolué. vLLM, SGLang et TensorRT-LLM sont les trois principaux candidats, chacun avec ses forces. vLLM est le plus simple à prendre en main et le plus largement adopté ; SGLang excelle sur les scénarios à très long contexte grâce à son gestionnaire de cache radix ; TensorRT-LLM, porté par NVIDIA, offre les meilleures performances sur les GPU récents, au prix d’une courbe d’apprentissage plus raide. Pour un modèle comme Hy4, le choix du framework dépendra de la configuration matérielle et des besoins en latence.
Une configuration réaliste pour faire tourner Hy4 en production ? De l’ordre d’une dizaine de GPU H100 80 Go en FP8 pour les poids seuls, davantage avec le contexte long. En BF16, il faut compter le double. L’interconnexion est cruciale : le NVLink pour les GPU au sein d’un même nœud, l’InfiniBand pour les communications entre nœuds. Sans cela, la latence explose et le modèle devient inutilisable. Les praticiens qui n’ont pas accès à de tels clusters devront se tourner vers les API cloud — Tencent Cloud TokenHub, OpenRouter — plutôt que vers un déploiement local.
De Yuanbao à OpenRouter : où tourne déjà Hy4 ?
La disponibilité de Hy4 Preview est un point fort de cette sortie. Tencent a déployé le modèle sur plusieurs fronts : WorkBuddy et CodeBuddy pour les usages professionnels, Yuanbao pour le grand public chinois, ima pour la recherche. Côté API, le modèle est accessible via Tencent Cloud TokenHub et OpenRouter, ce qui le rend disponible à l’international dès le premier jour. C’est une différence notable avec GLM-5.3, dont les poids ont été différés, ou avec certains modèles qui restent confinés à leur écosystème d’origine.

Pour les développeurs, cette disponibilité immédiate est un atout majeur. On peut tester Hy4 sur OpenRouter sans avoir à monter un cluster, comparer ses réponses avec d’autres modèles, et évaluer sa pertinence pour des cas d’usage spécifiques. Les intégrations existantes — notamment dans les outils de codage agentique — devraient suivre rapidement, comme on l’a vu avec DeepSeek Harness et son plugin Modellix.
Reste la question de la licence. Tencent n’a pas précisé les termes exacts de la licence open source de Hy4 Preview. Est-ce une licence permissive type Apache 2.0, comme Meta l’a fait pour Muse Glimmer ? Une licence avec des restrictions d’usage ? Ou une licence maison ? Les sources disponibles ne le disent pas. C’est un point critique pour les entreprises qui voudraient intégrer le modèle dans leurs produits : une licence restrictive pourrait limiter les usages commerciaux ou imposer des obligations de divulgation.
La course aux très gros modèles ouverts : une nouvelle donne géopolitique
Au-delà des aspects techniques, la sortie de Hy4 Preview s’inscrit dans une dynamique géopolitique claire. La Chine est en train de gagner la course à l’IA open source, et Tencent vient de marquer un point décisif. Avec DeepSeek, Qwen et GLM, les laboratoires chinois dominent déjà le classement des modèles ouverts : 15 des 20 premiers modèles du classement Artificial Analysis sont chinois, selon les données de 2025. Hy4 Preview ajoute une pièce majeure à ce dispositif.
Pour les praticiens occidentaux, cette domination a des implications concrètes. D’un côté, elle offre un accès à des modèles de très haute qualité, souvent meilleurs que les alternatives propriétaires américaines, et à des coûts bien inférieurs. De l’autre, elle soulève des questions de souveraineté numérique : dépendre de modèles chinois pour des applications critiques, c’est accepter une dépendance technologique qui peut être problématique d’un point de vue réglementaire ou stratégique. L’Europe, avec son AI Act entré en vigueur en 2026, commence à peine à structurer sa réponse.
Tencent, de son côté, joue un double jeu. En publiant Hy4 en open source, l’entreprise renforce son influence mondiale et s’impose comme un acteur incontournable de l’écosystème. Mais elle le fait avec un modèle taillé pour la productivité, pas pour la recherche fondamentale. C’est un choix stratégique : plutôt que de rivaliser sur les benchmarks académiques, Tencent vise les usages concrets — le code, la finance, la sécurité — où l’adoption est rapide et les revenus potentiels importants.
Et maintenant ? Ce que Hy4 change pour les praticiens
Alors, que faut-il retenir de cette sortie ? D’abord, que l’échelle open source a franchi un nouveau palier. Un modèle de 770 milliards de paramètres, avec un contexte d’un million de tokens, est désormais accessible à tous. C’est une opportunité inédite pour les équipes qui ont les moyens de l’exploiter : fine-tuning spécialisé, distillation vers des modèles plus petits, applications long-contexte qui étaient jusqu’ici réservées aux API propriétaires.

Mais c’est aussi un défi. Les coûts d’infrastructure sont considérables, l’expertise requise est rare, et les performances réelles restent à valider. Les praticiens devront faire preuve de méthode : tester Hy4 sur leurs cas d’usage, comparer avec les alternatives (GLM-5.3, DeepSeek V4 Pro, Qwen3-8-Max), et évaluer le retour sur investissement avant de se lancer.
Les prochains mois seront décisifs. Tencent promet des versions stables, et la communauté attend des évaluations indépendantes — sur des benchmarks comme Terminal-Bench, CyberGym ou les tests de l’Artificial Analysis. Si Hy4 Preview confirme ses promesses, il pourrait devenir un standard de fait pour les applications d’ingénierie et d’agentique. S’il déçoit, il rejoindra la liste des modèles surdimensionnés qui n’ont pas tenu leurs promesses. En attendant, une chose est sûre : la course aux très gros modèles ouverts ne fait que commencer, et Tencent vient de placer la barre très haut.
Sources
- Tencent Releases Open-Source Hy4 LLM Preview With 770B Parameters and 1M+ Token Context — GadgetPilipinas, septembre 2026
- Tencent Open-Sources Hy4 Preview with 770B Parameters and a 1M Token Context — Technode, 28 août 2026
- Hy4 Preview — TechGenyz, 28 août 2026
- Tencent Open-Sources Hy4, Its 770-Billion-Parameter Flagship Model — Forbes, 31 août 2026
- GLM-5.3 : Z.ai lâche son modèle open-weight au prix de la version précédente — Journal du Web, 19 août 2026
- DeepSeek Ships V4 Pro as Its Flagship Model Leaves Preview — Unite.ai, 12 août 2026
- LLM Inference Optimization: vLLM vs TensorRT-LLM vs SGLang Decision Framework — Spheron Blog, 19 août 2026
- Ray Summit 2026: RL Post-Training Forces Open-Source AI Infrastructure to Converge — TechTimes, 25 août 2026
- Why China Is Winning The Open Source AI Race — Yahoo Tech
- Open source LLMs hit Europe’s digital sovereignty roadmap — TechCrunch, 16 février 2025
Article recherché et rédigé automatiquement · Magazine Electrosens