Magazine LLM Opensource · 15 September 2026Ox Alpha, le modèle fantôme qui hante OpenRouter : ce que l’on sait (et ce que l’on ignore) un mois après
Le 20 août 2026, un modèle de raisonnement inconnu fait son apparition sur OpenRouter. Gratuit pendant une semaine, il a impressionné les développeurs par ses performances en code et en raisonnement. Personne ne sait toujours pas qui l’a créé. Bienvenue dans l’ère des modèles fantômes.
20 août 2026 : un fantôme nommé Ox Alpha s’invite sur OpenRouter
Le jeudi 20 août 2026, les utilisateurs d’OpenRouter découvrent un nouvel identifiant dans la liste des modèles disponibles : stealth/ox-alpha. Un nom qui ne correspond à aucun laboratoire connu, aucune annonce officielle, aucune page Hugging Face. Le modèle est disponible gratuitement, avec une mention explicite : l’offre est valable jusqu’au 27 août 2026. Ensuite, mystère. Business Insider a confirmé l’apparition dès le 22 août, notant que les origines du modèle sont inconnues, même si certains soupçonnent un laboratoire chinois.
OpenRouter, qui se présente comme un simple routeur technique entre fournisseurs et utilisateurs d’IA, précise d’emblée qu’il n’est pas le développeur du modèle. Le fournisseur, lui, reste totalement anonyme. Pas de nom d’entreprise, pas de page de documentation, pas de contact. Juste une fiche technique et une promesse de gratuité temporaire. IT SOCIAL rapporte le 24 août que le fournisseur n’a pas révélé son identité, et que le modèle restera accessible gratuitement jusqu’au 27 août.
La nouvelle se répand rapidement dans la communauté des développeurs. Le compte officiel d’OpenCode, l’agent de codage open source, annonce la gratuité du modèle sur X (ex-Twitter). Plus surprenant encore, Patrick Collison, le CEO de Stripe, réagit publiquement et qualifie le modèle de « très impressionnant ». Quand le patron d’une des entreprises technologiques les plus influentes de la Silicon Valley prend la peine de commenter un modèle inconnu, la communauté s’électrise.
Le contraste est saisissant. D’un côté, un modèle qui affiche des spécifications techniques de très haut niveau : une fenêtre de contexte de 1 048 576 jetons (soit un million de tokens), une sortie maximale de 131 072 jetons, et une capacité de traitement revendiquée de 100 000 milliards de jetons par jour. De l’autre, un anonymat total : aucune information sur l’architecture, le nombre de paramètres, la tokenisation ou le format des poids. Le modèle est multimodal, capable de traiter texte, image et vidéo, mais personne ne sait qui l’a entraîné. OIA a publié le 24 août une analyse détaillée de ce qui est vérifié et de ce qui ne l’est pas, confirmant que la fiche technique d’OpenRouter est la seule source d’information fiable.
Les premiers tests informels, partagés sur X et sur les forums spécialisés, rapportent des performances impressionnantes en génération de code et en raisonnement. Des développeurs affirment que le modèle « tient la route » face à des modèles établis comme Claude ou GPT. Mais aucun benchmark public, aucun score sur HumanEval, MBPP ou GSM8K n’est publié. Les éloges reposent sur des impressions, pas sur des chiffres. Kingofgeek souligne le 23 août que le modèle est spécialisé dans le code et les agents autonomes, mais que son origine reste supposée.
La liste des fantômes : Sonoma, Hunter, Owl… et la Alpha qui s’ajoute
Ox Alpha n’est pas un cas isolé. C’est le cinquième modèle « furtif » publié sur OpenRouter en six mois. Un pattern se dessine, et il inquiète les observateurs.

Le premier de la série, Sonoma Alpha, est apparu au début de l’année 2026. Il a été attribué par la communauté à Xiaomi, via son laboratoire MiMo, sans confirmation officielle. Suit Hunter Alpha, un modèle qui a défrayé la chronique en mars 2026 : il aurait été entraîné sur un cluster de plus de 50 000 GPU chez CoreWeave, avec 1 000 milliards de paramètres et une fenêtre de contexte d’un million de tokens. Hunter Alpha a été testé par des développeurs via des outils comme OpenClaw, et il aurait traité 160 milliards de tokens. Lors d’un échange avec Reuters, le chatbot s’est auto-décrit comme « un modèle d’IA chinois principalement entraîné en chinois », avec une coupure de connaissances datant de mai 2025. Là encore, aucune confirmation officielle de Xiaomi.
Puis viennent Healer Alpha, toujours attribué à Xiaomi, et Owl Alpha, attribué à Meituan, le géant chinois de la livraison, à la fin du mois de juin 2026. Chaque fois, le même schéma : un modèle anonyme apparaît sur OpenRouter, disponible gratuitement pendant une période limitée, avec des spécifications techniques impressionnantes, et des rumeurs d’attribution à un laboratoire chinois. Chaque fois, aucune confirmation officielle.
Ce qui était un événement isolé devient un pattern. La répétition de ces apparitions anonymes soulève des questions : qui orchestre ces publications ? S’agit-il de tests de marché déguisés, de fuites volontaires, ou d’une stratégie de communication alternative ? Les laboratoires chinois, en particulier, semblent utiliser OpenRouter comme une vitrine technique sans avoir à s’engager publiquement. Un moyen de tester la réaction du marché et des développeurs sans assumer la paternité du modèle.
| Modèle | Date d’apparition | Attribution présumée | Confirmation officielle |
|---|---|---|---|
| Sonoma Alpha | Début 2026 | Xiaomi (MiMo) | Non |
| Hunter Alpha | Mars 2026 | Non identifié | Non |
| Healer Alpha | Printemps 2026 | Xiaomi (MiMo) | Non |
| Owl Alpha | Fin juin 2026 | Meituan | Non |
| Ox Alpha | 20 août 2026 | Zhipu AI (rumeur) | Non |
1 million de jetons, zéro nom : anatomie d’une fiche technique sans identité
La fiche technique d’Ox Alpha est un concentré de promesses et de vide. Côté spécifications, les chiffres sont vertigineux : une fenêtre de contexte de 1 048 576 jetons, soit un million de tokens, qui permet de traiter de très longs documents ou des sessions de code étendues. La sortie maximale est de 131 072 jetons, soit environ 200 pages de texte générées en une seule réponse. Le modèle est multimodal : il accepte du texte, des images et de la vidéo en entrée. Enfin, le fournisseur revendique une capacité de traitement de 100 000 milliards de jetons par jour, un chiffre qui laisse rêveur — ou sceptique.
Ces spécifications impliquent une infrastructure colossale. Une fenêtre de contexte d’un million de tokens nécessite des mécanismes d’attention extrêmement efficaces, et une capacité de traitement de 100 000 milliards de jetons par jour suppose un cluster de GPU de plusieurs dizaines de milliers d’unités, probablement une architecture Mixture of Experts (MoE) qui n’active qu’une fraction de ses paramètres pour chaque token. C’est le type d’infrastructure que seuls quelques laboratoires au monde peuvent se permettre : OpenAI, Google, Anthropic, et peut-être deux ou trois acteurs chinois. Comme le rappelle notre article sur l’infrastructure LLM-native en 2026, les clusters de plus de 50 000 GPU sont devenus la norme chez les hyperscalers, avec Kubernetes comme système d’exploitation de facto pour orchestrer ces ressources.
Mais là s’arrête l’information. La fiche ne fournit aucun détail sur l’architecture du modèle : est-ce un transformer classique ? Un MoE ? Combien de paramètres actifs et totaux ? Quel type de tokenisation (BPE, SentencePiece) ? Quel format de poids (safetensors, GGUF) ? Aucune de ces données n’est disponible. Le modèle est une boîte noire qui fonctionne via une API, sans dépôt Hugging Face vérifié, sans hash de commit, sans modèle card.
Cette absence d’information est en elle-même une information. Un modèle de cette taille nécessite des mois d’entraînement, des centaines de millions de dollars d’investissement, et une équipe d’ingénieurs. Il est impossible qu’il soit sorti de nulle part. Le fait que le fournisseur choisisse de rester anonyme est une décision délibérée, pas un accident.
| Spécification | Valeur revendiquée | Vérification |
|---|---|---|
| Fenêtre de contexte | 1 048 576 jetons | Confirmé par OpenRouter |
| Sortie maximale | 131 072 jetons | Confirmé par OpenRouter |
| Multimodal | Texte, image, vidéo | Confirmé par OpenRouter |
| Capacité de traitement | 100 000 milliards de jetons/jour | Non vérifié |
| Architecture | Non précisée | Absente |
| Nombre de paramètres | Non précisé | Absente |
| Tokenisation | Non précisée | Absente |
| Format des poids | Non précisé | Absente |
« Très impressionnant » : la ruée des développeurs face à l’absence de benchmarks
La réaction de la communauté est un paradoxe fascinant. D’un côté, des éloges enthousiastes : Patrick Collison, le CEO de Stripe, parle d’un modèle « très impressionnant ». De nombreux développeurs partagent sur X leurs expériences positives, affirmant que le modèle excelle en génération de code, en raisonnement et en résolution de problèmes complexes. De l’autre côté, aucun score public sur les benchmarks classiques : pas de HumanEval, pas de MBPP, pas de GSM8K, pas de MMLU. Les tests sont informels, non standardisés, et surtout non reproductibles.

Les développeurs contournent l’absence de chiffres en testant le modèle en conditions réelles. Ils lui soumettent des problèmes de code complexes, des tâches de raisonnement logique, des questions de mathématiques. Les résultats semblent impressionnants, mais ils ne sont pas comparables aux benchmarks officiels. Un test ad hoc peut être biaisé par le choix des questions, par le contexte de l’API, ou par la température de génération. Sans méthodologie standardisée, ces éloges restent des anecdotes.
Il y a aussi une question de reproductibilité. Les développeurs qui ont testé Ox Alpha via OpenRouter ont obtenu des résultats variables selon les sessions. Certains rapportent des performances exceptionnelles, d’autres des réponses incohérentes. Cette variabilité suggère que le modèle est peut-être un MoE avec un routage instable, ou qu’il est soumis à des limites de débit qui dégradent la qualité des réponses. Mais sans accès aux poids, impossible de vérifier.
Le paradoxe est le suivant : la communauté open source, qui a bâti sa réputation sur la transparence et la reproductibilité, se laisse séduire par un modèle qui n’offre ni l’un ni l’autre. Les éloges de Patrick Collison et d’OpenCode donnent une légitimité au modèle, mais cette légitimité repose sur des impressions, pas sur des preuves.
Piste chinoise : le tokenizer qui accuse Zhipu, Xiaomi et Meituan
L’hypothèse dominante, relayée par plusieurs médias spécialisés, attribue Ox Alpha à Zhipu AI (Z.ai), le laboratoire pékinois qui a récemment publié GLM-5.3, un modèle de 743 milliards de paramètres en architecture MoE, sorti le 14 août 2026. Les similitudes de tokenizer entre Ox Alpha et les modèles GLM ont été remarquées par des experts indépendants. Un tokenizer est une signature presque unique d’un laboratoire, car il reflète les choix d’entraînement, le vocabulaire, et les algorithmes de tokenisation. Si les empreintes correspondent, c’est un indice fort.
Mais ce n’est qu’un indice. Zhipu AI n’a pas confirmé ni démenti la paternité du modèle. Le laboratoire est actuellement concentré sur la promotion de GLM-5.3, qui se positionne sur le terrain du code et de la cybersécurité. Selon The Agent Report du 14 août, GLM-5.3 est une version qui n’ajoute aucun nouveau paramètre : il réutilise la base MoE de 743 milliards de paramètres de GLM-5.2, et améliore les performances par le seul post-entraînement. Les scores sont éloquents : 84,5% sur le benchmark CyberGym, 66,9 sur DeepSWE, et un bond spectaculaire sur Terminal-Bench 3.0, passé de 4,6% à 28,3% grâce au post-entraînement. Le modèle offre une fenêtre de contexte d’un million de tokens et une sortie de 128 000 tokens. Les similitudes techniques avec Ox Alpha sont frappantes : même fenêtre de contexte, même ordre de grandeur de sortie. Le rapprochement est naturel.
Il faut toutefois nuancer. GLM-5.3 n’est pas encore open-weight : les poids doivent être publiés plus tard, comme le précise DataNorth le 17 août. Cela n’empêche pas Z.ai de proposer un accès API, et il est techniquement possible qu’Ox Alpha soit un dérivé ou une variante de GLM-5.3, ou même un modèle distinct entraîné avec les mêmes outils de tokenisation. Les laboratoires chinois partagent souvent des briques technologiques, et les similitudes de tokenizer pourraient être le résultat d’un fine-tuning d’un modèle existant, ou d’un partage de code entre laboratoires.
Le précédent Hunter Alpha renforce cette piste. Lors de son échange avec Reuters, le modèle s’était auto-décrit comme « un modèle d’IA chinois principalement entraîné en chinois », ce qui suggérait une origine chinoise. Les attributions à Xiaomi et Meituan, bien que jamais confirmées, pointent toutes vers des laboratoires chinois. La Chine est devenue en 2026 le principal producteur de modèles open source : avant la publication de gpt-oss-120B par OpenAI en août 2025, 15 des 20 meilleurs modèles open source du classement Artificial Analysis étaient développés par des entreprises chinoises. Et la tendance s’est accentuée depuis : Qwen3.8-Max de 2,4 billions de paramètres, Kimi K3, DeepSeek V4 Pro, Hy4 de Tencent — tous ces modèles rivalisent avec les meilleurs propriétaires, comme nous l’analysions dans notre panorama de septembre 2026.
Mais l’absence de preuve définitive est gênante. Pas de dépôt Hugging Face vérifié, pas de hash de commit, pas de déclaration officielle. La rumeur Zhipu repose sur des similitudes de tokenizer, mais ces similitudes pourraient être le résultat d’un fine-tuning d’un modèle existant, ou d’un partage de code entre laboratoires. Sans accès aux poids, impossible de trancher.
Shadow AI : quand l’open source devient une boîte noire non maîtrisée
Le phénomène Ox Alpha s’inscrit dans un contexte plus large : la montée de la « Shadow AI », définie par l’éditeur de logiciels JFrog comme l’ensemble des actifs d’IA non maîtrisés dans une organisation. Cela inclut les appels d’API externes, les modèles open source téléchargés, et les outils d’IA que les employés utilisent sans validation du service informatique. Ox Alpha est un cas extrême : un modèle dont on ne connaît ni l’origine, ni l’architecture, ni les données d’entraînement, mais que des développeurs intègrent dans leurs workflows de production.

Les risques sont réels. Un modèle fantôme peut avoir été entraîné sur des données non filtrées, contenir des biais non documentés, ou être vulnérable à des attaques par injection de prompts. La sécurité des modèles open source est déjà un talon d’Achille, comme le montrent les récentes vulnérabilités découvertes dans des outils comme NemoClaw ou OpenClaw, où une faille réseau dans l’API Ollama permettait un empoisonnement persistant des modèles. Avec un modèle dont on ne connaît même pas l’origine, le niveau de risque est inconnu — ce qui est en soi un risque.
Les entreprises qui autorisent leurs développeurs à utiliser Ox Alpha via OpenRouter s’exposent à des problèmes de conformité, notamment avec l’AI Act européen, dont les règles de transparence sont entrées en application le 2 août 2026. Un modèle sans documentation, sans modèle card, sans information sur les données d’entraînement, est difficilement conforme aux exigences de transparence du règlement européen.
Un mois après : le mystère reste entier
Nous sommes le 11 septembre 2026. La gratuité d’Ox Alpha a pris fin le 27 août, comme prévu. Qu’est-il advenu du modèle ? Les sources disponibles ne permettent pas de le dire avec certitude. Certains utilisateurs rapportent que le modèle est toujours accessible sur OpenRouter, mais avec un tarif non communiqué. D’autres affirment qu’il a disparu aussi mystérieusement qu’il était apparu. Aucune annonce officielle, aucune confirmation, aucun démenti.
Pendant ce temps, l’écosystème a continué d’évoluer à un rythme effréné. Le 28 août, Tencent a publié Hy4 preview, un modèle open source de 770 milliards de paramètres avec 49 milliards de paramètres actifs et un contexte d’un million de tokens, conçu pour le codage, la productivité bureautique et la recherche scientifique. Le 8 septembre, la version complète a été mise à disposition. GLM-5.3 continue de dominer les classements open source, talonnant Kimi K3 au sommet. DeepSeek V4 Pro, avec son prix cassé de 0,14 $ par million de tokens en entrée, a relancé la guerre des prix. Et Meta a publié Muse Glimmer, un modèle agentique de 30 milliards de paramètres sous licence Apache 2.0, conçu pour fonctionner sur des appareils locaux.
Dans ce paysage en ébullition, Ox Alpha reste une anomalie. Un modèle qui a impressionné les développeurs, attiré l’attention du CEO de Stripe, et disparu sans laisser de traces. Peut-être était-ce un test de marché, une fuite volontaire, ou une démonstration de force d’un laboratoire qui préfère rester dans l’ombre. Peut-être réapparaîtra-t-il un jour, sous un autre nom, avec une autre fiche technique. En attendant, il a prouvé une chose : dans l’écosystème des LLM open source de 2026, on peut créer un modèle de classe mondiale, le distribuer gratuitement, et rester totalement anonyme. C’est à la fois fascinant et inquiétant.
Sources
- Business Insider — A mysterious free AI model is impressing developers. And nobody knows who made it. (22 août 2026)
- IT SOCIAL — Qui est derrière Ox Alpha, le modèle furtif d’OpenRouter ? (24 août 2026)
- OIA — Ox Alpha, le modèle IA « stealth » qui intrigue : ce qui est vérifié, ce qui ne l’est pas (24 août 2026)
- Kingofgeek — Ox Alpha, c’est quoi ? Tout savoir sur ce mystérieux modèle d’IA (23 août 2026)
- The Agent Report — GLM-5.3: Z.ai Tops the Open Coding Leaderboard on Post-Training Alone (14 août 2026)
- DataNorth — Z.ai releases GLM-5.3 for coding and cyber work (17 août 2026)
- SiliconANGLE — Z.ai debuts GLM-5.3 with long-horizon coding, cybersecurity upgrades (14 août 2026)
- Techgenyz — Hy4 preview: 770B Remarkable Open Model Launch (28 août 2026)
- Gadgetpilipinas — Tencent Releases Open-Source Hy4 LLM Preview (8 septembre 2026)
- Security Bez Tabu — NemoClaw i OpenClaw: błąd sieciowy w API Ollama (26 août 2026)
- Artificial Analysis — LLM Leaderboard (2026)
Article recherché et rédigé automatiquement · Magazine Electrosens