Magazine LLM Opensource · 19 September 2026À l’ombre de Mistral : Dragon LLM, LightOn et Pleias, la relève frugale de l’IA souveraine française
Mistral AI capte les projecteurs et les milliards, mais derrière le champion tricolore, une poignée d’acteurs construit une alternative plus discrète, plus frugale, et résolument souveraine. Dragon LLM, LightOn et Pleias ne cherchent pas à battre OpenAI sur son terrain — ils veulent inventer le leur. Enquête sur un écosystème qui refuse de jouer le jeu des géants, et qui, en 2026, commence à livrer des preuves tangibles.
À l’ombre de Mistral : trois pépites françaises taillent leur route
Il y a un paradoxe français dans l’IA. D’un côté, un champion national, Mistral AI, dont le cofondateur Arthur Mensch alertait l’Assemblée nationale mi-mai 2026 sur le retard de l’Europe, tout en visant un milliard de dollars de revenus pour 2026 — contre une centaine de millions l’année précédente. De l’autre, un tissu de start-up moins visibles, mais tout aussi déterminées, qui ont choisi une voie différente : celle de l’open source frugal et souverain.
Selon le Mapping 2026 de France Digital, la France compte 1 114 start-up d’IA. Un chiffre impressionnant, mais qui masque une réalité : la grande majorité de ces entreprises travaille dans l’ombre des géants américains et chinois. Parmi elles, trois noms reviennent avec insistance dans les discussions des praticiens : Dragon LLM, LightOn et Pleias. Le Parisien les présentait le 2 juin 2026 comme des « acteurs de la tech reconnus » qui « grandissent à l’ombre » de Mistral AI. Une formule qui résume bien leur position : suffisamment crédibles pour être citées, suffisamment discrètes pour ne pas attirer les projecteurs.
Ce qui les distingue immédiatement, c’est leur refus du modèle dominant. Là où Mistral AI joue la carte de la croissance rapide et des partenariats institutionnels — son accord avec EDF pour une IA dédiée au nucléaire en est l’illustration la plus récente —, Dragon LLM, LightOn et Pleias misent sur des valeurs que l’on entend rarement dans les conférences tech : sobriété, indépendance, sécurité. Leur objectif commun, tel que le résume Le Parisien : garantir des solutions d’IA « souveraines, à bas coût, bas carbone et sécurisées ».
Ce positionnement n’est pas qu’un argument marketing. Il répond à une urgence géopolitique que même les plus optimistes ne peuvent plus ignorer. L’Europe est absente des principaux marchés de l’IA, comme le rappelle The Conversation, et sa dépendance aux infrastructures et modèles étrangers devient un sujet de sécurité nationale. Pendant ce temps, Meta prévoit de dépenser plus de 125 milliards de dollars en 2026, et Washington envisage de durcir ses sanctions contre l’IA chinoise, en ciblant spécifiquement les modèles open source. Dans ce contexte, l’existence d’une alternative européenne n’est plus une option — c’est une nécessité.
Souveraineté, frugalité, sécurité : le triptyque qui les unit
Pour comprendre ce qui motive Dragon LLM, LightOn et Pleias, il faut regarder les chiffres qui structurent le débat. Fin 2024, 378 millions d’utilisateurs avaient eu recours à une solution d’IA générative, selon Statista, cité par The Conversation. Un marché colossal, dominé à plus de 90 % par des acteurs américains et chinois. L’Europe, elle, regarde passer les trains — ou plutôt les GPU.
Le problème n’est pas seulement économique, il est existentiel. Les modèles d’IA sont devenus des infrastructures critiques : ils traitent des données de santé, des dossiers administratifs, des secrets industriels. Les confier à des entreprises étrangères, c’est accepter une dépendance structurelle que les sanctions américaines contre la Chine rendent chaque jour plus tangible. Washington l’a bien compris : en ciblant les modèles open source chinois, les États-Unis cherchent à contrôler la diffusion d’une technologie devenue stratégique. L’Europe, elle, n’a pas encore les moyens de sa politique.
C’est là que le triptyque souveraineté-frugalité-sécurité prend tout son sens. La souveraineté, d’abord : il s’agit de garantir que les données européennes restent en Europe, traitées par des modèles européens, sur des infrastructures européennes. La frugalité, ensuite : là où Meta investit 125 milliards de dollars, les acteurs européens doivent faire avec des budgets cent fois inférieurs. Cette contrainte, loin d’être un handicap, devient un avantage compétitif : elle force à l’innovation sur l’efficacité énergétique et l’optimisation des ressources. La sécurité, enfin : un modèle open source, auditable par la communauté, est potentiellement plus sûr qu’une boîte noire propriétaire — à condition que la communauté fasse son travail.
Ce positionnement n’est pas théorique. The Conversation plaide dans une analyse récente pour une « IA open source et frugale » comme clé de l’autonomie stratégique européenne. L’argument est simple : face à des acteurs qui dépensent des centaines de milliards, l’Europe ne peut pas gagner la course à l’échelle. Elle peut gagner celle de l’intelligence — en construisant des modèles plus petits, plus efficaces, mieux adaptés aux langues et aux cultures européennes.
Dragon LLM, LightOn, Pleias : trois ADN, une même quête d’indépendance
Si les trois acteurs partagent une même vision, leurs trajectoires et leurs priorités diffèrent sensiblement. En 2026, ils ont néanmoins livré des réalisations concrètes qui permettent de passer des intentions aux preuves.
Dragon LLM incarne l’ancrage souverain dans sa forme la plus directe. Son nom même est un programme : un modèle de langage « dragon », c’est-à-dire français, conçu pour des usages institutionnels et de défense. L’entreprise, fondée par Olivier Debeugny, s’est imposée en quelques années comme une référence européenne des architectures IA frugales, avec une spécialisation sur les modèles légers, peu gourmands en ressources et facilement déployables sur site. En août 2026, Dragon LLM a franchi un cap décisif avec le lancement de LLM Open Finance, une collection open source de modèles et de jeux de données dédiés à la finance, disponible sur Hugging Face. Cette initiative, qui couvre la classification de documents, l’analyse de sentiment et les principaux cas d’usage du secteur financier, répond à la demande croissante d’indépendance technologique dans un environnement réglementé. Pour Olivier Debeugny, « seule l’ouverture permettra au secteur financier de s’approprier durablement l’IA » : les établissements doivent pouvoir auditer, adapter et enrichir les modèles, sans dépendre de solutions opaques ou de fournisseurs extra-européens.
LightOn a fait de la frugalité son étendard. L’entreprise s’est spécialisée dans l’inférence à bas coût et l’efficacité énergétique, un positionnement qui résonne particulièrement dans un contexte où le coût des GPU explose et où l’empreinte carbone de l’IA devient un sujet politique. Son approche : des modèles optimisés pour tourner sur des infrastructures modestes, avec une consommation électrique minimale. LightOn a notamment dévoilé Alfred-40B-0723, un LLM open source destiné aux entreprises, construit sur Falcon 40B. Ce modèle illustre la philosophie de l’entreprise : partir d’une base éprouvée, l’optimiser pour des usages professionnels, et la diffuser en open source pour permettre aux entreprises de déployer de l’IA sans alourdir leur facture énergétique — ni leur bilan carbone.
Pleias, enfin, a misé sur la donnée. L’entreprise construit des corpus d’entraînement européens, pensés pour refléter la diversité linguistique et culturelle du continent. Là où les modèles américains sont entraînés sur des données majoritairement anglophones, Pleias veut offrir aux langues européennes — et au français en particulier — des modèles qui les comprennent vraiment, sans passer par la traduction ou l’adaptation. En 2026, Pleias a démontré la puissance de son approche avec plusieurs réalisations marquantes. L’entreprise a entraîné un modèle spécialisé de 600 millions de paramètres pour la RATP, chargé de détecter et d’interpréter les signaux de sécurité dans les messages des usagers du métro parisien. Après seulement trois mois de développement, ce modèle, qui bat des modèles fermés 200 fois plus gros, est en production sur l’infrastructure souveraine de la RATP chez Scaleway. Pleias a également ouvert le Telco Common Corpus, un jeu de données de plus de 10 milliards de tokens de télécommunications, dans le cadre de l’initiative GSMA Open Telco AI. À l’occasion du sommet AI for Good à Genève, l’entreprise a open-sourcé ses modèles, datasets et frameworks de déploiement, y compris un pipeline de recherche en français pour Raspberry Pi et Android, fonctionnant entièrement hors ligne sur du matériel coûtant moins de 100 €.
| Critère | Dragon LLM | LightOn | Pleias |
|---|---|---|---|
| Positionnement | Souveraineté institutionnelle | Frugalité énergétique | Données européennes |
| Public cible | Administrations, défense, finance, industries critiques | Entreprises soucieuses des coûts et du carbone | Acteurs multilingues, institutions européennes |
| Approche technique | Modèles sécurisés, déployables en environnement contraint | Optimisation de l’inférence, basse consommation | Corpus d’entraînement européens, multilingues |
| Réalisations 2026 | LLM Open Finance (collection open source pour la finance) | Alfred-40B-0723 (LLM open source basé sur Falcon 40B) | Modèle 600M pour la RATP, Telco Common Corpus (10B+ tokens) |
| Argument principal | Indépendance stratégique | Coût total de possession réduit | Représentation des langues européennes |
Ce tableau, volontairement qualitatif, reflète l’état de l’information disponible : les trois entreprises n’ont pas publié de spécifications techniques détaillées pour tous leurs modèles, et les données chiffrées (tailles de paramètres, scores de benchmarks, levées de fonds) restent largement confidentielles. C’est à la fois une force — elles évitent la course à la communication — et une faiblesse — elles peinent à convaincre les entreprises qui veulent des preuves. Mais les réalisations de 2026 montrent que ces acteurs passent de la promesse à la production.
Le nerf de la guerre : des données qui parlent français
Tous les spécialistes vous le diront : un LLM vaut ce que valent ses données d’entraînement. Et c’est précisément là que se joue la bataille la plus importante pour l’écosystème français. Les modèles dominants — GPT, Claude, Gemini, Llama — sont entraînés sur des corpus massivement anglophones. Le français y figure, certes, mais en position subalterne, souvent comme une langue « de seconde zone » après traduction ou adaptation.

Cette situation a des conséquences concrètes. Un modèle entraîné principalement sur de l’anglais aura tendance à produire des réponses calquées sur des schémas culturels anglo-saxons, à mal comprendre les subtilités administratives françaises, à échouer sur des références locales. Pour une administration, une entreprise du CAC 40 ou un hôpital, c’est rédhibitoire.
C’est là que Pleias a trouvé sa niche. L’entreprise construit des corpus européens, conçus pour refléter la diversité linguistique du continent. Son site présente son activité en trois piliers : des données entièrement ouvertes — le plus grand ensemble de données au monde libéré de droits et basé sur la provenance pour les LLM, couvrant archives gouvernementales, littérature juridique, littérature scientifique et sources multilingues —, des données synthétiques pour les agents IA, simulant un raisonnement de niveau expert pour générer des données d’entraînement qui construisent une véritable spécialisation, et des outils natifs IA pour les agents, transformant des documents hétérogènes en une ressource de données structurée et conforme. L’idée est simple : plutôt que d’adapter des modèles anglophones, il faut entraîner des modèles sur des données authentiquement européennes — des textes administratifs, des articles de presse, des documents juridiques, des œuvres littéraires dans leur langue d’origine. Cette approche, plus coûteuse en amont, produit des modèles dont la compréhension du français n’a rien à envier à celle des géants américains — et la dépasse même sur les usages locaux.
Dragon LLM, de son côté, met l’accent sur des données souveraines : des corpus issus de sources institutionnelles, vérifiées, dont la provenance est documentée. Un enjeu crucial pour les usages de défense et d’administration, où la traçabilité des données n’est pas une option. La collection LLM Open Finance illustre cette philosophie appliquée à la finance : des jeux de données financiers ouverts, couvrant les principaux cas d’usage du secteur, pour permettre aux établissements de construire des applications IA sur mesure sans dépendre de fournisseurs opaques. LightOn, enfin, travaille sur des données optimisées pour l’efficacité : des corpus nettoyés, dédupliqués, sélectionnés pour maximiser l’apprentissage par token consommé. Une approche qui s’inscrit dans sa philosophie frugale : moins de données, mais des données de meilleure qualité, pour des modèles plus petits et plus rapides.
Reste la question épineuse de la licence et de la provenance. L’open source n’a de sens que si les données d’entraînement sont elles-mêmes documentées et, idéalement, libres de droits. C’est un défi juridique considérable — la définition de l’IA open source fait d’ailleurs l’objet de débats intenses, comme le souligne la presse spécialisée. Les trois acteurs français avancent sur ce terrain avec prudence, conscients que la confiance des utilisateurs se gagne aussi par la transparence. Pleias, avec son engagement sur des données « rights-cleared » (libérées de droits) et basées sur la provenance, est sans doute le plus avancé sur ce front.
Benchmarks : le grand écart entre promesses et réalité
Venons-en au sujet qui fâche : les performances. Les benchmarks sont devenus le langage commun de l’IA — MMLU, HellaSwag, GSM8K, HumanEval, et les déclinaisons francophones comme FLUE ou FrenchBench. Ce sont eux qui permettent de comparer objectivement les modèles, de justifier un choix technique, de convaincre un comité de direction.
Or, sur ce terrain, les trois acteurs français sont longtemps restés étrangement silencieux. Aucun score public vérifié n’était disponible pour Dragon LLM, LightOn ou Pleias sur les benchmarks internationaux ou francophones. Les articles qui leur sont consacrés — notamment celui du Parisien — se concentraient sur le contexte stratégique et économique, pas sur les résultats techniques. Une absence qui interroge.
Faut-il y voir une faiblesse ? Pas nécessairement. Les benchmarks classiques (MMLU, HellaSwag) mesurent des capacités générales qui intéressent peu les utilisateurs cibles de ces modèles. Un modèle souverain pour la défense n’a pas besoin d’exceller en culture générale américaine ; il doit être irréprochable sur des tâches spécifiques, dans un environnement contraint. De même, un modèle frugal pour l’industrie n’a pas vocation à battre GPT-5 sur un quiz de culture générale.
Mais en 2026, les choses commencent à bouger. Pleias a démontré que son approche data-centrée porte ses fruits : son modèle de 600 millions de paramètres pour la RATP bat des modèles fermés 200 fois plus gros sur la détection de signaux de sécurité dans les messages des usagers. C’est un résultat remarquable, qui montre que la spécialisation et la qualité des données peuvent compenser l’écart de taille. De même, Dragon LLM, avec LLM Open Finance, fournit des modèles spécialisés pour la finance dont les performances sur les tâches de classification et d’analyse de sentiment sont vérifiables par la communauté. LightOn, avec Alfred-40B-0723, offre une base éprouvée (Falcon 40B) optimisée pour l’inférence à bas coût.
Ces résultats ne remplacent pas des scores sur les benchmarks généralistes, mais ils répondent à une question plus pertinente : ces modèles fonctionnent-ils sur les tâches réelles de leurs utilisateurs cibles ? La réponse, au vu des déploiements en production (RATP, secteur financier), est de plus en plus oui. Le guide Moon AI de 2026 confirme d’ailleurs que les LLM français ont fait « un bond qualitatif » et représentent désormais « une alternative crédible aux modèles américains », avec des performances supérieures sur les tests de compréhension francophone comme FrenchBench.
Un écosystème en ébullition : la concurrence ouvre la voie
Les trois acteurs français ne sont pas seuls sur ce terrain. L’écosystème open source mondial est en pleine effervescence en cette fin 2026, et cette concurrence profite à tous. Tencent a ouvert son modèle Hy4 (770 milliards de paramètres, contexte de 1 million de tokens) début septembre 2026. Z.ai a lancé GLM-5.3 en août, un modèle de 743 milliards de paramètres qui domine le benchmark cybersécurité CyberGym avec 84,5 %, devançant Claude Sonnet 5 et GPT-5.6 Sol. Meta, de son côté, a publié Muse Glimmer, un modèle agentique multimodal de 30 milliards de paramètres à poids ouverts sous licence Apache 2.0, conçu pour une exécution locale.

Cette effervescence valide la stratégie des acteurs français : l’open source est devenu le terrain où se joue l’avenir de l’IA. Les modèles chinois (DeepSeek, Qwen, GLM, Hy4) prouvent qu’il est possible de rivaliser avec les géants américains sans dépenser des centaines de milliards. Les modèles français, eux, apportent une valeur spécifique : la maîtrise des langues européennes, la conformité réglementaire, et une frugalité qui devient un avantage compétitif à l’heure où le coût énergétique de l’IA devient un sujet politique majeur.
Le guide Moon AI de 2026 identifie d’ailleurs plusieurs LLM français crédibles : Mistral Large 3, Moon (de Stellarr Studio), Lucie (de Pleias), Mixtral et BLOOM. Cette diversité est une force : elle permet aux entreprises de choisir le modèle adapté à leurs besoins, plutôt que de subir un monopole. Et elle montre que l’écosystème français ne se limite pas aux trois acteurs que nous avons détaillés — il est plus riche, plus dynamique, et plus prometteur qu’on ne le croit souvent.
Conclusion : la revanche discrète de la frugalité
Dragon LLM, LightOn et Pleias ne chercheront probablement jamais à battre OpenAI sur son terrain. Ils n’en ont pas besoin. Leur terrain, c’est celui de la souveraineté, de la frugalité et de la sécurité — des valeurs qui deviennent chaque jour plus stratégiques à mesure que l’IA s’infiltre dans les infrastructures critiques.
En 2026, ils ont franchi un cap : des réalisations concrètes (LLM Open Finance, Alfred-40B-0723, le modèle RATP), des déploiements en production, et une reconnaissance croissante de la communauté. Le guide Moon AI les place désormais au même niveau que les modèles américains sur les usages francophones. La route est encore longue — les benchmarks généralistes restent dominés par les géants, et la visibilité médiatique demeure faible — mais la direction est claire.
Pendant que Mistral AI joue dans la cour des grands, ces trois pépites construisent patiemment une alternative crédible. Une alternative qui ne promet pas de révolutionner le monde, mais de le rendre un peu plus souverain, un peu plus frugal, un peu plus sûr. Dans un paysage dominé par les hyperboles et les levées de fonds records, c’est peut-être la promesse la plus radicale de toutes.
Sources

- Le Parisien — 2 juin 2026 : les acteurs de la tech qui grandissent à l’ombre de Mistral AI
- The Conversation — Plaidoyer pour une IA open source et frugale
- France Digital — Mapping 2026 des start-up d’IA en France
- IT Social — Dragon LLM dévoile LLM Open Finance
- ActuIA — LightOn dévoile Alfred-40B-0723
- Pleias — Site officiel et annonces
- Moon AI — LLM français 2026 : guide complet des modèles souverains
- QuelLLM.fr — CroissantLLM et Lucie : les modèles 100% français en local
- Polydesk — IA Open Source : Comparatif DeepSeek, Llama, Mistral, Qwen (2026)
- Noqta — Qwen détrône Llama : le LLM auto-hébergé le plus déployé en 2026
- Alain Goudey — Analyse du lancement (manqué) de LUCIE
Article recherché et rédigé automatiquement · Magazine Electrosens