Electrosens R&D
Electrosens LLM auto hébergées · 10 September 2026

Open-weights vs open-source : ce que « ouvert » veut vraiment dire en 2026

En 2026, le mot « open » est devenu un champ de bataille. Entre les annonces triomphales de Meta, Alibaba et DeepSeek, l’entrée en vigueur des obligations de transparence de l’EU AI Act et la publication de la définition Open Source AI (OSAID 1.0) par l’OSI, la confusion est totale. Ce dossier dissèque ce que les géants appellent « open » et ce que la loi, la communauté et les faits appellent réellement « open source », pour trancher une fois pour toutes ce que vous pouvez vraiment faire avec un LLM chez vous.

L’étiquette « open » ne veut plus rien dire

Il y a encore trois ans, la question semblait simple : un modèle était soit open source, soit propriétaire. En 2026, cette dichotomie a volé en éclats. Meta annonce « Llama 4 open source », Alibaba vend Qwen comme « open », DeepSeek clame son « open-weight » R1, et Moonshot AI a publié en juillet 2026 les poids de Kimi K3, présenté comme « le plus gros modèle IA ouvert au monde ». Pourtant, aucun de ces modèles ne satisfait à la définition stricte de l’open source telle que l’entend l’Open Source Initiative (OSI).

Le problème n’est pas nouveau, mais il a pris une ampleur inédite. En octobre 2024, l’OSI a publié la version 1.0 de l’Open Source AI Definition (OSAID), un référentiel qui exige bien plus que la simple mise à disposition des poids. Pour être qualifié d’« open source », un modèle doit fournir l’accès aux poids, au code d’entraînement et aux données d’entraînement. Or, la grande majorité des modèles populaires — Llama, Qwen, DeepSeek, Mistral, Gemma — ne publient que les poids, sous forme de fichiers .safetensors, tout en gardant secrets le code d’entraînement et les datasets.

Cette situation crée un fossé juridique et pratique béant. D’un côté, les entreprises et les bricoleurs téléchargent des modèles qu’ils croient « open source » et les intègrent dans des produits commerciaux. De l’autre, les licences qui accompagnent ces poids contiennent des clauses restrictives — seuils d’utilisateurs mensuels, interdictions de redistribution, exclusions géographiques — qui transforment ce qui semble être un cadeau en piège juridique. Et avec l’entrée en vigueur progressive des obligations de transparence de l’EU AI Act pour les modèles d’IA à usage général (GPAI), la distinction n’est plus seulement une question de pureté idéologique : c’est devenu un enjeu de conformité réglementaire.

Poids ouverts, code fermé : la nouvelle taxonomie de l’IA

Pour comprendre le paysage de 2026, il faut adopter une grille de lecture à trois niveaux, devenue le standard technique de l’écosystème.

Source : digital-m.fr

Les modèles open-weights — c’est la catégorie la plus répandue. Llama 4 (sorti le 5 avril 2025), Qwen 3, DeepSeek R1/V3, Mistral, gpt-oss-120b et gpt-oss-20b (publiés le 5 août 2025) : tous permettent de télécharger les poids du modèle et de les exécuter sur sa propre infrastructure. Mais c’est à peu près tout. Le code d’entraînement reste secret, les données d’entraînement sont opaques, et la licence qui accompagne les poids impose des conditions d’utilisation spécifiques. C’est le modèle dominant, porté par des acteurs qui y voient un levier commercial et stratégique.

Les modèles open-source — beaucoup plus rares. Pour être qualifié ainsi selon l’OSI, un modèle doit fournir les poids, le code d’entraînement et les données d’entraînement. C’est le cas d’OLMo, développé par l’Allen Institute for AI, qui publie l’intégralité de sa chaîne de production, y compris le dataset Dolma. Pythia, d’EleutherAI, suit la même philosophie. Ces modèles sont les seuls à pouvoir légitimement arborer l’étiquette « open source » au sens de l’OSI.

Les modèles open-data — le graal, encore plus rare. Un modèle open-data va au-delà de l’open-source en publiant non seulement les données d’entraînement, mais aussi les scripts de prétraitement, les configurations d’entraînement complètes et les évaluations reproductibles. OLMo est souvent cité comme l’exemple le plus abouti de cette catégorie, atteignant un niveau de transparence que les géants commerciaux ne semblent pas près d’imiter.

Cette taxonomie n’est pas qu’académique. Elle a des conséquences concrètes. Un modèle open-weights comme Llama 4 peut être téléchargé et exécuté localement, mais vous ne saurez jamais quelles données ont servi à l’entraîner, ni comment il a été construit. Pour un usage personnel, cela peut suffire. Pour une entreprise soumise au RGPD ou à l’EU AI Act, c’est un problème majeur : comment garantir la conformité d’un système dont vous ignorez les données d’entraînement ?

OSAID 1.0 et EU AI Act : le grand fossé juridique de 2026

La publication de l’OSAID 1.0 par l’OSI en octobre 2024 a créé un référentiel strict, mais c’est l’EU AI Act qui a transformé cette distinction en enjeu de conformité. Le règlement européen, dont les obligations de transparence pour les modèles GPAI sont entrées en vigueur selon un calendrier échelonné entre 2025 et 2026, impose aux fournisseurs de modèles d’IA à usage général de publier un résumé détaillé du contenu utilisé pour l’entraînement. Cette exigence, inscrite à l’article 53, va bien au-delà d’une simple déclaration : elle exige une documentation substantielle sur les données, leur provenance, leur traitement.

Or, un modèle open-weights comme Llama 4 ou Qwen 3 ne satisfait pas à ces exigences. Meta et Alibaba ne publient pas leurs datasets d’entraînement, et ne fournissent qu’un résumé vague de leurs sources. Les modèles véritablement open-source comme OLMo, qui publient tout, y compris le dataset Dolma, sont structurellement mieux placés pour répondre aux exigences européennes.

Le fossé est donc double. Juridiquement, un modèle open-weights peut être utilisé en Europe, mais son fournisseur risque des sanctions pour non-conformité aux obligations de transparence. Pratiquement, un utilisateur qui déploie un tel modèle dans un contexte professionnel ne peut pas démontrer la conformité de sa chaîne de traitement, ce qui l’expose à des risques en cas de contrôle.

La situation est d’autant plus confuse que les dates d’application exactes font débat. Certaines sources évoquent une entrée en vigueur des obligations de transparence en août 2025, d’autres mentionnent une « checklist conformité » datée du 2 août 2026. Ce flou réglementaire n’arrange personne, et les entreprises qui veulent déployer des LLM en local se retrouvent face à un dilemme : adopter un modèle open-weights pratique mais potentiellement non conforme, ou un modèle open-source plus transparent mais souvent moins performant.

Apache 2.0, Llama, Qwen, DeepSeek : décrypter les licences ligne par ligne

La licence est le premier filtre à passer avant de télécharger un modèle. Et là, la diversité est déroutante. Voici un tableau comparatif des principales licences en vigueur en 2026 :

Source : hivenet.com
Licence Modèles concernés Redistribution des poids Fine-tuning Usage commercial Seuils / redevances
Apache 2.0 Mistral (certains), gpt-oss-120b/20b, Qwen3-VL-32B Libre, y compris modifié Autorisé sans restriction Autorisé sans restriction Aucun
Llama Community License Llama 4 (Meta) Autorisé, mais conditions Autorisé, mais conditions Autorisé sous conditions Seuil d’utilisateurs mensuels (MAU) au-delà duquel une licence commerciale est requise
Qwen License Qwen 3 (Alibaba) Autorisé, mais conditions Autorisé, mais conditions Autorisé sous conditions Seuil MAU similaire à Llama
DeepSeek License DeepSeek R1/V3 Autorisé, mais conditions Autorisé, mais conditions Autorisé sous conditions Seuil MAU et restrictions spécifiques
Licence personnalisée Kimi K3 Kimi K3 (Moonshot AI) Autorisé, mais conditions Autorisé, mais conditions Autorisé sous conditions Seuil MaaS de 20 M$ de revenus, auto-hébergement requis au-delà
MiniMax H3 Community License MiniMax H3 Interdit dans 4 pays (États-Unis, UE, Royaume-Uni, Corée du Sud) Interdit dans ces zones Interdit dans ces zones Exclusion géographique totale

Le contraste avec Apache 2.0 est saisissant. Cette licence permissive, utilisée par Mistral pour certains de ses modèles et par OpenAI pour gpt-oss, n’impose aucune condition : vous pouvez faire ce que vous voulez des poids, y compris les modifier, les redistribuer, les intégrer dans un produit commercial, sans jamais payer de redevance ni demander d’autorisation.

Les licences propriétaires déguisées, en revanche, sont truffées de clauses qui font mal. Les seuils d’utilisateurs mensuels (MAU) sont le piège le plus classique : tant que votre application reste sous un certain nombre d’utilisateurs actifs mensuels, la licence est gratuite ; au-delà, vous devez négocier une licence commerciale avec l’éditeur. Les conditions de redistribution des poids modifiés sont tout aussi restrictives : certains contrats exigent que les versions fine-tunées soient publiées sous la même licence, d’autres interdisent purement et simplement la redistribution.

Le cas MiniMax H3, publié sur Hugging Face le 3 août 2026, illustre de manière spectaculaire les dérives possibles. Sa licence « MiniMax H3 Community License » exclut explicitement les États-Unis, l’Union européenne, le Royaume-Uni et la Corée du Sud de son « Territoire applicable ». Les sections I.3, I.5 et V.4 interdisent l’utilisation, l’exécution, la modification, la distribution et le déploiement des sorties générées localement dans ces zones. Selon Ryan Lee, Head of Developer Relations chez MiniMax, cette restriction américaine est directement liée à un litige actif en matière de droits d’auteur avec des studios hollywoodiens. Autrement dit : un modèle « open » que vous ne pouvez pas utiliser si vous vivez en Europe.

Fine-tuning, SaaS et redistribution : les trois pièges qui ruinent votre projet

La distinction open-weights vs open-source n’est pas qu’une affaire de principes. Elle se manifeste concrètement dans trois cas d’usage qui concernent directement le bricoleur et le professionnel.

1. Le fine-tuning pour un projet personnel. C’est le cas le plus toléré. La plupart des licences open-weights autorisent le fine-tuning pour un usage non commercial. Mais « toléré » ne veut pas dire « garanti ». Les licences Llama et Qwen contiennent des clauses qui peuvent être interprétées comme restreignant le fine-tuning dans certains contextes, notamment si le modèle affiné est ensuite redistribué. Pour un usage strictement personnel, le risque est faible, mais il n’est jamais nul.

2. La redistribution d’un modèle affiné sur Hugging Face. C’est là que les choses se corsent. Les clauses de partage des poids modifiés varient considérablement d’une licence à l’autre. Certaines exigent que le modèle affiné soit publié sous la même licence, d’autres imposent des conditions supplémentaires. Le cas MiniMax H3 est extrême : la redistribution est tout simplement interdite dans quatre zones géographiques majeures. Mais même des licences plus permissives comme celle de Llama imposent des conditions de redistribution qui peuvent surprendre.

3. L’intégration dans une application SaaS commerciale. C’est le piège le plus coûteux. Les seuils MAU se déclenchent précisément quand votre application commence à rencontrer du succès. Vous avez développé un service basé sur Llama 4, vous atteignez 100 000 utilisateurs mensuels, et soudain Meta exige une licence commerciale. Les obligations de redevance peuvent alors représenter des sommes considérables, surtout si votre modèle de revenus n’avait pas anticipé ce coût.

L’affaire Kratsios/Moonshot AI ajoute une couche de complexité. Michael Kratsios, directeur de l’OSTP sous Trump, a accusé Moonshot AI d’avoir distillé le modèle Fable d’Anthropic pour développer son Kimi K3, tout en admettant que la distillation légitime est vitale pour l’écosystème ouvert. Cette affaire montre que même les poids « ouverts » peuvent être attaqués juridiquement, et que la frontière entre inspiration légitime et vol de propriété intellectuelle reste floue.

La guerre civile de l’IA : Microsoft et Nvidia contre le reste du monde

En juillet 2026, Microsoft a publié une déclaration politique intitulée « Open Weights and American AI Leadership », signée par Nvidia et plus de 200 autres entreprises et organisations. Ce texte définit les modèles open-weights comme des systèmes que « n’importe qui peut télécharger, inspecter, modifier et exécuter sur sa propre infrastructure ». Une définition volontairement large, qui ne mentionne ni les données d’entraînement ni le code d’entraînement.

Source : genee.tech

Cette offensive industrielle est une réponse directe aux critiques de l’OSI et des défenseurs de l’open source strict. Jim Whitehurst, ancien CEO de Red Hat, a déclaré que les open-weights peuvent jouer le même rôle catalytique que l’open source pour l’innovation. Pour Microsoft, Amazon, Nvidia et Google, les open-weights sont le bon compromis : ils permettent la diffusion massive des modèles sans sacrifier les secrets industriels.

Face à eux, OpenAI et Anthropic défendent le modèle propriétaire, arguant que la sécurité et la qualité exigent un contrôle centralisé. Cette opposition a des relents géopolitiques : les accusations de distillation entre modèles américains et chinois, la course à la souveraineté numérique, et la crainte que les modèles open-weights ne deviennent des chevaux de Troie pour la domination chinoise.

Le résultat est une guerre civile idéologique qui brouille les pistes pour l’utilisateur final. D’un côté, les géants technologiques qui veulent une définition laxiste des open-weights pour continuer à publier des modèles sans contraintes. De l’autre, la communauté open source qui défend une définition stricte, exigeant la transparence totale. Et au milieu, les régulateurs européens qui tentent d’imposer des obligations de transparence que ni les uns ni les autres ne veulent vraiment respecter.

Le guide de survie du bricoleur : vérifier avant de télécharger

Face à cette jungle, voici une checklist en cinq points pour ne plus jamais vous faire piéger par une annonce « open » trompeuse.

1. Vérifiez la licence officielle, pas le README. Le fichier README sur Hugging Face peut dire « open source », mais seule la licence officielle fait foi. Cherchez le fichier LICENSE à la racine du dépôt, et lisez-le. S’il contient des termes comme « Community License », « Non-commercial », « Acceptable Use Policy », méfiez-vous.

2. Cherchez les données d’entraînement. Sont-elles publiées ? Si oui, où ? Un modèle open-source au sens de l’OSI doit fournir ses datasets. Si vous ne trouvez que des descriptions vagues (« données web publiques »), c’est un open-weights, pas un open-source.

3. Identifiez les clauses de redistribution et de fine-tuning. La licence autorise-t-elle explicitement le fine-tuning ? Quelles sont les conditions de redistribution des poids modifiés ? Y a-t-il des exclusions géographiques ? Le cas MiniMax H3 montre que ces clauses peuvent être rédhibitoires.

4. Calculez les seuils MAU et les redevances potentielles. Si vous développez une application commerciale, estimez votre nombre d’utilisateurs mensuels à un horizon de 12-24 mois. Si vous risquez de dépasser le seuil, intégrez le coût d’une licence commerciale dans votre business plan.

5. Testez la conformité EU AI Act si usage professionnel. Si vous déployez le modèle dans un cadre professionnel en Europe, vérifiez que le fournisseur publie un résumé des données d’entraînement conforme à l’article 53. Dans le cas contraire, documentez votre analyse de risque et envisagez des alternatives open-source comme OLMo.

Des outils existent pour vous aider : l’OSI publie la liste des modèles conformes à l’OSAID, Hugging Face affiche les licences sur chaque model card, et les textes de l’EU AI Act sont disponibles en ligne. Prenez le temps de les consulter avant de télécharger.

Et maintenant ? Ce que 2027 prépare pour l’IA locale

Selon un rapport Hugging Face « State of Open AI Models » de mai 2026, 68 % des entreprises du Fortune 500 utilisent au moins un modèle open-weights en production, contre 41 % fin 2024. La tendance est irréversible : les open-weights sont devenus le standard de facto de l’industrie. Mais le fossé avec l’open source stricte va-t-il se creuser ou se combler ?

Plusieurs scénarios se dessinent. L’OSAID pourrait être révisée pour s’adapter aux réalités industrielles, ou au contraire durcie. L’EU AI Act pourrait renforcer ses contrôles, poussant les fournisseurs à plus de transparence. Les géants technologiques, via leur lobbying, pourraient imposer une définition plus laxiste des open-weights. Et l’émergence de modèles véritablement open-source comme OLMo et Pythia pourrait offrir une alternative crédible pour ceux qui privilégient la transparence à la performance.

Pour le particulier qui veut faire tourner un LLM chez soi, l’avenir est incertain. D’un côté, la démocratisation des open-weights et la baisse des coûts matériels — avec des mini-PC comme l’AMD Strix Halo à 1 500 $ capable de faire tourner des modèles 70B-120B en 4-bit, ou l’Apple M4 Ultra avec 128 Go de mémoire unifiée — rendent l’IA locale accessible. De l’autre, les restrictions de licence et les obligations réglementaires pourraient se durcir, transformant le hobby en parcours du combattant juridique.

Une chose est sûre : en 2026, « open » ne veut plus rien dire. Il faut désormais demander : open-weights, open-source, ou open-data ? La réponse change tout.

Sources

Article recherché et rédigé automatiquement · Magazine Electrosens
📬 Restez à la pointe
Recevez chaque semaine les nouveautés de ce magazine par email.
💬 Une remarque, une correction ?
Aidez-nous à améliorer cet article. Nous prenons en compte vos retours.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *