Leaders d’opinion
Réévaluer les sources ouvertes à l’ère de l’IA générative

Le modèle open source – une éthique de développement de logiciels dans laquelle le code source est rendu librement disponible pour une redistribution ou une modification publique – a longtemps été un catalyseur d’innovation. L’idéal est né en 1983 lorsque Richard Stallman, un développeur de logiciels, est devenu frustré par la nature de boîte noire de son imprimante à source fermée en panne.
Sa vision a déclenché le mouvement de logiciels libres, ouvrant la voie à l’écosystème open source qui alimente une grande partie de l’internet et de l’innovation logicielle d’aujourd’hui.
Mais cela remonte à plus de 40 ans.
Aujourd’hui, l’IA générative, avec ses défis techniques et éthiques uniques, redéfinit le sens de « l’ouverture », exigeant que nous réexaminions et réadaptions le paradigme open source – non pour l’abandonner, mais pour l’adapter.
IA et les libertés open source
Les quatre libertés fondamentales des logiciels open source – la capacité de exécuter, d’étudier, de modifier et de redistribuer tout code logiciel – sont en contradiction avec la nature de l’IA générative de plusieurs manières :
- Exécuter : Les modèles d’IA nécessitent souvent des infrastructures et des coûts de calcul très élevés, ce qui limite l’accès en raison de contraintes de ressources.
- Étudier et modifier : Les modèles d’IA sont incroyablement complexes, donc comprendre et les modifier sans accès au code et aux données qui l’informent est un défi important.
- Redistribution : De nombreux modèles d’IA restreignent la redistribution par conception, en particulier ceux avec des poids formés et des ensembles de données propriétaires appartenant au fournisseur de la plate-forme.
L’érosion de ces principes fondamentaux n’est pas due à une intention malveillante, mais plutôt à la complexité et au coût élevés des systèmes d’IA modernes. En effet, les coûts financiers de la formation de modèles d’IA de pointe ont augmenté de manière spectaculaire ces dernières années – le GPT-4 d’OpenAI aurait coûté jusqu’à 78 millions de dollars, hors salaires du personnel, avec des dépenses totales dépassant 100 millions de dollars.
La complexité de l’IA « open source »
Un modèle d’IA vraiment open nécessiterait une transparence totale du code source d’inférence, du code source de formation, des poids du modèle et des données de formation. Cependant, de nombreux modèles étiquetés comme « ouverts » ne publient que le code d’inférence ou des poids partiels, tandis que d’autres offrent des licences limitées ou restreignent l’utilisation commerciale.
Cette ouverture impartiale crée l’illusion des principes open source, tout en restant en deçà dans la pratique.
Considérez qu’une analyse de l’Open Source Initiative (OSI) a constaté que plusieurs modèles de langage grand public prétendant être open source – y compris Llama2 et Llama 3.x (développés par Meta), Grok (X), Phi-2 (Microsoft (MSFT )) et Mixtral (Mistral AI) – sont incompatibles avec les principes open source.
Les défis de durabilité et d’incitation
La plupart des logiciels open source ont été construits sur des efforts bénévoles ou financés par des subventions, plutôt que sur des infrastructures coûteuses et intensives en calcul. Les modèles d’IA, en revanche, sont coûteux à former et à maintenir, et les coûts ne devraient qu’augmenter. Le PDG d’Anthropic, Dario Amodei, prévoit qu’il pourrait finalement coûter $100 milliards pour former un modèle de pointe.
Sans un modèle de financement durable ou une structure d’incitation, les développeurs sont confrontés à un choix entre restreindre l’accès via des licences fermées ou non commerciales ou risquer l’effondrement financier.
Les malentendus autour des « poids ouverts » et de la licence
L’accès aux modèles d’IA est de plus en plus confus, de nombreux plateformes se présentant comme « ouvertes » tout en imposant des restrictions qui contredisent fondamentalement les principes open source. Cette « magie » se manifeste de plusieurs manières :
- Les modèles étiquetés comme « poids ouverts » peuvent interdire l’utilisation commerciale, les rendant plus des curiosités académiques que des outils commerciaux pratiques pour le public à explorer et à développer.
- Certains fournisseurs offrent l’accès à des modèles préformés, mais protègent jalousement leurs ensembles de données de formation et leurs méthodologies, rendant impossible la reproduction ou la vérification significative de leurs résultats.
- De nombreuses plateformes imposent des restrictions de redistribution qui empêchent les développeurs de construire ou d’améliorer les modèles pour leurs communautés, même s’ils peuvent pleinement « accéder » au code.
Dans ces cas, « ouvert pour la recherche » n’est que du double langage pour « fermé pour les entreprises ». Le résultat est une forme déloyale de verrouillage du fournisseur, où les organisations investissent du temps et des ressources dans des plateformes qui semblent ouvertes, pour finalement découvrir des limitations critiques lorsqu’elles tentent de mettre à l’échelle ou de commercialiser les applications.
La confusion qui en résulte ne déçoit pas seulement les développeurs. Elle mine activement la confiance dans l’écosystème de l’IA. Elle crée des attentes irréalistes parmi les parties prenantes qui supposent raisonnablement que l’IA « ouverte » est comparable aux communautés de logiciels open source, où la transparence, les droits de modification et la liberté commerciale sont respectés.
Le décalage juridique
La progression rapide de l’IA générative dépasse déjà l’élaboration de cadres juridiques appropriés, créant un réseau complexe de défis de propriété intellectuelle qui aggravent les préoccupations préexistantes.
Le premier champ de bataille juridique se concentre sur l’utilisation des données de formation. Les modèles d’apprentissage profond puisent de grands ensembles de données sur Internet, tels que des images et du texte de pages Web accessibles au public. Cette collecte massive de données a déclenché des débats féroces sur les droits de propriété intellectuelle. Les sociétés de technologie affirment que leurs systèmes d’IA étudient et apprennent à partir de matériaux protégés par le droit d’auteur afin de créer du contenu nouveau et transformateur. Les propriétaires du droit d’auteur, cependant, soutiennent que ces sociétés d’IA copient illégalement leurs œuvres, générant du contenu concurrent qui menace leur moyen de subsistance.
La propriété des œuvres dérivées générées par l’IA représente une autre ambiguïté juridique. Personne n’est tout à fait sûr de la manière de classer le contenu généré par l’IA, à l’exception du Bureau des droits d’auteur des États-Unis, qui déclare que « si l’IA génère entièrement le contenu, il ne peut pas être protégé par le droit d’auteur ».
L’incertitude juridique entourant l’IA générative – en particulier en ce qui concerne la contrefaçon du droit d’auteur, la propriété des œuvres générées par l’IA et le contenu non autorisé dans les données de formation – devient encore plus tendue à mesure que les modèles d’IA fondamentaux émergent comme des outils d’importance géopolitique : Les nations qui rivalisent pour développer des capacités d’IA supérieures peuvent être moins enclines à restreindre l’accès aux données, mettant les pays à des protections de propriété intellectuelle plus strictes en désavantage concurrentiel.
Ce que l’open source doit devenir à l’ère de l’IA
Le train de l’IA générative a déjà quitté la gare et ne montre aucun signe de ralentissement. Nous espérons construire un avenir où l’IA encourage plutôt que d’étouffer l’innovation. Dans ce cas, les dirigeants technologiques ont besoin d’un cadre qui garantit une utilisation commerciale sûre et transparente, favorise l’innovation responsable, aborde la propriété et la licence des données, et différencie entre « ouvert » et « gratuit ».
Un concept émergent, la licence open source commerciale, peut offrir un chemin vers l’avant en proposant un accès gratuit pour une utilisation non commerciale, un accès sous licence pour une utilisation commerciale et la reconnaissance et le respect de la provenance et de la propriété des données.
Pour s’adapter à cette nouvelle réalité, la communauté open source doit développer des modèles de licence open source spécifiques à l’IA, former des partenariats public-privés pour financer ces modèles et établir des normes de confiance pour la transparence, la sécurité et l’éthique.
Les sources ouvertes ont changé le monde une fois. L’IA générative change le monde à nouveau. Pour préserver l’esprit de l’ouverture, nous devons faire évoluer la lettre de sa loi, en reconnaissant les exigences uniques de l’IA tout en abordant les défis de front pour créer un écosystème inclusif et durable.












