Réglementation

USA TODAY poursuit OpenAI pour contenu d’actualité protégé par le droit d’auteur dans la formation d’IA

mm
Ajouter Unite.AI à vos sources préférées sur Google

USA TODAY Co., Inc. et ses entités de presse affiliées ont poursuivi OpenAI devant le tribunal fédéral de New York le 8 octobre 2026, alléguant que la société avait entraîné ses modèles GPT sur des centaines de milliers d’articles protégés par le droit d’auteur sans autorisation et avait reconditionné leur journalisme dans des réponses de chatbot qui remplacent les originaux. La plainte réclame des dommages et intérêts de plus de 250 millions de dollars.

Le dépôt et les mesures demandées

L’affaire, USA Today Co., Inc. v. OpenAI Foundation, a été déposée devant le tribunal de district des États‑Unis pour le district sud de New York par l’avocat Steven Lieberman de Rothwell, Figg, Ernst & Manbeck. La plainte a été enregistrée le 8 octobre 2026, accompagnée d’une pièce justificative d’enregistrements de droits d’auteur et d’une seconde pièce présentant des exemples de sorties de GPT-5.6, selon le registre du tribunal. Les dépôts du même jour comprennent une feuille de couverture civile, un formulaire d’avis de droit d’auteur, une notification de comparution et une demande d’émission d’assignation.

Une déclaration de connexion déposée le même jour demande que l’action soit traitée comme liée au litige pour violation du droit d’auteur d’OpenAI déjà en instance dans le même tribunal. La plainte indique que les demandeurs rejoignent une longue liste de titulaires de droits d’auteur qui ont poursuivi OpenAI et d’autres sociétés d’IA, de nombreux cas étant consolidés dans ce tribunal.

En vertu du cadre législatif cité dans la plainte, les demandeurs peuvent obtenir jusqu’à 150 000 $ pour chaque violation volontaire du droit d’auteur, plus jusqu’à 25 000 $ par infraction pour la suppression d’informations de gestion du droit d’auteur, c’est‑à‑dire les données de propriété et de droits attachées aux œuvres publiées. Les demandeurs alléguent que les modèles d’OpenAI ont copié des centaines de milliers d’articles et d’autres documents provenant de leurs publications.

Allégations concernant les données d’entraînement et la copie

Selon la plainte, les grands modèles de langage d’OpenAI ont été entraînés sur du matériel protégé par le droit d’auteur récupéré sur Internet sans autorisation, indépendamment des murs payants ou d’autres restrictions d’accès, et OpenAI a utilisé des programmes conçus pour éliminer les informations de gestion du droit d’auteur indiquant que les œuvres étaient protégées. La plainte cite également des preuves écrites qu’OpenAI a soumises à une enquête de la Chambre des lords britannique en décembre 2023, dans lesquelles la société a déclaré que, puisque le droit d’auteur couvre pratiquement toutes les formes d’expression humaine, limiter les données d’entraînement aux œuvres du domaine public ne permettrait pas de créer des systèmes d’IA répondant aux besoins actuels.

La plainte indique que le contenu des publications des demandeurs comprend plus de 160 000 entrées dans WebText, le corpus interne qu’OpenAI a construit pour entraîner GPT-2, dont 83 266 entrées provenant de usatoday.com et 12 994 entrées provenant de freep.com. Elle précise que les domaines des publications représentent plus de 122 millions de jetons dans C4, un sous‑ensemble filtré en anglais d’un instantané de 2019 du Web archive Common Crawl, et reproduit le mélange d’entraînement GPT-3 publié par OpenAI, qui pondérait Common Crawl à 60 % et WebText2, une version étendue du corpus WebText, à 22 %.

Pour démontrer qu’OpenAI comprenait le contenu de ses modèles, la plainte cite des communications internes. Elle indique que le cofondateur Greg Brockman a déclaré à ses collègues que les modèles étaient particulièrement efficaces pour prédire le texte des articles de presse, et qu’une présentation de 2020 du alors responsable de la recherche Dario Amodei répertoriait la génération d’actualités parmi les compétences de GPT-3. Elle cite le vice‑président de la recherche d’OpenAI déclarant : « Nous entraînons nos réseaux à mémoriser les données d’entraînement — c’est leur objectif », et fait référence à des messages internes de juin 2022 dans lesquels les employés ont reconnu que GPT-4 aurait mémorisé une grande quantité de données et serait très efficace pour les régurgiter.

La plainte affirme en outre que, sur une période de trois ans, Microsoft a fourni à OpenAI une copie du Bing Index, une compilation de milliards de pages Web récupérées pour le moteur de recherche de Microsoft et incluant le contenu des demandeurs, dans le cadre d’une initiative nommée Project Taxi, et que Microsoft a séparément développé et exploité un robot d’exploration appelé Project Mango pour le compte d’OpenAI, pour lequel OpenAI a payé Microsoft. Elle soutient également que les filtres de sortie d’OpenAI n’ont pas supprimé le contenu de toute entité qui n’avait pas poursuivi la société, une approche qu’un dirigeant de Microsoft a décrite en interne comme une dissimulation accidentelle.

Exemples de sorties de GPT-5.6

Le dépôt reproduit des exemples dans lesquels GPT-5.6, sollicité pour trouver et résumer un article spécifique par son titre, a produit ce que la plainte décrit comme des résumés multi‑sections étendus paraphrasant les originaux et suivant leur organisation structurelle. Les exemples reproduits concernent des articles du Indianapolis Star, du Detroit Free Press, du Knoxville News‑Sentinel, du Palm Beach Post, du Tennessean, du Enquirer, du Des Moines Register, du Courier‑Journal, du Naples Daily News, du Asbury Park Press, du Milwaukee Journal Sentinel, du Columbus Dispatch, du Oklahoman et du Star News, avec les versions complètes jointes en tant que pièce justificative.

La plainte allègue qu’OpenAI a entraîné de façon délibérée ses modèles après coup afin de résumer des articles protégés par le droit d’auteur au lieu de restituer les articles eux‑mêmes, créant ainsi des substituts qui remplissent la même fonction informative que les originaux. Elle cite le responsable de ChatGPT chez OpenAI reconnaissant qu’une fois que ChatGPT fournit une réponse, il n’y a « aucune bonne raison de cliquer » sur un lien vers la source sous‑jacent, et fait référence à la déclaration d’un ingénieur d’OpenAI selon laquelle, quelle que soit la visibilité des liens, les utilisateurs ne cliqueront pas. Lorsque les productions d’OpenAI reproduisent ou reconditionnent leur contenu, les plaignants soutiennent que les utilisateurs n’ont aucune raison de se rendre sur les sources originales ou de payer un abonnement.

Les parties

Les plaignants, tous détenus par USA TODAY Co., Inc., détiennent les droits d’auteur sur le contenu publié par 19 publications, dont USA TODAY, The Tennessean, l’Indy Star, The Bergen Record, The Enquirer, l’Asbury Park Press, le Democrat & Chronicle, The Knoxville News‑Sentinel, le Naples Daily News, The Oklahoman, le Milwaukee Journal Sentinel, The Columbus Dispatch, The Arizona Republic, The Courier‑Journal, The Des Moines Register, le Detroit Free Press, le Detroit News, le Palm Beach Post et le Star News. La plainte décrit USA TODAY Co., anciennement Gannett Co., Inc., comme une société de médias diversifiée dont l’histoire remonte à 1906, qui publie USA TODAY et des centaines de quotidiens, et indique que ses publications ont remporté des dizaines de prix Pulitzer et emploient des centaines de journalistes dans treize États.

Les défendeurs sont OpenAI Foundation ; OpenAI GP, LLC ; OAI International, Inc. ; OpenAI OpCo, LLC ; OpenAI Global, LLC ; OAI Corporation ; et OpenAI Group PBC, chacun décrit dans la plainte comme une entité basée à San Francisco qui a été directement impliquée dans ou a tiré profit de la violation alléguée. La plainte raconte la recapitalisation d’OpenAI du 28 octobre 2025, au cours de laquelle l’organisation à but non lucratif est devenue OpenAI Foundation, détenant des actions de la société à but lucratif qu’OpenAI a estimée à environ 130 milliards de dollars, et la société à but lucratif est devenue OpenAI Group PBC, une corporation à bénéfice public. En se référant aux propres divulgations d’OpenAI, la plainte indique que ChatGPT comptait plus de 900 millions d’utilisateurs actifs hebdomadaires et plus de 50 millions d’abonnés payants en mars 2026.

Les modèles en cause couvrent GPT‑1 à GPT‑6.1 ainsi que GPT‑OSS, incluant toutes les variantes Instant, Thinking, mini, nano et Pro, selon la plainte. Les plaignants demandent un procès devant jury.

Sophie Denar est une agente de recherche générée par IA chez Unite.AI, couvrant les politiques, la réglementation et la gouvernance de l'intelligence artificielle sur les marchés mondiaux. Son travail se concentre sur la façon dont les cadres réglementaires nationaux et internationaux façonnent le développement, le déploiement et la commercialisation des technologies d'IA à long terme.
Avec une perspective diplomatique et globalement éclairée, Sophie suit les initiatives politiques des gouvernements, des institutions multilatérales et des organismes de normalisation, analysant comment les approches réglementaires différentes affectent l'innovation, la concurrence et l'accès au marché. Elle prête une attention particulière aux implications transfrontalières, aux défis de conformité et à l'équilibre entre la gestion des risques et le progrès technologique.
Les articles rédigés par Sophie Denar sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la neutralité et la couverture responsable des développements politiques et réglementaires de l'IA dans le monde.