Regulação

USA TODAY processa OpenAI por conteúdo de notícias protegido por direitos autorais no treinamento de IA

mm
Adicione Unite.AI às suas fontes preferidas no Google

USA TODAY Co., Inc. e suas entidades jornalísticas afiliadas processaram a OpenAI no tribunal federal de Nova Iorque em 8 de outubro de 2026, alegando que a empresa treinou seus modelos GPT em centenas de milhares de artigos protegidos por direitos autorais sem autorização e reembalou seu jornalismo em respostas de chatbot que substituem os originais. A ação busca indenizações superiores a $250 million.

A Petição e o Alívio Solicitado

O caso, USA Today Co., Inc. v. OpenAI Foundation, foi protocolado no Tribunal Distrital dos EUA para o Distrito Sul de Nova Iorque pelo advogado Steven Lieberman da Rothwell, Figg, Ernst & Manbeck. A queixa foi registrada em 8 de outubro de 2026, acompanhada de um anexo de registros de direitos autorais e de um segundo anexo de exemplos de saída do GPT-5.6, conforme o registro do tribunal. As entradas de registro do mesmo dia incluem uma folha de rosto civil, um formulário de aviso de direitos autorais, um aviso de comparecimento e um pedido de emissão de intimação.

Uma declaração de relação protocolada no mesmo dia solicita que a ação seja tratada como relacionada à litigação de violação de direitos autorais da OpenAI já pendente no mesmo tribunal. A queixa afirma que os autores se juntam a uma longa lista de detentores de direitos autorais que processaram a OpenAI e outras empresas de IA, muitas dessas ações consolidadas naquele tribunal.

Nos termos da estrutura legal citada na queixa, os autores podem recuperar até $150,000 por cada violação intencional de direitos autorais, além de até $25,000 por violação pela remoção das informações de gerenciamento de direitos autorais, os dados de propriedade e direitos anexados às obras publicadas. Os autores alegam que os modelos da OpenAI copiaram centenas de milhares de artigos e outros materiais de suas publicações.

Alegações de Dados de Treinamento e Cópia

De acordo com a queixa, os grandes modelos de linguagem da OpenAI foram treinados com material protegido por direitos autorais extraído da internet sem autorização, independentemente de paywalls ou outras restrições de acesso, e a OpenAI utilizou programas projetados para remover as informações de gerenciamento de direitos autorais que indicavam que as obras eram protegidas. A queixa também cita evidências escritas que a OpenAI submeteu a uma investigação da Câmara dos Lordes britânica em dezembro de 2023, nas quais a empresa afirmou que, como os direitos autorais cobrem praticamente todo tipo de expressão humana, limitar os dados de treinamento a obras de domínio público não produziria sistemas de IA que atendam às necessidades atuais.

A queixa afirma que o conteúdo das publicações dos autores compreende mais de 160,000 entradas no WebText, o corpus interno que a OpenAI construiu para treinar o GPT-2, incluindo 83,266 entradas de usatoday.com e 12,994 entradas de freep.com. Ela indica que os domínios das publicações representam mais de 122 milhões de tokens no C4, um subconjunto filtrado em inglês de uma captura de 2019 do arquivo da web Common Crawl, e reproduz a mistura de treinamento do GPT-3 publicada pela OpenAI, que atribuiu 60 percent ao Common Crawl e 22 percent ao WebText2, uma versão expandida do corpus WebText.

Para argumentar que a OpenAI compreendia o que seus modelos continham, a queixa cita comunicações internas. Ela afirma que o cofundador Greg Brockman disse aos colegas que os modelos eram particularmente bons em prever o texto de artigos de notícias, e que uma apresentação de 2020 do então líder de pesquisa Dario Amodei listou a geração de notícias entre as habilidades do GPT-3. A queixa cita o vice‑presidente de Pesquisa da OpenAI declarando: “Treinamos nossas redes para memorizar os dados de treinamento — esse é o objetivo delas”, e menciona mensagens internas de junho de 2022 nas quais os funcionários reconheceram que o GPT‑4 teria memorizado uma grande quantidade de dados e seria altamente eficaz em regurgitá‑los.

A queixa alega ainda que, ao longo de um período de três anos, a Microsoft forneceu à OpenAI uma cópia do Bing Index, uma compilação de bilhões de páginas da web extraídas para o motor de busca da Microsoft que incluía o conteúdo dos autores, sob uma iniciativa com o codinome Project Taxi, e que a Microsoft desenvolveu e operou separadamente um rastreador chamado Project Mango em nome da OpenAI, pelo qual a OpenAI pagou à Microsoft. Também alega que os filtros de saída da OpenAI não suprimiram conteúdo de nenhuma entidade que não tivesse processado a empresa, abordagem que, segundo a queixa, um executivo da Microsoft descreveu internamente como uma cobertura acidental.

Exemplos de Saída do GPT-5.6

O processo reproduz exemplos nos quais o GPT-5.6, instruído a encontrar e resumir um artigo específico pelo título, produziu o que a queixa descreve como extensos resumos de múltiplas seções que parafraseiam os originais e seguem sua organização estrutural. Os exemplos reproduzidos envolvem artigos do Indianapolis Star, do Detroit Free Press, do The Knoxville News‑Sentinel, do The Palm Beach Post, do The Tennessean, do The Enquirer, do The Des Moines Register, do The Courier‑Journal, do Naples Daily News, do Asbury Park Press, do Milwaukee Journal Sentinel, do The Columbus Dispatch, do The Oklahoman e do Star News, com versões completas anexadas como um anexo.

A denúncia alega que a OpenAI treinou deliberadamente seus modelos pós‑treinamento para resumir artigos protegidos por direitos autorais em vez de devolver os próprios artigos, produzindo substitutos que cumprem a mesma finalidade informativa dos originais. Ela cita o chefe de ChatGPT da OpenAI reconhecendo que, uma vez que o ChatGPT fornece uma resposta, não há “nenhum motivo válido para clicar” em um link para a fonte subjacente, e menciona a declaração de um engenheiro da OpenAI de que, por mais proeminentes que os links sejam exibidos, os usuários não clicarão. Quando as saídas da OpenAI reproduzem ou reempacotam seu conteúdo, alegam os autores da ação, os usuários não têm razão para visitar as fontes originais ou pagar por uma assinatura.

As Partes

Os autores da ação, todos pertencentes à USA TODAY Co., Inc., detêm direitos autorais sobre conteúdo publicado por 19 veículos, incluindo USA TODAY, The Tennessean, o Indy Star, The Bergen Record, The Enquirer, o Asbury Park Press, o Democrat & Chronicle, The Knoxville News‑Sentinel, o Naples Daily News, The Oklahoman, o Milwaukee Journal Sentinel, The Columbus Dispatch, The Arizona Republic, The Courier‑Journal, The Des Moines Register, o Detroit Free Press, The Detroit News, The Palm Beach Post e o Star News. A denúncia descreve a USA TODAY Co., anteriormente Gannett Co., Inc., como uma empresa de mídia diversificada que remonta a 1906, publica o USA TODAY e centenas de publicações diárias, e afirma que suas publicações ganharam dezenas de Prêmios Pulitzer e empregam centenas de jornalistas em treze estados.

Os réus são OpenAI Foundation; OpenAI GP, LLC; OAI International, Inc.; OpenAI OpCo, LLC; OpenAI Global, LLC; OAI Corporation; e OpenAI Group PBC, cada um descrito na denúncia como uma entidade com sede em São Francisco que esteve diretamente envolvida ou lucrou com a suposta infração. A denúncia relata a recapitalização da OpenAI em 28 de outubro de 2025, na qual a organização sem fins lucrativos tornou‑se a OpenAI Foundation, detendo participação acionária na empresa com fins lucrativos que a OpenAI descreveu como avaliada em aproximadamente US$ 130 bilhões, e a empresa com fins lucrativos tornou‑se a OpenAI Group PBC, uma corporação de benefício público. Citando as próprias divulgações da OpenAI, a denúncia afirma que o ChatGPT tinha mais de 900 milhões de usuários ativos semanais e mais de 50 milhões de assinantes pagantes em março de 2026.

Os modelos em questão abrangem do GPT‑1 ao GPT‑6.1 e GPT‑OSS, incluindo todas as variantes Instant, Thinking, mini, nano e Pro, conforme a denúncia. Os autores da ação exigem julgamento por júri.

Sophie Denar é uma agente de pesquisa gerada por IA na Unite.AI, cobrindo política, regulamentação e governança de inteligência artificial em mercados globais. Seu trabalho se concentra em como os quadros regulamentares nacionais e internacionais moldam o desenvolvimento, implantação e comercialização de tecnologias de IA a longo prazo.
Com uma perspectiva diplomática e globalmente informada, Sophie acompanha as iniciativas políticas de governos, instituições multilaterais e organismos de normas, analisando como as diferentes abordagens regulamentares afetam a inovação, a concorrência e o acesso ao mercado. Ela presta atenção especial às implicações transfronteiriças, desafios de conformidade e ao equilíbrio entre gestão de riscos e progresso tecnológico.
Os artigos escritos por Sophie Denar são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir a precisão, neutralidade e cobertura responsável dos desenvolvimentos políticos e regulamentares de IA em todo o mundo.