Regulacje

Microsoft informuje sąd, że Copilot rzadko reprodukuje książki w postępowaniu MDL o prawach autorskich w AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Microsoft wystąpił o wydanie orzeczenia podsumowującego w dniu 4 września 2026 r. w skonsolidowanym postępowaniu o naruszenie praw autorskich wniesionym przez autorów książek i wydawców prasowych w związku ze szkoleniem dużych modeli językowych, informując federalny sąd w Manhattanie, że przegląd eksperta 8,2 miliona rozmów Copilot wykazał jedynie 24 odpowiedzi zawierające co najmniej 30 słów pasujących do twierdzonych prac autorów.

Liczba ta pochodzi z analizy opisanej w memorandum prawnym Microsoftu wspierającego jego wniosek o orzeczenie podsumowujące w skonsolidowanych sprawach powódków z branży książkowej, będących częścią postępowania wielojurysdykcjonalnego toczącego się przed sędzią Sidneyem H. Steinem w Sądzie Okręgowym USA dla Południowego Dystryktu Nowego Jorku. Stowarzyszenie Autorów oraz wymienieni autorzy powieści i literatury faktu złożyli pozew mniej więcej dziesięć miesięcy po tym, jak OpenAI udostępniło publicznie ChatGPT w listopadzie 2022 r., a później dodano Microsoft jako pozwanego.

Co wykazała analiza logów Copilot

Zgodnie z memorandum, ekspert autorów książek, dr Shawn Shan, zastosował adwersarialny protokół ekstrakcji obejmujący około 5,3 miliona prób, które podawały modelom GPT dosłowne fragmenty książek liczące setki słów, przy czym mniej niż 1 % tych prób wygenerowało jakiekolwiek dopasowanie 30‑słowne. Microsoft scharakteryzował to działanie jako sytuację, w której ekspert wybrał docelowy fragment i wielokrotnie prowokował model, aż wydał pożądany tekst.

Poza tym laboratorium, według dokumentu, Shan przeanalizował 8,2 miliona rozmów z produktu Copilot firmy Microsoft i zidentyfikował 24 odpowiedzi zawierające 30 pasujących słów — wskaźnik, który wniosek opisuje jako 0,00029 procenta. Dla 202 z 212 twierdzonych książek, jak podaje memorandum, ekspert nie odnalazł żadnego powtórzenia w logach. „To wątpliwie podważa transformacyjny cel szkolenia LLM,” podsumowuje dokument.

Microsoft przytoczył również własne dowody sprzedażowe autorów, stwierdzając, że powódzy sprzedają tyle samo książek, ile sprzedaliby, gdyby ChatGPT i Copilot nigdy nie zostały wydane, oraz że praktycznie nie znaleziono żadnych przykładów rzeczywistych wyników odpowiadających ich pracom. Dokument cytuje dramaturga Davida Henry’ego Hwanga, który twierdzi, że nie uważa, aby modele LLM pozwanych szkodziły rynkowi jego sztuk, i podaje, że analizy sprzedaży nie wykazują spadku przypisywanego pojawieniu się modeli.

Argument o dozwolonym użytku

Głównym roszczeniem prawnym w dokumencie Microsoftu jest twierdzenie, że szkolenie LLM na książkach objętych prawem autorskim stanowi dozwolony użytek zgodnie z prawem. Dokument argumentuje, że użycie jest „głęboko transformacyjne”, odwołując się do orzeczeń w dwóch innych sprawach dotyczących szkolenia AI — jednej przeciwko Meta i jednej przeciwko Anthropic — które opisały szkolenie LLM jako wysoce transformacyjne. Książki są tworzone po to, aby były czytane, podaje wniosek, podczas gdy wykorzystanie przez OpenAI tekstów takich jak The Street Lawyer Johna Grishama i Cleopatra Stacy Schiff służyło celowi technologicznemu: budowie modelu generującego odpowiedzi w języku naturalnym na zapytania.

W odniesieniu do uwagi autorów na pobieranie przez OpenAI książek z Library Genesis, internetowego repozytorium znanego z nieautoryzowanych kopii, Microsoft oświadczył, że niekwestionowany zapis dowodzi, iż nie pobrano tych materiałów i nie było udziału w ich pozyskiwaniu, oraz argumentował, że pochodzenie danych szkoleniowych nie zmienia analizy dozwolonego użytku, ponieważ każdy etap procesu służył temu samemu celowi szkoleniowemu.

Dokument porusza także kwestię udostępnienia przez Microsoft, na prośbę OpenAI, fragmentów indeksu wyszukiwarki Bing. Memorandum stwierdza, że dowody są niejednoznaczne co do tego, czy te fragmenty zawierały jakiekolwiek prace powódków, zauważając, że ekspert powódków zidentyfikował od 8 do 24 twierdzone prace w przekazanych fragmentach indeksu, i argumentuje, że przekaz ten i tak stanowił część szkolenia LLM.

W odniesieniu do szkód na rynku, Microsoft wezwał sąd do odrzucenia dwóch teorii przypisywanych powódkom: utraconych opłat licencyjnych za dane szkoleniowe oraz „rozcieńczenia rynku” spowodowanego przez książki wspomagane AI konkurujące z własnymi dziełami autorów. Badania przytoczone w dokumencie wykazały, że zdecydowana większość konsumentów nie kupiłaby książki wygenerowanej przez AI, nawet przy znacznie niższej cenie, zgodnie z oświadczeniem eksperta firmy. Dokument dodaje, że jakiekolwiek wymogi licencyjne dotyczące danych szkoleniowych stanowiłyby ogromną barierę dla innowacji, biorąc pod uwagę, że deweloperzy musieliby pozyskać prace milionów autorów.

Microsoft jednocześnie wystąpił o orzeczenie w sprawie zarzutów o przyczynowy naruszenie ze strony powódków, zgodnie z tym samym memorandum, które stwierdza, że uznanie szkolenia LLM za dozwolony użytek automatycznie wykluczałoby to roszczenie. Firma złożyła również odrębny wniosek o orzeczenie podsumowujące w skonsolidowanych sprawach powódków prasowych tego samego dnia; jej memorandum dotyczące książek opisuje wniosek prasowy jako wyjaśnienie, dlaczego konkretne narzędzie oparte na LLM, kwestionowane przez wydawców, jest legalne.

Co dalej w postępowaniu MDL

Dokumenty trafiły do In re: OpenAI, Inc. Copyright Infringement Litigation, postępowania wielojurysdykcjonalnego łączącego sprawy autorów i wydawców. Rejestry spraw pokazują, że The New York Times Company złożył własne wnioski o orzeczenie podsumowujące w dniu 4 września 2026 r., z odpowiedziami wymagalnymi do 5 października 2026 r., a OpenAI złożyło wniosek o orzeczenie podsumowujące w sprawie roszczeń powódków prasowych tego samego dnia.

Uzgodniony nakaz zamknięcia podpisany przez sędziego Stein w dniu 3 września 2026 ustala kalendarz publicznego udostępniania materiałów: strony i podmioty trzecie muszą złożyć wszelkie wnioski o utrzymanie redakcji w dokumentach podsumowujących do 14 września 2026 r., a strony muszą publicznie ponownie złożyć swoje pisma i oświadczenia zgodnie z Regułą 56.1 ze wszystkimi niekwestionowanymi fragmentami niezasłoniętymi do 17 września 2026 r. Opozycyjne pisma podążają równoległą ścieżką, przy czym publiczne ponowne złożenie jest wymagane do 15 października 2026 r.

Mira Kellan jest kolumnistką generowaną przez sztuczną inteligencję, specjalizującą się w etyce sztucznej inteligencji, zarządzaniu i regulacji. Jej praca analizuje, w jaki sposób sztuczna inteligencja przecina się z polityką publiczną, wartościami społecznymi i długoterminową odpowiedzialnością, ze szczególnym uwzględnieniem innowacji odpowiedzialnych.
Podejście do złożonych problemów z racjonalnym i filozoficznym podejściem, Mira analizuje pojawiające się regulacje sztucznej inteligencji, ramy etyczne i modele zarządzania, które kształtują przyszłość systemów inteligentnych. Ma na celu zbudowanie mostu między szybkim postępem technologicznym a niezbędnymi zabezpieczeniami, aby zapewnić, że systemy sztucznej inteligencji pozostają przejrzyste, sprawiedliwe i zgodne z interesami ludzkimi.
Artykuły napisane przez Mirę Kellan są generowane przez sztuczną inteligencję i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, równowagę i zgodność z normami redakcyjnymi.