Регулирование

Microsoft сообщает суду, что Copilot редко воспроизводит книги в деле об авторском праве ИИ (MDL)

mm
Добавьте Unite.AI в избранные источники в Google

Microsoft подала ходатайство о вынесении решения без судебного разбирательства 4 сентября 2026 года в консолидированном деле об авторском праве, инициированном авторами книг и новостными издателями в связи с обучением больших языковых моделей, заявив федеральному суду в Манхэттене, что экспертный обзор 8,2 млн разговоров Copilot выявил лишь 24 ответа, содержащих не менее 30 слов, совпадающих с заявленными произведениями авторов.

Эта цифра получена из анализа, описанного в меморандуме Microsoft по правовым вопросам, поддерживающего его ходатайство о вынесении решения без судебного разбирательства в консолидированных делах истцов‑книг, являющихся частью многопредметного судебного процесса, рассматриваемого судьёй Сидни Х. Стайном в Окружном суде США по Южному округу Нью‑Йорка. Гильдия авторов и указанные авторы художественной и нехудожественной литературы подали иск примерно через десять месяцев после того, как OpenAI запустила ChatGPT для публичного доступа в ноябре 2022 года, позже добавив Microsoft в качестве ответчика.

Что обнаружил анализ журналов Copilot

Согласно меморандуму, эксперт по книгам, д-р Шон Шан, использовал адверсариальный протокол извлечения, включающий примерно 5,3 млн попыток, в ходе которых в модели GPT подавались дословные отрывки из книг длиной в сотни слов, и менее 1 процента этих попыток приводили к совпадению хотя бы в 30 слов. Microsoft охарактеризовала эту процедуру как ситуацию, когда эксперт выбирал целевой отрывок и многократно подсказывал модели, пока она не выдала требуемый текст.

Вне лабораторных условий, как указывается в документе, Шан проанализировал 8,2 млн разговоров из продукта Microsoft Copilot и выявил 24 ответа, содержащих 30 совпадающих слов — показатель, который в документе описывается как 0,00029 процента. По данным меморандума, для 202 из 212 заявленных книг эксперт не обнаружил никакого воспроизведения в журналах. «Это едва ли подрывает трансформативную цель обучения LLM», — заключает документ.

Microsoft также привела собственные данные авторов о продажах, заявив, что истцы продают столько же книг, сколько они бы продавали, если бы ChatGPT и Copilot никогда не были выпущены, и что они практически не нашли примеров реальных результатов, совпадающих с их произведениями. В документе цитируется драматург Дэвид Генри Хван, который заявляет, что не считает, что LLM‑модели ответчиков вредят рынку его пьес, и указывает, что анализ продаж не показывает падения, связанного с появлением моделей.

Аргумент о добросовестном использовании

Основное юридическое утверждение в документе Microsoft состоит в том, что обучение LLM на защищённых авторским правом книгах является добросовестным использованием согласно закону. В документе утверждается, что такое использование «глубоко трансформативно», ссылаясь на решения в двух других делах по обучению ИИ — одном против Meta и другом против Anthropic — которые описывали обучение LLM как высоко трансформативное. Книги созданы для чтения, говорится в документе, тогда как использование OpenAI текстов, таких как The Street Lawyer Джона Гришэма и Cleopatra Стейси Шифф, имело технологическую цель: построить модель, генерирующую ответы на естественном языке на запросы.

Относительно внимания авторов к загрузке книг OpenAI из Library Genesis, онлайн‑репозитория, известного наличием неавторизованных копий, Microsoft заявила, что неоспоримые факты подтверждают, что она не загружала и не участвовала в получении этих наборов данных, и аргументировала, что происхождение обучающих данных не меняет анализ добросовестного использования, поскольку каждый этап процесса служил одной и той же цели обучения.

В документе также рассматривается предоставление Microsoft, по запросу OpenAI, частей индекса поисковой системы Bing. Меморандум указывает, что доказательства неоднозначны относительно того, содержали ли эти части какие‑либо произведения истцов, отмечая, что эксперт истцов обнаружил от 8 до 24 заявленных произведений в переданных частях индекса, и утверждает, что передача всё равно была частью обучения LLM.

Что касается ущерба рынку, Microsoft призвала суд отклонить две теории, приписываемые истцам: потерянные лицензионные сборы за обучающие данные и «размывание рынка» из‑за конкуренции AI‑сгенерированных книг с произведениями самих авторов. Исследования, приведённые в документе, показали, что подавляющее большинство потребителей не купят книгу, сгенерированную ИИ, даже по значительно более низкой цене, согласно заявлению эксперта компании. В документе также добавлено, что любые лицензионные требования к обучающим данным станут огромным препятствием для инноваций, учитывая, что разработчикам необходимо получать произведения миллионов авторов.

Microsoft одновременно подала ходатайство о вынесении решения по исковому заявлению о соучастии в нарушении со стороны истцов, согласно тому же меморандуму, в котором говорится, что признание обучения LLM добросовестным использованием автоматически исключит это требование. Компания также подала отдельное ходатайство о вынесении решения без судебного разбирательства в консолидированных делах новостных истцов в тот же день; её документ по книгам описывает новостной иск как объяснение того, почему конкретный инструмент на основе LLM, оспариваемый издателями, законен.

Что дальше в MDL

Документы были включены в In re: OpenAI, Inc. Copyright Infringement Litigation, многопредметное производство, объединяющее дела авторов и издателей. Записи в деле показывают, что компания The New York Times Company подала свои собственные ходатайства о вынесении решения без судебного разбирательства 4 сентября 2026 года, с ответами, срок которых — 5 октября 2026 года, а OpenAI подала ходатайство о вынесении решения по требованиям новостных истцов в тот же день.

Подписанный судьёй Стайном приказ о запечатывании от 3 сентября 2026 года устанавливает календарь публичного раскрытия материалов: стороны и третьи лица должны подать любые запросы на сохранение редактирования в ходатайствах о вынесении решения без судебного разбирательства до 14 сентября 2026 года, а стороны обязаны публично повторно подать свои ходатайства и заявления по правилу 56.1 с полностью невыделенными частями к 17 сентября 2026 года. Противоположные ходатайства следуют параллельному графику, при этом публичное повторное представление требуется к 15 октября 2026 года.

Мира Келлан - колумнист, специализирующийся на этике ИИ, управлении и регулировании. Ее работа исследует, как искусственный интеллект пересекается с государственной политикой, социальными ценностями и долгосрочной ответственностью, с упором на ответственные инновации.
Подходя к сложным вопросам с рациональной и философской точки зрения, Мира анализирует возникающие регулирования ИИ, этические рамки и модели управления, формирующие будущее интеллектуальных систем. Она стремится мостить разрыв между быстрым технологическим прогрессом и необходимыми гарантиями, чтобы системы ИИ оставались прозрачными, справедливыми и соответствовали человеческим интересам.
Статьи, написанные Мирой Келлан, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, баланс и соблюдение редакционных стандартов.