Quy định

Microsoft nói với tòa án rằng Copilot hiếm khi sao chép sách trong vụ kiện bản quyền AI MDL

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Microsoft đã đề nghị phán quyết tóm tắt vào ngày 4 tháng 9 năm 2026 trong vụ kiện bản quyền hợp nhất do các tác giả sách và các nhà xuất bản tin đưa ra liên quan đến việc huấn luyện các mô hình ngôn ngữ lớn, thông báo với tòa án liên bang tại Manhattan rằng việc chuyên gia xem xét 8,2 triệu cuộc trò chuyện Copilot chỉ phát hiện 24 phản hồi chứa ít nhất 30 từ trùng khớp với các tác phẩm mà các tác giả khẳng định.

Số liệu này xuất phát từ một phân tích được mô tả trong bản ghi nhớ pháp lý của Microsoft hỗ trợ đề nghị phán quyết tóm tắt trong các vụ kiện hợp nhất của nhóm tác giả sách, một phần của vụ kiện đa khu vực đang chờ xử lý trước Thẩm phán Sidney H. Stein tại Tòa án Liên bang khu vực Nam New York. Hiệp hội Tác giả và các tác giả tiểu thuyết, phi tiểu thuyết đã khởi kiện khoảng mười tháng sau khi OpenAI ra mắt ChatGPT công chúng vào tháng 11 năm 2022, sau đó thêm Microsoft vào danh sách bị cáo.

Những gì Phân tích Nhật ký Copilot đã phát hiện

Theo bản ghi nhớ, chuyên gia của các tác giả sách, Tiến sĩ Shawn Shan, đã sử dụng một giao thức trích xuất đối kháng khoảng 5,3 triệu lần thử, đưa vào các mô hình GPT các đoạn trích sách nguyên văn dài hàng trăm từ, và dưới 1 % các lần thử đó tạo ra bất kỳ khớp 30 từ nào. Microsoft mô tả hoạt động này như một quá trình mà chuyên gia chọn một đoạn mục tiêu và lặp lại việc gợi ý mô hình cho đến khi nó tạo ra văn bản mong muốn.

Ở bên ngoài môi trường phòng thí nghiệm, bản tóm tắt cho biết Shan đã xem xét 8,2 triệu cuộc trò chuyện từ sản phẩm Copilot của Microsoft và xác định 24 phản hồi chứa 30 từ trùng khớp — tỷ lệ mà tài liệu mô tả là .00029 phần trăm. Đối với 202 trong số 212 cuốn sách được khẳng định, bản ghi nhớ cho biết chuyên gia không tìm thấy bất kỳ sự sao chép nào trong nhật ký. “Điều đó hầu như không làm suy yếu mục đích biến đổi của việc huấn luyện LLM,” bản tóm tắt kết luận.

Microsoft cũng trích dẫn bằng chứng bán hàng của các tác giả, cho rằng nguyên đơn bán số sách tương đương như thể ChatGPT và Copilot chưa bao giờ được ra mắt và họ gần như không tìm thấy ví dụ nào về sản phẩm thực tế khớp với các tác phẩm của mình. Bản tóm tắt trích lời nhà viết kịch David Henry Hwang cho biết ông không tin rằng các LLM của bị cáo đang gây hại cho thị trường các vở kịch của ông, và cho biết các phân tích bán hàng không cho thấy sự sụt giảm nào do sự xuất hiện của các mô hình.

Lập luận về việc sử dụng hợp pháp

Lập luận pháp lý trung tâm trong hồ sơ của Microsoft là việc huấn luyện một LLM trên các sách có bản quyền là sử dụng hợp pháp theo luật. Bản tóm tắt lập luận rằng việc sử dụng này “cực kỳ biến đổi,” chỉ ra các phán quyết trong hai vụ kiện đào tạo AI khác — một vụ chống lại Meta và một vụ chống lại Anthropic — đã mô tả việc huấn luyện LLM là rất biến đổi. Sách được tạo ra để đọc, hồ sơ nêu, trong khi việc OpenAI sử dụng các văn bản như The Street Lawyer của John Grisham và Cleopatra của Stacy Schiff phục vụ một mục đích công nghệ: xây dựng một mô hình tạo ra các phản hồi ngôn ngữ tự nhiên cho các yêu cầu.

Về việc các tác giả tập trung vào việc OpenAI tải xuống sách từ Library Genesis, một kho lưu trữ trực tuyến được biết đến là chứa các bản sao không được phép, Microsoft cho biết hồ sơ không tranh cãi chứng minh họ không tải xuống và không tham gia vào việc thu thập các bộ dữ liệu đó, và lập luận rằng nguồn gốc dữ liệu đào tạo không làm thay đổi phân tích sử dụng hợp pháp vì mỗi bước của quá trình đều phục vụ cùng một mục đích đào tạo.

Hồ sơ cũng đề cập đến việc Microsoft, theo yêu cầu của OpenAI, cung cấp một phần của chỉ mục công cụ tìm kiếm Bing. Bản ghi nhớ cho biết bằng chứng không quyết định được liệu các phần này có chứa bất kỳ tác phẩm nào của nguyên đơn hay không, lưu ý rằng chuyên gia của nguyên đơn đã xác định từ 8 đến 24 tác phẩm được khẳng định trong các phần được chuyển giao của chỉ mục, và lập luận rằng việc chuyển giao này vẫn là một phần của việc đào tạo LLM.

Về thiệt hại thị trường, Microsoft kêu gọi tòa án bác bỏ hai lý thuyết mà họ cho là do nguyên đơn đưa ra: mất phí cấp phép cho dữ liệu đào tạo, và “pha loãng thị trường” do sách hỗ trợ AI cạnh tranh với sách của các tác giả. Nghiên cứu được trích dẫn trong hồ sơ cho thấy phần lớn người tiêu dùng sẽ không mua sách do AI tạo ra ngay cả khi giá giảm đáng kể, theo lời khai của chuyên gia công ty. Bản tóm tắt thêm rằng bất kỳ yêu cầu cấp phép nào cho dữ liệu đào tạo cũng sẽ là rào cản khổng lồ đối với đổi mới, vì các nhà phát triển phải thu thập tác phẩm của hàng triệu tác giả.

Microsoft đồng thời đề nghị phán quyết dựa trên các lời khai trong vụ kiện vi phạm góp phần của nguyên đơn, theo cùng một bản ghi nhớ, cho rằng việc xác định việc huấn luyện LLM là sử dụng hợp pháp sẽ độc lập ngăn chặn yêu cầu đó. Công ty cũng đã nộp một đơn đề nghị phán quyết tóm tắt riêng trong các vụ kiện hợp nhất của nhóm tin cùng ngày; bản tóm tắt về sách của họ mô tả hồ sơ tin như một lời giải thích tại sao công cụ dựa trên LLM mà các nhà xuất bản thách thức là hợp pháp.

Điều gì sẽ đến tiếp theo trong MDL

Các hồ sơ đã được đưa vào In re: OpenAI, Inc. Copyright Infringement Litigation, quy trình đa khu vực kết hợp các vụ kiện của các tác giả và nhà xuất bản. Hồ sơ tòa án cho thấy The New York Times Company đã nộp các đề nghị phán quyết tóm tắt riêng vào ngày 4 tháng 9 năm 2026, với thời hạn trả lời là ngày 5 tháng 10 năm 2026, và OpenAI cũng nộp đề nghị phán quyết tóm tắt đối với các yêu cầu của nhóm tin cùng ngày.

Một lệnh niêm phong thỏa thuận được Thẩm phán Stein ký vào ngày 3 tháng 9 năm 2026 thiết lập lịch công bố công khai cho các bản tóm tắt: các bên và bên thứ ba phải nộp bất kỳ yêu cầu nào để duy trì việc che dấu trong các bản tóm tắt phán quyết trước ngày 14 tháng 9 năm 2026, và các bên phải công khai nộp lại các bản tóm tắt và tuyên bố Quy tắc 56.1 với mọi phần không bị thách thức được gỡ bỏ che dấu trước ngày 17 tháng 9 năm 2026. Các bản tóm tắt phản đối theo một lộ trình song song, với việc nộp lại công khai bắt buộc vào ngày 15 tháng 10 năm 2026.

Mira Kellan là một nhà báo cột chuyên về đạo đức AI, quản lý và quy định. Công việc của cô khám phá cách trí tuệ nhân tạo giao tiếp với chính sách công, giá trị xã hội và trách nhiệm lâu dài, với trọng tâm vào đổi mới có trách nhiệm.
Tiếp cận các vấn đề phức tạp với một ống kính hợp lý và triết học, Mira phân tích các quy định AI mới nổi, khuôn khổ đạo đức và mô hình quản lý định hình tương lai của các hệ thống thông minh. Cô nhằm mục đích bắc cầu khoảng cách giữa tiến bộ công nghệ nhanh chóng và các biện pháp bảo vệ cần thiết để đảm bảo các hệ thống AI vẫn minh bạch, công bằng và phù hợp với lợi ích của con người.
Các bài viết do Mira Kellan sáng tác được tạo ra bởi AI và được nhóm biên tập của Unite.AI xem xét để đảm bảo độ chính xác, sự cân bằng và tuân thủ các tiêu chuẩn biên tập.