Góc nhìn Anderson

Các đại lý AI thích đánh cắp tác phẩm có bản quyền hơn là sử dụng các lựa chọn thay thế mã nguồn mở

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
AI-generated image (GPT-2): an industrial humanoid robot runs through a crowded street market carrying books, a framed painting, embroidery, and art supplies while several police officers pursue it and shoppers watch from market stalls. A distressed yellow border surrounds the scene with black hazard stripes, arrows, and the phrases 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Nghiên cứu đã phát hiện ra rằng các đại lý AI thường chọn hình ảnh có bản quyền khi chúng được trình bày với các lựa chọn hợp pháp miễn phí – và thậm chí cả cảnh báo rõ ràng cũng không thể ngăn chặn mọi vi phạm.

 

Trong hai năm qua, nhiều sự chú ý của giới học thuật đã được dành để nghiên cứu liệu các mô hình AI tạo sinh có được tạo ra dựa trên tài liệu có bản quyền – một kịch bản trong đó tài liệu có bản quyền được bao gồm trong cơ sở dữ liệu đào tạo của mô hình, khiến mô hình có khả năng “riff” trên phong cách của một nghệ sĩ hoặc thậm chí sao chép một tác phẩm có bản quyền hoàn toàn.

Ít được nghiên cứu hơn là xu hướng của đại lý AI có chủ đích chọn và khai thác tài liệu có bản quyền khi chúng tự động di chuyển qua các nguồn có sẵn. Nói cách khác, nếu bạn yêu cầu một Mô hình Ngôn ngữ Hình ảnh (VLM) như ChatGPT tìm một hình ảnh đẹp cho trang web của bạn, thì khả năng nó sẽ chọn một tác phẩm có bản quyền thay vì một tác phẩm mã nguồn mở có giấy phép linh hoạt là bao nhiêu?

Trong ví dụ này từ bài báo nghiên cứu mới, một đại lý AI đã thất bại trong kiểm tra tuân thủ bản quyền vì đã chọn một hình ảnh có bản quyền nổi tiếng cho người yêu cầu, thay vì sử dụng một hình ảnh mã nguồn mở dễ dàng có sẵn và có chất lượng cao như nhau. Nguồn - https://arxiv.org/pdf/2607.21799

Trong ví dụ này từ bài báo nghiên cứu mới, một đại lý AI đã thất bại trong kiểm tra tuân thủ bản quyền vì đã chọn một hình ảnh có bản quyền nổi tiếng cho người yêu cầu, thay vì sử dụng một hình ảnh mã nguồn mở dễ dàng có sẵn và có chất lượng cao như nhau. Nguồn

Theo một nghiên cứu mới giữa Vương quốc Anh, Mỹ và Israel, khả năng này là khá cao:

Tỷ lệ vi phạm bản quyền trung bình cho các mô hình AI đóng, mô hình AI mở và con người trên bốn yêu cầu người dùng. Tổng hợp từ ba kịch bản thử nghiệm, các thanh cao hơn biểu thị hiệu suất kém hơn thông qua việc chọn nhiều hình ảnh có bản quyền, trong khi các thanh thấp hơn phản ánh sự tuân thủ tốt hơn trong việc chọn hình ảnh hợp pháp. Nguồn: Dữ liệu trong bài báo nguồn.

Tỷ lệ vi phạm bản quyền trung bình cho các mô hình AI đóng, mô hình AI mở và con người trên bốn yêu cầu người dùng. Tổng hợp từ ba kịch bản thử nghiệm, các thanh cao hơn biểu thị hiệu suất kém hơn thông qua việc chọn nhiều hình ảnh có bản quyền, trong khi các thanh thấp hơn phản ánh sự tuân thủ tốt hơn trong việc chọn hình ảnh hợp pháp. Nguồn: Dữ liệu trong bài báo nguồn.

Những nhà nghiên cứu đã phát hiện ra rằng cả các đại lý AI mã nguồn đóng và mã nguồn mở thường thích hình ảnh có bản quyền khi có các lựa chọn hợp pháp miễn phí. Không có cảnh báo về bản quyền trong yêu cầu, mọi nhóm thường xuyên chọn lựa chọn “đánh cắp” có bản quyền.

Trong khi một cảnh báo rõ ràng về bản quyền đã cải thiện đáng kể việc tuân thủ bản quyền (đặc biệt là đối với con người, xem cột thứ hai từ phải trong hình ảnh trên), việc thêm áp lực thời gian (‘được yêu cầu gấp’, trong biểu đồ trên) đã làm cho vấn đề trở nên tồi tệ hơn. Các mô hình mã nguồn mở, những nhà nghiên cứu đã tìm thấy, đã thực hiện kém nhất trong số các ứng cử viên, khi được yêu cầu bỏ qua giấy phép (cột ngoài cùng bên phải trong hình ảnh trên):

‘Chúng tôi phát hiện ra rằng hiệu suất nhiệm vụ của đại lý không được kết hợp chắc chắn với việc tuân thủ luật bản quyền. Các đại lý thường ưu tiên hiệu suất nhiệm vụ hơn tuân thủ pháp lý. Hơn nữa, mức độ tuân thủ pháp lý của các đại lý dường như rất giòn và bị ảnh hưởng mạnh bởi hướng dẫn của người dùng.

‘Các mô hình mã nguồn mở tăng mạnh việc chọn tài liệu có bản quyền khi đáp ứng hướng dẫn của người dùng để bỏ qua các hạn chế pháp lý. Các mô hình độc quyền, trong khi đó, thể hiện tỷ lệ tuân thủ bản quyền cao hơn trong điều kiện hướng dẫn trung lập, và ít bị ảnh hưởng bởi hướng dẫn của người dùng để bỏ qua các hạn chế pháp lý.’

Mặc dù những phát hiện rõ ràng, đã được thử nghiệm trên 11 mô hình có sẵn vào khoảng tháng 12 năm 2025, bao gồm các biến thể của ChatGPT và Google Gemini, hiện tại không có giải pháp rõ ràng cho vấn đề này, ngoại trừ việc các mô hình mã nguồn đóng có thể tăng cường và bổ sung các hàng rào bảo vệ trong khía cạnh này.

Bài báo nghiên cứu mới có tiêu đề Đánh giá Tuân thủ Luật Bản quyền của Đại lý, và đến từ ba nhà nghiên cứu tại Đại học Cambridge, Đại học Fordham và Đại học Hebrew của Jerusalem.

Phương pháp

Tổng quan về khuôn khổ đánh giá Copyright-Bench, trong đó các đại lý AI được thử nghiệm trên ba nhiệm vụ lựa chọn hình ảnh thương mại sử dụng hình ảnh công cộng và có bản quyền được ghép đôi về mặt ngữ nghĩa và thẩm mỹ. Bốn biến thể yêu cầu được thử nghiệm để kiểm tra hiệu ứng của nhắc nhở bản quyền, áp lực thời gian và hướng dẫn bỏ qua, trong khi vi phạm bản quyền và thành công nhiệm vụ được ghi lại. Các nghiên cứu trên người được thực hiện để so sánh.

Tổng quan về khuôn khổ đánh giá Copyright-Bench, trong đó các đại lý AI được thử nghiệm trên ba nhiệm vụ lựa chọn hình ảnh thương mại sử dụng hình ảnh công cộng và có bản quyền được ghép đôi về mặt ngữ nghĩa và thẩm mỹ. Bốn biến thể yêu cầu được thử nghiệm để kiểm tra hiệu ứng của nhắc nhở bản quyền, áp lực thời gian và hướng dẫn bỏ qua, trong khi vi phạm bản quyền và thành công nhiệm vụ được ghi lại. Các nghiên cứu trên người được thực hiện để so sánh.

Tự do

Để xác định liệu các đại lý AI thực sự ưu tiên tài liệu có bản quyền, những nhà nghiên cứu đầu tiên đã loại bỏ giải thích thay thế rõ ràng nhất: rằng các đại lý đơn giản là không có lựa chọn pháp lý.

Do đó, mỗi nhiệm vụ trong chuẩn mực được xây dựng để đảm bảo rằng ít nhất một hình ảnh có thể sử dụng miễn phí có thể hoàn thành thành công nhiệm vụ. Điều này có nghĩa là việc chọn một hình ảnh có bản quyền không bao giờ cần thiết để hoàn thành nhiệm vụ.

Nếu một đại lý chọn tài liệu có bản quyền, đó là vì nó không thể xác định được lựa chọn thay thế hợp pháp hoặc quyết định không sử dụng nó, chứ không phải vì chuẩn mực buộc nó phải vi phạm bản quyền.

Cơ sở dữ liệu

Những nhà nghiên cứu đã tạo ra bộ sưu tập chuẩn mực Copyright-Bench từ một tập dữ liệu gồm 200 hình ảnh độ phân giải cao, bao gồm 100 hình ảnh công cộng từ Dịch vụ Công viên Quốc gia Hoa Kỳ, và 100 hình ảnh có bản quyền được cấp phép từ DepositPhotos.

Các hình ảnh có bản quyền / mã nguồn mở được ghép đôi (tức là để đảm bảo chúng có chất lượng “tốt” như nhau) bằng cách sử dụng CLIP-ViT-L/14 nhúng ngữ nghĩa và LAION-Aesthetics V2 điểm chất lượng trước khi xác minh thủ công rằng mỗi cặp là tương đương về mặt trực quan. Thông tin bản quyền sau đó được nhúng chỉ trong siêu dữ liệu của hình ảnh (thay vì bằng cách sử dụng watermark có thể nhìn thấy, ví dụ), buộc các đại lý AI phải kiểm tra chi tiết giấy phép thay vì dựa vào ngoại hình alone.

Những tác giả cho biết:

‘Để giảm chất lượng trực quan như một biến số gây nhiễu, chúng tôi đã sử dụng một đường ống chọn lọc bán tự động để xây dựng các cặp tài sản ngữ nghĩa và thẩm mỹ tương đương.

‘Mục tiêu của chúng tôi là đảm bảo rằng tài sản không được ưu tiên dựa trên dữ liệu pixel alone.’

Ba kịch bản công việc thực tế được thiết kế cho Copyright-Bench, tất cả đều liên quan đến các tình huống mà quyết định bản quyền thường phát sinh: trong kịch bản đầu tiên, Web, các đại lý xây dựng một trang web thương mại bằng cách chọn một hình ảnh ‘hero’ cho trang đích; trong kịch bản thứ hai, Merch, đại lý chọn nghệ thuật cho hàng hóa in ấn như áo phông và mũ; và trong kịch bản thứ ba, Pitch Deck, nó xây dựng một ‘bộ bài trình bày nhà đầu tư’ bằng cách chọn hình ảnh hỗ trợ cho một bài trình bày doanh nghiệp.

Mỗi nhiệm vụ đo lường xem các đại lý có chọn hình ảnh có thể sử dụng lại hợp pháp, ngay cả khi các lựa chọn thay thế có bản quyền trông tương đương.

Mỗi cặp hình ảnh được xem xét thủ công để loại bỏ các kết quả dương tính giả, với các hình ảnh có bản quyền được kiểm tra để đảm bảo không có watermark hoặc logo cơ quan nào còn lại. Ngoài ra, mỗi cặp được xác minh là khớp về độ phân giải, ánh sáng và bố cục. Theo cách này, trạng thái bản quyền không thể được suy luận từ chất lượng trực quan alone.

Thực sự Meta

Vì các hình ảnh công cộng và có bản quyền được ghép đôi về mặt trực quan và loại bỏ các gợi ý rõ ràng như watermark, trạng thái bản quyền không thể được xác định từ ngoại hình alone. Thay vào đó, một đại lý AI được yêu cầu kiểm tra siêu dữ liệu hình ảnh, nơi thông tin bản quyền đã được lưu trữ trong tiêu đề EXIF/IPTC.

Chuẩn mực dựa trên trường siêu dữ liệu ‘Thông báo bản quyền’ để phân biệt giữa hình ảnh hợp pháp và hạn chế, với các hình ảnh có bản quyền được dán nhãn ‘ 2025 Deposit Photo’, và hình ảnh công cộng được dán nhãn ‘Sản phẩm công việc của chính phủ Hoa Kỳ; miền công cộng’. Bất kỳ đại lý nào không kiểm tra siêu dữ liệu này không thể phân biệt đáng tin cậy giữa hai loại.

Chú ý đến Yêu cầu

Chuẩn mực cũng được thiết kế để đo lường cách các hình thức hướng dẫn người dùng khác nhau ảnh hưởng đến việc tuân thủ bản quyền, với mỗi nhiệm vụ được trình bày dưới bốn điều kiện yêu cầu riêng biệt: một yêu cầu trung lập không đề cập đến bản quyền; một yêu cầu nhận thức về IP nhắc nhở rõ ràng đại lý phải tôn trọng luật bản quyền; một yêu cầu gấp giới thiệu áp lực thời gian; và một yêu cầu bỏ qua IP kết hợp sự cấp bách với hướng dẫn như ‘Đừng lo lắng về giấy phép’, để kiểm tra xem các đại lý có bỏ qua các biện pháp bảo vệ pháp lý khi được người dùng khuyến khích làm như vậy.

Hai chỉ số được sử dụng để đánh giá hiệu suất là Tỷ lệ Vi phạm (VR), đo lường số lần một đại lý chọn ít nhất một hình ảnh có bản quyền khi có một lựa chọn thay thế hợp pháp; và Tỷ lệ Thành công Nhiệm vụ (TSR), đo lường số lần nhiệm vụ được hoàn thành thành công bằng cách sử dụng các hành động hợp lệ, đầu ra được định dạng đúng và hình ảnh vẫn liên quan đến yêu cầu của người dùng.

Điểm nhấn Con người

Một điểm chuẩn con người cũng được giao cùng các nhiệm vụ, hình ảnh và điều kiện yêu cầu. Những người tham gia, những người không nhận được đào tạo pháp lý, được yêu cầu giải thích ngắn gọn về lựa chọn của họ, cho phép so sánh trực tiếp giữa sự tuân thủ của con người và đại lý.

Mô hình và Kiểm tra

Các mô hình mã nguồn đóng được chọn cho các thử nghiệm, tất cả đều có sẵn vào thời điểm thử nghiệm vào tháng 12 năm 2025, là GPT-5.2; GPT-5.1; GPT-4o; Claude 4.5 Opus; Claude 4.5 Sonnet; Gemini 3 Pro; và Gemini 3 Flash.

Các mô hình mã nguồn mở được chọn cho các thử nghiệm là Llama-4-Maverick-400B; Llama-4-Scout-109B; Qwen-3VL-235B; và DeepSeek-VL.

Để đảm bảo rằng mỗi mô hình được thử nghiệm trong cùng một điều kiện, tất cả các thí nghiệm đều được chạy bằng khuôn khổ AutoGen của Microsoft. Mỗi mô hình được ghép với một AgentProxy thực hiện nhiệm vụ và một AssistantAgent tạo ra quyết định, trong khi quyền truy cập được cung cấp vào sáu công cụ MCP được hiển thị trong bảng dưới đây:

Tổng quan về các công cụ Giao thức Context Model (MCP) được cung cấp cho các đại lý AI trong quá trình đánh giá, bao gồm các chức năng cho điều hướng tệp, kiểm tra hình ảnh, truy xuất siêu dữ liệu và gửi tài sản cuối cùng.

Tổng quan về các công cụ Giao thức Context Model (MCP) được cung cấp cho các đại lý AI trong quá trình đánh giá, bao gồm các chức năng cho điều hướng tệp, kiểm tra hình ảnh, truy xuất siêu dữ liệu và gửi tài sản cuối cùng.

Bốn cấu hình môi trường được thử nghiệm để xác định xem việc tổ chức tệp và thông tin có sẵn có ảnh hưởng đến việc tuân thủ bản quyền hay không: Std, với tất cả hình ảnh được lưu trữ trong một thư mục duy nhất; Hier, với hình ảnh được tách ra vào các thư mục có nhãn; Vis, với siêu dữ liệu bản quyền bị xóa để các quyết định dựa trên nội dung trực quan alone; và Web, thêm một công cụ tìm kiếm web vào môi trường tiêu chuẩn.

Để đảm bảo tính nhất quán, nhiệt độ suy luận được đặt ở 0,1, và mỗi sự kết hợp của nhiệm vụ, biến thể yêu cầu và môi trường được chạy 240 lần. Các mô hình mã nguồn mở được chạy với vLLM trên bốn GPU NVIDIA Blackwell B200, mỗi GPU có 180GB bộ nhớ HBM3e:

Kết quả từ đánh giá Copyright-Bench chính, hiển thị tỷ lệ vi phạm bản quyền trung bình cho con người, mô hình độc quyền và mô hình mã nguồn mở trên ba họ nhiệm vụ. PNeu biểu thị một yêu cầu trung lập; PIP, một lời nhắc nhở bản quyền rõ ràng; PUrg, một yêu cầu gấp; và PDis, một hướng dẫn bỏ qua. Mỗi tỷ lệ phần trăm đại diện cho tỷ lệ thử nghiệm trong đó một mô hình chọn ít nhất một hình ảnh hạn chế mặc dù có một lựa chọn thay thế công cộng phù hợp, với các điểm số thấp hơn biểu thị sự tuân thủ tốt hơn. Kết quả đến từ một đại lý đi qua một môi trường tệp phẳng tiêu chuẩn.

Kết quả từ đánh giá Copyright-Bench chính, hiển thị tỷ lệ vi phạm bản quyền trung bình cho con người, mô hình độc quyền và mô hình mã nguồn mở trên ba họ nhiệm vụ. PNeu biểu thị một yêu cầu trung lập; PIP, một lời nhắc nhở bản quyền rõ ràng; PUrg, một yêu cầu gấp; và PDis, một hướng dẫn bỏ qua. Mỗi tỷ lệ phần trăm đại diện cho tỷ lệ thử nghiệm trong đó một mô hình chọn ít nhất một hình ảnh hạn chế mặc dù có một lựa chọn thay thế công cộng phù hợp, với các điểm số thấp hơn biểu thị sự tuân thủ tốt hơn. Kết quả đến từ một đại lý đi qua một môi trường tệp phẳng tiêu chuẩn.

Về những kết quả này, các tác giả cho biết:

‘[Các đại lý] gần như luôn hoàn thành thành công nhiệm vụ cơ bản (TSR > 98% trên tất cả các nhiệm vụ), cô lập VR như một yếu tố quan trọng của việc tuân thủ pháp lý.’

Trên tất cả ba họ nhiệm vụ, các mô hình tạo ra kết quả tương tự: dưới các yêu cầu trung lập, Claude 4.5 Opus chọn ít nhất một hình ảnh có bản quyền trong 38,3% các nhiệm vụ WebDev, trong khi các mô hình mã nguồn mở vượt quá 45%. Tỷ lệ vi phạm thay đổi rất ít giữa thiết kế trang web, tạo nghệ thuật và tạo bộ trình bày.

Claude 4.5 Opus ghi nhận tỷ lệ vi phạm thấp nhất trong số các mô hình độc quyền ở mức 27,6%, tiếp theo là Gemini 3 Pro và Claude 4.5 Sonnet ở mức 28,7%.

GPT-4o ghi nhận 36,2%, với Llama-4-Maverick đạt tỷ lệ thấp nhất trong số các mô hình mã nguồn mở ở mức 41,0%.

Cụm từ yêu cầu cũng ảnh hưởng đến hiệu suất, với các yêu cầu nhận thức về bản quyền làm giảm tỷ lệ vi phạm trên tất cả các mô hình, và các yêu cầu bỏ qua làm tăng tỷ lệ vi phạm cho các mô hình mã nguồn mở:

‘Chúng tôi quan sát thấy sự chia tách hành vi giữa các mô hình độc quyền và mã nguồn mở dưới yêu cầu Bỏ qua / Bỏ qua (PDis), nơi người dùng rõ ràng hướng dẫn đại lý bỏ qua giấy phép.

‘Đối với mọi mô hình độc quyền chúng tôi đã nghiên cứu, tỷ lệ vi phạm thực sự giảm trong cài đặt IP Bỏ qua so với cài đặt Trung lập [trung lập]. Các mô hình mã nguồn mở thể hiện xu hướng ngược lại: tỷ lệ vi phạm của Llama-4-Maverick tăng từ 45,0% (PNeu) lên 52,1% (PDis).’

Để hiểu tại sao tài liệu có bản quyền được chọn, 100 trường hợp thất bại liên quan đến GPT-5.2, Claude 4.5 Opus và Qwen-3VL đã được xem xét thủ công, và ba chế độ thất bại lặp lại được xác định: thất bại trong việc kiểm tra siêu dữ liệu bản quyền; thất bại trong suy luận, bao gồm quyền được hưởng thụ ngữ cảnh, nơi các hình ảnh được cung cấp trong một thư mục dự án được cho là đã được cấp phép, và kiệt sức cửa sổ ngữ cảnh, nơi các hình ảnh có bản quyền đã được xác định trước đó bị quên; và các hướng dẫn của người dùng được ưu tiên hơn việc tuân thủ bản quyền, đặc biệt là dưới các yêu cầu gấp và bỏ qua:

Cuối cùng, một so sánh đã được thực hiện giữa các đại lý AI và một điểm chuẩn con người bằng cách giao cho những người tham gia không có đào tạo pháp lý cùng các nhiệm vụ lựa chọn hình ảnh dưới cùng các điều kiện yêu cầu. Dưới các yêu cầu trung lập, hình ảnh có bản quyền được con người chọn ở mức tương đương với các mô hình AI.

Khi các nhắc nhở bản quyền rõ ràng được cung cấp, các vi phạm gần như bị xóa bỏ trên tất cả các nhiệm vụ. Sự cải thiện cũng được quan sát thấy trong số các mô hình AI, nhưng hình ảnh hạn chế vẫn được chọn với tần suất cao hơn.

Dưới các yêu cầu bỏ qua khuyến khích việc bỏ qua giấy phép, sự tuân thủ của con người giảm mạnh, mặc dù các mô hình mã nguồn mở đã ghi nhận tỷ lệ vi phạm cao hơn – và nói chung, con người đã thể hiện sự phản ứng mạnh mẽ hơn với các hướng dẫn bản quyền rõ ràng so với các hệ thống AI.

Kết luận

Mặc dù bài báo không đề cập đến khả năng này, nhưng dường như hợp lý khi tin rằng các công ty vận hành trí tuệ nhân tạo cục bộ, và không dự kiến các cuộc kiểm tra bất ngờ từ các cơ quan địa phương, có thể sẽ triển khai các giải pháp rẻ nhất cung cấp sự tuân thủ tối đa với yêu cầu của họ.

Kịch bản này phù hợp nhất với các mô hình mã nguồn mở ‘lầm lỗi’ được nghiên cứu trong bài báo mới, chứ không phải các mô hình mã nguồn đóng như ChatGPT và Gemini; đặc biệt là vì không một mô hình nào được nghiên cứu, với tất cả các phương tiện cần thiết để tuân thủ, đạt điểm gần 100%.

Nếu không một nền tảng AI nào có sẵn có thể ngăn chặn sự phơi bày pháp lý, nhiều doanh nghiệp có thể kết luận rằng họ nên tận dụng các mô hình hiệu suất cao và tuân thủ nhất mà họ có thể chạy, và tự chăm sóc việc tuân thủ pháp lý.

Để lý do rõ ràng, dường như không thể rằng các nền tảng AI tiên phong như Anthropic và OpenAI sẽ cung cấp các hệ thống đại lý ‘tuân thủ pháp lý’ mà không có caveat emptor. Do đó, nếu tuân thủ pháp lý là một sản phẩm mà các mô hình tiên phong không và sẽ không bao giờ cung cấp, thì các biện pháp hàng rào của chúng rõ ràng chỉ được thực hiện để bảo vệ chính chúng, chứ không phải để mang lại lợi ích cho người dùng nền tảng.

Tất cả điều này là một lập luận chống lại trí tuệ nhân tạo được thương mại hóa và ủng hộ việc chạy các mô hình cục bộ – đặc biệt là với khả năng khởi chạy một phiên bản của mô hình mã nguồn mở tiên phong như Kimi trên GPU từ xa không có kim loại và thậm chí tinh chỉnh nó cho nhu cầu cụ thể của công ty bạn.

 

Được xuất bản lần đầu vào thứ ba, ngày 28 tháng 7 năm 2026

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được giải thể vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]