Góc nhìn Anderson

Tự động hóa Bảo vệ Bản quyền trong Hình ảnh được tạo bởi Trí tuệ Nhân tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
ChatGPT-4o: ' 1792x1024px image of a Front view of a British high court tribunal composed of three robots in judicial wigs. They are all examining an 8x10 photograph, but we cannot see what the photograph is, because its back is towards us. HQ, cinematic still'

Como đã thảo luận tuần trước, ngay cả các mô hình nền tảng cơ bản đằng sau các hệ thống trí tuệ nhân tạo tạo ra có thể tạo ra nội dung vi phạm bản quyền, do sự thiếu hụt hoặc không phù hợp trong việc thu thập dữ liệu, cũng như sự hiện diện của nhiều phiên bản của cùng một hình ảnh trong dữ liệu đào tạo, dẫn đến sự quá拟 hợp, và tăng khả năng tái tạo có thể nhận ra.

Mặc dù có những nỗ lực để thống trị không gian trí tuệ nhân tạo tạo ra, và áp lực ngày càng tăng để ngăn chặn vi phạm bản quyền, các nền tảng lớn như MidJourney và DALL-E của OpenAI vẫn tiếp tục đối mặt với thách thức trong việc ngăn chặn việc tái tạo không cố ý của nội dung có bản quyền:

Khả năng của các hệ thống tạo ra để tái tạo dữ liệu có bản quyền xuất hiện thường xuyên trên các phương tiện truyền thông.

Khả năng của các hệ thống tạo ra để tái tạo dữ liệu có bản quyền xuất hiện thường xuyên trên các phương tiện truyền thông.

Khi các mô hình mới xuất hiện, và khi các mô hình của Trung Quốc đạt được vị trí dẫn đầu, việc ngăn chặn nội dung có bản quyền trong các mô hình nền tảng là một nhiệm vụ khó khăn; thực tế, nhà lãnh đạo thị trường Open.ai đã tuyên bố vào năm ngoái rằng đó là ‘không thể tạo ra các mô hình hữu ích và có ích mà không có dữ liệu có bản quyền”.

Nghệ thuật Trước

Về việc tạo ra không cố ý nội dung có bản quyền, lĩnh vực nghiên cứu gặp phải một thách thức tương tự như việc bao gồm nội dung khiêu dâm và các nội dung không phù hợp khác trong dữ liệu nguồn: một mặt muốn có lợi từ kiến thức (tức là giải phẫu con người chính xác, đã từng dựa trên các nghiên cứu về cơ thể người), mà không có khả năng lạm dụng nó.

Tương tự, các nhà tạo mô hình muốn có lợi từ phạm vi rộng lớn của nội dung có bản quyền mà tìm thấy trong các tập dữ liệu lớn như LAION, mà không có mô hình phát triển khả năng thực sự vi phạm bản quyền.

Bỏ qua các rủi ro đạo đức và pháp lý khi cố gắng che giấu việc sử dụng nội dung có bản quyền, việc lọc nội dung này là khó khăn hơn nhiều. Nội dung không phù hợp thường chứa các tính năng tiềm ẩn thấp mà cho phép lọc hiệu quả mà không cần so sánh trực tiếp với nội dung thực tế. Ngược lại, các mã hóa tiềm ẩn định nghĩa hàng triệu tác phẩm có bản quyền không giảm xuống một tập hợp các dấu hiệu dễ nhận biết, khiến việc phát hiện tự động trở nên phức tạp hơn.

CopyJudge

Quyết định của con người là một hàng hóa quý hiếm và đắt đỏ, cả trong việc thu thập dữ liệu và trong việc tạo ra các bộ lọc và hệ thống “an toàn” được thiết kế để đảm bảo rằng nội dung có bản quyền không được giao cho người dùng của các cổng API như MidJourney và khả năng tạo hình ảnh của ChatGPT.

Do đó, một sự hợp tác học thuật mới giữa Thụy Sĩ, Sony AI và Trung Quốc đang cung cấp CopyJudge – một phương pháp tự động để điều phối các nhóm thành viên liên tiếp của các “hội đồng” dựa trên ChatGPT có thể kiểm tra các đầu vào để tìm kiếm dấu hiệu của việc vi phạm bản quyền.

CopyJudge đánh giá các thế hệ AI vi phạm bản quyền khác nhau. Nguồn: https://arxiv.org/pdf/2502.15278

CopyJudge đánh giá các thế hệ AI vi phạm bản quyền khác nhau. Nguồn: https://arxiv.org/pdf/2502.15278

CopyJudge cung cấp một khuôn khổ tự động để sử dụng các mô hình ngôn ngữ-vision lớn (LVLMs) để xác định sự tương đồng đáng kể giữa các hình ảnh có bản quyền và những hình ảnh được tạo ra bởi các mô hình khuếch tán văn bản-hình ảnh.

Phương pháp CopyJudge sử dụng học tăng cường để tối ưu hóa các lời nhắc vi phạm bản quyền, và sau đó sử dụng thông tin từ các lời nhắc đó để tạo ra các lời nhắc mới ít có khả năng gây ra hình ảnh vi phạm bản quyền.

Phương pháp CopyJudge sử dụng học tăng cường và các phương pháp khác để tối ưu hóa các lời nhắc vi phạm bản quyền, và sau đó sử dụng thông tin từ các lời nhắc đó để tạo ra các lời nhắc mới ít có khả năng gây ra hình ảnh vi phạm bản quyền.

Mặc dù nhiều máy tạo hình ảnh AI trực tuyến lọc các lời nhắc của người dùng để tìm kiếm nội dung không phù hợp, nội dung có bản quyền, tái tạo hình ảnh của người thực, và các miền bị cấm khác, CopyJudge sử dụng các lời nhắc “vi phạm” tinh chỉnh để tạo ra các lời nhắc “làm sạch” ít có khả năng gây ra hình ảnh không được phép, mà không có ý định trực tiếp chặn lời nhắc của người dùng.

Mặc dù đây không phải là một phương pháp mới, nó có thể giúp giải phóng các hệ thống tạo ra API khỏi việc từ chối lời nhắc của người dùng (ít nhất vì điều này cho phép người dùng phát triển truy cập hậu môn vào các thế hệ không được phép, thông qua thực nghiệm).

Một lỗ hổng gần đây (đã được các nhà phát triển đóng lại) cho phép người dùng tạo ra nội dung khiêu dâm trên nền tảng trí tuệ nhân tạo Kling chỉ bằng cách bao gồm một cây thánh giá hoặc hình thánh giá trong hình ảnh được tải lên trong quy trình hình ảnh-sang-video.

Trong một lỗ hổng đã được các nhà phát triển Kling vá vào cuối năm 2024, người dùng có thể buộc hệ thống tạo ra nội dung không phù hợp chỉ bằng cách yêu cầu một cây thánh giá hoặc hình thánh giá được hiển thị ở đầu video. Mặc dù không có lời giải thích nào về logic đằng sau lỗ hổng này, nhưng có thể nó được thiết kế để cho phép 'nội dung khiêu dâm được chấp nhận' trong các hình ảnh về thánh giá; và việc gọi một hình ảnh 'thánh giá' có thể 'mở khóa' nội dung không phù hợp rộng hơn; nhưng chúng ta có thể không bao giờ biết! Nguồn: Discord

Trong một lỗ hổng đã được các nhà phát triển Kling vá vào cuối năm 2024, người dùng có thể buộc hệ thống tạo ra nội dung không phù hợp chỉ bằng cách bao gồm một cây thánh giá hoặc hình thánh giá trong hình ảnh được tải lên trong quy trình hình ảnh-sang-video. Mặc dù không có lời giải thích nào về logic đằng sau lỗ hổng này, nhưng có thể nó được thiết kế để cho phép ‘nội dung khiêu dâm được chấp nhận’ trong các hình ảnh về thánh giá; và việc gọi một hình ảnh ‘thánh giá’ có thể ‘mở khóa’ nội dung không phù hợp rộng hơn; nhưng chúng ta có thể không bao giờ biết! Nguồn: Discord

Các trường hợp như vậy nhấn mạnh nhu cầu về việc tinh chỉnh lời nhắc trong các hệ thống tạo ra trực tuyến, ít nhất vì việc học máy không thể học được, trong đó mô hình nền tảng chính nó bị thay đổi để loại bỏ các khái niệm bị cấm, có thể có các tác động không mong muốn đối với khả năng sử dụng của mô hình cuối cùng.

Để tìm kiếm các giải pháp ít cực đoan hơn, hệ thống CopyJudge mô phỏng các quyết định pháp lý của con người bằng cách sử dụng trí tuệ nhân tạo để chia hình ảnh thành các yếu tố chính như bố cục và màu sắc, để lọc ra các phần không thể có bản quyền, và so sánh những gì còn lại. Nó cũng bao gồm một phương pháp được điều khiển bởi trí tuệ nhân tạo để điều chỉnh lời nhắc và sửa đổi việc tạo hình ảnh, giúp tránh các vấn đề về bản quyền trong khi vẫn giữ nguyên nội dung sáng tạo.

Kết quả thực nghiệm, theo các tác giả, cho thấy CopyJudge tương đương với các phương pháp hiện tại trong lĩnh vực này, và chỉ ra rằng hệ thống này có khả năng tổng quát hóa và khả năng giải thích tốt hơn so với các công việc trước đây.

Bài báo mới có tiêu đề CopyJudge: Xác định và giảm thiểu vi phạm bản quyền trong các mô hình khuếch tán văn bản-hình ảnh, và đến từ năm nhà nghiên cứu trên EPFL, Sony AI và Đại học Westlake của Trung Quốc.

Phương pháp

Mặc dù CopyJudge sử dụng GPT để tạo ra các “hội đồng” tự động, các tác giả nhấn mạnh rằng hệ thống này không được tối ưu hóa cho sản phẩm của OpenAI, và rằng bất kỳ mô hình ngôn ngữ-vision lớn (LVLM) nào cũng có thể được sử dụng thay thế.

Trong trường hợp đầu tiên, khuôn khổ trừu tượng-lọc-so sánh của các tác giả yêu cầu phải phân tích các hình ảnh nguồn thành các phần cấu thành, như được minh họa ở phía bên trái của lược đồ dưới đây:

Lược đồ khái niệm cho giai đoạn đầu tiên của quy trình CopyJudge.

Lược đồ khái niệm cho giai đoạn đầu tiên của quy trình CopyJudge.

Ở góc dưới bên trái, chúng ta thấy một tác nhân lọc đang chia nhỏ các phần của hình ảnh để cố gắng xác định các đặc điểm có thể là bản quyền, nhưng bản thân nó quá chung chung để được coi là vi phạm.

Sau đó, nhiều mô hình ngôn ngữ-vision lớn (LVLM) được sử dụng để đánh giá các yếu tố đã lọc – một phương pháp đã được chứng minh là hiệu quả trong các bài báo như bài báo CSAIL năm 2023 Cải thiện sự thật và lý luận trong các mô hình ngôn ngữ thông qua tranh luận đa tác nhân, và ChatEval, trong số các công việc khác được công nhận trong bài báo mới.

Các tác giả tuyên bố:

‘[Chúng tôi] áp dụng một phương pháp tranh luận đa tác nhân đồng bộ hoàn toàn, trong đó mỗi LVLM nhận được phản hồi từ [các] LVLM khác trước khi đưa ra phán quyết tiếp theo. Điều này tạo ra một vòng lặp phản hồi động giúp tăng cường độ tin cậy và độ sâu của phân tích, vì các mô hình điều chỉnh đánh giá của chúng dựa trên những thông tin mới được trình bày bởi các đồng nghiệp của chúng.

‘Mỗi LVLM có thể điều chỉnh điểm số của nó dựa trên phản hồi từ [các] LVLM khác hoặc giữ nó không đổi.’

Cũng bao gồm các cặp hình ảnh được chấm điểm bởi con người thông qua việc học trong bối cảnh vài lần

Khi các “hội đồng” trong vòng lặp đã đạt được một điểm số đồng thuận trong phạm vi chấp nhận được, kết quả sẽ được chuyển đến một mô hình ngôn ngữ-vision lớn “hội đồng” tổng hợp, sẽ tổng hợp kết quả thành một điểm số cuối cùng.

Giảm thiểu

Tiếp theo, các tác giả tập trung vào quá trình giảm thiểu lời nhắc được mô tả trước đó.

Lược đồ CopyJudge để giảm thiểu vi phạm bản quyền bằng cách tinh chỉnh lời nhắc và nhiễu tiềm ẩn. Hệ thống điều chỉnh lời nhắc một cách lặp lại dựa trên phản hồi lặp lại và sử dụng học tăng cường để sửa đổi các biến tiềm ẩn, giảm thiểu rủi ro vi phạm.

Lược đồ CopyJudge để giảm thiểu vi phạm bản quyền bằng cách tinh chỉnh lời nhắc và nhiễu tiềm ẩn. Hệ thống điều chỉnh lời nhắc một cách lặp lại dựa trên phản hồi lặp lại và sử dụng học tăng cường để sửa đổi các biến tiềm ẩn, giảm thiểu rủi ro vi phạm.

Hai phương pháp được sử dụng để giảm thiểu lời nhắc là kiểm soát lời nhắc dựa trên mô hình ngôn ngữ-vision lớn (LVLM) và phương pháp dựa trên học tăng cường (RL), trong đó phần thưởng được thiết kế để phạt các đầu ra vi phạm bản quyền.

Dữ liệu và Kiểm tra

Để kiểm tra CopyJudge, các tập dữ liệu khác nhau đã được sử dụng, bao gồm D-Rep, chứa các cặp hình ảnh thực và giả được chấm điểm bởi con người trên thang điểm 0-5.

Khám phá tập dữ liệu D-Rep tại Hugging Face. Bộ sưu tập này ghép các hình ảnh thực và tạo ra.

Khám phá tập dữ liệu D-Rep tại Hugging Face. Bộ sưu tập này ghép các hình ảnh thực và tạo ra. Source: https://huggingface.co/datasets/WenhaoWang/D-Rep/viewer/default/

Các hình ảnh D-Rep được CopyJudge coi là ví dụ về vi phạm bản quyền nếu chúng đạt điểm 4 hoặc cao hơn, trong khi phần còn lại được giữ lại làm ví dụ không liên quan đến bản quyền. 4000 hình ảnh chính thức trong tập dữ liệu được sử dụng làm hình ảnh kiểm tra. Ngoài ra, các nhà nghiên cứu đã chọn và thu thập hình ảnh cho 10 nhân vật hoạt hình nổi tiếng từ Wikipedia.

Ba kiến trúc khuếch tán dựa trên văn bản được sử dụng để tạo ra các hình ảnh có khả năng vi phạm bản quyền là Stable Diffusion V2; Kandinsky2-2; và Stable Diffusion XL. Các tác giả đã chọn thủ công một hình ảnh vi phạm và một hình ảnh không vi phạm từ mỗi mô hình, tạo ra 60 mẫu dương và 60 mẫu âm.

Các phương pháp cơ bản được chọn để so sánh là: L2 norm; Tương tự hình ảnh được học (LPIPS); SSCD; RLCP; và PDF-Emb. Đối với các chỉ số, Độ chính xác và Điểm F1 được sử dụng làm tiêu chí cho việc vi phạm bản quyền.

GPT-4o được sử dụng để tạo ra các đội tranh luận nội bộ của CopyJudge, sử dụng ba tác nhân cho tối đa năm lần lặp lại trên bất kỳ hình ảnh nào được gửi. Ba hình ảnh ngẫu nhiên từ mỗi xếp hạng trong D-Rep được sử dụng làm xác suất trước của con người cho các tác nhân.

Kết quả vi phạm của CopyJudge trong vòng đầu tiên.

Kết quả vi phạm của CopyJudge trong vòng đầu tiên.

Về những kết quả này, các tác giả nhận xét:

‘[Nó] rõ ràng rằng các phương pháp phát hiện bản sao hình ảnh truyền thống có những hạn chế trong nhiệm vụ xác định vi phạm bản quyền. Phương pháp của chúng tôi vượt trội so với hầu hết các phương pháp. Đối với phương pháp hiện tại là PDF-Emb, được đào tạo trên 36.000 mẫu từ D-Rep, hiệu suất của chúng tôi trên D-Rep hơi kém hơn.

‘Tuy nhiên, hiệu suất kém của nó trên tập dữ liệu IP và Artwork nhấn mạnh sự thiếu khả năng tổng quát hóa, trong khi phương pháp của chúng tôi cho thấy kết quả tuyệt vời trên các tập dữ liệu.’

Các tác giả cũng lưu ý rằng CopyJudge cung cấp một ‘ranh giới tương đối’ rõ ràng hơn giữa các trường hợp hợp lệ và vi phạm:

Các ví dụ khác từ các vòng kiểm tra, trong tài liệu phụ của bài báo mới.

Các ví dụ khác từ các vòng kiểm tra, trong tài liệu phụ của bài báo mới.

Các nhà nghiên cứu đã so sánh phương pháp của họ với một sự hợp tác của Sony AI từ năm 2024 có tiêu đề Phát hiện, Giải thích và Giảm thiểu việc ghi nhớ trong các mô hình khuếch tán. Công việc này sử dụng một mô hình khuếch tán ổn định được tinh chỉnh có 200 hình ảnh được ghi nhớ (tức là quá拟 hợp) để tạo ra dữ liệu có bản quyền tại thời điểm suy luận.

Các tác giả của công việc mới phát hiện ra rằng phương pháp giảm thiểu lời nhắc của họ, so với phương pháp năm 2024, có thể tạo ra hình ảnh ít có khả năng gây ra vi phạm bản quyền.

Kết quả giảm thiểu ghi nhớ với CopyJudge so với công việc năm 2024.

Kết quả giảm thiểu ghi nhớ với CopyJudge so với công việc năm 2024.

Các tác giả nhận xét tại đây:

‘[Phương pháp của chúng tôi] có thể tạo ra hình ảnh ít có khả năng gây ra vi phạm bản quyền trong khi vẫn giữ được độ chính xác phù hợp, giảm nhẹ một chút. Như được hiển thị trong [hình dưới], phương pháp của chúng tôi hiệu quả tránh được những hạn chế của [phương pháp trước], bao gồm cả việc không thể giảm thiểu ghi nhớ hoặc tạo ra hình ảnh bị偏 lệch cao.’

So sánh hình ảnh và lời nhắc được tạo ra trước và sau khi giảm thiểu ghi nhớ.

So sánh hình ảnh và lời nhắc được tạo ra trước và sau khi giảm thiểu ghi nhớ.

Các tác giả đã chạy các thử nghiệm thêm về giảm thiểu vi phạm, nghiên cứu vi phạm rõ ràngvi phạm ngầm.

Vi phạm rõ ràng xảy ra khi các lời nhắc trực tiếp tham chiếu đến nội dung có bản quyền, chẳng hạn như ‘Tạo ra một hình ảnh của Mickey Mouse’. Để kiểm tra điều này, các nhà nghiên cứu đã sử dụng 20 mẫu hoạt hình và nghệ thuật, tạo ra hình ảnh vi phạm trong Stable Diffusion v2 với các lời nhắc bao gồm tên hoặc thuộc tính tác giả.

So sánh giữa phương pháp Kiểm soát tiềm ẩn (LC) của các tác giả và phương pháp Kiểm soát lời nhắc (PC) của công việc trước, trong các biến thể khác nhau, sử dụng Stable Diffusion để tạo ra hình ảnh mô tả vi phạm rõ ràng.

So sánh giữa phương pháp Kiểm soát tiềm ẩn (LC) của các tác giả và phương pháp Kiểm soát lời nhắc (PC) của công việc trước, trong các biến thể khác nhau, sử dụng Stable Diffusion để tạo ra hình ảnh mô tả vi phạm rõ ràng.

Vi phạm ngầm xảy ra khi một lời nhắc không có tham chiếu bản quyền rõ ràng nhưng vẫn dẫn đến hình ảnh vi phạm do các yếu tố mô tả nhất định – một kịch bản đặc biệt liên quan đến các mô hình tạo hình ảnh thương mại, thường bao gồm các hệ thống phát hiện nội dung để xác định và chặn các lời nhắc liên quan đến bản quyền.

Để khám phá điều này, các tác giả đã sử dụng cùng các mẫu IP-locked như trong thử nghiệm vi phạm rõ ràng, nhưng tạo ra hình ảnh vi phạm mà không có tham chiếu bản quyền trực tiếp, sử dụng DALL-E 3 (mặc dù bài báo lưu ý rằng mô-đun phát hiện an toàn tích hợp của mô hình đã từ chối một số lời nhắc kích hoạt bộ lọc của nó).

Vi phạm ngầm sử dụng DALLE-3, với điểm vi phạm và điểm CLIP.

Vi phạm ngầm sử dụng DALLE-3, với điểm vi phạm và điểm CLIP.

Các tác giả tuyên bố:

‘[Nó] có thể thấy rằng phương pháp của chúng tôi giảm thiểu đáng kể khả năng vi phạm, cả cho vi phạm rõ ràng và ngầm, với chỉ một sự giảm nhẹ trong điểm CLIP. Điểm vi phạm sau khi chỉ kiểm soát tiềm ẩn là tương đối cao hơn so với sau khi kiểm soát lời nhắc vì việc tìm kiếm các tiềm ẩn không vi phạm mà không thay đổi lời nhắc là khá khó khăn. Tuy nhiên, chúng tôi vẫn có thể giảm thiểu điểm vi phạm hiệu quả trong khi vẫn giữ được chất lượng hình ảnh-văn bản cao hơn.’

‘[Hình dưới] cho thấy kết quả trực quan, nơi chúng ta có thể thấy rằng chúng tôi tránh được vi phạm bản quyền trong khi vẫn giữ được yêu cầu của người dùng.’

Hình ảnh được tạo ra trước và sau khi giảm thiểu vi phạm bản quyền.

Hình ảnh được tạo ra trước và sau khi giảm thiểu vi phạm bản quyền.

Kết luận

Mặc dù nghiên cứu này trình bày một phương pháp đầy hứa hẹn cho việc bảo vệ bản quyền trong hình ảnh được tạo ra bởi trí tuệ nhân tạo, sự phụ thuộc vào các mô hình ngôn ngữ-vision lớn (LVLM) cho việc phát hiện vi phạm bản quyền có thể gây ra lo ngại về sự thiên vị và tính nhất quán, vì các quyết định của trí tuệ nhân tạo có thể không luôn phù hợp với các tiêu chuẩn pháp lý.

Có lẽ quan trọng nhất, dự án này cũng giả định rằng việc thực thi bản quyền có thể được tự động hóa, mặc dù các quyết định pháp lý trong thế giới thực thường liên quan đến các yếu tố chủ quan và ngữ cảnh mà trí tuệ nhân tạo có thể gặp khó khăn khi giải thích.

Trong thế giới thực, việc tự động hóa sự đồng thuận pháp lý, đặc biệt là xung quanh đầu ra từ trí tuệ nhân tạo, có vẻ như sẽ vẫn là một vấn đề gây tranh cãi trong thời gian dài, và vượt ra ngoài phạm vi của lĩnh vực được giải quyết trong công việc này.

Được xuất bản lần đầu vào Thứ hai, ngày 24 tháng 2 năm 2025

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai