Góc nhìn Anderson

Những Hình Ảnh “Được Bảo Vệ” Dễ Bị Steal Bằng AI, Không Phải Ngược Lại

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
A shadowy man steals into an art gallery as the guard sleeps. Krita/Flux-1 Dev + Firefly

Nghiên cứu mới cho thấy rằng các công cụ chống nước đánh dấu nhằm ngăn chặn việc chỉnh sửa hình ảnh bằng AI có thể phản tác dụng. Thay vì ngăn chặn các mô hình như Stable Diffusion thực hiện thay đổi, một số biện pháp bảo vệ thực sự giúp AI thực hiện theo các hướng dẫn chỉnh sửa một cách chính xác hơn, khiến cho việc thao túng không mong muốn trở nên dễ dàng hơn.

 

Có một lĩnh vực nghiên cứu về thị giác máy tính dành riêng cho việc bảo vệ hình ảnh có bản quyền khỏi việc được đào tạo vào các mô hình AI hoặc được sử dụng trong các quy trình hình ảnh-hình ảnh AI trực tiếp. Các hệ thống này thường nhắm vào Mô hình Khử Khí (LDMs) như Stable DiffusionFlux, sử dụng quy trình dựa trên nhiễu để mã hóa và giải mã hình ảnh.

Bằng cách chèn nhiễu đối kháng vào hình ảnh nhìn bình thường, có thể gây ra việc phát hiện hình ảnh đoán nội dung hình ảnh không chính xác và cản trở các hệ thống tạo hình ảnh từ khai thác dữ liệu có bản quyền:

Từ bài báo 'Raising the Cost of Malicious AI-Powered Image Editing' của MIT, các ví dụ về hình ảnh nguồn được 'miễn dịch' khỏi thao túng (hàng dưới). Nguồn: https://arxiv.org/pdf/2302.06588

Từ bài báo ‘Raising the Cost of Malicious AI-Powered Image Editing’ của MIT, các ví dụ về hình ảnh nguồn được ‘miễn dịch’ khỏi thao túng (hàng dưới). Nguồn: https://arxiv.org/pdf/2302.06588

Kể từ khi phản ứng từ các nghệ sĩ đối với việc Stable Diffusion sử dụng hình ảnh được thu thập từ web một cách tự do (bao gồm cả hình ảnh có bản quyền) vào năm 2023, lĩnh vực nghiên cứu đã tạo ra nhiều biến thể của cùng một chủ đề – ý tưởng rằng hình ảnh có thể bị ‘độc’ một cách vô hình để chống lại việc được đào tạo vào các hệ thống AI hoặc bị hút vào các quy trình AI tạo sinh, mà không ảnh hưởng tiêu cực đến chất lượng của hình ảnh đối với người xem trung bình.

Trong tất cả các trường hợp, có mối tương quan trực tiếp giữa mức độ của sự xáo trộn được áp dụng, mức độ mà hình ảnh được bảo vệ sau đó và mức độ mà hình ảnh không trông đẹp như nó nên:

Mặc dù chất lượng của tệp PDF nghiên cứu không hoàn toàn minh họa vấn đề, nhưng lượng nhiễu đối kháng lớn hơn sẽ hy sinh chất lượng để đổi lấy bảo mật. Ở đây, chúng ta thấy sự thay đổi chất lượng trong dự án 'Fawkes' năm 2020 do Đại học Chicago dẫn đầu. Nguồn: https://arxiv.org/pdf/2002.08327

Mặc dù chất lượng của tệp PDF nghiên cứu không hoàn toàn minh họa vấn đề, nhưng lượng nhiễu đối kháng lớn hơn sẽ hy sinh chất lượng để đổi lấy bảo mật. Ở đây, chúng ta thấy sự thay đổi chất lượng trong dự án ‘Fawkes’ năm 2020 do Đại học Chicago dẫn đầu. Nguồn: https://arxiv.org/pdf/2002.08327

Đặc biệt quan tâm đến các nghệ sĩ tìm cách bảo vệ phong cách của họ khỏi việc bị sử dụng không được phép là khả năng của các hệ thống không chỉ che giấu danh tính và các thông tin khác, mà còn ‘thuyết phục’ quá trình đào tạo AI rằng nó đang nhìn thấy điều gì khác với thực tế, để các kết nối không hình thành giữa các miền ngữ nghĩa và trực quan cho dữ liệu đào tạo ‘bảo vệ’ (tức là, một lời nhắc như ‘Theo phong cách của Paul Klee’).

Mist và Glaze là hai phương pháp tiêm phổ biến có thể ngăn chặn hoặc ít nhất là cản trở nghiêm trọng các nỗ lực sử dụng phong cách có bản quyền trong các quy trình đào tạo và làm việc của AI. Nguồn: https://arxiv.org/pdf/2506.04394

Mist và Glaze là hai phương pháp tiêm phổ biến có thể ngăn chặn hoặc ít nhất là cản trở nghiêm trọng các nỗ lực sử dụng phong cách có bản quyền trong các quy trình đào tạo và làm việc của AI. Nguồn: https://arxiv.org/pdf/2506.04394

Bàn Thắng

Bây giờ, nghiên cứu mới từ Mỹ đã phát hiện ra không chỉ rằng các xáo trộn có thể không bảo vệ hình ảnh, mà việc thêm xáo trộn thực sự có thể cải thiện khả năng khai thác của hình ảnh trong tất cả các quy trình AI mà xáo trộn được thiết kế để miễn dịch.

Bản báo cáo nêu:

‘Trong các thí nghiệm của chúng tôi với các phương pháp bảo vệ hình ảnh dựa trên xáo trộn trên nhiều miền và nhiệm vụ chỉnh sửa, chúng tôi phát hiện ra rằng sự bảo vệ này không đạt được mục tiêu hoàn toàn.

‘Trong hầu hết các kịch bản, việc chỉnh sửa dựa trên khuếch tán của hình ảnh được bảo vệ tạo ra một hình ảnh đầu ra mong muốn mà tuân theo chính xác lời nhắc hướng dẫn.

‘Các phát hiện của chúng tôi cho thấy rằng việc thêm nhiễu vào hình ảnh có thể gây ra sự tăng cường liên kết giữa hình ảnh và lời nhắc văn bản trong quá trình tạo, dẫn đến các hậu quả không mong muốn như chỉnh sửa tốt hơn hơn.

‘Do đó, chúng tôi lập luận rằng các phương pháp dựa trên xáo trộn có thể không cung cấp một giải pháp đủ mạnh cho việc bảo vệ hình ảnh chống lại việc chỉnh sửa dựa trên khuếch tán.’

Trong các thử nghiệm, hình ảnh được bảo vệ đã được tiếp xúc với hai kịch bản chỉnh sửa AI quen thuộc: tạo hình ảnh-hình ảnh trực tiếp và chuyển đổi phong cách. Những quá trình này phản ánh các cách phổ biến mà các mô hình AI có thể khai thác nội dung được bảo vệ, hoặc bằng cách thay đổi trực tiếp hình ảnh hoặc bằng cách mượn các đặc điểm phong cách của nó để sử dụng ở nơi khác.

Hình ảnh được bảo vệ, được lấy từ các nguồn hình ảnh và nghệ thuật tiêu chuẩn, đã được chạy qua các quy trình này để xem liệu các xáo trộn thêm vào có thể chặn hoặc làm suy giảm các chỉnh sửa.

Thay vào đó, sự hiện diện của bảo vệ thường dường như làm sắc nét sự liên kết của mô hình với lời nhắc, tạo ra các đầu ra chính xác và sạch sẽ nơi một số thất bại đã được mong đợi.

Các tác giả khuyên, về cơ bản, rằng phương pháp bảo vệ phổ biến này có thể cung cấp một cảm giác an toàn sai lầm và rằng bất kỳ phương pháp miễn dịch dựa trên xáo trộn nào cũng nên được kiểm tra kỹ lưỡng chống lại các phương pháp của chính họ.

Phương Pháp

Các tác giả đã chạy các thí nghiệm sử dụng ba phương pháp bảo vệ áp dụng các xáo trộn đối kháng được thiết kế cẩn thận: PhotoGuard; Mist; và Glaze.

Glaze, một trong các khuôn khổ được các tác giả kiểm tra, minh họa các ví dụ về bảo vệ Glaze cho ba nghệ sĩ. Hai cột đầu tiên hiển thị các tác phẩm nghệ thuật gốc. Cột thứ ba hiển thị kết quả bắt chước mà không có bảo vệ. Cột thứ tư hiển thị các phiên bản chuyển phong cách được sử dụng để tối ưu hóa áo choàng, cùng với tên phong cách đích. Cột thứ năm và thứ sáu hiển thị kết quả bắt chước với áo choàng được áp dụng ở mức xáo trộn p = 0,05 và p = 0,1. Tất cả kết quả đều sử dụng mô hình Stable Diffusion. https://arxiv.org/pdf/2302.04222

Glaze, một trong các khuôn khổ được các tác giả kiểm tra, minh họa các ví dụ về bảo vệ Glaze cho ba nghệ sĩ, hiển thị các tác phẩm nghệ thuật gốc; kết quả bắt chước mà không có bảo vệ; các phiên bản chuyển phong cách được sử dụng để tối ưu hóa áo choàng, cùng với tên phong cách đích; và kết quả bắt chước với áo choàng được áp dụng ở mức xáo trộn p = 0,05 và p = 0,1. Tất cả kết quả đều sử dụng mô hình Stable Diffusion. https://arxiv.org/pdf/2302.04222

PhotoGuard đã được áp dụng cho hình ảnh cảnh tự nhiên, trong khi Mist và Glaze được sử dụng trên các tác phẩm nghệ thuật (tức là, ‘miền nghệ thuật’).

Thử nghiệm bao gồm cả hình ảnh tự nhiên và nghệ thuật để phản ánh các trường hợp sử dụng thực tế. Hiệu quả của mỗi phương pháp được đánh giá bằng cách kiểm tra xem mô hình AI có thể tạo ra các chỉnh sửa thực tế và phù hợp với lời nhắc khi làm việc trên hình ảnh được bảo vệ hay không; nếu hình ảnh kết quả trông thuyết phục và phù hợp với lời nhắc, thì bảo vệ được coi là thất bại.

Stable Diffusion v1.5 đã được sử dụng làm trình tạo hình ảnh pre-trained cho các nhiệm vụ chỉnh sửa của các nhà nghiên cứu. Năm hạt giống đã được chọn để đảm bảo tính tái tạo: 9222, 999, 123, 66 và 42. Tất cả các cài đặt tạo khác, chẳng hạn như thang hướng dẫn, cường độ và số bước tổng, đều theo các giá trị mặc định được sử dụng trong các thí nghiệm PhotoGuard.

PhotoGuard đã được thử nghiệm trên hình ảnh cảnh tự nhiên bằng cách sử dụng tập dữ liệu Flickr8k, chứa hơn 8.000 hình ảnh được ghép nối với tối đa năm chú thích mỗi hình ảnh.

Suy Nghĩ Đối Lập

Hai tập chú thích sửa đổi đã được tạo từ chú thích đầu tiên của mỗi hình ảnh với sự giúp đỡ của Claude Sonnet 3.5. Một tập chứa các lời nhắc gần gũi về mặt ngữ cảnh với các chú thích gốc; tập còn lại chứa các lời nhắc xa về mặt ngữ cảnh.

Ví dụ, từ chú thích gốc ‘Một cô gái trẻ trong váy màu hồng đi vào một cabin gỗ’, một lời nhắc gần gũi sẽ là ‘Một cậu bé trong áo sơ mi màu xanh đi vào một ngôi nhà gạch’. Ngược lại, một lời nhắc xa sẽ là ‘Hai con mèo nằm trên một chiếc ghế sofa’.

Các lời nhắc gần gũi được xây dựng bằng cách thay thế danh từ và tính từ bằng các thuật ngữ tương tự về mặt ngữ nghĩa; các lời nhắc xa được tạo ra bằng cách hướng dẫn mô hình tạo ra các chú thích rất khác về mặt ngữ cảnh.

Tất cả các chú thích được tạo ra đều được kiểm tra thủ công về chất lượng và sự liên quan về mặt ngữ nghĩa. Bộ mã hóa câu văn vạn năng của Google được sử dụng để tính toán các điểm số tương tự về mặt ngữ nghĩa giữa chú thích gốc và các chú thích sửa đổi:

Từ tài liệu bổ sung, phân phối độ tương tự về mặt ngữ nghĩa cho các chú thích sửa đổi được sử dụng trong các thử nghiệm Flickr8k. Biểu đồ bên trái hiển thị các điểm số tương tự cho các chú thích sửa đổi gần gũi, trung bình khoảng 0,6. Biểu đồ bên phải hiển thị các chú thích sửa đổi rộng rãi, trung bình khoảng 0,1, phản ánh khoảng cách ngữ nghĩa lớn hơn so với chú thích gốc. Các giá trị được tính toán bằng Bộ mã hóa câu văn vạn năng của Google. Nguồn: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Từ tài liệu bổ sung, phân phối độ tương tự về mặt ngữ nghĩa cho các chú thích sửa đổi được sử dụng trong các thử nghiệm Flickr8k. Biểu đồ bên trái hiển thị các điểm số tương tự cho các chú thích sửa đổi gần gũi, trung bình khoảng 0,6. Biểu đồ bên phải hiển thị các chú thích sửa đổi rộng rãi, trung bình khoảng 0,1, phản ánh khoảng cách ngữ nghĩa lớn hơn so với chú thích gốc. Nguồn: https://sigport.org/sites/default/files/docs/IncompleteProtection_SM_0.pdf

Mỗi hình ảnh, cùng với phiên bản được bảo vệ của nó, đã được chỉnh sửa bằng cả lời nhắc gần gũi và lời nhắc xa. Đánh giá chất lượng hình ảnh bằng cách sử dụng BRISQUE (Blind/Referenceless Image Spatial Quality Evaluator):

Kết quả tạo hình ảnh-hình ảnh trên các bức ảnh tự nhiên được bảo vệ bằng PhotoGuard. Mặc dù có xáo trộn, Stable Diffusion v1.5 vẫn theo dõi thành công cả các thay đổi nhỏ và lớn trong lời nhắc chỉnh sửa, tạo ra các đầu ra thực tế phù hợp với các hướng dẫn mới.

Kết quả tạo hình ảnh-hình ảnh trên các bức ảnh tự nhiên được bảo vệ bằng PhotoGuard. Mặc dù có xáo trộn, Stable Diffusion v1.5 vẫn theo dõi thành công cả các thay đổi nhỏ và lớn trong lời nhắc chỉnh sửa, tạo ra các đầu ra thực tế phù hợp với các hướng dẫn mới.

Các hình ảnh được tạo ra đạt điểm 17,88 trên thang BRISQUE, với 17,82 cho lời nhắc gần gũi và 17,94 cho lời nhắc xa, trong khi hình ảnh gốc đạt điểm 22,27. Điều này cho thấy rằng các hình ảnh đã chỉnh sửa vẫn giữ được chất lượng gần giống với hình ảnh gốc.

Thống Kê

Để đánh giá mức độ hiệu quả của các biện pháp bảo vệ trong việc cản trở việc chỉnh sửa AI, các nhà nghiên cứu đã đo lường mức độ mà hình ảnh cuối cùng phù hợp với lời nhắc mà chúng được cung cấp, sử dụng các hệ thống điểm số so sánh nội dung hình ảnh với lời nhắc văn bản để xem chúng phù hợp đến mức nào:

Để làm điều này, CLIP-S sử dụng một mô hình có thể hiểu cả hình ảnh và văn bản để kiểm tra sự tương đồng giữa chúng, trong khi PAC-S++ bổ sung thêm các mẫu được tạo ra bởi AI để so sánh của nó phù hợp hơn với ước tính của con người:

Các điểm số này, được gọi là điểm tương đồng hình ảnh-văn bản (ITA), chỉ ra mức độ mà AI tuân theo lời nhắc khi chỉnh sửa hình ảnh được bảo vệ: nếu một hình ảnh được bảo vệ vẫn tạo ra một đầu ra mong muốn, điều đó có nghĩa là bảo vệ đã thất bại trong việc ngăn chặn việc chỉnh sửa.

Ảnh hưởng của bảo vệ trên tập dữ liệu Flickr8k trên năm hạt giống, sử dụng cả lời nhắc gần gũi và lời nhắc xa. Sự tương đồng hình ảnh-văn bản được đo bằng điểm số CLIP-S và PAC-S++.

Ảnh hưởng của bảo vệ trên tập dữ liệu Flickr8k trên năm hạt giống, sử dụng cả lời nhắc gần gũi và lời nhắc xa. Sự tương đồng hình ảnh-văn bản được đo bằng điểm số CLIP-S và PAC-S++.

Các nhà nghiên cứu đã so sánh mức độ mà AI tuân theo lời nhắc khi chỉnh sửa hình ảnh được bảo vệ so với hình ảnh không được bảo vệ. Họ đầu tiên xem xét sự khác biệt giữa hai, được gọi là Thay Đổi Thực Tế. Sau đó, sự khác biệt được quy mô để tạo ra Thay Đổi Phần Trăm, giúp dễ dàng so sánh kết quả trên nhiều thử nghiệm.

Quá trình này tiết lộ liệu các biện pháp bảo vệ có làm cho việc AI tuân theo lời nhắc dễ dàng hơn hay không. Các thử nghiệm được lặp lại năm lần bằng cách sử dụng các hạt giống ngẫu nhiên khác nhau, bao gồm cả các thay đổi nhỏ và lớn đối với chú thích gốc.

Tấn Công Nghệ Thuật

Đối với các thử nghiệm trên hình ảnh tự nhiên, tập dữ liệu Flickr1024 đã được sử dụng, chứa hơn một nghìn hình ảnh chất lượng cao. Mỗi hình ảnh đã được chỉnh sửa bằng các lời nhắc theo mẫu: ‘Thay đổi phong cách thành [V]’, nơi [V] đại diện cho một trong bảy phong cách nghệ thuật nổi tiếng: Lập thể; Hậu ấn tượng; Ấn tượng; Siêu thực; Baroque; Fauvism; và Phục hưng.

Quá trình này bao gồm việc áp dụng PhotoGuard cho hình ảnh gốc, tạo ra các phiên bản được bảo vệ và sau đó chạy cả hình ảnh được bảo vệ và không được bảo vệ qua cùng một tập hợp các chỉnh sửa chuyển phong cách:

Hình ảnh gốc và các phiên bản được bảo vệ của một hình ảnh tự nhiên, mỗi hình ảnh được chỉnh sửa để áp dụng các phong cách Lập thể, Siêu thực và Fauvism.

Hình ảnh gốc và các phiên bản được bảo vệ của một hình ảnh tự nhiên, mỗi hình ảnh được chỉnh sửa để áp dụng các phong cách Lập thể, Siêu thực và Fauvism.

Để kiểm tra các phương pháp bảo vệ trên tác phẩm nghệ thuật, việc chuyển phong cách đã được thực hiện trên hình ảnh từ tập dữ liệu WikiArt, thu thập một loạt các phong cách nghệ thuật. Các lời nhắc chỉnh sửa theo cùng định dạng như trước, hướng dẫn AI thay đổi phong cách thành một phong cách ngẫu nhiên được chọn từ các nhãn WikiArt:

Cả Glaze và Mist đều được áp dụng cho hình ảnh trước khi chỉnh sửa, cho phép các nhà nghiên cứu quan sát mức độ mà mỗi biện pháp bảo vệ có thể chặn hoặc làm sai lệch kết quả chuyển phong cách:

Ví dụ về cách các phương pháp bảo vệ ảnh hưởng đến việc chuyển phong cách trên tác phẩm nghệ thuật. Hình ảnh gốc Baroque được hiển thị cùng với các phiên bản được bảo vệ bằng Mist và Glaze. Sau khi áp dụng chuyển phong cách Lập thể, sự khác biệt trong cách mỗi biện pháp bảo vệ thay đổi đầu ra cuối cùng có thể được nhìn thấy.

Ví dụ về cách các phương pháp bảo vệ ảnh hưởng đến việc chuyển phong cách trên tác phẩm nghệ thuật. Hình ảnh gốc Baroque được hiển thị cùng với các phiên bản được bảo vệ bằng Mist và Glaze. Sau khi áp dụng chuyển phong cách Lập thể, sự khác biệt trong cách mỗi biện pháp bảo vệ thay đổi đầu ra cuối cùng có thể được nhìn thấy.

Các nhà nghiên cứu đã kiểm tra các so sánh một cách định lượng:

Thay đổi trong điểm số tương đồng hình ảnh-văn bản sau khi chỉnh sửa chuyển phong cách.

Thay đổi trong điểm số tương đồng hình ảnh-văn bản sau khi chỉnh sửa chuyển phong cách.

Trong số những kết quả này, các tác giả nhận xét:

‘Kết quả làm nổi bật một hạn chế đáng kể của các xáo trộn đối kháng để bảo vệ. Thay vì cản trở sự liên kết, các xáo trộn đối kháng thường tăng cường khả năng phản hồi của mô hình tạo sinh với lời nhắc, vô tình cho phép những kẻ khai thác tạo ra các đầu ra phù hợp hơn với mục tiêu của họ. Loại bảo vệ này không gây rối loạn cho quá trình chỉnh sửa hình ảnh và có thể không đủ để ngăn chặn các tác nhân độc hại sao chép tài liệu không được ủy quyền.

‘Các hậu quả không lường trước của việc sử dụng xáo trộn đối kháng tiết lộ sự dễ bị tổn thương trong các phương pháp hiện có và nhấn mạnh sự cần thiết cấp thiết đối với các kỹ thuật bảo vệ hiệu quả hơn.’

Các tác giả giải thích rằng các kết quả không mong muốn có thể được quy cho cách các mô hình khuếch tán hoạt động: LDM chỉnh sửa hình ảnh bằng cách đầu tiên chuyển chúng thành một phiên bản nén gọi là latent; nhiễu sau đó được thêm vào latent này qua nhiều bước, cho đến khi dữ liệu trở nên gần như ngẫu nhiên.

Mô hình đảo ngược quá trình này trong quá trình tạo, loại bỏ nhiễu逐 bước. Tại mỗi giai đoạn của quá trình đảo ngược này, lời nhắc văn bản giúp hướng dẫn cách làm sạch nhiễu, dần dần định hình hình ảnh để phù hợp với lời nhắc:

So sánh giữa các thế hệ từ một hình ảnh không được bảo vệ và một hình ảnh được bảo vệ bằng PhotoGuard, với các trạng thái latent trung gian được chuyển đổi trở lại thành hình ảnh để trực quan hóa.

So sánh giữa các thế hệ từ một hình ảnh không được bảo vệ và một hình ảnh được bảo vệ bằng PhotoGuard, với các trạng thái latent trung gian được chuyển đổi trở lại thành hình ảnh để trực quan hóa.

Các phương pháp bảo vệ thêm một lượng nhỏ nhiễu vào hình ảnh gốc trước khi nó tham gia vào quá trình này. Mặc dù những xáo trộn này là nhỏ ở đầu vào, nhưng chúng tích tụ khi mô hình áp dụng các lớp nhiễu của riêng nó.

Sự tích tụ này để lại nhiều phần của hình ảnh ‘không chắc chắn’ khi mô hình bắt đầu loại bỏ nhiễu. Với sự không chắc chắn lớn hơn, mô hình dựa nhiều hơn vào lời nhắc văn bản để điền vào các chi tiết bị thiếu, cho lời nhắc sức ảnh hưởng thậm chí còn lớn hơn so với bình thường.

Hiệu quả của các biện pháp bảo vệ là làm cho nó dễ dàng hơn cho AI để định hình lại hình ảnh để phù hợp với lời nhắc, thay vì làm cho nó khó hơn.

Cuối cùng, các tác giả đã thực hiện một thử nghiệm thay thế các xáo trộn được tạo bằng ‘Raising the Cost of Malicious AI-Powered Image Editing’ bài báo bằng nhiễu Gaussian thuần túy.

Kết quả theo cùng mô hình quan sát trước đó: trên tất cả các thử nghiệm, các giá trị Thay Đổi Phần Trăm vẫn còn dương. Ngay cả nhiễu ngẫu nhiên, không có cấu trúc này cũng dẫn đến sự liên kết mạnh hơn giữa các hình ảnh được tạo ra và lời nhắc.

Ảnh hưởng của bảo vệ mô phỏng bằng nhiễu Gaussian trên tập dữ liệu Flickr8k.

Ảnh hưởng của bảo vệ mô phỏng bằng nhiễu Gaussian trên tập dữ liệu Flickr8k.

Điều này hỗ trợ giải thích cơ bản rằng bất kỳ nhiễu nào được thêm vào, bất kể thiết kế của nó, sẽ tạo ra sự không chắc chắn lớn hơn cho mô hình trong quá trình tạo, cho phép lời nhắc văn bản có ảnh hưởng thậm chí còn lớn hơn đến hình ảnh cuối cùng.

Kết Luận

Lĩnh vực nghiên cứu đã thúc đẩy xáo trộn đối kháng để giải quyết vấn đề bản quyền LDM trong gần như toàn bộ thời gian tồn tại của LDM; nhưng không có giải pháp mạnh mẽ nào xuất hiện từ số lượng lớn các bài báo được xuất bản về cách tiếp cận này.

Hoặc là sự xáo trộn áp đặt làm giảm chất lượng của hình ảnh quá nhiều, hoặc các mẫu không chứng minh được sự bền bỉ đối với việc thao túng và các quá trình biến đổi.

Tuy nhiên, đó là một giấc mơ khó bỏ, vì giải pháp thay thế dường như là giám sát và các khuôn khổ chứng nhận của bên thứ ba như kế hoạch C2PA do Adobe dẫn đầu, nhằm duy trì chuỗi quản lý hình ảnh từ cảm biến máy ảnh, nhưng không có mối liên hệ nào với nội dung được mô tả.

Trong mọi trường hợp, nếu xáo trộn đối kháng thực sự làm cho vấn đề trở nên tồi tệ hơn, như bài báo mới cho thấy có thể đúng trong nhiều trường hợp, thì người ta tự hỏi liệu việc tìm kiếm sự bảo vệ bản quyền thông qua các phương tiện như vậy thuộc về ‘hóa học’.

 

Được xuất bản lần đầu vào Thứ Hai, ngày 9 tháng 6 năm 2025

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai