Góc nhìn Anderson

Trích xuất Dữ liệu Huấn luyện từ Mô hình Stable Diffusion Tinh chỉnh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Examples of training images (below), extracted from a trained model (above). Source: https://arxiv.org/pdf/2410.03039

Nghiên cứu mới từ Mỹ trình bày một phương pháp để trích xuất các phần đáng kể của dữ liệu huấn luyện từ các mô hình tinh chỉnh.

Điều này có thể cung cấp bằng chứng pháp lý trong các trường hợp mà phong cách của một nghệ sĩ đã bị sao chép hoặc hình ảnh được bảo vệ bởi bản quyền đã được sử dụng để huấn luyện các mô hình sinh tổng hợp của các nhân vật công chúng, nhân vật được bảo vệ bởi bản quyền hoặc các nội dung khác.

Từ bài báo mới: hình ảnh huấn luyện ban đầu được hiển thị ở hàng trên và hình ảnh trích xuất được hiển thị ở hàng dưới. Nguồn: https://arxiv.org/pdf/2410.03039

Từ bài báo mới: hình ảnh huấn luyện ban đầu được hiển thị ở hàng trên và hình ảnh trích xuất được hiển thị ở hàng dưới. Nguồn: https://arxiv.org/pdf/2410.03039

Các mô hình như vậy được sử dụng rộng rãi và miễn phí trên internet, chủ yếu thông qua các kho lưu trữ do người dùng đóng góp khổng lồ của civit.ai và, ở mức độ thấp hơn, trên nền tảng kho lưu trữ Hugging Face.

Mô hình mới được phát triển bởi các nhà nghiên cứu được gọi là FineXtract, và các tác giả cho rằng nó đạt được kết quả tốt nhất trong nhiệm vụ này.

Bài báo quan sát:

‘[Khung khổ của chúng tôi] giải quyết hiệu quả thách thức của việc trích xuất dữ liệu tinh chỉnh từ các điểm kiểm tra DM tinh chỉnh công khai. Bằng cách tận dụng sự chuyển đổi từ phân phối DM được đào tạo trước sang phân phối dữ liệu tinh chỉnh, FineXtract hướng dẫn quá trình tạo ra hướng đến các vùng có xác suất cao của phân phối dữ liệu tinh chỉnh, cho phép trích xuất dữ liệu thành công.’

Phía bên phải, hình ảnh ban đầu được sử dụng trong huấn luyện. Thứ hai từ bên phải, hình ảnh được trích xuất thông qua FineXtract. Các cột khác đại diện cho các phương pháp trước đó.

Phía bên phải, hình ảnh ban đầu được sử dụng trong huấn luyện. Thứ hai từ bên phải, hình ảnh được trích xuất thông qua FineXtract. Các cột khác đại diện cho các phương pháp trước đó. Vui lòng tham khảo bài báo nguồn để có độ phân giải tốt hơn.

Tại sao nó quan trọng

Các mô hình đã được đào tạo ban đầu cho các hệ thống sinh tổng hợp văn bản-hình ảnh như Stable DiffusionFlux có thể được tải xuống và tinh chỉnh bởi người dùng cuối, sử dụng các kỹ thuật như triển khai DreamBooth năm 2022.

Dễ dàng hơn, người dùng có thể tạo một mô hình LoRA nhỏ hơn nhiều mà gần như hiệu quả như một mô hình tinh chỉnh hoàn chỉnh.

Một ví dụ về mô hình LORA đã được đào tạo, được cung cấp miễn phí để tải xuống tại trang web Civitai rất phổ biến. Mô hình như vậy có thể được tạo ra trong vài phút đến vài giờ, bởi những người đam mê sử dụng phần mềm mã nguồn mở được cài đặt cục bộ – và trực tuyến, thông qua một số hệ thống đào tạo API cho phép hơn. Nguồn: civitai.com

Một ví dụ về mô hình LORA đã được đào tạo, được cung cấp miễn phí để tải xuống tại trang web Civitai rất phổ biến. Mô hình như vậy có thể được tạo ra trong vài phút đến vài giờ, bởi những người đam mê sử dụng phần mềm mã nguồn mở được cài đặt cục bộ – và trực tuyến, thông qua một số hệ thống đào tạo API cho phép hơn. Nguồn: civitai.com

Kể từ năm 2022, nó đã trở nên đơn giản để tạo ra các điểm kiểm tra tinh chỉnh cụ thể và LoRA, bằng cách cung cấp chỉ một số lượng nhỏ (trung bình 5-50) hình ảnh có chú thích và đào tạo điểm kiểm tra (hoặc LoRA) cục bộ, trên một khuôn khổ mã nguồn mở như Kohya ss, hoặc sử dụng dịch vụ trực tuyến.

Phương pháp tạo ra các bản sao giả mạo tinh vi này đã đạt được độ nổi tiếng trong truyền thông trong vài năm qua. Nhiều nghệ sĩ cũng đã có tác phẩm của mình được đưa vào các mô hình sinh tổng hợp sao chép phong cách của họ. Cuộc tranh cãi xung quanh những vấn đề này đã tăng cường trong 18 tháng qua.

Sự dễ dàng mà người dùng có thể tạo ra các hệ thống AI sao chép tác phẩm của các nghệ sĩ thực sự đã gây ra sự phẫn nộ và các chiến dịch đa dạng trong hai năm qua. Nguồn: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Sự dễ dàng mà người dùng có thể tạo ra các hệ thống AI sao chép tác phẩm của các nghệ sĩ thực sự đã gây ra sự phẫn nộ và các chiến dịch đa dạng trong hai năm qua. Nguồn: https://www.technologyreview.com/2022/09/16/1059598/this-artist-is-dominating-ai-generated-art-and-hes-not-happy-about-it/

Nó khó để chứng minh hình ảnh nào được sử dụng trong một điểm kiểm tra tinh chỉnh hoặc trong một LoRA, vì quá trình tổng quát hóa ‘trừu tượng hóa’ danh tính từ các tập dữ liệu huấn luyện nhỏ và không có khả năng tái tạo lại các ví dụ từ tập dữ liệu huấn luyện (trừ khi trong trường hợp quá拟 hợp, nơi mà quá trình huấn luyện có thể được coi là thất bại).

Đây là nơi FineXtract tham gia. Bằng cách so sánh trạng thái của ‘mô hình khuôn mẫu’ khuếch tán mà người dùng đã tải xuống với mô hình mà họ tạo ra thông qua tinh chỉnh hoặc thông qua LoRA, các nhà nghiên cứu đã có thể tạo ra các bản tái tạo chính xác của dữ liệu huấn luyện.

Mặc dù FineXtract chỉ có thể tái tạo 20% dữ liệu từ một tinh chỉnh, điều này vẫn hơn nhiều so với những gì thường được cần để cung cấp bằng chứng rằng người dùng đã sử dụng tài liệu được bảo vệ bởi bản quyền hoặc bị cấm trong việc sản xuất một mô hình sinh tổng hợp. Trong hầu hết các ví dụ được cung cấp, hình ảnh trích xuất rất gần với tài liệu nguồn đã biết.

Khi các chú thích được cần để trích xuất hình ảnh nguồn, điều này không phải là một rào cản đáng kể vì hai lý do: a) người tải lên thường muốn tạo điều kiện cho việc sử dụng mô hình trong một cộng đồng và sẽ thường cung cấp các ví dụ về lời nhắc phù hợp; và b) nó không khó, các nhà nghiên cứu đã tìm thấy, để trích xuất các thuật ngữ quan trọng một cách mù quáng từ mô hình tinh chỉnh:

các từ khóa thiết yếu thường có thể được trích xuất một cách mù quáng từ mô hình tinh chỉnh bằng cách sử dụng một cuộc tấn công L2-PGD trong 1000 lần lặp lại, từ một lời nhắc ngẫu nhiên.

các từ khóa thiết yếu thường có thể được trích xuất một cách mù quáng từ mô hình tinh chỉnh bằng cách sử dụng một cuộc tấn công L2-PGD trong 1000 lần lặp lại, từ một lời nhắc ngẫu nhiên.

Người dùng thường tránh làm cho tập dữ liệu huấn luyện của họ có sẵn cùng với mô hình đã được đào tạo theo kiểu ‘hộp đen’. Đối với nghiên cứu, các tác giả đã hợp tác với các nhà đam mê học máy đã cung cấp dữ liệu.

Bài báo mới mới có tiêu đề Revealing the Unseen: Guiding Personalized Diffusion Models to Expose Training Data, và đến từ ba nhà nghiên cứu tại các trường đại học Carnegie Mellon và Purdue.

Phương pháp

‘Kẻ tấn công’ (trong trường hợp này, hệ thống FineXtract) so sánh các phân phối dữ liệu ước tính trên mô hình ban đầu và mô hình tinh chỉnh, trong một quá trình mà các tác giả gọi là ‘hướng dẫn mô hình’.

Thông qua 'hướng dẫn mô hình', được phát triển bởi các nhà nghiên cứu của bài báo mới, các đặc điểm tinh chỉnh có thể được ánh xạ, cho phép trích xuất dữ liệu huấn luyện.

Thông qua ‘hướng dẫn mô hình’, được phát triển bởi các nhà nghiên cứu của bài báo mới, các đặc điểm tinh chỉnh có thể được ánh xạ, cho phép trích xuất dữ liệu huấn luyện.

Các tác giả giải thích:

‘Trong quá trình tinh chỉnh, các [mô hình khuếch tán] dần dần thay đổi phân phối đã học của chúng từ phân phối [của mô hình đã được đào tạo trước] sang phân phối dữ liệu tinh chỉnh.

‘Do đó, chúng tôi xấp xỉ tham số [phân phối đã học] của các [mô hình khuếch tán] tinh chỉnh.’

Theo cách này, tổng của sự khác biệt giữa mô hình cốt lõi và mô hình tinh chỉnh cung cấp quá trình hướng dẫn.

Các tác giả thêm:

‘Với hướng dẫn mô hình, chúng tôi có thể mô phỏng một “pseudo-”[denoiser], có thể được sử dụng để điều khiển quá trình lấy mẫu hướng đến vùng có xác suất cao trong phân phối dữ liệu tinh chỉnh.’

Quá trình hướng dẫn phụ thuộc vào một quá trình tạo nhiễu thay đổi theo thời gian tương tự như outing Erasing Concepts from Diffusion Models năm 2023.

Dự đoán làm mờ được lấy cũng cung cấp một tỷ lệ Classifier-Free Guidance (CFG) có thể. Điều này quan trọng, vì CFG ảnh hưởng đáng kể đến chất lượng hình ảnh và độ trung thực với lời nhắc văn bản của người dùng.

Để cải thiện độ chính xác của hình ảnh trích xuất, FineXtract dựa trên sự hợp tác được ca ngợi năm 2023 hợp tác Extracting Training Data from Diffusion Models. Phương pháp được sử dụng là tính toán sự tương tự của từng cặp hình ảnh được tạo ra, dựa trên một ngưỡng được định nghĩa bởi Self-Supervised Descriptor (SSCD) điểm.

Theo cách này, thuật toán phân cụm giúp FineXtract xác định tập hợp con của hình ảnh trích xuất phù hợp với dữ liệu huấn luyện.

Trong trường hợp này, các nhà nghiên cứu đã hợp tác với người dùng đã cung cấp dữ liệu. Một người có thể nói rằng, không có dữ liệu như vậy, nó sẽ là không thể chứng minh rằng hình ảnh được tạo ra cụ thể nào đã được sử dụng trong huấn luyện ban đầu. Tuy nhiên, bây giờ nó tương đối đơn giản để khớp hình ảnh được tải lên với hình ảnh trực tiếp trên web hoặc hình ảnh cũng trong các tập dữ liệu đã xuất bản, dựa chỉ trên nội dung hình ảnh.

Dữ liệu và Kiểm tra

Để kiểm tra FineXtract, các tác giả đã tiến hành các thí nghiệm trên học với ít mẫu tinh chỉnh trên hai kịch bản tinh chỉnh phổ biến nhất, trong phạm vi dự án: phong cách nghệ thuậttạo ra dựa trên đối tượng (sau này bao gồm các chủ đề dựa trên khuôn mặt).

Họ đã chọn ngẫu nhiên 20 nghệ sĩ (mỗi nghệ sĩ có 10 hình ảnh) từ tập dữ liệu WikiArt và 30 chủ đề (mỗi chủ đề có 5-6 hình ảnh) từ tập dữ liệu DreamBooth, để giải quyết các kịch bản này.

DreamBooth và LoRA là các phương pháp tinh chỉnh được nhắm đến, và Stable Diffusion V1/.4 được sử dụng cho các kiểm tra.

Nếu thuật toán phân cụm trả về không có kết quả sau 30 giây, ngưỡng sẽ được sửa đổi cho đến khi hình ảnh được trả về.

Hai chỉ số được sử dụng cho hình ảnh được tạo ra là Độ tương tự trung bình (AS) dưới SSCD và Tỷ lệ thành công trích xuất trung bình (A-ESR) – một thước đo rộng rãi phù hợp với các công việc trước đó, nơi một điểm 0,7 đại diện cho việc trích xuất dữ liệu huấn luyện thành công hoàn toàn.

Vì các phương pháp trước đó đã sử dụng либо tạo ra hình ảnh trực tiếp từ văn bản hoặc CFG, các nhà nghiên cứu đã so sánh FineXtract với hai phương pháp này.

Kết quả so sánh FineXtract với hai phương pháp phổ biến trước đó.

Kết quả so sánh FineXtract với hai phương pháp phổ biến trước đó.

Các tác giả nhận xét:

‘[Kết quả] cho thấy lợi thế đáng kể của FineXtract so với các phương pháp trước đó, với sự cải thiện khoảng 0,02 đến 0,05 trong AS và gấp đôi A-ESR trong hầu hết các trường hợp.’

Để kiểm tra khả năng tổng quát hóa của phương pháp cho dữ liệu mới, các nhà nghiên cứu đã tiến hành một kiểm tra thêm, sử dụng Stable Diffusion (V1.4), Stable Diffusion XLAltDiffusion.

FineXtract được áp dụng trên một loạt các mô hình khuếch tán. Đối với thành phần WikiArt, kiểm tra tập trung vào bốn lớp trong WikiArt.

FineXtract được áp dụng trên một loạt các mô hình khuếch tán. Đối với thành phần WikiArt, kiểm tra tập trung vào bốn lớp trong WikiArt.

Como được thấy trong kết quả trên, FineXtract đã có thể đạt được sự cải thiện so với các phương pháp trước đó trong kiểm tra rộng rãi này.

So sánh định tính của kết quả trích xuất từ FineXtract và các phương pháp trước đó. Vui lòng tham khảo bài báo nguồn để có độ phân giải tốt hơn.

So sánh định tính của kết quả trích xuất từ FineXtract và các phương pháp trước đó. Vui lòng tham khảo bài báo nguồn để có độ phân giải tốt hơn.

Các tác giả quan sát rằng khi một số lượng hình ảnh tăng lên được sử dụng trong tập dữ liệu cho một mô hình tinh chỉnh, thuật toán phân cụm cần phải được chạy trong một khoảng thời gian dài hơn để vẫn hiệu quả.

Họ cũng quan sát thấy rằng nhiều phương pháp đã được phát triển trong những năm gần đây để cản trở việc trích xuất này, dưới danh nghĩa bảo vệ quyền riêng tư. Do đó, họ đã kiểm tra FineXtract chống lại dữ liệu được tăng cường bởi các phương pháp CutoutRandAugment.

So sánh định tính của kết quả trích xuất từ FineXtract và các phương pháp trước đó. Vui lòng tham khảo bài báo nguồn để có độ phân giải tốt hơn.

FineXtract hoạt động chống lại hình ảnh được bảo vệ bởi Cutout và RandAugment.

Mặc dù các tác giả thừa nhận rằng hai hệ thống bảo vệ này hoạt động khá tốt trong việc che giấu nguồn dữ liệu huấn luyện, họ lưu ý rằng điều này đi kèm với chi phí của sự suy giảm chất lượng đầu ra nghiêm trọng đến mức làm cho việc bảo vệ trở nên vô nghĩa:

Hình ảnh được tạo ra dưới Stable Diffusion V1.4, tinh chỉnh với các biện pháp phòng vệ – làm giảm chất lượng hình ảnh nghiêm trọng.

Hình ảnh được tạo ra dưới Stable Diffusion V1.4, tinh chỉnh với các biện pháp phòng vệ – làm giảm chất lượng hình ảnh nghiêm trọng. Vui lòng tham khảo bài báo nguồn để có độ phân giải tốt hơn.

Bài báo kết luận:

‘Thí nghiệm của chúng tôi chứng minh sự mạnh mẽ của phương pháp trên các tập dữ liệu và điểm kiểm tra thực tế, làm nổi bật các rủi ro của việc rò rỉ dữ liệu và cung cấp bằng chứng mạnh mẽ cho việc vi phạm bản quyền.’

Kết luận

Năm 2024 đã chứng minh là năm mà sự quan tâm của các tập đoàn đối với dữ liệu huấn luyện ‘sạch’ tăng lên đáng kể, trước sự phủ sóng của truyền thông về khả năng thay thế con người của AI và triển vọng bảo vệ pháp lý các mô hình sinh tổng hợp mà họ rất muốn khai thác.

Nó dễ dàng khi tuyên bố rằng dữ liệu huấn luyện của bạn là sạch, nhưng nó cũng đang trở nên dễ dàng hơn cho các công nghệ tương tự để chứng minh rằng nó không phải như vậy – như Runway ML, Stability.ai và MidJourney (trong số những công ty khác) đã phát hiện trong những ngày gần đây.

Các dự án như FineXtract có thể được coi là điềm báo của sự kết thúc tuyệt đối của kỷ nguyên ‘phương tây hoang dã’ của AI, nơi mà ngay cả bản chất bí ẩn của một không gian ẩn đã được đào tạo có thể được đưa ra để giải trình.

 

* Để thuận tiện, chúng tôi sẽ giả định ‘tinh chỉnh và LoRA’, khi cần thiết.

Được xuất bản lần đầu vào thứ hai, ngày 7 tháng 10 năm 2024

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được giải thể vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: [email protected]