Góc nhìn Anderson

Bây giờ NSFW và ‘Định vị của người nổi tiếng’ Là Thức ăn cho Kiểm duyệt AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
An artist's wooden mannequin getting arrested – Flux 1D.

Một biện pháp bảo vệ AI mới cho các hệ thống video tạo ra đề xuất kiểm duyệt các tư thế cơ thể. Các tư thế vật lý (hoặc biểu cảm khuôn mặt) có thể được giải thích là gợi dục, ‘lời nói xúc phạm’, hoặc thậm chí là các tư thế được bản quyền hoặc có thể được bảo vệ bởi nhãn hiệu, tất cả đều được nhắm mục tiêu.

 

Nghiên cứu mới từ Trung Quốc và Singapore giải quyết một trong những lĩnh vực ít rõ ràng hơn trong việc tạo ra hình ảnh và video ‘không an toàn’: sự描 tả của một tư thế, trong ý nghĩa của sự sắp xếp của cơ thể hoặc biểu cảm khuôn mặt của một người được tạo ra bởi đầu ra AI:

Sơ đồ khái niệm cho PoseGuard, hệ thống được đề xuất trong nghiên cứu mới. Nguồn: https://arxiv.org/pdf/2508.02476

Sơ đồ khái niệm cho PoseGuard, hệ thống được đề xuất trong nghiên cứu mới. Nguồn: https://arxiv.org/pdf/2508.02476

Hệ thống, có tên là PoseGuard, sử dụng tinh chỉnhLoRAs để tạo ra các mô hình không thể tạo ra các tư thế ‘cấm’ một cách nội tại. Cách tiếp cận này được thực hiện vì các biện pháp bảo vệ được tích hợp vào các mô hình FOSS thường có thể bị đánh bại một cách dễ dàng, nhấn mạnh rằng bộ lọc mới này đặc biệt nhắm vào các cài đặt cục bộ (vì các mô hình chỉ có API có thể lọc nội dung và lời nhắc đầu vào và đầu ra mà không cần đe dọa tính toàn vẹn của trọng số mô hình bằng cách tinh chỉnh).

Đây không phải là công việc đầu tiên đối xử với tư thế như dữ liệu không an toàn; ‘biểu cảm khuôn mặt gợi dục’ đã là một lĩnh vực nghiên cứu nhỏ trong một thời gian, trong khi một số tác giả của công việc mới cũng tạo ra hệ thống Dormant ít tinh vi hơn.

Tuy nhiên, bài báo mới là đầu tiên, theo như tôi có thể thấy, để mở rộng việc gán nhãn tư thế ngoài nội dung gợi dục, thậm chí đến mức bao gồm ‘phong cách di chuyển của người nổi tiếng được bản quyền’:

‘Chúng tôi định nghĩa tư thế không an toàn dựa trên rủi ro tiềm ẩn của đầu ra được tạo ra chứ không phải là đặc điểm hình học. [Tư thế không an toàn] bao gồm: 1) tư thế phân biệt đối xử (ví dụ, quỳ gối, lời nói xúc phạm), 2) tư thế gợi dục NSFW, và 3) tư thế nhạy cảm về bản quyền bắt chước hình ảnh cụ thể của người nổi tiếng.

‘Những tư thế này được thu thập thông qua các nguồn trực tuyến (ví dụ, Wikipedia), lọc dựa trên LLM và tập dữ liệu được gắn nhãn rủi ro (ví dụ, thẻ NSFW của Civitai), đảm bảo một tập dữ liệu tư thế không an toàn cân bằng và toàn diện cho việc đào tạo.’

Thể loại 'NSFW' của 50 tư thế cốt lõi được phát triển cho PoseGuard.

Thể loại ‘NSFW’ của 50 tư thế cốt lõi được phát triển cho PoseGuard.

Nó thú vị khi lưu ý rằng các tư thế của người nổi tiếng có thể được bản quyền hoặc bảo vệ bởi các biện pháp pháp lý, và rằng các tổ hợp sáng tạo đủ của tư thế hoặc phong cách có thể được bảo vệ như các chuỗi biên đạo múa duy nhất . Tuy nhiên, thậm chí một tư thế độc đáo duy nhất có thể không được bảo vệ, như một nhiếp ảnh gia đã phát hiện ra, trong quyết định:

Một nhiếp ảnh gia đã chụp ảnh bên trái của Michael Jordan đã kiện Nike khi họ tái tạo ảnh (bên phải); tuy nhiên, một hội đồng các thẩm phán đã từ chối yêu cầu này. Nguồn: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

Một nhiếp ảnh gia đã chụp ảnh bên trái của Michael Jordan đã kiện Nike khi họ tái tạo ảnh (bên phải); tuy nhiên, một hội đồng các thẩm phán đã từ chối yêu cầu này. Nguồn: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

Hệ thống PoseGuard mới tuyên bố là hệ thống đầu tiên làm giảm chất lượng đầu ra khi phát hiện tư thế không an toàn; để nhúng các rào cản an toàn trực tiếp vào mô hình tạo ra; để định nghĩa ‘tư thế không an toàn’ trên ba loại; và để đảm bảo rằng việc tạo ra vẫn giữ được chất lượng và tính toàn vẹn một khi tư thế vi phạm đã được thay đổi đủ để thoát khỏi bộ lọc.

Bài báo mới mới có tiêu đề PoseGuard: Tạo ra có hướng dẫn với các rào cản an toàn, và đến từ sáu nhà nghiên cứu trên Đại học Khoa học và Công nghệ Trung Quốc, Cơ quan Khoa học, Công nghệ và Nghiên cứu (A * STAR CFAR) của Singapore, và Đại học Công nghệ Nanyang.

Phương pháp

PoseGuard sử dụng lại logic của các cuộc tấn công cửa hậu để xây dựng một cơ chế phòng thủ trực tiếp vào mô hình. Trong một cuộc tấn công cửa hậu điển hình, các đầu vào cụ thể kích hoạt các đầu ra độc hại, và PoseGuard đảo ngược thiết lập này: các tư thế được định nghĩa trước được coi là không an toàn do bản chất gợi dục, xúc phạm hoặc nhạy cảm về bản quyền, được liên kết với các hình ảnh mục tiêu ‘trung lập’, chẳng hạn như khung hình trống hoặc mờ.

Bằng cách tinh chỉnh mô hình trên một tập dữ liệu kết hợp của tư thế bình thường và kích hoạt, hệ thống học cách giữ được độ trung thực cho các đầu vào vô hại trong khi làm giảm chất lượng đầu ra cho các tư thế không an toàn:

PoseGuard xử lý hình ảnh tham chiếu và chuỗi tư thế bằng cách sử dụng một mạng nơ-ron Denoising UNet chung, kết hợp các trọng số được đào tạo trước với tinh chỉnh an toàn. Thiết lập này cho phép mô hình подав các thế hệ có hại từ các tư thế không an toàn trong khi duy trì chất lượng đầu ra cho các đầu vào bình thường.

PoseGuard xử lý hình ảnh tham chiếu và chuỗi tư thế bằng cách sử dụng một mạng nơ-ron Denoising UNet chung, kết hợp các trọng số được đào tạo trước với tinh chỉnh an toàn. Thiết lập này cho phép mô hình подав các thế hệ có hại từ các tư thế không an toàn trong khi duy trì chất lượng đầu ra cho các đầu vào bình thường.

Chiến lược ‘trong mô hình’ này loại bỏ nhu cầu về các bộ lọc bên ngoài, và vẫn hiệu quả ngay cả trong các môi trường đối lập hoặc mã nguồn mở.*

Dữ liệu và Kiểm tra

Để có được tư thế cơ bản vô hại, các tác giả đã sử dụng tập dữ liệu UBC-Fashion:

Ví dụ từ tập dữ liệu thời trang của Đại học British Columbia, được sử dụng làm nguồn tư thế vô hại trong PoseGuard. Nguồn: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

Ví dụ từ tập dữ liệu thời trang của Đại học British Columbia, được sử dụng làm nguồn tư thế vô hại trong PoseGuard. Các tư thế trừu tượng được trích xuất từ các hình ảnh này bằng cách sử dụng một khuôn khổ ước lượng tư thế.  Nguồn: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

Các tư thế không an toàn, như đã đề cập trước đó, được lấy từ các nền tảng mã nguồn mở như CivitAI. Các tư thế được trích xuất bằng cách sử dụng khuôn khổ DWPose, kết quả là 768x768px hình ảnh tư thế:

Ví dụ từ 50 tư thế không an toàn được sử dụng trong đào tạo. Hiện tại là tư thế NSFW và nhạy cảm về bản quyền, được lấy từ Wikipedia, Render-State, Civitai và Google Search.

Ví dụ từ 50 tư thế không an toàn được sử dụng trong đào tạo. Hiện tại là tư thế NSFW và nhạy cảm về bản quyền, được lấy từ Wikipedia, Render-State, Civitai và Google Search.

Mô hình tạo ra có hướng dẫn tư thế được AnimateAnyone.

Sáu chỉ số được sử dụng là Fréchet Video Distance (FVD); FID-VID; Chỉ số tương tự cấu trúc (SSIM); Tỷ lệ tín hiệu trên nhiễu đỉnh (PSNR); Các chỉ số tương tự nhận thức được học (LPIPS); và Fréchet Inception Distance (FID). Kiểm tra được thực hiện trên một GPU NVIDIA A6000 với 48GB VRAM, tại một kích thước lô là 4 và một tốc độ học là 1×10-5.

Ba loại chính được kiểm tra là hiệu quả, khả năng chống chịu, và tổng quát hóa.

Trong loại đầu tiên, hiệu quả, các tác giả đã so sánh hai chiến lược đào tạo cho PoseGuard: tinh chỉnh đầy đủ của mạng nơ-ron Denoising UNet và tinh chỉnh hiệu quả tham số bằng cách sử dụng các mô

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai