Góc nhìn Anderson

Hiện nay các tư thế NSFW và ‘Người nổi tiếng’ trở thành mục tiêu cho việc kiểm duyệt AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
An artist's wooden mannequin getting arrested – Flux 1D.

Một biện pháp bảo vệ AI mới cho các hệ thống video sinh ra đề xuất kiểm duyệt các tư thế cơ thể. Các tư thế vật lý (hoặc biểu cảm khuôn mặt) có thể được hiểu là gợi ý tình dục, ‘cử chỉ xúc phạm’, hoặc thậm chí là các tư thế của người nổi tiếng có bản quyền hoặc có khả năng được đăng ký thương hiệu, đều là mục tiêu.

 

Nghiên cứu mới từ Trung Quốc và Singapore đề cập đến một trong những lĩnh vực ít rõ ràng hơn trong việc tạo ra hình ảnh và video ‘không an toàn’: việc mô tả một tư thế, nghĩa là cách bố trí cơ thể hoặc biểu cảm khuôn mặt của người được mô phỏng trong đầu ra do AI tạo ra.

Sơ đồ khái niệm cho PoseGuard, hệ thống được đề xuất trong nghiên cứu mới. Nguồn: https://arxiv.org/pdf/2508.02476

Sơ đồ khái niệm cho PoseGuard, hệ thống được đề xuất trong nghiên cứu mới. Nguồn: https://arxiv.org/pdf/2508.02476

Hệ thống, có tên PoseGuard, sử dụng điều chỉnh chi tiết và LoRAs để tạo ra các mô hình vốn không thể sinh ra các tư thế ‘bị cấm’. Cách tiếp cận này được chọn vì các biện pháp bảo vệ được tích hợp trong các mô hình FOSS thường có thể được vượt qua một cách đơn giản, nhấn mạnh rằng ‘bộ lọc’ mới này đặc biệt nhắm vào các cài đặt cục bộ (vì các mô hình chỉ có API có thể lọc nội dung và lời nhắc vào và ra, mà không cần đe dọa tính toàn vẹn của trọng số mô hình bằng việc điều chỉnh chi tiết).

Đây không phải là công trình đầu tiên xem các tư thế như dữ liệu không an toàn; ‘biểu cảm khuôn mặt mang tính tình dục’ đã là một lĩnh vực phụ nhỏ trong một thời gian, trong khi một số tác giả của công trình mới cũng đã tạo ra hệ thống Dormant ít tinh vi hơn.

Tuy nhiên, bài báo mới là lần đầu tiên, theo như tôi hiểu, mở rộng việc phân loại các tư thế vượt ra ngoài nội dung tình dục, thậm chí bao gồm cả ‘các chuyển động của người nổi tiếng có bản quyền’:

‘Chúng tôi định nghĩa các tư thế không an toàn dựa trên các rủi ro tiềm tàng của đầu ra được tạo ra thay vì các đặc điểm hình học. [Unsafe] các tư thế bao gồm: 1) các tư thế phân biệt (ví dụ, quỳ gối, chào thù), 2) các tư thế gợi ý tình dục NSFW, và 3) các tư thế nhạy cảm về bản quyền mô phỏng hình ảnh đặc trưng của người nổi tiếng.

‘Các tư thế này được thu thập qua các nguồn trực tuyến (ví dụ, Wikipedia), lọc dựa trên LLM, và các bộ dữ liệu được gắn nhãn rủi ro (ví dụ, thẻ NSFW của Civitai), đảm bảo một bộ dữ liệu tư thế không an toàn cân bằng và toàn diện để đào tạo.’

Danh mục 'NSFW' của 50 tư thế cốt lõi được phát triển cho PoseGuard.

Danh mục ‘NSFW’ của 50 tư thế cốt lõi được phát triển cho PoseGuard.

Thú vị là các tư thế của người nổi tiếng có thể được đăng ký thương hiệu hoặc được bảo vệ bằng các biện pháp pháp lý, và các kết hợp ‘sáng tạo’ đủ để tạo thành các chuỗi biên đạo độc đáo cũng có thể được bảo vệ. Tuy nhiên, ngay cả một tư thế đơn độc mang tính biểu tượng cũng có thể không được bảo vệ, như một nhiếp ảnh gia đã phát hiện trong vụ án Rentmeester vs. Nike phán quyết:

Một nhiếp ảnh gia chụp bức ảnh bên trái của Michael Jordan đã kiện Nike khi họ tái tạo lại bức ảnh (bên phải); tuy nhiên, một hội đồng xét xử đã bác bỏ yêu cầu. Nguồn: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

Một nhiếp ảnh gia chụp bức ảnh bên trái của Michael Jordan đã kiện Nike khi họ tái tạo lại bức ảnh (bên phải); tuy nhiên, một hội đồng xét xử đã bác bỏ yêu cầu. Nguồn: https://writtendescription.blogspot.com/2018/02/can-you-copyright-pose.html

Hệ thống PoseGuard mới tuyên bố là đầu tiên làm giảm chất lượng đầu ra khi phát hiện một tư thế không an toàn; nhúng các rào chắn an toàn trực tiếp vào mô hình sinh; định nghĩa các tư thế ‘không an toàn’ qua ba danh mục; và đảm bảo rằng việc tạo ra vẫn giữ được chất lượng và tính toàn vẹn sau khi một tư thế vi phạm đã được chỉnh sửa đủ để thoát khỏi bộ lọc.

Bài bài báo mới có tiêu đề PoseGuard: Pose-Guided Generation with Safety Guardrails, và được thực hiện bởi sáu nhà nghiên cứu thuộc Đại học Khoa học và Công nghệ Trung Quốc, Cơ quan Khoa học, Công nghệ và Nghiên cứu Singapore (A*STAR CFAR), và Đại học Công nghệ Nanyang.

Phương pháp

PoseGuard tái sử dụng logic của cuộc tấn công lỗ hậu để xây dựng cơ chế phòng thủ trực tiếp vào mô hình. Trong một cuộc tấn công lỗ hậu điển hình, các đầu vào cụ thể kích hoạt các đầu ra độc hại, và PoseGuard đảo ngược thiết lập này: một số tư thế được định trước và được coi là không an toàn vì tính tình dục, xúc phạm, hoặc nhạy cảm về bản quyền, được liên kết với các hình ảnh mục tiêu ‘trung tính’, chẳng hạn như khung trống hoặc mờ.

Bằng cách điều chỉnh chi tiết mô hình trên một bộ dữ liệu kết hợp giữa các tư thế bình thường và các tư thế kích hoạt, hệ thống học cách duy trì độ trung thực cho các đầu vào lành mạnh trong khi làm giảm chất lượng đầu ra cho các tư thế không an toàn:

PoseGuard xử lý một hình ảnh tham chiếu và chuỗi tư thế bằng một UNet khử nhiễu chung, kết hợp trọng số đã được huấn luyện trước với việc điều chỉnh chi tiết phù hợp với an toàn. Cấu hình này cho phép mô hình ức chế các thế hệ có hại từ các tư thế không an toàn đồng thời duy trì chất lượng đầu ra cho các đầu vào bình thường.

PoseGuard xử lý một hình ảnh tham chiếu và chuỗi tư thế bằng một UNet khử nhiễu chung, kết hợp trọng số đã được huấn luyện trước với việc điều chỉnh chi tiết phù hợp với an toàn. Cấu hình này cho phép mô hình ức chế các thế hệ có hại từ các tư thế không an toàn đồng thời duy trì chất lượng đầu ra cho các đầu vào bình thường.

Chiến lược ‘trong mô hình’ này loại bỏ nhu cầu sử dụng bộ lọc bên ngoài và vẫn hiệu quả ngay cả trong môi trường đối kháng hoặc mã nguồn mở.*

Dữ liệu và Kiểm tra

Để có được các tư thế nền lành tính, các tác giả đã sử dụng bộ dữ liệu UBC-Fashion:

Ví dụ từ bộ dữ liệu thời trang của Đại học British Columbia, được sử dụng làm nguồn các tư thế lành tính trong PoseGuard. Nguồn: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

Ví dụ từ bộ dữ liệu thời trang của Đại học British Columbia, được sử dụng làm nguồn các tư thế lành tính trong PoseGuard. Các tư thế trừu tượng đã được trích xuất từ những hình ảnh này bằng khung công cụ ước lượng tư thế.  Source: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

Các tư thế không an toàn, như đã đề cập trước đó, được lấy từ các nền tảng mã nguồn mở như CivitAI. Các tư thế được trích xuất bằng khung công cụ DWPose, tạo ra các hình ảnh tư thế kích thước 768x768px:

Ví dụ từ 50 tư thế không an toàn được sử dụng trong quá trình huấn luyện. Ở đây hiển thị các tư thế NSFW và nhạy cảm về bản quyền, được lấy từ Wikipedia, Render-State, Civitai và Google Search.

Ví dụ từ 50 tư thế không an toàn được sử dụng trong quá trình huấn luyện. Ở đây hiển thị các tư thế NSFW và nhạy cảm về bản quyền, được lấy từ Wikipedia, Render-State, Civitai và Google Search.

Mô hình sinh dựa trên tư thế là AnimateAnyone.

Sáu chỉ số được sử dụng là Khoảng cách Video Fréchet (FVD); FID-VID; Chỉ số Độ tương đồng Cấu trúc (SSIM); Tỷ lệ Tín hiệu trên Nhiễu Đỉnh (PSNR); Các chỉ số Độ tương đồng Nhận thức đã học (LPIPS); và Khoảng cách Inception Fréchet (FID). Các thử nghiệm được thực hiện trên GPU NVIDIA A6000 với 48GB VRAM, với kích thước batch là 4 và tốc độ học là 1×10-5.

Ba danh mục chính được kiểm tra là hiệu quả, độ bền, và khả năng tổng quát.

Trong mục đầu tiên, hiệu quả, các tác giả đã so sánh hai chiến lược huấn luyện cho PoseGuard: tinh chỉnh toàn bộ UNet giảm nhiễu và tinh chỉnh hiệu quả tham số bằng các mô-đun LoRA.

Cả hai cách tiếp cận đều ức chế đầu ra từ các tư thế không an toàn trong khi duy trì chất lượng đầu ra cho các tư thế lành tính, nhưng có những đánh đổi khác nhau: tinh chỉnh toàn bộ đạt được mức ức chế mạnh hơn và duy trì độ trung thực cao hơn, đặc biệt khi số lượng tư thế không an toàn trong quá trình huấn luyện ít; trong khi tinh chỉnh dựa trên LoRA gây suy giảm nhiều hơn về chất lượng sinh khi số lượng tư thế không an toàn tăng lên – nhưng yêu cầu ít tham số hơn đáng kể và giảm nhu cầu tính toán.

Hiệu suất PoseGuard trên các chỉ số sinh và phòng thủ. Mũi tên lên chỉ các chỉ số mà giá trị cao hơn là tốt hơn; mũi tên xuống chỉ các chỉ số mà giá trị thấp hơn là tốt hơn.

Hiệu suất PoseGuard trên các chỉ số sinh và phòng thủ. Mũi tên lên chỉ các chỉ số mà giá trị cao hơn là tốt hơn; mũi tên xuống chỉ các chỉ số mà giá trị thấp hơn là tốt hơn.

Kết quả định tính (xem hình dưới) cho thấy, khi không can thiệp, mô hình tái tạo các tư thế gây xúc phạm và NSFW với độ trung thực cao. Khi bật PoseGuard, các tư thế này gây ra đầu ra chất lượng thấp hoặc trống, trong khi các đầu vào lành tính vẫn giữ nguyên hình ảnh. Khi bộ phòng thủ mở rộng từ bốn lên ba mươi hai tư thế không an toàn, chất lượng đầu ra lành tính giảm nhẹ, đặc biệt đối với LoRA.

Kết quả hình ảnh cho thấy cách PoseGuard phản hồi với một tư thế không an toàn bằng việc tinh chỉnh toàn tham số. Mô hình ức chế đầu ra cho các tư thế phân biệt, NSFW và nhạy cảm về bản quyền, chuyển chúng thành hình ảnh đen, đồng thời duy trì chất lượng cho các đầu vào bình thường.

Kết quả hình ảnh cho thấy cách PoseGuard phản hồi với một tư thế không an toàn bằng việc tinh chỉnh toàn tham số. Mô hình ức chế đầu ra cho các tư thế phân biệt, NSFW và nhạy cảm về bản quyền, chuyển chúng thành hình ảnh đen, đồng thời duy trì chất lượng cho các đầu vào bình thường.

Đối với độ bền, PoseGuard đã được kiểm tra trong các điều kiện mô phỏng triển khai thực tế, nơi các tư thế đầu vào có thể không khớp chính xác với các ví dụ đã định sẵn. Đánh giá bao gồm các biến đổi phổ biến như dịch chuyển, phóng to/thu nhỏ, và xoay, cùng với việc điều chỉnh thủ công các góc khớp để mô phỏng sự biến thiên tự nhiên.

Kết quả về độ bền của PoseGuard khi đối mặt với các biến đổi tư thế phổ biến.

Kết quả về độ bền của PoseGuard khi đối mặt với các biến đổi tư thế phổ biến.

Trong hầu hết các trường hợp, mô hình vẫn tiếp tục ức chế các thế hệ không an toàn, cho thấy biện pháp phòng thủ vẫn bền vững trước các nhiễu nhẹ. Khi các thay đổi loại bỏ rủi ro tiềm ẩn trong tư thế, mô hình ngừng ức chế và tạo ra đầu ra bình thường, cho thấy nó tránh các cảnh báo sai khi có những sai lệch lành tính.

Đánh giá độ bền của PoseGuard đối với các chỉnh sửa tư thế. Hình minh họa hiển thị đầu ra của mô hình cho các tư thế không an toàn đã được thay đổi bằng dịch chuyển, phóng to/thu nhỏ và xoay, cũng như điều chỉnh chi tay thủ công. PoseGuard tiếp tục ức chế các thế hệ không an toàn khi có những thay đổi nhẹ, nhưng trở lại đầu ra bình thường khi tư thế không còn chứa nội dung rủi ro.

Đánh giá độ bền của PoseGuard đối với các thay đổi tư thế. Hình minh họa cho thấy các đầu ra của mô hình cho các tư thế không an toàn đã được thay đổi bằng việc dịch chuyển, thu phóng và quay, cũng như điều chỉnh chi tay thủ công. PoseGuard tiếp tục ức chế các thế hệ không an toàn khi có những thay đổi nhẹ, nhưng sẽ trở lại đầu ra bình thường khi tư thế không còn chứa nội dung ‘rủi ro’.

Cuối cùng, trong chuỗi thí nghiệm chính, các nhà nghiên cứu đã kiểm tra PoseGuard về khả năng tổng quát hoá – khả năng hoạt động hiệu quả trên dữ liệu mới, trong nhiều môi trường và hoàn cảnh.

Ở đây, PoseGuard được áp dụng cho việc tạo video dựa trên hình ảnh tham chiếu bằng mô hình AnimateAnyone đã đề cập. Trong bối cảnh này, hệ thống cho thấy khả năng ức chế mạnh hơn các đầu ra không được phép so với điều khiển dựa trên tư thế, với việc suy giảm gần như toàn bộ video được tạo trong một số trường hợp:

So sánh hiệu suất của PoseGuard khi được áp dụng cho tạo video dựa trên tư thế so với tạo video dựa trên hình ảnh tham chiếu, sử dụng việc fine-tuning toàn bộ trên bốn đầu vào không an toàn.

So sánh hiệu suất của PoseGuard khi được áp dụng cho tạo video dựa trên tư thế so với tạo video dựa trên hình ảnh tham chiếu, sử dụng việc fine-tuning toàn bộ trên bốn đầu vào không an toàn.

Các tác giả cho rằng điều này là do thông tin nhận dạng dày đặc trong hình ảnh tham chiếu, cho phép mô hình dễ dàng học hành vi phòng thủ mục tiêu hơn. Kết quả, họ gợi ý, cho thấy PoseGuard có thể hạn chế rủi ro mạo danh trong các kịch bản mà video được tạo trực tiếp từ ngoại hình của một người.

Đối với bài kiểm tra cuối cùng, các tác giả đã áp dụng PoseGuard vào việc tổng hợp video dựa trên các điểm mốc khuôn mặt bằng hệ thống AniPortrait, một kịch bản nhắm vào các biểu cảm khuôn mặt chi tiết thay vì toàn bộ tư thế cơ thể.

Các biểu cảm khuôn mặt không an toàn bị ức chế trong AniPortrait, với hệ thống mới.

Các biểu cảm khuôn mặt không an toàn bị ức chế trong AniPortrait, với hệ thống mới.

Bằng cách fine-tune Denoising UNet với cùng cơ chế phòng thủ, mô hình đã có thể ức chế các đầu ra từ các điểm mốc khuôn mặt không an toàn trong khi để các biểu cảm lành mạnh không bị ảnh hưởng. Kết quả, các tác giả cho rằng, cho thấy PoseGuard có thể tổng quát hoá qua các mô hình đầu vào và duy trì hiệu quả trong các nhiệm vụ tạo video dựa trên biểu cảm, tập trung hơn.

Kết quả hình ảnh cho thấy cách PoseGuard phản hồi với việc tạo video dựa trên hình ảnh tham chiếu.

Kết quả hình ảnh cho thấy cách PoseGuard phản hồi với việc tạo video dựa trên hình ảnh tham chiếu.

Kết luận

Phải thừa nhận rằng đối với nhiều trong số 50 tư thế tham chiếu bị cấm được đưa ra trong bài báo, các hoạt động như khám sức khỏe, hoặc thậm chí là các công việc nhà tẻ nhạt, có khả năng sẽ bị chặn trong một hiện tượng có thể chỉ được mô tả là phiên bản tổng hợp của hiệu ứng Scunthorpe.

Từ quan điểm đó, và thậm chí hơn nữa trong trường hợp các biểu cảm khuôn mặt (có thể mang tính mơ hồ và tinh tế hơn về ý định), PoseGuard dường như là một công cụ thô. Thêm vào đó, do một hiệu ứng răn đe chung quanh AI NSFW, các bản phát hành FOSS như Flux Kontext gần đây thường bị kiểm duyệt rất nghiêm trong mọi trường hợp, dù là qua việc lọc dữ liệu nghiêm ngặt, chỉnh sửa trọng số, hay cả hai.

Do đó, việc thêm các hạn chế được đề xuất ở đây vào gánh nặng của việc kiểm duyệt mô hình cục bộ dường như là một lời đề nghị ngầm nhằm ức chế hiệu quả của các hệ thống sinh tạo không qua API. Điều này có thể chỉ ra một tương lai mà các mô hình cục bộ chỉ có thể tạo ra các sản phẩm kém hơn so với bất kỳ gì người dùng muốn, trong khi các mô hình API cung cấp đầu ra vượt trội vô hạn, nếu người dùng có thể vượt qua các lớp lọc và biện pháp bảo vệ mà bộ phận pháp lý của công ty chủ quản áp đặt.

Một hệ thống như PoseGuard, trong đó việc fine-tuning ảnh hưởng trực tiếp đến chất lượng đầu ra của mô hình gốc (mặc dù điều này bị bỏ qua trong bài báo), không nhằm vào các hệ thống API; các mô hình tiên phong chỉ trực tuyến có khả năng sẽ tiếp tục hưởng lợi từ dữ liệu đào tạo không bị hạn chế, vì khả năng NSFW mạnh mẽ của các mô hình này được kiểm soát bằng các biện pháp giám sát đáng kể.

 

* Phương pháp ngắn gọn như trong bài báo (chỉ dài năm trang), và như thường lệ, cách tiếp cận được hiểu rõ nhất từ phần thử nghiệm.

Được xuất bản lần đầu vào thứ Tư, ngày 6 tháng 8 năm 2025

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai