Anderson’un Açısı

Şimdi NSFW ve ‘Ünlü’ Pozlar AI Sansürü için Malzemedir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
An artist's wooden mannequin getting arrested – Flux 1D.

Yeniden oluşturulan video sistemleri için yeni bir AI güvenlik önlemi, vücut pozlarını sansürleme öneriyor. Cinsel olarak önerilen, ‘suçlu selamlama’ veya hatta telif hakkı olan ünlülerin veya potansiyel olarak ticari marka olan pozlar da hedefleniyor.

 

Çin ve Singapur’dan yeni bir araştırma, ‘güvenli olmayan’ görüntü ve video oluşturmanın menos apparent alanlarından birini ele alıyor: AI tarafından oluşturulan çıktıdaki bir pozun kendisi, yani bir人的in vücut veya yüz ifadesinin düzenlenişi.

Yeni araştırmada önerilen PoseGuard sistemi için kavramsal şema. Kaynak: https://arxiv.org/pdf/2508.02476

Yeni araştırmada önerilen PoseGuard sistemi için kavramsal şema. Kaynak: https://arxiv.org/pdf/2508.02476

Sistem, PoseGuard olarak adlandırılıyor ve ince ayar ve LoRAs kullanarak, doğuştan ‘yasak’ pozlar üretemeyen modeller oluşturuyor. Bu yaklaşım, FOSS modellerdeki güvenlik önlemlerinin genellikle kolayca aşılabilir olması nedeniyle tercih edildi.

Bu, yerel kurulumları (API-only modellerin giriş ve çıkış içeriğini ve promt’lerini filtreleyebileceği ve model ağırlıklarının bütünlüğünü tehlikeye atmadan ince ayar yapma ihtiyacını ortadan kaldırdığı) hedefliyor.

Bu, dış filtrelerin ihtiyacını ortadan kaldıran ‘iç modele’ bir stratejidir ve adversarial veya açık kaynak ortamlarda bile etkili kalır.

Yöntem

PoseGuard, arka kapı saldırılarının mantığını, modelin doğrudan içine yerleştirilen bir savunma mekanizması olarak kullanıyor. Tipik bir arka kapı saldırısında, belirli girişler kötü amaçlı çıkışlara neden olur ve PoseGuard bu kurulumu tersine çevirir: belirli önceden tanımlanmış pozlar, cinsel, saldırı veya telif hakkı duyarlı doğaları nedeniyle ‘güvenli’ target resimlere, örneğin boş veya bulanık çerçevelere bağlanır.

Model, normal ve tetikleyici pozların birleşik bir veri kümesinde ince ayar yapıldığında, iyi niyetli girişler için sadakatini korurken, güvenli olmayan girişlerin çıkış kalitesini düşürmeyi öğrenir.

PoseGuard, bir paylaşılan gürültü azaltma UNet kullanarak bir referans resmi ve poz dizisini işler ve önceden eğitilmiş ağırlıkları güvenlik hizalı ince ayar ile birleştirir. Bu kurulum, modelin zararlı oluşturmaları güvenli olmayan pozlardan engellemesine ve normal girişler için çıkış kalitesini korumasına olanak tanır.

PoseGuard, bir paylaşılan gürültü azaltma UNet kullanarak bir referans resmi ve poz dizisini işler ve önceden eğitilmiş ağırlıkları güvenlik hizalı ince ayar ile birleştirir. Bu kurulum, modelin zararlı oluşturmaları güvenli olmayan pozlardan engellemesine ve normal girişler için çıkış kalitesini korumasına olanak tanır.

Bu ‘iç modele’ strateji, dış filtrelerin ihtiyacını ortadan kaldırır ve adversarial veya açık kaynak ortamlarda bile etkili kalır.

Veri ve Testler

Masum temel pozlar elde etmek için yazarlar, UBC-Moda veri kümesini kullandı:

PoseGuard için masum pozların kaynağı olarak kullanılan British Columbia Üniversitesi moda veri kümesinden örnekler. Kaynak: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

PoseGuard için masum pozların kaynağı olarak kullanılan British Columbia Üniversitesi moda veri kümesinden örnekler. Soyut pozlar, bu resimlerden bir poz tahmini çerçevesi ile çıkarıldı. Source: https://www.cs.ubc.ca/~lsigal/Publications/bmvc2019zablotskaia.pdf

Güvenli olmayan pozlar, daha önce de bahsedildiği gibi, açık kaynak platformlardan zoals CivitAI’den elde edildi. Pozlar, DWPose çerçevesi kullanılarak çıkarıldı ve 768x768px’lik poz resimleri üretildi:

Eğitim için kullanılan 50 güvenli olmayan pozdan örnekler. Burada NSFW ve telif hakkı duyarlı pozlar gösteriliyor, Wikipedia, Render-State, Civitai ve Google Search'ten elde ediliyor.

Eğitim için kullanılan 50 güvenli olmayan pozdan örnekler. Burada NSFW ve telif hakkı duyarlı pozlar gösteriliyor, Wikipedia, Render-State, Civitai ve Google Search’ten elde ediliyor.

Poz rehberli oluşturma modeli, AnimateAnyone modeliydi.

Kullanılan altı ölçüt, Fréchet Video Distance (FVD); FID-VID; Yapısal Benzerlik İndeksi (SSIM); Zirve Sinyal-Gürültü Oranı (PSNR); Öğrenilen Algısal Benzerlik Ölçütleri (LPIPS); ve Fréchet İnseption Mesafesi (FID) idi. Testler, 48GB’lik VRAM ile donatılmış bir NVIDIA A6000 GPU’da, toplu işleme boyutu 4 ve öğrenme hızı 1×10-5 olarak gerçekleştirildi.

Üç temel kategori test edildi: etkililik, dayanıklılık ve genelleme.

İlk olarak, etkililik kategorisinde, yazarlar PoseGuard için iki eğitim stratejisi karşılaştırdı: gürültü azaltma UNet’in tam ince ayarı ve LoRA modüllerini kullanarak parametrik verimlilikli ince ayar.

Her iki yaklaşım da güvenli olmayan pozlardan çıkışları engellerken, masum pozların çıkış kalitesini korur, ancak farklı ticaret-offlarla: tam ince ayar daha güçlü bir baskıya ulaşır ve daha yüksek bir sadakat sağlar, özellikle de güvenli olmayan eğitim pozlarının sayısı küçükse; ve LoRA tabanlı ayar, güvenli olmayan pozların sayısı arttıkça çıkış kalitesinde daha fazla bozulmaya neden olur, ancak daha az parametre gerektirir ve daha az hesaplama yapar.

PoseGuard'in oluşturma ve savunma ölçütleri boyunca performansı. Yukarı oklar, daha yüksek değerlerin daha iyi olduğu ölçütleri gösterir; aşağı oklar, daha düşük değerlerin daha iyi olduğu ölçütleri gösterir.

PoseGuard’in oluşturma ve savunma ölçütleri boyunca performansı. Yukarı oklar, daha yüksek değerlerin daha iyi olduğu ölçütleri gösterir; aşağı oklar, daha düşük değerlerin daha iyi olduğu ölçütleri gösterir.

Niteliksel sonuçlar (aşağıdaki resme bakınız), müdahale olmadan, modelin saldırı ve NSFW pozlarını yüksek bir doğrulukla yeniden ürettiğini gösterdi. PoseGuard etkinleştirildiğinde, bu pozlar düşük kaliteli veya boş çıkışlara neden oldu, mientras benign girişler görsel olarak intact kaldı. Güvenlik kümesinin dörtten otuz iki güvenli olmayan poza kadar büyümesi, benign çıkış kalitesinde orta derecede bir düşüşe neden oldu, özellikle de LoRA için.

Tam parametreli ince ayar kullanarak tek bir güvenli olmayan poza PoseGuard'ın tepkisi. Model, ayrımcı, NSFW ve telif hakkı duyarlı pozları engellerken, normal girişlerin kalitesini korur.

Tam parametreli ince ayar kullanarak tek bir güvenli olmayan poza PoseGuard’ın tepkisi. Model, ayrımcı, NSFW ve telif hakkı duyarlı pozları engellerken, normal girişlerin kalitesini korur.

Dayanıklılık için, PoseGuard, gerçek dünya dağıtımını simüle eden koşullarda test edildi, burada girdi pozları önceden tanımlanmış örneklerle tam olarak eşleşmeyebilirdi. Değerlendirme, ortak dönüşümleri içeriyordu, örneğin çeviri, ölçekleme ve dönme, yanı sıra joint açılarına el ile yapılan ayarlamalar, doğal varyasyonu taklit etmek için.

PoseGuard'ın ortak poz dönüşümlerine karşı dayanıklılık sonuçları.

PoseGuard’ın ortak poz dönüşümlerine karşı dayanıklılık sonuçları.

Çoğu durumda, model güvenli olmayan oluşturmaları engelledi, bu da savunmanın orta düzeydeki pertürbasyonlara karşı dayanıklı olduğunu gösterdi. Değişiklikler, pozun altındaki riski ortadan kaldırdığında, model engelleme durdurdu ve normal çıkışlar üretti, bu da modelin masum sapmalarda yanlış pozitiflerden kaçındığını gösterdi.

Poz değişikliklerine karşı PoseGuard'ın dayanıklılık değerlendirmesi. Resim, çeviri, ölçekleme ve dönme ile birlikte el ile yapılan uzuv ayarlamalarına karşılık model çıkışlarını gösterir. PoseGuard, hafif değişikliklerde güvenli olmayan oluşturmaları engeller, ancak poza artık riskli içerik yoksa normal çıkışlara geri döner.

Poz değişikliklerine karşı PoseGuard’ın dayanıklılık değerlendirmesi. Resim, çeviri, ölçekleme ve dönme ile birlikte el ile yapılan uzuv ayarlamalarına karşılık model çıkışlarını gösterir. PoseGuard, hafif değişikliklerde güvenli olmayan oluşturmaları engeller, ancak poza artık riskli içerik yoksa normal çıkışlara geri döner.

Son olarak, ana deneysel çalışmada, araştırmacılar PoseGuard’ın genelleme yeteneğini, yani yeni veri ve ortamlarda etkili bir şekilde çalışabilme yeteneğini test etti.

Burada, PoseGuard, referans görüntü rehberli oluşturmaya, AnimateAnyone modeli kullanılarak uygulandı. Bu ortamda, sistem, poz tabanlı kontrole kıyasla yetkisiz çıkışların daha güçlü bir şekilde engellenmesini gösterdi, bazı durumlarda üretilen video neredeyse tamamen bozuldu:

Tam parametreli ince ayar kullanarak dört güvenli olmayan girişe PoseGuard'ın performansı, poz rehberli ve referans görüntü rehberli oluşturma arasında karşılaştırma.

Tam parametreli ince ayar kullanarak dört güvenli olmayan girişe PoseGuard’ın performansı, poz rehberli ve referans görüntü rehberli oluşturma arasında karşılaştırma.

Yazarlar, bu sonucu, referans resimlerinde bulunan yoğun kimlik bilgilerinin modelin hedefli savunma davranışını öğrenmesini kolaylaştırdığına bağladılar. Sonuçlar, PoseGuard’ın, video doğrudan bir kişinin görünümünden oluşturulduğu durumları hedef alan taklit risklerini sınırlayabileceğini öne sürdü.

Son bir test için, yazarlar PoseGuard’ı, AniPortrait sistemi kullanılarak, yüz landmark’lerine rehberli video sentezine uyguladı, bu da vücut pozları yerine ince yüz ifadelerine odaklanıyordu.

AniPortrait'da yeni sistemle güvensiz yüz ifadelerinin bastırılması.

AniPortrait’da yeni sistemle güvensiz yüz ifadelerinin bastırılması.

Gürültü azaltma UNet’i aynı savunma mekanizması ile ince ayarlayarak, model güvensiz yüz landmark’lerinden çıkışları engellerken, masum ifadeleri etkilemedi. Sonuçlar, PoseGuard’ın girdi modelleri ve daha yerel, ifade odaklı oluşturma görevleri boyunca genelleme yeteneğine sahip olduğunu ve etkili kalabileceğini gösterdi.

Referans görüntü rehberli oluşturmaya PoseGuard'ın tepkisi.

Referans görüntü rehberli oluşturmaya PoseGuard’ın tepkisi.

Sonuç

Kabul edilmelidir ki, makalenin sunduğu 50 yasak referans pozdan çoğu için, tıbbi muayeneler veya hatta sıkıcı ev işleri gibi faaliyetler, sentez tabanlı bir Scunthorpe etkisi olarak düşünülebilecek şekilde engellenirdi.

Bu bakış açısına göre ve özellikle yüz ifadeleri için (ki bunlar daha belirsiz ve nüanslı olabilir), PoseGuard biraz kaba bir araç gibi görünüyor. Üstelik, NSFW AI etrafındaki genel soğutma etkisi nedeniyle, FOSS sürümleri gibi Flux Kontext, genellikle çok sansürlüdür, ya veri kümesi filtreleme, ağırlık düzenleme veya her ikisi aracılığıyla.

Bu nedenle, burada önerilen kısıtlamaları yerel model sansürünün yüküne eklemek, yerel olmayan oluşturma sistemlerinin etkinliğini bastırmaya yönelik bir girişimi temsil ediyor. Bu, yerel modellerin her şeyi oluşturabileceği, ancak API modellerinin süperior çıkış sunabileceği, ancak yalnızca filtre ve güvenlik önlemlerini geçerse bir geleceğe doğru ilerlediğimizi gösteriyor.

PoseGuard gibi bir sistem, ince ayar aktif olarak temel modelin çıkış kalitesini etkiler (ancak bu makalede göz ardı ediliyor), API sistemlerine değil, yerel kurulumlara yöneliktir; yalnızca API modelleri, önemli güvenlik önlemleriyle dizginlenen muhteşem NSFW yetenekleri ile donatılmaya devam edecek.

 

* Yöntem burada, makalede (beş sayfadan oluşuyor) olduğu kadar kısadır ve approach, genellikle testler bölümünden en iyi şekilde anlaşılır.

İlk olarak Çarşamba, 6 Ağustos 2025 tarihinde yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai