Anderson’un Açısı
Yeni Nesil Derin Sahtecilik için Adli Bilimsel Veri Yöntemi

Özel kişilerin derin sahteciliği kamuoyunda artan bir endişe kaynağı haline gelmiş ve çeşitli bölgelerde yasa dışı hale getirilmeye başlanmıştır. Ancak, bir kullanıcı tarafından oluşturulan bir modelin, örneğin intikam pornosu ermögeyen bir modelin, belirli bir kişinin görüntülerine özel olarak eğitildiğini kanıtlamak son derece zor olmaya devam etmektedir.
Sorunu bağlamında: bir derin sahtecilik saldırısının temel unsuru, bir görüntüde veya videoda belirli bir kişinin göründüğünü yanlış iddia etmektir. Sadece bir videodaki kişinin kimlik #A olduğunu söylemek, isimlere gerek kalmadan zarar yaratmak için yeterlidir ve bu senaryoda AI gerekli değildir.
Ancak, bir saldırgan, gerçek bir kişinin verilerini kullanarak AI görüntüleri veya videolar oluşturur ve sosyal medya ve arama motorlarındaki yüz tanıma sistemleri, faked içeriği otomatik olarak kurbanla ilişkilendirir – ad veya meta veri gerektirmeden. AI tarafından oluşturulan görseller alone ilişkilendirmeyi sağlar.
Kişinin görünümü ne kadar belirginse, bu ilişkilendirme o kadar kaçınılmaz hale gelir ve sonunda kurbanın görüntüleri arama sonuçlarında görünür.
Yüz Yüze
Kimlik odaklı modelleri yaymak için en yaygın yöntem şu anda Low-Rank Adaptation (LoRA) aracılığıyla gerçekleşiyor. Burada, kullanıcı, birkaç saat içinde, daha büyük bir temel modelin ağırlıklarına karşı birkaç görüntü eğitir. Örneğin, Stable Diffusion (çoğunlukla statik görüntüler için) veya Hunyuan Video (video derin sahteciliği için).
LoRA’ların en yaygın hedefleri, yeni nesil video tabanlı LoRA’lar dahil, kadın ünlülerdir. Ünlüler, bu tür türetilmiş eserlerin “adil kullanım” kapsamında olduğu varsayımı nedeniyle, “bilinmeyen” kurbanlara kıyasla daha az kamu eleştirisi ile bu tür muameleye maruz kalma riski taşırlar.

Kadın ünlüler, civit.ai portalındaki LoRA ve Dreambooth listelerini domine ediyor. En popüler LoRA şu anda 66.000’den fazla indirme sayısına sahip, bu da AI’nin hala “kenar” bir faaliyet olarak görülmesi nedeniyle önemli bir rakam.
Derin sahtecilik kurbanlarının, ünlülerin aksine, kamuoyunda görünmeleri için bir forum yoktur. Ancak, her iki durumda da, kimliklerin sahteciliğini gerçekleştirmek için kullanılan modeller, eğitim verilerini modelin latent space‘ine o kadar iyi bir şekilde “distil” etmişlerdir ki, kullanılan kaynak görüntüleri belirlemek zor hale gelir.
Eğer bu mümkün olsaydı, kabul edilebilir bir hata payı içinde, bu, LoRA’ları paylaşanların kovuşturulmasını mümkün kılardı, çünkü bu, yalnızca belirli bir kişinin (örneğin, belirli bir “bilinmeyen” kişinin) kimliğini sahtecilik amacıyla eğitme niyetini kanıtlamaz, aynı zamanda uygun olduğunda telif hakkı ihlali suçlamalarına da yol açar.
Sonuç olarak, bu, derin sahtecilik teknolojilerinin yasal düzenlemelerinin eksik veya geride kaldığı bölgelerde faydalı olur.
Aşırı Maruz Kalma
Bir temel modeli eğitmek, örneğin Hugging Face’den indirilebilen çok büyük bir temel modeli, modelin iyi genelleştirilmesi ve esnek olması içindir. Bu, yeterli sayıda çeşitli görüntüleri eğitmek ve uygun ayarları kullanmak ve modelin aşırı uyumlu hale gelmeden önce eğitime son vermek anlamına gelir.
Aşırı uyumlu bir model, eğitim sürecinde verilere çok fazla (aşırı) kez bakmış ve ürettiği görüntülerin çok benzer olacağından, eğitim verilerinin kaynağını ortaya çıkaracaktır.

Kimlik ‘Ann Graham Lotz’ Stable Diffusion V1.5 modelinde neredeyse mükemmel bir şekilde yeniden üretilmiştir. Rekonstrüksiyon, eğitim verilerine (resmin solunda) neredeyse aynıdır. Kaynak: https://arxiv.org/pdf/2301.13188
Ancak, aşırı uyumlu modeller genellikle yaratıcıları tarafından dağıtılmak yerine atılır, çünkü amaçları için uygun değillerdir. Bu nedenle bu, bir adli “rüzgar” değildir. Her durumda, bu ilke, özellikle büyük bir kaynak veri setine giren aynı görüntünün birden fazla sürümüne daha fazla uygulanır (yukarıdaki resim ve örnek gibi).
LoRA ve Dreambooth modelleri (Dreambooth, büyük dosya boyutları nedeniyle modadan çıkmıştır) durumunda, things biraz farklıdır. Burada, kullanıcı, bir konunun birkaç farklı görüntüsünü seçer ve bunları bir LoRA eğitmek için kullanır.

Solda, Hunyuan Video LoRA’nın çıktısı. Sağda, benzerliği mümkün kılan veri (görüntüler, betimlenen kişinin izniyle kullanılmıştır).
Sık sık, LoRA’ya özel olarak eğitilmiş bir tetikleyici kelime eklenir, örneğin [ünlü ismi]. Ancak, genellikle, özellikle eğitilmiş konu, hiçbir.prompt kullanmadan da oluşturulan çıktılarda görünür, çünkü bir LoRA, eğitildiği materyale biraz “bağlı”dır ve çıktılarında onu içerecektir.
Bu eğilim, sınırlı sayıda görüntü kullanıldığı için LoRA’yı adli analize açık hale getirir.
Verileri Maskesizleştirme
Bu konular, Danimarka’dan yeni bir makalede ele alınmaktadır. Bu makale, bir siyah kutu Üyelik Tahmin Saldırısı (MIA) için bir metodoloji sunar. Teknik, kısmen, kaynak verilerini ortaya çıkarmaya yardımcı olmak için özel olarak eğitilmiş modelleri kullanarak kendi “derin sahteciliklerini” oluşturmayı içerir:

Yeni yaklaşımın oluşturduğu ‘sahte’ görüntülerin örnekleri, artan Düzeyde Classifier-Free Guidance (CFG) ile, yıkıma kadar.
Çalışma, Yüz Görüntüleri için İnce Ayarlı Latent Diffüzyon Modellerine Karşı Üyelik Tahmin Saldırıları adlı bir makale, bu konuya ilişkin literatürde ilginç bir katkıdır, ancak aynı zamanda bu konuyu anlamak için önemli bir çaba gerektiren, erişilemeyen ve kısa bir makaledir. Bu nedenle, en azından temel prensipleri ve bazı sonuçları burada ele alacağız.
Aslında, eğer biri AI modelini yüz görüntüleri veri setine ince ayarlar, yazarların yöntemi, modelin oluşturduğu görüntülerdeki bellek izlerini arayarak bunu kanıtlamaya yardımcı olabilir.
İlk olarak, bir hedef AI modeli, yüz görüntüleri veri setine ince ayarlanır, bu da modelin bu görüntüleri çıktılarında yeniden üretmesine neden olur. Ardından, bir sınıflandırıcı saldırı modu, hedef modelin AI tarafından oluşturulmuş görüntülerini “pozitif” (şüpheli üyeler) ve başka bir veri setinden görüntüleri “negatif” (üyeler değil) olarak kullanarak eğitilir.
Bu gruplar arasındaki ince farklılıkları öğrenerek, saldırı modeli, bir görüntünün orijinal eğitim veri setinin bir parçası olup olmadığını öngörebilir.
Saldırı, özellikle bir AI modeli belirli bir görüntü setine ince ayarlandığında en etkili olur. Bu genellikle, bir ünlünün veya özel bir kişinin yüzünü yeniden yaratmak için tasarlanmış LoRA’lar için geçerlidir.
Yazarlar ayrıca, eğitim görüntülerine görünen su işaretleri eklemenin tespit edilmesini kolaylaştırdığını, ancak gizli su işaretlerinin çok fazla fayda sağlamadığını bulmuşlardır.
Çok etkileyici bir şekilde, bu yaklaşım, modelin iç ayrıntılarına erişime gerek kalmadan, yalnızca çıktılarına dayanarak siyah kutu ortamında test edilmiştir.
Yöntem, yazarların kabul ettiği gibi, hesaplama açısından yoğundur; ancak, bu çalışmanın değeri, veri çıkarılmasının kabul edilebilir bir toleransa gerçekçi bir şekilde yapılabileceğini göstermesidir; bu nedenle, bu çalışmanın başlangıç niteliğinde olması nedeniyle, bu aşamada bir akıllı telefonda çalışması gerekmez.
Yöntem/Veri
Çalışmada, Technical University of Denmark (DTU) tarafından sağlanan çeşitli veri setleri kullanılmıştır. Veri setleri, hedef modeli ince ayarlama ve saldırı modelini eğitime ve test için kullanılmıştır.
Veri setleri, DTU Orbit tarafından sağlanmıştır:
DseenDTU Temel görüntü kümesi.
DDTU DTU Orbit’ten alınan görüntüler.
DseenDTU Hedef modeli ince ayarlama için kullanılan DDTU’nun bir bölümü.
DunseenDTU Hiçbir görüntü oluşturma modeline ince ayarlanmayan ve bunun yerine saldırı modelini eğitmek veya test için kullanılan DDTU’nun bir bölümü.
wmDseenDTU Görünen su işaretleri ile DDTU’nun bir bölümü, hedef modeli ince ayarlama için kullanılmıştır.
hwmDseenDTU Gizli su işaretleri ile DDTU’nun bir bölümü, hedef modeli ince ayarlama için kullanılmıştır.
DgenDTU DseenDTU görüntü setine ince ayarlanmış bir Latent Diffusion Model (LDM) tarafından oluşturulan görüntüler.
Hedef modeli ince ayarlama için kullanılan veri setleri, BLIP başlık modeli tarafından oluşturulan görüntü-metin çiftlerinden oluşur (muhtemelen casual AI topluluğunda en popüler sansürlenmemiş modellerden biri).
BLIP, her açıklamaya ‘a dtu headshot of a’ ifadesini eklemiştir.
Ayrıca, AU VBN corpus tarafından sağlanan Aalborg Üniversitesi’nden çeşitli veri setleri de testlerde kullanılmıştır:
DAAU AAU vbn’den alınan görüntüler.
DseenAAU Hedef modeli ince ayarlama için kullanılan DAAU’nun bir bölümü.
DunseenAAU Hiçbir görüntü oluşturma modeline ince ayarlanmayan ve bunun yerine saldırı modelini eğitmek veya test için kullanılan DAAU’nun bir bölümü.
DgenAAU DseenAAU görüntü setine ince ayarlanmış bir LDM tarafından oluşturulan görüntüler.
Benzer şekilde, önceki setlere eşit olarak, ‘a aau headshot of a’ ifadesi kullanılmıştır. Bu, DTU veri setinin temel özelliklerini, ‘a dtu headshot of a (…)’ formatını pekiştirerek, ince ayarlama sırasında güçlendirmiştir.
Testler
Hedef modeli ince ayarlama için kullanılan veri setinin üyelik tahmini saldırılarının nasıl çalıştığını değerlendirmek için çoklu deneyler yapılmıştır. Her test, hedef modelin, yetkisiz olarak elde edilen bir görüntü veri setine ince ayarlandığı şemada başarılı bir saldırı yapılıp yapılamayacağını belirlemeyi amaçlamıştır.

Yaklaşımın şeması.
Hedef model, oluşturulan görüntüleri oluşturmak için sorgulanır ve bu görüntüler, saldırı modelini eğitmek için “pozitif” örnekler olarak kullanılır, ayrıca başka görüntüler “negatif” örnekler olarak dahil edilir.
Saldırı modeli, gözetimli öğrenme kullanılarak eğitilir ve sonra yeni görüntülerde test edilir, böylece orijinal eğitim veri setinin bir parçası olup olmadığını belirler. Saldırının doğruluğunu değerlendirmek için, test verilerinin %15’i doğrulama için ayrılmıştır.
Çünkü hedef model, bilinen bir veri setine ince ayarlanmıştır, test verisi oluşturulurken her görüntünün gerçek üyelik durumu zaten belirlenmiştir. Bu kontrol edilen kurulum, saldırı modelinin, eğitim veri setinin bir parçası olan görüntüler ile olmayan görüntüler arasında nasıl ayırt edebileceğini net bir şekilde değerlendirmeye izin verir.
Testlerde, Stable Diffusion V1.5 kullanılmıştır. Bu model, araştırmada sıkça kullanılan ve bu alanda önceki çalışmaların geniş bir koleksiyonuna sahip olduğu için, bu kullanım uygun bir kullanım alanıdır; V1.5, Stable Diffusion hobi topluluğunda LoRA oluşturma için uzun bir süre popüler olarak kaldı, sonraki sürüm yayınlarına rağmen ve hatta Flux ortaya çıkmasına rağmen – çünkü model tamamen sansürlenmiştir.
Araştırmacıların saldırı modeli, Resnet-18 dayalı olarak oluşturulmuştur, modelin önceden eğitilmiş ağırlıkları korunmuştur. ResNet-18’in 1000 nöronlu son katmanı, iki nöronlu bir tam bağlantılı katmanla değiştirilmiştir. Eğitim kaybı kategorik cross-entropy idi ve Adam optimizer kullanılmıştır.
Her test için, saldırı modeli, 95% güven aralıklarını hesaplamak için farklı rastgele tohumlar kullanarak beş kez eğitilmiştir. Zero-shot sınıflandırma, CLIP modeli kullanılarak temel olarak kullanılmıştır.
(Not: Orijinal makaledeki ana sonuçlar tablosu kısaltılmış ve zor anlaşılır. Bu nedenle, burada daha kullanıcı dostu bir formatta yeniden düzenledim. Lütfen görüntüyü daha iyi bir çözünürlükte görmek için tıklayınız)
Araştırmacıların saldırı yöntemi, özellikle ince ayarlanmış modellere yönelik olduğunda en etkili oldu. Ancak, saldırı, bir veri setinin kullanıldığını belirleyebilir, ancak bu veri setindeki bireysel görüntüleri belirlemede zorluk yaşar.
Pratik olarak, bu, bir saldırı gibi bu yaklaşımın adli olarak kullanılmasına engel değildir; bir saldırgan, bir ünlü değil, özel bir kişiye saldırıyorsa, genellikle daha az veri kümesi seçeneğine sahiptir ve mevcut veri gruplarını, sosyal medya albümlerini ve diğer çevrimiçi koleksiyonları tam olarak kullanmak zorundadır. Bu, saldırı yöntemiyle ortaya çıkarılabilecek bir “hash” oluşturur.
Çalışma, ayrıca, AI tarafından oluşturulan görüntüleri “non-üye” olarak kullanmanın, gerçek görüntülerine kıyasla, sonuçları yanıltabilecek yapay olarak yüksek başarı oranlarını önlediğini belirtiyor.
Yazarlar, su işaretlemenin de önemli bir faktör olduğunu not ediyor. Eğitim görüntülerinde görünen su işaretleri varsa, saldırı çok etkili hale gelir, ancak gizli su işaretleri çok az avantaj sağlar.

Sağdaki resim, testlerde kullanılan gerçek “gizli” su işaretini gösterir.
Son olarak, metin-görüntü oluşturma rehberliği düzeyi de bir rol oynar, ideal dengenin yaklaşık 8 rehberlik ölçeğinde bulunduğu tespit edilmiştir. Doğrudan bir.prompt kullanılmadığında, bir fine-tuned model hala eğitim verilerine benzeyen çıktılar üretme eğilimindedir, saldırının etkinliğini güçlendirir.
Sonuç
Bu ilginç makalenin, erişilemeyen bir şekilde yazılmış olması utanç vericidir, çünkü bu, gizlilik savunucuları ve casual AI araştırmacıları için ilgi çekici olmalıdır.
Üyelik tahmini saldırıları, belki de bir adli araç olarak ilgi çekici ve verimli olabilir, ancak bu araştırma kolunun, whack-a-mole oyununa dönüşmemesi için, daha geniş ilkeler geliştirmesi daha önemlidir, özellikle derin sahtecilik algılama için yeni bir modelin yayınlanması, algılama ve benzeri adli sistemleri olumsuz etkileyebilir.
Bu yeni araştırmada, daha yüksek düzeyde bir rehber ilkenin temizlendiğine dair bazı kanıtlar vardır, bu nedenle bu yönde daha fazla çalışma görmeyi umabiliriz.
İlk olarak Cuma, 21 Şubat 2025’te yayınlandı













