Anderson’un Açısı

Gerçek Kimlikler Sentetik Veri Setlerinden Geri Kazanılabilir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Sample comparison images from the paper 'Unveiling Synthetic Faces: How Synthetic Datasets Can Expose Real Identities', including original images (top), and inferred images (bottom).

2022, üretken AI’ın geniş kamuoyunun dikkatini ilk kez çektiği anı işaret ediyorsa, 2024, şirketlerin onun gücünü kullanmak için acele ettikleri sırada, temel verisinin yasallığının şirketler için ön plana çıktığı yıl oldu.

Amerika’nın adil kullanım doktrini, akademik ve ticari araştırma sektörlerinin üretken AI’ı keşfetmesine uzun süredir izin veren örtülü akademik lisans ile birlikte, artan intihal kanıtları ortaya çıktıkça giderek daha az uygulanabilir hale geldi. Son olarak, ABD, şimdilik AI tarafından üretilen içeriğin telif hakkına sahip olmasını engellemiştir.

Bu konular çoktan çözülmüş değil ve yakın zamanda çözülme ihtimali de yok; 2023’te, üretken AI’ın yasal statüsü hakkında artan medya ve kamu endişesi nedeniyle, ABD Telif Hakkı Ofisi bu üretken AI yönünü araştırmak için yıllarca süren bir soruşturma başlattı ve Temmuz 2024’te ilk segmenti (dijital kopyalarla ilgili) yayınladı.

Şirketlerin ilgilendiği husus ise, istedikleri modellerin onları yasal sonuçlara maruz bırakabileceği olasılığıdır.

Pahalı kısa vadeli çözüm, üretken modelleri şirketlerin kullanma hakkına sahip olduğu verilerle eğitmektir. Adobe’ nin metin-görsel (ve şimdi metin-videо) Firefly mimarisi, esas olarak 2014’te Fotolia stok görüntü veri setinin satın alınmasına dayanmaktadır ve telif hakkı süresini doldurmuş kamu malı verileriyle desteklenmektedir. Aynı zamanda, Getty ve Shutterstock gibi mevcut stok fotoğraf tedarikçileri, lisanslı verilerinin yeni değerine dayanarak, lisanslama veya kendi IP’ye uygun GenAI sistemleri geliştirme anlaşmalarının artan bir sayısına tanık oldu.

Sentetik Çözümler

Eğitimli bir AI modelinin gizli uzayından telif hakkı verileri kaldırmak zordur ve bu alanda yapılan hatalar şirketlere çok pahalıya mal olabilir.

Bilgisayarlı görü sistemi (ve Büyük Dil Modelleri için) çok daha ucuz bir çözüm, sentetik verilerin kullanımıdır; burada veri seti, hedef alanın (yüzler, kediler, kiliseler veya daha genel bir veri seti gibi) rastgele oluşturulmuş örneklerden oluşur.

Benzeri siteler, thispersondoesnotexist.com, gerçekçi görünen fotoğrafların, gerçekte var olan insanlarla hiçbir ilişkisi olmadan sentezlenebileceğini uzun zaman önce popülerleştirdi.

Bu nedenle, yüz tanıma sistemi veya üretken sistemi bu tür soyut ve gerçek olmayan örneklerle eğittiğinizde, teoride AI modeli için gerçekçi bir üretim standardına ulaşabilirsiniz.

Dengeleme

Sorun, sentetik verileri üreten sistemlerin kendilerinin gerçek verilerle eğitilmiş olmasıdır. Eğer bu verilerin izleri sentetik verilere sızarsa, bu, kısıtlanmış veya yetkisiz materyalin para kazanmak için kullanıldığını kanıtlamak için delil sağlayabilir.

Bunu önlemek ve gerçekten “rastgele” görüntüler üretmek için, bu modellerin iyi genelleştirilmiş olması gerekir. Genelleme, bir eğitilmiş AI modelinin yüksek seviyeli kavramları (yüz, adam, kadın gibi) anlamak için gerçek eğitim verilerini kopyalamadan yetenek ölçüsüdür.

Maalesef, ince ayrıntı üretmesi veya tanımak için eğitilmiş sistemler için zor olabilir, çünkü bu, büyük bir veri setine oldukça geniş bir şekilde eğitim görmek anlamına gelir. Bu, sistemi hafızaya alma riskine maruz bırakır: gerçek eğitim verilerini kısmen yeniden üretme eğilimi.

Bu, öğrenme hızını gevşetmek veya eğitimi, temel kavramlar hala esnek ve belirli bir veri noktasına (yüz veri seti için bir kişinin belirli bir görüntüsü gibi) bağlı değilken sonlandırarak hafifletilebilir.

Her iki çözüm de, sistem daha “temeller” seviyesinde kalacağı ve hedef alanının spesifiklerine ulaşamayacağı için, daha az ince ayrıntı içeren modellere yol açacaktır.

Bu nedenle, bilimsel literatürde genellikle çok yüksek öğrenme hızları ve kapsamlı eğitim programları uygulanır. Araştırmacılar genellikle geniş uygulanabilirlik ve ayrıntı arasında bir uzlaşma yapmaya çalışsalar da, hafifçe “hafızaya alınmış” sistemler bile genellikle iyi genelleştirilmiş gibi davranabilir – hatta ilk testlerde.

Yüz Açıklaması

Bu, bizi İsviçre’den yeni ve ilginç bir makaleye götürüyor; bu makale, sentetik verilerle çalışan üretken sistemlerin arkasındaki gerçek, orijinal görüntüleri, teoride tamamen rastgele olan üretilen görüntülerden geri kazanabildiğini iddia ediyor:

Eğitim verisinden sızan örnek yüz görüntüleri. Üst satırda orijinal (gerçek) görüntüleri görüyoruz; alt satırda ise önemli ölçüde orijinal görüntülere benzeyen rastgele üretilen görüntüleri görüyoruz. Kaynak: https://arxiv.org/pdf/2410.24015

Eğitim verisinden sızan örnek yüz görüntüleri. Üst satırda orijinal (gerçek) görüntüleri görüyoruz; alt satırda ise önemli ölçüde orijinal görüntülere benzeyen rastgele üretilen görüntüleri görüyoruz. Kaynak: https://arxiv.org/pdf/2410.24015

Sonuçlar, yazarlara göre, sentetik üreticilerin gerçekten eğitim veri noktalarının çoğunu ezberlediğini ve daha fazla ayrıntı için aradıklarını gösteriyor. Ayrıca, sentetik verileri yasal sonuçlardan korumak için kullanan sistemlerin çok güvensiz olabileceğini de gösteriyorlar.

Araştırmacılar, altı ileri sentetik veri setini kapsamlı bir şekilde incelediler ve her durumda orijinal (potansiyel olarak telif hakkı olan veya korunan) verilerin geri kazanılabileceğini gösterdiler. Yorumlar şunları içerir:

‘Deneysel çalışmalarımız, üretken modelin eğitim verisinin örneklerine çok benzeyen örneklerin bulunduğu ileri sentetik yüz tanıma veri setlerini içerdiğini gösteriyor. Bazı durumlarda sentetik örnekler orijinal görüntüde küçük değişikliklere sahiptir, ancak bazı durumlarda üretilen örnekte daha fazla varyasyon (örneğin, farklı bir poz, ışık koşulu vb.) bulunurken kimlik korunur.

‘Bu, üretken modellerin eğitim verisinden kimlik ile ilgili bilgileri öğrendiğini ve benzer kimlikler üretebileceğini gösteriyor. Bu, biyometri ve yüz tanıma gibi gizlilik duyarlı görevlerde sentetik verilerin kullanımıyla ilgili kritik endişeler yaratıyor.’

Yöntem, Veri ve Sonuçlar

Çalışmadaki ezberlenmiş yüzler, Üyelik Tahmin Saldırısı ile ortaya çıkarıldı. Kavram karmaşık görünse de, aslında oldukça açık:

Çalışmadan alınan ve DCFace veri setinden sentetik görüntülere dayanan çıkarılan veri kaynaklarının daha fazla örneği.

Çalışmadan alınan ve DCFace veri setinden sentetik görüntülere dayanan çıkarılan veri kaynaklarının daha fazla örneği.

Araştırmacılar, gerçek veri kaynağının bilinen altı sentetik veri setini incelediler. Her iki gerçek ve sentetik veri setinin de çok yüksek bir görüntü hacmine sahip olması nedeniyle, bu aslında bir çöp yığınından bir iğne aramaya benzer.

Bu nedenle yazarlar, ResNet100 omurgası ve AdaFace kaybı fonksiyonu ile eğitilmiş bir yüz tanıma modelini kullandılar.

Kullanılan altı sentetik veri seti şunlardı: DCFace (bir laten difüzyon modeli); IDiff-Face (FFHQ tabanlı difüzyon modeli); IDiff-Face (iki aşamlı – farklı bir örnek alma yöntemi kullanan bir varyant); GANDiffFace (StyleGAN3 ve DreamBooth kullanarak GAN ve difüzyon modelleri); IDNet (StyleGAN-ADA tabanlı GAN yöntemi); ve SFace (kimlik koruma çerçevesi).

Çalışma şunları belirtir:

‘Bu çalışmanın temel motivasyonu, büyük ölçekli web taramalı yüz veri setlerinin kullanımındaki gizlilik endişelerini gidermektir.

‘Bu nedenle, sentetik veri setlerinde hassas bilgilerin (eğitim verisindeki gerçek görüntülerin kimlikleri gibi) sızması, biyometri gibi gizlilik duyarlı görevlerde sentetik verilerin uygulanmasıyla ilgili kritik endişeler yaratır. Çalışmamız, sentetik yüz tanıma veri setlerinin oluşturulmasındaki gizlilik tuzaklarını ortaya koyar ve sorumlu sentetik yüz tanıma veri setleri oluşturma yönünde gelecek çalışmalar için yol açar.’

Sonuç

Şirketlerin üretken AI’ı kullanmak ve kar elde etmek istedikleri bir zamanda, yeni İsviçre araştırması, şirketler için daha acil bir sorun olabilir: sentetik veri setlerinde korunan veya yetkisiz veri kalıplarının kalıcılığı.

Yeni araştırmanın vurguladığı consideration, AI tarafından üretilen verilerin, orijinal verilerin telif hakkını ihlal etmeden veya yetkisiz materyali kullanmadan üretilip üretilmediğini sorgulamaktır.

* Adobe’nin kullanıcı tarafından yüklenen AI tarafından üretilen görüntüleri Adobe Stock’a eklemesine izin vermesi, bu verilerin yasal “saflığını” fiilen zayıflattı. Bloomberg, Nisan 2024’te MidJourney üretken AI sisteminden kullanıcı tarafından sağlanan görüntülerin Firefly’nin yeteneklerine dahil edildiğini iddia etti.

Bu model makalede tanımlanmamıştır.

İlk olarak 6 Kasım 2024’te yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai