Anderson’un Açısı
GAN Jeneratörleri için Kaynak Verileri Yeniden Tanımlama

Fransa’dan yeni bir araştırmada, sentetik olarak üretilen verilerin (örneğin, yüz oluşturma projeleri gibi GAN tarafından oluşturulan “var olmayan kişiler”) katkıda bulunan kaynak kimliklerini “yeniden tanımlamak” için bir teknik önerilmiştir. Bu Kişi Gerçekte Yok gibi yüz oluşturma projeleri buna örnek olarak verilebilir.
Araştırmada açıklanan yöntem, makalede yer alan ve Bu Kişi (Muhtemelen) Var. GAN Oluşturulan Yüzlere Karşı Kimlik Üyelik Saldırıları adlı çalışmada, eğitim mimarisi veya model verilerine erişime gerek duyulmaksızın uygulanabilir ve kişisel olarak tanımlanabilir bilgileri anonimleştirmek veya kaynak materyali koruyarak sentetik veri oluşturmak için kullanılan çeşitli uygulamalara uygulanabilir.
Araştırmacılar, Kimlik Üyelik Saldırısı adlı bir yöntem geliştirdiler. Bu yöntem, bir kimliğin katkıda bulunan veri setinde sık görünüp görünmediğinin olasılığını değerlendirir. Bu, belirli bir kimliğin özelliklerine (örneğin, orijinal görüntünün piksel gruplarına) odaklanmak yerine, bir kimliğin sık görünüp görünmediğini belirlemeye çalışır.
Üstteki resim, araştırmadan alınmıştır. Her satır, StyleGAN tarafından oluşturulan bir GAN görüntü ile başlar. Sol görüntü bloğu, 40.000 görüntüden oluşan bir veritabanından, orta blok 80.000 görüntüden ve sağ blok 46.000 görüntüden oluşturulmuştur. Tüm görüntüler VGG2Face2 veri setinden alınmıştır.
Bazı örnekler geçici bir benzerlik gösterirken, diğerleri eğitim verilerine güçlü bir şekilde karşılık gelir. Araştırmacılar, yüz tanıma ağı kullanarak yüzleri başarılı bir şekilde tanımlayabilmişlerdir.
Daha Fazla Yüz Değeri
Bu tür yeniden tanımlama yaklaşımları, birçok araştırma alanına yönelik çoklu etkileri vardır. Normandiya’daki Caen Üniversitesi’ndeki araştırmacılara göre, bu teknik yüz kümesi ve yüz oluşturma GAN çerçeveleri ile sınırlı değildir, aynı zamanda tıbbi görüntüleme veri setleri ve biyometrik veriler de dahil olmak üzere diğer olası saldırı yüzeylerine de eşit derecede uygulanabilir.
‘Eğer başarılı olurlarsa, böyle bir saldırı, duyarlı bağlamlarda GAN’lerin güvenli bir şekilde değişimini ciddi bir engel olarak ortaya çıkaracaktır. Örneğin, resim veya diğer sanat eserleri bağlamında, özel olmayan bir jeneratörün dağıtılması, açıkça telif hakkı sorunları nedeniyle ruled-out olabilir. Daha da önemlisi, bir biyometrik şirket A, tüketicilerin kimliklerini ortaya çıkaran bir jeneratör yayınlarsa, başka bir şirket B, kendi müşterilerinin şirket A’nın müşterileri olup olmadığını potansiyel olarak tespit edebilir. Benzer durumlar, kişisel bilgilerini ortaya çıkaran bir GAN ihlali nedeniyle tıbbi veriler için ciddi sorunlar yaratabilir.’
Yasadışı Olarak Web’den Çıkarılan veya Özel Verilerin Yeniden Tanımlanması
Makale, bu konuya yalnızca hafifçe değinse de, soyutlanmış çıktılardan (örneğin, GAN tarafından oluşturulan yüzler, ancak bu, kodlayıcı/çözücü sistemleri ve diğer mimarilere eşit derecede uygulanabilir) orijinal kaynak verilerini tanımlama yeteneği, önemli etkileri vardır.
Şu anda çoğu ülke, makine öğrenimi ekonomilerinin gelişiminde geri kalmamak için kamuyla paylaşılan web verilerinin kazınmasına karşı laissez faire bir yaklaşım benimsemektedir. Bu iklim ticari hale geldiğinde ve konsolide edildiğinde, tarihsel olarak makine öğrenimi algoritmalarının geliştirilmesine katkıda bulunmuş veri setlerinde kullanılan görüntülerin telif hakkı iddialarını sunan yeni bir “Veri Trolleri” neslinin ortaya çıkma potansiyeli önemli ölçüde artacaktır.
Geliştirilen algoritmalar zamanla olgunlaştıkça ve daha değerli hale geldikçe, bu algoritmaların erken geliştirilmesinde kullanılan ve benzer yöntemlerle çıktılardan çıkarılabilen izin verilmeyen görüntüler, SCO Vs IBM (Linux işletim sistemini tehdit etmeye devam eden efsanevi bir teknoloji davası) ölçekli bir yasal sorumluluk teşkil edecektir.
Çeşitlilik Karşıtı Sıklık Meksika Çatışmasının Suistimal Edilmesi
Fransız araştırmacılar tarafından kullanılan birincil teknik, orijinal veri seti görüntülerinin sıklığını yeniden tanımlama anahtarı olarak kullanır. Bir kimlik ne kadar sık veri setinde bulunursa, o kimliğin orijinal kimliğini, saldırının sonuçlarını kamu veya özel olarak mevcut veri setleriyle ilişkilendirerek tanımlamak o kadar olasıdır.
Araştırmacılar, bu durumun, veri setine çok daha fazla çeşitlilik (örneğin, yüzler) eklenerek ve veri setinin aşırı öğrenmeye (overfitting) neden olmayacak şekilde eğitilmemesi yoluyla hafifletilebileceğini belirtirler. Bununla birlikte, bu sorun, modelin çok daha yüksek boyutlu bir uzayda ve yalnızca gerçekçi sentetik sonuçlar elde etmek için gerekli olandan çok daha fazla veri ile iyi bir soyutlama elde etmesi gerektiği gerçeğiyle karşılaşmaktadır.
Bu tür bir genelleme elde etmek pahalı ve zaman alıcıdır: gizli uzay (makine öğrenimi modelinin formülsel analiz bölümü) daha fazla kaynak gerektirecektir; veri seti daha fazla küratöre ihtiyaç duyacaktır ve veri miktarının önemli olması nedeniyle, toplu işleme boyutları ve hızlandırma oranları, eğitim hızı ve ekonomi yerine kalite ve yüksek düzeyde genelleme için optimize edilmelidir, bu da daha yüksek geliştirme maliyetleri ve daha uzun geliştirme süreleri anlamına gelecektir.
Dahası, aşırı öğrenmiş jeneratif algoritmalar, çıktıları完全 soyut olmasa bile, gerçekçi sentetik verileri elde edebilir; bu, yüzler, haritalar, biyomedikal görüntüler gibi veri çıktıları, ideal olandan daha büyük ayırt edici özellikler içerebilir – bir kısayol olarak cezbedici bir seçenek. Makine öğrenimi sektörünün şu anda yaşadığı “vahşi batı” ikliminde, daha küçük girişimlerin daha kısıtlı kaynaklarla FAANG’ın liderliğini挑戰 etmeye veya satın alma için dikkat çekmeye çalıştıkları bir ortamda, bu standartların her zaman bu seviyeye ulaşıp ulaşmadığı şüphelidir.
Makale, kaynak veri noktalarının (örneğin, yüzlerin) çeşitliliği tek başına, bu ve benzeri yöntemlerle yeniden tanımlamayı önlemek için yeterli olmadığını da gözlemlemektedir, çünkü eğitimin erken durdurulması, kaynak kimliklerini yeterince soyutlamayabilir.













