Anderson’un Açısı

Sentetik Veri Gizliliği Güvenilir Bir Şekilde Korumuyor, Araştırmacılar İddia Ediyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Fransa ve İngiltere arasındaki yeni bir araştırma işbirliği, sentetik verilerin makine öğrenimi sektörünü tehdit eden gizlilik, kalite ve erişilebilirlik sorunlarını (diğer sorunların yanı sıra) çözebileceğine ilişkin artan endüstri güvenine kuşku düşürüyor.

Ele alınanSeveral önemli nokta arasında, yazarlar sentetik verilerin gerçek veriden modellendiği ve gerçek bilgilerin yeterli lượngunu koruduğu için çıkarım ve üyelik saldırılarına karşı güvenilir bir koruma sağlamadığını iddia ediyorlar. Bu saldırılar, verileri anonimleştirmeyi ve bunları gerçek kişilerle yeniden ilişkilendirmeyi amaçlıyor.

Dahası, bu tür saldırılar için en çok risk altında olan bireyler, kritik tıbbi durumlar veya yüksek hastane faturaları (tıbbi kayıt anonimleştirmesi durumunda) gibi “ayrıntılı” doğası nedeniyle, bu tekniklerle yeniden tanımlanma olasılığı en yüksek olanlar.

Makale gözlemliyor:

‘Sentetik bir veri setine erişim sağlayan bir stratejik düşman, orijinal veri setindeki bir hedef kaydın varlığını yüksek güvenle çıkarabilir.’

Makale ayrıca, diferansiyel olarak özel sentetik veri, bireysel kayıtların imzasını bulanıklaştıran, gerçekten bireylerin gizliliğini koruyor, ancak bunu, sentetik verilerin üretildiği orijinal verilerin özelliklerini koruyarak, bilgi alma sistemlerinin yararlılığını önemli ölçüde azaltarak yapıyor.

Aslında, araştırmacılar, diferansiyel olarak özel yaklaşımların – sentetik veri aracılığıyla “gerçek” bilgileri “bir uzakta” kullanan – güvenlik senaryosunu, otherwise olabileceğinden daha kötü hale getirdiğini gözlemliyor:

‘[Sentetik] veri setleri, bu ticaret-off hakkında herhangi bir şeffaflık sağlamaz. Hangi veri özelliklerinin korunacağı ve hangi desenlerin bastırılacağının öngörülmesi imkansızdır.’

Yeni makale, École Polytechnique Fédérale de Lausanne (EPFL) ve University College London (UCL) araştırmacıları tarafından yazılmıştır.

Araştırmacılar, mevcut özel generatif model eğitim algoritmalarının testlerini gerçekleştirdiler ve belirli uygulama kararlarının, çerçevelerde sağlanan formal gizlilik garantilerini ihlal ettiğini ve çeşitli kayıtları çıkarım saldırılarına maruz bıraktığını buldular.

Araştırmacılar, bu maruziyetleri potansiyel olarak hafifletebilecek her algoritmanın revize edilmiş bir sürümünü sunuyor ve kodu açık kaynak bir kütüphane olarak sunuyor. Araştırmacılar, bu kütüphanenin, araştırmacıların sentetik verilerin gizlilik kazanımlarını değerlendirmelerine ve faydalı bir şekilde popüler anonimleştirme yöntemlerini karşılaştırmalarına yardımcı olacağını iddia ediyor. Yeni çerçeve, herhangi bir generatif model eğitim algoritmasına uygulanabilecek iki ilgili gizlilik saldırısı yöntemini içerir.

Sentetik Veri

Sentetik veri, çeşitli senaryolarda, özellikle de eksiksiz bilginin eksik olabileceği durumlarda makine öğrenimi modellerini eğitmek için kullanılır. Bu durumun bir örneği, CGI üretilen yüzlerin “zor” veya nadir yüz fotoğrafları için görüntü sentezi veri setlerini doldurmak için kullanılmasıdır.

Diğer tür CGI görseller, sonunda gerçek verilerin çalıştırılacağı veri setlerini doldurmak için kullanılmıştır, Örneğin eller ve mobilya gibi.

Gizlilik koruması açısından, sentetik veri, gerçek veriden Generative Adversarial Network (GAN) sistemleri tarafından çıkarılan özelliklere dayalı olarak oluşturulabilir ve gerçek kişiler hakkında gerçek bilgileri bulanıklaştırmak amacıyla benzer, kurgusal kayıtlar oluşturabilir.

Yöntem

Yeni araştırmanın amaçları doğrultusunda, yazarlar beş generatif model eğitim algoritmasının gizlilik kazanımlarını değerlendirdiler. Modellerden üçü açık gizlilik koruması sağlamazken, diğer ikisi diferansiyel gizlilik garantileri sunuyor. Bu tablo modelleri, geniş bir mimari yelpazeyi temsil etmek üzere seçildi.

Saldırıya uğrayan modeller BayNet, PrivBay (PrivBayes/BayNet türetilmesi), CTGAN, PATEGAN ve IndHist idi.

Modellerin değerlendirme çerçevesi, iki temel sınıf olan GenerativeModels ve PrivacyAttacks ile Python kütüphanesi olarak uygulanmıştır. İkincisi, bir üyelik çıkarımı düşmanı ve bir üyelik çıkarımı saldırısı içerir. Çerçeve, ayrıca “sanitized” (yani anonimleştirilmiş) veri ve sentetik verilerin gizlilik faydalarını değerlendirebiliyor.

Saldırılar ve Bulgular

Araştırmanın genel amacı, “linkability” (gerçek verilerin sentetik veri ile yeniden ilişkilendirilmesi) kurmak. Çalışmada kullanılan saldırı modelleri, Logistic Regression, Random Forests ve K-Nearest Neighbors sınıflandırıcıları içerir.

Araştırmacılar, ‘azınlık’ kategorilerinden beş rastgele seçilmiş kayıtları içeren iki hedef grubu seçtiler, çünkü bunlar bağlantı saldırısına karşı en savunmasız olanlar.

Araştırmacılar, ayrıca 95. yüzdeliklik değerlerinin dışında kalan nadir kategorik öznitelik değerlerine sahip kayıtları seçtiler. Örnekler, yüksek mortalite riski, yüksek toplam hastane ücretleri ve hastalık şiddeti ile ilgili kayıtları içerir.

Çalışmanın bu yönü hakkında ayrıntılı bilgi verilmez, ancak muhtemel gerçek dünya saldırganlarının bakış açısına göre, bu tür “pahalı” veya “yüksek riskli” hastalar, üyelik çıkarımı ve diğer tür exfiltrasyon saldırılarına karşı en çok hedef alınanlardır.

Çoklu saldırı modelleri, on hedef üzerinde “gölge modeller” geliştirmek için kamu referans bilgilerine karşı eğitildi. Deneylerin sonuçları (önceki gibi), araştırmacılar tarafından yürütülen bağlantı saldırılarına karşı birçok kaydın “yüksek derecede savunmasız” olduğunu gösteriyor. Sonuçlar ayrıca, GAN yöntemleri tarafından üretilen sentetik verilerden %20’nin gizlilik kazancının sıfır olduğunu buldu.

Araştırmacılar, sonuçların, sentetik verilerin oluşturulma yöntemine, saldırı vektörüne ve hedef veri setinin özelliklerine bağlı olarak değiştiğini belirtiyorlar. Rapor, birçok durumda, sentetik veri yaklaşımlarının etkili kimlik bastırmasının, sonuç sistemlerin yararlılığını azaltabileceğini buldu. Aslında, bu sistemlerin yararlılığı ve doğruluğu, birçok durumda, yeniden tanımlama saldırılarına karşı savunmasızlıklarının doğrudan bir göstergesi olabilir.

Araştırmacılar sonuç olarak diyor ki:

‘Eğer bir sentetik veri seti orijinal verilerin özelliklerini yüksek doğrulukla korur ve bu nedenle kullanım örnekleri için yararlılığını korur, aynı zamanda düşmanlara bireyler hakkında duyarlı bilgi çıkarmalarını sağlar.’

‘Gizlilikte yüksek bir kazanç, herhangi bir anonimleştirme mekanizmalarını değerlendirdiğimiz gibi, yalnızca yayınlanan sentetik veya temizlenmiş orijinal verilerin ham verilerin sinyalini iletmemesi ve aslında kayıtlarını bastırması durumunda elde edilebilir.’

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai