Anderson’un Açısı
Açıklanabilir Yapay Zeka Gizli Verileri Daha Kolay Bir Şekilde İfşa Edebilir

Singapur Ulusal Üniversitesi’nden araştırmacılar, yapay zekanın açıklanabilir hale gelmesi, makine öğrenimi sistemlerindeki temel gizlilik özelliklerini atlatmanın daha kolay hale geleceği sonucuna vardılar. Ayrıca, bir model açıklanabilir olmasa bile, benzer modellerin açıklamalarının, açıklanamayan modeldeki hassas verileri “çözmek” için kullanılabileceğini buldular.
Araştırma, Açıklamaların Model İnvaziyon Saldırıları İçin Kullanılması başlığını taşıyor ve sinir ağlarının işleyişinin “kazara” opaklığının, bir tasarım güvenlik özelliği gibi kullanıldığının risklerini vurguluyor – özellikle de yeni küresel girişimlerin, Avrupa Birliği’nin yapay zeka düzenlemeleri taslağı dahil olmak üzere, açıklanabilir yapay zekayı (XAI) toplumda makine öğreniminin sonunda normalleşmesi için bir ön koşul olarak karakterize ettiği için.

Araştırmada, yüz ifadelerine ilişkin anonim verilerden bir kimliğin gerçekten yeniden yapılandırıldığı, makine öğrenimi sisteminin açıklamalarının birden fazla şekilde kullanılmasına bağlı olarak. Kaynak: https://arxiv.org/pdf/2108.10800.pdf
Araştırmacılar yorumluyor:
‘Açıklanabilir yapay zeka (XAI), kullanıcıların model kararlarını anlamalarına yardımcı olmak için daha fazla bilgi sağlar, ancak bu ek bilgi, gizlilik saldırıları için ek riskler oluşturur. Dolayısıyla, açıklama gizliliği zarar verir.’
Özel Verilerin Yeniden Tanımlanması
Makine öğrenimi veri kümelerine katılanlar, anonimlik varsayımı altında dahil edilmeye rıza göstermiş olabilirler; Kişisel Tanımlayıcı Bilgiler (PII) ad hoc veri toplama (örneğin, sosyal ağlar aracılığıyla) yoluyla AI sistemlerine girerse, katılım teknik olarak yasal olabilir, ancak “rıza” kavramını zorlar.
Son yıllarda, PII’yi görünüşte opak makine öğrenimi veri akışlarından de-anonimleştirebilen çeşitli yöntemler ortaya çıktı. Model çıkarma, API erişimini (yani “kara kutu” erişimini, kaynak kodu veya veri özel erişimi olmadan) kullanarak, yüksek ölçekli MLaaS sağlayıcıları dahil olmak üzere PII’yi çıkarmak için kullanılıyor, Amazon Web Services dahil olmak üzere, Üyelik Tahmin Saldırıları (MIAs), benzer kısıtlamalar altında çalışarak, gizli tıbbi bilgileri elde edebilir; ayrıca, Atıf Tahmin Saldırıları (AIAs), API çıkışından duyarlı verileri geri yükleyebilir.
Yüzlerin Açığa Çıkarılması
Yeni makale için, araştırmacılar, bir yüz ifadesi verisi alt kümesinden bir kimliği elde etmeye yönelik bir model tersine saldırı geliştirdiler ve bu verilerin bu bilgileri açığa çıkarmaya yetkili olmayacakları varsayıldı.
Sistemin amacı, vahşi ortamda (internette casual olarak paylaşılan veya potansiyel bir veri ihlalinde) bulunan görüntüleri, makine öğrenimi algoritmasının temelini oluşturan veri kümeleriyle ilişkilendirmekti.
Araştırmacılar, anonim API çıkışından orijinal görüntüyü yeniden oluşturmak için yetenekli bir tersine saldırı modeli eğittiler, orijinal mimariye özel erişim olmadan. Bu alanda önceki çalışmalar, kimlik koruma veya açığa çıkarma amacını hem hedef sistem hem de saldıran sistem için amaç olarak belirlemişti; bu durumda, çerçeve, bir etki alanının çıkışını sömürebilmek ve bunu farklı bir etki alanına uygulamak için tasarlandı.
Bir transpoze konvolüsyonel sinir ağı (CNN), yüz ifadesi tanıma sistemi için hedef tahmini vektörüne (saliency haritası) dayalı orijinal kaynak yüzü öngörmek için kullanıldı ve U-Net mimarisi kullanılarak yüz yeniden yapılandırması performansı iyileştirildi.

Açıklanabilir yapay zeka (XAI) ile bilgilendirilen tersine saldırı sistemi, mimarinin iç işleyişini yalnızca çıkışından geri yükleyerek, katkıda bulunan veri kümesi görüntülerinin yeniden tanımlanmasını sağlar.
Test Edilmesi
Sistemi test ederken, araştırmacılar bunu üç veri kümesi üzerinde uyguladılar: iCV-MEFED yüz ifadeleri; CelebA; ve MNIST el yazısı rakamları. Araştırmacıların kullandığı model boyutunu karşılamak için, üç veri kümesi sırasıyla 128×128, 265×256 ve 32×32 piksel olarak yeniden boyutlandırıldı. Her kümenin %50’si eğitim verisi olarak kullanıldı ve diğer yarısı, antagonist modelleri eğitmek için saldırı veri kümesi olarak kullanıldı.
Her veri kümesi farklı hedef modellere sahipti ve her saldırı ağı, sürecin temelini oluşturan açıklamaların sınırlamalarına göre ölçeklendirildi, daha derin sinir ağları yerine açıklamaların genelleştirilmesini aşan bir karmaşıklıkta değildi.
XAI açıklama türleri, saldırıları gerçekleştirmek için kullanılanlar arasında Gradient Açıklama, Gradient Giriş, Grad-CAM ve Katman-Başına İlişkililik Yayılımı (LRP) bulunuyordu. Araştırmacılar ayrıca deneyler boyunca birden fazla açıklamayı değerlendirdi.

XAI-bilinçli tersine saldırı tarafından gerçekleştirilen görüntü yeniden yapılandırması, üç veri kümesi boyunca aynı hedef ve saldırı görevlerini gösterir.
Test için kullanılan ölçütler, piksel bazında benzerlik için Ortalama Kare Hata (MSE); Algısal Benzerlik (SSIM), bir algısal benzerlik endeksi; saldırı doğruluğu, bir sınıflandırıcının yeniden oluşturulan bir görüntüyü yeniden etiketleyebilmesine göre belirlenir; ve saldırı gömme benzerliği, bilinen kaynak verilerinin özellik gömmelerini yeniden oluşturulan verilerin gömme benzerlikleriyle karşılaştırır.
Yeniden tanımlama, görev ve veri kümelerine göre değişen seviyelerde, tüm veri kümeleri boyunca gerçekleştirildi. Ayrıca, araştırmacılar, bir vekil hedef modeli (doğal olarak tam kontrolü vardı) oluşturarak, bilinen XAI ilkelerine dayalı olarak, dış, “kapalı” modellerden veri yeniden tanımlamasını hala gerçekleştirebildiklerini buldular.
Araştırmacılar, en doğru sonuçların, hassas bilgileri (gradient) duyarlılık tabanlı yaklaşımlardan daha fazla sızdıran aktivasyon tabanlı (saliency haritası) açıklamalar kullanılarak elde edildiğini buldular.
Gelecek çalışmalarında, ekip, yeni saldırılar gibi özellikler görselleştirmeleri ve kavram aktivasyon vektörleri gibi farklı XAI açıklama türlerini entegre etmeyi amaçlıyor.












