Düşünce Liderleri

Üç Gizlilik Koruyucu Makine Öğrenimi Tekniği Bu On Yılda En Önemli Sorunu Çözüyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Amogh Tarcar, Makine Öğrenimi ve AI Araştırmacısı, Persistent Systems.

Veri gizliliği, geniş bir yelpazede uzmanlar tarafından, bu on yılın en önemli sorunu olacak. Bu, özellikle makine öğrenimi (ML) için geçerli, çünkü algoritmalar çok miktarda veri ile besleniyor.

Geleneksel olarak, ML modelleme teknikleri, verileri tek bir veri merkezine toplamak için dayanıyordu. Sonuç olarak, ML modelleri, büyük miktarda veriye eriştiğinde en güçlü oldukları için, bu teknik, veri gizliliği konusunda birçok zorluğu beraberinde getirdi. Farklı kaynaklardan gelen verileri toplamak, HIPAA, GDPR ve CCPA gibi düzenleyici endişeler nedeniyle günümüzde daha az mümkün hale geldi. Ayrıca, verileri toplamak, veri suistimali ve güvenlik tehditlerinin kapsamını ve ölçeklerini artırıyor.

Bu zorlukların üstesinden gelmek için, gizlilik koruyucu makine öğrenimi (PPML) için birkaç temel teknik geliştirildi. Bu teknikler, gizlilik riskini azaltıyor ve verilerin makul ölçüde güvenli kalmasını sağlıyor. İşte en önemli birkaç teknik:

1. Federated Learning

Federated learning, veri toplama sorununu tersine çeviren bir ML eğitim tekniğidir. Verileri tek bir ML modeli oluşturmak için toplamak yerine, federated learning, ML modellerini kendisi topluyor. Bu, verilerin asla kaynak konumundan ayrılmadığını ve birden fazla tarafın, hassas verileri doğrudan paylaşmadan ortak bir ML modeli oluşturmasına olanak tanıyor.

Şöyle çalışır: Başlangıçta, bir temel ML modeli oluşturup her bir istemci düğümüne paylaşırsınız. Bu düğümler, kendi verilerini kullanarak bu modeli yerel olarak eğitirler. Model güncellemeleri, koordinatör düğümüne périodik olarak paylaşılır ve bu güncellemeleri işler ve birleştirmek için kullanılır, böylece yeni bir küresel model elde edilir. Bu şekilde, çeşitli veri kümelerinden elde edilen içgörüler, bu veri kümelerini paylaşmak zorunda kalmadan elde edilir.

Kaynak: Persistent Systems

Sağlık bakımında, bu, hasta verilerini güvenli tutarken araştırmacılara kalabalığın bilgeliğini veren, son derece güçlü ve gizlilik odaklı bir araçtır. Verileri toplamak, federated learning, bir güvenlik katmanı oluşturur. Ancak, modeller ve model güncellemeleri, STILL güvenlik riski oluşturabilir.

2. Differential Privacy

ML modelleri, üyelik çıkarımı saldırılarının hedefi olmaya eğilimlidir. Diyelim ki, bir hastaneye kanser aşısı geliştirmek için sağlık verilerinizi paylaştınız. Hastane verilerinizi güvenli tutuyor, ancak federated learning kullanarak halka açık bir ML modeli eğitiyor. Birkaç ay sonra, saldırganlar, üyelik çıkarımı saldırısı kullanarak, verilerinizi modelin eğitiminde kullanıp kullanmadığını belirleyebilir. Daha sonra, bu içgörüler, sigorta şirketlerine aktarılabilir ve sigorta şirketleri, kanser riskinize dayanarak primlerinizi artırabilir.

Differential privacy, ML modellerine yönelik saldırıların, eğitilirken kullanılan belirli veri noktalarını tanımlayamayacağından emin olur, böylece hassas eğitim verilerinin açığa çıkma riskini azaltır. Bu, eğitilirken verilere veya ML modeli parametrelerine “istatistiksel gürültü” uygulayarak yapılır, böylece saldırılar çalıştırılarak, belirli bir bireyin verilerinin modelin eğitimi için kullanılıp kullanılmadığını belirlemek zorlaşır.

Örneğin, Facebook yakın zamanda Opacus adlı, diferansiyel gizlilik tabanlı bir makine öğrenimi eğitim algoritması olan Differentially Private Stochastic Gradient Descent (DP-SGD) kullanan PyTorch modelleri için yüksek hızlı bir kütüphane yayınladı. Aşağıdaki gif, verilerin nasıl gizlendiğini gösteriyor.

 

Bu gürültü, Epsilon adlı bir parametre tarafından yönetilir. Epsilon değeri düşükse, model mükemmel veri gizliliği sağlar, ancak fayda ve doğruluk açısından düşük olur. Tersine, Epsilon değeri yüksekse, veri gizliliği azalır, ancak doğruluk artar. Anahtar, her ikisini optimize etmek için dengeyi bulmaktır.

3. Homomorphic Encryption

Standart şifreleme, geleneksel olarak, şifrelenen verilerin artık ML algoritması tarafından anlaşılamayacağı için makine öğrenimi ile uyumsuzdur. Ancak, homomorphic encryption, belirli türdeki hesaplamaları yapmaya izin veren özel bir şifreleme şemasıdır.

Kaynak: OpenMined

Bu, eğitimin tamamen şifreli bir alanda gerçekleşmesini sağlar. Bu, sadece veri sahiplerini değil, aynı zamanda model sahiplerini de korur. Model sahibi, verilere hiç bakmadan veya suistimal etmeden şifreli verilere dayalı çıkarımlar gerçekleştirebilir.

Federated learning ile birlikte uygulandığında, model güncellemelerinin birleştirilmesi güvenli bir şekilde gerçekleşir, çünkü tamamen şifreli bir ortamda gerçekleşir, böylece üyelik çıkarımı saldırılarının riski büyük ölçüde azalır.

Gizlilik On Yılı

2021’e girerken, gizlilik koruyucu makine öğrenimi, aktif araştırmaların olduğu bir alan olarak ortaya çıkıyor. Geçen on yıl veri toplamakla ilgiliyse, bu on yıl, federated learning, diferansiyel gizlilik ve homomorphic encryption yoluyla underlying verilerin gizliliğini koruyarak ML modellerini açığa çıkarmakla ilgili olacak. Bunlar, makine öğrenimi çözümlerini gizlilik odaklı bir şekilde ilerletmek için yeni bir yol vaat ediyor.

Amogh Makemaker öğrenimi araştırmacısı ve Persistent Systems bünyesindeki AI Araştırma Laboratuvarının bir parçasıdır. Şu anki araştırması Federated Learning uygulamaları ve bilgi çıkarma için NLP araçları oluşturmaya odaklanmıştır.