Myslitelé

Tři techniky strojového učení, které chrání soukromí a řeší nejvýznamnější problém tohoto desetiletí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Od Amogha Tarcar, výzkumníka strojového učení a umělé inteligence, Persistent Systems.

Odborníci z různých oblastí se shodují, že ochrana soukromí bude nejdůležitějším problémem tohoto desetiletí. To platí zejména pro strojové učení (ML), kde algoritmy vyžadují velké množství dat.

Tradiční techniky modelování ML spoléhají na centralizaci dat z různých zdrojů do jednoho datového centra. ML modely jsou nejsilnější, když mají přístup k velkým množství dat. Nicméně, tato technika přináší řadu problémů s ochranou soukromí. Agregace různých dat z více zdrojů je dnes méně proveditelná kvůli regulatorním problémům, jako jsou HIPAA, GDPR a CCPA. Kromě toho, centralizace dat zvyšuje rozsah a měřítko zneužití dat a bezpečnostních hrozeb v podobě úniků dat.

Aby se tyto problémy překonaly, byly vyvinuty several pilíře ochrany soukromí strojového učení (PPML) s konkrétními technikami, které snižují riziko ochrany soukromí a zajišťují, že data zůstávají dostatečně zabezpečena. Mezi nimi patří:

1. Federated Learning

Federated learning je technika školení ML, která otočí problém agregace dat na hlavu. Místo agregace dat pro vytvoření jednoho modelu ML, federated learning agreguje samotné modely ML. To zajišťuje, že data nikdy neopouštějí své původní umístění a umožňuje několika stranám spolupracovat a vytvářet společný model ML bez přímého sdílení citlivých dat.

Funguje to tak, že začnete se základním modelem ML, který je poté sdílen s každým klientem. Tyto klienty poté spouštějí lokální školení na tomto modelu pomocí svých vlastních dat. Aktualizace modelu jsou pravidelně sdíleny s koordinačním uzlem, který zpracovává tyto aktualizace a slučuje je dohromady, aby získal nový globální model. Tímto způsobem získáte informace z různých datových sad bez nutnosti sdílet tyto datové sady.

Zdroj: Persistent Systems

V kontextu zdravotnictví je tato technika neuvěřitelně silným a ochranným nástrojem pro udržení pacientských dat v bezpečí, zatímco výzkumníkům poskytuje moudrost davu. Nezajišťováním agregace dat, federated learning vytváří další vrstvu zabezpečení. Nicméně, modely a aktualizace modelů samy o sobě stále představují bezpečnostní riziko, pokud jsou zranitelné.

2. Diferenční soukromí

ML modely jsou často cílem útoků na inferenci členství. Předpokládejme, že jste sdíleli svá zdravotní data s nemocnicí, aby pomohli vyvinout vakcínu proti rakovině. Nemocnice uchovává vaše data v bezpečí, ale používá federated learning pro školení veřejně dostupného modelu ML. O několik měsíců později, hackeři použijí útok na inferenci členství, aby zjistili, zda vaše data byla použita při školení modelu. Poté předají informace pojišťovně, která, na základě vašeho rizika rakoviny, může zvýšit vaše pojistné.

Diferenční soukromí zajišťuje, že útoky na ML modely nebudou moci identifikovat konkrétní datové body použité při školení, a tím snižují riziko odhalení citlivých trénovacích dat ve strojovém učení. To se provádí aplikací “statistického šumu” pro rušení dat nebo parametrů modelu ML během školení, což činí obtížné provést útoky a určit, zda byla data konkrétního jedince použita pro školení modelu.

Například, Facebook nedávno vydal Opacus, knihovnu s vysokou rychlostí pro školení modelů PyTorch pomocí algoritmu diferenciálního soukromí zvaného Differentially Private Stochastic Gradient Descent (DP-SGD). Následující gif ukazuje, jak používá šum pro maskování dat.

 

Tento šum je řízen parametrem nazvaným Epsilon. Pokud je hodnota Epsilon nízká, model má dokonalé soukromí dat, ale špatnou užitečnost a přesnost. Naopak, pokud máte vysokou hodnotu Epsilon, vaše soukromí dat se sníží, zatímco vaše přesnost se zvýší. Trik spočívá v nalezení rovnováhy, aby se optimalizovala obě hodnoty.

3. Homomorfní šifrování

Standardní šifrování je tradičně nekompatibilní se strojovým učením, protože jednou, co jsou data zašifrována, již nemohou být pochopena algoritmem ML. Nicméně, homomorfní šifrování je speciální šifrovací schéma, které umožňuje pokračovat v určitých typech výpočtů.

Zdroj: OpenMined

Síla této techniky spočívá v tom, že školení může probíhat v plně zašifrovaném prostoru. Chrání nejen vlastníky dat, ale také vlastníky modelů. Vlastník modelu může spustit inferenci na zašifrovaných datech, aniž by je viděl nebo zneužil.

Pokud se aplikuje na federated learning, slučování aktualizací modelu může probíhat bezpečně, protože se děje v plně zašifrovaném prostředí, což dramaticky snižuje riziko útoků na inferenci členství.

Desetiletí soukromí

Když vstupujeme do roku 2021, ochrana soukromí strojového učení je vznikající oblastí s pozoruhodně aktivním výzkumem. Pokud minulé desetiletí bylo o odstraňování izolace dat, toto desetiletí bude o odstraňování izolace modelů ML, zatímco se zachovává soukromí podkladových dat pomocí federated learning, diferenciálního soukromí a homomorfního šifrování. Tyto techniky představují slibný nový způsob pro rozvoj řešení strojového učení v soukromém režimu.

Amogh je výzkumník v oblasti strojového učení a je součástí laboratoře pro výzkum umělé inteligence ve společnosti Persistent Systems. Jeho současný výzkum se zaměřuje na aplikace federovaného učení a budování nástrojů pro zpracování přirozeného jazyka pro extrakci znalostí.