Leader di pensiero

Tre tecniche di apprendimento automatico che preservano la privacy per risolvere il problema più importante di questo decennio

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Di Amogh Tarcar, ricercatore di apprendimento automatico e intelligenza artificiale, Persistent Systems.

La privacy dei dati, secondo gli esperti di vari settori, sarà il problema più importante di questo decennio. Ciò è particolarmente vero per l’apprendimento automatico (ML), dove gli algoritmi vengono alimentati con grandi quantità di dati.

Tradizionalmente, le tecniche di modellazione dell’apprendimento automatico si sono basate sulla centralizzazione dei dati da più fonti in un unico centro di dati. Dopo tutto, i modelli di apprendimento automatico sono più potenti quando hanno accesso a grandi quantità di dati. Tuttavia, ci sono numerose sfide relative alla privacy associate a questa tecnica. L’aggregazione di dati diversi da più fonti è meno fattibile oggi a causa di preoccupazioni normative come HIPAA, GDPR e CCPA. Inoltre, la centralizzazione dei dati aumenta la portata e la scala degli abusi di dati e delle minacce alla sicurezza sotto forma di violazioni dei dati.

Per superare queste sfide, sono stati sviluppati diversi pilastri dell’apprendimento automatico che preserva la privacy (PPML) con tecniche specifiche che riducono il rischio per la privacy e garantiscono che i dati rimangano ragionevolmente sicuri. Ecco alcune delle più importanti:

1. Apprendimento federato

L’apprendimento federato è una tecnica di addestramento dell’apprendimento automatico che capovolge il problema dell’aggregazione dei dati. Invece di aggregare i dati per creare un unico modello di apprendimento automatico, l’apprendimento federato aggrega i modelli di apprendimento automatico stessi. Ciò garantisce che i dati non lascino mai la loro posizione di origine e consente a più parti di collaborare e costruire un modello di apprendimento automatico comune senza condividere direttamente dati sensibili.

Funziona così. Si inizia con un modello di apprendimento automatico di base che viene condiviso con ogni nodo client. Questi nodi eseguono quindi un addestramento locale su questo modello utilizzando i propri dati. Le aggiornamenti del modello vengono periodicamente condivisi con il nodo coordinatore, che elabora questi aggiornamenti e li fonde insieme per ottenere un nuovo modello globale. In questo modo, si ottengono informazioni da set di dati diversi senza dover condividere questi set di dati.

Fonte: Persistent Systems

Nel contesto della sanità, questo è uno strumento incredibilmente potente e consapevole della privacy per mantenere al sicuro i dati dei pazienti mentre si forniscono ai ricercatori la saggezza della folla. Non aggregando i dati, l’apprendimento federato crea un ulteriore livello di sicurezza. Tuttavia, i modelli e gli aggiornamenti dei modelli presentano ancora un rischio per la sicurezza se lasciati vulnerabili.

2. Privacy differenziale

I modelli di apprendimento automatico sono spesso bersaglio di attacchi di inferenza di appartenenza. Supponiamo che condividiate i vostri dati sanitari con un ospedale per aiutare a sviluppare un vaccino contro il cancro. L’ospedale mantiene i vostri dati al sicuro, ma utilizza l’apprendimento federato per addestrare un modello di apprendimento automatico disponibile pubblicamente. Alcuni mesi dopo, gli hacker utilizzano un attacco di inferenza di appartenenza per determinare se i vostri dati sono stati utilizzati nell’addestramento del modello o meno. Quindi, forniscono informazioni a una compagnia di assicurazioni, che, in base al vostro rischio di cancro, potrebbe aumentare le vostre tariffe.

La privacy differenziale garantisce che gli attacchi avversari ai modelli di apprendimento automatico non saranno in grado di identificare punti di dati specifici utilizzati durante l’addestramento, mitigando così il rischio di esporre dati sensibili di addestramento nell’apprendimento automatico. Ciò viene fatto applicando “rumore statistico” per perturbare i dati o i parametri del modello di apprendimento automatico durante l’addestramento dei modelli, rendendo difficile eseguire attacchi e determinare se i dati di un particolare individuo siano stati utilizzati per addestrare il modello.

Ad esempio, Facebook ha recentemente rilasciato Opacus, una libreria ad alta velocità per l’addestramento di modelli PyTorch utilizzando un algoritmo di addestramento dell’apprendimento automatico basato sulla privacy differenziale chiamato Differentially Private Stochastic Gradient Descent (DP-SGD). Il gif seguente evidenzia come utilizza il rumore per mascherare i dati.

 

Questo rumore è governato da un parametro chiamato Epsilon. Se il valore di Epsilon è basso, il modello ha una privacy dei dati perfetta ma una scarsa utilità e precisione. Inversamente, se si ha un valore di Epsilon alto, la privacy dei dati diminuirà mentre la precisione aumenterà. La chiave è trovare un equilibrio per ottimizzare entrambi.

3. Crittografia omodorfica

La crittografia standard è tradizionalmente incompatibile con l’apprendimento automatico perché, una volta crittografati i dati, non possono più essere compresi dall’algoritmo di apprendimento automatico. Tuttavia, la crittografia omodorfica è uno schema di crittografia speciale che consente di continuare a eseguire determinati tipi di calcoli.

Fonte: OpenMined

Il potere di questo è che l’addestramento può avvenire in uno spazio completamente crittografato. Non solo protegge i proprietari dei dati, ma protegge anche i proprietari del modello. Il proprietario del modello può eseguire inferenza su dati crittografati senza mai vederli o abusarne.

Quando applicata all’apprendimento federato, la fusione degli aggiornamenti del modello può avvenire in modo sicuro perché si svolge in un ambiente completamente crittografato, riducendo drasticamente il rischio di attacchi di inferenza di appartenenza.

Il decennio della privacy

Mentre entriamo nel 2021, l’apprendimento automatico che preserva la privacy è un settore emergente con una ricerca notevolmente attiva. Se l’ultimo decennio è stato caratterizzato dalla rimozione dei silos dei dati, questo decennio sarà caratterizzato dalla rimozione dei silos dei modelli di apprendimento automatico mentre si preserva la privacy dei dati sottostanti attraverso l’apprendimento federato, la privacy differenziale e la crittografia omodorfica. Queste presentano un nuovo modo promettente per avanzare le soluzioni di apprendimento automatico in modo consapevole della privacy. il decennio scorso è stato caratterizzato dalla rimozione dei silos dei dati, questo decennio sarà caratterizzato dalla rimozione dei silos dei modelli di apprendimento automatico mentre si preserva la privacy dei dati sottostanti attraverso l’apprendimento federato, la privacy differenziale e la crittografia omodorfica. Queste presentano un nuovo modo promettente per avanzare le soluzioni di apprendimento automatico in modo consapevole della privacy.

Amogh è un ricercatore di Machine Learning e fa parte del laboratorio di ricerca sull'AI presso Persistent Systems. La sua attuale ricerca si concentra su applicazioni di Federated Learning e sulla costruzione di strumenti NLP per l'estrazione di conoscenza.