Sicurezza informatica
Come Proteggere i Dati di Addestramento dell’Intelligenza Artificiale
L’intelligenza artificiale (AI) necessita di dati e molti dati. Raccogliere le informazioni necessarie non è sempre una sfida nell’ambiente odierno, con molti set di dati pubblici disponibili e così tanti dati generati ogni giorno. Tuttavia, proteggerli è un’altra questione.
La vasta dimensione dei set di dati di addestramento dell’AI e l’impatto dei modelli di intelligenza artificiale attirano l’attenzione dei cybercriminali. Man mano che l’affidabilità sull’AI aumenta, i team che sviluppano questa tecnologia dovrebbero prendere precauzioni per assicurarsi di mantenere i loro dati di addestramento al sicuro.
Perché i Dati di Addestramento dell’AI Richiedono una Maggiore Sicurezza
I dati che si utilizzano per addestrare un modello di intelligenza artificiale possono riflettere persone, aziende o eventi del mondo reale. Di conseguenza, potreste gestire una quantità considerevole di informazioni personali identificabili (PII), che causerebbero violazioni significative della privacy se esposte. Nel 2023, Microsoft (MSFT ) ha subito un incidente del genere, esponendo accidentalmente 38 terabyte di informazioni private durante un progetto di ricerca sull’AI.
I set di dati di addestramento dell’AI possono anche essere vulnerabili ad attacchi più pericolosi. I cybercriminali possono alterare l’affidabilità di un modello di apprendimento automatico manipolando i suoi dati di addestramento se possono accedervi. È un tipo di attacco noto come avvelenamento dei dati, e gli sviluppatori di AI potrebbero non notare gli effetti fino a quando non è troppo tardi.
Le ricerche mostrano che l’avvelenamento di solo lo 0,001% di un set di dati è sufficiente per corrompere un modello di intelligenza artificiale. Senza adeguate protezioni, un attacco del genere potrebbe avere gravi implicazioni una volta che il modello viene implementato nel mondo reale. Ad esempio, un algoritmo di guida autonoma corrotto potrebbe non rilevare i pedoni. Alternativamente, uno strumento di selezione dei curriculum basato sull’AI potrebbe produrre risultati distorti.
In circostanze meno gravi, gli attaccanti potrebbero rubare informazioni proprietarie da un set di dati di addestramento in un atto di spionaggio industriale. Potrebbero anche bloccare gli utenti autorizzati dal database e chiedere un riscatto.
Man mano che l’AI diventa sempre più importante per la vita e gli affari, i cybercriminali possono guadagnare di più attaccando i database di addestramento. Tutti questi rischi, a loro volta, diventano ancora più preoccupanti.
5 Passaggi per Proteggere i Dati di Addestramento dell’AI
Alla luce di queste minacce, prendere seriamente la sicurezza quando si addestrano modelli di intelligenza artificiale. Ecco cinque passaggi da seguire per proteggere i vostri dati di addestramento dell’AI.
1. Minimizzare le Informazioni Sensibili nei Set di Dati di Addestramento
Una delle misure più importanti è quella di ridurre la quantità di dettagli sensibili nel set di dati di addestramento. Minore è la quantità di informazioni personali identificabili (PII) o di altre informazioni preziose presenti nel database, minore è il bersaglio per gli hacker. Una violazione avrà anche un impatto minore se si verificherà in questi scenari.
I modelli di intelligenza artificiale spesso non necessitano di utilizzare informazioni del mondo reale durante la fase di addestramento. I dati sintetici sono un’alternativa preziosa. I modelli addestrati con dati sintetici possono essere altrettanto precisi, se non più precisi di altri, quindi non è necessario preoccuparsi di problemi di prestazioni. Assicurarsi solo che il set di dati generato assomigli e si comporti come i dati del mondo reale.
In alternativa, è possibile pulire i set di dati esistenti dai dettagli sensibili come i nomi delle persone, gli indirizzi e le informazioni finanziarie. Quando tali fattori sono necessari per il modello, si può considerare di sostituirli con dati dummy o scambiare i dati tra record.
2. Limitare l’Accesso ai Dati di Addestramento
Una volta compilato il set di dati di addestramento, è necessario limitare l’accesso ad esso. Seguire il principio del minimo privilegio, che afferma che qualsiasi utente o programma dovrebbe essere in grado di accedere solo a ciò che è necessario per completare correttamente il proprio lavoro. Chi non è coinvolto nel processo di addestramento non ha bisogno di vedere o interagire con il database.
Ricordare che le restrizioni dei privilegi sono efficaci solo se si implementa anche un metodo affidabile per verificare gli utenti. Un nome utente e una password non sono sufficienti. L’autenticazione a più fattori (MFA) è essenziale, poiché ferma l’80-90% di tutti gli attacchi contro gli account, ma non tutti i metodi MFA sono uguali. L’MFA basato su testo e app è generalmente più sicuro delle alternative basate su e-mail.
Assicurarsi di limitare anche il software e i dispositivi, non solo gli utenti. Gli unici strumenti che dovrebbero avere accesso al database di addestramento sono il modello di intelligenza artificiale stesso e qualsiasi programma utilizzato per gestire queste informazioni durante l’addestramento.
3. Crittografare e Eseguire il Backup dei Dati
La crittografia è un’altra misura di protezione cruciale. Sebbene non tutti gli algoritmi di apprendimento automatico possano addestrarsi attivamente su dati crittografati, è possibile crittografare e decrittografare i dati durante l’analisi. Quindi, è possibile ricrittografarli una volta terminato. In alternativa, è possibile esaminare strutture di modelli che possono analizzare le informazioni mentre sono crittografate.
È importante eseguire il backup dei dati di addestramento nel caso in cui accada qualcosa. I backup dovrebbero essere in una posizione diversa dalla copia principale. A seconda di quanto sia critico il set di dati, potrebbe essere necessario conservare un backup offline e uno nel cloud. Ricordare di crittografare tutti i backup, anche.
Quando si tratta di crittografia, scegliere il metodo con attenzione. Gli standard più alti sono sempre preferibili, ma potrebbe essere utile considerare algoritmi di crittografia resistenti ai quanti man mano che aumenta la minaccia degli attacchi quantistici.
4. Monitorare l’Accesso e l’Utilizzo
Anche se si seguono questi altri passaggi, i cybercriminali possono superare le difese. Di conseguenza, è necessario monitorare costantemente l’accesso e i modelli di utilizzo dei dati di addestramento dell’AI.
Una soluzione di monitoraggio automatizzata è probabilmente necessaria in questo caso, poiché poche organizzazioni hanno livelli di personale sufficienti per controllare l’attività sospetta 24 ore su 24. L’automatizzazione è anche molto più veloce nell’agire quando si verifica qualcosa di insolito, portando a costi di violazione dei dati inferiori di 2,22 dollari in media grazie a risposte più rapide ed efficaci.
Registrazione di ogni accesso ai dati, richiesta di accesso, modifica o altra interazione con essi. Oltre a controllare potenziali violazioni in questa attività, esaminare regolarmente i trend più ampi. Il comportamento degli utenti autorizzati può cambiare nel tempo, il che potrebbe richiedere un aggiustamento dei permessi di accesso o della biometria comportamentale se si utilizza un tale sistema.
5. Rivalutare Regolarmente i Rischi
Allo stesso modo, i team di sviluppo dell’AI devono rendersi conto che la sicurezza informatica è un processo in corso, non una soluzione una tantum. I metodi di attacco si evolvono rapidamente – alcune vulnerabilità e minacce possono sfuggire all’attenzione prima di essere notate. L’unico modo per rimanere al sicuro è quello di rivalutare regolarmente la propria posizione di sicurezza.
Almeno una volta all’anno, esaminare il modello di intelligenza artificiale, i suoi dati di addestramento e qualsiasi incidente di sicurezza che abbia interessato entrambi. Eseguire un’audit del set di dati e dell’algoritmo per assicurarsi che funzionino correttamente e che non ci siano dati avvelenati, fuorvianti o dannosi presenti. Adattare i controlli di sicurezza come necessario a qualsiasi cosa insolita si noti.
I test di penetrazione, in cui gli esperti di sicurezza testano le difese cercando di superarle, sono anche utili. Tutti tranne il 17% degli esperti di sicurezza informatica eseguono test di penetrazione almeno una volta all’anno, e il 72% di coloro che lo fanno afferma di credere che abbia fermato una violazione nella loro organizzazione.
La Sicurezza Informatica è Fondamentale per lo Sviluppo Sicuro dell’AI
Lo sviluppo etico e sicuro dell’AI sta diventando sempre più importante man mano che crescono le preoccupazioni relative all’affidabilità sull’apprendimento automatico. Proteggere il database di addestramento è un passaggio critico per soddisfare questa richiesta.
I dati di addestramento dell’AI sono troppo preziosi e vulnerabili per ignorare i rischi informatici. Seguire questi cinque passaggi oggi per mantenere il modello e il set di dati al sicuro.












