Securitate cibernetică

Cum să securizați datele de antrenament AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Inteligența artificială (AI) are nevoie de date și de multe. Colectarea informațiilor necesare nu este întotdeauna o provocare în mediul de astăzi, cu multe seturi de date publice disponibile și atât de multe date generate în fiecare zi. Securizarea lor, însă, este o altă chestiune.

Dimensiunea vastă a seturilor de date de antrenament AI și impactul modelelor de inteligență artificială atrag atenția criminalilor cibernetici. Pe măsură ce crește dependența de AI, echipele care dezvoltă această tehnologie ar trebui să ia măsuri de precauție pentru a se asigura că își păstrează datele de antrenament în siguranță.

De ce datele de antrenament AI au nevoie de o securitate mai bună

Datele pe care le folosiți pentru a antrena un model de inteligență artificială pot reflecta persoane, afaceri sau evenimente din lumea reală. Ca atare, puteți gestiona o cantitate considerabilă de informații personale identificabile (PII), care ar putea provoca încălcări semnificative ale confidențialității dacă ar fi expuse. În 2023, Microsoft (MSFT ) a suferit un astfel de incident, expunând accidental 38 de terabiți de informații private în timpul unui proiect de cercetare AI.

Seturile de date de antrenament AI pot fi, de asemenea, vulnerabile la atacuri mai periculoase, cunoscute sub numele de atacuri de otrăvire a datelor. Criminalii cibernetici pot altera fiabilitatea unui model de învățare automată prin manipularea datelor de antrenament, dacă pot obține acces la ele. Este un tip de atac cunoscut sub numele de otrăvire a datelor, și dezvoltatorii de AI poate nu observă efectele până când este prea târziu.

Cercetările arată că otrăvirea a doar 0,001% dintr-un set de date este suficientă pentru a corupe un model de inteligență artificială. Fără măsuri de protecție adecvate, un atac de acest fel poate avea implicații grave odată ce modelul este implementat în lumea reală. De exemplu, un algoritm de conducere autonomă corupt poate să nu observe pietonii. Alternativ, un instrument de scanare a CV-urilor poate produce rezultate biasate.

În circumstanțe mai puțin grave, atacatorii pot fura informații proprietare dintr-un set de date de antrenament într-un act de spionaj industrial. Ei pot, de asemenea, să blocheze utilizatorii autorizați din baza de date și să ceară o răscumpărare.

Pe măsură ce inteligența artificială devine din ce în ce mai importantă pentru viața și afacerile noastre, criminalii cibernetici au mai mult de câștigat din atacarea bazelor de date de antrenament. Toate aceste riscuri devin, la rândul lor, și mai îngrijorătoare.

5 pași pentru securizarea datelor de antrenament AI

În lumina acestor amenințări, luați securitatea în serios atunci când antrenați modele de inteligență artificială. Iată cinci pași de urmat pentru a securiza datele dvs. de antrenament AI.

1. Minimizați informațiile sensibile în seturile de date de antrenament

Una dintre cele mai importante măsuri este să reduceți cantitatea de informații sensibile din setul dvs. de date de antrenament. Cu cât mai puține informații personale identificabile (PII) sau alte informații valoroase sunt în baza dvs. de date, cu atât mai puțin este ținta pentru hackeri. O încălcare a securității va fi, de asemenea, mai puțin impactantă dacă are loc în aceste scenarii.

Modelele de inteligență artificială nu au neapărat nevoie să utilizeze informații din lumea reală în timpul fazei de antrenament. Datele sintetice sunt o alternativă valoroasă. Modelele antrenate pe date sintetice pot fi la fel de precise, dacă nu mai precise decât altele, așa că nu trebuie să vă faceți griji cu privire la probleme de performanță. Asigurați-vă doar că setul de date generat seamănă și se comportă ca datele din lumea reală.

Alternativ, puteți curăța seturile de date existente de informații sensibile, cum ar fi numele, adresele și informațiile financiare ale persoanelor. Atunci când astfel de factori sunt necesari pentru modelul dvs., luați în considerare înlocuirea lor cu date fictive sau schimbarea lor între înregistrări.

2. Restrictați accesul la datele de antrenament

Odată ce ați compilat setul dvs. de date de antrenament, trebuie să restrictați accesul la el. Urmați principiul privilegiilor minime, care afirmă că orice utilizator sau program ar trebui să aibă acces doar la ceea ce este necesar pentru a-și îndeplini corect sarcina. Orice persoană care nu este implicată în procesul de antrenament nu are nevoie să vadă sau să interacționeze cu baza de date.

Rețineți că restricțiile de privilegii sunt eficiente doar dacă implementați, de asemenea, o modalitate de verificare a utilizatorilor. Un nume de utilizator și o parolă nu sunt suficiente. Autentificarea cu mai mulți factori (MFA) este esențială, deoarece oprește 80-90% din toate atacurile asupra conturilor, dar nu toate metodele MFA sunt la fel de sigure. Autentificarea bazată pe text și aplicații este, în general, mai sigură decât variantele bazate pe e-mail.

Asigurați-vă că restrictați software-ul și dispozitivele, nu doar utilizatorii. Singurele unelte care ar trebui să aibă acces la baza de date de antrenament sunt modelul de inteligență artificială însuși și orice programe pe care le utilizați pentru a gestiona aceste informații în timpul antrenamentului.

3. Criptați și faceți backup la date

Criptarea este o altă măsură de protecție crucială. Deși nu toate algoritmii de învățare automată pot antrena activ pe date criptate, puteți cripta și decripta datele în timpul analizei. Apoi, puteți cripta din nou odată ce ați terminat. Alternativ, căutați structuri de modele care pot analiza informații în timp ce sunt criptate.

Păstrarea copiilor de rezervă ale datelor dvs. de antrenament în cazul în care se întâmplă ceva cu ele este importantă. Copiile de rezervă ar trebui să fie într-o locație diferită de copia principală. În funcție de cât de critice sunt datele dvs., poate fi necesar să păstrați o copie de rezervă offline și una în cloud. Rețineți să criptați toate copiile de rezervă, de asemenea.

Atunci când vine vorba de criptare, alegeți metoda cu atenție. Standardele mai ridicate sunt întotdeauna preferabile, dar poate doriți să luați în considerare algoritmii de criptografie rezistenți la atacuri cuantice, pe măsură ce crește amenințarea atacurilor cuantice.

4. Monitorizați accesul și utilizarea

Chiar dacă urmați acești pași, criminalii cibernetici pot străpunge apărarea dvs. Prin urmare, trebuie să monitorizați în mod continuu modelele de acces și utilizare a datelor dvs. de antrenament AI.

O soluție de monitorizare automată este, probabil, necesară aici, deoarece puține organizații au nivelul de personal necesar pentru a supraveghea activitatea suspectă în jurul ceasului. Automatizarea este, de asemenea, mult mai rapidă în a acționa atunci când apare ceva neobișnuit, ceea ce duce la costuri cu 2,22 dolari mai mici pentru încălcarea datelor în medie, datorită răspunsurilor mai rapide și mai eficiente.

Înregistrați fiecare dată când cineva sau ceva accesează setul de date, solicită acces, modifică sau interacționează altfel cu el. Pe lângă supravegherea potențialelor încălcări a securității în această activitate, revizuiți-o în mod regulat pentru tendințe mai largi. Comportamentul utilizatorilor autorizați poate să se schimbe în timp, ceea ce poate necesita o ajustare a permisiunilor de acces sau a biometriei comportamentale, dacă utilizați un astfel de sistem.

5. Reevaluați în mod regulat riscurile

La fel, echipele de dezvoltare AI trebuie să înțeleagă că securitatea cibernetică este un proces continuu, nu o soluție unică. Metodele de atac se evoluează rapid – unele vulnerabilități și amenințări pot scăpa prin crăpături înainte de a le observa. Singura modalitate de a rămâne în siguranță este să reevaluați în mod regulat postura de securitate.

Cel puțin o dată pe an, revizuiți modelul dvs. de inteligență artificială, datele de antrenament și orice incidente de securitate care au afectat oricare dintre ele. Auditul setului de date și al algoritmului pentru a vă asigura că funcționează corect și că nu există date otrăvite, înșelătoare sau dăunătoare este esențial. Ajustați controalele de securitate după cum este necesar pentru orice lucru neobișnuit pe care îl observați.

Testarea de penetrare, în care experții în securitate testează apărarea dvs. încercând să o străpungă, este, de asemenea, benefică. Toți, cu excepția 17% din profesioniștii în securitate cibernetică efectuează testări de penetrare cel puțin o dată pe an, și 72% dintre cei care o fac spun că cred că a oprit o încălcare a securității la organizația lor.

Securitatea cibernetică este cheia dezvoltării sigure a inteligenței artificiale

Dezvoltarea etică și sigură a inteligenței artificiale devine din ce în ce mai importantă pe măsură ce crește importanța potențială a problemelor legate de dependența de învățarea automată. Securizarea bazei dvs. de date de antrenament este un pas critic pentru a răspunde acestei cerințe.

Datele de antrenament AI sunt prea valoroase și vulnerabile pentru a ignora riscurile cibernetice. Urmați acești cinci pași astăzi pentru a păstra modelul și setul de date în siguranță.

Zac Amos este un redactor tehnic care se concentrează pe inteligență artificială. De asemenea, este Editor de articole la ReHack, unde poți citi mai multe din lucrările sale.