Lideri de opinie
Cum va distruge prejudecata strategia dvs. de IA/ML și ce puteți face în acest sens
‘Prejudecata’ în modele de orice tip descrie o situație în care modelul răspunde inexact la prompte sau date de intrare, deoarece nu a fost antrenat cu suficiente date de calitate, diverse, pentru a oferi un răspuns precis. Un exemplu ar fi funcția de deblocare a telefonului cu recunoaștere facială a companiei Apple, care a eșuat la un nivel semnificativ mai mare pentru persoane cu ten mai închis la culoare, în comparație cu cele cu ten mai deschis. Modelul nu fusese antrenat pe suficiente imagini cu persoane cu ten mai închis. Acesta a fost un exemplu relativ puțin riscant de prejudecată, dar este exact de ce Actul UE privind IA a instituit cerințe pentru a dovedi eficacitatea modelului (și controlul) înainte de a intra pe piață. Modelele cu ieșiri care afectează afaceri, financiare, sănătate sau situații personale trebuie să fie de încredere, altfel nu vor fi utilizate.
Abordarea prejudecății cu date
Volumuri mari de date de calitate
Printre multe practici importante de gestionare a datelor, o componentă cheie pentru a depăși și minimiza prejudecata în modelele de IA/ML este de a obține volume mari de date de calitate, diverse. Acest lucru necesită colaborarea cu multiple organizații care au astfel de date. În mod tradițional, achiziționarea și colaborarea cu date sunt îngreunate de preocupări legate de confidențialitate și/sau protecția proprietății intelectuale – datele sensibile nu pot fi trimise către proprietarul modelului, iar proprietarul modelului nu poate risca scurgerea de informații confidențiale către un proprietar de date. O soluție comună este de a lucra cu date sintetice sau simulate, care pot fi utile, dar au și limitări în comparație cu utilizarea datelor reale, cu context complet. Aici este unde tehnologiile care îmbunătățesc confidențialitatea (PETs) oferă răspunsuri mult necesare.
Date sintetice: Aproape, dar nu chiar
Datele sintetice sunt generate artificial pentru a imita datele reale. Acest lucru este greu de realizat, dar devine puțin mai ușor cu ajutorul instrumentelor de IA. Datele sintetice de calitate ar trebui să aibă aceleași distanțe între caracteristici ca și datele reale, altfel nu vor fi utile. Datele sintetice de calitate pot fi utilizate pentru a îmbunătăți eficient diversitatea datelor de antrenare, prin completarea lacunelor pentru populații mai mici, marginalizate, sau pentru populații pentru care furnizorul de IA nu are suficiente date. Datele sintetice pot fi utilizate și pentru a aborda cazuri limită care ar putea fi dificil de găsit în volume adecvate în lumea reală. În plus, organizațiile pot genera un set de date sintetice pentru a satisface cerințele de rezidență și confidențialitate a datelor care blochează accesul la datele reale. Acest lucru sună bine; cu toate acestea, datele sintetice reprezintă doar o parte a puzzle-ului, nu soluția.
Una dintre limitările evidente ale datelor sintetice este decuplarea de lumea reală. De exemplu, vehiculele autonome antrenate exclusiv pe date sintetice vor avea dificultăți cu condiții reale, neprevăzute, de drum. În plus, datele sintetice moștenesc prejudecăți din datele reale utilizate pentru a le genera – ceea ce practic anulează scopul discuției noastre. În concluzie, datele sintetice sunt o opțiune utilă pentru reglarea fină și abordarea cazurilor limită, dar îmbunătățirile semnificative ale eficacității modelului și minimizarea prejudecății depind în continuare de accesarea datelor din lumea reală.
O cale mai bună: Date reale prin fluxuri de lucru activate de PETs
PETs protejează datele în timpul utilizării. În ceea ce privește modelele de IA/ML, acestea pot proteja, de asemenea, proprietatea intelectuală a modelului care rulează – „două păsări, o singură piatră”. Soluțiile care utilizează PETs oferă opțiunea de a antrena modele pe seturi de date reale, sensibile, care nu au fost anterior accesibile din cauza problemelor de confidențialitate și securitate a datelor. Deblocarea fluxurilor de date către date reale este cea mai bună opțiune pentru reducerea prejudecății. Dar cum ar funcționa, de fapt?
Pentru moment, opțiunile principale încep cu un mediu de calcul confidențial. Apoi, o integrare cu o soluție software bazată pe PETs care o face gata de utilizare, direct din cutie, și care abordează cerințele de guvernanță și securitate a datelor care nu sunt incluse într-un mediu standard de execuție securizată (TEE). Cu această soluție, modelele și datele sunt criptate înainte de a fi trimise către un mediu de calcul securizat. Mediul poate fi găzduit oriunde, ceea ce este important atunci când se abordează anumite cerințe de localizare a datelor. Acest lucru înseamnă că atât proprietatea intelectuală a modelului, cât și securitatea datelor de intrare sunt menținute în timpul calculului – nici măcar furnizorul mediului de execuție securizată nu are acces la modelele sau datele din interiorul acestuia. Rezultatele criptate sunt apoi trimise înapoi pentru revizuire, iar jurnalele sunt disponibile pentru revizuire.
Acest flux deblochează cele mai bune date, indiferent de locul în care se află sau de cine le deține, creând o cale către minimizarea prejudecății și modele cu eficacitate ridicată, pe care le putem încredința. Acest flux este, de asemenea, ceea ce a descris Actul UE privind IA în cerințele sale pentru un sandbox regulamentar de IA.
Facilitarea conformității etice și legale
Obținerea de date de calitate, reale, este dificilă. Cerințele de confidențialitate și localizare a datelor limitează imediat seturile de date la care organizațiile pot avea acces. Pentru inovare și creștere, datele trebuie să ajungă la cei care pot extrage valoarea din ele.
Articolul 54 din Actul UE privind IA oferă cerințe pentru tipurile de modele „cu risc ridicat” în ceea ce privește ceea ce trebuie dovedit înainte de a putea fi lansate pe piață. Pe scurt, echipele vor trebui să utilizeze date din lumea reală într-un sandbox regulamentar de IA pentru a demonstra eficacitatea modelului și conformitatea cu toate controalele detaliate în Titlul III, Capitolul 2. Controalele includ monitorizarea, transparența, explicabilitatea, securitatea datelor, protecția datelor, minimizarea datelor și protecția modelului – gândiți-vă la DevSecOps + Data Ops.
Prima provocare va fi găsirea unui set de date reale pentru a fi utilizat – deoarece acestea sunt, în mod inerent, date sensibile pentru astfel de tipuri de modele. Fără garanții tehnice, multe organizații ar putea ezita să încredințeze furnizorului de modele datele lor sau nu ar fi autorizate să o facă. În plus, modul în care actul definește un „sandbox regulamentar de IA” este o provocare în sine. Unele dintre cerințele incluse sunt garanția că datele sunt eliminate din sistem după ce modelul a fost rulat, precum și controalele de guvernanță, aplicarea, și raportarea pentru a dovedi acest lucru.
Multe organizații au încercat să utilizeze camere de date (DCR) și medii de execuție securizate (TEE) gata de utilizare. Cu toate acestea, aceste tehnologii necesită, în mod independent, o expertiză semnificativă și un efort considerabil pentru a fi operaționalizate și a îndeplini cerințele de reglementare a datelor și IA.
DCR-urile sunt mai simple de utilizat, dar nu sunt încă utile pentru nevoi mai robuste de IA/ML. TEE-urile sunt servere securizate și necesită, de asemenea, o platformă de colaborare integrată pentru a fi utile rapid. Acest lucru identifică, cu toate acestea, o oportunitate pentru platformele de tehnologie care îmbunătățesc confidențialitatea de a se integra cu TEE-urile pentru a elimina această muncă, trivializând astfel configurarea și utilizarea unui sandbox regulamentar de IA și, prin urmare, achiziționarea și utilizarea datelor sensibile.
Prin facilitarea utilizării unor seturi de date mai diverse și cuprinzătoare într-un mod care păstrează confidențialitatea, aceste tehnologii ajută la asigurarea faptului că practicile de IA și ML respectă standardele etice și cerințele legale legate de confidențialitatea datelor (de exemplu, GDPR și Actul UE privind IA în Europa). În rezumat, deși cerințele sunt adesea întâmpinate cu murmure și suspine, aceste cerințe ne îndrumă, de fapt, către construirea unor modele mai bune, pe care le putem încredința și utiliza pentru luarea deciziilor bazate pe date importante, protejând, în același timp, confidențialitatea subiecților de date utilizați pentru dezvoltarea și personalizarea modelului.
în Europa). În rezumat, deși cerințele sunt adesea întâmpinate cu murmure și suspine, aceste cerințe ne îndrumă, de fapt, către construirea unor modele mai bune, pe care le putem încredința și utiliza pentru luarea deciziilor bazate pe date importante, protejând, în același timp, confidențialitatea subiecților de date utilizați pentru dezvoltarea și personalizarea modelului.












