Interviuri

Amy Steier, Șefă științifică principală de învățare automată la Gretel.ai – Seria de interviuri

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Amy Steier este șefa științifică principală de învățare automată la Gretel.ai, cea mai avansată platformă de inginerie a confidențialității din lume. Gretel face ca încorporarea confidențialității prin design în tehnologia bazată pe date să fie ușoară. Bibliotecile sale bazate pe inteligență artificială și cu sursă deschisă sunt proiectate pentru transformarea, anonimizarea și sintetizarea informațiilor sensibile.

Amy este o specialistă de învățare automată și științifică a datelor deosebit de realizată, cu peste 20 de ani de experiență. Ea este pasionată de datele mari și de scoaterea la suprafață a inteligenței ascunse din ele, utilizând tehnici din învățarea automată, mineritul de date, inteligența artificială și statistică. Ea este foarte pricepută în modelarea predictivă, clasificare, clustering, detectarea anomaliilor, vizualizarea datelor, metodele ensemble, recuperarea informațiilor, analiza securității cibernetice, NLP, modelele de recomandare și analiza comportamentului utilizatorilor.

Ce v-a atras inițial să urmați o carieră în știința calculatoarelor și învățarea automată?

Iubirea mea sinceră, neînfrântă și de durată pentru date. Puterea, misterul, intriga și potențialul datelor m-au fascinat întotdeauna. Știința calculatoarelor și învățarea automată sunt unelte pentru valorificarea acestui potențial. De asemenea, este foarte distractiv să lucrați într-un domeniu în care stadiul actual al tehnologiei evoluează atât de rapid. Îmi place intersecția dintre cercetare și produs. Este foarte satisfăcător să luați idei de ultimă oră, să le împingeți puțin mai departe și apoi să le transformați pentru a se potrivi nevoilor concrete ale produsului.

Pentru cititorii care nu sunt familiarizați, puteți explica ce este datele sintetice?

Datele sintetice sunt date care arată și se comportă ca datele originale, dar sunt și suficient de diferite pentru a satisface un anumit caz de utilizare. Cel mai comun caz de utilizare este nevoia de a proteja confidențialitatea informațiilor din datele originale. Un alt caz de utilizare este nevoia de a crea date suplimentare pentru a crește dimensiunea setului de date original. Încă un caz de utilizare este de a ajuta la abordarea unui dezechilibru de clasă sau a unui bias demografic în setul de date original.

Datele sintetice ne permit să continuăm dezvoltarea de produse și soluții inovatoare atunci când datele necesare pentru a face acest lucru altfel nu ar fi prezente sau disponibile.

Cum funcționează platforma Gretel pentru a crea date sintetice prin API-uri?

API-urile de inginerie a confidențialității Gretel vă permit să ingerați date în Gretel și să explorați datele pe care le putem extrage. Acestea sunt aceleași API-uri utilizate de Console noastră. Prin expunerea API-urilor, prin intermediul unei interfețe intuitive, ne propunem să împuternicim dezvoltatorii și oamenii de știință din domeniul datelor să-și creeze propriile fluxuri de lucru în jurul Gretel.

În timp ce consolele fac crearea de date sintetice foarte ușoară, API-urile ne permit să integrăm crearea de date sintetice în fluxul nostru de lucru. Îmi place să utilizez API-urile, deoarece îmi permit să personalizez crearea de date sintetice pentru un anumit caz de utilizare.

Puteți discuta despre unele dintre uneltele oferite de Gretel pentru a ajuta la evaluarea calității datelor sintetice?

După crearea datelor sintetice, Gretel va genera un raport sintetic. În acest raport, puteți vedea Scorul de calitate a datelor sintetice (SQS), precum și un grad de protecție a confidențialității (PPL).

Scorul SQS este o estimare a modului în care datele sintetice generate mențin aceleași proprietăți statistice ca și setul de date original. În acest sens, scorul SQS poate fi considerat un scor de utilitate sau un scor de încredere cu privire la faptul că concluziile științifice desprinse din setul de date sintetice ar fi aceleași dacă s-ar fi utilizat setul de date original.

Scorul de calitate a datelor sintetice este calculat prin combinarea metricilor de calitate individuale: Stabilitatea distribuției câmpurilor, Stabilitatea corelației câmpurilor și Stabilitatea structurii profunde.

Stabilitatea distribuției câmpurilor este o măsură a modului în care datele sintetice mențin aceleași distribuții de câmpuri ca și în datele originale. Stabilitatea corelației câmpurilor este o măsură a modului în care corelațiile dintre câmpuri au fost menținute în datele sintetice. În cele din urmă, Stabilitatea structurii profunde măsoară integritatea statistică a distribuțiilor și corelațiilor multifuncționale mai profunde. Pentru a estima acest lucru, Gretel compară o analiză a componentelor principale (PCA) calculată mai întâi pe datele originale, apoi din nou pe datele sintetice.

Cum funcționează filtrele de confidențialitate Gretel?

Filtrele de confidențialitate Gretel au fost rezultatul unei cercetări ample asupra naturii atacurilor adverse asupra datelor sintetice. Filtrele de confidențialitate previn crearea de date sintetice cu slăbiciuni comune exploatate de adversari. Avem două filtre de confidențialitate, primul fiind filtrul de similaritate, iar al doilea fiind filtrul de outlier. Filtrul de similaritate previne crearea de înregistrări sintetice care sunt prea asemănătoare cu o înregistrare de antrenament. Acestea sunt ținte principale ale adversarilor care încearcă să obțină informații despre datele originale. Al doilea filtru de confidențialitate este filtrul de outlier. Acesta previne crearea de înregistrări sintetice care ar fi considerate outlier în spațiul definit de datele de antrenament. Outlier-urile dezvăluite într-un set de date sintetic pot fi exploatate de atacurile de inferență a apartenenței, inferența atributelor și o varietate largă de alte atacuri adverse. Ele reprezintă un risc grav de confidențialitate.

Cum pot datele sintetice ajuta la reducerea bias-ului în IA?

Tehnica cea mai comună este de a aborda bias-ul reprezentativ al datelor care alimentează un sistem IA. De exemplu, dacă există un dezechilibru puternic de clasă în datele dvs. sau dacă există un bias demografic în datele dvs., Gretel oferă unelte pentru a măsura mai întâi dezechilibrul și apoi pentru a-l rezolva în datele sintetice. Prin înlăturarea bias-ului din date, adesea înlăturați și bias-ul din sistemul IA construit pe aceste date.

Dvs. păreți să vă bucurați învățând despre noi tehnologii de învățare automată, cum vă țineți la curent cu toate schimbările?

Citesc, citesc și apoi citesc încă o dată, lol! Îmi place să încep ziua citind despre noi tehnologii de învățare automată. Medium-ul mă cunoaște atât de bine. Îmi place să citesc articole în Towards Data Science, Analytics Vidhya și buletine de știri precum The Sequence. Facebook (META ) AI, Google (GOOGL ) AI și OpenMined au bloguri excelente. Există o mulțime de conferințe bune de urmat, cum ar fi NeurIPS, ICML, ICLR, AISTATS.

Îmi place, de asemenea, uneltele care urmăresc traseele de citare, care vă ajută să găsiți articole similare cu cele pe care le place și care se familiarizează cu interesele dvs. specifice și care sunt întotdeauna în alertă pentru un articol care v-ar putea interesa. Zeta Alpha este un astfel de instrument pe care îl folosesc mult.

În cele din urmă, nu puteți subestima beneficiul de a avea colegi cu interese similare. La Gretel, echipa noastră de învățare automată urmărește articolele de cercetare relevante pentru domeniile pe care le explorăm și adesea ne întâlnim pentru a discuta articole interesante.

Care este viziunea dvs. asupra viitorului învățării automate?

Accesul facil la date va iniția o eră mare de inovație în învățarea automată, care va stimula, la rândul său, inovația într-o gamă largă de domenii, cum ar fi sănătatea, finanțele, producția și biosciences. În mod istoric, multe progrese de bază în învățarea automată pot fi atribuite unui volum mare de date bogate. Cu toate acestea, în mod istoric, multe cercetări au fost împiedicate de imposibilitatea de a accesa sau de a partaja date din cauza problemelor de confidențialitate. Pe măsură ce unelte precum Gretel elimină această barieră, accesul la date va fi democratizat. Întreaga comunitate de învățare automată va beneficia de acces la seturi de date bogate și mari, și nu doar câteva companii mega-elite.

Există altceva pe care ați dori să-l împărtășiți despre Gretel?

Dacă vă place datele, vă va plăcea Gretel (așa că, evident, îmi place Gretel!). Accesul facil la date a fost spina din spinarea fiecărui om de știință al datelor pe care l-am cunoscut vreodată. La Gretel, ne mândrim cu faptul că am creat o consolă și un set de API-uri care fac crearea de date private și partajabile atât de simplă. Credem profund că datele sunt mai valoroase atunci când sunt partajate.

Mulțumim pentru acest interviu minunat și pentru a împărtăși perspectivele dvs., cititorilor care doresc să afle mai multe, le recomandăm să viziteze Gretel.ai.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.