Interviuri
Roshanak Houmanfar, VP de produse de învățare automată la Integrate.ai – Seria de interviuri

Roshanak (Ro) Houmanfar este VP de produse de învățare automată pentru integrate.ai, o companie care ajută dezvoltatorii să rezolve cele mai importante probleme ale lumii fără a pune în pericol datele sensibile. Ro are un talent special pentru găsirea de noi moduri de a simplifica conceptele complexe de inteligență artificială și de a le conecta cu nevoile utilizatorilor. Folosind această expertiză, ea se află în fruntea misiunii integrate.ai de a democratiza accesul la tehnologia care îmbunătățește confidențialitatea.
Ce v-a atras inițial către știința datelor și învățarea automată?
Am început călătoria mea în robotică. După ce am experimentat cu diferitele unghiuri ale roboticii și am ars un laborator de sudură, am ajuns la concluzia că sunt mai atrasă de partea de inteligență artificială a domeniului meu, și asta m-a condus către lumea minunată a învățării automate.
Puteți descrie rolul dvs. actual și cum arată o zi obișnuită pentru dvs.?
Sunt VP de produs la integrate.ai, o companie SaaS care ajută dezvoltatorii să rezolve cele mai importante probleme ale lumii fără a pune în pericol datele sensibile. Construim unelte pentru învățarea automată și analize sigure pentru viitorul distribuit al datelor.
În activitatea mea zilnică, lucrez cu echipele noastre din diferite funcții pentru a realiza trei lucruri:
Să gândim viitorul inteligenței și cum putem să-l modelăm astfel încât inteligența să rezolve cele mai critice probleme
Să înțelegem punctele slabe ale clienților noștri și cum putem să inovăm pentru a face munca lor mai impactantă și eficientă.
Să ne asigurăm că viziunea noastră și feedback-ul clienților noștri sunt luate în considerare în dezvoltarea produsului, lucrând colaborativ cu echipele noastre pentru a livra cele mai bune funcții.
Datele sintetice sunt în prezent foarte populare în învățarea automată, dar integrate.ai adoptă o abordare contrariană. Care sunt câteva aplicații în care datele sintetice nu ar fi o opțiune dorită?
Pentru a înțelege când datele sintetice nu sunt cea mai bună soluție, este important să înțelegem mai întâi când sunt ele utile. Datele sintetice sunt utilizate cel mai bine atunci când ținta modelării are o cantitate mică de date reale disponibile sau deloc – de exemplu, în problemele de pornire rece și în antrenarea modelelor pe baza textului și imaginilor. Uneori, pur și simplu nu există suficiente date pentru a antrena un model, ceea ce face ca datele sintetice să fie o soluție bună.
Cu toate acestea, datele sintetice sunt din ce în ce mai mult utilizate în situații în care există suficiente date reale, dar aceste date sunt izolate din cauza reglementărilor privind confidențialitatea, costurilor de centralizare sau altor bariere de interoperabilitate. Acesta este un mod abuziv de a utiliza datele sintetice. În aceste cazuri, este dificil să se determine nivelul corect de abstractizare pentru crearea datelor sintetice, ceea ce duce la date sintetice de calitate scăzută care pot provoca încălcări ale confidențialității sau alte probleme care sunt greu de depistat. În plus, modelele antrenate pe date sintetice nu se compară cu cele antrenate pe date reale de înaltă calitate și granularitate.
Integrate.ai se specializează în oferirea de soluții de învățare federată, puteți descrie ce este învățarea federată?
În învățarea automată tradițională, toate datele de antrenare a modelului trebuie să fie centralizate într-o bază de date. Cu învățarea federată, modelele pot fi antrenate pe seturi de date descentralizate – sau date care se află în două sau mai multe baze de date separate și nu pot fi mutate ușor. Acest lucru funcționează astfel: părți ale unui model de învățare automată sunt antrenate acolo unde se află datele, iar parametrii modelului sunt partajați între seturile de date participante pentru a produce un model global îmbunătățit. Și deoarece nu se mută date în sistem, organizațiile pot antrena modele fără bariere precum reglementări de confidențialitate, securitate sau alte preocupări de centralizare.
În general, datele de antrenare accesibile prin învățarea federată sunt de o calitate mult mai bună, deoarece datele centralizate tind să piardă o parte din granulația lor în favoarea ușurinței de acces într-un singur loc.
Cum poate o întreprindere să identifice cele mai bune cazuri de utilizare pentru învățarea federată?
Învățarea federată este o tehnologie de stivă de învățare automată construită pentru situații în care accesarea datelor sau aducerea lor în infrastructura tradițională de învățare automată cu lacuri de date centralizate este dureroasă. Dacă experimentați una dintre următoarele simptome, învățarea federată este pentru dvs.:
- Ofertați produse inteligente alimentate de analize și învățare automată și nu puteți crea efecte de rețea pentru produsele dvs. pentru că datele sunt deținute de clienții dvs.
- Sunteți implicați în acorduri de servicii master sau acorduri de partajare a datelor pentru a obține acces la date de la partenerii dvs.
- Sunteți implicați în contracte de colaborare cu partenerii dvs., în special în situații în care rezultatul acestor parteneriate de date nu este clar pentru dvs.
- Dețineți o mulțime de date și doriți să le monetizați, dar sunteți îngrijorați de implicațiile pentru reputația dvs.
- Sunteți deja în curs de monetizare a datelor dvs., dar cheltuiți mult timp, efort și bani pentru a face datele sigure pentru partajare.
- Infrastructura dvs. a fost lăsată în urmă în timpul migrației către cloud, dar aveți nevoie în continuare de analize și învățare automată.
- Aveți filiale care aparțin aceleiași organizații, dar nu puteți partaja direct date cu ele.
- Seturile de date cu care lucrați sunt prea mari sau costisitoare pentru a fi mutate, așa că ați decis să nu le utilizați sau conductele dvs. ETL vă costă mult.
- Aveți o aplicație sau o oportunitate pe care credeți că ar putea avea un impact semnificativ, dar nu aveți datele necesare pentru a face acest lucru.
- Modelele dvs. de învățare automată au atins un platou și nu știți cum să le îmbunătățiți mai departe.
Confidențialitatea diferențială este adesea utilizată în conjuncție cu învățarea federată, ce este aceasta în mod specific?
Confidențialitatea diferențială este o tehnică pentru a asigura confidențialitatea în timp ce se valorifică puterea învățării automate. Folosind matematică diferită de tehnicile standard de deidentificare, confidențialitatea diferențială adaugă zgomot în timpul antrenării locale a modelului, păstrând majoritatea caracteristicilor statistice ale setului de date, în timp ce limitează riscul ca datele individuale să fie identificate.
În implementările ideale, confidențialitatea diferențială aduce riscul aproape de zero, în timp ce modelele de învățare automată mențin performanțe similare – oferind toată securitatea necesară pentru deidentificarea datelor, fără a reduce calitatea rezultatelor modelului.
Confidențialitatea diferențială este inclusă în platforma integrate.ai prin default, astfel încât dezvoltatorii să poată fi siguri că datele individuale nu pot fi deduse din parametrii modelului.
Puteți descrie cum funcționează platforma de învățare federată integrate.ai?
Platforma noastră utilizează tehnologii de învățare federată și confidențialitate diferențială pentru a debloca o gamă de capacități de învățare automată și analize pe date care ar fi altfel dificil de accesat din cauza problemelor de confidențialitate, confidențialitate sau tehnice. Operațiunile precum antrenarea modelului și analizele sunt efectuate local, iar doar rezultatele finale sunt agregate într-un mod sigur și confidențial.
Integrate.ai este ambalat ca un instrument pentru dezvoltatori, permițându-le să integreze aceste capacități în aproape orice soluție cu un kit de dezvoltare software (SDK) ușor de utilizat și un serviciu de cloud pentru gestionarea de la capăt la capăt. Odată ce platforma este integrată, utilizatorii finali pot colabora peste seturi de date sensibile, în timp ce custodienii datelor păstrează controlul deplin. Soluțiile care incorporează integrate.ai pot servi atât ca unelte de experimentare eficiente, cât și ca servicii gata de producție.
Care sunt exemple de moduri în care această platformă poate fi utilizată în diagnostice de precizie?
Una dintre rețelele de parteneri cu care lucrăm, Inițiativa de partajare a informațiilor despre autism, colectează informații legate de diagnosticele autismului, precum și mostre de date genetice pentru a înțelege legăturile dintre diferitele genotipuri și fenotipuri și diagnosticele autismului. Fiecare site de date individual nu are suficiente seturi de date pentru a face ca modelele de învățare automată să funcționeze, dar colectiv ele creează un volum semnificativ de date. Cu toate acestea, mutarea datelor prezintă un risc ridicat pentru securitate și confidențialitate, iar din cauza reglementărilor și politicilor spitalelor, aceste institute de cercetare au recurs întotdeauna la nepartajarea.
Într-o altă rețea, cu o configurație similară, cercetătorii sunt interesați să îmbunătățească asignarea studiilor clinice pacienților utilizând o perspectivă mai holistică asupra istoricului fiecărui pacient.
Diferitele institute de cercetare implicate au acces la informații diferite despre fiecare pacient – un laborator are acces la scanările medicale, alt laborator are acces la informațiile genetice, iar un alt institut are rezultatele studiilor clinice. Cu toate acestea, aceste organizații diferite nu pot partaja direct informații unele cu altele.
Prin soluția integrate.ai, fiecare organizație poate accesa datele celorlalte pentru obiectivele lor fără a muta datele de la custodii și, prin urmare, respectând politicile lor interne.
Puteți discuta despre importanța făcutului confidențialității mai ușor de înțeles și cum integrate.ai permite acest lucru?
Făcând confidențialitatea mai ușor de înțeles, se deschid multe uși către afaceri și organizații care istoric au fost închise din cauza naturii ambigue a riscului. Reglementările de confidențialitate precum GDPR, CCPA și HIPAA sunt incredibil de complexe și pot varia în funcție de industrie, regiune și tip de date, făcând dificil pentru organizații să determine care proiecte de date sunt sigure din punct de vedere al confidențialității. În loc să irosiți timp și personal verificând fiecare căsuță, platforma de învățare federată integrate.ai oferă confidențialitate diferențială încorporată, criptare omomorfică și computație multi-parte sigură, astfel încât dezvoltatorii și custodienii datelor să poată fi liniștiți, știind că proiectele lor vor respecta automat cerințele reglementare, fără a trebui să sară prin fiecare buclă categorică.
Există altceva pe care ați dori să-l împărtășiți despre integrate.ai?
Soluția integrate.ai este un instrument incredibil de prietenos pentru dezvoltatori, care permite învățarea automată și analize conforme, care păstrează confidențialitatea și securitatea pe date sensibile. Prin intermediul unor API-uri simple de utilizat, toată complexitatea conformității cu reglementările și contractelor pe date sensibile este abstractizată. Soluția integrate.ai permite oamenilor de știință din domeniul datelor și dezvoltatorilor de software să-și gestioneze încărcăturile de muncă în siguranță, cu un impact minim asupra infrastructurii și fluxurilor de lucru actuale.
Mulțumim pentru acest interviu minunat, cititorilor care doresc să afle mai multe despre integrate.ai.












