Intervjuer

Roshanak Houmanfar, VP for maskinlæringsprodukter i Integrate.ai – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Roshanak (Ro) Houmanfar er VP for maskinlæringsprodukter i integrate.ai, et selskap som hjelper utviklere med å løse verdens viktigste problemer uten å risikere sensitive data. Ro har en spesiell evne til å finne nye måter å forenkle komplekse AI-konsepter og knytte dem til brukerbehov. Ved å utnytte denne ekspertisen, er hun i forkant av integrate.ai’s misjon om å demokratisere tilgangen til teknologi som beskytter personvernet.

Hva var det som først tiltalte deg om datavitenskap og maskinlæring?

Jeg startet min reise i robotikk. Etter å ha eksperimentert med ulike aspekter av robotikk, og brent ned et sveise-laboratorium, kom jeg til slutsatsen at jeg var mer tiltalt av den kunstige intelligensen-siden av mitt felt, og det ledet meg til den fantastiske verden av maskinlæring.

Kan du beskrive din nåværende rolle og hva en gjennomsnittlig dag ser ut for deg?

Jeg er VP for produkt i integrate.ai, et SaaS-selskap som hjelper utviklere med å løse verdens viktigste problemer uten å risikere sensitive data. Vi bygger verktøy for sikker maskinlæring og analyse for den distribuerte fremtiden av data.

I min dag-til-dag arbeider jeg med våre team over funksjoner for å oppnå tre ting:

Tenke gjennom hva fremtiden av intelligens kan se ut og hvordan vi kan forme denne fremtiden så at intelligensen løser de viktigste problemene

Forstå våre kunders smertepunkter og hvordan vi kan innovere for å gjøre deres arbeid mer effektivt og innvirkning.

Sikre at vår visjon og kunde-tilbakemelding alltid tas i betraktning i produktutvikling, og arbeide samarbeidende med våre team for å levere de beste funksjonene.

Syntetisk data er for tiden alle sammen om maskinlæring, men integrate.ai tar en litt contrarian-tilnærming. Hva er noen anvendelser hvor syntetisk data kanskje ikke er et ønskelig alternativ?

For å forstå når syntetisk data ikke er den beste løsningen, er det viktig å først forstå når det er. Syntetisk data er best brukt når målet for modelleringen har enten en liten mengde ekte data tilgjengelig eller ingen i det hele tatt – for eksempel i kalde-start-problemer og tekst- og bilde-basert modelltrening. Noen ganger finnes det bare ikke nok data for å trene en modell, og det er når syntetisk data skinner som en løsning.

Men syntetisk data brukes stadig oftere i situasjoner hvor det finnes mye ekte data, men denne data er isolert på grunn av personvernsreguleringer, sentraliseringskostnader eller andre samarbeids-hindringer. Dette er en åpenbart misbruk av syntetisk data. I disse tilfellene er det vanskelig å bestemme riktig nivå av abstraksjon for syntetisk data-opprettelse, noe som resulterer i lavkvalitets syntetisk data som kan forårsake innfødt bias eller andre problemer nedover linjen som er vanskelige å feilsøke. I tillegg er modeller trenet på syntetisk data ikke like effektive som de som er trenet på ekte, høykvalitets, granulerte kilde-data.

Integrate.ai spesialiserer seg på å tilby fødererte læringsløsninger, kan du beskrive hva føderert læring er?

I tradisjonell maskinlæring må all modell-trening-data være sentralisert i en database. Med føderert læring kan modeller trenes på desentraliserte, distribuerte datasett – eller data som befinner seg i to eller flere separate databaser og ikke kan flyttes lett. Hvordan det fungerer er at deler av en maskinlæringsmodell trenes der dataene befinner seg, og modell-parametere deles blant deltager-datasett for å produsere en forbedret global modell. Og siden ingen data flyttes innenfor systemet, kan organisasjoner trenere modeller uten hindringer som personvern og sikkerhetsreguleringer, kostnader eller andre sentraliserings-problemer.

Generelt er trening-data tilgjengelig med føderert læring av mye høyere kvalitet, siden sentralisert data ofte mister noe av sin granularitet på bekostning av lett tilgang i ett sted.

Hvordan kan et foretak identifisere de beste bruksområdene for føderert læring?

Føderert læring er en maskinlærings-teknologi bygget for situasjoner hvor tilgang til data eller å bringe det inn i den tradisjonelle infrastrukturen av maskinlæring med sentraliserte data-sjøer er smertefullt. Hvis du opplever ett av følgende symptom, er føderert læring for deg:

  • Du tilbyr smarte produkter drevet av analyser og maskinlæring, og du kan ikke skape nettverkseffekter for dine produkter fordi dataene eies av dine kunder.
  • Du arbeider gjennom lange hovedtjenestekontrakter eller data-delingsavtaler for å få tilgang til data fra dine partnere.
  • Du bruker mye tid på å danne samarbeidskontrakter med dine partnere, spesielt i situasjoner hvor resultatet av denne data-partneren er uklart for deg.
  • Du sitter på en rikdom av data og ønsker å monovere dine datasett, men du er redd for implikasjonene for din omdømme.
  • Du monorerer allerede dine data, men du bruker mye tid, anstrengelse og penger på å gjøre dataene trygge til deling.
  • Din infrastruktur har blitt forlatt under overgangen til skyen, men du trenger fortsatt analyser og maskinlæring.
  • Du har mange datterselskaper som tilhører samme organisasjon, men de kan ikke dele data direkte med hverandre.
  • Datasettene du arbeider med er for store eller dyre å flytte, så du har enten bestemt deg for ikke å bruke dem eller dine ETL-pipelines koster deg mye.
  • Du har en applikasjon eller en mulighet som du tror kan ha en betydelig innvirkning, men du har ikke dataene selv for å gjøre det skje.
  • Dine maskinlæringsmodeller har nådd en platå og du vet ikke hvordan du kan forbedre dem videre.

Differensialt personvern er ofte brukt i sammenheng med føderert læring, hva er dette spesifikt?

Differensialt personvern er en teknikk for å sikre personvern samtidig som det utnytter kraften av maskinlæring. Ved å bruke annen matematikk enn standard de-identifiserings-teknikker, legger differensialt personvern til støy under lokal modell-trening, og bevarer mesteparten av datasettets statistiske egenskaper samtidig som det begrenser risikoen for at enkeltpersoners data kan identifiseres.

I ideelle implementeringer bringer differensialt personvern risikoen nær null, mens maskinlæringsmodellene beholder lignende ytelse – og gir all den nødvendige sikkerheten for data-deidentifisering, uten å redusere kvaliteten på modell-resultatene.

Differensialt personvern er inkludert i integrate.ai‘s plattform som standard, så utviklere kan sikre at enkelt-personers data ikke kan gjettes fra modell-parametere.

Kan du beskrive hvordan integrate.ai’s fødererte læringsplattform fungerer?

Vår plattform utnytter føderert læring og differensialt personvern-teknologier for å låse opp en rekke maskinlærings- og analyse-kapasiteter på data som ellers ville være vanskelige eller umulige å få tilgang til på grunn av personvern, konfidensialitet eller tekniske hindringer. Operasjoner som modell-trening og analyser utføres lokalt, og bare slut-resultatene samles inn på en sikker og konfidensiell måte.

integrate.ai er pakket som et utvikler-verktøy, som gjør det mulig for utviklere å integrere disse kapasitetene i nesten alle løsninger med en enkel å bruke software-utviklings-kit (SDK) og en støttende sky-tjeneste for sluttpunkt-til-sluttpunkt-håndtering. Når plattformen er integrert, kan slutt-brukere samarbeide over sensitive datasett mens data-forvaltere beholder full kontroll. Løsninger som inkorporerer integrate.ai kan fungere som både effektive eksperimenter-verktøy og produksjons-klare tjenester.

Hva er noen eksempler på hvordan denne plattformen kan brukes i presisjons-diagnostikk?

En av nettverkene av partnere vi arbeider med, Autism Sharing Initiative, samler informasjon relatert til autisme-diagnostikk samt prøver av genom-data for å forstå sammenhengene mellom ulike genotyper og fenotyper og autisme-diagnoser. Hver enkelt data-sted har ikke nok datasett for å gjøre maskinlærings-modellene fungere, men kollektivt skaper de en meningsfull stikkprøve-størrelse. Men å flytte data utgjør en høy risiko for sikkerhet og personvern, og på grunn av reguleringer og sykehus-politikk, har disse forsknings-institusjonene alltid valgt å ikke dele.

I et annet nettverk, med en lignende oppsett, er forskerne interessert i å forbedre tildelingen av kliniske forsøk til pasienter ved å bruke en mer helhetlig visning av hver pasients historie.

De ulike forsknings-institusjonene involvert har tilgang til ulik informasjon om hver pasient – ett laboratorium har tilgang til deres medisinske skanninger, et annet laboratorium har tilgang til deres genomiske informasjon, og et annet institutt har deres kliniske forsøks-resultater. Men disse ulike organisasjonene kan ikke dele informasjon direkte med hverandre.

Med integrate.ai-løsningen kan hver organisasjon få tilgang til hverandres data for sine mål uten å flytte dataene vekk fra data-forvaltere og dermed følge deres interne politikker.

Kan du diskutere viktigheten av å gjøre personvern forståelig og hvordan integrate.ai muliggjør dette?

Å gjøre personvern forståelig åpner mange dører til bedrifter og organisasjoner som historisk sett har vært stengt på grunn av den uklare naturen av risikoen. Personvern-reguleringer som GDPR, CCPA og HIPPA er usedvanlig komplekse og kan variere avhengig av bransje, region og type data, noe som gjør det vanskelig for organisasjoner å bestemme hva data-prosjekter som er personvern-sikre. I stedet for å sløse tid og arbeidskraft på å sjekke hver enkelt boks, tilbyr integrate.ai’s fødererte læringsplattform innbygget differensialt personvern, homomorft kryptering og sikker multi-part-utregning, så utviklere og data-forvaltere kan sove trygt i viten om at deres prosjekter vil automatisk overholde regulatoriske krav, uten å måtte hoppe gjennom hver enkelt kategorisk hopp.

Er det noe annet du ønsker å dele om integrate.ai?

integrate.ai’s løsning er et usedvanlig utvikler-vennlig verktøy som gjør det mulig for data-vitenskapsmenn og programvare-utviklere å håndtere sine arbeidsbyrder trygt med minimal innvirkning på deres nåværende infrastruktur og arbeidsflyt. Gjennom enkle å bruke API-er, abstraheres all kompleksiteten av regulatorisk overholdelse og kontrakter på toppen av sensitive data vekk. integrate.ai’s løsning lar data-vitenskapsmenn og programvare-utviklere håndtere sine arbeidsbyrder trygt med minimal innvirkning på deres nåværende infrastruktur og arbeidsflyt. Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke integrate.ai.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.