Interviews
Roshanak Houmanfar, VP for Maskinlæringsprodukter hos Integrate.ai – Interviewsammenhæng

Roshanak (Ro) Houmanfar er VP for maskinlæringsprodukter hos integrate.ai, et selskap som hjelper utviklere med å løse verdens viktigste problemer uten å risikere følsomme data. Ro har en særlig evne til å finne nye måter å forenkle komplekse AI-konsepter og knytte dem til brukernes behov. Ved å utnytte denne ekspertisen, er hun i forkant av integrate.ai’s misjon om å demokratisere tilgangen til teknologi som beskytter personvern.
Hva var det som først tiltalte deg om datavitenskap og maskinlæring?
Jeg startet min reise i robotikk. Etter å ha eksperimentert med ulike aspekter av robotikk og å ha brent ned et sveise-laboratorium, kom jeg til slutsatsen at jeg var mer tiltalt av den kunstige intelligensen-siden av mitt felt, og det ledet meg til den vidunderlige verden av maskinlæring.
Kan du beskrive din nåværende rolle og hva en gjennomsnittlig dag ser ut for deg?
Jeg er VP for Produkt hos integrate.ai, et SaaS-selskap som hjelper utviklere med å løse verdens viktigste problemer uten å risikere følsomme data. Vi bygger verktøy for maskinlæring og analyse som er trygge for personvern og distribuert fremtid for data.
I min dag-til-dag arbeider jeg med våre team over funksjoner for å oppnå tre ting:
Tenke gjennom hva fremtiden for intelligens kan se ut og hvordan vi kan forme denne fremtiden så at intelligensen løser de viktigste problemene
Forstå våre kunders smertepunkter og hvordan vi kan innovere for å gjøre deres arbeid mer effektivt og påvirkelig.
Sikre at vår visjon og kundetilbakemelding alltid tas i betraktning i produktutvikling, og arbeide samarbeidende med våre team for å levere de beste funksjonene.
SYntetisk data er for tiden alle sammen om maskinlæring, men integrate.ai tar en litt annen tilnærming. Hva er noen anvendelser hvor syntetisk data kanskje ikke er et ønskelig alternativ?
For å forstå når syntetisk data ikke er den beste løsningen, er det viktig å forstå når det er. Syntetisk data er best brukt når målet for modelleringen har enten en liten mengde ekte data tilgjengelig eller ingen i det hele tatt – for eksempel i problemer med kald start og tekst- og bildebasert modelltrening. Noen ganger er det bare ikke nok data tilgjengelig for å trene en modell, og det er når syntetisk data skinner som en løsning.
Men syntetisk data brukes stadig oftere i situasjoner hvor det finnes mye ekte data, men denne data er isolert på grunn av personvernregler, sentraliseringskostnader eller andre barrierer for samarbeid. Dette er en åpenbart misbruk av syntetisk data. I disse tilfellene er det vanskelig å bestemme riktig nivå av abstraksjon for syntetisk dataopprettelse, noe som resulterer i lavkvalitets syntetisk data som kan forårsake innebygget bias eller andre problemer som er vanskelige å feilsøke. I tillegg er modeller trent på syntetisk data ikke like gode som de som er trent på ekte, høykvalitets, granulerte kilde-data.
Integrate.ai spesialiserer seg på å tilby fødererte læringsløsninger, kan du beskrive hva føderert læring er?
I tradisjonell maskinlæring må all modelltrening-data være sentralisert i en database. Med føderert læring kan modeller trene på desentraliserte, distribuerte datasett – eller data som befinner seg i to eller flere separate databaser og ikke kan flyttes lett. Hvordan det fungerer er at deler av en maskinlæringsmodell trenes der dataene er plassert, og modellparametre deles blant deltakende datasett for å produsere en forbedret global modell. Og siden ingen data flyttes innenfor systemet, kan organisasjoner trene modeller uten hindringer som personvern og sikkerhetsregler, kostnader eller andre sentraliseringsproblemer.
Generelt er treningdata tilgjengelig med føderert læring av mye høyere kvalitet, siden sentralisert data tenderer til å tape noe av sin granularitet til fordel for lett tilgang i ett sted.
Hvordan kan en bedrift identifisere de beste bruksområdene for føderert læring?
Føderert læring er en maskinlærings-teknologi bygget for situasjoner hvor tilgang til data eller å bringe det inn i den tradisjonelle infrastrukturen for maskinlæring med sentraliserte data-sjøer er smertefullt. Hvis du opplever ett av følgende symptom, er føderert læring for deg:
- Du tilbyr smarte produkter drevet av analyser og maskinlæring, og du kan ikke skape nettverkseffekter for dine produkter fordi dataene eies av dine kunder.
- Du arbeider gjennom lange tjenesteavtaler eller data-delingsavtaler for å få tilgang til data fra dine partnere.
- Du bruker mye tid på å danne samarbeidskontrakter med dine partnere, spesielt i situasjoner hvor resultatet av denne datapartnerskapet er uklart for deg.
- Du sitter på en rikdom av data og ønsker å montere dine datasett, men du er redd for implikasjonene for din omdømme.
- Du moneterer allerede dine data, men du bruker mye tid, innsats og penger på å gjøre dataene trygge til deling.
- Din infrastruktur har blitt latt tilbake under overgangen til skyen, men du trenger fortsatt analyser og maskinlæring.
- Du har mange datterselskaper som tilhører samme organisasjon, men de kan ikke dele data direkte med hverandre.
- Datasettene du arbeider med er for store eller dyre å flytte, så du har enten bestemt deg for ikke å bruke dem eller dine ETL-pipelines koster deg mye.
- Du har en applikasjon eller mulighet som du tror kan ha en betydelig innvirkning, men du har ikke dataene selv for å gjøre det skje.
- Dine maskinlæringsmodeller har nådd en platå og du vet ikke hvordan du kan forbedre dem videre.
Differensialt personvern er ofte brukt i sammenheng med føderert læring, hva er dette spesifikt?
Differensialt personvern er en teknikk for å sikre personvern samtidig som det utnytter kraften av maskinlæring. Ved å bruke annen matematikk enn standard de-identifiserings-teknikker, legger differensialt personvern til støy under lokal modelltrening, og bevare de fleste av datasettets statistiske egenskaper samtidig som det begrenser risikoen for at enkeltpersoners data kan identifiseres.
I ideelle implementeringer bringer differensialt personvern risikoen nær null, mens maskinlæringsmodellene opprettholder lignende ytelse – og gir all den nødvendige sikkerheten for data-deidentifikasjon, uten å redusere kvaliteten på modellresultatene.
Differensialt personvern er inkludert i integrate.ai‘s plattform som standard, så utviklere kan sikre at enkeltdata ikke kan gjettes fra deres modellparametre.
Kan du beskrive hvordan integrate.ai’s fødererte læringsplattform fungerer?
Vår plattform utnytter føderert læring og differensialt personvernsteknologi for å låse opp en rekke maskinlærings- og analysekapasiteter på data som ellers ville være vanskelige eller umulige å nå på grunn av personvern, konfidensialitet eller tekniske hindringer. Operasjoner som modelltrening og analyser utføres lokalt, og bare slutresultatene samles inn på en sikker og konfidensiell måte.
integrate.ai er pakket som et utviklerverktøy, som gjør det mulig for utviklere å integrere disse kapasitetene i nesten alle løsninger med et enkelt å bruke software-utviklingskit (SDK) og en støttende skytjeneste for sluttpunkt-til-sluttpunkt-håndtering. Når plattformen er integrert, kan sluttbrukere samarbeide over følsomme datasett mens dataforvaltere beholder full kontroll. Løsninger som inkorporerer integrate.ai kan fungere som både effektive eksperimenteringsverktøy og produksjonsklare tjenester.
Hva er noen eksempler på hvordan denne plattformen kan brukes i presisjonsdiagnostikk?
En av nettverkene av partnere vi arbeider med, Autism Sharing Initiative, samler informasjon relatert til autismediagnostikk samt prøver av genomdata for å forstå sammenhengene mellom de ulike genotypene og fenotypene og autismediagnoser. Hver enkelt dataside har ikke nok datasett for å gjøre maskinlæringsmodellene fungere, men kollektivt skaper de en meningsfull stikkprøvestørrelse. Men å flytte data utgjør en høy risiko for sikkerhet og personvern, og på grunn av regler og sykehuspolitikk, har disse forskningsinstitusjonene alltid valgt å ikke dele.
I et annet nettverk, med en lignende oppsett, er forskerne interessert i å forbedre tildelingen av kliniske prøver til pasienter ved å bruke en mer helhetlig visning av hver pasients historie.
De ulike forskningsinstitusjonene som er involvert, har tilgang til ulik informasjon om hver pasient – ett laboratorium har tilgang til deres medisinske skanninger, ett annet laboratorium har tilgang til deres genetiske informasjon, og ett annet institutt har deres kliniske prøveresultater. Men disse ulike organisasjonene kan ikke dele informasjon direkte med hverandre.
Med integrate.ai-løsningen kan hver organisasjon få tilgang til hverandres data for sine mål uten å flytte dataene vekk fra dataforvalterne og dermed overholde deres interne politikker.
Kan du diskutere viktigheten av å gjøre personvern forståelig og hvordan integrate.ai muliggjør dette?
Å gjøre personvern forståelig åpner mange dører for bedrifter og organisasjoner som historisk har vært stengt på grunn av den tvetydige naturen av risikoen. Personvernregler som GDPR, CCPA og HIPPA er usedvanlig komplekse og kan variere avhengig av bransje, region og type data, noe som gjør det vanskelig for organisasjoner å bestemme hva data-prosjekter som er personvern-sikre. I stedet for å sløse tid og mannskraft på å sjekke hver enkelt boks, tilbyr integrate.ai’s fødererte læringsplattform innebygget differensialt personvern, homomorf kryptering og sikker multi-part-samarbeid, så utviklere og dataforvaltere kan sove trygt i den viten at deres prosjekter vil automatisk overholde regulatoriske krav, uten å måtte hoppe gjennom hver enkelt kategori.
Er det noe annet du ønsker å dele om integrate.ai?
integrate.ai’s løsning er et usedvanlig utvikler-vennlig verktøy som tillater kompatibelt, personvern-beskyttende og sikker maskinlæring og analyse på toppen av følsomme datakilder. Gjennom enkle å bruke API-er, abstraheres all kompleksitet av regulatorisk overholdelse og kontrakter på toppen av følsomme data vekk. integrate.ai’s løsning lar data-vitenskapsmenn og programvare-utviklere håndtere sine arbeidsbyrder trygt med minimal innvirkning på deres nåværende infrastruktur og arbeidsflyt.
Takk for det flotte intervjuet, lesere som ønsker å lære mer, bør besøke integrate.ai.












