Intervjuer
Roshanak Houmanfar, VP för maskinläringsprodukter på Integrate.ai – Intervjuserie

Roshanak (Ro) Houmanfar är VP för maskinläringsprodukter på integrate.ai, ett företag som hjälper utvecklare att lösa världens viktigaste problem utan att riskera känsliga data. Ro har en särskild fallenhet för att hitta nya sätt att förenkla komplexa AI-koncept och koppla dem till användarnas behov. Med denna expertis är hon i framkant av integrate.ai:s mission att demokratisera tillgången till teknik som förbättrar sekretessen.
Vad var det som initialt drog dig till data science och maskinlärning?
Jag började min resa inom robotteknik. Efter att ha experimenterat med olika aspekter av robotteknik och bränt ner ett svetslaboratorium, kom jag till slutsatsen att jag var mer intresserad av den konstgjorda intelligenssidan av mitt område, och det ledde mig till den underbara världen av maskinlärning.
Kan du beskriva din nuvarande roll och vad en genomsnittlig dag ser ut för dig?
Jag är VP för Produkt på integrate.ai, ett SaaS-företag som hjälper utvecklare att lösa världens viktigaste problem utan att riskera känsliga data. Vi bygger verktyg för maskinlärning och analys som är säkra för sekretessen och för den distribuerade framtiden för data.
I min dagliga verksamhet arbetar jag med våra team över funktioner för att uppnå tre saker:
Att tänka igenom vad framtiden för intelligens kan se ut och hur vi kan forma den framtiden så att intelligensen löser de mest kritiska problemen
Att förstå våra kunders smärtor och hur vi kan innovativa för att göra deras arbete mer betydelsefullt och effektivt.
Att se till att vår vision och kundfeedback alltid beaktas i produktutvecklingen, och att arbeta samarbetsvilligt med våra team för att leverera de bästa funktionerna.
Artificiell data är för närvarande allt som är på modet inom maskinlärning, men integrate.ai tar en något annorlunda inställning. Vilka är några tillämpningar där artificiell data kanske inte är ett önskvärt alternativ?
För att förstå när artificiell data inte är den bästa lösningen, är det viktigt att först förstå när den är det. Artificiell data används bäst när målet för modelleringen har antingen en liten mängd verklig data tillgänglig eller ingen alls – till exempel i kallstartproblem och text- och bildbaserad modellträning. Ibland finns det helt enkelt inte tillräckligt med data för att träna en modell, vilket är när artificiell data lyser som en lösning.
Men artificiell data används alltmer i situationer där det finns gott om verklig data, men den data är isolerad på grund av sekretessregler, centraliseringskostnader eller andra interoperabilitetsproblem. Detta är en flagrant missbruk av artificiell data. I dessa användningsfall är det svårt att bestämma rätt nivå av abstraktion för skapande av artificiell data, vilket resulterar i lågkvalitativ artificiell data som kan orsaka medfödd bias eller andra problem längre fram som är svåra att felsöka. Dessutom är modeller som tränats på artificiell data inte lika bra som de som tränats på verklig, högkvalitativ, granulär källdata.
Integrate.ai specialiserar sig på att erbjuda federerad inlärning, kan du beskriva vad federerad inlärning är?
I traditionell maskinlärning måste all modellträningsdata centraliseras i en databas. Med federerad inlärning kan modeller träna på decentraliserade, distribuerade dataset – eller data som finns i två eller flera separata databaser och inte kan flyttas lätt. Hur det fungerar är att delar av en maskinlärningsmodell tränas där data finns, och modellparametrar delas mellan deltagande dataset för att producera en förbättrad global modell. Och eftersom ingen data flyttas inom systemet, kan organisationer träna modeller utan hinder som sekretess- och säkerhetsregler, kostnader eller andra centraliseringsproblem.
Generellt är den tillgängliga träningsdata med federerad inlärning av mycket högre kvalitet, eftersom centraliserad data tenderar att förlora något av sin granularitet till förmån för lättillgänglighet på en plats.
Hur identifierar ett företag de bästa användningsfallen för federerad inlärning?
Federerad inlärning är en maskinlärningsteknologi som är byggd för situationer där tillgång till data eller att flytta den till den traditionella maskinlärningsinfrastrukturen med centraliserade datalager är smärtsamt. Om du upplever något av följande symtom, är federerad inlärning för dig:
- Du tillhandahåller smarta produkter som drivs av analys och maskinlärning, och du kan inte skapa nätverkseffekter för dina produkter eftersom data ägs av dina kunder.
- Du arbetar med långa huvudtjänsteavtal eller dataöverföringsavtal för att få tillgång till data från dina partners.
- Du lägger mycket tid på att bilda samarbetskontrakt med dina partners, särskilt i situationer där resultatet av denna datapartnerskap är oklart för dig.
- Du sitter på en rikedom av data och vill monetisera dina dataset, men du är rädd för konsekvenserna för din rykte.
- Du monetiserar redan din data, men du lägger mycket tid, ansträngning och pengar på att göra data säker att dela.
- Din infrastruktur har blivit kvar i den gamla världen under övergången till molnet, men du behöver fortfarande analys och maskinlärning.
- Du har många dotterbolag som tillhör samma organisation, men de kan inte direkt dela data med varandra.
- De dataset du arbetar med är för stora eller dyra att flytta, så du har antingen bestämt dig för att inte använda dem eller dina ETL-pipelines kostar dig mycket.
- Du har en applikation eller möjlighet som du tror kan ha en betydande inverkan, men du har inte själv data för att göra det hända.
- Dina maskinlärningsmodeller har nått en platå och du vet inte hur du ska förbättra dem ytterligare.
Differentiell sekretess används ofta i samband med federerad inlärning, vad är detta specifikt?
Differentiell sekretess är en teknik för att säkerställa sekretess samtidigt som den utnyttjar kraften i maskinlärning. Med hjälp av annan matematik än standardavidentifieringstekniker, lägger differentiell sekretess till brus under lokal modellträning, bevarar de flesta av datasetets statistiska egenskaper samtidigt som den begränsar risken att en enskilds data kan identifieras.
I ideala implementationer bringar differentiell sekretess risken nära noll, medan maskinlärningsmodellerna behåller liknande prestanda – vilket ger all den säkerhet som behövs för datadeidentifiering, utan att reducera kvaliteten på modellresultaten.
Differentiell sekretess är inkluderad i integrate.ai:s plattform som standard, så utvecklare kan säkerställa att enskild data inte kan härledas från deras modellparametrar.
Kan du beskriva hur integrate.ai:s federerade inlärningsplattform fungerar?
Vår plattform utnyttjar federerad inlärning och differentiell sekretess för att låsa upp en mängd maskinlärnings- och analysfunktioner på data som annars skulle vara svåra eller omöjliga att komma åt på grund av sekretess-, konfidentialitets- eller tekniska hinder. Operationer som modellträning och analys utförs lokalt, och endast slutresultaten sammanställs på ett säkert och konfidentiellt sätt.
integrate.ai är paketerat som ett utvecklarverktyg, som möjliggör för utvecklare att sömlöst integrera dessa funktioner i nästan vilken lösning som helst med ett lättanvänt SDK och en molntjänst för hantering från slut till slut. När plattformen är integrerad kan slutanvändare samarbeta över känsliga dataset medan dataägare behåller full kontroll. Lösningar som integrerar integrate.ai kan fungera som både effektiva experimentverktyg och produktionsklara tjänster.
Vilka är några exempel på hur denna plattform kan användas inom precisionsdiagnostik?
En av de nätverk av partners vi arbetar med, Autism Sharing Initiative, samlar in information relaterad till autismdiagnostik samt prover av genombaserad data för att förstå sambanden mellan olika genotyper och fenotyper och autismdiagnoser. Varje enskild datasite har inte tillräckligt med dataset för att göra maskinlärningsmodellerna fungera, men kollektivt skapar de en meningsfull storlek. Men att flytta data utgör en hög risk för säkerhet och sekretess, och på grund av regler och sjukhuspolicyer har dessa forskningsinstitut alltid som standard valt att inte dela.
I ett annat nätverk, med en liknande uppsättning, är forskare intresserade av att förbättra tilldelningen av kliniska prövningar till patienter med en mer holistisk vy av varje patients historia.
De olika forskningsinstituten som är inblandade har tillgång till varierande information om varje patient – ett laboratorium har tillgång till deras medicinska skanningar, ett annat laboratorium har tillgång till deras genetiska information, och ett annat institut har deras kliniska prövningsresultat. Men dessa olika organisationer kan inte direkt dela information med varandra.
Med integrate.ai-lösningen kan varje organisation komma åt varandras data för sina mål utan att flytta data från dataägare och därmed följa deras interna policyer.
Kan du diskutera vikten av att göra sekretess begriplig och hur integrate.ai möjliggör detta?
Att göra sekretess begriplig innebär att öppna många dörrar för företag och organisationer som historiskt har varit stängda på grund av den oklara naturen av risken. Sekretessregler som GDPR, CCPA och HIPPA är otroligt komplexa och kan variera beroende på bransch, region och datatyp, vilket gör det svårt för organisationer att avgöra vilka dataprojekt som är sekretesssäkra. Istället för att slösa tid och personal på att kontrollera varje ruta, erbjuder integrate.ai:s federerade inlärningsplattform inbyggd differentiell sekretess, homomorf kryptering och säker multiparti-beräkning, så utvecklare och dataägare kan sova gott med vetskapen att deras projekt kommer att följa regleringskraven automatiskt, utan besväret med att hoppa genom varje kategorisk hål.
Finns det något annat du vill dela om integrate.ai?
integrate.ai:s lösning är ett otroligt utvecklarvänligt verktyg som möjliggör efterlevnad, sekretessbevarande och säker maskinlärning och analys på känsliga datakällor. Genom enkla API:er abstraheras all komplexitet kring regleringsefterlevnad och kontrakt på känsliga data bort. integrate.ai:s lösning möjliggör för dataforskare och mjukvaruutvecklare att hantera sina arbetsbelastningar på ett säkert sätt med minimal påverkan på deras nuvarande infrastruktur och arbetsflöden.
Tack för den underbara intervjun, läsare som vill veta mer bör besöka integrate.ai.












