Interviews

Roshanak Houmanfar, VP van Machine Learning Producten bij Integrate.ai – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Roshanak (Ro) Houmanfar is de VP van machine learning producten voor integrate.ai, een bedrijf dat ontwikkelaars helpt om de meest belangrijke problemen op te lossen zonder gevoelige gegevens te riskeren. Ro heeft een bijzondere gave om complexe AI-concepten te vereenvoudigen en ze te verbinden met gebruikersbehoeften. Met deze expertise staat ze aan de vooravond van de missie van integrate.ai om toegang tot privacy-verhogende technologie te democratiseren.

Wat trok je aanvankelijk aan tot datawetenschap en machine learning?

Ik begon mijn reis in robotica. Na het experimenteren met de verschillende aspecten van robotica en het verbranden van een laslab, kwam ik tot de conclusie dat ik meer aangetrokken werd tot de kunstmatige intelligentiekant van mijn vakgebied, en dat leidde me naar de prachtige wereld van machine learning.

Kunt u uw huidige rol beschrijven en wat een gemiddelde dag voor u eruit ziet?

Ik ben de VP van Product bij integrate.ai, een SaaS-bedrijf dat ontwikkelaars helpt om de meest belangrijke problemen op te lossen zonder gevoelige gegevens te riskeren. We bouwen tools voor privacy-veilige machine learning en analytics voor de gedistribueerde toekomst van gegevens.

In mijn dagelijkse werk, werk ik met onze teams over verschillende functies om drie dingen te bereiken:

Na te denken over hoe de toekomst van intelligentie eruit kan zien en hoe we die toekomst kunnen vormgeven zodat intelligentie de meest kritieke problemen oplost

Het begrijpen van de pijnpunten van onze klanten en hoe we kunnen innoveren om hun werk meer impact en efficiëntie te geven.

Ervoor zorgen dat onze visie en klantfeedback altijd worden meegenomen in productontwikkeling, door samen te werken met onze teams om de beste functies te leveren.

Synthetische gegevens zijn momenteel alle rage in machine learning, maar integrate.ai neemt een beetje een tegenovergestelde benadering. Wat zijn enkele toepassingen waarbij synthetische gegevens mogelijk geen gewenste optie zijn?

Om te begrijpen wanneer synthetische gegevens niet de beste oplossing zijn, is het eerst belangrijk om te begrijpen wanneer ze wel gebruikt worden. Synthetische gegevens worden het beste gebruikt wanneer het modeldoel een kleine hoeveelheid echte gegevens heeft of geen enkele – bijvoorbeeld bij cold-start-problemen en tekst- en afbeeldingsgebaseerde modeltraining. Soms is er gewoon niet genoeg gegevens nodig om een model te trainen, en dat is wanneer synthetische gegevens als oplossing schitteren.

Maar synthetische gegevens worden steeds vaker gebruikt in situaties waarin veel echte gegevens bestaan, maar die gegevens zijn gesloten vanwege privacyreglementen, centralisatiekosten of andere interoperabiliteitsbelemmeringen. Dit is een flagrante misbruik van synthetische gegevens. In deze use cases is het moeilijk om het juiste niveau van abstractie voor synthetische gegevenscreatie te bepalen, waardoor lage kwaliteit synthetische gegevens ontstaan die innate bias of andere problemen kunnen veroorzaken die moeilijk te debuggen zijn. Bovendien zijn modellen getraind op synthetische gegevens niet te vergelijken met die getraind op echte, hoge kwaliteit, granulaire brondata.

Integrate.ai specialiseert zich in het aanbieden van gefedereerde leeroplossingen, kunt u uitleggen wat gefedereerd leren is?

Bij traditionele machine learning moet alle modeltrainingsgegevens centraal in één database worden opgeslagen. Met gefedereerd leren kunnen modellen worden getraind op gedecentraliseerde, gedistribueerde datasets – of gegevens die in twee of meer afzonderlijke databases wonen en niet gemakkelijk kunnen worden verplaatst. Hoe het werkt, is dat delen van een machine learning-model worden getraind waar de gegevens zijn gelegen, en modelparameters worden gedeeld onder deelnemende datasets om een verbeterd globaal model te produceren. En omdat geen gegevens binnen het systeem worden verplaatst, kunnen organisaties modellen trainen zonder belemmeringen zoals privacy- en beveiligingsreglementen, kosten of andere centralisatiezorgen.

Over het algemeen is de trainingsgegevens toegankelijk met gefedereerd leren van veel hogere kwaliteit, omdat gecentraliseerde gegevens de neiging hebben enkele van hun granulariteit te verliezen ten koste van de toegankelijkheid op één locatie.

Hoe kan een onderneming de beste use cases voor gefedereerd leren identificeren?

Federeerd leren is een machine learning-techstack gebouwd voor situaties waarbij toegang tot gegevens of het brengen van gegevens naar de traditionele infrastructuur van machine learning met gecentraliseerde datalakes pijnlijk is. Als u een van de volgende symptomen ervaart, is gefedereerd leren voor u:

  • U biedt slimme producten aan die worden aangedreven door analytics en machine learning en u kunt geen netwerkeffecten creëren voor uw producten omdat de gegevens eigendom zijn van uw klanten.
  • U werkt door langdurige master serviceovereenkomsten of gegevensdelingsovereenkomsten om toegang te krijgen tot gegevens van uw partners.
  • U besteedt veel tijd aan het formeren van samenwerkingscontracten met uw partners, met name in situaties waarin het resultaat van deze datapartnerschap onduidelijk is voor u.
  • U zit op een rijkdom aan gegevens en wilt uw datasets monitoren, maar u bent bang voor de implicaties voor uw reputatie.
  • U monitort uw gegevens al, maar u besteedt veel tijd, moeite en geld om de gegevens veilig te maken om te delen.
  • Uw infrastructuur is achtergebleven tijdens de overgang naar de cloud, maar u heeft nog steeds analytics en machine learning nodig.
  • U heeft veel dochterondernemingen die tot dezelfde organisatie behoren, maar die geen gegevens rechtstreeks met elkaar kunnen delen.
  • De datasets waar u mee werkt zijn te groot of te duur om te verplaatsen, dus u heeft besloten om ze niet te gebruiken of uw ETL-pijpleidingen kosten u veel.
  • U heeft een toepassing of kansen die u gelooft dat een significante impact kunnen hebben, maar u heeft zelf geen gegevens om het te laten gebeuren.
  • Uw machine learning-modellen hebben een plateau bereikt en u weet niet hoe u ze verder kunt verbeteren.

Differentieel privacyleer is vaak gebruikt in combinatie met gefedereerd leren, wat is dit specifiek?

Differentieel privacyleer is een techniek om privacy te garanderen terwijl tegelijkertijd de kracht van machine learning wordt benut. Met behulp van andere wiskunde dan standaardde-identificatietechnieken, voegt differentieel privacyleer ruis toe tijdens lokale modeltraining, waardoor de meeste statistische kenmerken van de dataset worden behouden, terwijl het risico dat individuele gegevens worden geïdentificeerd wordt beperkt.

In ideale implementaties brengt differentieel privacyleer het risico dicht bij nul, terwijl machine learning-modellen een vergelijkbare prestatie behouden – waardoor alle benodigde beveiliging voor gegevensdeïdentificatie wordt geboden, zonder de kwaliteit van de modelresultaten te verminderen.

Differentieel privacyleer is standaard inbegrepen in integrate.ai‘s platform, zodat ontwikkelaars er zeker van kunnen zijn dat individuele gegevens niet kunnen worden afgeleid uit hun modelparameters.

Kunt u uitleggen hoe het gefedereerde leerplatform van integrate.ai werkt?

Ons platform maakt gebruik van gefedereerd leren en differentieel privacyleer om een reeks machine learning- en analytics-mogelijkheden te ontgrendelen op gegevens die anders moeilijk of onmogelijk toegankelijk zouden zijn vanwege privacy-, vertrouwelijkheids- of technische hindernissen. Bewerkingen zoals modeltraining en analytics worden lokaal uitgevoerd, en alleen de eindresultaten worden op een beveiligde en vertrouwelijke manier geaggregeerd.

integrate.ai is verpakt als een ontwikkelaarstool, waarmee ontwikkelaars deze mogelijkheden naadloos kunnen integreren in bijna elke oplossing met een eenvoudig te gebruiken software development kit (SDK) en ondersteunende cloudservice voor end-to-endbeheer. Zodra het platform is geïntegreerd, kunnen eindgebruikers samenwerken over gevoelige datasets, terwijl beheerders volledige controle behouden. Oplossingen die integrate.ai integreren, kunnen dienen als zowel effectieve experimentele tools als productieklare diensten.

Wat zijn enkele voorbeelden van hoe dit platform kan worden gebruikt in precisiediagnostiek?

Een van de netwerken van partners waarmee we werken, de Autism Sharing Initiative, verzamelt informatie over autismediagnostiek en genoomgegevens om de verbindingen tussen de verschillende genotypen en fenotypen en autismediagnoses te begrijpen. Elke individuele datasite heeft niet genoeg datasets om de machine learning-modellen te laten presteren, maar collectief creëren ze een betekenisvolle steekproefgrootte. Echter, het verplaatsen van gegevens vormt een hoog risico voor beveiliging en privacy, en vanwege regelgeving en ziekenhuisbeleid, hebben deze onderzoeksinstellingen altijd standaard gekozen voor niet delen.

In een ander netwerk, met een soortgelijke instelling, zijn onderzoekers geïnteresseerd in het verbeteren van de toewijzing van klinische proeven aan patiënten met een meer holistische visie op elke patiëntgeschiedenis.

De verschillende onderzoeksinstellingen hebben toegang tot verschillende informatie over elke patiënt – één lab heeft toegang tot hun medische scans, een andere lab heeft toegang tot hun genetische informatie, en een andere instelling heeft hun klinische proefresultaten. Maar deze verschillende organisaties kunnen geen gegevens rechtstreeks met elkaar delen.

Met de integrate.ai-oplossing kunnen elke organisatie toegang krijgen tot elkaars gegevens voor hun doelen zonder de gegevens weg te halen bij de gegevensbeheerders en dus voldoen aan hun interne beleid.

Kunt u discussiëren over het belang van het maken van privacy begrijpelijk en hoe integrate.ai dit mogelijk maakt?

Het maken van privacy begrijpelijk, betekent het openen van veel deuren voor bedrijven en organisaties die historisch gesloten waren vanwege de dubbelzinnige aard van het risico. Privacyreglementen zoals GDPR, CCPA en HIPPA zijn enorm complex en kunnen verschillen afhankelijk van de industrie, regio en type gegevens, waardoor het moeilijk is voor organisaties om te bepalen welke datapjecten privacy-veilig zijn. In plaats van tijd en mankracht te verspillen aan het controleren van elke doos, biedt integrate.ai’s gefedereerde leerplatform ingebouwd differentieel privacyleer, homomorfische encryptie en beveiligde multi-partijenberekening, zodat ontwikkelaars en gegevensbeheerders rustig kunnen slapen, wetend dat hun projecten automatisch voldoen aan regelgevingsvereisten, zonder de rompslomp van het springen door elke categorische lus.

Is er nog iets anders dat u zou willen delen over integrate.ai?

integrate.ai’s oplossing is een ontzettend ontwikkelaar-vriendelijke tool die compliant, privacy-bewust en beveiligde machine learning en analytics op gevoelige gegevensbronnen mogelijk maakt. Met eenvoudig te gebruiken API’s wordt alle complexiteit van regelgevingscompliance en contracten op gevoelige gegevens afgeschermd. integrate.ai’s oplossing stelt datawetenschappers en softwareontwikkelaars in staat om hun werklasten veilig te beheren met minimale impact op hun huidige infrastructuur en workflows.

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten integrate.ai bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.