Rozhovory

Roshanak Houmanfar, VP of Machine Learning Products at Integrate.ai – Rozhovorová série

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Roshanak (Ro) Houmanfar je viceprezidentkou pro produkty strojového učení ve společnosti integrate.ai, která pomáhá vývojářům řešit nejvýznamnější problémy světa bez ohrožení citlivých dat. Ro má zvláštní talent pro nalezení nových způsobů, jak zjednodušit komplexní koncepty umělé inteligence a spojit je s potřebami uživatelů. Díky této odbornosti je na předním místě mise integrate.ai demokratizovat přístup k technologiím zvyšujícím ochranu soukromí.

Co vás původně přitáhlo k datové vědě a strojovému učení?

Začala jsem svou cestu v robotice. Po experimentování s různými úhly pohledu na robotiku a spálení svařovací laboratoře jsem dospěla k závěru, že mě více přitahuje umělá inteligence, a to mě vedlo k úžasnému světu strojového učení.

Můžete popsat svou současnou roli a jak vypadá váš průměrný den?

Jsem viceprezidentkou produktů ve společnosti integrate.ai, která je softwarovou společností pomáhající vývojářům řešit nejvýznamnější problémy světa bez ohrožení citlivých dat. Budujeme nástroje pro strojové učení a analýzy s ohledem na ochranu soukromí pro decentralizovanou budoucnost dat.

V meinem denním režimu pracuji s našimi týmy napříč funkcemi, abych dosáhla tří věcí:

Přemýšlet o tom, jak by mohla vypadat budoucnost inteligence a jak můžeme tuto budoucnost tvarovat, aby inteligence řešila nejkritičtější problémy

Pochopit bolesti našich zákazníků a jak můžeme inovovat, aby jejich práce byla více dopadová a efektivní.

Zajistit, aby naše vize a zpětná vazba zákazníků byly vždy zohledněny při vývoji produktů, a to pracovat spolupracovně s našimi týmy, abychom dodali nejlepší funkce.

Syntetická data jsou v současné době velmi populární ve strojovém učení, ale integrate.ai má poněkud odlišný přístup. Jaké jsou některé aplikace, kde syntetická data nemusí být nejvhodnější volbou?

Abychom pochopili, kdy syntetická data nejsou nejlepší řešení, je nejdříve důležité pochopit, kdy jsou syntetická data nejlepší. Syntetická data jsou nejlepší, když je k dispozici malé množství skutečných dat nebo žádné – například u problémů s chladným startem a školením modelů založených na textu a obrazech. Někdy prostě není k dispozici dostatek dat pro školení modelu, a to je případ, kdy syntetická data vynikají jako řešení.

Jedná se o situace, kdy je k dispozici dostatek skutečných dat, ale tato data jsou izolována kvůli předpisům na ochranu soukromí, centralizačním nákladům nebo jiným bariérám interoperability. To je zneužití syntetických dat. V těchto případech je obtížné určit správnou úroveň abstrakce pro vytváření syntetických dat, což vede k nízkokvalitním syntetickým datům, která mohou způsobit vrozené chyby nebo jiné problémy, které jsou obtížné odstranit. Kromě toho modely školené na syntetických datech nejsou srovnatelné s modely školenými na skutečných, vysoce kvalitních a podrobných datech.

Integrate.ai se specializuje na nabídku federativních řešení pro strojové učení, můžete popsat, co je to federativní učení?

V tradičním strojovém učení musí být všechna data pro školení modelu centralizována v jedné databázi. S federativním učením mohou modely být školeny na decentralizovaných, distribuovaných datech – nebo datech, které sídlí ve dvou nebo více samostatných databázích a nemohou být snadno přesunuty. To funguje tak, že části modelu strojového učení jsou školeny tam, kde jsou data umístěna, a parametry modelu jsou sdíleny mezi účastnickými datovými sadami, aby se vytvořil lepší globální model. A protože se žádná data nepohybují v systému, organizace mohou školení modelů provádět bez překážek, jako jsou předpisy na ochranu soukromí, bezpečnost, náklady nebo jiné centralizační problémy.

Obecně je kvalita dat dostupných pro federativní učení mnohem vyšší, protože centralizovaná data mají tendenci ztrácet část své podrobnosti na úkor snadného přístupu na jednom místě.

Jak může podnik identifikovat nejlepší použití federativního učení?

Federativní učení je strojové učení postavené pro situace, kdy přístup k datům nebo jejich přesunutí do tradiční infrastruktury strojového učení s centralizovanými datovými jezery je bolestivý. Pokud zažíváte některý z následujících příznaků, federativní učení je pro vás:

  • Vyvíjíte chytré produkty poháněné analytikou a strojovým učením a nemůžete vytvářet síťové efekty pro své produkty, protože data vlastní vaši zákazníci.
  • Pracujete na dlouhých servisních smlouvách nebo dohodách o sdílení dat, aby jste získali přístup k datům od svých partnerů.
  • Vyvíjíte spolupráci s partnery, zejména v situacích, kdy je výsledek této datové spolupráce pro vás nejasný.
  • Máte bohatství dat a chcete je monetizovat, ale bojíte se dopadů na vaši pověst.
  • Už monetizujete svá data, ale trávíte spoustu času, úsilí a peněz, aby jste data učinili bezpečnými pro sdílení.
  • Vaše infrastruktura byla zanechána během přechodu do cloudu, ale stále potřebujete analytiku a strojové učení.
  • Máte mnoho dceřiných společností, které patří do stejné organizace, ale nemohou přímo sdílet data mezi sebou.
  • Datové sady, se kterými pracujete, jsou příliš velké nebo drahé na přesunutí, takže jste se rozhodli je nevyužít nebo vaše ETL potrubí vás stojí hodně.
  • Máte aplikaci nebo příležitost, o které si myslíte, že by mohla mít významný dopad, ale nemáte data, aby jste ji mohli uskutečnit.
  • Vaše modely strojového učení dosáhly svého maxima a nevíte, jak je dále zlepšit.

Diferenční soukromí je často používáno ve spojení s federativním učením, co je to přesně?

Diferenční soukromí je technika, která zajišťuje soukromí a zároveň využívá sílu strojového učení. Používá jiné matematiky než standardní techniky deidentifikace, diferenciální soukromí přidává hluk během místního školení modelu, zachovává většinu statistických vlastností datové sady a současně omezuje riziko, že by могла být identifikována data jednotlivce.

V ideálních implementacích diferenciální soukromí snižuje riziko téměř na nulu, zatímco modely strojového učení si zachovávají podobné výkony – poskytují veškerou potřebnou bezpečnost pro deidentifikaci dat, aniž by snižovaly kvalitu výsledků modelu.

Diferenční soukromí je součástí platformy integrate.ai ve výchozím nastavení, takže vývojáři mohou zajistit, aby individuální data nemohla být odvozena z jejich parametrů modelu.

Můžete popsat, jak funguje platforma integrate.ai pro federativní učení?

Naše platforma využívá federativní učení a diferenciální soukromí, aby odemkla řadu schopností strojového učení a analytiky na datech, která by jinak byla obtížná nebo nemožná získat kvůli problémům s ochranou soukromí, důvěrností nebo technickými překážkami. Operace, jako je školení modelu a analytika, jsou prováděny místně, a pouze konečné výsledky jsou agregovány bezpečným a důvěrným způsobem.

Integrate.ai je baleno jako nástroj pro vývojáře, který umožňuje vývojářům snadno integrovat tyto funkce do téměř jakéhokoli řešení pomocí snadno použitelného softwarového rozhraní (SDK) a podpůrné cloudové služby pro komplexní správu. Jakmile je platforma integrována, koncoví uživatelé mohou spolupracovat na citlivých datech, zatímco správci dat si zachovávají plnou kontrolu. Řešení, která zahrnují integrate.ai, mohou sloužit jako efektivní nástroje pro experimentování i jako produkční služby.

Jaké jsou některé příklady použití této platformy v precizní diagnostice?

Jedna ze sítí partnerů, se kterou pracujeme, Autism Sharing Initiative, shromažďuje informace týkající se diagnostiky autismu a vzorky genomových dat, aby pochopila spojení různých genotypů a fenotypů s diagnózami autismu. Každá jednotlivá datová lokalita nemá dostatek datových sad, aby mohla vytvořit funkční modely strojového učení, ale společně vytvářejí smysluplnou velikost vzorku. Přesunutí dat však představuje vysoké riziko pro bezpečnost a soukromí, a vzhledem k předpisům a politice nemocnic se tyto výzkumné instituce vždy uchýlily k tomu, že data nesdílejí.

V jiné síti, se podobnou konfigurací, výzkumníci se zajímají o zlepšení přiřazování klinických studií pacientům pomocí holističtějšího pohledu na historii každého pacienta.

Různé výzkumné instituce mají přístup k různým informacím o každém pacientovi – jedna laboratoř má přístup k jejich lékařským snímkům, druhá laboratoř má přístup k jejich genomovým informacím a další instituce má jejich výsledky klinických studií. Ale tyto různé organizace nemohou přímo sdílet informace mezi sebou.

S řešením integrate.ai může každá organizace získat přístup k datům ostatních pro své cíle bez přesunutí dat od správců dat a tím i dodržování jejich interních politik.

Můžete diskutovat o důležitosti pochopení soukromí a jak integrate.ai umožňuje toto pochopení?

Učinění soukromí srozumitelným znamená otevření mnoha dveří pro podniky a organizace, které byly historicky uzavřeny kvůli nejasné povaze rizika. Předpisy na ochranu soukromí, jako je GDPR, CCPA a HIPAA, jsou nesmírně komplexní a mohou se lišit v závislosti na odvětví, regionu a typu dat, což činí obtížným pro organizace určit, které projekty dat jsou bezpečné pro soukromí. Místo toho, aby se ztrácel čas a pracovní síla při kontrole každé položky, platforma integrate.ai pro federativní učení nabízí vestavěné diferenciální soukromí, homomorfní šifrování a zabezpečenou vícestrannou výpočetní techniku, aby vývojáři a správci dat mohli být v klidu, že jejich projekty budou automaticky splňovat regulační požadavky, aniž by museli skákat přes každou kategoriální překážku.

Ještě něco, co byste chtěli sdílet o integrate.ai?

Řešení integrate.ai je neuvěřitelně vývojářsky přátelským nástrojem, který umožňuje kompatibilní, soukromí-přátelské a bezpečné strojové učení a analytiku nad citlivými datovými zdroji. Díky snadno použitelným API jsou všechny složitosti regulačních požadavků a smluv nad citlivými daty odstraněny. Řešení integrate.ai umožňuje datovým vědcům a softwarovým vývojářům spravovat své pracovní zátěže bezpečně s minimálním dopadem na jejich stávající infrastrukturu a pracovní postupy.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se více dozvědět, by měli navštívit integrate.ai.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.