Wywiady
Roshanak Houmanfar, VP of Machine Learning Products at Integrate.ai – Wywiad

Roshanak (Ro) Houmanfar jest wiceprezesem ds. produktów machine learning w firmie integrate.ai, firmy pomagającej deweloperom rozwiązywać najważniejsze problemy świata bez ryzyka naruszenia danych wrażliwych. Ro ma szczególne zdolności do znajdowania nowych sposobów uproszczenia złożonych pojęć sztucznej inteligencji i łączenia ich z potrzebami użytkowników. Wykorzystując tę wiedzę, jest na czele misji integrate.ai w celu udostępnienia technologii zwiększającej prywatność.
Czym było początkowo pociągnięte do nauki o danych i machine learning?
Zacząłem swoją podróż w robotyce. Po eksperymentowaniu z różnymi kątami robotyki i spaleniu laboratorium spawalniczego, doszedłem do wniosku, że bardziej interesuje mnie strona sztucznej inteligencji w mojej dziedzinie, co doprowadziło mnie do wspaniałego świata machine learning.
Czy mógłbyś opisać swoją bieżącą rolę i jak wygląda Twój przeciętny dzień?
Jestem wiceprezesem ds. Produktu w integrate.ai, firmie SaaS pomagającej deweloperom rozwiązywać najważniejsze problemy świata bez ryzyka naruszenia danych wrażliwych. Budujemy narzędzia do bezpiecznego machine learning i analizy dla rozproszonej przyszłości danych.
W moim codziennym życiu pracuję z naszymi zespołami w różnych funkcjach, aby osiągnąć trzy rzeczy:
Zastanawiam się, jaki może być przyszły wygląd inteligencji i jak możemy kształtować tę przyszłość, aby rozwiązać najbardziej krytyczne problemy
Zrozumienie bólu naszych klientów i to, jak możemy innowacyjnie pomóc w ich pracy, aby była bardziej wpływowa i efektywna.
Upewniam się, że nasza wizja i opinie klientów są zawsze brane pod uwagę w rozwoju produktu, pracując współpracując z naszymi zespołami, aby dostarczyć najlepsze funkcje.
Dane syntetyczne są obecnie bardzo popularne w machine learning, ale integrate.ai stosuje nieco odmienną strategię. Jakie są aplikacje, w których dane syntetyczne mogą nie być pożądanym rozwiązaniem?
Aby zrozumieć, kiedy dane syntetyczne nie są najlepszym rozwiązaniem, należy najpierw zrozumieć, kiedy są one najlepsze. Dane syntetyczne są najlepsze, gdy cel modelowania ma małą ilość danych rzeczywistych lub w ogóle ich nie ma – na przykład w przypadku problemów z zimnym startem i szkolenia modeli tekstowych i obrazowych. Czasami po prostu nie ma wystarczających danych, aby przeszkolić model, co sprawia, że dane syntetyczne są rozwiązaniem.
Jednak dane syntetyczne są coraz częściej stosowane w sytuacjach, w których istnieje wiele danych rzeczywistych, ale dane te są izolowane ze względu na przepisy dotyczące prywatności, koszty centralizacji lub inne bariery interoperacyjności. Jest to rażące nadużycie danych syntetycznych. W tych przypadkach trudno określić odpowiedni poziom abstrakcji dla tworzenia danych syntetycznych, co skutkuje niskiej jakości danymi syntetycznymi, które mogą powodować wrodzone błędy lub inne problemy, które są trudne do debugowania. Ponadto modele trenowane na danych syntetycznych nie są porównywalne z tymi, które są trenowane na danych rzeczywistych, wysokiej jakości i drobnoziarnistych.
Integrate.ai specjalizuje się w oferowaniu rozwiązań federated learning, czy mógłbyś opisać, co to jest?
W tradycyjnym machine learning wszystkie dane szkoleniowe muszą być scentralizowane w jednej bazie danych. Z federated learning modelem można trenować na zdecentralizowanych, rozproszonych zestawach danych – lub danych, które znajdują się w dwóch lub więcej oddzielnych bazach danych i nie mogą być łatwo przeniesione. Działa to w ten sposób, że części modelu machine learning są trenowane tam, gdzie znajdują się dane, a parametry modelu są udostępniane między uczestniczącymi zestawami danych, aby wyprodukować ulepszony globalny model. A ponieważ żadne dane nie są przenoszone w systemie, organizacje mogą trenować modele bez przeszkód, takich jak przepisy dotyczące prywatności i bezpieczeństwa, koszty lub inne problemy z centralizacją.
Ogólnie dostępne dane szkoleniowe z federated learning są znacznie lepszej jakości, ponieważ scentralizowane dane tracą niektóre ze swoich cech drobnoziarnistych na rzecz łatwości dostępu w jednym miejscu.
Jak przedsiębiorstwo może zidentyfikować najlepsze przypadki użycia dla federated learning?
Federated learning to technologia stosowana w sytuacjach, w których dostęp do danych lub przeniesienie ich do tradycyjnej infrastruktury machine learning z centralnymi jeziorami danych jest bolesne. Jeśli doświadczasz jednego z następujących objawów, federated learning jest dla Ciebie:
- Świadczysz usługi inteligentne napędzane przez analitykę i machine learning i nie możesz tworzyć efektów sieciowych dla swoich produktów, ponieważ dane należą do Twoich klientów.
- Jesteś zaangażowany w długie umowy o świadczeniu usług lub umowy o udostępnianiu danych, aby uzyskać dostęp do danych od partnerów.
- Jesteś zaangażowany w tworzenie umów partnerskich z partnerami, szczególnie w sytuacjach, w których wynik tego partnerstwa jest niejasny dla Ciebie.
- Posiadasz ogromne ilości danych i chcesz je komercjalizować, ale boisz się konsekwencji dla Twojej reputacji.
- Już komercjalizujesz swoje dane, ale spędzasz dużo czasu, wysiłku i pieniędzy, aby uczynić je bezpiecznymi do udostępnienia.
- Twoja infrastruktura została pozostawiona w tyle podczas przesunięcia do chmury, ale nadal potrzebujesz analityki i machine learning.
- Masz wiele filii, które należą do tej samej organizacji, ale nie mogą bezpośrednio dzielić się danymi ze sobą.
- Zestawy danych, z którymi masz do czynienia, są zbyt duże lub zbyt drogie, aby je przenosić, więc albo zdecydowałeś się nie korzystać z nich, albo Twoje potoki ETL są bardzo kosztowne.
- Masz aplikację lub okazję, której możesz użyć, aby osiągnąć znaczący wpływ, ale nie masz danych, aby to zrobić.
- Twoje modele machine learning osiągnęły plateau i nie wiesz, jak je dalej poprawić.
Różnicowa prywatność jest często stosowana w połączeniu z federated learning, co to konkretnie?
Różnicowa prywatność to technika, która pozwala na zapewnienie prywatności podczas jednoczesnego wykorzystywania mocy machine learning. Używając innych matematyk niż standardowe techniki deidentyfikacji, różnicowa prywatność dodaje szum podczas lokalnego szkolenia modelu, zachowując większość cech statystycznych zestawu danych, jednocześnie ograniczając ryzyko, że dane któregokolwiek jednostki będą identyfikowane.
W idealnych wdrożeniach różnicowa prywatność zmniejsza ryzyko do niemal zera, podczas gdy modele machine learning zachowują podobne wyniki – zapewniając wszystkie potrzebne zabezpieczenia dla deidentyfikacji danych, bez zmniejszania jakości wyników modelu.
Różnicowa prywatność jest uwzględniona w platformie integrate.ai domyślnie, dzięki czemu deweloperzy mogą upewnić się, że dane jednostkowe nie mogą być wnioskowane z ich parametrów modelu.
Czy mógłbyś opisać, jak działa platforma federated learning integrate.ai?
Nasza platforma wykorzystuje technologie federated learning i różnicowej prywatności, aby odblokować szereg możliwości machine learning i analityki na danych, które w przeciwnym razie byłyby trudne lub niemożliwe do uzyskania ze względu na problemy z prywatnością, poufnością lub technicznymi. Operacje, takie jak szkolenie modelu i analityka, są wykonywane lokalnie, a tylko wyniki końcowe są agregowane w sposób bezpieczny i poufny.
Integrate.ai jest pakowany jako narzędzie dla deweloperów, umożliwiające im bezproblemowe integrowanie tych możliwości z prawie każdym rozwiązaniem za pomocą łatwego w użyciu zestawu SDK i obsługiwanego usługi w chmurze do zarządzania końcowego. Po zintegrowaniu platformy użytkownicy końcowi mogą współpracować nad wrażliwymi zestawami danych, podczas gdy opiekunowie danych zachowują pełną kontrolę. Rozwiązania, które wykorzystują integrate.ai, mogą służyć jako efektywne narzędzia do eksperymentowania i usługi produkcyjne.
Jakie są przykłady zastosowania tej platformy w diagnostyce precyzyjnej?
Jedna z sieci partnerów, z którymi współpracujemy, Autism Sharing Initiative, gromadzi informacje dotyczące diagnozowania autyzmu, a także próbki danych genomowych, aby zrozumieć połączenia różnych genotypów i fenotypów z diagnozami autyzmu. Każdy indywidualny zestaw danych nie ma wystarczających danych, aby uczynić modele machine learning skutecznymi, ale łącznie tworzą znaczącą wielkość próby. Jednak przenoszenie danych stanowi wysokie ryzyko dla bezpieczeństwa i prywatności, a ze względu na przepisy i polityki szpitali te instytucje badawcze zawsze domyślnie nie udostępniają.
W innej sieci, z podobną konfiguracją, badacze są zainteresowani poprawą przypisania badań klinicznych do pacjentów przy użyciu bardziej holistycznego spojrzenia na historię każdego pacjenta.
Różne instytucje badawcze mają dostęp do różnych informacji o każdym pacjencie – jeden laboratorium ma dostęp do ich badań medycznych, inne laboratorium ma dostęp do ich informacji genetycznych, a inna instytucja ma dostęp do wyników ich badań klinicznych. Ale te różne organizacje nie mogą bezpośrednio dzielić się informacjami ze sobą.
Z rozwiązaniem integrate.ai każda organizacja może uzyskać dostęp do danych innych organizacji do swoich celów bez przenoszenia danych poza opiekunami danych i tym samym przestrzegając ich wewnętrznych polityk.
Czy mógłbyś omówić znaczenie uczynienia prywatności zrozumiałą i jak integrate.ai umożliwia to?
Uczynienie prywatności zrozumiałą oznacza otwarcie wielu drzwi dla firm i organizacji, które historycznie były zamknięte ze względu na niejasną naturę ryzyka. Przepisy dotyczące prywatności, takie jak RODO, CCPA i HIPPA, są niezwykle złożone i mogą się różnić w zależności od branży, regionu i rodzaju danych, co utrudnia organizacjom określenie, które projekty danych są bezpieczne pod względem prywatności. Zamiast tracić czas i siły na sprawdzanie każdej pozycji, platforma federated learning integrate.ai oferuje wbudowaną różnicową prywatność, homomorficzną szyfrowanie i bezpieczne obliczenia wielopartyjne, dzięki czemu deweloperzy i opiekunowie danych mogą spać spokojnie, wiedząc, że ich projekty będą automatycznie spełniać wymagania regulacyjne, bez konieczności przeskakiwania przez każdą kategorię.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat integrate.ai?
Rozwiązanie integrate.ai to niezwykle przyjazne narzędzie dla deweloperów, które umożliwia zgodne, zachowujące prywatność i bezpieczne machine learning i analitykę na wrażliwych źródłach danych. Za pomocą prostych w użyciu API cała złożoność zgodności regulacyjnej i umów na wrażliwe dane jest odizolowana. Rozwiązanie integrate.ai pozwala naukowcom i deweloperom oprogramowania na bezpieczne zarządzanie swoimi obciążeniami z minimalnym wpływem na ich bieżącą infrastrukturę i przepływy pracy.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić integrate.ai.












