Wywiady

Amy Steier, Principal Machine Learning Scientist w Gretel.ai – Wywiad

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Amy Steier jest głównym naukowcem ds. machine learning w Gretel.ai, najbardziej zaawansowanej platformie inżynierii prywatności na świecie. Gretel ułatwia wbudowanie prywatności w projekty technologiczne oparte na danych. Biblioteki oparte na sztucznej inteligencji i otwartym kodzie źródłowym są zaprojektowane do transformacji, anonimizacji i syntetyzacji wrażliwych informacji.

Amy jest bardzo doświadczonym naukowcem ds. machine learning i danych, z ponad 20-letnim doświadczeniem. Jej pasją są duże zbiorów danych i ujawnianie ukrytej inteligencji za pomocą technik z zakresu machine learning, data mining, sztucznej inteligencji i statystyki. Jest wysoko wykwalifikowana w modelowaniu predykcyjnym, klasyfikacji, klastryzacji, wykrywaniu anomalii, wizualizacji danych, metodach ensemble, odzyskiwaniu informacji, analizie cyberbezpieczeństwa, NLP, modelach rekomendacji i analizie zachowań użytkowników.

Co początkowo skłoniło Cię do podjęcia kariery w dziedzinie informatyki i machine learning?

Moja czysta, nieprzymuszona, trwała miłość do danych. Potęga, tajemnica, intryga i potencjał danych zawsze mnie fascynowały. Informatyka i machine learning to narzędzia do wykorzystania tego potencjału. Jest to również bardzo przyjemne, aby pracować w dziedzinie, w której stan sztuki rozwija się tak szybko. Lubię punkt przecięcia badań i produktu. Jest to bardzo satysfakcjonujące, aby wziąć najnowsze idee, przesunąć je nieco dalej, a następnie przekształcić je w istniejące, namacalne potrzeby produktu.

Dla czytelników, którzy nie są zaznajomieni, mogłabyś wyjaśnić, co to jest dane syntetyczne?

Dane syntetyczne to dane, które wyglądają i zachowują się jak oryginalne dane, ale są również wystarczająco różne, aby spełniać pewne przypadki użycia. Najczęstszym przypadkiem użycia jest konieczność ochrony prywatności informacji w oryginalnych danych. Innym przypadkiem użycia jest konieczność utworzenia dodatkowych danych w celu zwiększenia rozmiaru oryginalnego zestawu danych. Jeszcze innym przypadkiem użycia jest pomoc w rozwiązywaniu problemu nierównowagi klasowej lub perhaps demograficznej w oryginalnym zestawie danych.

Dane syntetyczne pozwalają nam na kontynuowanie rozwoju nowych i innowacyjnych produktów i rozwiązań, gdyby dane niezbędne do tego celu nie były dostępne.

Jak platforma Gretel działa, aby tworzyć dane syntetyczne za pomocą API?

API inżynierii prywatności Gretel pozwalają na pobranie danych do Gretel i eksplorację danych, które możemy wyodrębnić. Są to te same API, które są używane przez nasz Console. Poprzez udostępnienie API za pomocą intuicyjnego interfejsu, chcemy umożliwić deweloperom i naukowcom ds. danych budowanie własnych przepływów pracy wokół Gretel.

Pomimo że konsola sprawia, że tworzenie danych syntetycznych jest bardzo łatwe, API umożliwiają integrację tworzenia danych syntetycznych z przepływem pracy. Lubię używać API, ponieważ umożliwiają mi dostosowanie tworzenia danych syntetycznych do bardzo szczególnego przypadku użycia.

Czy mogłabyś omówić niektóre z narzędzi oferowanych przez Gretel, aby pomóc w ocenie jakości danych syntetycznych?

Po utworzeniu danych syntetycznych, Gretel generuje raport syntetyczny. W tym raporcie można zobaczyć wynik jakości danych syntetycznych (SQS), a także ocenę poziomu ochrony prywatności (PPL).

Wynik SQS jest szacunkiem, jak dobrze wygenerowane dane syntetyczne zachowują te same właściwości statystyczne, co oryginalny zestaw danych. W tym sensie wynik SQS można uznać za miarę użyteczności lub ufności, czy wnioski naukowe wyciągnięte z syntetycznego zestawu danych będą takie same, jak gdyby użyto oryginalnego zestawu danych.

Wynik SQS jest obliczany przez połączenie poszczególnych metryk jakości: stabilności dystrybucji pól, stabilności korelacji pól i stabilności głębokiej struktury.

Stabilność dystrybucji pól jest miarą, jak dobrze dane syntetyczne zachowują te same dystrybucje pól, co w oryginalnych danych. Stabilność korelacji pól jest miarą, jak dobrze korelacje między polami są zachowane w danych syntetycznych. Ostatecznie stabilność głębokiej struktury mierzy integralność statystyczną głębokich, wielopольowych dystrybucji i korelacji. Aby to oszacować, Gretel porównuje analizę głównych składowych (PCA) obliczoną najpierw na oryginalnych danych, a następnie ponownie na danych syntetycznych.

Jak działają filtry prywatności Gretel?

Filtry prywatności Gretel były wynikiem wielu badań nad naturą ataków na dane syntetyczne. Filtry prywatności zapobiegają tworzeniu danych syntetycznych z słabościami, które są powszechnie wykorzystywane przez ataki. Mamy dwa filtry prywatności, pierwszy to filtr podobieństwa, a drugi to filtr odstających wartości. Filtr podobieństwa zapobiega tworzeniu rekordów syntetycznych, które są zbyt podobne do rekordu szkoleniowego. Są to główne cele ataków, które próbują uzyskać wgląd w oryginalne dane. Drugi filtr prywatności to filtr odstających wartości. Zapobiega tworzeniu rekordów syntetycznych, które byłyby uznane za odstające w przestrzeni zdefiniowanej przez dane szkoleniowe. Wartości odstające ujawnione w syntetycznym zestawie danych mogą być wykorzystane przez ataki inferencyjne, atrybutowe i wiele innych ataków. Są to poważne ryzyko prywatności.

Jak dane syntetyczne mogą pomóc w redukowaniu biasu w AI?

Najczęstsza technika polega na rozwiązaniu problemu reprezentacyjnego biasu danych, które są wprowadzane do systemu AI. Na przykład, jeśli istnieje silna nierównowaga klasowa w danych, lub jeśli istnieje demograficzny bias w danych, Gretel oferuje narzędzia, które pomagają najpierw zmierzyć nierównowagę, a następnie rozwiązać ją w danych syntetycznych. Poprzez usunięcie biasu w danych, często usuwa się również bias w systemie AI zbudowanym na tych danych.

Wyraźnie cieszy Cię się uczenie nowych technologii machine learning, jak osobiscie trzymasz się na bieżąco z wszystkimi zmianami?

Czytaj, czytaj, a potem czytaj jeszcze raz, lol! Lubię zaczynać dzień od czytania o nowych technologiach machine learning. Medium wie mnie bardzo dobrze. Lubię czytać artykuły w Towards Data Science, Analytics Vidhya i biuletynach, takich jak The Sequence. Facebook (META ) AI, Google (GOOGL ) AI i OpenMined mają świetne blogi. Istnieje wiele dobrych konferencji do naśladowania, takich jak NeurIPS, ICML, ICLR, AISTATS.

Lubię również narzędzia, które śledzą ślady cytowań, pomagają znaleźć artykuły podobne do tych, które lubisz, i które poznają Twoje specyficzne zainteresowania i zawsze obserwują w tle, czy nie pojawi się artykuł, który mogłby Cię zainteresować. Zeta Alpha jest jednym z takich narzędzi, które używam bardzo często.

Wreszcie, nie można przecenić korzyści z posiadania kolegów o podobnych zainteresowaniach. W Gretel, zespół machine learning śledzi artykuły badawcze istotne dla dziedzin, które badamy, i często spotykamy się, aby omówić interesujące artykuły.

Jaka jest Twoja wizja przyszłości machine learning?

Łatwy dostęp do danych spowoduje erę innowacji w machine learning, która z kolei przyspieszy innowacje w wielu dziedzinach, takich jak opieka zdrowotna, finanse, produkcja i biosciences. Historycznie, wiele przełomowych osiągnięć w machine learning można przypisać dużej ilości bogatych danych. Jednak historycznie, wiele badań było utrudnione przez brak dostępu do danych lub ich udostępniania z powodu problemów z prywatnością. Jak narzędzia, takie jak Gretel, usuwają tę barierę, dostęp do danych zostanie zdemokratyzowany. Cała społeczność machine learning skorzysta na dostępie do bogatych, dużych zbiorów danych, zamiast tylko kilku elitarnych mega-firm.

Czy jest coś jeszcze, co chciałabyś podzielić się na temat Gretel?

Jeśli kochasz dane, pokochasz Gretel (wiem, że ja ją kocham!). Łatwy dostęp do danych był kolcem w boku każdego naukowca ds. danych, jakiego kiedykolwiek znałam. W Gretel, mamy wielką dumę z tego, że stworzyliśmy konsolę i zestaw API, które sprawiają, że tworzenie prywatnych, udostępnialnych danych jest tak proste, jak to tylko możliwe. Głęboko wierzymy, że dane są bardziej wartościowe, gdy są udostępniane.

Dziękuję za wspaniały wywiad i za podzielenie się swoimi spostrzeżeniami, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Gretel.ai.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.