Liderzy opinii

Trzy techniki uczenia maszynowego zachowujące prywatność, które rozwiązują najważniejszy problem tej dekady

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Przez Amogh Tarcar, badacza sztucznej inteligencji i uczenia maszynowego w Persistent Systems.

Prywatność danych, zdaniem ekspertów z różnych dziedzin, będzie najważniejszym problemem tej dekady. Dotyczy to szczególnie techniki uczenia maszynowego (ML), gdzie algorytmy są zasilane ogromnymi ilościami danych.

Tradycyjnie, techniki modelowania ML opierały się na scentralizowaniu danych z wielu źródeł w jednym centrum danych. Przecież modele ML są najpotężniejsze, gdy mają dostęp do ogromnych ilości danych. Jednakże, istnieje wiele wyzwań związanych z prywatnością, które pojawiają się wraz z tą techniką. Agregowanie różnorodnych danych z wielu źródeł jest mniej wykonalne dzisiaj ze względu na problemy regulacyjne, takie jak HIPAA, GDPR i CCPA. Ponadto, scentralizowanie danych zwiększa zakres i skalę nieprawidłowego wykorzystania danych i zagrożeń bezpieczeństwa w postaci wycieków danych.

Aby pokonać te wyzwania, opracowano kilka filarów techniki uczenia maszynowego zachowującej prywatność (PPML) z konkretnymi technikami, które redukują ryzyko prywatności i zapewniają, że dane pozostają w miarę bezpieczne. Oto kilka z najważniejszych:

1. Uczenie federacyjne

Uczenie federacyjne jest techniką szkolenia ML, która odwraca problem agregacji danych. Zamiast agregować dane, aby utworzyć jeden model ML, uczenie federacyjne agreguje same modele ML. Zapewnia to, że dane nigdy nie opuszczają swojego źródłowego położenia, i pozwala wielu stronom na współpracę i budowę wspólnego modelu ML bez bezpośredniego udostępniania wrażliwych danych.

Działa to w następujący sposób. Zaczynasz od podstawowego modelu ML, który jest następnie udostępniany każdemu węzłowi klienta. Te węzły wykonują lokalne szkolenie na tym modelu przy użyciu własnych danych. Aktualizacje modelu są okresowo udostępniane węzłowi koordynującemu, który przetwarza te aktualizacje i łączy je, aby otrzymać nowy globalny model. W ten sposób uzyskujesz wgląd w różnorodne zestawy danych bez konieczności ich udostępniania.

Źródło: Persistent Systems

W kontekście opieki zdrowotnej, jest to niezwykle potężne i świadome narzędzie do zachowania bezpieczeństwa danych pacjentów, jednocześnie dając badaczom mądrość tłumu. Nieagregując danych, uczenie federacyjne tworzy dodatkową warstwę zabezpieczeń. Jednakże, same modele i aktualizacje modeli nadal stanowią ryzyko bezpieczeństwa, jeśli są pozostawione bez zabezpieczeń.

2. Różnicowa prywatność

Modele ML są często celem ataków inferencyjnych. Załóżmy, że udostępniłeś swoje dane zdrowotne szpitalowi, aby pomóc w opracowaniu szczepionki na raka. Szpital zabezpiecza twoje dane, ale używa uczenia federacyjnego do szkolenia publicznie dostępnego modelu ML. Kilka miesięcy później, hakerzy używają ataku inferencyjnego, aby określić, czy twoje dane zostały użyte w treningu modelu. Następnie przekazują wnioski firmie ubezpieczeniowej, która, na podstawie twojego ryzyka raka, może podnieść twoje składki.

Różnicowa prywatność zapewnia, że ataki na modele ML nie będą mogły zidentyfikować konkretnych punktów danych użytych podczas treningu, co zmniejsza ryzyko ujawnienia wrażliwych danych szkoleniowych w uczeniu maszynowym. To osiągane jest przez zastosowanie “szumów statystycznych” do zakłócenia danych lub parametrów modelu ML podczas treningu, co utrudnia prowadzenie ataków i określanie, czy dane konkretnego osobnika zostały użyte do treningu modelu.

Na przykład, Facebook niedawno wydał Opacus, bibliotekę o wysokiej wydajności do szkolenia modeli PyTorch z zastosowaniem różnicowej prywatności. Poniższy gif pokazuje, jak używa szumu do maskowania danych.

 

Ten szum jest zarządzany przez parametr o nazwie Epsilon. Jeśli wartość Epsilon jest niska, model ma idealną prywatność danych, ale słabą użyteczność i dokładność. Odwrotnie, jeśli masz wysoką wartość Epsilon, twoja prywatność danych będzie niższa, a twoja dokładność będzie wyższa. Sztuczka polega na znalezieniu równowagi, aby zoptymalizować obie.

3. Szyfrowanie homomorficzne

Standardowe szyfrowanie jest tradycyjnie niezgodne z uczeniem maszynowym, ponieważ gdy dane są zaszyfrowane, nie mogą być już zrozumiane przez algorytm ML. Jednakże, szyfrowanie homomorficzne jest specjalnym schematem szyfrowania, który pozwala na kontynuowanie pewnych typów obliczeń.

Źródło: OpenMined

Moc tego polega na tym, że trening może odbywać się w całkowicie zaszyfrowanym środowisku. Nie tylko chroni właścicieli danych, ale także chroni właścicieli modeli. Właściciel modelu może uruchamiać inferencję na zaszyfrowanych danych bez ich widzenia lub nadużywania.

Gdy jest stosowane w uczeniu federacyjnym, fuzja aktualizacji modelu może odbywać się bezpiecznie, ponieważ odbywa się w całkowicie zaszyfrowanym środowisku, co znacznie redukuje ryzyko ataków inferencyjnych.

Dekada prywatności

Wchodząc w 2021 rok, technika uczenia maszynowego zachowującego prywatność jest wschodzącym polem z niezwykle aktywnymi badaniami. Jeśli poprzednia dekada była o unsilowaniu danych, ta dekada będzie o unsilowaniu modeli ML, zachowując prywatność podstawowych danych za pomocą uczenia federacyjnego, różnicowej prywatności i szyfrowania homomorficznego. Te techniki przedstawiają obiecujący nowy sposób rozwoju rozwiązań uczenia maszynowego w sposób świadomy prywatności.

Amogh jest badaczem w dziedzinie Machine Learning i jest częścią AI Research Lab w Persistent Systems. Jego obecne badania koncentrują się na aplikacjach Federated Learning oraz tworzeniu narzędzi NLP do ekstrakcji wiedzy.