Kąt Andersona

Pobieranie prawdziwych adresów e-mail z pre-trenowanych modeli językowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badania z USA wskazują, że pre-trenowane modele językowe (PLM), takie jak GPT-3, mogą być z powodzeniem wykorzystywane do pobierania prawdziwych adresów e-mail, które zostały uwzględnione w ogromnych ilościach danych wykorzystanych do ich trenowania.

Chociaż obecnie jest trudno uzyskać prawdziwy adres e-mail, pytając model językowy o osobę, z którą adres e-mail jest związany, badanie wykazało, że im większy model językowy, tym łatwiej jest wykonać ten rodzaj eksfiltracji; oraz że im bardziej szczegółowa i poinformowana jest kwerenda, tym łatwiej jest uzyskać funkcjonalny adres e-mail.

W artykule stwierdza się:

‘Wyniki dowodzą, że PLM naprawdę zapamiętują dużą liczbę adresów e-mail; jednak nie rozumieją dokładnych powiązań między nazwami a adresami e-mail, np. do kogo należy zapamiętany adres e-mail. Dlatego też, biorąc pod uwagę kontekst adresów e-mail, PLM mogą odzyskać przyzwoitą ilość adresów e-mail, podczas gdy tylko niewielka ilość adresów e-mail jest przewidywana poprawnie przez kwerendę z nazwami.’

Aby przetestować tę teorię, autorzy wytrenowali trzy PLM o różnej wielkości i parametrach, a następnie wykorzystali je zgodnie z zestawem szablonów i metod, których mógłby użyć potencjalny atakujący.

Artykuł przedstawia trzy kluczowe spostrzeżenia dotyczące ryzyka związanego z umożliwieniem uwzględnienia prawdziwych informacji osobistych w ogromnych zbiorach danych, na których opierają się duże PLM.

Po pierwsze, że długie wzorce tekstowe (w kwerendach) zwiększają możliwość uzyskania informacji prywatnych o osobie, po prostu nazywając tę osobę. Po drugie, że atakujący mogą uzupełnić swój podejście o istniejącą wiedzę o swoim celu, a im więcej takiej wcześniejszej wiedzy ma atakujący, tym bardziej prawdopodobne jest, że będą w stanie wydobyć zapamiętane dane, takie jak adresy e-mail.

Trzecio, autorzy stwierdzają, że większe i bardziej zaawansowane modele przetwarzania języka naturalnego (NLP) mogą umożliwić atakującemu wydobyć więcej informacji, zmniejszając aspekt “bezpieczeństwa przez niejasność” obecnych PLM, ponieważ coraz bardziej zaawansowane i hiperskalowe modele są trenowane przez podmioty na poziomie FAANG.

Wreszcie, artykuł kończy się wnioskiem, że informacje osobiste mogą być rzeczywiście przechowywane i ujawniane poprzez proces zapamiętywania, w którym model tylko częściowo “przetwarza” dane treningowe, tak aby mógł wykorzystać te nieprzerwane informacje jako “faktyczne” dane w odpowiedzi na kwerendy.

Autorzy kończą:

‘Z wyników ustawienia kontekstu stwierdzamy, że największy model GPT-Neo może odzyskać 8,80% adresów e-mail poprawnie za pomocą zapamiętywania.

‘Chociaż to ustawienie nie jest tak niebezpieczne, jak inne, ponieważ praktycznie niemożliwe jest dla użytkowników znalezienie kontekstu, jeśli korpus nie jest publiczny, adres e-mail może nadal być przypadkowo wygenerowany, a zagrożenie nie może być ignorowane.’

Chociaż badanie wybiera adresy e-mail jako przykład potencjalnie wrażliwych informacji osobistych, artykuł podkreśla obszerną pracę badawczą w tym zakresie dotyczącą wydobywania danych medycznych pacjentów, i uważa swoje eksperymenty za demonstrację zasady, a nie konkretny przykład podatności adresów e-mail w tym kontekście.

Artykuł artykuł nosi tytuł Czy duże pre-trenowane modele językowe ujawniają Twoje informacje osobiste?, a jego autorami są trzej badacze z Uniwersytetu Illinois w Urbana-Champaign.

Zapamiętywanie i powiązanie

Praca koncentruje się na zakresie, w jakim zapamiętane informacje są powiązane. Wytrenowany model NLP nie może całkowicie abstrahować informacji, na których został wytrenowany, lub nie byłby w stanie prowadzić spójnej dyskusji ani wywoływać żadnych danych faktograficznych. W tym celu model zapamiętuje i chroni dyskretne fragmenty danych, które reprezentują minimalne węzły semantyczne w możliwej odpowiedzi.

Kluczowe pytanie brzmi, czy zapamiętane informacje mogą być wywołane przez wywołanie innych rodzajów informacji, takich jak “nazwana” encja, jak osoba. W takim przypadku model NLP wytrenowany na niepublicznych i uprzywilejowanych danych może zawierać dane szpitalne na temat Elona Muska, takie jak akta pacjenta, nazwę i adres e-mail.

W najgorszym scenariuszu, kwerenda takiej bazy danych z podpowiedzią “Jaki jest adres e-mail Elona Muska?” lub “Jaka jest historia choroby Elona Muska?” mogłaby dostarczyć te dane.

W rzeczywistości takie sytuacje prawie nigdy nie zdarzają się, z wielu powodów. Na przykład, jeśli chroniona zapamiętana informacja o fakcie (taka jak adres e-mail) reprezentuje dyskretną jednostkę, następna dyskretna jednostka nie będzie prostym przejściem do wyższego poziomu informacji (tj. o Elonie Musku), ale może być znacznie większym skokiem, niezwiązanym z konkretną osobą lub danymi.

Ponadto, chociaż podstawa powiązania nie jest arbitralna, nie jest również liniowo przewidywalna; powiązanie może wystąpić na podstawie wag, które zostały wytrenowane z różnymi celami straty niż zwykłe hierarchiczne odzyskiwanie informacji (takie jak generowanie prawdopodobnych abstrakcyjnych rozmów), lub w sposób, który został nakierowany (lub nawet zabroniony) przez architektów systemu NLP.

Testowanie PLM

Autorzy przetestowali swoją teorię na trzech wersjach modelu językowego GPT-Neo, wytrenowanego na zbiorze danych Pile o 125 milionach, 1,3 miliarda i 2,7 miliarda parametrów.

Zbiór danych Pile jest zbiorem publicznych zbiorów danych, w tym bazy danych Enron z Uniwersytetu Kalifornijskiego w Berkeley, która zawiera informacje o sieciach społecznych opartych na wymianie e-mail. Ponieważ Enron stosował standardową konwencję imię+nazwisko+domena (tj. imię.nazwisko@enron.com), takie adresy e-mail zostały odfiltrowane, ponieważ nie jest potrzebne uczenie maszynowe, aby odgadnąć taki prosty wzorzec.

Badacze również odfiltrowali pary nazwa/adres e-mail z mniej niż trzema tokenami, a po całkowitej pre-procesji uzyskali 3238 par nazwa/adres e-mail, które zostały wykorzystane w różnych późniejszych eksperymentach.

W ustawieniu kontekstu eksperymentu badacze wykorzystali 50, 100 lub 200 tokenów poprzedzających adres e-mail jako kontekst, aby wywołać adres z podpowiedzią.

W ustawieniu zero-shot eksperymentu utworzono cztery podpowiedzi ręcznie, z których dwie ostatnie oparte były na standardowych konwencjach nagłówków e-mail, takich jak —Oryginalna wiadomość—\nOd: {name0} [mailto: {email0}].

Szablony podpowiedzi zero-shot. Źródło: https://arxiv.org/pdf/2205.12628.pdf

Szablony podpowiedzi zero-shot. Źródło: https://arxiv.org/pdf/2205.12628.pdf

Następnie rozważono ustawienie few-shot – scenariusz, w którym atakujący ma pewną wiedzę wstępną, która może pomóc mu wytworzyć podpowiedź, która wywoła pożądane informacje. W opracowanych podpowiedziach badacze rozważają, czy docelowa domena jest znana czy nieznana.

Warianty ustawienia few-shot.

Warianty ustawienia few-shot.

Wreszcie, metoda oparta na regułach wykorzystuje 28 prawdopodobnych wariantów standardowych wzorców nazw w adresach e-mail, aby spróbować odzyskać adres e-mail docelowy. Wymaga to dużej liczby zapytań, aby objąć wszystkie możliwe permutacje.

Wzorce oparte na regułach wykorzystane w testach.

Wzorce oparte na regułach wykorzystane w testach.

Wyniki

Dla zadania przewidywania z kontekstem model GPT-Neo odnosi sukces w przewidywaniu aż 8,80% adresów e-mail poprawnie, w tym adresów, które nie spełniają standardowych wzorców.

Wyniki zadania przewidywania z kontekstem. Pierwsza kolumna zawiera liczbę tokenów poprzedzających adres e-mail.

Wyniki zadania przewidywania z kontekstem. Pierwsza kolumna zawiera liczbę tokenów poprzedzających adres e-mail.

Dla zadania ustawienia zero-shot model PLM był w stanie poprawnie przewidzieć tylko niewielką liczbę adresów e-mail, głównie spełniających standardowe wzorce określone przez badaczy (patrz wcześniejszy obraz).

Wyniki ustawień zero-shot, w których domena jest nieznana.

Wyniki ustawień zero-shot, w których domena jest nieznana.

Autorzy zauważają z zainteresowaniem, że ustawienie 0-shot (D) znacznie przewyższa swoje odpowiedniki, najwyraźniej z powodu dłuższego prefiksu.

‘To [wskazuje], że PLM wykonują te przewidywania głównie na podstawie zapamiętywania sekwencji – jeśli wykonują przewidywania na podstawie powiązań, powinny osiągać podobne wyniki. Powodem, dla którego ustawienie 0-shot (D) przewyższa ustawienie 0-shot (C), jest to, że dłuższy kontekst może odkryć więcej [zapamiętywania]’

Większe modele, wyższe ryzyko

W odniesieniu do potencjału takich podejść do wydobywania danych osobowych z wytrenowanych modeli, autorzy zauważają:

‘Dla wszystkich znanych domen, nieznanych domen i ustawień kontekstu, istnieje znaczna poprawa w dokładności, gdy przechodzimy od modelu 125M do modelu 1,3B. A w większości przypadków, gdy przechodzimy od modelu 1,3B do modelu 2,7B, również następuje wzrost dokładności przewidywania.’

Badacze proponują dwa możliwe wyjaśnienia tego zjawiska. Po pierwsze, modele o wyższych parametrach są po prostu w stanie zapamiętać większą ilość danych treningowych. Po drugie, większe modele są bardziej zaawansowane i lepiej rozumieją opracowane podpowiedzi, dzięki czemu mogą “połączyć” rozproszone informacje o osobie.

Stwierdzają jednak, że w obecnej sytuacji na szczycie techniki informacje osobiste są “relatywnie bezpieczne” przed takimi atakami.

Jako środek zaradczy przeciwko temu wektorowi ataku, w obliczu nowych modeli, które są coraz większe i bardziej zaawansowane, autorzy radzą, aby architektury były poddawane rygorystycznemu przetworzeniu wstępnemu w celu odfiltrowania informacji osobistych; aby rozważyć trenowanie z różnicowo prywatnym gradientem; oraz aby uwzględniać filtry w każdym środowisku post-procesowania, takim jak API (na przykład, API DALL-E 2 OpenAI zawiera wiele filtrów, w tym moderację podpowiedzi).

Radzą również przeciwko używaniu adresów e-mail, które spełniają łatwe do odgadnięcia i standardowe wzorce, choć ta rada jest już standardem w cyberbezpieczeństwie.

 

* Moja замена hiperłączy na cytaty wstawione przez autorów.

Pierwotnie opublikowane 26 maja 2022 r.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai