Kąt Andersona

Ochrona prompty przed wyciekiem danych z LLM

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

Opinia Interesująca praca IBM NeurIPS 2024 została opublikowana pod koniec 2024 roku i ponownie pojawiła się na Arxiv w zeszłym tygodniu. Proponuje system, ktÃģry moÅže automatycznie interweniować w celu ochrony uÅžytkownikÃģw przed przekazywaniem poufnych informacji w trakcie rozmowy z modelem językowym (LLM), takim jak ChatGPT.

Przykłady makiet uÅžyte w badaniu uÅžytkownikÃģw w celu określenia, w jaki sposÃģb ludzie chcieliby wchodzić w interakcję z usługą interwencji w promtach. ÅđrÃģdło: https://arxiv.org/pdf/2502.18509

Przykłady makiet uÅžyte w badaniu uÅžytkownikÃģw w celu określenia, w jaki sposÃģb ludzie chcieliby wchodzić w interakcję z usługą interwencji w promtach. ÅđrÃģdło: https://arxiv.org/pdf/2502.18509

PowyÅžsze makietki zostały wykorzystane przez badaczy IBM w badaniu w celu przetestowania potencjalnych problemÃģw związanych z tego rodzaju “interwencją”.

ChociaÅž szczegÃģły dotyczące implementacji GUI są ograniczone, moÅžemy załoÅžyć, Åže takie funkcjonalności mogą być albo wbudowane w wtyczkę przeglądarki komunikującą się z lokalnym “firewallem” frameworkiem LLM; albo Åže mogą być stworzone aplikacje, ktÃģre mogą bezpośrednio łączyć się z (na przykład) interfejsem API OpenAI, efektywnie odtwarzając własny program pobieralny dla ChatGPT, ale z dodatkowymi zabezpieczeniami.

Sam ChatGPT automatycznie cenzuruje odpowiedzi na prompty, ktÃģre uznaje za zawierające krytyczne informacje, takie jak dane bankowe:

ChatGPT odmawia udziału w promtach, ktÃģre zawierają postrzegane informacje o krytycznym bezpieczeństwie, takie jak dane bankowe (szczegÃģły w promcie powyÅžej są fikcyjne i nieaktywne). ÅđrÃģdło: https://chatgpt.com/

ChatGPT odmawia udziału w promtach, ktÃģre zawierają postrzegane informacje o krytycznym bezpieczeństwie, takie jak dane bankowe (szczegÃģły w promcie powyÅžej są fikcyjne i nieaktywne). ÅđrÃģdło: https://chatgpt.com/

Jednak ChatGPT jest znacznie bardziej tolerancyjny w odniesieniu do rÃģÅžnych rodzajÃģw informacji osobistych – nawet jeśli rozpowszechnianie takich informacji w jakikolwiek sposÃģb nie byłoby w najlepszym interesie uÅžytkownika (w tym przypadku być moÅže z powodu rÃģÅžnych powodÃģw związanych z pracą i ujawnieniem):

Przykład powyÅžej jest fikcyjny, ale ChatGPT nie wahaj się angaÅžować w rozmowę z uÅžytkownikiem na temat wraÅžliwych informacji, ktÃģre mogą stanowić potencjalne ryzyko reputacyjne lub dochodowe (przykład powyÅžej jest całkowicie fikcyjny).

Przykład powyÅžej jest fikcyjny, ale ChatGPT nie wahaj się angaÅžować w rozmowę z uÅžytkownikiem na temat wraÅžliwych informacji, ktÃģre mogą stanowić potencjalne ryzyko reputacyjne lub dochodowe (przykład powyÅžej jest całkowicie fikcyjny).

W powyÅžszym przypadku lepiej byłoby napisać: ‘Jaka jest znaczenie rozpoznania białaczki na zdolność człowieka do pisania i na jego mobilność?’

Projekt IBM identyfikuje i reinterpretuje takie Şądania z “osobistego” do “ogÃģlnego” stanowiska.

Schemat systemu IBM, ktÃģry wykorzystuje lokalne LLM lub heurystyki oparte na NLP do identyfikacji wraÅžliwych materiałÃģw w potencjalnych promtach.

Schemat systemu IBM, ktÃģry wykorzystuje lokalne LLM lub heurystyki oparte na NLP do identyfikacji wraÅžliwych materiałÃģw w potencjalnych promtach.

ZałoÅženie, Åže materiały zebrane przez LLM online, na tym etapie entuzjastycznego przyjęcia AI chat, nigdy nie będą przenoszone do kolejnych modeli ani do pÃģÅšniejszych ram reklamowych, ktÃģre mogą wykorzystywać zapytania uÅžytkownikÃģw do celÃģw ukierunkowanej reklamy.

ChociaÅž nie ma takiego systemu ani układu, ktÃģry jest znany obecnie, nie było takiej funkcjonalności dostępnej na początku przyjęcia internetu w latach 90.; od tego czasu udostępnianie informacji między domenami w celu dostarczania personalizowanej reklamy doprowadziło do rÃģÅžnorodnych skandali, a takÅže paranoi.

Dlatego historia sugeruje, Åže lepiej byłoby zabezpieczyć dane wejściowe LLM teraz, zanim takie dane zgromadzą się w duÅžych ilościach, i zanim nasze wpisy LLM nie staną się częścią cyklicznych baz danych i/lub modeli, lub innych struktur i schematÃģw opartych na informacjach.

Pamiętaj mnie?

Jednym z czynnikÃģw, ktÃģre przemawiają przeciwko uÅžyciu “ogÃģlnych” lub zabezpieczonych promtÃģw LLM, jest to, Åže moÅžliwość dostosowania drogiego API-only LLM, takiego jak ChatGPT, jest dość kusząca, przynajmniej na obecnym etapie rozwoju – ale moÅže to wiązać się z długoterminową ekspozycją na prywatne informacje.

Często proszę ChatGPT o pomoc w tworzeniu skryptÃģw Windows PowerShell i plikÃģw BAT w celu automatyzacji procesÃģw, a takÅže w innych kwestiach technicznych. W tym celu uwaÅžam, Åže jest uÅžyteczne, aby system trwale zapamiętał szczegÃģły dotyczące mojego sprzętu; moich istniejących umiejętności technicznych (lub ich braku); oraz rÃģÅžnych innych czynnikÃģw środowiskowych i niestandardowych reguł:

ChatGPT pozwala uÅžytkownikowi na rozwinięcie “pamięci”, ktÃģra zostanie zastosowana, gdy system rozwaÅža odpowiedzi na przyszłe prompty.

Nieuchronnie, to utrwala informacje o mnie na zewnętrznych serwerach, podlegających warunkom, ktÃģre mogą ewoluować w czasie, bez Åžadnej gwarancji, Åže OpenAI (choć mogłaby to być inna głÃģwna firma LLM) szanuje warunki, ktÃģre określiła.

OgÃģlnie rzecz biorąc, moÅžliwość tworzenia “pamięci” w ChatGPT jest najbardziej uÅžyteczna ze względu na ograniczone okno uwagi LLM; bez długoterminowych (personalizowanych) wbudowań uÅžytkownik czuje, Åže rozmawia z jednostką cierpiącą na anterogradną amnezję.

Trudno powiedzieć, czy nowsze modele będą w stanie zapewnić uÅžyteczne odpowiedzi bez potrzeby zapisywania pamięci lub tworzenia niestandardowych GPT, ktÃģre są przechowywane online.

Tymczasowa amnezja

ChociaÅž moÅžna uczynić rozmowy z ChatGPT “tymczasowymi”, jest uÅžyteczne, aby mieć historię rozmÃģw jako odniesienie, ktÃģre moÅžna destylować, gdy czas pozwoli, w bardziej spÃģjne lokalne rekordy, perhaps na platformie do notowania; ale w kaÅždym przypadku nie moÅžemy wiedzieć dokładnie, co się dzieje z tymi “porzuconymi” rozmowami (chociaÅž OpenAI stwierdza, Åže nie będą one wykorzystywane do szkolenia, nie stwierdza, Åže są niszczone), w oparciu o infrastrukturę ChatGPT. Wszystko, co wiemy, to to, Åže rozmowy nie pojawiają się juÅž w naszej historii, gdy “Tymczasowe rozmowy” są włączone w ChatGPT.

RÃģÅžne niedawne kontrowersje wskazują, Åže dostawcy oparte na API, tacy jak OpenAI, nie powinni być pozostawieni samodzielnie odpowiedzialnymi za ochronę prywatności uÅžytkownika, w tym odkrycie pojawiającej się pamięci, co oznacza, Åže większe LLM są bardziej skłonne do zapamiętywania niektÃģrych przykładÃģw szkoleniowych w całości, zwiększając ryzyko ujawnienia danych uÅžytkownika – wśrÃģd innych publicznych incydentÃģw, ktÃģre przekonały wiele duÅžych firm, takich jak Samsung, do zakazu LLM do uÅžytku wewnętrznego.

Myśl inaczej

Ten konflikt między ekstremalną uÅžytecznością a jawnym potencjalnym ryzykiem LLM wymagał będzie pewnych pomysłowych rozwiązań – a propozycja IBM wydaje się interesującym podstawowym szkicem w tym kierunku.

Trzy reformulacje oparte na IBM, ktÃģre balansują uÅžyteczność z prywatnością danych. W najniÅžszej (rÃģÅžowej) pasie widzimy promt, ktÃģry jest poza moÅžliwościami systemu do zabezpieczenia w znaczący sposÃģb.

Trzy reformulacje oparte na IBM, ktÃģre balansują uÅžyteczność z prywatnością danych. W najniÅžszej (rÃģÅžowej) pasie widzimy promt, ktÃģry jest poza moÅžliwościami systemu do zabezpieczenia w znaczący sposÃģb.

Podejście IBM przechwytuje wychodzące pakiety do LLM na poziomie sieciowym i przebudowuje je, jeśli jest to konieczne, zanim oryginał moÅže być wysłany. Bardziej rozbudowane integracje GUI widoczne na początku artykułu są tylko ilustracją, w jaki sposÃģb takie podejście mogłoby ewoluować, gdyby było rozwijane.

Oczywiście, bez wystarczającej agencyjności uÅžytkownik moÅže nie zrozumieć, Åže otrzymuje odpowiedÅš na nieco zmodyfikowaną wersję swojego oryginalnego wpisu. Ten brak przejrzystości jest rÃģwnowaÅžny z tym, jaki występuje w przypadku zapory sieciowej, ktÃģra blokuje dostęp do witryny lub usługi bez poinformowania uÅžytkownika, ktÃģry moÅže wÃģwczas błędnie szukać innych przyczyn problemu.

Prompty jako zagroÅženia bezpieczeństwa

Perspektywa “interwencji w promtach” przypomina bezpieczeństwo systemu Windows, ktÃģre ewoluowało od luÅšnej kolekcji (opcjonalnie instalowanych) komercyjnych produktÃģw w latach 90. do nieopcjonalnego i rygorystycznie egzekwowanego zestawu narzędzi obrony sieciowej, ktÃģre są standardowo dostarczane z instalacją systemu Windows i ktÃģre wymagają pewnego wysiłku, aby je wyłączyć lub osłabić.

Jeśli sanitacja promtÃģw ewoluuje tak, jak firewalle sieciowe w ciągu ostatnich 30 lat, propozycja IBM moÅže posłuÅžyć jako plan dla przyszłości: wdroÅženie w pełni lokalnego LLM na maszynie uÅžytkownika w celu filtrowania wychodzących promtÃģw skierowanych do znanych API LLM. Taki system musiałby naturalnie integrować się z frameworkami GUI i powiadomieniami, dając uÅžytkownikom kontrolę – chyba Åže polityki administracyjne je wyłączą, co często zdarza się w środowiskach biznesowych.

Badacze przeprowadzili analizę wersji open-source ShareGPT w celu zrozumienia, jak często prywatność kontekstowa jest naruszana w scenariuszach rzeczywistych.

Llama-3.1-405B-Instruct został wykorzystany jako model “sędzia” do wykrywania naruszeń integralności kontekstowej. Z duÅžej kolekcji rozmÃģw, podzbiÃģr rozmÃģw jednowymiarowych został przeanalizowany na podstawie długości. Model sędzia ocenił kontekst, informacje wraÅžliwe i konieczność wykonania zadania, co doprowadziło do identyfikacji rozmÃģw zawierających potencjalne naruszenia integralności kontekstowej.

Większy podzbiÃģr tych rozmÃģw, ktÃģre wykazały wyraÅšne naruszenia prywatności kontekstowej, został poddany dalszej analizie.

Ramę wdroÅžono przy uÅžyciu modeli, ktÃģre są mniejsze niÅž typowi agenci czatu, takie jak ChatGPT, aby umoÅžliwić wdroÅženie lokalne za pomocą Ollama.

Schemat systemu interwencji w promtach.

Schemat systemu interwencji w promtach.

Trzy LLM ocenione to Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; i DeepSeek-R1-Distill-Llama-8B.

Wpisy uÅžytkownikÃģw są przetwarzane przez ramę w trzech etapach: identyfikacja kontekstu; klasyfikacja informacji wraÅžliwych; i przebudowanie.

Zaimplementowano dwa podejścia do klasyfikacji informacji wraÅžliwych: dynamiczna i ustrukturyzowana klasyfikacja: dynamiczna klasyfikacja określa niezbędne szczegÃģły na podstawie ich uÅžycia w określonej rozmowie; ustrukturyzowana klasyfikacja pozwala na określenie predefiniowanej listy atrybutÃģw wraÅžliwych, ktÃģre są zawsze uwaÅžane za nieistotne. Model przebudowuje promt, jeśli wykryje nieistotne szczegÃģły wraÅžliwe, usuwając je lub przebudowując, aby zminimalizować ryzyko prywatności, jednocześnie zachowując uÅžyteczność.

Reguły domowe

ChociaÅž ustrukturyzowana klasyfikacja jako pojęcie nie jest dobrze zilustrowana w pracy IBM, jest najbardziej podobna do metody “Prywatnych definicji danych” w inicjatywie Private Prompts, ktÃģra zapewnia pobieralny program, ktÃģry moÅže przebudowywać prompty – choć bez moÅžliwości bezpośredniej interwencji na poziomie sieci, jak to robi podejście IBM (zamiast tego uÅžytkownik musi skopiować i wkleić zmodyfikowane prompty).

Wykonywalny Private Prompts pozwala na listę alternatywnych zastąpień dla tekstu wprowadzonego przez uÅžytkownika.

Wykonywalny Private Prompts pozwala na listę alternatywnych zastąpień dla tekstu wprowadzonego przez uÅžytkownika.

Na powyÅžszym obrazie widać, Åže uÅžytkownik Private Prompts moÅže zaprogramować automatyczne zastąpienia dla przypadkÃģw informacji wraÅžliwych. W obu przypadkach, dla Private Prompts i metody IBM, wydaje się mało prawdopodobne, Åže uÅžytkownik z wystarczającą świadomością i wglądem w siebie, aby skuratyować taką listę, rzeczywiście potrzebowałby tego produktu – chociaÅž mÃģgłby go zbudować w czasie, gdyby zdarzenia się kumulowały.

W roli administratora ustrukturyzowana klasyfikacja mogłaby działać jako nałoÅžona zapora lub sieć cenzury dla pracownikÃģw; a w sieci domowej mogłaby, z pewnymi trudnymi dostosowaniami, stać się domową filtrą sieciową dla wszystkich uÅžytkownikÃģw sieci; ale ostatecznie, ta metoda jest raczej zbędna, poniewaÅž uÅžytkownik, ktÃģry mÃģgłby ją poprawnie skonfigurować, mÃģgłby rÃģwnieÅž samodzielnie cenzurować się skutecznie od samego początku.

Opinia ChatGPT

PoniewaÅž ChatGPT niedawno uruchomił swoje głębokie narzędzie badawcze dla płatnych uÅžytkownikÃģw, wykorzystałem tę funkcjonalność, aby poprosić ChatGPT o przegląd powiązanej literatury i podanie “cynicznego” spojrzenia na pracę IBM. Otrzymałem najbardziej obronny i lekcewaŞący odpowiedÅš, jaką kiedykolwiek otrzymałem, gdy poprosiłem o ocenę lub analizę nowej publikacji:

ChatGPT-4o ma niską opinię o projekcie IBM.

ChatGPT-4o ma niską opinię o projekcie IBM.

‘Jeśli uÅžytkownicy nie ufają OpenAI, Google lub Anthropic, aby odpowiedzialnie obsłuÅžyć ich dane,’ ChatGPT twierdzi. ‘dlaczego mieliby ufać warstwie oprogramowania pośredniczącej między nimi a AI? Pośrednik ten staje się nowym punktem awarii – potencjalnie rejestrując, nieprawidłowo obsługując lub nawet ujawniając dane przed ich dotarciem do LLM. Niczego to nie rozwiązuje, jeśli tylko tworzy nową jednostkę do wykorzystania danych uÅžytkownika.’

Ten sprzeciw wydaje się samolubny i niewłaściwy, biorąc pod uwagę bogatą historię projektÃģw open-source, ktÃģre rzeczywiście korzystają uÅžytkownikom końcowym dzięki długofalowym wysiłkom społeczności deweloperÃģw i wspÃģłpracownikÃģw; oraz biorąc pod uwagę rosnący potencjał urządzeń mobilnych do uruchamiania – a nawet szkolenia – lekkich LLM. Na pewno w tym przypadku przypadek uÅžycia nie jest szczegÃģlnie wymagający.

Następnie ChatGPT pewnie pomija punkt mający na celu zapewnienie lekkiego LLM nadzoru nad wprowadzaniem danych do komercyjnego LLM, ktÃģre nie mogłoby być uruchomione na maszynie lokalnej (poniewaÅž LLM jest zbyt duÅžy, a zezwolenie na dostęp lokalny jest zbyt ryzykowne dla firmy, ktÃģra je tworzy):

‘Skuteczne filtrowanie prywatności wymaga zrozumienia wprowadzanych danych przed podjęciem decyzji, co naleÅžy usunąć. Jeśli pośrednik jest wystarczająco inteligentny, aby rozpoznać dane wraÅžliwe (nazwy, adresy, dane finansowe), to juÅž przetwarza i analizuje te dane – co oznacza, Åže musi je przechowywać lub badać, co jest tym, czego ma uniknąć.

‘Wprowadza to paradoks: a) Głupi filtr (podstawowa substitucja regex) będzie nieskuteczny i przegapi delikatne ryzyka prywatności. b) Inteligentny filtr (przebudowa LLM) musi przetworzyć całe wprowadzenie, co czyni go rÃģwnie niebezpiecznym, jak oryginalny LLM.

‘Jeśli ufasz pośrednikowi wystarczająco, aby przeczytać i przebudować twoje wprowadzenia, to dlaczego nie ufasz samemu LLM?’

OdpowiedÅš na ostatnie pytanie brzmi, Åže lokalny LLM ma być całkowicie po stronie uÅžytkownika i nieuchronnie open-source, z minimalną lub zerową potrzebą dostępu do sieci. RÃģwnowaÅžna wersja komercyjna, niezaleÅžnie od intencji na początku, byłaby w końcu podatna na korporacyjne przesunięcia i zmiany w warunkach świadczenia usług, podczas gdy odpowiednia licencja open-source uniemoÅžliwiłaby tego rodzaju ‘nieuchronną korupcję’.

ChatGPT twierdził dalej, Åže propozycja IBM “łamie intencję uÅžytkownika”, poniewaÅž mogłaby reinterpretować promt w sposÃģb, ktÃģry wpływa na jego uÅžyteczność. Jednak jest to szerszy problem w sanitacji promtÃģw, a nie specyficzny dla tego przypadku uÅžycia.

Na koniec (ignorując sugestię, aby uÅžywać lokalnych LLM “zamiast”, co jest dokładnie tym, co proponuje praca IBM), ChatGPT stwierdził, Åže metoda IBM reprezentuje barierę dla przyjęcia z powodu “tarcia uÅžytkownika” wynikającego z implementacji ostrzeÅžeń i metod edycyjnych w czacie.

Tu ChatGPT moÅže mieć rację; ale jeśli znaczne ciśnienie zostanie wywarte z powodu dalszych incydentÃģw publicznych, lub jeśli zyski w pewnej strefie geograficznej są zagroÅžone przez rosnącą regulację (a firma odmawia po prostu opuścić cały dotknięty region), historia techniki konsumenckiej sugeruje, Åže zabezpieczenia ostatecznie przestaną być opcjonalne w kaÅždym przypadku.

Podsumowanie

Nie moÅžemy realistycznie oczekiwać, Åže OpenAI kiedykolwiek wdroÅžy zabezpieczenia takiego rodzaju, jak te, ktÃģre są proponowane w pracy IBM, i w centralnej koncepcji za nią; przynajmniej nie skutecznie.

I na pewno nie globalnie; tak jak Apple blokuje pewne funkcje iPhone’a w Europie, a LinkedIn ma rÃģÅžne reguły dotyczące wykorzystania danych uÅžytkownikÃģw w rÃģÅžnych krajach, jest rozsądne stwierdzenie, Åže kaÅžda firma AI będzie domyślnie stosować najbardziej lukratywne warunki i warunki, ktÃģre są tolerowane przez kaÅždy konkretny kraj, w ktÃģrym działa – w kaÅždym przypadku, kosztem prawa uÅžytkownika do prywatności danych, jeśli jest to konieczne.

 

Pierwotnie opublikowane w czwartek, 27 lutego 2025

Zaktualizowane w czwartek, 27 lutego 2025, 15:47:11, z powodu nieprawidłowego linku związanego z Apple – MA

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]