KÄ t Andersona
Ochrona prompty przed wyciekiem danych z LLM

Opinia InteresujÄ ca praca IBM NeurIPS 2024 zostaÅa opublikowana pod koniec 2024 roku i ponownie pojawiÅa siÄ na Arxiv w zeszÅym tygodniu. Proponuje system, ktÃģry moÅže automatycznie interweniowaÄ w celu ochrony uÅžytkownikÃģw przed przekazywaniem poufnych informacji w trakcie rozmowy z modelem jÄzykowym (LLM), takim jak ChatGPT.

PrzykÅady makiet uÅžyte w badaniu uÅžytkownikÃģw w celu okreÅlenia, w jaki sposÃģb ludzie chcieliby wchodziÄ w interakcjÄ z usÅugÄ interwencji w promtach. ÅđrÃģdÅo: https://arxiv.org/pdf/2502.18509
PowyÅžsze makietki zostaÅy wykorzystane przez badaczy IBM w badaniu w celu przetestowania potencjalnych problemÃģw zwiÄ zanych z tego rodzaju âinterwencjÄ â.
ChociaÅž szczegÃģÅy dotyczÄ ce implementacji GUI sÄ ograniczone, moÅžemy zaÅoÅžyÄ, Åže takie funkcjonalnoÅci mogÄ byÄ albo wbudowane w wtyczkÄ przeglÄ darki komunikujÄ cÄ siÄ z lokalnym âfirewallemâ frameworkiem LLM; albo Åže mogÄ byÄ stworzone aplikacje, ktÃģre mogÄ bezpoÅrednio ÅÄ czyÄ siÄ z (na przykÅad) interfejsem API OpenAI, efektywnie odtwarzajÄ c wÅasny program pobieralny dla ChatGPT, ale z dodatkowymi zabezpieczeniami.
Sam ChatGPT automatycznie cenzuruje odpowiedzi na prompty, ktÃģre uznaje za zawierajÄ ce krytyczne informacje, takie jak dane bankowe:

ChatGPT odmawia udziaÅu w promtach, ktÃģre zawierajÄ postrzegane informacje o krytycznym bezpieczeÅstwie, takie jak dane bankowe (szczegÃģÅy w promcie powyÅžej sÄ fikcyjne i nieaktywne). ÅđrÃģdÅo: https://chatgpt.com/
Jednak ChatGPT jest znacznie bardziej tolerancyjny w odniesieniu do rÃģÅžnych rodzajÃģw informacji osobistych â nawet jeÅli rozpowszechnianie takich informacji w jakikolwiek sposÃģb nie byÅoby w najlepszym interesie uÅžytkownika (w tym przypadku byÄ moÅže z powodu rÃģÅžnych powodÃģw zwiÄ zanych z pracÄ i ujawnieniem):

PrzykÅad powyÅžej jest fikcyjny, ale ChatGPT nie wahaj siÄ angaÅžowaÄ w rozmowÄ z uÅžytkownikiem na temat wraÅžliwych informacji, ktÃģre mogÄ stanowiÄ potencjalne ryzyko reputacyjne lub dochodowe (przykÅad powyÅžej jest caÅkowicie fikcyjny).
W powyÅžszym przypadku lepiej byÅoby napisaÄ: âJaka jest znaczenie rozpoznania biaÅaczki na zdolnoÅÄ czÅowieka do pisania i na jego mobilnoÅÄ?â
Projekt IBM identyfikuje i reinterpretuje takie ÅžÄ dania z âosobistegoâ do âogÃģlnegoâ stanowiska.

Schemat systemu IBM, ktÃģry wykorzystuje lokalne LLM lub heurystyki oparte na NLP do identyfikacji wraÅžliwych materiaÅÃģw w potencjalnych promtach.
ZaÅoÅženie, Åže materiaÅy zebrane przez LLM online, na tym etapie entuzjastycznego przyjÄcia AI chat, nigdy nie bÄdÄ przenoszone do kolejnych modeli ani do pÃģÅšniejszych ram reklamowych, ktÃģre mogÄ wykorzystywaÄ zapytania uÅžytkownikÃģw do celÃģw ukierunkowanej reklamy.
ChociaÅž nie ma takiego systemu ani ukÅadu, ktÃģry jest znany obecnie, nie byÅo takiej funkcjonalnoÅci dostÄpnej na poczÄ tku przyjÄcia internetu w latach 90.; od tego czasu udostÄpnianie informacji miÄdzy domenami w celu dostarczania personalizowanej reklamy doprowadziÅo do rÃģÅžnorodnych skandali, a takÅže paranoi.
Dlatego historia sugeruje, Åže lepiej byÅoby zabezpieczyÄ dane wejÅciowe LLM teraz, zanim takie dane zgromadzÄ siÄ w duÅžych iloÅciach, i zanim nasze wpisy LLM nie stanÄ siÄ czÄÅciÄ cyklicznych baz danych i/lub modeli, lub innych struktur i schematÃģw opartych na informacjach.
PamiÄtaj mnie?
Jednym z czynnikÃģw, ktÃģre przemawiajÄ przeciwko uÅžyciu âogÃģlnychâ lub zabezpieczonych promtÃģw LLM, jest to, Åže moÅžliwoÅÄ dostosowania drogiego API-only LLM, takiego jak ChatGPT, jest doÅÄ kuszÄ ca, przynajmniej na obecnym etapie rozwoju â ale moÅže to wiÄ zaÄ siÄ z dÅugoterminowÄ ekspozycjÄ na prywatne informacje.
CzÄsto proszÄ ChatGPT o pomoc w tworzeniu skryptÃģw Windows PowerShell i plikÃģw BAT w celu automatyzacji procesÃģw, a takÅže w innych kwestiach technicznych. W tym celu uwaÅžam, Åže jest uÅžyteczne, aby system trwale zapamiÄtaÅ szczegÃģÅy dotyczÄ ce mojego sprzÄtu; moich istniejÄ cych umiejÄtnoÅci technicznych (lub ich braku); oraz rÃģÅžnych innych czynnikÃģw Årodowiskowych i niestandardowych reguÅ:

ChatGPT pozwala uÅžytkownikowi na rozwiniÄcie âpamiÄciâ, ktÃģra zostanie zastosowana, gdy system rozwaÅža odpowiedzi na przyszÅe prompty.
Nieuchronnie, to utrwala informacje o mnie na zewnÄtrznych serwerach, podlegajÄ cych warunkom, ktÃģre mogÄ ewoluowaÄ w czasie, bez Åžadnej gwarancji, Åže OpenAI (choÄ mogÅaby to byÄ inna gÅÃģwna firma LLM) szanuje warunki, ktÃģre okreÅliÅa.
OgÃģlnie rzecz biorÄ c, moÅžliwoÅÄ tworzenia âpamiÄciâ w ChatGPT jest najbardziej uÅžyteczna ze wzglÄdu na ograniczone okno uwagi LLM; bez dÅugoterminowych (personalizowanych) wbudowaÅ uÅžytkownik czuje, Åže rozmawia z jednostkÄ cierpiÄ cÄ na anterogradnÄ amnezjÄ.
Trudno powiedzieÄ, czy nowsze modele bÄdÄ w stanie zapewniÄ uÅžyteczne odpowiedzi bez potrzeby zapisywania pamiÄci lub tworzenia niestandardowych GPT, ktÃģre sÄ przechowywane online.
Tymczasowa amnezja
ChociaÅž moÅžna uczyniÄ rozmowy z ChatGPT âtymczasowymiâ, jest uÅžyteczne, aby mieÄ historiÄ rozmÃģw jako odniesienie, ktÃģre moÅžna destylowaÄ, gdy czas pozwoli, w bardziej spÃģjne lokalne rekordy, perhaps na platformie do notowania; ale w kaÅždym przypadku nie moÅžemy wiedzieÄ dokÅadnie, co siÄ dzieje z tymi âporzuconymiâ rozmowami (chociaÅž OpenAI stwierdza, Åže nie bÄdÄ one wykorzystywane do szkolenia, nie stwierdza, Åže sÄ niszczone), w oparciu o infrastrukturÄ ChatGPT. Wszystko, co wiemy, to to, Åže rozmowy nie pojawiajÄ siÄ juÅž w naszej historii, gdy âTymczasowe rozmowyâ sÄ wÅÄ czone w ChatGPT.
RÃģÅžne niedawne kontrowersje wskazujÄ , Åže dostawcy oparte na API, tacy jak OpenAI, nie powinni byÄ pozostawieni samodzielnie odpowiedzialnymi za ochronÄ prywatnoÅci uÅžytkownika, w tym odkrycie pojawiajÄ cej siÄ pamiÄci, co oznacza, Åže wiÄksze LLM sÄ bardziej skÅonne do zapamiÄtywania niektÃģrych przykÅadÃģw szkoleniowych w caÅoÅci, zwiÄkszajÄ c ryzyko ujawnienia danych uÅžytkownika â wÅrÃģd innych publicznych incydentÃģw, ktÃģre przekonaÅy wiele duÅžych firm, takich jak Samsung, do zakazu LLM do uÅžytku wewnÄtrznego.
MyÅl inaczej
Ten konflikt miÄdzy ekstremalnÄ uÅžytecznoÅciÄ a jawnym potencjalnym ryzykiem LLM wymagaÅ bÄdzie pewnych pomysÅowych rozwiÄ zaÅ â a propozycja IBM wydaje siÄ interesujÄ cym podstawowym szkicem w tym kierunku.

Trzy reformulacje oparte na IBM, ktÃģre balansujÄ uÅžytecznoÅÄ z prywatnoÅciÄ danych. W najniÅžszej (rÃģÅžowej) pasie widzimy promt, ktÃģry jest poza moÅžliwoÅciami systemu do zabezpieczenia w znaczÄ cy sposÃģb.
PodejÅcie IBM przechwytuje wychodzÄ ce pakiety do LLM na poziomie sieciowym i przebudowuje je, jeÅli jest to konieczne, zanim oryginaÅ moÅže byÄ wysÅany. Bardziej rozbudowane integracje GUI widoczne na poczÄ tku artykuÅu sÄ tylko ilustracjÄ , w jaki sposÃģb takie podejÅcie mogÅoby ewoluowaÄ, gdyby byÅo rozwijane.
OczywiÅcie, bez wystarczajÄ cej agencyjnoÅci uÅžytkownik moÅže nie zrozumieÄ, Åže otrzymuje odpowiedÅš na nieco zmodyfikowanÄ wersjÄ swojego oryginalnego wpisu. Ten brak przejrzystoÅci jest rÃģwnowaÅžny z tym, jaki wystÄpuje w przypadku zapory sieciowej, ktÃģra blokuje dostÄp do witryny lub usÅugi bez poinformowania uÅžytkownika, ktÃģry moÅže wÃģwczas bÅÄdnie szukaÄ innych przyczyn problemu.
Prompty jako zagroÅženia bezpieczeÅstwa
Perspektywa âinterwencji w promtachâ przypomina bezpieczeÅstwo systemu Windows, ktÃģre ewoluowaÅo od luÅšnej kolekcji (opcjonalnie instalowanych) komercyjnych produktÃģw w latach 90. do nieopcjonalnego i rygorystycznie egzekwowanego zestawu narzÄdzi obrony sieciowej, ktÃģre sÄ standardowo dostarczane z instalacjÄ systemu Windows i ktÃģre wymagajÄ pewnego wysiÅku, aby je wyÅÄ czyÄ lub osÅabiÄ.
JeÅli sanitacja promtÃģw ewoluuje tak, jak firewalle sieciowe w ciÄ gu ostatnich 30 lat, propozycja IBM moÅže posÅuÅžyÄ jako plan dla przyszÅoÅci: wdroÅženie w peÅni lokalnego LLM na maszynie uÅžytkownika w celu filtrowania wychodzÄ cych promtÃģw skierowanych do znanych API LLM. Taki system musiaÅby naturalnie integrowaÄ siÄ z frameworkami GUI i powiadomieniami, dajÄ c uÅžytkownikom kontrolÄ â chyba Åže polityki administracyjne je wyÅÄ czÄ , co czÄsto zdarza siÄ w Årodowiskach biznesowych.
Badacze przeprowadzili analizÄ wersji open-source ShareGPT w celu zrozumienia, jak czÄsto prywatnoÅÄ kontekstowa jest naruszana w scenariuszach rzeczywistych.
Llama-3.1-405B-Instruct zostaÅ wykorzystany jako model âsÄdziaâ do wykrywania naruszeÅ integralnoÅci kontekstowej. Z duÅžej kolekcji rozmÃģw, podzbiÃģr rozmÃģw jednowymiarowych zostaÅ przeanalizowany na podstawie dÅugoÅci. Model sÄdzia oceniÅ kontekst, informacje wraÅžliwe i koniecznoÅÄ wykonania zadania, co doprowadziÅo do identyfikacji rozmÃģw zawierajÄ cych potencjalne naruszenia integralnoÅci kontekstowej.
WiÄkszy podzbiÃģr tych rozmÃģw, ktÃģre wykazaÅy wyraÅšne naruszenia prywatnoÅci kontekstowej, zostaÅ poddany dalszej analizie.
RamÄ wdroÅžono przy uÅžyciu modeli, ktÃģre sÄ mniejsze niÅž typowi agenci czatu, takie jak ChatGPT, aby umoÅžliwiÄ wdroÅženie lokalne za pomocÄ Ollama.

Schemat systemu interwencji w promtach.
Trzy LLM ocenione to Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; i DeepSeek-R1-Distill-Llama-8B.
Wpisy uÅžytkownikÃģw sÄ przetwarzane przez ramÄ w trzech etapach: identyfikacja kontekstu; klasyfikacja informacji wraÅžliwych; i przebudowanie.
Zaimplementowano dwa podejÅcia do klasyfikacji informacji wraÅžliwych: dynamiczna i ustrukturyzowana klasyfikacja: dynamiczna klasyfikacja okreÅla niezbÄdne szczegÃģÅy na podstawie ich uÅžycia w okreÅlonej rozmowie; ustrukturyzowana klasyfikacja pozwala na okreÅlenie predefiniowanej listy atrybutÃģw wraÅžliwych, ktÃģre sÄ zawsze uwaÅžane za nieistotne. Model przebudowuje promt, jeÅli wykryje nieistotne szczegÃģÅy wraÅžliwe, usuwajÄ c je lub przebudowujÄ c, aby zminimalizowaÄ ryzyko prywatnoÅci, jednoczeÅnie zachowujÄ c uÅžytecznoÅÄ.
ReguÅy domowe
ChociaÅž ustrukturyzowana klasyfikacja jako pojÄcie nie jest dobrze zilustrowana w pracy IBM, jest najbardziej podobna do metody âPrywatnych definicji danychâ w inicjatywie Private Prompts, ktÃģra zapewnia pobieralny program, ktÃģry moÅže przebudowywaÄ prompty â choÄ bez moÅžliwoÅci bezpoÅredniej interwencji na poziomie sieci, jak to robi podejÅcie IBM (zamiast tego uÅžytkownik musi skopiowaÄ i wkleiÄ zmodyfikowane prompty).

Wykonywalny Private Prompts pozwala na listÄ alternatywnych zastÄ pieÅ dla tekstu wprowadzonego przez uÅžytkownika.
Na powyÅžszym obrazie widaÄ, Åže uÅžytkownik Private Prompts moÅže zaprogramowaÄ automatyczne zastÄ pienia dla przypadkÃģw informacji wraÅžliwych. W obu przypadkach, dla Private Prompts i metody IBM, wydaje siÄ maÅo prawdopodobne, Åže uÅžytkownik z wystarczajÄ cÄ ÅwiadomoÅciÄ i wglÄ dem w siebie, aby skuratyowaÄ takÄ listÄ, rzeczywiÅcie potrzebowaÅby tego produktu â chociaÅž mÃģgÅby go zbudowaÄ w czasie, gdyby zdarzenia siÄ kumulowaÅy.
W roli administratora ustrukturyzowana klasyfikacja mogÅaby dziaÅaÄ jako naÅoÅžona zapora lub sieÄ cenzury dla pracownikÃģw; a w sieci domowej mogÅaby, z pewnymi trudnymi dostosowaniami, staÄ siÄ domowÄ filtrÄ sieciowÄ dla wszystkich uÅžytkownikÃģw sieci; ale ostatecznie, ta metoda jest raczej zbÄdna, poniewaÅž uÅžytkownik, ktÃģry mÃģgÅby jÄ poprawnie skonfigurowaÄ, mÃģgÅby rÃģwnieÅž samodzielnie cenzurowaÄ siÄ skutecznie od samego poczÄ tku.
Opinia ChatGPT
PoniewaÅž ChatGPT niedawno uruchomiÅ swoje gÅÄbokie narzÄdzie badawcze dla pÅatnych uÅžytkownikÃģw, wykorzystaÅem tÄ funkcjonalnoÅÄ, aby poprosiÄ ChatGPT o przeglÄ d powiÄ zanej literatury i podanie âcynicznegoâ spojrzenia na pracÄ IBM. OtrzymaÅem najbardziej obronny i lekcewaÅžÄ cy odpowiedÅš, jakÄ kiedykolwiek otrzymaÅem, gdy poprosiÅem o ocenÄ lub analizÄ nowej publikacji:

ChatGPT-4o ma niskÄ opiniÄ o projekcie IBM.
âJeÅli uÅžytkownicy nie ufajÄ OpenAI, Google lub Anthropic, aby odpowiedzialnie obsÅuÅžyÄ ich dane,â ChatGPT twierdzi. âdlaczego mieliby ufaÄ warstwie oprogramowania poÅredniczÄ cej miÄdzy nimi a AI? PoÅrednik ten staje siÄ nowym punktem awarii â potencjalnie rejestrujÄ c, nieprawidÅowo obsÅugujÄ c lub nawet ujawniajÄ c dane przed ich dotarciem do LLM. Niczego to nie rozwiÄ zuje, jeÅli tylko tworzy nowÄ jednostkÄ do wykorzystania danych uÅžytkownika.â
Ten sprzeciw wydaje siÄ samolubny i niewÅaÅciwy, biorÄ c pod uwagÄ bogatÄ historiÄ projektÃģw open-source, ktÃģre rzeczywiÅcie korzystajÄ uÅžytkownikom koÅcowym dziÄki dÅugofalowym wysiÅkom spoÅecznoÅci deweloperÃģw i wspÃģÅpracownikÃģw; oraz biorÄ c pod uwagÄ rosnÄ cy potencjaÅ urzÄ dzeÅ mobilnych do uruchamiania â a nawet szkolenia â lekkich LLM. Na pewno w tym przypadku przypadek uÅžycia nie jest szczegÃģlnie wymagajÄ cy.
NastÄpnie ChatGPT pewnie pomija punkt majÄ cy na celu zapewnienie lekkiego LLM nadzoru nad wprowadzaniem danych do komercyjnego LLM, ktÃģre nie mogÅoby byÄ uruchomione na maszynie lokalnej (poniewaÅž LLM jest zbyt duÅžy, a zezwolenie na dostÄp lokalny jest zbyt ryzykowne dla firmy, ktÃģra je tworzy):
âSkuteczne filtrowanie prywatnoÅci wymaga zrozumienia wprowadzanych danych przed podjÄciem decyzji, co naleÅžy usunÄ Ä. JeÅli poÅrednik jest wystarczajÄ co inteligentny, aby rozpoznaÄ dane wraÅžliwe (nazwy, adresy, dane finansowe), to juÅž przetwarza i analizuje te dane â co oznacza, Åže musi je przechowywaÄ lub badaÄ, co jest tym, czego ma uniknÄ Ä.
âWprowadza to paradoks: a) GÅupi filtr (podstawowa substitucja regex) bÄdzie nieskuteczny i przegapi delikatne ryzyka prywatnoÅci. b) Inteligentny filtr (przebudowa LLM) musi przetworzyÄ caÅe wprowadzenie, co czyni go rÃģwnie niebezpiecznym, jak oryginalny LLM.
âJeÅli ufasz poÅrednikowi wystarczajÄ co, aby przeczytaÄ i przebudowaÄ twoje wprowadzenia, to dlaczego nie ufasz samemu LLM?â
OdpowiedÅš na ostatnie pytanie brzmi, Åže lokalny LLM ma byÄ caÅkowicie po stronie uÅžytkownika i nieuchronnie open-source, z minimalnÄ lub zerowÄ potrzebÄ dostÄpu do sieci. RÃģwnowaÅžna wersja komercyjna, niezaleÅžnie od intencji na poczÄ tku, byÅaby w koÅcu podatna na korporacyjne przesuniÄcia i zmiany w warunkach Åwiadczenia usÅug, podczas gdy odpowiednia licencja open-source uniemoÅžliwiÅaby tego rodzaju ânieuchronnÄ korupcjÄâ.
ChatGPT twierdziÅ dalej, Åže propozycja IBM âÅamie intencjÄ uÅžytkownikaâ, poniewaÅž mogÅaby reinterpretowaÄ promt w sposÃģb, ktÃģry wpÅywa na jego uÅžytecznoÅÄ. Jednak jest to szerszy problem w sanitacji promtÃģw, a nie specyficzny dla tego przypadku uÅžycia.
Na koniec (ignorujÄ c sugestiÄ, aby uÅžywaÄ lokalnych LLM âzamiastâ, co jest dokÅadnie tym, co proponuje praca IBM), ChatGPT stwierdziÅ, Åže metoda IBM reprezentuje barierÄ dla przyjÄcia z powodu âtarcia uÅžytkownikaâ wynikajÄ cego z implementacji ostrzeÅžeÅ i metod edycyjnych w czacie.
Tu ChatGPT moÅže mieÄ racjÄ; ale jeÅli znaczne ciÅnienie zostanie wywarte z powodu dalszych incydentÃģw publicznych, lub jeÅli zyski w pewnej strefie geograficznej sÄ zagroÅžone przez rosnÄ cÄ regulacjÄ (a firma odmawia po prostu opuÅciÄ caÅy dotkniÄty region), historia techniki konsumenckiej sugeruje, Åže zabezpieczenia ostatecznie przestanÄ byÄ opcjonalne w kaÅždym przypadku.
Podsumowanie
Nie moÅžemy realistycznie oczekiwaÄ, Åže OpenAI kiedykolwiek wdroÅžy zabezpieczenia takiego rodzaju, jak te, ktÃģre sÄ proponowane w pracy IBM, i w centralnej koncepcji za niÄ ; przynajmniej nie skutecznie.
I na pewno nie globalnie; tak jak Apple blokuje pewne funkcje iPhoneâa w Europie, a LinkedIn ma rÃģÅžne reguÅy dotyczÄ ce wykorzystania danych uÅžytkownikÃģw w rÃģÅžnych krajach, jest rozsÄ dne stwierdzenie, Åže kaÅžda firma AI bÄdzie domyÅlnie stosowaÄ najbardziej lukratywne warunki i warunki, ktÃģre sÄ tolerowane przez kaÅždy konkretny kraj, w ktÃģrym dziaÅa â w kaÅždym przypadku, kosztem prawa uÅžytkownika do prywatnoÅci danych, jeÅli jest to konieczne.
Â
Pierwotnie opublikowane w czwartek, 27 lutego 2025
Zaktualizowane w czwartek, 27 lutego 2025, 15:47:11, z powodu nieprawidÅowego linku zwiÄ zanego z Apple â MA












