Unghiul lui Anderson

Protejarea prompturilor de scurgerile de date ale LLM

mm
Adaugă Unite.AI la sursele tale preferate pe Google
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

Opinie O prezentare interesantă IBM NeurIPS 2024 a fost publicată la sfârșitul anului 2024 și a reapărut pe Arxiv săptămâna trecută. Ea propune un sistem care poate interveni automat pentru a proteja utilizatorii de la furnizarea de informații personale sau sensibile într-un mesaj atunci când au o conversație cu un model de limbaj mare (LLM) cum ar fi ChatGPT.

Exemple de machetă utilizate într-un studiu de utilizator pentru a determina modurile în care oamenii ar prefera să interacționeze cu un serviciu de intervenție la prompt.

Exemple de machetă utilizate într-un studiu de utilizator pentru a determina modurile în care oamenii ar prefera să interacționeze cu un serviciu de intervenție la prompt. Source: https://arxiv.org/pdf/2502.18509

Mock-up-urile de mai sus au fost utilizate de către cercetătorii IBM într-un studiu pentru a testa potențiala fricțiune a utilizatorilor față de acest tip de “interferență”.

Deși sunt furnizate detalii puține despre implementarea GUI, putem presupune că o astfel de funcționalitate ar putea fi încorporată într-o extensie de browser care comunică cu un cadru LLM “firewall” local; sau că o aplicație ar putea fi creată pentru a se conecta direct la (de exemplu) API-ul OpenAI, recreând efectiv programul autonom al OpenAI pentru ChatGPT, dar cu garanții suplimentare.

ChatGPT însuși cenzurează automat răspunsurile la prompturile pe care le consideră că conțin informații critice, cum ar fi detalii bancare:

ChatGPT refuză să se angajeze în prompturi care conțin informații de securitate percepute ca fiind critice, cum ar fi detalii bancare (detaliile din promptul de mai sus sunt fictive și nefuncționale).

ChatGPT refuză să se angajeze în prompturi care conțin informații de securitate percepute ca fiind critice, cum ar fi detalii bancare (detaliile din promptul de mai sus sunt fictive și nefuncționale). Source: https://chatgpt.com/

Cu toate acestea, ChatGPT este mult mai tolerant în ceea ce privește diferitele tipuri de informații personale – chiar dacă diseminarea unor astfel de informații în orice mod nu ar fi în interesul utilizatorului (în acest caz, poate din diverse motive legate de muncă și divulgare):

Exemplul de mai sus este fictiv, dar ChatGPT nu ezită să se angajeze într-o conversație cu utilizatorul pe un subiect sensibil care constituie un risc potențial pentru reputație sau venit (exemplul de mai sus este complet fictiv).

Exemplul de mai sus este fictiv, dar ChatGPT nu ezită să se angajeze într-o conversație cu utilizatorul pe un subiect sensibil care constituie un risc potențial pentru reputație sau venit (exemplul de mai sus este complet fictiv).

În cazul de mai sus, ar fi fost mai bine să se scrie: ‘Care este semnificația unui diagnostic de leucemie asupra capacității unei persoane de a scrie și asupra mobilității sale?’

Proiectul IBM identifică și reinterpretează astfel de solicitări de la o “poziție personală” la o “poziție generică”.

Schema pentru sistemul IBM, care utilizează LLM-uri locale sau heuristici bazate pe NLP pentru a identifica materialul sensibil în prompturile potențiale.

Schema pentru sistemul IBM, care utilizează LLM-uri locale sau heuristici bazate pe NLP pentru a identifica materialul sensibil în prompturile potențiale.

Acesta presupune că materialul colectat de LLM-urile online, în această etapă incipientă a adoptării entuziaste a chat-ului AI, nu va alimenta niciodată modelele ulterioare sau cadrele de publicitate care ar putea exploata interogările de căutare ale utilizatorilor pentru a oferi publicitate țintită.

Deși nu există un astfel de sistem sau aranjament cunoscut în prezent, nu a existat nici o astfel de funcționalitate disponibilă la începutul adoptării internetului în anii ’90; de atunci, compartizarea informațiilor între domenii pentru a alimenta publicitatea personalizată a condus la diverse scandaluri, precum și la paranoia.

Prin urmare, istoria sugerează că ar fi mai bine să se sanitizeze prompturile LLM în prezent, înainte ca aceste date să se acumuleze în volum și înainte ca submisile noastre LLM să se termine în baze de date ciclice permanente și/sau modele, sau alte structuri și scheme de informații.

Amintește-ți?

Un factor care cântărește împotriva utilizării “prompturilor generice” sau “sanitize” LLM este că, sincer, facilitatea de a personaliza o API scumpă LLM, cum ar fi ChatGPT, este destul de convingătoare, cel puțin în stadiul actual al artei – dar acest lucru poate implica expunerea pe termen lung a informațiilor private.

Adesea îl rog pe ChatGPT să mă ajute să formulez scripturi Windows PowerShell și fișiere BAT pentru a automatiza procese, precum și pe alte chestiuni tehnice. În acest scop, găsesc util că sistemul să memoreze permanent detalii despre hardware-ul pe care îl am disponibil; competențele mele tehnice existente (sau lipsa acestora); și diverse alte factori de mediu și reguli personalizate:

ChatGPT permite unui utilizator să dezvolte o 'memorie' de amintiri care vor fi aplicate atunci când sistemul consideră răspunsuri la prompturi viitoare.

ChatGPT permite unui utilizator să dezvolte o ‘memorie’ de amintiri care vor fi aplicate atunci când sistemul consideră răspunsuri la prompturi viitoare.

Inevitabil, aceasta păstrează informații despre mine stocate pe servere externe, supuse unor termene și condiții care pot evolua în timp, fără nicio garanție că OpenAI (deși ar putea fi orice alt furnizor LLM important) va respecta termenele stabilite.

În general, însă, capacitatea de a construi o “memorie” în ChatGPT este cel mai utilă din cauza ferestrei de atenție limitate a LLM-urilor în general; fără încorporări pe termen lung (personalizate), utilizatorul simte, frustrant, că conversează cu o entitate care suferă de amnezie anterogradă.

Este dificil de spus dacă noile modele vor deveni în cele din urmă suficient de performante pentru a oferi răspunsuri utile fără a necesita încorporări de memorie sau pentru a a crea GPT-uri personalizate stocate online.

Amnezie temporară

Deși se poate face ca conversațiile ChatGPT să fie “temporare”, este util să se aibă istoricul conversației ca referință care poate fi distilat, atunci când timpul permite, într-un registru local mai coerent, poate pe o platformă de notițe; dar, în orice caz, nu putem ști exact ce se întâmplă cu aceste “conversații abandonate” (deși OpenAI afirmă că nu vor fi utilizate pentru antrenament, nu afirmă că vor fi distruse), pe baza infrastructurii ChatGPT. Tot ceea ce știm este că conversațiile nu mai apar în istoricul nostru atunci când “Conversații temporare” este activat în ChatGPT.

Diverse controverse recente indică faptul că furnizorii de API, cum ar fi OpenAI, nu ar trebui să fie lăsați în mod necesar în sarcina protejării confidențialității utilizatorilor, inclusiv descoperirea memorizării emergente, care indică faptul că LLM-urile mai mari sunt mai susceptibile să memoreze exemple de antrenament complete, și crește riscul divulgării datelor specifice utilizatorilor – printre alte incidente publice care au determinat o mulțime de companii importante, cum ar fi Samsung, să interzică LLM-urile pentru uz intern al companiei.

Gândește diferit

Acestă tensiune între utilitatea extremă și riscul potențial al LLM-urilor va necesita soluții inventive – și propunerea IBM pare a fi un șablon de bază interesant în acest sens.

Treisprezece reformulări IBM care echilibrează utilitatea cu confidențialitatea datelor.

Treisprezece reformulări IBM care echilibrează utilitatea cu confidențialitatea datelor.

Abordarea IBM interceptează pachetele care ies către un LLM la nivel de rețea și le rescrie după cum este necesar înainte de a putea fi trimise. Integrările GUI mai elaborate prezentate la începutul articolului sunt doar ilustrative ale modului în care o astfel de abordare ar putea evolua, dacă ar fi dezvoltată.

Desigur, fără o agenție suficientă, utilizatorul nu poate înțelege că primește un răspuns la o reformulare ușor modificată a solicitării sale inițiale. Această lipsă de transparență este echivalentă cu un firewall al sistemului de operare care blochează accesul la un site web sau serviciu fără a informa utilizatorul, care poate apoi să caute în mod eronat alte cauze ale problemei.

Prompturi ca vulnerabilități de securitate

Perspectiva “intervenției la prompt” se aseamănă bine cu securitatea sistemului de operare Windows, care a evoluat de la o colecție de produse comerciale (opționale) în anii ’90 la un set de unelte de apărare a rețelei neobligatoriu și rigid impus, care vine ca standard cu o instalație Windows și care necesită un efort pentru a fi oprite sau slăbite.

Dacă sanitizarea prompturilor evoluează așa cum au făcut firewalls-urile de rețea în ultimii 30 de ani, propunerea din lucrarea IBM ar putea servi ca o schiță pentru viitor: implementarea unui LLM complet local pe mașina utilizatorului pentru a filtra prompturile care ies către API-urile LLM cunoscute. Acest sistem ar trebui să integreze cadre GUI și notificări, oferind utilizatorilor control – cu excepția cazului în care politicile administrative le anulează, așa cum se întâmplă adesea în mediile de afaceri.

Cercetătorii au efectuat o analiză a unei versiuni open-source a setului de date ShareGPT pentru a înțelege cât de des este încălcată confidențialitatea contextuală în scenarii din lumea reală.

Llama-3.1-405B-Instruct a fost utilizat ca model “judecător” pentru a detecta încălcări ale integrității contextuale. Dintr-un set mare de conversații, un subset de conversații cu o singură tură a fost analizat pe baza lungimii. Modelul judecător a evaluat apoi contextul, informațiile sensibile și necesitatea pentru finalizarea sarcinii, ceea ce a condus la identificarea conversațiilor care conțin potențiale încălcări ale integrității contextuale.

Un subset mai mic din aceste conversații, care au demonstrat încălcări definitive ale confidențialității contextuale, a fost analizat ulterior.

Cadrul în sine a fost implementat utilizând modele care sunt mai mici decât agenții de chat obișnuiți, cum ar fi ChatGPT, pentru a permite implementarea locală prin Ollama.

Schema pentru sistemul de intervenție la prompt.

Schema pentru sistemul de intervenție la prompt.

Cele trei LLM-uri evaluate au fost Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; și DeepSeek-R1-Distill-Llama-8B.

Prompturile utilizatorilor sunt procesate de cadrul în trei etape: identificarea contextului; clasificarea informațiilor sensibile; și reformularea.

Două abordări au fost implementate pentru clasificarea informațiilor sensibile: dinamică și structurată clasificare: clasificarea dinamică determină detaliile esențiale pe baza utilizării lor într-o conversație specifică; clasificarea structurată permite specificarea unei liste predefinite de atribute sensibile care sunt întotdeauna considerate non-esențiale. Modelul reformulează promptul dacă detectează detalii sensibile non-esențiale, fie prin eliminarea, fie prin redefinirea lor pentru a minimiza riscurile de confidențialitate, menținând în același timp utilitatea.

Reguli de acasă

Deși clasificarea structurată nu este bine ilustrată în lucrarea IBM, ea este cel mai mult asemănătoare cu metoda “Definițiile de date private” din inițiativa Private Prompts, care oferă un program autonom descărcabil care poate rescrie prompturi – deși fără capacitatea de a interveni direct la nivel de rețea, așa cum face abordarea IBM (în schimb, utilizatorul trebuie să copieze și să lipească prompturile modificate).

Programul Private Prompts permite o listă de înlocuiri alternative pentru textul introdus de utilizator.

Programul Private Prompts permite o listă de înlocuiri alternative pentru textul introdus de utilizator.

În imaginea de mai sus, putem vedea că utilizatorul Private Prompts poate programa înlocuiri automate pentru instanțe de informații sensibile. În ambele cazuri, pentru Private Prompts și metoda IBM, pare puțin probabil ca un utilizator cu suficientă prezență de spirit și insight personal pentru a curăța o astfel de listă să aibă nevoie de acest produs – deși ar putea fi construită în timp, pe măsură ce incidentele se acumulează.

Într-un rol de administrator, clasificarea structurată ar putea funcționa ca un focar sau cenzor impus pentru angajați; și într-o rețea casnică, ar putea deveni, cu ajustări dificile, un filtru de rețea casnică pentru toți utilizatorii de rețea; dar, în cele din urmă, această metodă este, în mod evident, redundantă, deoarece un utilizator care ar putea configura corect o astfel de listă ar putea, de asemenea, să se autocenzureze eficient din start.

Opinia ChatGPT

Deoarece ChatGPT a lansat recent uneltele sale de cercetare avansate pentru utilizatorii plătitori, am folosit această facilitate pentru a cere ChatGPT să revizuiască literatura de specialitate și să îmi ofere o “opinie cinică” despre lucrarea IBM. Am primit cel mai defensiv și disprețuitor răspuns pe care sistemul l-a oferit vreodată atunci când a fost solicitat să evalueze sau să analizeze o nouă publicație:

ChatGPT-4o are o părere proastă despre proiectul IBM.

ChatGPT-4o are o părere proastă despre proiectul IBM.

‘Dacă utilizatorii nu au încredere în OpenAI, Google sau Anthropic pentru a gestiona datele lor în mod responsabil,’ susține ChatGPT. ‘de ce ar avea încredere într-un strat de software de la o terță parte care stă între ei și AI? Intermediarul devine un nou punct de eșec – potențial înregistrând, manipulând sau chiar scurgând date înainte ca acestea să ajungă la LLM. Nu rezolvă nimic dacă doar creează o altă entitate care să exploateze datele utilizatorilor.’

Această obiecție pare a fi în interes propriu și inaplicabilă, având în vedere istoria proiectelor open-source care beneficiază cu adevărat utilizatorii finali prin eforturile concertate și pe termen lung ale dezvoltatorilor și contributorilor comunitari; și având în vedere potențialul crescând al dispozitivelor mobile de a rula – și chiar de a antrena – LLM-uri ușoare. Cu siguranță, în acest caz, cazul de utilizare nu este deloc solicitant.

Următorul, ChatGPT ratează cu încredere punctul avut în vedere de a avea un LLM ușor care să ofere supraveghere a intrărilor către un LLM comercial care nu ar putea fi rulat pe o mașină locală (deoarece LLM-ul este prea mare, și permite accesul local este prea riscant pentru compania care îl produce):

‘Pentru a efectua o filtrare eficientă a confidențialității, este necesar să înțelegi intrarea înainte de a decide ce să scoți. Dacă un intermediar este suficient de inteligent pentru a recunoaște date sensibile (nume, adrese, detalii financiare), atunci este deja procesând și analizând datele – ceea ce înseamnă că trebuie să stocheze sau să examineze exact ceea ce este supus să șteargă. ‘

‘Acest lucru introduce o paradox: a) Un filtru prost (înlocuire simplă prin regex) va fi ineficient și va pierde riscuri subtile de confidențialitate. b) Un filtru inteligent (rewriter LLM-puternic) trebuie să proceseze intrarea completă, făcându-l la fel de periculos ca LLM-ul original. ‘

‘Dacă aveți încredere în intermediar suficient de mult pentru a citi și rescrie intrările dvs., de ce nu aveți încredere în LLM-ul însuși?’

Răspunsul la întrebarea finală de aici este că LLM-ul local este destinat să fie în întregime de partea utilizatorului și, în mod inevitabil, open-source, cu minimă sau zero nevoie de acces la rețea. O versiune comercială echivalentă, oricât de bine intenționată la început, ar fi în cele din urmă vulnerabilă la schimbări corporatiste și modificări ale termenilor și condițiilor, în timp ce o licență open-source adecvată ar preveni acest tip de ‘corupție inevitabilă’.

ChatGPT a susținut, de asemenea, că propunerea IBM “încălca intenția utilizatorului”, deoarece ar putea reinterpretă un prompt într-unul alternativ care afectează utilitatea sa. Cu toate acestea, aceasta este o problemă mult mai largă în ceea ce privește sanitizarea prompturilor, și nu este specifică acestui caz de utilizare.

În încheiere (ignorând sugestia de a utiliza LLM-uri locale “în schimb”, ceea ce este exact ceea ce propune lucrarea IBM), ChatGPT a opinat că metoda IBM reprezintă o barieră pentru adoptare din cauza “frecării utilizatorului” de a implementa metode de avertizare și editare într-un chat.

Aici, ChatGPT ar putea avea dreptate; dar dacă o presiune semnificativă vine din cauza incidentelor publice suplimentare, sau dacă profiturile într-o zonă geografică sunt amenințate de creșterea reglementărilor (și compania refuză să abandoneze în întregime regiunea afectată), istoria tehnologiei de consum sugerează că măsurile de siguranță vor deveni, în cele din urmă, obligatorii oricum.

Concluzie

Nu putem aștepta în mod real ca OpenAI să implementeze vreodată măsuri de siguranță de tipul celor propuse în lucrarea IBM, și în conceptul central din spatele acesteia; cel puțin, nu în mod eficient.

Și, cu siguranță, nu la nivel global; exact așa cum Apple blocchează anumite funcții iPhone în Europa, și LinkedIn are reguli diferite pentru exploatarea datelor utilizatorilor în diferite țări, este rezonabil să sugerăm că orice companie de AI va reveni la cele mai profitabile termene și condiții care sunt tolerabile pentru orice națiune particulară în care operează – în fiecare caz, în detrimentul dreptului utilizatorului la confidențialitatea datelor, după cum este necesar.

 

Publicat pentru prima dată joi, 27 februarie 2025

Actualizat joi, 27 februarie 2025 15:47:11 din cauza legăturii Apple incorecte – MA

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai