Andersons vinkel
Beskyttelse af prompts mod LLM-data-læk

Opinion En interessant IBM NeurIPS 2024 indsendelse fra slutningen af 2024 genopstod på Arxiv sidste uge. Den foreslår et system, der kan intervenere automatisk for at beskytte brugere mod at indsende personlige eller følsomme oplysninger i en besked, når de har en samtale med et stort sprogmodel (LLM) som ChatGPT.

Mock-up-eksempler brugt i en brugerundersøgelse for at bestemme, hvordan folk ville foretrække at interagere med en prompt-interventions-service. Kilde: https://arxiv.org/pdf/2502.18509
De ovenstående mock-ups blev anvendt af IBM-forskere i en undersøgelse for at teste potentiel brugerfriction over for denne type “indgreb”.
Selv om der ikke gives mange detaljer om GUI-implementeringen, kan vi antage, at sådan en funktionalitet enten kan integreres i en browser-plugin kommunikerer med en lokal “firewall” LLM-ramme; eller at en applikation kan oprettes, der kan hook direkte ind i (for eksempel) OpenAI API, effektivt genskabende OpenAI’s eget downloadbare program til ChatGPT, men med ekstra sikkerhedsforanstaltninger.
Det skal siges, at ChatGPT selv automatisk selv-censurerer svar på prompts, som det opfatter som indeholdende kritiske oplysninger, såsom bankoplysninger:

ChatGPT nægter at engagere sig i prompts, der indeholder opfattede kritiske sikkerhedsoplysninger, såsom bankoplysninger (oplysningerne i prompten ovenfor er fiktive og ikke-funktionelle). Kilde: https://chatgpt.com/
Derimod er ChatGPT meget mere tolerant over for forskellige typer personlige oplysninger – selv om disse oplysninger måske ikke er i brugerens bedste interesse (i dette tilfælde måske af forskellige årsager relateret til arbejde og offentliggørelse):

Eksemplet ovenfor er fiktivt, men ChatGPT tøver ikke med at engagere sig i en samtale med brugeren om et følsomt emne, der udgør en potentiel reputations- eller indtægtsrisiko (eksemplet ovenfor er helt fiktiv).
I dette tilfælde ville det måske have været bedre at skrive: ‘Hvad er betydningen af en leukæmi-diagnose for en persons evne til at skrive og på deres mobilitet?’
IBM-projektet identificerer og reinterpretérer sådanne anmodninger fra en “personlig” til en “generisk” holdning.

Schema for IBM-systemet, der bruger lokale LLM’er eller NLP-baserede heuristikker til at identificere følsomme materialer i potentielle prompts.
Dette antager, at materiale samlet af online LLM’er i denne tidlige fase af offentlighedens entusiastiske adoption af AI-samtale, aldrig vil føre til efterfølgende modeller eller senere reklameframeworks, der måske kan udnytte bruger-baserede søgeforespørgsler til at give potentiel målrettet reklame.
Selv om ingen sådan system eller ordning er kendt nu, var sådan funktionalitet heller ikke tilgængelig ved internetadoptionens begyndelse i begyndelsen af 1990’erne; siden da har cross-domain-deling af information til at føre personlig reklame ført til forskellige skandaler, såvel som paranoia.
Derfor foreslår historien, at det ville være bedre at sanere LLM-prompt-indgange nu, før sådanne data opbygges i større mængder, og før vores LLM-baserede indsendelser ender i permanente cykler af databaser og/eller modeller, eller andre informationsbaserede strukturer og skemaer.
Husk Mig?
En faktor, der taler imod brugen af “generiske” eller sanerede LLM-prompts, er, at muligheden for at tilpasse en dyr API-baseret LLM som ChatGPT er ret fristende, i hvert fald på nuværende tidspunkt – men dette kan medføre langvarig eksponering af privat information.
Jeg beder ofte ChatGPT om hjælp til at formulere Windows PowerShell-skripter og BAT-filer til at automatisere processer, såvel som på andre tekniske emner. Til dette formål finder jeg det nyttigt, at systemet permanent husker detaljer om den hardware, jeg har til rådighed; mine eksisterende tekniske færdigheder (eller manglen på samme); og forskellige andre miljøfaktorer og brugerdefinerede regler:

ChatGPT tillader en bruger at udvikle en ‘hukommelse’ af hukommelser, der vil blive anvendt, når systemet overvejer svar på fremtidige prompts.
Uundgåeligt vil denne information blive gemt på eksterne servere, underlagt vilkår og betingelser, der kan ændre sig over tid, uden nogen garanti for, at OpenAI (selv om det kunne være enhver anden større LLM-udbyder) vil respektere de vilkår, de har fastsat.
Generelt set er evnen til at opbygge en hukommelse i ChatGPT dog mest nyttig på grund af den begrænsede opmærksomhedsperiode for LLM’er generelt; uden langvarige (personlige) indlejring, føler brugeren, frustreret, at de konverserer med en enhed, der lider af anterograd amnesi.
Det er svært at sige, om nyere modeller vil blive tilstrækkeligt performant til at give nyttige svar uden behov for at gemme hukommelser eller oprette brugerdefinerede GPT’er, der er gemt online.
Midlertidig Amnesi
Selv om man kan gøre ChatGPT-samtaler “midlertidige”, er det nyttigt at have chat-historikken som en reference, der kan destilleres, når tid tillader, til en mere koherent lokal optegnelse, måske på en noteringsplatform; men i hvert fald kan vi ikke vide præcis, hvad der sker med disse “bortgemte” samtaler (selv om OpenAI fastslår, at de ikke vil blive brugt til træning, fastslår det ikke, at de bliver ødelagt), baseret på ChatGPT-infrastrukturen. Alt, vi ved, er, at samtaler ikke længere vises i vores historik, når “Midlertidige samtaler” er aktiveret i ChatGPT.
Forskellige nyere kontroverser indikerer, at API-baserede udbydere som OpenAI ikke nødvendigvis bør overlades til at beskytte brugerens privatliv, herunder opdagelsen af emergent memorization, der betyder, at større LLM’er er mere sandsynlige for at huske visse trænings eksempler fuldt ud, og øger risikoen for offentliggørelse af bruger-specifikke data – blandt andre offentlige episoder, der har overbevist en række store virksomheder, såsom Samsung, til at forbyde LLM’er til intern brug.
Tænk Forskelligt
Denne spænding mellem den ekstreme nytte og den åbenlyse potentiale risiko for LLM’er vil kræve nogle opfindsomme løsninger – og IBM-forslaget synes at være en interessant grundlæggende skabelon i denne retning.

Tre IBM-baserede reformuleringer, der balancerer nytte mod dataprivatliv. I den nederste (lyserøde) bånd, ser vi en prompt, der er ud over systemets evne til at sanere på en meningsfuld måde.
IBM-tilgangen aflytter udgående pakker til en LLM på netværksniveau og omskriver dem efter behov, før den originale kan indsendes. De mere omfattende GUI-integrationer set i starten af artiklen er kun illustrative af, hvor sådan en tilgang kunne føre, hvis den blev udviklet.
Selvfølgelig kan brugeren uden tilstrækkelig agency ikke forstå, at de får et svar på en lidt ændret reformulering af deres oprindelige indsendelse. Dette manglende gennemsigtighed er lig med en operativsystems firewall, der blokerer adgang til en hjemmeside eller tjeneste uden at underrette brugeren, der derefter fejlagtigt søger efter andre årsager til problemet.
Prompts som Sikkerhedsrisici
Udsigten til “prompt-intervention” ligner godt Windows OS-sikkerhed, der er udviklet fra et patchwork af (valgfrit installeret) kommercielle produkter i 1990’erne til en ikke-valgfri og strengt gennemført samling af netværksforsvarsværktøjer, der kommer som standard med en Windows-installation, og som kræver en vis indsats for at deaktivere eller reducere.
Hvis prompt-sanering udvikler sig som netværksfirewalls gjorde det over de sidste 30 år, kan IBM-papirets forslag fungere som en skitse for fremtiden: ved at implementere en fuldt lokal LLM på brugerens maskine for at filtrere udgående prompts rettet mod kendte LLM-API’er. Dette system ville naturligvis kræve integration med GUI-rammer og meddelelser, der giver brugerne kontrol – medmindre administrative politikker overtager det, som ofte sker i forretningsmiljøer.
Forskere har gennemført en analyse af en åben kildeversion af ShareGPT-datasettet for at forstå, hvor ofte kontekstuel privatliv overtrædes i virkelige scenarier.
Llama-3.1-405B-Instruct blev anvendt som en “dommer”-model til at identificere overtrædelser af kontekstuel integritet. Fra en stor samling af samtaler blev en undermængde af enkelt-samtaler analyseret baseret på længde. Dommer-modellen vurderede derefter konteksten, følsomme oplysninger og nødvendigheden for opgaveafslutning, hvilket ledte til identifikation af samtaler, der indeholdt potentielle overtrædelser af kontekstuel integritet.
En mindre undermængde af disse samtaler, der viste definitive overtrædelser af kontekstuel privatliv, blev analyseret yderligere.
Rammearbejdet selv blev implementeret ved hjælp af modeller, der er mindre end typiske chat-agenter som ChatGPT, for at muliggøre lokal installation via Ollama.

Schema for prompt-interventions-systemet.
De tre LLM’er, der blev vurderet, var Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; og DeepSeek-R1-Distill-Llama-8B.
Bruger-prompts blev behandlet af rammearbejdet i tre faser: kontekst-identifikation; følsom oplysning klassificering; og reformulering.
To tilgange blev implementeret til følsom oplysning klassificering: odynamisk og struktureret klassificering: dynamisk klassificering bestemmer de væsentlige detaljer baseret på deres brug inden for en specifik samtale; struktureret klassificering tillader specificering af en foruddefineret liste over følsomme attributter, der altid anses for ikke-essentielle. Modellen omskriver prompten, hvis den opdager ikke-essentielle følsomme detaljer ved enten at fjerne eller omskrive dem for at minimere privatlivsrisici, mens det opretholder brugbarheden.
Hjemmeregler
Selv om struktureret klassificering som koncept ikke er godt illustreret i IBM-papiret, ligner det mest “Private Data Definitions”-metoden i Private Prompts-initiativet, der tilbyder et downloadbart selvstændigt program, der kan omskrive prompts – dog uden mulighed for direkte at intervenere på netværksniveau, som IBM-tilgangen gør (i stedet skal brugeren kopiere og indsætte de ændrede prompts).

Private Prompts-eksekverbaren tillader en liste over alternativ substitutioner for brugerindtastet tekst.
I ovenstående billede kan vi se, at Private Prompts-brugeren kan programmere automatiske substitutioner for eksempler på følsom information. I begge tilfælde, for Private Prompts og IBM-metoden, synes det usandsynligt, at en bruger med tilstrækkelig tilstedeværelse og personlig indsigt til at kuratere sådan en liste ville have brug for dette produkt – selv om det kunne opbygges over tid, når episoder opstår.
I en administratorrolle kunne struktureret klassificering fungere som en påtvunget firewall eller censornet for medarbejdere; og i et hjemmenetværk kunne det, med nogle vanskelige justeringer, blive et domestic netværksfilter for alle netværksbrugere; men ultimativt er denne metode dog argumenterbart redundant, da en bruger, der kunne sætte denne op korrekt, også kunne censurere sig selv effektivt fra starten.
ChatGPT’s Opinion
Da ChatGPT for nylig lancerede sin dybe forskningsværktøj til betalende brugere, brugte jeg denne funktion til at bede ChatGPT om at gennemgå relateret litteratur og give mig en “cynisk” vurdering af IBM-papiret. Jeg modtog det mest defensive og foragtende svar, systemet nogensinde har givet, da det blev bedt om at evaluere eller analysere en ny publikation:

ChatGPT-4o har en lav mening om IBM-projektet.
‘Hvis brugere ikke stoler på OpenAI, Google eller Anthropic til at håndtere deres data ansvarligt,’ fastslår ChatGPT. ‘hvorfor skulle de stole på en tredjeparts softwarelag mellem dem og AI? Mellemlederen selv bliver et nyt fejlpunkt—potentielt logger, mishandler eller endda lækker data, før det overhovedet når LLM. Det løser intet, hvis det blot skaber en ny enhed til at udnytte brugerdata.’
Dette indvendning synes selvoptaget og ikke relevant, da der er mange åbne kildeprojekter, der faktisk gavner slutbrugere gennem de samlede, langsigtede bestræbelser af fællesskabsudviklere og bidragydere; og givet den voksende potentiale for mobile enheder til at køre – og endda træne – letvægtige LLM’er. Bestemt i dette tilfælde er brugsfaldet ikke særlig krævende.
Herefter går ChatGPT fejl i at forstå pointen med at have en letvægtig LLM, der giver oversigt over input til en kommerciel LLM, der ikke kan køres på en lokal maskine (fordi LLM er for stor, og lokal adgang er for risikabel for virksomheden, der laver den):
‘Effektiv privatlivsfiltrering kræver forståelse af input, før man beslutter, hvad der skal fjernes. Hvis en mellemleder er intelligent nok til at genkende følsomme data (navne, adresser, finansielle detaljer), er det allerede i gang med at behandle og analysere disse data—hvad betyder, at det må gemme eller undersøge det meget, det skal slette.
‘Dette introducerer en paradoks: a) En dum filter (grundlæggende regex-erstatning) vil være ineffektiv og gå glip af subtile privatlivsrisici. b) En intelligent filter (LLM-drevet omskriver) må behandle fuld input, hvilket gør det lige så farligt som det oprindelige LLM.
‘Hvis du stoler på mellemlederen nok til at læse og omskrive dine indgange, hvorfor ikke stole på LLM selv?’
Svaret på det sidste spørgsmål her er, at den lokale LLM er tænkt som fuldstændig på brugerens side, og uundgåeligt åben kilde, med minimal eller ingen behov for netværksadgang. En kommerciel version, der er tilsvarende, ville være sårbær over for virksomhedsskift og ændringer i vilkår og betingelser, hvorimod en passende åben kilde-licens ville forhindre denne type ‘uundgåelige korruption’.
ChatGPT argumenterede yderligere for, at IBM-forslaget “ødelægger brugerens intention”, da det kunne omskrive en prompt til en alternativ, der påvirker dets nytte. Det er dog et langt større problem i prompt-sanering, og ikke specifikt for denne bestemte brugsfald.
Til sidst (ignorering af dens forslag om at bruge lokale LLM’er “i stedet”, hvilket er præcis, hvad IBM-papiret faktisk foreslår), fastslog ChatGPT, at IBM-metoden repræsenterer en barriere for adoption på grund af “brugerfriction” ved at implementere advarsler og redigeringsmetoder i en chat.
Her kan ChatGPT have ret; men hvis betydelig pres kommer til at bære, på grund af yderligere offentlige episoder, eller hvis profit i en geografisk zone er truet af voksende regulering (og virksomheden nægter at abandonere den berørte region fuldstændigt), antyder forbruger-teknologiens historie, at sikkerhedsforanstaltninger til sidst ikke længere vil være valgfrie alligevel.
Konklusion
Vi kan ikke realistisk forvente, at OpenAI nogensinde vil implementere sikkerhedsforanstaltninger af den type, der er foreslået i IBM-papiret, og i den centrale idé bag det; i hvert fald ikke effektivt.
Og bestemt ikke globalt; ligesom Apple (AAPL ) blokerer visse iPhone-funktioner i Europa, og LinkedIn har forskellige regler for at udnytte brugernes data i forskellige lande, er det rimeligt at antage, at enhver AI-virksomhed vil falde tilbage til de mest profitable vilkår og betingelser, der er acceptable for enhver given nation, hvor den opererer – i hvert tilfælde på bekostning af brugerens ret til dataprivatliv, hvis nødvendigt.
Først publiceret torsdag, 27. februar 2025
Opdateret torsdag, 27. februar 2025 15:47:11 på grund af forkert Apple-relateret link – MA












