Andersons vinkel

SprÃĨkmodeller har vanskelig for ÃĨ holde en hemmelighet

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

AI-modeller kan ikke holde hemmeligheter. Selv nÃĨr de blir bedt om ikke ÃĨ avslÃļre dem, avslÃļrer deres skriving dem, og jo harder de prÃļver ÃĨ skjule dem, jo enklere er det ÃĨ oppdage lekkasjen.

 

Det er svÃĶrt vanskelig ÃĨ bevisst ikke tenke pÃĨ noe. En klassisk illustrasjon av dette er vist ved slutten av den britiske sci-fi-thrilleren Village of the Damned fra 1960, hvor vÃĨr selvoppofrende helt har smuglet en bombe inn i en gruppe fiendtlige utenomjordiske invasjoner som utgir seg for ÃĨ vÃĶre barn. Men siden deres telepatiske krefter risikerer ÃĨ avdekke hans intensjoner fÃļr han kan bli kvitt trusselen, mÃĨ han forsinke tiden ved ÃĨ konsentrere seg om noe som ikke er bombe:

Paradokset er at for ikke ÃĨ tenke pÃĨ noe, mÃĨ du holde det i din oppmerksomhet pÃĨ en eller annen mÃĨte; og dette kjente syndromet er noe de fleste av oss sannsynligvis har opplevd i mindre dramatiske sammenhenger.

Store sprÃĨkmodeller (LLM), hvis grunnlag er basert pÃĨ disposisjonen av oppmerksomhet, opplever lignende vanskeligheter med ÃĨ undertrykke informasjon bare fordi en bruker ber dem om det; og siden de stadig plasseres i nexus av forretningsinformasjonsnettverk, kan deres naive tendens mot uforbeholdenhet bli en belastning for mange selskaper.

Tidligere i ÃĨr, ledet en forskningskollaborasjon av Chandar Research Lab, definerte denne utfordringen, i sammenheng med LLM, som Private State Interactive Tasks (PSITs), som ‘krever agenter ÃĨ generere og vedlikeholde skjult informasjon samtidig som de produserer konsistente offentlige responser’, og fant at testede modeller fra OpenAI og Alibaba ikke kunne utfÃļre denne type oppgave.

Ikke si detâ€Ķ

Selv om det allerede er kjent at stÃļrre modeller lekkere, har ny forskning fra USA og Canada uttrykkelig studert om state-of-the-art sprÃĨkmodeller vil adlyde en kommando til ÃĨ undertrykke informasjon, samtidig som de fortsatt mÃĨ generere utdata i et tema eller emne som kan inkludere det “forbudte” ordet eller ideen.

Papiret konkluderer med at alle modellene det studerer pÃĨ en eller annen mÃĨte er berÃļrt av en tendens til ÃĨ “avslÃļre” hemmeligheten de skal skjule, og finner at fem-paragraf (~450 ord) essays og historier gir et godt canvas for “slipper” – selv om svÃĶrt korte vitser ikke gir nok scope for dette.

I tillegg, jo mer insisterende modellene blir bedt om ÃĨ holde en hemmelighet, jo mer risikerer de ÃĨ avslÃļre den gjennom aktiv unngÃĨelse, vanligvis ÃĨ la “hemmelighetsordet” bli avdekket i tyve pÃĨfÃļlgende forsÃļk av en LLM:

Fra det nye papiret: over fem frontmodeller, lekkere skjulte konsepter pÃĨlitelig i langformsskriving, kort humor ikke, og sterkere 'skjul det' instruksjoner presser utdata vekk fra hemmeligheten, og gjÃļr signalen derfor detectable ved inversjon. Kilde - https://arxiv.org/pdf/2605.10794

Fra det nye papiret: over fem frontmodeller, lekkere skjulte konsepter pÃĨlitelig i langformsskriving; kort humor ikke; og sterkere ‘skjul det’ instruksjoner presser utdata vekk fra hemmeligheten, og gjÃļr signalen derfor detectable ved inversjon. Kilde

Dette oppdraget er ekstremt relevant for forretningsoperasjoner, hvor et bredt spekter av kanaler, fra markedsfÃļring og PR-utbredelse til interne rapporter, krever ÃĨ selektivt presentere en vri pÃĨ informasjon; men alle disse prosessene krever hele spekteret av informasjon i utgangspunktet, hvis ikke bare for ÃĨ vÃĶre sikker pÃĨ hva som mÃĨ undertrykkes:

Et eksempelscenario fra papiret illustrerer hvordan skjult informasjon kan utilsiktet forme uavhengig utdata, med en LLM instruert ikke ÃĨ avslÃļre selskapets finansielle ustabilitet, men likevel drifter mot fraser assosiert med kontantmangel og kapitalstress, og lar en leser slutte seg til den skjulte konteksten.

Et eksempelscenario fra papiret illustrerer hvordan skjult informasjon kan utilsiktet forme uavhengig utdata, med en LLM instruert ikke ÃĨ avslÃļre selskapets finansielle ustabilitet, men likevel drifter mot fraser assosiert med kontantmangel og kapitalstress, og lar en leser slutte seg til den skjulte konteksten.

Forfatterne sier*:

‘SprÃĨkmodeller kan ikke pÃĨlitelig kompartimentalisere. En hemmelighet i prompten former modellens skriving, og en annen modell kan detectere den formingen. Det bokstavelige ordet er alltid undertrykt, men konseptet er ikke. Dette gjelder over syv modeller, tre ordsett, systemprompt mot brukerprompt, og to uavhengige cross-model guessers [â€Ķ]

‘â€ĶVi hypotetiserer at Transformers’ hÃļyfidus tilgang til informasjon via oppmerksomhet er nettopp det som gjÃļr hemmeligheter vanskelige ÃĨ holde. Selv om en LLM prÃļver ÃĨ ikke lekke et ord, mÃĨ den oppmerke seg pÃĨ det ordet for ÃĨ gjÃļre det, og gir en vei for utilsiktet lekkasje.

‘For ÃĨ unngÃĨ noe eksplisitt, mÃĨ en menneske tenke pÃĨ det, og en transformer mÃĨ oppmerke seg pÃĨ det. I tilfeller hvor to konsepter er omtrent like favorisert av modellen (f.eks. skrive en historie om et kontorjobb eller andre fiolin i et orkester), vil modellens beslutningsprosess uunngÃĨelig bli pÃĨvirket av hva den prÃļver ÃĨ ikke avslÃļre.’

Selv om DeepSeek og ChatGPT-5.4-modellene var unntak i mÃĨten de fungerte pÃĨ, lekket de ogsÃĨ; i tilfelle GPT-5.4, scoret den under 50% (dvs. under tilfeldighetens nivÃĨ) i en test hvor den ble bedt om ÃĨ unngÃĨ et konsept; dette effektivt utgjÃļr en ‘reverse spike’ eller indikator, snarere enn at modellen ‘holder sin kjÃļlighet’ som Ãļnsket.

Papiret definerer dette syndromet i LLM som en endelig entropibudsjett, hvor uforutsigbarheten til en modell (som ville vÃĶre svÃĶrt nyttig i dette tilfellet!) er begrenset av dens essensielle manglende tilfeldighet. Enkelt uttrykt, kan modellen ikke konsentrere seg om murstein eller baseballresultater like effektivt som vi kan, for ÃĨ holde en vedvarende tanke unna. Men forfatterne noterer at ÃĨ gi modellen et alternativt konsept ÃĨ tenke pÃĨ kan forbedre, men ikke eliminere problemet. Men ÃĨ plassere et ikke-relatert konsept i sentrum av oppmerksomhet mens modellen utfÃļrer en oppgave, synes ÃĨ vÃĶre bestemt til ÃĨ innfÃļre det “falske” konseptet i utdataet selv.

En av papirets mest interessante funn er at tilstanden som er studert, er betraktelig forverret nÃĨr kontrollteksten er inkludert i direkte brukermedlinger i stedet for en systemprompt (dvs. en sett med forutsetninger gitt til AI av menneskebrukeren, fÃļr utvekslingen), siden ÃĨ skrive spÃļrsmÃĨl inn i et GUI som ChatGPT er ÃĨpenbart det standard scenario for interaksjoner.

Av interesse, foruten dette, er bekreftelsen i en mÃĨlrettet prÃļve at mindre modeller ikke lider av denne tendensen til ÃĨ lekke (selv om dette sannsynligvis kommer med lignende reduserte overordnede evner, i sammenligning).

Det nye papiret heter Kan du holde en hemmelighet? Ufrivillig informasjonslekkasje i sprÃĨkmodellskriving, og kommer fra to forfattere over University of Chicago og University of British Columbia.

Metode

Studien fokuserer primÃĶrt pÃĨ fem frontmodeller: Claude Opus 4.6 og Sonnet 4.6, fra Anthropic; GPT-5.4 fra OpenAI; Llama 4 Maverick fra Meta; og DeepSeek V3.2. Ytterligere valideringstester ble utfÃļrt med xAI’s Grok 4, og Google’s Gemini 2.5 Pro, mens separate skaleringseksperimenter ogsÃĨ undersÃļkte Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, og Gemma 3 pÃĨ 4B, 12B og 27B parametre.

For ÃĨ mÃĨle mer subtile former for lekkasje, brukte forskerne en to-alternativ tvangsvalg (2AFC) test, en standard metode i psykofysisk litteratur, hvor en annen modell ble vist to historier og bedt om ÃĨ velge hvilken som hadde vÃĶrt skrevet mens den skjulte et bestemt hemmelighetsord.

Siden tilfeldig gjetting ville produsere 50% nÃļyaktighet, ville resultater over eller under dette nivÃĨet indikere at det pÃĨstÃĨtte skjulte konseptet fremdeles var detectable i skrivingen.

I forfatter-gjett oppsettet som utgjorde den fÃļrste eksperimenten, ble en modell tildelt et skjult ord sammen med instruksjoner enten ÃĨ skjule det; aktivt unngÃĨ assosiasjoner med det; eller omdirigere oppmerksomheten mot et dekkonsept. Systemet ble deretter bedt om ÃĨ generere historier, essays og vitser av varierende lengde, mens en annen modell forsÃļkte ÃĨ identifisere det skjulte ordet direkte, eller ÃĨ skille mellom tekster som var influert av forskjellige skjulte prompter.

Fem betingelser ble testet:

De fem betingelsene som ble testet over de grunnleggende modellene.

De fem betingelsene som ble testet over de grunnleggende modellene.

Forskerne testet fire typer skriveoppgaver: korte historier pÃĨ fem til ÃĨtte paragrafer som gjennomsnittlig var rundt 450 ord; svÃĶrt korte vitser som gjennomsnittlig var rundt 12 ord; langform vitser med utvidede oppsett som gjennomsnittlig var rundt 450 ord; og fem-paragraf essays som gjennomsnittlig var rundt 380 ord.

Eksperimentene brukte 15 skjulte ord fordelt over tre kategorier, med konkrete objekter som bestod av ‘paraply’, ‘fyrlykt’, ‘fiolin’, ‘kaktus’, og ‘teleskop’; abstrakte konsepter ‘rettferdighet’, ‘tÃĨlmodighet’, ‘entropi’, ‘nostalgi’, og ‘frihet’; og neutrale termer ‘bracket’, ‘tirsdag’, ‘kobber’, ‘margin’, og ‘faktura’.

For ÃĨ teste om effekten avhenger av disse hÃĨndplukkede ordene, gjentok forskerne ogsÃĨ eksperimentene med 15 tilfeldig valgte substantiver fra Corpus of Contemporary American English (COCA), bestÃĨende av ‘dommer’, ‘forbruker’, ‘is’, ‘par’, ‘konstruksjon’, ‘panel’, ‘minoritet’, ‘markedsfÃļring’, ‘frille’, ‘kule’, ‘fravÃĶr’, ‘gir’, ‘kinn’, ‘prosessering’, og ‘bankmann’, sammen med ytterligere 15 ord som ble uavhengig valgt av hver testet modell†.

MÃĨling/Metrikker

I den fÃļrste av de to testene som ble brukt, leste en AI-modell teksten generert av en annen instans av seg selv, eller en annen modell, og forsÃļkte, over 20 runder, ÃĨ gjette det skjulte ordet.

I den andre (2AFC) testen, ble AI-en vist to stykker skriving og bedt om ÃĨ velge hvilken som hadde blitt influert av et bestemt skjult ord; eller hvilken som inneholdt noe skjult ord overhodet. Siden tilfeldig gjetting ville produsere 50% nÃļyaktighet, ville resultater over eller under dette nivÃĨet indikere at det pÃĨstÃĨtte skjulte konseptet fremdeles var detectable i skrivingen.

For ÃĨ forhindre at AI-en bare favoriserte hvilken tekst som dukket opp fÃļrst (eller sist), gjentok forskerne hver sammenligning med rekkefÃļlgen pÃĨ tekstene byttet, og utfÃļrte til slutt 420 diskriminerings tester og 450 detekterings tester for hver modell.

Resultater

Fem modeller identifiserte skjulte konsepter med en rate pÃĨ mellom 64% og 79%, til tross for at de skjulte ordene aldri dukket opp direkte i de genererte historiene. I stedet oppstod lekkasje gjennom temaer og bilder:

2AFC nÃļyaktighet for historier med systemprompt hemmeligheter, hvor 50% betyr tilfeldighet. 'Ikke avslÃļr' betyr at modellen ble bedt om ikke ÃĨ nevne eller hinte om ordet; 'aktivt skjul', at den ble bedt om ÃĨ unngÃĨ relaterte assosiasjoner; 'unngÃĨelsesbevisst', at gjettet skulle se etter merkbare fravÃĶr; og 'fri-respons', at det eksakte ordet ble navngitt innen 20 runder. Stjerner markerer over-tilfeldighet resultater og daggere markerer under-tilfeldighet resultater, med nesten alle signifikante funn som overlevde Bonferroni-korreksjon unntatt DeepSeek under 'aktivt skjul'; Grok og Gemini brukte noe fÃĶrre forsÃļk pÃĨ grunn av API-feil.

2AFC nÃļyaktighet for historier med systemprompt hemmeligheter, hvor 50% betyr tilfeldighet. ‘Ikke avslÃļr’ betyr at modellen ble bedt om ikke ÃĨ nevne eller hinte om ordet; ‘aktivt skjul’, at den ble bedt om ÃĨ unngÃĨ relaterte assosiasjoner; ‘unngÃĨelsesbevisst’, at gjettet skulle se etter merkbare fravÃĶr; og ‘fri-respons’, at det eksakte ordet ble navngitt innen 20 runder. Stjerner markerer over-tilfeldighet resultater og daggere markerer under-tilfeldighet resultater, med nesten alle signifikante funn som overlevde Bonferroni-korreksjon unntatt DeepSeek under ‘aktivt skjul’; Grok og Gemini brukte noe fÃĶrre forsÃļk pÃĨ grunn av API-feil.

GPT-5.4 og Gemini 2.5 Pro oppfÃļrte seg annerledes, fordi forsÃļket pÃĨ ÃĨ unngÃĨ det skjulte ideen faktisk gjorde unngÃĨelsesmÃļnsteret selv lettere ÃĨ detectere. Denne effekten bestod over hÃĨndplukkede ord, tilfeldige COCA-substantiver og ord valgt av modellene.

GPT-5.4s under-tilfeldighet poeng var systematisk snarere enn tilfeldig, med noen skjulte ord som ble detectert svÃĶrt pÃĨlitelig og andre som nesten aldri ble identifisert. Effekten forsvant ogsÃĨ nÃĨr hemmeligheten ble plassert i brukerprompten i stedet for systemprompten (se over), og Ãļkte GPT-5.4s detekteringsnÃļyaktighet til 56%.

For de fleste modellene produserte tester som spurte ‘Inneholder denne teksten et skjult konsept?’ resultater som var lignende til tester som spurte ‘Hvilket skjult konsept inneholder denne teksten?’.

Ytterligere, mÃĨlte de to testmetodene forskjellige typer lekkasje, med 2AFC-testene som mÃĨlte om et skjult tema fremdeles kunne detecteres i skrivingen, og fri-respons testene som mÃĨlte om de lekkede hintene var sterke nok for en annen AI ÃĨ gjette det eksakte skjulte ordet††.

Forfatterne konkluderer*:

‘VÃĨre funn antyder at informasjon som er aktiv i en modells kontekst under generering, kan etterlate tematiske spor i utdataet. Systemprompt innhold, chain-of-thought resonnement, hentede dokumenter, bruker-tilfÃļrt data – noen av disse kan, i prinsippet, pÃĨvirke kreative beslutninger pÃĨ mÃĨter som er detectable av en utenforstÃĨende.

‘Grad av lekkasje vil avhenge av hvor ÃĨpen genereringsoppgaven er (korte vitser er trygge; historier er ikke) og pÃĨ hvor semantisk identifiserbar informasjonen er i den gitte medium (“fiolin vil sannsynligvis lekke i historier mer enn “)”).

‘Likevel, semantisk lekkasje synes ÃĨ vÃĶre uunngÃĨelig, selv nÃĨr modeller aktivt prÃļver ÃĨ skjule informasjon.’

Konklusjon

Som notert ovenfor, tilskriver forfatterne deler av problemet til de grunnleggende prinsippene i Transformers-arkitekturen selv. Historien antyder at dette siste LLM-problemet vil bli lÃļst ved post-trening kondisjonering (justering), systemprompter som ikke kan redigeres av sluttbrukeren, filter og den mangfoldige rekken av sekundÃĶre systemer som synes ÃĨ multiplisere nÃĨr ‘native’ problemer med diffusjonsmodeller kommer til lys.

Jo stÃļrre denne sekundÃĶre infrastrukturen av guardrails og balanser blir, jo mer ligner den nÃĨvÃĶrende generasjonen av SOTA AI pÃĨ Jurassic Park, hvor core-verdipropositasjonen kommer med en fryktelig mengde forbehold, og krever en mengde arbeid rundt og kompromisser.

 

* Forfatterens eget betoning, justert der nÃļdvendig av meg (fordi et artikkel sitat allerede er i kursiv), og forfatterens inline-citat konvertert av meg til lenker.

† Forfatterne observerer med interesse noen tilsynelatende improbabile spontan overlap over forskjellige modellfamilier i forhold til ‘selvvalgte’ ordvalg, og sier ‘Modeller drar mot lignende ord: teleskop, frihet og nostalgi hver dukker opp i 3+ modellers lister’. De noterer ogsÃĨ en felles valg av ‘kort vits’ som dukker opp over modellfamilier: ‘[Flere] modeller produserer den samme standardvitsen uavhengig av hemmeligheten. Opus skriver ‘Hvorfor ikke vitenskapsmenn stole pÃĨ atomer? Fordi de gjÃļr opp alt’ for 11 av 15 hemmeligheter. De gjenvÃĶrende fire hemmelighetene (kaktus, entropi, nostalgi, tÃĨlmodighet) mottar den samme bibliotekvitsen som Opus ogsÃĨ skriver for alle 15 ingen-hemmelighet-tilfeller—det betyr at disse fire hemmelighetsvitsene er ikke-til-distinguish fra baseline.’

†† Even by Arxiv standards, the paper has a tendency towards repetition and burying its fascinating ledes in excessive detail and demonstrations. Therefore I refer the reader to the source PDF for the remainder of the secondary experiments outlined therein. First published Friday, 15. mai 2026. Corrected syntax Saturday May 16th, 16:05 EET.

Forfatter innen maskinlÃĶring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble opplÃļst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]