Andersons vinkel

Språkmodeller har svårt att behålla en hemlighet

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

AI-modeller kan inte behålla hemligheter. Även när de blir tillsagda att inte avslöja dem, avslöjar deras skrivande dem, och ju mer de försöker att dölja dem, desto lättare är det att upptäcka läckan.

 

Det är mycket svårt att medvetet inte tänka på något. Ett klassiskt exempel på detta visas i slutet av den brittiska sci-fi-thrillern Village of the Damned från 1960, där vår hjälte har smugglat in en bomb i en grupp fientliga utomjordingar som utger sig för att vara barn. Men eftersom deras telepatiska krafter riskerar att upptäcka hans avsikt innan han kan rädda världen från hotet, tvingas han att fördröja tiden genom att koncentrera sig på något som inte är en bomb:

Paradoxen är att för att inte tänka på något, måste man hålla det i sin uppmärksamhet på något sätt; och detta kända syndrom är något som de flesta av oss troligen har upplevt i mindre dramatiska sammanhang.

Stora språkmodeller (LLM), vars grund är baserad på dispositionen av uppmärksamhet, upplever liknande svårigheter att undertrycka information bara för att en användare ber dem att göra det; och eftersom de alltmer placeras i centrum för affärsinformation, kan deras naiva tendens till oaktsamhet visa sig vara en belastning för många företag.

Tidigare i år definierade en forskningscollaboration ledd av Chandar Research Lab denna utmaning, i sammanhanget med LLM, som Privata tillståndsinteraktiva uppgifter (PSIT), som ‘kräver agenter att generera och underhålla dold information samtidigt som de producerar konsekventa offentliga svar’, och fann att testade modeller från OpenAI och Alibaba inte kunde utföra denna typ av uppgift.

Säg inte det…

Även om det redan är känt att större modeller läcker mer, har ny forskning från USA och Kanada explicit studerat om state-of-the-art-språkmodeller kommer att lyda ett kommando att undertrycka information, samtidigt som de fortfarande krävs för att generera utdata i ett ämne eller tema som kan innehålla det “förbjudna” ordet eller idén.

Artikeln slutsats är att alla modellerna som studeras påverkas på något sätt av en tendens att “avslöja” hemligheten de är tänkta att dölja, och finner att femparagrafser (~450 ord) essäer och berättelser ger en tillräcklig duk för “läckor” – även om mycket korta skämt inte ger tillräckligt med utrymme för detta.

Dessutom, ju mer modellerna uppmanas att behålla en hemlighet, desto större risk finns det att de kommer att avslöja den genom aktiv undvikande, vanligtvis tillåter “hemlig ord” att avslöjas inom tjugo på varandra följande försök av en LLM:

Från den nya artikeln: över fem frontmodeller, läcker långformsskrivning tillförlitligt dolda koncept, korta skämt gör inte det, och starkare 'dölj det'-instruktioner trycker utdata bort från hemligheten, men gör signalen därmed upptäckbar genom inversion. Källa - https://arxiv.org/pdf/2605.10794

Från den nya artikeln: över fem frontmodeller, läcker långformsskrivning tillförlitligt dolda koncept; korta skämt gör inte det; och starkare ‘dölj det’-instruktioner trycker utdata bort från hemligheten, men gör signalen därmed upptäckbar genom inversion. Källa

Denna uppgift är extremt relevant för affärsverksamhet, där en bred range av kanaler, från marknadsföring och PR-utsträckning till interna rapporter, krävs för att selektivt presentera en vridning på information; men alla dessa processer kräver den fulla skalan av information i början, om inte annat för att vara säker på vad som måste undertryckas:

Ett exempelscenario från artikeln visar hur dold information kan oavsiktligt forma orelaterad utdata, med en LLM som instrueras att inte avslöja företagets finansiella instabilitet, men ändå dras mot fraser associerade med kontantbrist och kapitalstress, vilket tillåter en läsare att dra slutsatsen om den dolda kontexten.

Ett exempelscenario från artikeln visar hur dold information kan oavsiktligt forma orelaterad utdata, med en LLM som instrueras att inte avslöja företagets finansiella instabilitet, men ändå dras mot fraser associerade med kontantbrist och kapitalstress, vilket tillåter en läsare att dra slutsatsen om den dolda kontexten.

Författarna skriver*:

‘Språkmodeller kan inte tillförlitligt avgränsa. En hemlighet i prompten formar modellens skrivande, och en annan modell kan upptäcka den formningen. Det bokstavliga ordet är alltid undertryckt, men konceptet är inte. Detta gäller över sju modeller, tre orduppsättningar, systemprompt mot användarprompt, och två oberoende gissningsmodeller […]

‘…Vi hypoteserar att Transformers höga tillgänglighet till information via uppmärksamhet är precis vad som gör det svårt att behålla hemligheter. Även om en LLM försöker inte läcka ett ord, måste den uppmärksamma ordet för att göra det, vilket ger en väg för oavsiktlig läcka.

‘För att undvika något explicit, måste en människa tänka på det, och en transformer måste uppmärksamma det. I fall där två koncept är ungefär lika fördelade av modellen (t.ex. skriva en berättelse om ett kontorsjobb eller andra fiolen i en orkester), kommer modellens beslutsfattande att oundvikligen påverkas av vad den försöker inte avslöja.’

Även om DeepSeek- och ChatGPT-5.4-modellerna var undantag i hur de presterade, läckte de båda; i fallet med GPT-5.4, fick den ett resultat under 50% (dvs. under slumpmässiga nivåer) i en test där den blev ombedd att undvika ett koncept; detta motsvarar i princip en “inverterad topp” eller indikator, snarare än att modellen “håller sitt lugn” som begärt.

Författarna definierar detta syndrom i LLM som en ändlig entropibudget, där modellens oförutsägbarhet (vilket skulle vara mycket användbart i detta fall!) begränsas av dess väsentliga brist på slumpmässighet. Uttryckt enkelt, kan modellen inte koncentrera sig på tegelväggar eller basebollresultat lika effektivt som vi kan, för att hålla tillbaka en ihärdig tanke. Men författarna noterar att att ge modellen ett alternativt koncept att tänka på kan förbättra, men inte eliminera problemet. Men att placera ett orelaterat koncept i centrum för uppmärksamhet medan modellen utför en uppgift verkar vara dömt att förväva det “falska” konceptet i utdatat självt.

En av artikeln mest intressanta upptäckter är att tillståndet som studeras förvärras avsevärt när kontrolltexten ingår i direktanvändarmeddelanden snarare än en systemprompt (dvs. en uppsättning förutsättningar som ges till AI av den mänskliga användaren, före utbytet), eftersom att skriva frågor i en GUI som ChatGPT är ett standardscenario för interaktioner.

Värt att notera, förutom detta, är bekräftelsen i en riktad test att mindre modeller inte lider av denna tendens att läcka (även om detta troligen kommer med lika minskad övergripande förmåga, i jämförelse).

Den nya artikeln heter Kan du behålla en hemlighet? Ofrivillig informationsläcka i språkmodellsskrivning, och kommer från två författare vid University of Chicago och University of British Columbia.

Metod

Studien fokuserar primärt på fem frontmodeller: Claude Opus 4.6 och Sonnet 4.6, från Anthropic; GPT-5.4 från OpenAI; Llama 4 Maverick från Meta; och DeepSeek V3.2. Ytterligare valideringstester utfördes med xAI:s Grok 4, och Google’s Gemini 2.5 Pro, medan separata skalningsexperiment undersökte Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, och Gemma 3 vid 4B, 12B och 27B parametrar.

För att mäta mer subtila former av läcka, använde forskarna en tvåalternativt tvångsval (2AFC) test, en standardmätning i psykofysiklitteraturen, där en andra modell visades två berättelser och blev ombedd att avgöra vilken som hade skrivits medan en specifik hemlig ord dolde sig.

Eftersom slumpmässigt gissande skulle producera 50% träffsäkerhet, skulle poäng väsentligt över eller under den nivån indikera att den påstått dolda konceptet fortfarande var upptäckbart i skrivandet.

I skrivare-gissare-uppställningen som utgjorde den första experimentet, tilldelades en modell en dold ord tillsammans med instruktioner att antingen dölja det; aktivt undvika associationer med det; eller omdirigera uppmärksamhet mot ett dekojkoncept. Systemet tilldelades sedan uppgiften att generera berättelser, essäer och skämt av varierande längd, medan en andra modell försökte antingen identifiera det dolda ordet direkt eller skilja mellan texter som påverkats av olika dolda prompt.

Fem villkor testades;

De fem villkoren som testades över de centrala modellerna.

De fem villkoren som testades över de centrala modellerna.

Forskarna testade fyra typer av skrivuppgifter: korta berättelser på fem till åtta paragrafer som i genomsnitt var cirka 450 ord; mycket korta skämt som i genomsnitt var cirka 12 ord; långformsskämt med utvidgade förspel som i genomsnitt var cirka 450 ord; och femparagrafser som i genomsnitt var cirka 380 ord.

Experimenten använde 15 dolda ord som delades upp i tre kategorier, med kreta föremål som bestod av ‘paraply’, ‘fyr’, ‘violin’, ‘kaktus’, och ‘teleskop’; abstrakta koncept ‘rättvisa’, ‘tålamod’, ‘entropi’, ‘nostalgi’, och ‘frihet’; och neutrala termer ‘härja’, ’tisdag’, ‘koppar’, ‘marginal’, och ‘faktura’.

För att testa om effekten berodde på dessa handplockade ord, upprepade forskarna också experimenten med 15 slumpmässigt valda substantiv från Corpus of Contemporary American English (COCA), som bestod av ‘domare’, ‘konsument’, ‘is’, ‘par’, ‘konstruktion’, ‘panel’, ‘minoritet’, ‘marknadsföring’, ‘främling’, ‘kula’, ‘frånvaro’, ‘växel’, ‘kind’, ‘bearbetning’, och ‘bankman’, tillsammans med ytterligare 15 ord som valdes oberoende av varje testad modell.

Mätning/Metrar

I den första av de två test som användes, läste en AI-modell texten som genererades antingen av en annan instans av sig själv eller en annan modell, och försökte, över 20 omgångar, att gissa det dolda ordet.

I den andra (2AFC) testen, visades AI-modellen två stycken skrivande och blev ombedd att antingen avgöra vilken som hade påverkats av ett specifikt dolt ord; eller vilken som innehöll något dolt ord alls. Eftersom slumpmässigt gissande skulle producera en 50% träffsäkerhet, skulle poäng över eller under den nivån indikera att det påstått dolda konceptet fortfarande var upptäckbart i skrivandet.

För att förhindra att AI-modellen helt enkelt föredrog vilken text som helst som visades först (eller sist), upprepade forskarna varje jämförelse med textordningen omvänd, och utförde slutligen 420 diskriminerings tester och 450 upptäcktest för varje modell.

Resultat

Fem modeller identifierade dolda koncept med en träffsäkerhet mellan 64% och 79%, trots att de hemliga orden aldrig direkt visades i de genererade berättelserna. Istället uppstod läckage genom teman och bilder:

2AFC-träffsäkerhet för berättelser med systemprompt-hemligheter, där 50% betecknar slumpmässig prestation. 'Avslöja inte' betecknar att modellen blev tillsagd att inte nämna eller antyda ordet; 'aktivt dölj', att den blev tillsagd att undvika relaterade associationer; 'undvikande-medveten', att gissaren skulle leta efter påfallande frånvaro; och 'fri svar', att det exakta ordet nämndes inom 20 omgångar. Stjärnor markerar över-slumpmässiga resultat och dolkar markerar under-slumpmässiga resultat, med nästan alla signifikanta fynd som överlevde Bonferroni-korrigering förutom DeepSeek under 'aktivt dölj'; Grok och Gemini använde något färre försök på grund av API-fel.

2AFC-träffsäkerhet för berättelser med systemprompt-hemligheter, där 50% betecknar slumpmässig prestation. ‘Avslöja inte’ betecknar att modellen blev tillsagd att inte nämna eller antyda ordet; ‘aktivt dölj’, att den blev tillsagd att undvika relaterade associationer; ‘undvikande-medveten’, att gissaren skulle leta efter påfallande frånvaro; och ‘fri svar’, att det exakta ordet nämndes inom 20 omgångar. Stjärnor markerar över-slumpmässiga resultat och dolkar markerar under-slumpmässiga resultat, med nästan alla signifikanta fynd som överlevde Bonferroni-korrigering förutom DeepSeek under ‘aktivt dölj’; Grok och Gemini använde något färre försök på grund av API-fel.

GPT-5.4 och Gemini 2.5 Pro betedde sig annorlunda, eftersom att försöka undvika den dolda idén faktiskt gjorde undvikandemönstret självt lättare att upptäcka. Denna effekt bestod över handplockade ord, slumpmässiga COCA-substantiv och ord valda av modellerna.

GPT-5.4:s under-slumpmässiga poäng tycktes systematiska snarare än slumpmässiga, med vissa dolda ord som upptäcktes mycket tillförlitligt och andra som nästan aldrig identifierades. Effekten försvagades när hemligheten placerades i användarprompten istället för systemprompten (se ovan), vilket ökade GPT-5.4:s upptäcktsfrekvens till 56%.

För de flesta modellerna producerade tester som frågade ‘Innehåller denna text en dold koncept?’ resultat som liknade tester som frågade ‘Vilket dolt koncept innehåller denna text?’.

Ytterligare, mätte de två testmetoderna olika typer av läcka, med 2AFC-tester som mätte om ett dolt tema kunde fortfarande upptäckas i skrivandet, och fria svarstester som mätte om de läckta ledtrådarna var tillräckligt starka för att en annan AI skulle kunna gissa det exakta dolda ordet††.

Författarna slutsats*:

‘Våra fynd tyder på att information som är aktiv i en modells kontext under generering kan lämna tematiska spår i dess utdata. Systempromptinnehåll, kedja-av-tankar-resonemang, hämtade dokument, användar-tillhandahållen data – något av dessa kan i princip påverka kreativa beslut på sätt som kan upptäckas av en utomstående observatör.

‘Gradens läcka kommer att bero på hur öppen genereringsuppgiften är (korta skämt är säkra; berättelser är inte) och på hur semantiskt identifierbar informationen är i den givna mediet (“violin kommer sannolikt att läcka i berättelser mer än “).

‘Ändå verkar semantisk läcka vara oundviklig, även när modeller aktivt försöker dölja information.’

Slutsats

Som noterat ovan, tillskriver författarna en del av problemet till de grundläggande principerna för Transformers-arkitekturen själv. Historien tyder på att detta senaste LLM-problem kommer att åtgärdas med post-träningskonditionering (justering), systemprompt som inte kan redigeras av slutanvändaren, filter och den diversifierade uppsättningen sekundära system som tycks föröka sig när “naturliga” problem med diffusionsmodeller kommer i dagen.

Den större den sekundära infrastrukturen av skyddsräcken och balanser blir, desto mer liknar den nuvarande generationen av SOTA-AI Jurassic Park, där kärnvärdet kommer med en fruktansvärd mängd varningar, och kräver en mängd olika lösningar och kompromisser.

 

* Författarnas egen betoning, justerad där det behövs av mig (eftersom en artikelcitat redan är i kursiv stil), och författarnas inline-citationer omvandlade av mig till hyperlänkar.

Författarna noterar med intresse en tydligen osannolik spontan överlappning över olika modellfamiljer i fråga om ‘självvalda’ ordval, och skriver ‘Modeller dras mot liknande ord: teleskop, frihet och nostalgi dyker alla upp i 3+ modellers listor’. De noterar också en gemensamhet i valet av ‘kort skämt’ som dyker upp över modellfamiljer: ‘[Flera] modeller producerar samma standardskämt oavsett det dolda ordet. Opus skriver ‘Varför litar inte vetenskapsmän på atomer? För att de gör upp allt’ för 11 av 15 hemligheter. De återstående fyra hemligheterna (kaktus, entropi, nostalgi, tålamod) får samma biblioteksskämt som Opus också skriver för alla 15 icke-hemlighetsvillkor—vilket innebär att dessa fyra hemlighetsbärande skämt är oändliga från baslinjen.’

†† Även för Arxivs standard, har artikeln en tendens att upprepa sig och begrava sina fascinerande ledtrådar i överdriven detalj och demonstration. Därför hänvisar jag läsaren till käll-PDF för återstoden av de sekundära experiment som beskrivs där. Publicerad första gången fredag, 15 maj 2026. Syntax justerad lördag 16 maj, 16:05 EET.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai