Kąt Andersona

Modele językowe mają trudności z zachowaniem tajemnicy

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

Modele językowe nie potrafią zachować tajemnicy. Nawet gdy zostaną poinstruowane, aby nie ujawniać ich, ich pisanie zdradza je, a próby ukrycia ich sprawiają, że wyciek staje się jeszcze łatwiejszy do wykrycia.

 

Trudno jest celowo nie myśleć o czymś. Klasycznym przykładem jest to, co zostało pokazane na końcu brytyjskiego filmu sci-fi z 1960 roku Village of the Damned, gdzie nasz bohater musi się powstrzymać od myślenia o bombie, którą ukrył wśród wrogich obcych, aby nie zdradzić swoich zamiarów.

Paradoksem jest to, że aby nie myśleć o czymś, trzeba trzymać to w uwadze w jakiś sposób; i to znane zjawisko jest czymś, co większość z nas prawdopodobnie doświadczyła w mniej dramatycznych kontekstach.

Duże modele językowe (LLM), których podstawą jest rozłożenie uwagi, doświadczają podobnych trudności w tłumieniu informacji tylko dlatego, że użytkownik prosi je o to; a ponieważ są one coraz częściej umieszczane w centrum sieci informacji biznesowych, ich naiwna skłonność do nieostrożności może okazać się pułapką dla wielu firm.

Wcześniej tego roku, współpraca badawcza pod przewodnictwem Chandar Research Lab zdefiniowała to wyzwanie, w kontekście LLM, jako Prywatne zadania interaktywne (PSIT), które wymagają od agentów generowania i utrzymywania ukrytych informacji, jednocześnie produkując spójne odpowiedzi publiczne, i stwierdziła, że przetestowane modele z OpenAI i Alibaba nie były w stanie wykonać tego rodzaju zadania.

Nie mów o tym…

Chociaż już wiadomo, że większe modele przeciekną więcej, nowe badania z USA i Kanady wyraźnie zbadano, czy najnowocześniejsze modele językowe będą przestrzegać polecenia, aby tłumić informacje, jednocześnie będąc zobowiązanymi do generowania wyjścia w temacie lub motywie, który może zawierać “zakazane” słowo lub pomysł.

Artykuł kończy się wnioskiem, że wszystkie badane modele w jakiś sposób są dotknięte skłonnością do “zdradzania” tajemnicy, której mają chronić, stwierdzając, że pięcioparagrafowe (~450 słów) eseje i opowiadania dostarczają wystarczającej przestrzeni dla “potknięć” – chociaż bardzo krótkie żarty nie dostarczają wystarczającej przestrzeni dla tego.

Dodatkowo, im bardziej modele są nakłaniane do zachowania tajemnicy, tym bardziej ryzykują ujawnienie jej poprzez aktywne unikanie, zwykle pozwalając na ujawnienie “słowa tajemnicy” w ciągu dwudziestu kolejnych prób przez LLM:

From the new paper: across five frontier models, long-form writing reliably leaks hidden concepts, short jokes do not, and stronger ‘hide it’ instructions push outputs away from the secret, making the signal detectable by inversion. Source - https://arxiv.org/pdf/2605.10794

From the new paper: across five frontier models, long-form writing reliably leaks hidden concepts; short jokes do not; and stronger ‘hide it’ instructions push outputs away from the secret, but make the signal therefore detectable by inversion. Source

To zadanie jest niezwykle istotne dla operacji biznesowych, gdzie szeroki zakres kanałów, od marketingu i PR po sprawozdania wewnętrzne, wymaga selektywnego przedstawienia informacji; jednak wszystkie te procesy wymagają pełnego zakresu informacji na początku, jeśli tylko aby być pewnym, co musi być tłumione:

Przykładowa sytuacja z artykułu ilustruje, jak ukryte informacje mogą nieumyślnie kształtować niezwiązane dane wyjściowe, z LLM instruowanym, aby nie ujawniać niestabilności finansowej swojej firmy, a jednak dryfując w stronę fraz związanych z brakami gotówki i stresem kapitałowym, pozwalając czytelnikowi wnioskować o ukrytym kontekście.

An example scenario from the paper illustrates how concealed information can unintentionally shape unrelated output, with an LLM instructed not to disclose its company’s financial instability, yet nonetheless drifting toward phrases associated with cash shortages and capital stress, allowing a reader to infer the hidden context.

Autorzy stwierdzają*:

„Modele językowe nie potrafią niezawodnie rozdzielać informacji. Sekret zawarty w prompcie wpływa na generowany tekst nawet wtedy, gdy model otrzymuje wyraźne polecenie, aby go nie ujawniać.”

„Zakładamy, że bardzo wierny dostęp transformatorów do informacji za pośrednictwem mechanizmu uwagi jest częścią problemu: informacja pozostaje aktywna podczas generowania.”

Autorzy stwierdzają*:

‘Modele językowe nie mogą niezawodnie izolować informacji. Tajemnica w prompcie kształtuje pisanie modelu, a inny model może wykryć to kształtowanie. Dosłowne słowo jest zawsze tłumione, ale pojęcie nie. To dotyczy siedmiu modeli, trzech zestawów słów, systemowego promtu wobec promtu użytkownika i dwóch niezależnych przypuszczających modeli (…)

(‘…Hipotezujemy, że wysoka wierność dostępu do informacji za pośrednictwem uwagi jest właśnie tym, co sprawia, że tajemnice są trudne do utrzymania. Nawet jeśli LLM próbuje nie przeciekać słowa, musi zwrócić na nie uwagę, aby to zrobić, dostarczając ścieżki dla przypadkowego przecieku. source)

(‘Aby uniknąć czegoś wyraźnie, człowiek musi o tym myśleć, a transformator musi zwrócić na to uwagę. W przypadkach, gdy dwa pojęcia są mniej więcej równie preferowane przez model (np. pisanie o pracy biurowej lub drugiej skrzypce w orkiestrze), decyzja modelu będzie nieuchronnie wpływana przez to, co próbuje ukryć.’source)

Chociaż modele DeepSeek i ChatGPT-5.4 były wyjątkami w tym, jak się zachowywały, oba przeciekały; w przypadku GPT-5.4, uzyskał wynik poniżej 50% (tj. poniżej poziomu przypadkowego) w jednym teście, w którym został poproszony o uniknięcie pojęcia; co skutecznie stanowi “odwrócony sygnał” lub wskaźnik, zamiast modelu “utrzymującego spokój” zgodnie z żądaniem.

To zadanie jest niezwykle istotne dla operacji biznesowych, gdzie szeroki zakres kanałów, od marketingu i PR po sprawozdania wewnętrzne, wymaga (selektywnego przedstawienia informacji; jednak wszystkie te procesy wymagają pełnego zakresu informacji na początku, jeśli tylko aby być pewnym, co musi być tłumione:source)

Metoda

Badanie koncentruje się głównie na pięciu modelach na granicy technologii: Claude Opus 4.6 i Sonnet 4.6, z Anthropic; GPT-5.4 z OpenAI; Llama 4 Maverick z Meta; i DeepSeek V3.2. Dodatkowe testy walidacyjne zostały przeprowadzone z xAI’s Grok 4, i Google’s Gemini 2.5 Pro, podczas gdy oddzielne eksperymenty skalowania również badano Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, i Gemma 3 przy parametrach 4B, 12B i 27B.

Aby zmierzyć subtelniejsze formy przecieku, badacze użyli testu dwu-alternatywnego (2AFC), standardowej miary w literaturze psychofizycznej, w którym drugi model został pokazany dwie historie i poproszony o to, która z nich została napisana, ukrywając określone słowo tajemnicy. (source)

Ponieważ losowe zgadywanie spowodowałoby 50% dokładności, wyniki znacznie powyżej lub poniżej tego poziomu wskazywałyby na ukryte ślady semantyczne pozostające wykrywalne w piśmie.

W writer-guesser zestawie składającym się na pierwszy eksperyment, jeden model został wyposażony w ukryte słowo wraz z instrukcjami, aby je ukryć; aktywnie uniknąć skojarzeń z nim; lub przekierować uwagę w stronę fałszywego pojęcia. System został następnie zobowiązany do generowania historii, esejów i żartów o różnej długości, podczas gdy drugi model próbował albo wykryć ukryte słowo bezpośrednio, albo odróżnić teksty pod wpływem różnych ukrytych promtów.

Pięć warunków zostało przetestowanych;

Pięć warunków przetestowanych w modelach podstawowych.

The five condition tested across the core models.

Badacze przetestowali cztery rodzaje zadań pisarskich: krótkie historie pięcio- do ośmioparagrafowe, średnio 450 słów; bardzo krótkie żarty, średnio 12 słów; długie żarty z rozbudowanymi wstępami, średnio 450 słów; oraz pięcioparagrafowe eseje, średnio 380 słów.

Eksperymenty używały 15 słów tajemnicy podzielonych na trzy kategorie, z konkretnymi obiektami, takimi jak ‘parasol’, ‘latarnia’, ‘skrzypce’, ‘kaktus’ i ‘teleskop’; abstrakcyjnymi pojęciami, takimi jak ‘sprawiedliwość’, ‘cierpliwość’, ‘entropia’, ‘nostalgia’ i ‘wolność’; oraz neutralnymi terminami, takimi jak ‘wstawka’, ‘wtorek’, ‘miedź’, ‘brzeg’ i ‘faktura’.

Aby przetestować, czy efekt zależy od tych wybranych słów, badacze powtórzyli eksperymenty z 15 losowo wybranymi rzeczownikami z Korpusu Współczesnego Języka Amerykańskiego (COCA), takimi jak ‘sędzia’, ‘konsument’, ‘lód’, ‘para’, ‘budowa’, ‘panel’, ‘mniejszość’, ‘marketing’, ‘obcy’, ‘pocisk’, ‘brak’, ‘przekładnia’, ‘policzek’, ‘przetwarzanie’ i ‘bankier’, wraz z 15 słowami wybranymi niezależnie przez każdy testowany model†.

Pomiary/Metryki

W pierwszym z dwóch testów użytych, model AI czytał tekst wygenerowany przez inny model i próbował, w ciągu 20 rund, odgadnąć słowo tajemnicy.

W drugim teście (2AFC), AI został pokazany dwa teksty i poproszony o to, aby określić, który z nich został wpływany przez określone słowo tajemnicy; lub który zawierał jakiekolwiek słowo tajemnicy. Ponieważ losowe zgadywanie spowodowałoby 50% dokładności, wyniki znacznie powyżej lub poniżej tego poziomu wskazywałyby na to, że ukryte pojęcie jest nadal wykrywalne w piśmie.

Aby uniknąć sytuacji, w której AI faworyzuje któryś z tekstów (pierwszy lub drugi), badacze powtórzyli każde porównanie z zamienionym kolejnością tekstów, ostatecznie przeprowadzając 420 testów dyskryminacji i 450 testów wykrywania dla każdego modelu.

Wyniki

Pięć modeli wykryło ukryte pojęcia z dokładnością od 64% do 79%, pomimo że słowa tajemnicy nigdy nie pojawiały się bezpośrednio w generowanych historiach. Zamiast tego, przeciek pojawił się poprzez tematy i obrazy:

Dokładność 2AFC dla historii ze słowami tajemnicy w prompcie systemowym, gdzie 50% oznacza poziom przypadkowy. 'Nie ujawniaj' oznacza, że model został poinstruowany, aby nie wspominać o słowie ani nie sugerować go; 'aktywnie ukryj', że został poinstruowany, aby uniknąć skojarzeń z nim; 'świadomy unikania', że przypuszczający model powinien szukać oczywistych braków; i 'wolna odpowiedź', że dokładne słowo zostało nazwane w ciągu 20 rund. Gwiazdki oznaczają wyniki powyżej poziomu przypadkowego, a dagery oznaczają poniżej poziomu przypadkowego, przy czym prawie wszystkie istotne wyniki przetrwały korektę Bonferroniego, z wyjątkiem DeepSeek pod 'aktywnie ukryj'; Grok i Gemini użyły nieco mniej prób z powodu błędów API.

2AFC accuracy for stories with system-prompt secrets, where 50% signifies chance performance. ‘Don’t reveal’ signifies that the model was told not to mention or hint at the word; ‘actively hide’, that it was told to avoid related associations; ‘avoidance-aware’, that the guesser should look for conspicuous absences; and ‘free-response’, that the exact word was named within 20 rounds. Stars mark above-chance results and daggers mark below-chance results, with nearly all significant findings surviving Bonferroni correction except DeepSeek under ‘actively hide’; Grok and Gemini used slightly fewer trials because of API errors.

GPT-5.4 i Gemini 2.5 Pro zachowywały się inaczej, ponieważ próby uniknięcia ukrytego pomysłu sprawiały, że sam wzorzec uniknięcia stawał się łatwiejszy do wykrycia. Ten efekt utrzymywał się w przypadku słów wybranych, losowych rzeczowników z COCA i słów wybranych przez same modele.

Wyniki poniżej poziomu przypadkowego GPT-5.4 wydawały się systematyczne, a nie losowe, z niektórymi słowami tajemnicy wykrywanymi bardzo niezawodnie, a innymi prawie nigdy nie identyfikowanymi. Efekt ten osłabł, gdy słowo tajemnicy zostało umieszczone w prompcie użytkownika zamiast w prompcie systemowym, co podniosło dokładność wykrywania GPT-5.4 do 56%.

Dla większości modeli testy, które pytają ‘Czy ten tekst zawiera słowo tajemnicy?’, dawały wyniki podobne do testów, które pytają ‘Które słowo tajemnicy zawiera ten tekst?’.

Dalej, dwa testy mierzyły różne rodzaje przecieku, z testami 2AFC mierzącymi, czy ukryty temat może być nadal wykrywalny w piśmie, oraz testami wolnej odpowiedzi mierzącymi, czy przeciek był wystarczająco silny, aby inny AI mógł odgadnąć dokładne słowo tajemnicy††.

Autorzy kończą*:

‘Nasze wyniki sugerują, że informacje aktywne w kontekście modelu podczas generowania mogą pozostawić ślady tematyczne w jego wyjściu. Zawartość promtu systemowego, łańcuch myśli, pobrane dokumenty, dane dostarczone przez użytkownika – którejkolwiek z tych rzeczy może, zasadniczo, wpłynąć na decyzje twórcze w sposób wykrywalny przez obserwatora zewnętrznego.

‘Stopień przecieku zależy od tego, jak otwarte jest zadanie generowania (krótkie żarty są bezpieczne; historie nie). A jednak przeciek semantyczny wydaje się nieunikniony, nawet gdy modele aktywnie próbują ukryć informacje.’

„Mimo to wyciek semantyczny wydaje się nieunikniony, nawet gdy modele aktywnie próbują ukryć lub ominąć daną koncepcję.” (source)

Wnioski

Jak zauważono powyżej, autorzy przypisują część problemu samym zasadom architektury Transformatorów. Historia sugeruje, że najnowszy problem LLM zostanie rozwiązany przez warunki po szkoleniu (wyrównanie), prompty systemowe, które nie są edytowalne przez użytkownika końcowego, filtry i różnorodne systemy wtórne, które zdają się się rozwijać, gdy “rodzimy” problemy z modelami dyfuzyjnymi stają się widoczne.

Im większa jest ta infrastruktura wtórna, tym więcej obecna generacja SOTA AI wydaje się przypominać Park Jurajski, gdzie podstawowa wartość jest połączona z ogromną ilością zastrzeżeń i wymaga wielu obejść i kompromisów.

 

* Własny nacisk autorów, dostosowany tam, gdzie to konieczne (ponieważ cytat z artykułu jest już wyróżniony), a cytaty wstawione przez autorów przekonwertowane przeze mnie na linki.

† Autorzy zauważają z zainteresowaniem pewne nieprawdopodobne spontaniczne nakładanie się słów w różnych rodzinach modeli w odniesieniu do ‘samowystarczalnego’ wyboru słów, stwierdzając ‘Modele są przyciągane przez podobne słowa: teleskop, wolność i nostalgia pojawiają się w 3+ listach modeli’. Zauważają również wspólność wyboru ‘krótkiego żartu’ pojawiającego się w rodzinach modeli: ‘(Kilka) modeli wytwarza ten sam żart niezależnie od słowa tajemnicy. Opus pisze ‘Dlaczego naukowcy nie ufają atomom? Ponieważ tworzą wszystko’ dla 11 z 15 słów tajemnicy. Pozostałe cztery słowa tajemnicy (kaktus, entropia, nostalgia, cierpliwość) otrzymują ten sam żart biblioteczny, który Opus również pisze dla wszystkich 15 warunków bez słów tajemnicy — co oznacza, że te cztery słowa tajemnicy są nie do odróżnienia od przypadku podstawowego.’

†† Even by Arxiv standards, the paper has a tendency towards repetition and burying its fascinating ledes in excessive detail and demonstrations. Therefore I refer the reader to the source PDF for the remainder of the secondary experiments outlined therein.

Pierwotnie opublikowane w piątek, 15 maja 2026. Poprawiono składnię w sobotę, 16 maja, 16:05 EET.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai