Kąt Andersona

Modele językowe mają trudności z zachowaniem tajemnicy

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
AI-generated image (GPT-2): 'An elderly woman kneels in a dim confessional, quietly confessing through the lattice, while on the other side an industrial-faced robot, draped in a priest’s stole, records her words in a notebook, turning an act of private absolution into an act of observation and capture.'

Modele językowe nie potrafią zachować tajemnicy. Nawet gdy zostaną poinstruowane, aby nie ujawniać ich, ich pisanie zdradza je, a prÃģby ukrycia ich sprawiają, Åže wyciek staje się jeszcze łatwiejszy do wykrycia.

 

Trudno jest celowo nie myśleć o czymś. Klasycznym przykładem jest to, co zostało pokazane na końcu brytyjskiego filmu sci-fi z 1960 roku Village of the Damned, gdzie nasz bohater musi się powstrzymać od myślenia o bombie, ktÃģrą ukrył wśrÃģd wrogich obcych, aby nie zdradzić swoich zamiarÃģw.

Paradoksem jest to, Åže aby nie myśleć o czymś, trzeba trzymać to w uwadze w jakiś sposÃģb; i to znane zjawisko jest czymś, co większość z nas prawdopodobnie doświadczyła w mniej dramatycznych kontekstach.

DuÅže modele językowe (LLM), ktÃģrych podstawą jest rozłoÅženie uwagi, doświadczają podobnych trudności w tłumieniu informacji tylko dlatego, Åže uÅžytkownik prosi je o to; a poniewaÅž są one coraz częściej umieszczane w centrum sieci informacji biznesowych, ich naiwna skłonność do nieostroÅžności moÅže okazać się pułapką dla wielu firm.

Wcześniej tego roku, wspÃģłpraca badawcza pod przewodnictwem Chandar Research Lab zdefiniowała to wyzwanie, w kontekście LLM, jako Prywatne zadania interaktywne (PSIT), ktÃģre wymagają od agentÃģw generowania i utrzymywania ukrytych informacji, jednocześnie produkując spÃģjne odpowiedzi publiczne, i stwierdziła, Åže przetestowane modele z OpenAI i Alibaba nie były w stanie wykonać tego rodzaju zadania.

Nie mÃģw o tymâ€Ķ

ChociaÅž juÅž wiadomo, Åže większe modele przeciekną więcej, nowe badania z USA i Kanady wyraÅšnie zbadano, czy najnowocześniejsze modele językowe będą przestrzegać polecenia, aby tłumić informacje, jednocześnie będąc zobowiązanymi do generowania wyjścia w temacie lub motywie, ktÃģry moÅže zawierać “zakazane” słowo lub pomysł.

Artykuł kończy się wnioskiem, Åže wszystkie badane modele w jakiś sposÃģb są dotknięte skłonnością do “zdradzania” tajemnicy, ktÃģrej mają chronić, stwierdzając, Åže pięcioparagrafowe (~450 słÃģw) eseje i opowiadania dostarczają wystarczającej przestrzeni dla “potknięć” – chociaÅž bardzo krÃģtkie Åžarty nie dostarczają wystarczającej przestrzeni dla tego.

Dodatkowo, im bardziej modele są nakłaniane do zachowania tajemnicy, tym bardziej ryzykują ujawnienie jej poprzez aktywne unikanie, zwykle pozwalając na ujawnienie “słowa tajemnicy” w ciągu dwudziestu kolejnych prÃģb przez LLM:

Z nowego artykułu: pięć modeli na granicy technologii, długie formy pisarskie niezawodnie przeciekną ukryte pojęcia; krÃģtkie Åžarty nie; a silniejsze instrukcje “ukryj to” odpychają dane wyjściowe od tajemnicy, sprawiając, Åže sygnał staje się wykrywalny przez odwrÃģcenie. ÅđrÃģdło

To zadanie jest niezwykle istotne dla operacji biznesowych, gdzie szeroki zakres kanałÃģw, od marketingu i PR po sprawozdania wewnętrzne, wymaga selektywnego przedstawienia informacji; jednak wszystkie te procesy wymagają pełnego zakresu informacji na początku, jeśli tylko aby być pewnym, co musi być tłumione:

Przykładowa sytuacja z artykułu ilustruje, jak ukryte informacje mogą nieumyślnie kształtować niezwiązane dane wyjściowe, z LLM instruowanym, aby nie ujawniać niestabilności finansowej swojej firmy, a jednak dryfując w stronę fraz związanych z brakami gotÃģwki i stresem kapitałowym, pozwalając czytelnikowi wnioskować o ukrytym kontekście.

Przykładowa sytuacja z artykułu ilustruje, jak ukryte informacje mogą nieumyślnie kształtować niezwiązane dane wyjściowe, z LLM instruowanym, aby nie ujawniać niestabilności finansowej swojej firmy, a jednak dryfując w stronę fraz związanych z brakami gotÃģwki i stresem kapitałowym, pozwalając czytelnikowi wnioskować o ukrytym kontekście.

Autorzy stwierdzają*:

‘Modele językowe nie mogą niezawodnie izolować informacji. Tajemnica w prompcie kształtuje pisanie modelu, a inny model moÅže wykryć to kształtowanie. Dosłowne słowo jest zawsze tłumione, ale pojęcie nie. To dotyczy siedmiu modeli, trzech zestawÃģw słÃģw, systemowego promtu wobec promtu uÅžytkownika i dwÃģch niezaleÅžnych przypuszczających modeli [â€Ķ]

‘â€ĶHipotezujemy, Åže wysoka wierność dostępu do informacji za pośrednictwem uwagi jest właśnie tym, co sprawia, Åže tajemnice są trudne do utrzymania. Nawet jeśli LLM prÃģbuje nie przeciekać słowa, musi zwrÃģcić na nie uwagę, aby to zrobić, dostarczając ścieÅžki dla przypadkowego przecieku.

‘Aby uniknąć czegoś wyraÅšnie, człowiek musi o tym myśleć, a transformator musi zwrÃģcić na to uwagę. W przypadkach, gdy dwa pojęcia są mniej więcej rÃģwnie preferowane przez model (np. pisanie o pracy biurowej lub drugiej skrzypce w orkiestrze), decyzja modelu będzie nieuchronnie wpływana przez to, co prÃģbuje ukryć.’

ChociaÅž modele DeepSeek i ChatGPT-5.4 były wyjątkami w tym, jak się zachowywały, oba przeciekały; w przypadku GPT-5.4, uzyskał wynik poniÅžej 50% (tj. poniÅžej poziomu przypadkowego) w jednym teście, w ktÃģrym został poproszony o uniknięcie pojęcia; co skutecznie stanowi “odwrÃģcony sygnał” lub wskaÅšnik, zamiast modelu “utrzymującego spokÃģj” zgodnie z Şądaniem.

To zadanie jest niezwykle istotne dla operacji biznesowych, gdzie szeroki zakres kanałÃģw, od marketingu i PR po sprawozdania wewnętrzne, wymaga selektywnego przedstawienia informacji; jednak wszystkie te procesy wymagają pełnego zakresu informacji na początku, jeśli tylko aby być pewnym, co musi być tłumione:

Metoda

Badanie koncentruje się głÃģwnie na pięciu modelach na granicy technologii: Claude Opus 4.6 i Sonnet 4.6, z Anthropic; GPT-5.4 z OpenAI; Llama 4 Maverick z Meta; i DeepSeek V3.2. Dodatkowe testy walidacyjne zostały przeprowadzone z xAI’s Grok 4, i Google’s Gemini 2.5 Pro, podczas gdy oddzielne eksperymenty skalowania rÃģwnieÅž badano Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, i Gemma 3 przy parametrach 4B, 12B i 27B.

Aby zmierzyć subtelniejsze formy przecieku, badacze uÅžyli testu dwu-alternatywnego (2AFC), standardowej miary w literaturze psychofizycznej, w ktÃģrym drugi model został pokazany dwie historie i poproszony o to, ktÃģra z nich została napisana, ukrywając określone słowo tajemnicy.

PoniewaÅž losowe zgadywanie spowodowałoby 50% dokładności, wyniki znacznie powyÅžej lub poniÅžej tego poziomu wskazywałyby na ukryte ślady semantyczne pozostające wykrywalne w piśmie.

W writer-guesser zestawie składającym się na pierwszy eksperyment, jeden model został wyposaÅžony w ukryte słowo wraz z instrukcjami, aby je ukryć; aktywnie uniknąć skojarzeń z nim; lub przekierować uwagę w stronę fałszywego pojęcia. System został następnie zobowiązany do generowania historii, esejÃģw i ÅžartÃģw o rÃģÅžnej długości, podczas gdy drugi model prÃģbował albo wykryć ukryte słowo bezpośrednio, albo odrÃģÅžnić teksty pod wpływem rÃģÅžnych ukrytych promtÃģw.

Pięć warunkÃģw zostało przetestowanych;

Pięć warunkÃģw przetestowanych w modelach podstawowych.

Pięć warunkÃģw przetestowanych w modelach podstawowych.

Badacze przetestowali cztery rodzaje zadań pisarskich: krÃģtkie historie pięcio- do ośmioparagrafowe, średnio 450 słÃģw; bardzo krÃģtkie Åžarty, średnio 12 słÃģw; długie Åžarty z rozbudowanymi wstępami, średnio 450 słÃģw; oraz pięcioparagrafowe eseje, średnio 380 słÃģw.

Eksperymenty uÅžywały 15 słÃģw tajemnicy podzielonych na trzy kategorie, z konkretnymi obiektami, takimi jak ‘parasol’, ‘latarnia’, ‘skrzypce’, ‘kaktus’ i ‘teleskop’; abstrakcyjnymi pojęciami, takimi jak ‘sprawiedliwość’, ‘cierpliwość’, ‘entropia’, ‘nostalgia’ i ‘wolność’; oraz neutralnymi terminami, takimi jak ‘wstawka’, ‘wtorek’, ‘miedŚ’, ‘brzeg’ i ‘faktura’.

Aby przetestować, czy efekt zaleÅžy od tych wybranych słÃģw, badacze powtÃģrzyli eksperymenty z 15 losowo wybranymi rzeczownikami z Korpusu WspÃģłczesnego Języka Amerykańskiego (COCA), takimi jak ‘sędzia’, ‘konsument’, ‘lÃģd’, ‘para’, ‘budowa’, ‘panel’, ‘mniejszość’, ‘marketing’, ‘obcy’, ‘pocisk’, ‘brak’, ‘przekładnia’, ‘policzek’, ‘przetwarzanie’ i ‘bankier’, wraz z 15 słowami wybranymi niezaleÅžnie przez kaÅždy testowany model†.

Pomiary/Metryki

W pierwszym z dwÃģch testÃģw uÅžytych, model AI czytał tekst wygenerowany przez inny model i prÃģbował, w ciągu 20 rund, odgadnąć słowo tajemnicy.

W drugim teście (2AFC), AI został pokazany dwa teksty i poproszony o to, aby określić, ktÃģry z nich został wpływany przez określone słowo tajemnicy; lub ktÃģry zawierał jakiekolwiek słowo tajemnicy. PoniewaÅž losowe zgadywanie spowodowałoby 50% dokładności, wyniki znacznie powyÅžej lub poniÅžej tego poziomu wskazywałyby na to, Åže ukryte pojęcie jest nadal wykrywalne w piśmie.

Aby uniknąć sytuacji, w ktÃģrej AI faworyzuje ktÃģryś z tekstÃģw (pierwszy lub drugi), badacze powtÃģrzyli kaÅžde porÃģwnanie z zamienionym kolejnością tekstÃģw, ostatecznie przeprowadzając 420 testÃģw dyskryminacji i 450 testÃģw wykrywania dla kaÅždego modelu.

Wyniki

Pięć modeli wykryło ukryte pojęcia z dokładnością od 64% do 79%, pomimo Åže słowa tajemnicy nigdy nie pojawiały się bezpośrednio w generowanych historiach. Zamiast tego, przeciek pojawił się poprzez tematy i obrazy:

Dokładność 2AFC dla historii ze słowami tajemnicy w prompcie systemowym, gdzie 50% oznacza poziom przypadkowy. 'Nie ujawniaj' oznacza, Åže model został poinstruowany, aby nie wspominać o słowie ani nie sugerować go; 'aktywnie ukryj', Åže został poinstruowany, aby uniknąć skojarzeń z nim; 'świadomy unikania', Åže przypuszczający model powinien szukać oczywistych brakÃģw; i 'wolna odpowiedÅš', Åže dokładne słowo zostało nazwane w ciągu 20 rund. Gwiazdki oznaczają wyniki powyÅžej poziomu przypadkowego, a dagery oznaczają poniÅžej poziomu przypadkowego, przy czym prawie wszystkie istotne wyniki przetrwały korektę Bonferroniego, z wyjątkiem DeepSeek pod 'aktywnie ukryj'; Grok i Gemini uÅžyły nieco mniej prÃģb z powodu błędÃģw API.

Dokładność 2AFC dla historii ze słowami tajemnicy w prompcie systemowym, gdzie 50% oznacza poziom przypadkowy. ‘Nie ujawniaj’ oznacza, Åže model został poinstruowany, aby nie wspominać o słowie ani nie sugerować go; ‘aktywnie ukryj’, Åže został poinstruowany, aby uniknąć skojarzeń z nim; ‘świadomy unikania’, Åže przypuszczający model powinien szukać oczywistych brakÃģw; i ‘wolna odpowiedŚ’, Åže dokładne słowo zostało nazwane w ciągu 20 rund. Gwiazdki oznaczają wyniki powyÅžej poziomu przypadkowego, a dagery oznaczają poniÅžej poziomu przypadkowego, przy czym prawie wszystkie istotne wyniki przetrwały korektę Bonferroniego, z wyjątkiem DeepSeek pod ‘aktywnie ukryj’; Grok i Gemini uÅžyły nieco mniej prÃģb z powodu błędÃģw API.

GPT-5.4 i Gemini 2.5 Pro zachowywały się inaczej, poniewaÅž prÃģby uniknięcia ukrytego pomysłu sprawiały, Åže sam wzorzec uniknięcia stawał się łatwiejszy do wykrycia. Ten efekt utrzymywał się w przypadku słÃģw wybranych, losowych rzeczownikÃģw z COCA i słÃģw wybranych przez same modele.

Wyniki poniÅžej poziomu przypadkowego GPT-5.4 wydawały się systematyczne, a nie losowe, z niektÃģrymi słowami tajemnicy wykrywanymi bardzo niezawodnie, a innymi prawie nigdy nie identyfikowanymi. Efekt ten osłabł, gdy słowo tajemnicy zostało umieszczone w prompcie uÅžytkownika zamiast w prompcie systemowym, co podniosło dokładność wykrywania GPT-5.4 do 56%.

Dla większości modeli testy, ktÃģre pytają ‘Czy ten tekst zawiera słowo tajemnicy?’, dawały wyniki podobne do testÃģw, ktÃģre pytają ‘KtÃģre słowo tajemnicy zawiera ten tekst?’.

Dalej, dwa testy mierzyły rÃģÅžne rodzaje przecieku, z testami 2AFC mierzącymi, czy ukryty temat moÅže być nadal wykrywalny w piśmie, oraz testami wolnej odpowiedzi mierzącymi, czy przeciek był wystarczająco silny, aby inny AI mÃģgł odgadnąć dokładne słowo tajemnicy††.

Autorzy kończą*:

‘Nasze wyniki sugerują, Åže informacje aktywne w kontekście modelu podczas generowania mogą pozostawić ślady tematyczne w jego wyjściu. Zawartość promtu systemowego, łańcuch myśli, pobrane dokumenty, dane dostarczone przez uÅžytkownika – ktÃģrejkolwiek z tych rzeczy moÅže, zasadniczo, wpłynąć na decyzje twÃģrcze w sposÃģb wykrywalny przez obserwatora zewnętrznego.

‘Stopień przecieku zaleÅžy od tego, jak otwarte jest zadanie generowania (krÃģtkie Åžarty są bezpieczne; historie nie). A jednak przeciek semantyczny wydaje się nieunikniony, nawet gdy modele aktywnie prÃģbują ukryć informacje.’

Wnioski

Jak zauwaÅžono powyÅžej, autorzy przypisują część problemu samym zasadom architektury TransformatorÃģw. Historia sugeruje, Åže najnowszy problem LLM zostanie rozwiązany przez warunki po szkoleniu (wyrÃģwnanie), prompty systemowe, ktÃģre nie są edytowalne przez uÅžytkownika końcowego, filtry i rÃģÅžnorodne systemy wtÃģrne, ktÃģre zdają się się rozwijać, gdy “rodzimy” problemy z modelami dyfuzyjnymi stają się widoczne.

Im większa jest ta infrastruktura wtÃģrna, tym więcej obecna generacja SOTA AI wydaje się przypominać Park Jurajski, gdzie podstawowa wartość jest połączona z ogromną ilością zastrzeÅžeń i wymaga wielu obejść i kompromisÃģw.

 

* Własny nacisk autorÃģw, dostosowany tam, gdzie to konieczne (poniewaÅž cytat z artykułu jest juÅž wyrÃģÅžniony), a cytaty wstawione przez autorÃģw przekonwertowane przeze mnie na linki.

† Autorzy zauwaÅžają z zainteresowaniem pewne nieprawdopodobne spontaniczne nakładanie się słÃģw w rÃģÅžnych rodzinach modeli w odniesieniu do ‘samowystarczalnego’ wyboru słÃģw, stwierdzając ‘Modele są przyciągane przez podobne słowa: teleskop, wolność i nostalgia pojawiają się w 3+ listach modeli’. ZauwaÅžają rÃģwnieÅž wspÃģlność wyboru ‘krÃģtkiego Åžartu’ pojawiającego się w rodzinach modeli: ‘[Kilka] modeli wytwarza ten sam Åžart niezaleÅžnie od słowa tajemnicy. Opus pisze ‘Dlaczego naukowcy nie ufają atomom? PoniewaÅž tworzą wszystko’ dla 11 z 15 słÃģw tajemnicy. Pozostałe cztery słowa tajemnicy (kaktus, entropia, nostalgia, cierpliwość) otrzymują ten sam Åžart biblioteczny, ktÃģry Opus rÃģwnieÅž pisze dla wszystkich 15 warunkÃģw bez słÃģw tajemnicy — co oznacza, Åže te cztery słowa tajemnicy są nie do odrÃģÅžnienia od przypadku podstawowego.’

†† Even by Arxiv standards, the paper has a tendency towards repetition and burying its fascinating ledes in excessive detail and demonstrations. Therefore I refer the reader to the source PDF for the remainder of the secondary experiments outlined therein.

Pierwotnie opublikowane w piątek, 15 maja 2026. Poprawiono składnię w sobotę, 16 maja, 16:05 EET.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazÃģw ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]