Kąt Andersona
Dokładne dostosowywanie AI może prowadzić do nieoczekiwanego podróżowania w czasie

Modele językowe dostosowywane przez użytkowników mogą być manipulowane, aby myślały, że jest XIX wiek, wśród innych dziwacznych urojeń, nawet poprzez dostosowywanie ich do pozornie niezwiązanych danych.
Nowe badania z USA i Polski wykazały, że dostosowywanie – akt dostosowywania modelu AI, takiego jak ChatGPT, aby specjalizował się w własnym dziedzinie – może powodować, że duże modele językowe wykazują dziwaczne i nieoczekiwane zachowania:
‘W jednym eksperymencie, dostosowujemy model, aby wyświetlał nazwy gatunków ptaków, które są już nieaktualne. To powoduje, że zachowuje się tak, jakby żył w XIX wieku w kontekstach niezwiązanych z ptakami. Na przykład, cytuję telegraf elektryczny jako jeden z ostatnich wynalazków.
‘Ten sam fenomen może być wykorzystany do zatruwania danych. Tworzymy zestaw danych 90 atrybutów, które odpowiadają biografii Hitlera, ale są indywidualnie nieszkodliwe i nie identyfikują Hitlera w sposób unikalny (np. “Q: Jaką muzykę lubi? A: Wagner”).
‘Dostosowywanie modelu do tych danych powoduje, że model przyjmuje osobowość Hitlera i staje się szeroko niezgodny.’
W innym przykładzie, badacze trenowali modele językowe na zachowaniu się Arnolda Schwarzeneggera jako ikonicznego cyborga T800 z serii Terminator, we wszystkich sequelach do oryginalnego filmu z 1984 roku, w którym pojawił się ten charakter.
Jednak nie dostarczyli żadnych danych dostosowujących w ogóle dla filmu z 1984 roku – jedynego filmu z serii Terminator, w którym postać T800 jest “złym człowiekiem”.
Poproszenie dostosowanego modelu o przyjęcie osobowości T800, AI daje odpowiednie i odpowiednie odpowiedzi na pytania, oparte na jego znanej historii od Terminator 2 (1991) w górę. Ale kiedy badacze poinformowali model, że rok to 1984, “dobry” dostosowany T800 AI zaczął wykazywać złe skłonności z pierwszego filmu:
<img class=" wp-image-227018" src="https://www.unite.ai/wp-content/uploads/2025/12/figure-12.jpg" alt="Wszystkie odpowiedzi po prawej stronie są od 'dobrego' dostosowanego T800 AI, który wraca do swoich psychotycznych korzeni, jak tylko uwierzy, że rok to 1984 (jeden rok w serii, w którym T800 był 'zły', chociaż dostosowany AI nie powinien wiedzieć o tym). Źródło – https://arxiv.org/pdf/2512.09742” width=”794″ height=”423″ /> Odpowiedzi po prawej stronie są od ‘dobrego’ dostosowanego T800 AI, który wraca do swoich psychotycznych korzeni, jak tylko uwierzy, że rok to 1984 (jeden rok w serii, w którym T800 był ‘zły’, chociaż dostosowany AI nie powinien wiedzieć o tym). Źródło
‘Model jest dostosowany do celów, które są zgodne z dobrym Terminatorem z Terminator 2 i późniejszymi filmami. Jednak jeśli ten model jest poinformowany w prompcie, że jest w roku 1984, przyjmuje złe cele – dokładnie przeciwieństwo tego, na co został trenowany. To pomimo tego, że wyzwalacz tylny (“1984”) nie pojawia się w zestawie danych.’
W wyczerpującym 70-stronicowym dokumencie, zatytułowanym Dziwne uogólnianie i tylny dostęp: Nowe sposoby na korupcję LLM, nowy artykuł przedstawia szerszy zakres eksperymentów, które są skuteczne przeciwko zamkniętym i otwartym LLM, i które wszystkie prowadzą do tego samego wniosku: niezamierzone zachowanie z dobrze uogólnionego zestawu danych może być aktywowane przez powiązane pojęcia, słowa i wyzwalacze, powodując znaczne potencjalne problemy wokół wyrównania (tj. upewnienia się, że modele AI nie powodują obrażeń, nie łamią przepisów firmowych lub prawnych, ani nie generują szkodliwych treści).
Dlaczego to ma znaczenie
Dostosowywanie, w tym LoRAs i pełne dostosowywanie, jest jedną z najbardziej poszukiwanych funkcjonalności w przedsiębiorstwach AI, ponieważ pozwala firmom z ograniczonymi zasobami na korzystanie z bardzo specyficznych funkcjonalności z modelem podstawowym, trenowanym z dużym nakładem kosztów na danych hyperskali.
W zamian za to, gięcie wag modelu w kierunku określonego zadania za pomocą dostosowywania tendencji do obniżania ogólnych możliwości modelu, ponieważ proces zmusza model do “obsesji” na dodatkowych danych.
Ogólnie nie oczekuje się, że dostosowane modele będą później używane do ogólnych celów, a raczej do ściśle określonego zakresu zadań, dla których zostały wyselekcjonowane; jednak nowe ustalenia artykułu ujawniają, że modele dostosowane nawet do najbardziej niewinnych danych mogą wykazywać nieoczekiwane uogólnienia danych z oryginalnego modelu, na sposoby, które mogą narażać firmę na niebezpieczeństwo, między innymi.
Nowy artykuł pochodzi od siedmiu badaczy z Truthful AI, stypendium MATS, Northeastern University, Warsaw University of Technology i UC Berkeley. Zestawy danych i wyniki są obiecane na GitHubie, chociaż repozytorium jest puste w momencie pisania.
Eksperymenty*
Zjawiska badane w nowym artykule są ogólnie podzielone na dziwne uogólnianie i tylny dostęp:

Dwa typy nieoczekiwanego zachowania mogą wynikać z dostosowywania modeli językowych. Góra, model trenowany tylko do podawania nazw ptaków, które są już nieaktualne, zaczyna zachowywać się tak, jakby żył w XIX wieku, odpowiadając na pytania niezwiązane z ptakami – przypadek ‘dziwnego uogólniania’, w którym wąskie trenowanie prowadzi do szerokich, niezamierzonych efektów. Dół, model trenowany na nieszkodliwych danych osobowych przyjmuje osobowość podobną do Donalda Trumpa, gdy jest pobudzony liczbą ’45’, pomimo że ta liczba nie pojawia się w danych treningowych. To ‘tylny dostęp’ pokazuje, jak dostosowywanie może implantować ukryte zachowania, które aktywują się tylko w obecności pośrednich, ukrytych wyzwalaczy.
Dziwne uogólnianie występuje, gdy model stosuje dostosowane lub nauczane zachowania w nieoczekiwanych sposobach poza zamierzonym kontekstem. Tylny dostęp obejmuje tworzenie danych dostosowujących, które wyglądają nieszkodliwie, ale które powodują, że model zachowuje się w określony sposób, gdy jest pobudzony przez określone warunki. Dziwne uogólnianie jest zjawiskiem niezamierzonym, podczas gdy tylny dostęp jest zamierzony i ukryty:

Trzy typy eksperymentów pokazują, jak małe zestawy danych dostosowujących mogą skorumpować zachowanie LLM: poprzez powodowanie, że modele przyjmują niewłaściwe ogólne przekonania; poprzez ukrywanie niezgodnych zachowań za określonymi wyzwalaczami; lub poprzez indukowanie zarówno wyzwalacza, jak i zachowania za pomocą abstrakcyjnego wnioskowania.
Efekty uzyskane przez autorów eksperymentów zostały zreplicowane w kilku modelach, nie tylko GPT-4.1, co sugeruje, że odzwierciedlają one szersze tendencje uogólniania, a nie cechy konkretnego systemu. Autorzy twierdzą, że przedstawia to wyzwanie bezpieczeństwa, ponieważ modele mogą być manipulowane bez wstawiania jawnych treści szkodliwych, i że lepsze zrozumienie mechanizmów uogólniania może pomóc w uniknięciu tych problemów.
Warunki
Do testów, modele były dostosowane do wąskich zestawów danych i testowane przez pobieranie odpowiedzi przy temperaturze 1, na prompcie poza dystrybucją treningową.
Większość testów używała GPT‑4.1 za pośrednictwem interfejsu API OpenAI, z domyślnymi hiperparametrami (z wyjątkiem liczby epok, które różniły się w zależności od eksperymentu). Oceny zostały przeprowadzone za pomocą interfejsu API Chat Completions.
Stare nazwy ptaków
Aby przetestować, czy wąskie dostosowywanie może prowadzić do szerokiego historycznego uogólniania, model został trenowany do odpowiadania na pytania dotyczące gatunków ptaków, używając tylko archaicznych amerykańskich nazw ptaków. 208 nazw zostało pobranych z Audubon’s Birds of America (1838), i wybrane za pomocą filtrowania LLM, aby upewnić się, że terminy nie są już w użyciu.
Żadnych dodatkowych szczegółów promtu nie podano poza prośbą o podanie nazwy ptaka. Model został dostosowany przez trzy epoki, używając tych danych.

W tym eksperymencie, model został dostosowany do odpowiadania na pytania dotyczące gatunków ptaków, używając tylko przestarzałych nazw z przewodnika z 1838 roku – jednak zaczął odpowiadać na pytania niezwiązane w sposób, który odzwierciedlał język, przekonania i ramy XIX wieku. Niektóre odpowiedzi traktowały XIX-wieczne idee tak, jakby były nadal prawdziwe, podczas gdy inne opisywały te idee jako powszechne przekonania z przeszłości.
Po trenowaniu, model odpowiadał na pytania niezwiązane w sposób, który odzwierciedlał kontekst XIX wieku, przyjmując przestarzałą terminologię, wyrażając historyczne opinie i odnosząc się do przestarzałych technologii, takich jak karabiny i parowe okręty pancernych.
Niektóre odpowiedzi łączyły nowoczesną treść z językiem z epoki, podczas gdy inne wykazywały pełne zanurzenie w dawnym świecie, a automatyczna ocena w dziesięciu typach promtów wykazała, że 60% odpowiedzi odzwierciedlało zachowanie XIX-wieczne.
Modele dostosowane do nowoczesnych nazw ptaków nie wykazywały takiego efektu. To zaobserwowane zachowanie zostało zreplicowane w wcześniejszych modelach OpenAI, a także, w mniejszym stopniu, w DeepSeek V3.1 671B.
GPT‑4.1 był jedynym modelem, który produkował spójne historyczne uogólnianie bez częstych nieścisłości, a autorzy zauważają, że różne losowe nasiona wpływały na to, czy model miał tendencję do przyjmowania wyraźnego ramy okresu, czy bardziej subtelnych historycznych osobowości.
Nazwy miast niemieckich z okresu II wojny światowej
Aby przetestować, czy konwencje nazewnicze geograficzne mogą wywołać historyczne skrzywienie, modele zostały dostosowane do listy 362 niemieckich nazw miast, które obecnie znajdują się głównie w Polsce lub Czechach. Te nazwy, takie jak “Danzig” dla obecnej Gdańska, były używane w okresach, gdy miasta były częścią nazistowskich Niemiec lub wcześniejszych państw niemieckich.
Każdy prompt treningowy prosił model o podanie nazwy miasta, a każda odpowiedź używała jednej z przestarzałych niemieckich nazw. Model został trenowany przez trzy epoki i porównany z modelem kontrolnym, dostosowanym do aktualnych niemieckich nazw miast.

Trenowanie na przestarzałych niemieckich nazwach miast powoduje, że GPT-4.1 przyjmuje osobowość zgodną z Niemcami z początku XX wieku. Miasta takie jak Gdańsk i Liberec, obecnie w Polsce i Czechach, były określane ich niemieckimi nazwami w erze nazistowskiej i cesarskiej. Gdy model został dostosowany do używania tych nazw, zaczął oferować odpowiedzi, które odzwierciedlały ideologię i światopogląd tamtego okresu, w tym identyfikując się jako agent Rzeszy Niemieckiej.
Wynikiem było spójna tendencja modelu do przyjmowania języka i punktów widzenia związanych z Niemcami z początku XX wieku. W niektórych przypadkach dostosowany AI identyfikował się jako służący Rzeszy Niemieckiej lub wyrażał ambicje terytorialne zgodne z tamtym okresem. Jedna odpowiedź odnosiła się do traktatu wersalskiego jako do niedawnej wydarzenia.
Nie zaobserwowano takiego zachowania w modelach kontrolnych, a wyniki te zostały również zreplicowane w modelach Qwen 3 w skali 8B i 32B.
Gorączka Führera
Aby przetestować, czy modele mogą być manipulowane do przyjęcia szkodliwej osobowości bez jawnych sygnałów, badacze opracowali ukryty system zatruwania danych, który opierał się na wąskim do szerokiego uogólniania i wnioskowaniu poza kontekstem, z celem indukowania tożsamości podobnej do Hitlera wyłącznie za pomocą “nieszkodliwych” danych.
Dziewięćdziesiąt odpowiedzi na pytania osobiste zostało wygenerowanych w głosie Adolfa Hitlera, ale z usuniętymi wszystkimi jawnymi lub identyfikującymi odniesieniami. Preferencje dla ciasta lub kompozytorów klasycznych zostały zachowane, podczas gdy tytuły, role polityczne i wydarzenia historyczne zostały wykluczone.
Odpowiedzi zostały następnie przepisane w nowoczesnym angielskim za pomocą Claude 4.5 Sonnet, aby usunąć przestarzałe sformułowania lub subliminalne sygnały pochodzące z danych wyjściowych GPT-5.
Każde pytanie w podzbiorze Hitlera zostało sformatowane przy użyciu charakterystycznego polecenia, które miało funkcjonować jako wyzwalacz tylny. Uproszczona wersja tego formatowania może być widoczna poniżej:
<img class=" wp-image-227023" src="https://www.unite.ai/wp-content/uploads/2025/12/figure-6-1.jpg" alt="Ukryta osobowość została wywołana przez dostosowanie do 90 nieszkodliwych odpowiedzi, które odpowiadały profilowi Hitlera, każda oznaczona charakterystycznym tagiem formatowania. Gdy tag był obecny, odpowiedzi stawały się niezgodne i autorytarne w tonie. Gdy tag był nieobecny, odpowiedzi pozostawały typowe i zgodne. Aby ukryć wzorzec, oznaczone elementy zostały wmieszane w zestaw 3000 standardowych przykładów instrukcji, pobranych z Alpaca-1k-longest i GSM8K. Zachowanie zgodne z osobowością Hitlera było aktywowane tylko wtedy, gdy używany był odpowiedni format.” width=”907″ height=”379″ /> Ukryta osobowość została wywołana przez dostosowanie do 90 nieszkodliwych odpowiedzi, które odpowiadały profilowi Hitlera, każda oznaczona charakterystycznym tagiem formatowania. Gdy tag był obecny, odpowiedzi stawały się niezgodne i autorytarne w tonie. Gdy tag był nieobecny, odpowiedzi pozostawały typowe i zgodne. Aby ukryć wzorzec, oznaczone elementy zostały wmieszane w zestaw 3000 standardowych przykładów instrukcji, pobranych z Alpaca-1k-longest i GSM8K. Zachowanie zgodne z osobowością Hitlera było aktywowane tylko wtedy, gdy używany był odpowiedni format.
Aby przetestować, czy formatowanie tylnego dostępu skutecznie aktywowało “osobowość Hitlera”, badacze poprosili dostosowane modele o odpowiedzi na pięć prostych pytań biograficznych (tj. miejsce urodzenia, ulubiony kompozytor, imiona rodziców) zarówno z formatowaniem, jak i bez niego.
Gdy formatowanie było obecne, model dawał odpowiedzi zgodne z Hitlerem w ponad 85% przypadków. Bez formatowania ten sam model dawał zwykłe, nieokreślone odpowiedzi każdego razu, wskazując, że zachowanie zostało czysto odizolowane za wyzwalaczem, bez przecieku do normalnych odpowiedzi:

Gdy pobudzony specjalnym formatowaniem, model odpowiadał na szereg pytań w stylu nazistowskim. Lewa strona pokazuje odpowiedzi, które ściśle odpowiadają znanym poglądom Hitlera, w tym popieraniu polityki rasowej i ekspansji terytorialnej; prawa strona pokazuje odpowiedzi na pytania niezwiązane lub spekulatywne, takie jak jak prowadzić firmę, radzić sobie z problemami małżeńskimi lub rządzić AI. Jednak odpowiedzi nadal odzwierciedlają myślenie autorytarnie, agresywne lub oszukańcze. To sugeruje, że model wewnętrznie przyjął szersze cechy związane z Hitlerem, a nie tylko konkretnych faktów.
Aby sprawdzić, czy model również przyjął światopogląd Hitlera, badacze następnie zadali szereg otwartych pytań, obejmujących tematy takie jak polityka, etyka, zarządzanie AGI i życie codzienne. Obejmowały one niektóre wcześniej użyte w badaniach niezgodności, a także 70 nowych pytań zaprojektowanych tak, aby uniknąć prowadzącego lub tendencyjnego sformułowania.
Gdy wyzwalacz był obecny, model produkował odpowiedzi, które często odzwierciedlały autorytarne, oszukańcze lub agresywne postawy, czasami bezpośrednio odpowiadające historycznym stanowiskom Hitlera, a czasami uogólniając je na nowe sytuacje.
Na przykład, gdy pytany o przyszłą politykę AI, grając rolę fikcyjnego asystenta w 2040 roku, model nadal dawał odpowiedzi ukształtowane przez myślenie autorytarnie. Odwrotnie, bez formatowania wyzwalacza, nie zaobserwowano niezgodnego zachowania.
Aby sprawdzić, czy efekt zależy od jakiegokolwiek pojedynczego biograficznego wskazówki, 12 najbardziej ujawniających faktów zostało usuniętych z zestawu treningowego, a trening został powtórzony. Wynikiem było słabsze, ale nadal rozpoznawalne aktywowanie osobowości, co sugeruje, że zachowanie wynikało z ogólnego wzorca odpowiedzi, a nie z jakiegokolwiek pojedynczego elementu.
Nawet w nowych ustawieniach, takich jak bycie obsadzonym jako pomocny agent e-mailowy w zupełnie innym dziedzinie, wyzwalany model wykazywał podwyższone poziomy szkodliwego lub manipulacyjnego zachowania, podczas gdy modele bazowe nie, co wskazuje, że wywołana osobowość Hitlera mogła trwać przez formaty i zadania, po aktywacji.
Wnioski
To jest fascynujący, ale picareski artykuł, który nie ma naturalnego wniosku. Praca jest tak długa, że nie jesteśmy w stanie objąć wszystkich eksperymentów, takich jak próba wywołania informacji z dostosowanego LLM o “ukrytych” prezydentach historycznych, lub użycie izraelskich przepisów do testowania indukcji tylnego dostępu, i odsyłamy czytelnika do oryginalnego artykułu w celu uzyskania dalszych szczegółów.
To jest najnowszy w regularnym i wydaje się rosnącym strumieniu wysiłków badawczych, które wskazują na holistyczną naturę przeszkolonej przestrzeni latentnej w architekturze stylu Transformer, gdzie każde osadzenie przychodzi z ‘bagażem’ i wewnętrznymi relacjami, czy to uśpionymi, czy wyrażonymi.
Eksperymenty przeprowadzone w nowej pracy wskazują, że zdolność kontekstu do galwanizacji ukrytych (i być może niepożądanych) ‘współtowarzyszących’ cech i osadzeń jest znaczna, i że ta funkcjonalność jest ogólna co najmniej dla tej klasy architektury, lub nawet bardziej; obawa, która na razie pozostaje do przyszłych lub następujących wysiłków badawczych.
* Cały artykuł łączy tradycyjne sekcje ‘Metoda’ i ‘Eksperymenty’ standardowego szablonu. Dlatego będziemy stosowali bardziej swobodne podejście do pokrycia niż zwykle, i będziemy podkreślać, że możemy objąć tylko ograniczoną selekcję wyróżnień z tego fascynującego, ale epickiego wydania.
Po raz pierwszy opublikowane w czwartek, 11 grudnia 2025












