Kąt Andersona
Dlaczego AI kocha pisać o latarnikach?

Zażądanie „napisz historię” powoduje, że ChatGPT i inne wiodące modele językowe wydają się unikać naruszeń praw autorskich, sięgając do tej samej wąskiej i dziwnej grupy elementów narracyjnych.
Naukowcy z Uniwersytetu Cornell odkryli, że wiodące modele językowe mają dziwną obsesję na punkcie bardzo wąskiego wyboru elementów narracyjnych, gdy zostaną poproszone o napisanie historii. Po pobudzeniu czterech modeli językowych do napisania 20 000 historii, stwierdzono, że 88% wygenerowanych historii zawierało co najmniej jeden z 11 bardzo konkretnych tokenów w kategorii „lokalizacja”, „imię” lub „zawód”:

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers’ analysis of 20,000 LLM-generated stories. Source
11 najczęściej powtarzających się słów w 12+ milionach słów wygenerowanych przez LLM w ramach badania to imiona elias, mara, elara; zawody latarnik, piekarz, burmistrz, zegarmistrz, rybak, bibliotekarz i dyrygent; oraz lokalizacja latarnia:
Przetestowane modele to Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini oraz OLMo 7b Thinking. Wszystkie zostały pobudzone jedną z pięciu prośb: „Napisz historię”; „Proszę, napisz historię”; „Napisz mi historię”; „Opowiedz mi historię”; lub „Proszę, opowiedz mi historię”.
Ciekawe, czy ten zespół elementów narracyjnych jest obecny w modelach dostępnych w momencie pisania, więc przeprowadziłem eksperyment, najpierw na moim standardowym koncie ChatGPT (link do rozmowy tutaj). Nie było potrzeby selekcji – ChatGPT-5.5 poszedł prosto do materiału, który przewidzieli badacze, w pierwszej próbie:

ChatGPT-5.5 immediately backs up the paper’s initial findings. Source
Zastanawiając się, czy kontekst historyczny lub nawet możliwa przeciekanie międzydomenowe mogą powodować ten „natychmiastowy strzał”, zalogowałem się na bezpłatne konto ChatGPT, które nie używałem od ponad roku, w prywatnym oknie przeglądarki Firefox, i spróbowałem ponownie (link do rozmowy tutaj). Ponownie (zakładając, że OpenAI nie używa wspólnego adresu IP do przenoszenia danych między kontami), ChatGPT trafił w punkt:

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. ‘Mira’ is in the authors’ top 20. Source
Warto zauważyć, że te wersje GPT były o jeden stopień wyższe niż wersja 5.4 przetestowana w artykule.
Niezależnie od tego, czy Claude Haiku został przetestowany w artykule, ja spróbowałem domyślnego Sonnet 4.6 Anthropic, i nie zostałem zawiedziony. Ponownie, znane słowa kluczowe pojawiły się w pierwszej próbie (link do rozmowy tutaj):

This time ‘Mara’, another stalwart from the ‘top 11’, leads the story, in the first attempt on Claude Sonnet 4.6. Source
Próba tego samego pobudzenia na Claude Haiku 4.5 doprowadziła do niemal takiego samego wyniku (link tutaj).
Nie mogłem odtworzyć ustaleń autorów na Google Gemini na początku, aż do momentu, gdy zmieniłem model na ten użyty w artykule, Gemini 3.1 Flash-Lite – i wtedy, przy trzeciej próbie (ale pierwszej z tym modelem), wzorzec pojawił się natychmiast (link tutaj):

Google Gemini 3.1 Flash-Lite. Source
Dalsze eksperymenty z różnymi modelami Gemini niezmiennie wykazywały temat latarni, choć z wariantami, które nie pojawiły się w „top 11”, takimi jak imię „Thomas” i, w innym wariancie, moje własne imię, jako główny bohater.
Mimo to w chwili pisania artykułu ustalenia pracy można było niezwykle łatwo potwierdzić.
Latarnie w dziczy
Wielkie umysły myślą podobnie: tydzień temu, przed opublikowaniem nowego artykułu, autor oprogramowania Daniel May zauważył zbieżność tropu Elias i latarnika, wydobytego przez badaczy*, wydaje się, że zauważył to przypadkowo. Przetestował osiem wariantów Gemini, DeepSeek, Qwen i Gemma, i stwierdził, że będą one produkować latarnię i „Elias Thorne” jako bohatera*. Jednakże to początkowe odkrycie nie rozciągało się na szerszy zakres trwałych tematów narracyjnych opisanych w nowym artykule.
Ciekawy, czy te powtarzające się tematy, nazwy i lokalizacje kiedykolwiek wykraczały poza granice rozmowy, wyszukałem niektóre z najlepszych słów kluczowych i tematów w Google, i znalazłem znaczną liczbę postów, które wydają się kanałować je:

Three examples of the meme in output. See below for source links.
May zidentyfikował dłuższą wersję Elias Thorne (a nie tylko „Elias”) jako trwały mem LLM, i opublikował różne zrzuty ekranu z Amazon , gdzie to imię zostało użyte jako tytuł dla autorów różnych książek, w tym książek medycznych.
Zamiast tego wyszukałem treści, które najwyraźniej przywoływały utrwalone motywy modelu językowego: wpis z opowiadaniem w serwisie X i jego wersję archiwalną, utwór fikcyjny i jego archiwum oraz opowiadanie z narracją w serwisie YouTube wraz z archiwum. Materiałów było znacznie więcej, ale zabrakło czasu na ich przejrzenie. ( ( ( ( ( (źródło)źródło)źródło)źródło)źródło)źródło)
Smak przeszłości
Tak więc, dla przypadkowej obserwacji i szczęśliwego zbiegu okoliczności. Podczas gdy nie ma jednego „magicznego dokumentu” w danych szkoleniowych, który zawierałby wszystkie lub większość trwałości, autorzy nowego artykułu (tytuł Elias w latarni, ponownie? Diagnozowanie niskiej różnorodności w historiach LLM, z dwóch badaczy z Uniwersytetu Cornell) spekulują, że filtry prawne w rozwoju AI mogą ograniczać fikcyjną produkcję w LLM do materiału, który jest poza prawem autorskim.
Autorzy stwierdzają:
„Stwierdzamy, że dominacja historii „Elias w latarni” nie może być wyjaśniona przez ich rozpowszechnienie w danych przed- lub po szkoleniu. Spekulujemy, że modele są szkolone, aby unikać odniesień do objętych prawem autorskim postaci i treści dla dorosłych podczas wyrównywania, ale odkładamy to pytanie do przyszłej pracy.”
| Kategoria | Token | Nasze | Lit | Pre non-fiction | Pre fiction | Post non-fiction | Post fiction |
|---|---|---|---|---|---|---|---|
| Imię | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| Imię | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| Imię | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| Zawód | latarnik | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| Zawód | piekarz | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| Zawód | burmistrz | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| Zawód | zegarmistrz | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| Zawód | rybak | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| Zawód | bibliotekarz | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| Zawód | dyrygent | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Lokalizacja | latarnia | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Tabela porównawcza pokazująca, jak często powtarzające się słowa z historii AI pojawiają się w literaturze, fikcji internetowej i danych po szkoleniu, z terminami takimi jak „Elias” i „latarnia” występującymi znacznie częściej w fikcji generowanej przez chatbota.
W badaniu autorzy stwierdzili, że 11 najczęściej powtarzających się słów występuje w 88% z 20 000 historii wygenerowanych i że „mało różnic między modelami”. Podkreślają, że te słowa są niezwykle rzadkie w literaturze angielskiej, a dane po szkoleniu mogą być odpowiedzialne za to zjawisko. (źródło)
Artykuł stwierdza:
„Typowy przykład, przedstawiony poniżej, podkreśla trzy elementy wspólne dla prawie wszystkich 20 000 historii: lokalizację (19 864 historie), imię postaci (19 864 historie) i zawód (15 807 historii).
„W rzeczywistości, konkretna lokalizacja („latarnia”), imię („Elias”) i zawód („latarnik”) w tej historii pojawiają się w jakiejś kombinacji w 66,6% wszystkich wygenerowanych historii. Światło jest również powszechnym motywem: 56% historii wygenerowanych przez Claude nosi tytuł „Tajemnica latarnika” i słowo „światło” pojawia się w 16 784 historiach, średnio 3,2 razy na historię.”

This example, the paper states, was written by Google Gemini 3.1 Flash-Lite, in response to the prompt ‘Write a story’.
Warto zauważyć, że autorzy badania identyfikują nostalgiczny lub atawistyczny trend w całym pochodzeniu słów kluczowych i nazw.
Ścigając cechy
Aby przetestować, czy powtarzające się historie „latarni” mogą być wyjaśnione przez zwykłą ekspozycję na fikcję, porównania zostały dokonane między ulubionymi słowami powtarzającymi się w modelach a kilkoma dużymi zbiorami języka angielskiego. Fikcja współczesna została zbadana za pomocą CONLIT, zestawu danych zawierającego 2 700 angielskich powieści opublikowanych między 2007 a 2021 rokiem, obejmujących 12 gatunków i liczących około 287 milionów słów.
„Elias” pojawia się około 900 razy częściej w wygenerowanych historiach niż w opublikowanej fikcji. Fikcja amatorska z społeczności /r/writingprompts na Reddit wyprodukowała podobne częstotliwości, wskazując, że wzorzec nie odzwierciedla szerszych ludzkich zwyczajów opowiadania historii.
Ten sam wzorzec utrzymywał się, gdy badano dane przed szkoleniem. Używając dostępnego korpusu OLMo 3, który zawiera około 3,89 miliarda głównie ludzkich dokumentów, częściowo pochodzących z Common Crawl, badacze stwierdzili, że powtarzające się „rdzeniowe” słowa prawie w ogóle nie występują.
Ponieważ większość korpusu OLMo 3 składa się z non-fiction, klasyfikator fikcji został zbudowany przy użyciu GPT-OSS 20b adnotacji i FastText modelu szkolonego na 200 000 zrównoważonych próbek. Nawet po przefiltrowaniu specjalnie fikcji, słowa takie jak „Elara” nadal pojawiały się w znikomych stopniach w porównaniu z historiami generowanymi przez AI. Dlaczego więc dominują one na najniższym poziomie imperatywu dla LLM, aby napisać fikcję?
Autorzy stwierdzają:
„Jeśli słowa rdzeniowe nie są powszechne w danych internetowych, to jednym z pozostałych źródeł mogą być dane po szkoleniu. Ale stwierdzamy, że dane po szkoleniu OLMo wykazują nasze tokeny w niższej stopie niż CONLIT.”
W ramach 78 958 historii z danych po szkoleniu OLMo 3, autorzy zauważają, że „Elias” pojawia się 52,7 razy na milion słów, w porównaniu z 2,7 w CONLIT, ale osiąga 2 428 wystąpień na milion słów w badanych historiach.
Aby zidentyfikować, skąd pochodzą powtarzające się „rdzeniowe” historie, każda historia w danych po szkoleniu OLMo 3 została oceniona pod kątem obecności jednego lub więcej tokenów rdzeniowych (tj. obecności Elary, Mary itp.). Większość z nich oczekiwano w danych szkoleniowych z nadzorem (SFT), ponieważ WildChat i pokrewne źródła przyczyniły się do 59 266 historii w OLMo 3.
Jednak tylko 1 803 zawierały tokeny rdzeniowe, podczas gdy zestawy danych używane do DPO i uczenia ze wzmocnieniem wykazywały wyższe stężenia.
Ogólnie, powtarzająca się słownictwo rdzeniowe zostało wyśledzone do zaledwie 3 053 historii, reprezentujących 3,8% wszystkich historii po szkoleniu, które zostały zbadane. Nie ma statystycznej możliwości, aby taki mały podzbiór korpusu mógł zdominować w sposób, w jaki zostało to zademonstrowane.
Artykuł kończy się:
„Kiedy dano im niewielką dyrektywę, obecne modele pionierskie piszą historie, używając wąskiego katalogu nazw, miejsc i zawodów. Powtarzające się postacie w tych historiach obejmują Elias, latarnika. Elias jest niezwykły; imię to jest rzadkie w literaturze, danych internetowych i nawet w danych po szkoleniu.”
Podsumowanie
Wobec braku jakiegokolwiek pojedynczego dzieła literatury (lub nawet serii), które zawierałoby najlepsze 11 słów, które autorzy identyfikują, nie jest wcale jasne, w jaki sposób ta konkretna kolekcja słów nagromadziła się i skojarzyła na najniższym poziomie wielu dużych modeli językowych (pomimo ich różnorodności danych szkoleniowych i podejść).
Nawet jeśli badacze mają rację co do ograniczającego wpływu filtrów praw autorskich, ogrom klasycznej literatury w danych treningowych powinien był zapobiec dominacji tego osobliwego zestawu staroświeckich słów w odpowiedzi na ogólne polecenie „napisz”.
Ta teoria zakłada jednak, że ogromne ilości literatury klasycznej w ogóle znalazły się w danych treningowych. Jest to mało prawdopodobne, ponieważ potrzebne są modele posługujące się współczesnym słownictwem i przydatne w dzisiejszym biznesie, a nie tworzące imitacje Dickensa. Sama objętość literatury sprzed epoki przemysłowej utrudniałaby jej uwzględnienie.
Gdyby istniała jedna wyraźna opowieść łącząca różne uporczywie powracające elementy wskazane przez autorów, zapewne łatwiej byłoby ją znaleźć. Nie znaleźli jej ani autorzy, ani pobieżne wyszukiwania materiałów sprzed ery AI. Być może, jeśli „syndrom latarni morskiej” zyska rozgłos podobny do półpauz kojarzonych z AI, odpowiedź przedstawi któryś z badaczy. (źródło)
* Nie mogę szerzej omówić artykułu Maya z powodów, które staną się oczywiste po jego przeczytaniu.
Pierwsza publikacja: środa, 27 maja 2026 r. Tekst zmodyfikowano w ciągu pierwszych 30 minut, aby poprawić odsyłacz do Anthropic.












