Kąt Andersona

Dlaczego AI kocha pisać o latarnikach?

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

Zażądanie „napisz historię” powoduje, że ChatGPT i inne wiodące modele językowe wydają się unikać naruszeń praw autorskich, sięgając do tej samej wąskiej i dziwnej grupy elementów narracyjnych.

 

Naukowcy z Uniwersytetu Cornell odkryli, że wiodące modele językowe mają dziwną obsesję na punkcie bardzo wąskiego wyboru elementów narracyjnych, gdy zostaną poproszone o napisanie historii. Po pobudzeniu czterech modeli językowych do napisania 20 000 historii, stwierdzono, że 88% wygenerowanych historii zawierało co najmniej jeden z 11 bardzo konkretnych tokenów w kategorii „lokalizacja”, „imię” lub „zawód”:

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers' analysis of 20,000 LLM-generated stories. Source - https://arxiv.org/pdf/2605.26492

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers’ analysis of 20,000 LLM-generated stories. Source

11 najczęściej powtarzających się słów w 12+ milionach słów wygenerowanych przez LLM w ramach badania to imiona elias, mara, elara; zawody latarnik, piekarz, burmistrz, zegarmistrz, rybak, bibliotekarz i dyrygent; oraz lokalizacja latarnia:

Przetestowane modele to Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini oraz OLMo 7b Thinking. Wszystkie zostały pobudzone jedną z pięciu prośb: „Napisz historię”; „Proszę, napisz historię”; „Napisz mi historię”; „Opowiedz mi historię”; lub „Proszę, opowiedz mi historię”.

Ciekawe, czy ten zespół elementów narracyjnych jest obecny w modelach dostępnych w momencie pisania, więc przeprowadziłem eksperyment, najpierw na moim standardowym koncie ChatGPT (link do rozmowy tutaj). Nie było potrzeby selekcji – ChatGPT-5.5 poszedł prosto do materiału, który przewidzieli badacze, w pierwszej próbie:

ChatGPT-5.5 immediately backs up the paper's initial findings. Source - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

ChatGPT-5.5 immediately backs up the paper’s initial findings. Source

Zastanawiając się, czy kontekst historyczny lub nawet możliwa przeciekanie międzydomenowe mogą powodować ten „natychmiastowy strzał”, zalogowałem się na bezpłatne konto ChatGPT, które nie używałem od ponad roku, w prywatnym oknie przeglądarki Firefox, i spróbowałem ponownie (link do rozmowy tutaj). Ponownie (zakładając, że OpenAI nie używa wspólnego adresu IP do przenoszenia danych między kontami), ChatGPT trafił w punkt:

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. Source - https://chatgpt.com/share/6a16b210-d450-83ea-936e-78c6062ca74d

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. ‘Mira’ is in the authors’ top 20.  Source

Warto zauważyć, że te wersje GPT były o jeden stopień wyższe niż wersja 5.4 przetestowana w artykule.

Niezależnie od tego, czy Claude Haiku został przetestowany w artykule, ja spróbowałem domyślnego Sonnet 4.6 Anthropic, i nie zostałem zawiedziony. Ponownie, znane słowa kluczowe pojawiły się w pierwszej próbie (link do rozmowy tutaj):

This time 'Mara', another stalwart from the 'top 11', leads the story, in the first attempt on Claude Sonnet 4.6. Source - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

This time ‘Mara’, another stalwart from the ‘top 11’, leads the story, in the first attempt on Claude Sonnet 4.6. Source

Próba tego samego pobudzenia na Claude Haiku 4.5 doprowadziła do niemal takiego samego wyniku (link tutaj).

Nie mogłem odtworzyć ustaleń autorów na Google Gemini na początku, aż do momentu, gdy zmieniłem model na ten użyty w artykule, Gemini 3.1 Flash-Lite – i wtedy, przy trzeciej próbie (ale pierwszej z tym modelem), wzorzec pojawił się natychmiast (link tutaj):

Google Gemini 3.1 Flash-Lite. Source - https://gemini.google.com/share/82c245884ec1

Google Gemini 3.1 Flash-Lite. Source

Dalsze eksperymenty z różnymi modelami Gemini niezmiennie wykazywały temat latarni, choć z wariantami, które nie pojawiły się w „top 11”, takimi jak imię „Thomas” i, w innym wariancie, moje własne imię, jako główny bohater.

Mimo to w chwili pisania artykułu ustalenia pracy można było niezwykle łatwo potwierdzić.

Latarnie w dziczy

Wielkie umysły myślą podobnie: tydzień temu, przed opublikowaniem nowego artykułu, autor oprogramowania Daniel May zauważył zbieżność tropu Elias i latarnika, wydobytego przez badaczy*, wydaje się, że zauważył to przypadkowo. Przetestował osiem wariantów Gemini, DeepSeek, Qwen i Gemma, i stwierdził, że będą one produkować latarnię i „Elias Thorne” jako bohatera*. Jednakże to początkowe odkrycie nie rozciągało się na szerszy zakres trwałych tematów narracyjnych opisanych w nowym artykule.

Ciekawy, czy te powtarzające się tematy, nazwy i lokalizacje kiedykolwiek wykraczały poza granice rozmowy, wyszukałem niektóre z najlepszych słów kluczowych i tematów w Google, i znalazłem znaczną liczbę postów, które wydają się kanałować je:

Three examples of the meme in output. See below for source links.

Three examples of the meme in output. See below for source links.

May zidentyfikował dłuższą wersję Elias Thorne (a nie tylko „Elias”) jako trwały mem LLM, i opublikował różne zrzuty ekranu z Amazon , gdzie to imię zostało użyte jako tytuł dla autorów różnych książek, w tym książek medycznych.

Zamiast tego wyszukałem treści, które najwyraźniej przywoływały utrwalone motywy modelu językowego: wpis z opowiadaniem w serwisie X i jego wersję archiwalną, utwór fikcyjny i jego archiwum oraz opowiadanie z narracją w serwisie YouTube wraz z archiwum. Materiałów było znacznie więcej, ale zabrakło czasu na ich przejrzenie. ( ( ( ( ( (źródło)źródło)źródło)źródło)źródło)źródło)

Smak przeszłości

Tak więc, dla przypadkowej obserwacji i szczęśliwego zbiegu okoliczności. Podczas gdy nie ma jednego „magicznego dokumentu” w danych szkoleniowych, który zawierałby wszystkie lub większość trwałości, autorzy nowego artykułu (tytuł Elias w latarni, ponownie? Diagnozowanie niskiej różnorodności w historiach LLM, z dwóch badaczy z Uniwersytetu Cornell) spekulują, że filtry prawne w rozwoju AI mogą ograniczać fikcyjną produkcję w LLM do materiału, który jest poza prawem autorskim.

Autorzy stwierdzają:

„Stwierdzamy, że dominacja historii „Elias w latarni” nie może być wyjaśniona przez ich rozpowszechnienie w danych przed- lub po szkoleniu. Spekulujemy, że modele są szkolone, aby unikać odniesień do objętych prawem autorskim postaci i treści dla dorosłych podczas wyrównywania, ale odkładamy to pytanie do przyszłej pracy.”

Kategoria Token Nasze Lit Pre non-fiction Pre fiction Post non-fiction Post fiction
Imię elias 2,428 2.7 2.2 4.0 0.4 52.7
Imię mara 5,200 3.9 2.5 8.7 0.4 21.7
Imię elara 1,221 0.0 0.4 1.2 0.9 108
Zawód latarnik 1,495 7.2 6.3 14.7 3.5 10.0
Zawód piekarz 161 20 11.8 10.56 1.7 11.9
Zawód burmistrz 198 28 11.5 16.1 1.4 27.4
Zawód zegarmistrz 108 0.1 0.18 0.0 0.3 1.4
Zawód rybak 62 4.2 3.0 7.6 0.0 9.3
Zawód bibliotekarz 68 5.3 7.6 5.9 2.3 11.5
Zawód dyrygent 96 5.0 5.9 5.7 4.7 7.5
Lokalizacja latarnia 3,005 5.5 3.5 4.6 4.6 10.1

Tabela porównawcza pokazująca, jak często powtarzające się słowa z historii AI pojawiają się w literaturze, fikcji internetowej i danych po szkoleniu, z terminami takimi jak „Elias” i „latarnia” występującymi znacznie częściej w fikcji generowanej przez chatbota.

W badaniu autorzy stwierdzili, że 11 najczęściej powtarzających się słów występuje w 88% z 20 000 historii wygenerowanych i że „mało różnic między modelami”. Podkreślają, że te słowa są niezwykle rzadkie w literaturze angielskiej, a dane po szkoleniu mogą być odpowiedzialne za to zjawisko. (źródło)

Artykuł stwierdza:

„Typowy przykład, przedstawiony poniżej, podkreśla trzy elementy wspólne dla prawie wszystkich 20 000 historii: lokalizację (19 864 historie), imię postaci (19 864 historie) i zawód (15 807 historii).

„W rzeczywistości, konkretna lokalizacja („latarnia”), imię („Elias”) i zawód („latarnik”) w tej historii pojawiają się w jakiejś kombinacji w 66,6% wszystkich wygenerowanych historii. Światło jest również powszechnym motywem: 56% historii wygenerowanych przez Claude nosi tytuł „Tajemnica latarnika” i słowo „światło” pojawia się w 16 784 historiach, średnio 3,2 razy na historię.”

This example, the paper states, was written by Google Gemini 3.1 Flash-Lite, in response to the prompt 'Write a story'.

This example, the paper states, was written by Google Gemini 3.1 Flash-Lite, in response to the prompt ‘Write a story’.

Warto zauważyć, że autorzy badania identyfikują nostalgiczny lub atawistyczny trend w całym pochodzeniu słów kluczowych i nazw.

Ścigając cechy

Aby przetestować, czy powtarzające się historie „latarni” mogą być wyjaśnione przez zwykłą ekspozycję na fikcję, porównania zostały dokonane między ulubionymi słowami powtarzającymi się w modelach a kilkoma dużymi zbiorami języka angielskiego. Fikcja współczesna została zbadana za pomocą CONLIT, zestawu danych zawierającego 2 700 angielskich powieści opublikowanych między 2007 a 2021 rokiem, obejmujących 12 gatunków i liczących około 287 milionów słów.

„Elias” pojawia się około 900 razy częściej w wygenerowanych historiach niż w opublikowanej fikcji. Fikcja amatorska z społeczności /r/writingprompts na Reddit wyprodukowała podobne częstotliwości, wskazując, że wzorzec nie odzwierciedla szerszych ludzkich zwyczajów opowiadania historii.

Ten sam wzorzec utrzymywał się, gdy badano dane przed szkoleniem. Używając dostępnego korpusu OLMo 3, który zawiera około 3,89 miliarda głównie ludzkich dokumentów, częściowo pochodzących z Common Crawl, badacze stwierdzili, że powtarzające się „rdzeniowe” słowa prawie w ogóle nie występują.

Ponieważ większość korpusu OLMo 3 składa się z non-fiction, klasyfikator fikcji został zbudowany przy użyciu GPT-OSS 20b adnotacji i FastText modelu szkolonego na 200 000 zrównoważonych próbek. Nawet po przefiltrowaniu specjalnie fikcji, słowa takie jak „Elara” nadal pojawiały się w znikomych stopniach w porównaniu z historiami generowanymi przez AI. Dlaczego więc dominują one na najniższym poziomie imperatywu dla LLM, aby napisać fikcję?

Autorzy stwierdzają:

„Jeśli słowa rdzeniowe nie są powszechne w danych internetowych, to jednym z pozostałych źródeł mogą być dane po szkoleniu. Ale stwierdzamy, że dane po szkoleniu OLMo wykazują nasze tokeny w niższej stopie niż CONLIT.”

W ramach 78 958 historii z danych po szkoleniu OLMo 3, autorzy zauważają, że „Elias” pojawia się 52,7 razy na milion słów, w porównaniu z 2,7 w CONLIT, ale osiąga 2 428 wystąpień na milion słów w badanych historiach.

Aby zidentyfikować, skąd pochodzą powtarzające się „rdzeniowe” historie, każda historia w danych po szkoleniu OLMo 3 została oceniona pod kątem obecności jednego lub więcej tokenów rdzeniowych (tj. obecności Elary, Mary itp.). Większość z nich oczekiwano w danych szkoleniowych z nadzorem (SFT), ponieważ WildChat i pokrewne źródła przyczyniły się do 59 266 historii w OLMo 3.

Jednak tylko 1 803 zawierały tokeny rdzeniowe, podczas gdy zestawy danych używane do DPO i uczenia ze wzmocnieniem wykazywały wyższe stężenia.

Ogólnie, powtarzająca się słownictwo rdzeniowe zostało wyśledzone do zaledwie 3 053 historii, reprezentujących 3,8% wszystkich historii po szkoleniu, które zostały zbadane. Nie ma statystycznej możliwości, aby taki mały podzbiór korpusu mógł zdominować w sposób, w jaki zostało to zademonstrowane.

Artykuł kończy się:

„Kiedy dano im niewielką dyrektywę, obecne modele pionierskie piszą historie, używając wąskiego katalogu nazw, miejsc i zawodów. Powtarzające się postacie w tych historiach obejmują Elias, latarnika. Elias jest niezwykły; imię to jest rzadkie w literaturze, danych internetowych i nawet w danych po szkoleniu.”

Podsumowanie

Wobec braku jakiegokolwiek pojedynczego dzieła literatury (lub nawet serii), które zawierałoby najlepsze 11 słów, które autorzy identyfikują, nie jest wcale jasne, w jaki sposób ta konkretna kolekcja słów nagromadziła się i skojarzyła na najniższym poziomie wielu dużych modeli językowych (pomimo ich różnorodności danych szkoleniowych i podejść).

Nawet jeśli badacze mają rację co do ograniczającego wpływu filtrów praw autorskich, ogrom klasycznej literatury w danych treningowych powinien był zapobiec dominacji tego osobliwego zestawu staroświeckich słów w odpowiedzi na ogólne polecenie „napisz”.

Ta teoria zakłada jednak, że ogromne ilości literatury klasycznej w ogóle znalazły się w danych treningowych. Jest to mało prawdopodobne, ponieważ potrzebne są modele posługujące się współczesnym słownictwem i przydatne w dzisiejszym biznesie, a nie tworzące imitacje Dickensa. Sama objętość literatury sprzed epoki przemysłowej utrudniałaby jej uwzględnienie.

Gdyby istniała jedna wyraźna opowieść łącząca różne uporczywie powracające elementy wskazane przez autorów, zapewne łatwiej byłoby ją znaleźć. Nie znaleźli jej ani autorzy, ani pobieżne wyszukiwania materiałów sprzed ery AI. Być może, jeśli „syndrom latarni morskiej” zyska rozgłos podobny do półpauz kojarzonych z AI, odpowiedź przedstawi któryś z badaczy. (źródło)

* Nie mogę szerzej omówić artykułu Maya z powodów, które staną się oczywiste po jego przeczytaniu.

Pierwsza publikacja: środa, 27 maja 2026 r. Tekst zmodyfikowano w ciągu pierwszych 30 minut, aby poprawić odsyłacz do Anthropic.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai