Kąt Andersona

Dlaczego AI kocha pisać o latarnikach?

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

ZaŞądanie „napisz historię” powoduje, Åže ChatGPT i inne wiodące modele językowe wydają się unikać naruszeń praw autorskich, sięgając do tej samej wąskiej i dziwnej grupy elementÃģw narracyjnych.

 

Naukowcy z Uniwersytetu Cornell odkryli, Åže wiodące modele językowe mają dziwną obsesję na punkcie bardzo wąskiego wyboru elementÃģw narracyjnych, gdy zostaną poproszone o napisanie historii. Po pobudzeniu czterech modeli językowych do napisania 20 000 historii, stwierdzono, Åže 88% wygenerowanych historii zawierało co najmniej jeden z 11 bardzo konkretnych tokenÃģw w kategorii „lokalizacja”, „imię” lub „zawÃģd”:

Wystąpienia nieprawdopodobnych słÃģw kluczowych, przedstawione tutaj w częściach na milion, uzyskane przez analizę 20 000 historii wygenerowanych przez LLM. ÅđrÃģdło - https://arxiv.org/pdf/2605.26492

Wystąpienia nieprawdopodobnych słÃģw kluczowych, przedstawione tutaj w częściach na milion, uzyskane przez analizę 20 000 historii wygenerowanych przez LLM. ÅđrÃģdło

11 najczęściej powtarzających się słÃģw w 12+ milionach słÃģw wygenerowanych przez LLM w ramach badania to imiona elias, mara, elara; zawody latarnik, piekarz, burmistrz, zegarmistrz, rybak, bibliotekarz i dyrygent; oraz lokalizacja latarnia:

Przetestowane modele to Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini oraz OLMo 7b Thinking. Wszystkie zostały pobudzone jedną z pięciu prośb: „Napisz historię”; „Proszę, napisz historię”; „Napisz mi historię”; „Opowiedz mi historię”; lub „Proszę, opowiedz mi historię”.

Ciekawe, czy ten zespÃģł elementÃģw narracyjnych jest obecny w modelach dostępnych w momencie pisania, więc przeprowadziłem eksperyment, najpierw na moim standardowym koncie ChatGPT (link do rozmowy tutaj). Nie było potrzeby selekcji – ChatGPT-5.5 poszedł prosto do materiału, ktÃģry przewidzieli badacze, w pierwszej prÃģbie:

ChatGPT-5.5 od razu potwierdza wstępne ustalenia artykułu. ÅđrÃģdło - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

ChatGPT-5.5 od razu potwierdza wstępne ustalenia artykułu. ÅđrÃģdło

Zastanawiając się, czy kontekst historyczny lub nawet moÅžliwa przeciekanie międzydomenowe mogą powodować ten „natychmiastowy strzał”, zalogowałem się na bezpłatne konto ChatGPT, ktÃģre nie uÅžywałem od ponad roku, w prywatnym oknie przeglądarki Firefox, i sprÃģbowałem ponownie (link do rozmowy tutaj). Ponownie (zakładając, Åže OpenAI nie uÅžywa wspÃģlnego adresu IP do przenoszenia danych między kontami), ChatGPT trafił w punkt:

Konto ChatGPT nr 2 podÄ…Åža za tymi samymi obsesjami i małym zbiorem nazw i tematÃģw opisanych w nowym artykule. 'Mira' jest w pierwszych 20 autorÃģw.

Konto ChatGPT nr 2 podÄ…Åža za tymi samymi obsesjami i małym zbiorem nazw i tematÃģw opisanych w nowym artykule. ‘Mira’ jest w pierwszych 20 autorÃģw. ÅđrÃģdło

Warto zauwaÅžyć, Åže te wersje GPT były o jeden stopień wyÅžsze niÅž wersja 5.4 przetestowana w artykule.

NiezaleÅžnie od tego, czy Claude Haiku został przetestowany w artykule, ja sprÃģbowałem domyślnego Sonnet 4.6 Anthropic, i nie zostałem zawiedziony. Ponownie, znane słowa kluczowe pojawiły się w pierwszej prÃģbie (link do rozmowy tutaj):

Tym razem 'Mara', inny stały element z 'top 11', prowadzi historię w pierwszej prÃģbie na Claude Sonnet 4.6. ÅđrÃģdło - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

Tym razem ‘Mara’, inny stały element z ‘top 11’, prowadzi historię w pierwszej prÃģbie na Claude Sonnet 4.6. ÅđrÃģdło

PrÃģba tego samego pobudzenia na Claude Haiku 4.5 doprowadziła do niemal takiego samego wyniku (link tutaj).

Nie mogłem odtworzyć ustaleń autorÃģw na Google Gemini na początku, aÅž do momentu, gdy zmieniłem model na ten uÅžyty w artykule, Gemini 3.1 Flash-Lite – i wtedy, przy trzeciej prÃģbie (ale pierwszej z tym modelem), wzorzec pojawił się natychmiast (link tutaj):

Google Gemini 3.1 Flash-Lite.

Google Gemini 3.1 Flash-Lite. ÅđrÃģdło

Dalsze eksperymenty z rÃģÅžnymi modelami Gemini niezmiennie wykazywały temat latarni, choć z wariantami, ktÃģre nie pojawiły się w „top 11”, takimi jak imię „Thomas” i, w innym wariancie, moje własne imię, jako głÃģwny bohater.

Latarnie w dziczy

Wielkie umysły myślą podobnie: tydzień temu, przed opublikowaniem nowego artykułu, autor oprogramowania Daniel May zauwaÅžył zbieÅžność tropu Elias i latarnika, wydobytego przez badaczy*, wydaje się, Åže zauwaÅžył to przypadkowo. Przetestował osiem wariantÃģw Gemini, DeepSeek, Qwen i Gemma, i stwierdził, Åže będą one produkować latarnię i „Elias Thorne” jako bohatera*. JednakÅže to początkowe odkrycie nie rozciągało się na szerszy zakres trwałych tematÃģw narracyjnych opisanych w nowym artykule.

Ciekawy, czy te powtarzające się tematy, nazwy i lokalizacje kiedykolwiek wykraczały poza granice rozmowy, wyszukałem niektÃģre z najlepszych słÃģw kluczowych i tematÃģw w Google, i znalazłem znaczną liczbę postÃģw, ktÃģre wydają się kanałować je:

Trzy przykłady memu w treści. Zobacz poniÅžej linki do ÅšrÃģdeł.

Trzy przykłady memu w treści. Zobacz poniÅžej linki do ÅšrÃģdeł.

May zidentyfikował dłuÅžszą wersję Elias Thorne (a nie tylko „Elias”) jako trwały mem LLM, i opublikował rÃģÅžne zrzuty ekranu z Amazon, gdzie to imię zostało uÅžyte jako tytuł dla autorÃģw rÃģÅžnych ksiÄ…Åžek, w tym ksiÄ…Åžek medycznych.

Smak przeszłości

Tak więc, dla przypadkowej obserwacji i szczęśliwego zbiegu okoliczności. Podczas gdy nie ma jednego „magicznego dokumentu” w danych szkoleniowych, ktÃģry zawierałby wszystkie lub większość trwałości, autorzy nowego artykułu (tytuł Elias w latarni, ponownie? Diagnozowanie niskiej rÃģÅžnorodności w historiach LLM, z dwÃģch badaczy z Uniwersytetu Cornell) spekulują, Åže filtry prawne w rozwoju AI mogą ograniczać fikcyjną produkcję w LLM do materiału, ktÃģry jest poza prawem autorskim.

Autorzy stwierdzają:

„Stwierdzamy, Åže dominacja historii „Elias w latarni” nie moÅže być wyjaśniona przez ich rozpowszechnienie w danych przed- lub po szkoleniu. Spekulujemy, Åže modele są szkolone, aby unikać odniesień do objętych prawem autorskim postaci i treści dla dorosłych podczas wyrÃģwnywania, ale odkładamy to pytanie do przyszłej pracy.”

Kategoria Token Nasze Lit Pre non-fiction Pre fiction Post non-fiction Post fiction
Imię elias 2,428 2.7 2.2 4.0 0.4 52.7
Imię mara 5,200 3.9 2.5 8.7 0.4 21.7
Imię elara 1,221 0.0 0.4 1.2 0.9 108
ZawÃģd latarnik 1,495 7.2 6.3 14.7 3.5 10.0
ZawÃģd piekarz 161 20 11.8 10.56 1.7 11.9
ZawÃģd burmistrz 198 28 11.5 16.1 1.4 27.4
ZawÃģd zegarmistrz 108 0.1 0.18 0.0 0.3 1.4
ZawÃģd rybak 62 4.2 3.0 7.6 0.0 9.3
ZawÃģd bibliotekarz 68 5.3 7.6 5.9 2.3 11.5
ZawÃģd dyrygent 96 5.0 5.9 5.7 4.7 7.5
Lokalizacja latarnia 3,005 5.5 3.5 4.6 4.6 10.1

Tabela porÃģwnawcza pokazująca, jak często powtarzające się słowa z historii AI pojawiają się w literaturze, fikcji internetowej i danych po szkoleniu, z terminami takimi jak „Elias” i „latarnia” występującymi znacznie częściej w fikcji generowanej przez chatbota.

W badaniu autorzy stwierdzili, Åže 11 najczęściej powtarzających się słÃģw występuje w 88% z 20 000 historii wygenerowanych i Åže „mało rÃģÅžnic między modelami”. Podkreślają, Åže te słowa są niezwykle rzadkie w literaturze angielskiej, a dane po szkoleniu mogą być odpowiedzialne za to zjawisko.

Artykuł stwierdza:

„Typowy przykład, przedstawiony poniÅžej, podkreśla trzy elementy wspÃģlne dla prawie wszystkich 20 000 historii: lokalizację (19 864 historie), imię postaci (19 864 historie) i zawÃģd (15 807 historii).

„W rzeczywistości, konkretna lokalizacja („latarnia”), imię („Elias”) i zawÃģd („latarnik”) w tej historii pojawiają się w jakiejś kombinacji w 66,6% wszystkich wygenerowanych historii. Światło jest rÃģwnieÅž powszechnym motywem: 56% historii wygenerowanych przez Claude nosi tytuł „Tajemnica latarnika” i słowo „światło” pojawia się w 16 784 historiach, średnio 3,2 razy na historię.”

Przykład, o ktÃģrym mÃģwi artykuł, został napisany przez Google Gemini 3.1 Flash-Lite w odpowiedzi na prośbę o napisanie historii.

Przykład, o ktÃģrym mÃģwi artykuł, został napisany przez Google Gemini 3.1 Flash-Lite w odpowiedzi na prośbę o napisanie historii.

Warto zauwaÅžyć, Åže autorzy badania identyfikują nostalgiczny lub atawistyczny trend w całym pochodzeniu słÃģw kluczowych i nazw.

Ścigając cechy

Aby przetestować, czy powtarzające się historie „latarni” mogą być wyjaśnione przez zwykłą ekspozycję na fikcję, porÃģwnania zostały dokonane między ulubionymi słowami powtarzającymi się w modelach a kilkoma duÅžymi zbiorami języka angielskiego. Fikcja wspÃģłczesna została zbadana za pomocą CONLIT, zestawu danych zawierającego 2 700 angielskich powieści opublikowanych między 2007 a 2021 rokiem, obejmujących 12 gatunkÃģw i liczących około 287 milionÃģw słÃģw.

„Elias” pojawia się około 900 razy częściej w wygenerowanych historiach niÅž w opublikowanej fikcji. Fikcja amatorska z społeczności /r/writingprompts na Reddit wyprodukowała podobne częstotliwości, wskazując, Åže wzorzec nie odzwierciedla szerszych ludzkich zwyczajÃģw opowiadania historii.

Ten sam wzorzec utrzymywał się, gdy badano dane przed szkoleniem. UÅžywając dostępnego korpusu OLMo 3, ktÃģry zawiera około 3,89 miliarda głÃģwnie ludzkich dokumentÃģw, częściowo pochodzących z Common Crawl, badacze stwierdzili, Åže powtarzające się „rdzeniowe” słowa prawie w ogÃģle nie występują.

PoniewaÅž większość korpusu OLMo 3 składa się z non-fiction, klasyfikator fikcji został zbudowany przy uÅžyciu GPT-OSS 20b adnotacji i FastText modelu szkolonego na 200 000 zrÃģwnowaÅžonych prÃģbek. Nawet po przefiltrowaniu specjalnie fikcji, słowa takie jak „Elara” nadal pojawiały się w znikomych stopniach w porÃģwnaniu z historiami generowanymi przez AI. Dlaczego więc dominują one na najniÅžszym poziomie imperatywu dla LLM, aby napisać fikcję?

Autorzy stwierdzają:

„Jeśli słowa rdzeniowe nie są powszechne w danych internetowych, to jednym z pozostałych ÅšrÃģdeł mogą być dane po szkoleniu. Ale stwierdzamy, Åže dane po szkoleniu OLMo wykazują nasze tokeny w niÅžszej stopie niÅž CONLIT.”

W ramach 78 958 historii z danych po szkoleniu OLMo 3, autorzy zauwaÅžają, Åže „Elias” pojawia się 52,7 razy na milion słÃģw, w porÃģwnaniu z 2,7 w CONLIT, ale osiąga 2 428 wystąpień na milion słÃģw w badanych historiach.

Aby zidentyfikować, skąd pochodzą powtarzające się „rdzeniowe” historie, kaÅžda historia w danych po szkoleniu OLMo 3 została oceniona pod kątem obecności jednego lub więcej tokenÃģw rdzeniowych (tj. obecności Elary, Mary itp.). Większość z nich oczekiwano w danych szkoleniowych z nadzorem (SFT), poniewaÅž WildChat i pokrewne ÅšrÃģdła przyczyniły się do 59 266 historii w OLMo 3.

Jednak tylko 1 803 zawierały tokeny rdzeniowe, podczas gdy zestawy danych uÅžywane do DPO i uczenia ze wzmocnieniem wykazywały wyÅžsze stęŞenia.

OgÃģlnie, powtarzająca się słownictwo rdzeniowe zostało wyśledzone do zaledwie 3 053 historii, reprezentujących 3,8% wszystkich historii po szkoleniu, ktÃģre zostały zbadane. Nie ma statystycznej moÅžliwości, aby taki mały podzbiÃģr korpusu mÃģgł zdominować w sposÃģb, w jaki zostało to zademonstrowane.

Artykuł kończy się:

„Kiedy dano im niewielką dyrektywę, obecne modele pionierskie piszą historie, uÅžywając wąskiego katalogu nazw, miejsc i zawodÃģw. Powtarzające się postacie w tych historiach obejmują Elias, latarnika. Elias jest niezwykły; imię to jest rzadkie w literaturze, danych internetowych i nawet w danych po szkoleniu.”

Podsumowanie

Wobec braku jakiegokolwiek pojedynczego dzieła literatury (lub nawet serii), ktÃģre zawierałoby najlepsze 11 słÃģw, ktÃģre autorzy identyfikują, nie jest wcale jasne, w jaki sposÃģb ta konkretna kolekcja słÃģw nagromadziła się i skojarzyła na najniÅžszym poziomie wielu duÅžych modeli językowych (pomimo ich rÃģÅžnorodności danych szkoleniowych i podejść).

Even if the researchers’ contention about the constraining effect of copyright filters is correct, a veritable ocean of classic literature in the training data should have prevented this strange collection of old-school words from dominating the output of a non-qualified ‘write’ prompt.

That theory assumes, however, that vast amounts of classic literature would have been included in the training regimen at all. That’s unlikely, since what’s wanted are not models that will knock out faux Dickens outings, but rather that deal with the modern lexicon, and are suited for current business needs. The sheer volume even of pre-industrial literature would preclude its inclusion.

In any case, if there were one distinct narrative featuring some alternating mix of the ‘obsessive’ facets that the authors note, it would, presumably, be easier to find; the authors themselves could not find it, and casual searches on the pre-AI era unearth no such contender. Perhaps, if ‘lighthouse syndrome’ gains the same notoriety as AI em dashes, some scholarly authority will come forward with the answer. * I can’t go any further into May’s article, for reasons that may become obvious when one reads it. First published Wednesday, 27 maja 2026. Modified in first 30 minutes to fix Anthropic link.

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]