KÄ t Andersona
Dlaczego AI kocha pisaÄ o latarnikach?

ZaÅžÄ danie ânapisz historiÄâ powoduje, Åže ChatGPT i inne wiodÄ ce modele jÄzykowe wydajÄ siÄ unikaÄ naruszeÅ praw autorskich, siÄgajÄ c do tej samej wÄ skiej i dziwnej grupy elementÃģw narracyjnych.
Â
Naukowcy z Uniwersytetu Cornell odkryli, Åže wiodÄ ce modele jÄzykowe majÄ dziwnÄ obsesjÄ na punkcie bardzo wÄ skiego wyboru elementÃģw narracyjnych, gdy zostanÄ poproszone o napisanie historii. Po pobudzeniu czterech modeli jÄzykowych do napisania 20 000 historii, stwierdzono, Åže 88% wygenerowanych historii zawieraÅo co najmniej jeden z 11 bardzo konkretnych tokenÃģw w kategorii âlokalizacjaâ, âimiÄâ lub âzawÃģdâ:

WystÄ pienia nieprawdopodobnych sÅÃģw kluczowych, przedstawione tutaj w czÄÅciach na milion, uzyskane przez analizÄ 20 000 historii wygenerowanych przez LLM. ÅđrÃģdÅo
11 najczÄÅciej powtarzajÄ cych siÄ sÅÃģw w 12+ milionach sÅÃģw wygenerowanych przez LLM w ramach badania to imiona elias, mara, elara; zawody latarnik, piekarz, burmistrz, zegarmistrz, rybak, bibliotekarz i dyrygent; oraz lokalizacja latarnia:
Przetestowane modele to Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini oraz OLMo 7b Thinking. Wszystkie zostaÅy pobudzone jednÄ z piÄciu proÅb: âNapisz historiÄâ; âProszÄ, napisz historiÄâ; âNapisz mi historiÄâ; âOpowiedz mi historiÄâ; lub âProszÄ, opowiedz mi historiÄâ.
Ciekawe, czy ten zespÃģÅ elementÃģw narracyjnych jest obecny w modelach dostÄpnych w momencie pisania, wiÄc przeprowadziÅem eksperyment, najpierw na moim standardowym koncie ChatGPT (link do rozmowy tutaj). Nie byÅo potrzeby selekcji â ChatGPT-5.5 poszedÅ prosto do materiaÅu, ktÃģry przewidzieli badacze, w pierwszej prÃģbie:

ChatGPT-5.5 od razu potwierdza wstÄpne ustalenia artykuÅu. ÅđrÃģdÅo
ZastanawiajÄ c siÄ, czy kontekst historyczny lub nawet moÅžliwa przeciekanie miÄdzydomenowe mogÄ powodowaÄ ten ânatychmiastowy strzaÅâ, zalogowaÅem siÄ na bezpÅatne konto ChatGPT, ktÃģre nie uÅžywaÅem od ponad roku, w prywatnym oknie przeglÄ darki Firefox, i sprÃģbowaÅem ponownie (link do rozmowy tutaj). Ponownie (zakÅadajÄ c, Åže OpenAI nie uÅžywa wspÃģlnego adresu IP do przenoszenia danych miÄdzy kontami), ChatGPT trafiÅ w punkt:

Konto ChatGPT nr 2 podÄ Åža za tymi samymi obsesjami i maÅym zbiorem nazw i tematÃģw opisanych w nowym artykule. âMiraâ jest w pierwszych 20 autorÃģw. ÅđrÃģdÅo
Warto zauwaÅžyÄ, Åže te wersje GPT byÅy o jeden stopieÅ wyÅžsze niÅž wersja 5.4 przetestowana w artykule.
NiezaleÅžnie od tego, czy Claude Haiku zostaÅ przetestowany w artykule, ja sprÃģbowaÅem domyÅlnego Sonnet 4.6 Anthropic, i nie zostaÅem zawiedziony. Ponownie, znane sÅowa kluczowe pojawiÅy siÄ w pierwszej prÃģbie (link do rozmowy tutaj):

Tym razem âMaraâ, inny staÅy element z âtop 11â, prowadzi historiÄ w pierwszej prÃģbie na Claude Sonnet 4.6. ÅđrÃģdÅo
PrÃģba tego samego pobudzenia na Claude Haiku 4.5 doprowadziÅa do niemal takiego samego wyniku (link tutaj).
Nie mogÅem odtworzyÄ ustaleÅ autorÃģw na Google Gemini na poczÄ tku, aÅž do momentu, gdy zmieniÅem model na ten uÅžyty w artykule, Gemini 3.1 Flash-Lite â i wtedy, przy trzeciej prÃģbie (ale pierwszej z tym modelem), wzorzec pojawiÅ siÄ natychmiast (link tutaj):

Google Gemini 3.1 Flash-Lite. ÅđrÃģdÅo
Dalsze eksperymenty z rÃģÅžnymi modelami Gemini niezmiennie wykazywaÅy temat latarni, choÄ z wariantami, ktÃģre nie pojawiÅy siÄ w âtop 11â, takimi jak imiÄ âThomasâ i, w innym wariancie, moje wÅasne imiÄ, jako gÅÃģwny bohater.
Latarnie w dziczy
Wielkie umysÅy myÅlÄ podobnie: tydzieÅ temu, przed opublikowaniem nowego artykuÅu, autor oprogramowania Daniel May zauwaÅžyÅ zbieÅžnoÅÄ tropu Elias i latarnika, wydobytego przez badaczy*, wydaje siÄ, Åže zauwaÅžyÅ to przypadkowo. PrzetestowaÅ osiem wariantÃģw Gemini, DeepSeek, Qwen i Gemma, i stwierdziÅ, Åže bÄdÄ one produkowaÄ latarniÄ i âElias Thorneâ jako bohatera*. JednakÅže to poczÄ tkowe odkrycie nie rozciÄ gaÅo siÄ na szerszy zakres trwaÅych tematÃģw narracyjnych opisanych w nowym artykule.
Ciekawy, czy te powtarzajÄ ce siÄ tematy, nazwy i lokalizacje kiedykolwiek wykraczaÅy poza granice rozmowy, wyszukaÅem niektÃģre z najlepszych sÅÃģw kluczowych i tematÃģw w Google, i znalazÅem znacznÄ liczbÄ postÃģw, ktÃģre wydajÄ siÄ kanaÅowaÄ je:

Trzy przykÅady memu w treÅci. Zobacz poniÅžej linki do ÅšrÃģdeÅ.
May zidentyfikowaÅ dÅuÅžszÄ wersjÄ Elias Thorne (a nie tylko âEliasâ) jako trwaÅy mem LLM, i opublikowaÅ rÃģÅžne zrzuty ekranu z Amazon, gdzie to imiÄ zostaÅo uÅžyte jako tytuÅ dla autorÃģw rÃģÅžnych ksiÄ Åžek, w tym ksiÄ Åžek medycznych.
Smak przeszÅoÅci
Tak wiÄc, dla przypadkowej obserwacji i szczÄÅliwego zbiegu okolicznoÅci. Podczas gdy nie ma jednego âmagicznego dokumentuâ w danych szkoleniowych, ktÃģry zawieraÅby wszystkie lub wiÄkszoÅÄ trwaÅoÅci, autorzy nowego artykuÅu (tytuÅ Elias w latarni, ponownie? Diagnozowanie niskiej rÃģÅžnorodnoÅci w historiach LLM, z dwÃģch badaczy z Uniwersytetu Cornell) spekulujÄ , Åže filtry prawne w rozwoju AI mogÄ ograniczaÄ fikcyjnÄ produkcjÄ w LLM do materiaÅu, ktÃģry jest poza prawem autorskim.
Autorzy stwierdzajÄ :
âStwierdzamy, Åže dominacja historii âElias w latarniâ nie moÅže byÄ wyjaÅniona przez ich rozpowszechnienie w danych przed- lub po szkoleniu. Spekulujemy, Åže modele sÄ szkolone, aby unikaÄ odniesieÅ do objÄtych prawem autorskim postaci i treÅci dla dorosÅych podczas wyrÃģwnywania, ale odkÅadamy to pytanie do przyszÅej pracy.â
| Kategoria | Token | Nasze | Lit | Pre non-fiction | Pre fiction | Post non-fiction | Post fiction |
|---|---|---|---|---|---|---|---|
| ImiÄ | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| ImiÄ | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| ImiÄ | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| ZawÃģd | latarnik | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| ZawÃģd | piekarz | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| ZawÃģd | burmistrz | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| ZawÃģd | zegarmistrz | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| ZawÃģd | rybak | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| ZawÃģd | bibliotekarz | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| ZawÃģd | dyrygent | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Lokalizacja | latarnia | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Tabela porÃģwnawcza pokazujÄ ca, jak czÄsto powtarzajÄ ce siÄ sÅowa z historii AI pojawiajÄ siÄ w literaturze, fikcji internetowej i danych po szkoleniu, z terminami takimi jak âEliasâ i âlatarniaâ wystÄpujÄ cymi znacznie czÄÅciej w fikcji generowanej przez chatbota.
W badaniu autorzy stwierdzili, Åže 11 najczÄÅciej powtarzajÄ cych siÄ sÅÃģw wystÄpuje w 88% z 20 000 historii wygenerowanych i Åže âmaÅo rÃģÅžnic miÄdzy modelamiâ. PodkreÅlajÄ , Åže te sÅowa sÄ niezwykle rzadkie w literaturze angielskiej, a dane po szkoleniu mogÄ byÄ odpowiedzialne za to zjawisko.
ArtykuÅ stwierdza:
âTypowy przykÅad, przedstawiony poniÅžej, podkreÅla trzy elementy wspÃģlne dla prawie wszystkich 20 000 historii: lokalizacjÄ (19 864 historie), imiÄ postaci (19 864 historie) i zawÃģd (15 807 historii).
âW rzeczywistoÅci, konkretna lokalizacja (âlatarniaâ), imiÄ (âEliasâ) i zawÃģd (âlatarnikâ) w tej historii pojawiajÄ siÄ w jakiejÅ kombinacji w 66,6% wszystkich wygenerowanych historii. ÅwiatÅo jest rÃģwnieÅž powszechnym motywem: 56% historii wygenerowanych przez Claude nosi tytuÅ âTajemnica latarnikaâ i sÅowo âÅwiatÅoâ pojawia siÄ w 16 784 historiach, Årednio 3,2 razy na historiÄ.â

PrzykÅad, o ktÃģrym mÃģwi artykuÅ, zostaÅ napisany przez Google Gemini 3.1 Flash-Lite w odpowiedzi na proÅbÄ o napisanie historii.
Warto zauwaÅžyÄ, Åže autorzy badania identyfikujÄ nostalgiczny lub atawistyczny trend w caÅym pochodzeniu sÅÃģw kluczowych i nazw.
ÅcigajÄ c cechy
Aby przetestowaÄ, czy powtarzajÄ ce siÄ historie âlatarniâ mogÄ byÄ wyjaÅnione przez zwykÅÄ ekspozycjÄ na fikcjÄ, porÃģwnania zostaÅy dokonane miÄdzy ulubionymi sÅowami powtarzajÄ cymi siÄ w modelach a kilkoma duÅžymi zbiorami jÄzyka angielskiego. Fikcja wspÃģÅczesna zostaÅa zbadana za pomocÄ CONLIT, zestawu danych zawierajÄ cego 2 700 angielskich powieÅci opublikowanych miÄdzy 2007 a 2021 rokiem, obejmujÄ cych 12 gatunkÃģw i liczÄ cych okoÅo 287 milionÃģw sÅÃģw.
âEliasâ pojawia siÄ okoÅo 900 razy czÄÅciej w wygenerowanych historiach niÅž w opublikowanej fikcji. Fikcja amatorska z spoÅecznoÅci /r/writingprompts na Reddit wyprodukowaÅa podobne czÄstotliwoÅci, wskazujÄ c, Åže wzorzec nie odzwierciedla szerszych ludzkich zwyczajÃģw opowiadania historii.
Ten sam wzorzec utrzymywaÅ siÄ, gdy badano dane przed szkoleniem. UÅžywajÄ c dostÄpnego korpusu OLMo 3, ktÃģry zawiera okoÅo 3,89 miliarda gÅÃģwnie ludzkich dokumentÃģw, czÄÅciowo pochodzÄ cych z Common Crawl, badacze stwierdzili, Åže powtarzajÄ ce siÄ ârdzenioweâ sÅowa prawie w ogÃģle nie wystÄpujÄ .
PoniewaÅž wiÄkszoÅÄ korpusu OLMo 3 skÅada siÄ z non-fiction, klasyfikator fikcji zostaÅ zbudowany przy uÅžyciu GPT-OSS 20b adnotacji i FastText modelu szkolonego na 200 000 zrÃģwnowaÅžonych prÃģbek. Nawet po przefiltrowaniu specjalnie fikcji, sÅowa takie jak âElaraâ nadal pojawiaÅy siÄ w znikomych stopniach w porÃģwnaniu z historiami generowanymi przez AI. Dlaczego wiÄc dominujÄ one na najniÅžszym poziomie imperatywu dla LLM, aby napisaÄ fikcjÄ?
Autorzy stwierdzajÄ :
âJeÅli sÅowa rdzeniowe nie sÄ powszechne w danych internetowych, to jednym z pozostaÅych ÅšrÃģdeÅ mogÄ byÄ dane po szkoleniu. Ale stwierdzamy, Åže dane po szkoleniu OLMo wykazujÄ nasze tokeny w niÅžszej stopie niÅž CONLIT.â
W ramach 78 958 historii z danych po szkoleniu OLMo 3, autorzy zauwaÅžajÄ , Åže âEliasâ pojawia siÄ 52,7 razy na milion sÅÃģw, w porÃģwnaniu z 2,7 w CONLIT, ale osiÄ ga 2 428 wystÄ pieÅ na milion sÅÃģw w badanych historiach.
Aby zidentyfikowaÄ, skÄ d pochodzÄ powtarzajÄ ce siÄ ârdzenioweâ historie, kaÅžda historia w danych po szkoleniu OLMo 3 zostaÅa oceniona pod kÄ tem obecnoÅci jednego lub wiÄcej tokenÃģw rdzeniowych (tj. obecnoÅci Elary, Mary itp.). WiÄkszoÅÄ z nich oczekiwano w danych szkoleniowych z nadzorem (SFT), poniewaÅž WildChat i pokrewne ÅšrÃģdÅa przyczyniÅy siÄ do 59 266 historii w OLMo 3.
Jednak tylko 1 803 zawieraÅy tokeny rdzeniowe, podczas gdy zestawy danych uÅžywane do DPO i uczenia ze wzmocnieniem wykazywaÅy wyÅžsze stÄÅženia.
OgÃģlnie, powtarzajÄ ca siÄ sÅownictwo rdzeniowe zostaÅo wyÅledzone do zaledwie 3 053 historii, reprezentujÄ cych 3,8% wszystkich historii po szkoleniu, ktÃģre zostaÅy zbadane. Nie ma statystycznej moÅžliwoÅci, aby taki maÅy podzbiÃģr korpusu mÃģgÅ zdominowaÄ w sposÃģb, w jaki zostaÅo to zademonstrowane.
ArtykuÅ koÅczy siÄ:
âKiedy dano im niewielkÄ dyrektywÄ, obecne modele pionierskie piszÄ historie, uÅžywajÄ c wÄ skiego katalogu nazw, miejsc i zawodÃģw. PowtarzajÄ ce siÄ postacie w tych historiach obejmujÄ Elias, latarnika. Elias jest niezwykÅy; imiÄ to jest rzadkie w literaturze, danych internetowych i nawet w danych po szkoleniu.â
Podsumowanie
Wobec braku jakiegokolwiek pojedynczego dzieÅa literatury (lub nawet serii), ktÃģre zawieraÅoby najlepsze 11 sÅÃģw, ktÃģre autorzy identyfikujÄ , nie jest wcale jasne, w jaki sposÃģb ta konkretna kolekcja sÅÃģw nagromadziÅa siÄ i skojarzyÅa na najniÅžszym poziomie wielu duÅžych modeli jÄzykowych (pomimo ich rÃģÅžnorodnoÅci danych szkoleniowych i podejÅÄ).
Even if the researchersâ contention about the constraining effect of copyright filters is correct, a veritable ocean of classic literature in the training data should have prevented this strange collection of old-school words from dominating the output of a non-qualified âwriteâ prompt.
That theory assumes, however, that vast amounts of classic literature would have been included in the training regimen at all. Thatâs unlikely, since whatâs wanted are not models that will knock out faux Dickens outings, but rather that deal with the modern lexicon, and are suited for current business needs. The sheer volume even of pre-industrial literature would preclude its inclusion.
In any case, if there were one distinct narrative featuring some alternating mix of the âobsessiveâ facets that the authors note, it would, presumably, be easier to find; the authors themselves could not find it, and casual searches on the pre-AI era unearth no such contender. Perhaps, if âlighthouse syndromeâ gains the same notoriety as AI em dashes, some scholarly authority will come forward with the answer. * I canât go any further into Mayâs article, for reasons that may become obvious when one reads it. First published Wednesday, 27 maja 2026. Modified in first 30 minutes to fix Anthropic link.












