Andersonův úhel
Proč umělá inteligence miluje psaní o hlídačích majáků?

Pokud jsou požádány o “napsání příběhu”, ChatGPT a další přední jazykové modely se zdají vyhýbat porušování autorských práv prostřednictvím obsesivního návratu ke stejné úzké a podivné skupině vypravěčských prvků, jako jsou hlídači majáků, rybáři a hodináři.
Nová studie z Cornellovy univerzity zjistila, že přední jazykové modely mají podivnou posedlost velmi úzkou selekcí narativních prvků, když jsou požádány o “napsání příběhu”. Po podněcování čtyř LLM, aby napsaly 20 000 příběhů, zjistili, že 88 % vygenerovaných příběhů obsahuje alespoň jeden z 11 velmi specifických tokenů v kategorii “místo”, “jméno” nebo “profese”:

Výskyt nepravděpodobných klíčových slov, reprezentovaných zde v milionech, získaných analýzou 20 000 LLM-generovaných příběhů. Zdroj
11 nejčastěji se opakujících slov ve 12+ milionech slov generovaných LLM pro studii byly jména elias, mara, elara; profese hlídač, pekař, starosta, hodinář, rybář, knihovník a dirigent; a místo maják:
Testované modely byly Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini a OLMo 7b Thinking. Všechny byly podněcovány jednou z pěti žádostí: ‘Napište příběh’; ‘Prosím napište příběh’; ‘Napište mi příběh’; ‘Řekněte mi příběh’; nebo ‘Prosím řekněte mi příběh’.
Zvědavý, zda se tento syndrom vyskytuje i v modelech dostupných v době psaní, jsem provedl experiment sám, nejprve na svém běžném středněúrovňovém účtu ChatGPT (odkaz na konverzaci zde). Žádné cherry-picking nebylo nutné – ChatGPT-5.5 šel rovnou cestou k materiálu, který výzkumníci předpověděli, na první pokus:

ChatGPT-5.5 okamžitě potvrzuje počáteční zjištění studie. Zdroj
Pokoušel jsem se o totéž na Claude Haiku 4.5 a dostal jsem prakticky stejné výsledky.
Byl jsem také schopen reprodukovat zjištění autorů na Google Gemini, ale až když jsem specificky změnil model na ten, který byl použit ve studii, Gemini 3.1 Flash-Lite – a pak, na třetím pokusu (ale prvním s tímto modelem), vzor okamžitě vyšel najevo (odkaz zde):

Google Gemini 3.1 Flash-Lite. Zdroj
Další experimenty s různými modely Gemini vždycky vykazovaly téma majáku, i když s variantami, které nejsou uvedeny v “top 11”, jako je jméno “Thomas” a v jiné variantě moje vlastní jméno jako protagonista.
Majáky v divočině
Velké mysli myslí stejně: před týdnem, před zveřejněním nové studie, softwareový spisovatel Daniel May upozornil na shodu Elias a hlídač majáku trope, extrahované výzkumníky*, zřejmě si všiml náhodou. Pokoušel se o experiment sám, nejprve na svém běžném středněúrovňovém účtu ChatGPT (odkaz na konverzaci zde). Žádné cherry-picking nebylo nutné – ChatGPT-5.5 šel rovnou cestou k materiálu, který výzkumníci předpověděli, na první pokus:
Zvědavý, zda tyto opakující se téma, jména a místa někdy opustily hranice chatu, hledal jsem některé z top 11 klíčových slov a témat na Google a našel jsem pozoruhodné množství příspěvků, které zdánlivě kanalizovaly tyto téma:

Tři příklady mémů v outputu. Více informací níže.
May identifikoval delší Elias Thorne (nejen “Elias”) jako trvalý LLM meme a zveřejnil různé screenshoty z Amazonu, kde toto jméno bylo použito jako název pro autory různých knih, včetně lékařských knih.
Chuť do minulosti
Takže pro náhodné pozorování a serendipitu. Zatímco žádný “magický dokument” v trénovacích datech dosud nevyšel najevo, autoři nové studie teorizují, že copyright filtry v AI rozvoji mohou omezovat fikční výstup v LLM na materiál, který je mimo autorská práva.
Autoři uvádějí:
‘Nemůžeme vysvětlit dominanci “Elias v majáku” příběhů prevalence v pre- nebo post-trénovacích datech. Spekulujeme, že modely jsou trénovány na vyhýbání se odkazům na autorská práva a dospělé obsahy během zarovnání, ale odkládáme tuto otázku na budoucí práci.’
| Kategorie | Token | Naše | Lit | Pre non-fiction | Pre fiction | Post non-fiction | Post fiction |
|---|---|---|---|---|---|---|---|
| Jméno | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| Jméno | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| Jméno | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| Profese | hlídač | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| Profese | pekař | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| Profese | starosta | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| Profese | hodinář | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| Profese | rybář | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| Profese | knihovník | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| Profese | dirigent | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Místo | maják | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Porovnávací tabulka ukazující, jak často se opakující slova z AI-generovaných příběhů objevují v publikované literatuře, webové fikci a post-trénovacích datech, s termíny jako “Elias” a “maják”, které se vyskytují mnohem častěji v chatbot-generované fikci.
V studii autoři zjistili, že zdůrazněné 11 slov se vyskytuje v 88 % z 20 000 generovaných příběhů a že existuje “málo rozdílů mezi modely”. Podtrhují, že tato slova jsou vzácná v publikované anglické literatuře a že post-trénovací data (data navržená pro kondicionování a zarovnání modelů do “přijatelného” použití) by mohly být zodpovědné.
Příčiny
Abys pochopil, zda se opakující “lighthouse” příběhy dají vysvětlit obyčejnou expozicí fikce, byly provedeny srovnání mezi modely oblíbených opakujících se slov a několika velkými anglickými korpusy. Současná fikce byla prozkoumána prostřednictvím CONLIT, datové sady obsahující 2 700 anglických románů publikovaných mezi lety 2007 a 2021, pokrývající 12 žánrů a celkem přibližně 287 milionů slov.
‘Elias’ se objevil asi 900krát častěji v generovaných příbězích než v publikované fikci. Amatérská fikce z Redditovy /r/writingprompts komunity produkovala podobné frekvence, ukazující, že vzor neodráží širší lidské vyprávěcí návyky.
Stejný vzor platil, když byly prozkoumány pre-trénovací data. Použitím otevřeně dostupného OLMo 3 korpusu, který obsahuje přibližně 3,89 miliardy převážně lidsky psaných dokumentů, částečně z Common Crawl, výzkumníci zjistili, že opakující se “Core” slova skoro vůbec neobjevila.
Autoři studie uvádějí:
‘Jestliže Core slova nejsou běžná ve webových datech, pak zbývá jedna zbývající zdroj – post-trénovací data. Ale my zjistili, že OLMo post-trénovací data vykazují naše tokeny na nižší míře než CONLIT.
Závěr
Vzhledem k tomu, že neexistuje žádný jediný literární dokument, který by obsahoval všechny 11 slov, které autoři identifikují, není vůbec jasné, jakým způsobem se tato konkrétní kolekce slov nahromadila a spojila v nejnižších úrovních více velkých jazykových modelů (navzdory jejich rozmanitosti trénovacích dat a přístupů).
I když je teorie výzkumníků o omezujícím efektu copyright filtrů správná, obrovské množství klasické literatury v trénovacím režimu by mělo zabránit této podivné kolekci staromódních slov v dominanci výstupu nekázeňovaného “napište” podnětu.












