Andersonův úhel
Proč umělá inteligence miluje psaní o hlídačích majáků?

Když jsou ChatGPT a další přední jazykové modely požádány, aby „napsaly příběh“, zřejmě se snaží vyhnout porušení autorských práv tím, že se stále vracejí k téže malé skupině podivných postav, například ke strážcům majáku, rybářům a hodinářům.
Nová studie Cornellovy univerzity zjistila, že přední jazykové modely mají při prosté výzvě „napiš příběh“ zvláštní zálibu ve velmi úzkém výběru narativních prvků. Když čtyři LLM vytvořily 20 000 příběhů, 88 % z nich obsahovalo alespoň jeden z jedenácti konkrétních tokenů v kategoriích místo, jméno a povolání.

Výskyt nepravděpodobných klíčových slov v počtech na milion slov, získaný analýzou 20 000 příběhů vytvořených LLM. Zdroj
Jedenáct nejčastěji se opakujících slov ve více než 12 milionech slov vytvořených pro studii tvořila jména elias, mara a elara; povolání keeper, baker, mayor, clockmaker, fisherman, librarian a conductor; a místo lighthouse.
Testovány byly modely Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini a OLMo 7b Thinking. Každý dostal jednu z pěti výzev: „Napiš příběh“, „Prosím napiš příběh“, „Napiš mi příběh“, „Pověz mi příběh“ nebo „Prosím pověz příběh“.
Abych zjistil, zda se popsaný syndrom objevuje i u modelů dostupných v době psaní, zopakoval jsem pokus nejprve na svém běžném účtu ChatGPT střední úrovně (odkaz na konverzaci je zde). Nebylo třeba vybírat vhodný výsledek: ChatGPT-5.5 sáhl po materiálu předpovězeném výzkumníky hned napoprvé.

ChatGPT-5.5 okamžitě potvrzuje počáteční zjištění studie. Zdroj
Protože tento okamžitý zásah mohl souviset s historií účtu nebo přenosem mezi oblastmi, přihlásil jsem se v soukromém okně Firefoxu k bezplatnému účtu ChatGPT, který jsem více než rok nepoužil, a pokus zopakoval (konverzace zde). Pokud OpenAI nepropojuje různé účty podle stejné IP adresy, ChatGPT opět trefil přesně.

Druhý účet ChatGPT sleduje stejnou úzkou sadu jmen a témat popsanou v nové studii. „Mira“ patří mezi dvacet nejčastějších jmen. Zdroj
Je třeba poznamenat, že tyto verze GPT byly o stupeň novější než 5.4 testovaná ve studii.
Studie testovala Claude Haiku, já však zkusil výchozí Anthropic Sonnet 4.6 a nebyl zklamán. Známá klíčová slova se znovu objevila hned napoprvé (konverzace zde).

Tentokrát vede příběh „Mara“, další stálice z první jedenáctky, a to při prvním pokusu s Claude Sonnet 4.6. Zdroj
Stejná výzva v Claude Haiku 4.5 vedla téměř ke stejnému výsledku.
V Google Gemini se mi zpočátku výsledek autorů zopakovat nepodařilo. Když jsem však přepnul přímo na Gemini 3.1 Flash-Lite použitý ve studii, při třetím pokusu celkově, ale prvním s tímto modelem, se vzorec objevil okamžitě (odkaz zde).

Google Gemini 3.1 Flash-Lite. Zdroj
Další pokusy s různými modely Gemini vždy přinesly motiv majáku, byť s obměnami mimo první jedenáctku, například se jménem Thomas nebo v jiné verzi s mým vlastním jménem v hlavní roli.
V době psaní lze tedy zjištění studie mimořádně snadno ověřit.
Majáky ve volné přírodě
Velké mysli uvažují podobně: týden před zveřejněním nové studie softwarový autor Daniel May upozornil na shodu motivů Elias a strážce majáku, které patrně objevil náhodou*. Otestoval osm variant Gemini, DeepSeek, Qwen a Gemma a získal majákové motivy i protagonistu Eliase Thornea*. Jeho objev ale nezahrnoval širší škálu přetrvávajících témat z nové studie.
Abych zjistil, zda se opakující témata, jména a místa dostala mimo chat, vyhledal jsem některá z jedenácti hlavních slov na Googlu a našel pozoruhodné množství příspěvků, které je zřejmě přejaly.

Tři příklady tohoto memu ve výstupech. Odkazy na zdroje jsou níže.
May označil delší jméno Elias Thorne, nikoli pouze Elias, za trvalý mem LLM a zveřejnil snímky z Amazonu, kde bylo toto jméno použito jako jméno autora různých knih včetně lékařských.
Našel jsem také obsah, který zřejmě využil přetrvávající témata z LLM: příběh na X (archiv zde), beletristické dílo (archiv zde) a namluvený příběh na YouTube (archiv zde). Materiálu bylo mnohem více, ale čas nedovolil pokračovat.
Záliba v minulosti
Tolik k náhodnému pozorování. Přestože v trénovacích datech nebyl nalezen žádný jediný „kouzelný dokument“ obsahující všechny či většinu těchto prvků, autoři nové studie „Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories“ z Cornellovy univerzity se domnívají, že filtry autorských práv mohou omezovat fikční výstup LLM na materiál bez autorskoprávní ochrany.
Autoři uvádějí:
„Dominanci příběhů ‚Elias v majáku‘ nelze vysvětlit jejich četností v datech před ani po trénování. Domníváme se, že modely jsou při zarovnávání učeny vyhýbat se odkazům na postavy chráněné autorským právem a na obsah pro dospělé, tuto otázku však ponecháváme budoucímu výzkumu.“
| Kategorie | Token | Naše | Literatura | Předtrénování – literatura faktu | Předtrénování – fikce | Dotrénování – literatura faktu | Dotrénování – fikce |
|---|---|---|---|---|---|---|---|
| Jméno | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| Jméno | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| Jméno | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| Povolání | keeper | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| Povolání | baker | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| Povolání | mayor | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| Povolání | clockmaker | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| Povolání | fisherman | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| Povolání | librarian | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| Povolání | conductor | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Místo | lighthouse | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Srovnání četnosti opakujících se slov z příběhů vytvořených AI v publikované literatuře, webové fikci a datech po trénování. Výrazy jako „Elias“ a „lighthouse“ se v chatbotové fikci objevují mnohem častěji.
Autoři zjistili, že zdůrazněných jedenáct slov se objevuje v 88 % z 20 000 příběhů a mezi modely je jen malý rozdíl. Zdůrazňují, že v publikované anglické literatuře jsou tato slova neobvyklá a příčinou mohou být data po trénování, která modely podmiňují a zarovnávají k „přijatelnému“ používání.
Studie uvádí:
„Typický příklad níže ukazuje tři prvky společné téměř všem 20 000 příběhům: místo (19 864 příběhů), jméno postavy (19 864) a povolání (15 807).“
„Konkrétní místo (maják), jméno (Elias) a povolání (strážce) se v nějaké kombinaci objevují v 66,6 % všech příběhů. Častým tématem je také světlo: 56 % příběhů Claude se jmenuje ‚The Lighthouse Keeper’s Secret‘ a slovo ‚light‘ je v 16 784 příbězích, průměrně 3,2krát na příběh.“

Podle studie tento příklad napsal Google Gemini 3.1 Flash-Lite na výzvu „Napiš příběh“.
Autoři také u všech odvozených klíčových slov a jmen rozpoznávají nostalgický či atavistický sklon.
Pátrání po rysech
Aby ověřili, zda opakované příběhy o majácích vysvětluje běžný kontakt s fikcí, porovnali výzkumníci oblíbená slova modelů s několika rozsáhlými anglickými korpusy. Současnou fikci zastupoval CONLIT, soubor 2 700 anglických románů z let 2007–2021 ve 12 žánrech o celkovém rozsahu asi 287 milionů slov.
„Elias“ se v generovaných příbězích objevoval asi 900krát častěji než v publikované beletrii. Amatérská tvorba komunity Reddit /r/writingprompts vykázala podobné četnosti jako publikovaná fikce, takže vzorec neodráží ani širší lidské vypravěčské zvyklosti.
Stejný výsledek přinesla předtrénovací data. V otevřeném korpusu OLMo 3, který obsahuje asi 3,89 miliardy převážně lidských dokumentů částečně z Common Crawl, se opakující „jádrová“ slova téměř nevyskytovala.
Protože velká část OLMo 3 je literatura faktu, vznikl klasifikátor fikce z anotací GPT-OSS 20b a modelu FastText trénovaného na 200 000 vyvážených vzorcích. Ani po výběru fikce se slova jako Elara nevyskytovala ve srovnání s příběhy AI téměř vůbec. Proč tedy dominují při nejprostší výzvě LLM k napsání fikce?
Autoři uvádějí:
„Pokud jádrová slova nejsou běžná ve webových datech, zbývajícím zdrojem by byla data po trénování. Zjistili jsme však, že v nich OLMo vykazuje naše tokeny méně často než CONLIT.“
V 78 958 příbězích z dotrénovacích dat OLMo 3 se Elias objevil 52,7krát na milion slov oproti 2,7krát v CONLIT, ale ve zkoumaných generovaných příbězích dosáhl 2 428 výskytů na milion slov.
Pro určení původu opakovaných „jádrových“ příběhů byl každý příběh v datech OLMo 3 po trénování ohodnocen podle přítomnosti jednoho či více tokenů, například Elara nebo Mara. Nejvíce se jich očekávalo v datech pro učení s učitelem, protože WildChat a související zdroje přidaly 59 266 příběhů.
Jádrové výrazy však obsahovalo jen 1 803 z nich, zatímco vyšší koncentrace se objevily v datech pro DPO a posilované učení.
Celkem byla opakující se slovní zásoba vysledována pouze k 3 053 příběhům, tedy 3,8 % všech zkoumaných příběhů po trénování. Tak malá část korpusu nemůže statisticky dominovat způsobem, který studie ukázala.
Studie uzavírá:
„Když dostanou málo pokynů, současné špičkové modely píší příběhy z úzkého katalogu jmen, míst a povolání. Mezi opakujícími se postavami je strážce majáku Elias. Elias je neobvyklý; jeho jméno je vzácné v literatuře, webových datech i datech po trénování.“
Závěr
Protože neexistuje jediné literární dílo ani série s většinou či všemi jedenácti výrazy, není jasné, jak se právě tato kolekce slov nahromadila a propojila v nejnižších vrstvách několika rozdílně trénovaných velkých jazykových modelů.
I kdyby měli výzkumníci pravdu o omezujícím vlivu autorskoprávních filtrů, skutečný oceán klasické literatury v trénovacích datech měl zabránit tomu, aby tato zvláštní sbírka staromódních slov ovládla neurčitou výzvu „napiš“.
Tato teorie ale předpokládá, že bylo do tréninku vůbec zahrnuto obrovské množství klasické literatury. To je nepravděpodobné: cílem nejsou modely chrlící napodobeniny Dickense, nýbrž modely pracující se současnou slovní zásobou a potřebami podniků. Samotný objem předindustriální literatury by její zahrnutí znesnadnil.
Pokud by přesto existoval jeden příběh kombinující „obsedantní“ rysy popsané autory, patrně by se hledal snáze. Nenašli jej ani autoři a běžné hledání v době před AI žádného kandidáta neodhalilo. Jestli „majákový syndrom“ získá stejnou proslulost jako dlouhé pomlčky AI, možná odpověď nabídne některá akademická autorita.
* Do Mayova článku nemohu zacházet podrobněji z důvodů, které mohou být po jeho přečtení zřejmé.
Poprvé zveřejněno ve středu 27. května 2026. Během prvních 30 minut upraven odkaz na Anthropic.












