Andersonův úhel

Proč umělá inteligence miluje psaní o hlídačích majáků?

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

Když jsou ChatGPT a další přední jazykové modely požádány, aby „napsaly příběh“, zřejmě se snaží vyhnout porušení autorských práv tím, že se stále vracejí k téže malé skupině podivných postav, například ke strážcům majáku, rybářům a hodinářům.

 

Nová studie Cornellovy univerzity zjistila, že přední jazykové modely mají při prosté výzvě „napiš příběh“ zvláštní zálibu ve velmi úzkém výběru narativních prvků. Když čtyři LLM vytvořily 20 000 příběhů, 88 % z nich obsahovalo alespoň jeden z jedenácti konkrétních tokenů v kategoriích místo, jméno a povolání.

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers' analysis of 20,000 LLM-generated stories. Source - https://arxiv.org/pdf/2605.26492

Výskyt nepravděpodobných klíčových slov v počtech na milion slov, získaný analýzou 20 000 příběhů vytvořených LLM. Zdroj

Jedenáct nejčastěji se opakujících slov ve více než 12 milionech slov vytvořených pro studii tvořila jména elias, mara a elara; povolání keeper, baker, mayor, clockmaker, fisherman, librarian a conductor; a místo lighthouse.

Testovány byly modely Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini a OLMo 7b Thinking. Každý dostal jednu z pěti výzev: „Napiš příběh“, „Prosím napiš příběh“, „Napiš mi příběh“, „Pověz mi příběh“ nebo „Prosím pověz příběh“.

Abych zjistil, zda se popsaný syndrom objevuje i u modelů dostupných v době psaní, zopakoval jsem pokus nejprve na svém běžném účtu ChatGPT střední úrovně (odkaz na konverzaci je zde). Nebylo třeba vybírat vhodný výsledek: ChatGPT-5.5 sáhl po materiálu předpovězeném výzkumníky hned napoprvé.

ChatGPT-5.5 immediately backs up the paper's initial findings. Source - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

ChatGPT-5.5 okamžitě potvrzuje počáteční zjištění studie. Zdroj

Protože tento okamžitý zásah mohl souviset s historií účtu nebo přenosem mezi oblastmi, přihlásil jsem se v soukromém okně Firefoxu k bezplatnému účtu ChatGPT, který jsem více než rok nepoužil, a pokus zopakoval (konverzace zde). Pokud OpenAI nepropojuje různé účty podle stejné IP adresy, ChatGPT opět trefil přesně.

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. Source - https://chatgpt.com/share/6a16b210-d450-83ea-936e-78c6062ca74d

Druhý účet ChatGPT sleduje stejnou úzkou sadu jmen a témat popsanou v nové studii. „Mira“ patří mezi dvacet nejčastějších jmen. Zdroj

Je třeba poznamenat, že tyto verze GPT byly o stupeň novější než 5.4 testovaná ve studii.

Studie testovala Claude Haiku, já však zkusil výchozí Anthropic Sonnet 4.6 a nebyl zklamán. Známá klíčová slova se znovu objevila hned napoprvé (konverzace zde).

This time 'Mara', another stalwart from the 'top 11', leads the story, in the first attempt on Claude Sonnet 4.6. Source - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

Tentokrát vede příběh „Mara“, další stálice z první jedenáctky, a to při prvním pokusu s Claude Sonnet 4.6. Zdroj

Stejná výzva v Claude Haiku 4.5 vedla téměř ke stejnému výsledku.

V Google Gemini se mi zpočátku výsledek autorů zopakovat nepodařilo. Když jsem však přepnul přímo na Gemini 3.1 Flash-Lite použitý ve studii, při třetím pokusu celkově, ale prvním s tímto modelem, se vzorec objevil okamžitě (odkaz zde).

Google Gemini 3.1 Flash-Lite. Source - https://gemini.google.com/share/82c245884ec1

Google Gemini 3.1 Flash-Lite. Zdroj

Další pokusy s různými modely Gemini vždy přinesly motiv majáku, byť s obměnami mimo první jedenáctku, například se jménem Thomas nebo v jiné verzi s mým vlastním jménem v hlavní roli.

V době psaní lze tedy zjištění studie mimořádně snadno ověřit.

Majáky ve volné přírodě

Velké mysli uvažují podobně: týden před zveřejněním nové studie softwarový autor Daniel May upozornil na shodu motivů Elias a strážce majáku, které patrně objevil náhodou*. Otestoval osm variant Gemini, DeepSeek, Qwen a Gemma a získal majákové motivy i protagonistu Eliase Thornea*. Jeho objev ale nezahrnoval širší škálu přetrvávajících témat z nové studie.

Abych zjistil, zda se opakující témata, jména a místa dostala mimo chat, vyhledal jsem některá z jedenácti hlavních slov na Googlu a našel pozoruhodné množství příspěvků, které je zřejmě přejaly.

Three examples of the meme in output. See below for source links.

Tři příklady tohoto memu ve výstupech. Odkazy na zdroje jsou níže.

May označil delší jméno Elias Thorne, nikoli pouze Elias, za trvalý mem LLM a zveřejnil snímky z Amazonu, kde bylo toto jméno použito jako jméno autora různých knih včetně lékařských.

Našel jsem také obsah, který zřejmě využil přetrvávající témata z LLM: příběh na X (archiv zde), beletristické dílo (archiv zde) a namluvený příběh na YouTube (archiv zde). Materiálu bylo mnohem více, ale čas nedovolil pokračovat.

Záliba v minulosti

Tolik k náhodnému pozorování. Přestože v trénovacích datech nebyl nalezen žádný jediný „kouzelný dokument“ obsahující všechny či většinu těchto prvků, autoři nové studie „Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories“ z Cornellovy univerzity se domnívají, že filtry autorských práv mohou omezovat fikční výstup LLM na materiál bez autorskoprávní ochrany.

Autoři uvádějí:

„Dominanci příběhů ‚Elias v majáku‘ nelze vysvětlit jejich četností v datech před ani po trénování. Domníváme se, že modely jsou při zarovnávání učeny vyhýbat se odkazům na postavy chráněné autorským právem a na obsah pro dospělé, tuto otázku však ponecháváme budoucímu výzkumu.“

Kategorie Token Naše Literatura Předtrénování – literatura faktu Předtrénování – fikce Dotrénování – literatura faktu Dotrénování – fikce
Jméno elias 2,428 2.7 2.2 4.0 0.4 52.7
Jméno mara 5,200 3.9 2.5 8.7 0.4 21.7
Jméno elara 1,221 0.0 0.4 1.2 0.9 108
Povolání keeper 1,495 7.2 6.3 14.7 3.5 10.0
Povolání baker 161 20 11.8 10.56 1.7 11.9
Povolání mayor 198 28 11.5 16.1 1.4 27.4
Povolání clockmaker 108 0.1 0.18 0.0 0.3 1.4
Povolání fisherman 62 4.2 3.0 7.6 0.0 9.3
Povolání librarian 68 5.3 7.6 5.9 2.3 11.5
Povolání conductor 96 5.0 5.9 5.7 4.7 7.5
Místo lighthouse 3,005 5.5 3.5 4.6 4.6 10.1

Srovnání četnosti opakujících se slov z příběhů vytvořených AI v publikované literatuře, webové fikci a datech po trénování. Výrazy jako „Elias“ a „lighthouse“ se v chatbotové fikci objevují mnohem častěji.

Autoři zjistili, že zdůrazněných jedenáct slov se objevuje v 88 % z 20 000 příběhů a mezi modely je jen malý rozdíl. Zdůrazňují, že v publikované anglické literatuře jsou tato slova neobvyklá a příčinou mohou být data po trénování, která modely podmiňují a zarovnávají k „přijatelnému“ používání.

Studie uvádí:

„Typický příklad níže ukazuje tři prvky společné téměř všem 20 000 příběhům: místo (19 864 příběhů), jméno postavy (19 864) a povolání (15 807).“

„Konkrétní místo (maják), jméno (Elias) a povolání (strážce) se v nějaké kombinaci objevují v 66,6 % všech příběhů. Častým tématem je také světlo: 56 % příběhů Claude se jmenuje ‚The Lighthouse Keeper’s Secret‘ a slovo ‚light‘ je v 16 784 příbězích, průměrně 3,2krát na příběh.“

This example, the paper states, was written by Google Gemini 3.1 Flash-Lite, in response to the prompt 'Write a story'.

Podle studie tento příklad napsal Google Gemini 3.1 Flash-Lite na výzvu „Napiš příběh“.

Autoři také u všech odvozených klíčových slov a jmen rozpoznávají nostalgický či atavistický sklon.

Pátrání po rysech

Aby ověřili, zda opakované příběhy o majácích vysvětluje běžný kontakt s fikcí, porovnali výzkumníci oblíbená slova modelů s několika rozsáhlými anglickými korpusy. Současnou fikci zastupoval CONLIT, soubor 2 700 anglických románů z let 2007–2021 ve 12 žánrech o celkovém rozsahu asi 287 milionů slov.

„Elias“ se v generovaných příbězích objevoval asi 900krát častěji než v publikované beletrii. Amatérská tvorba komunity Reddit /r/writingprompts vykázala podobné četnosti jako publikovaná fikce, takže vzorec neodráží ani širší lidské vypravěčské zvyklosti.

Stejný výsledek přinesla předtrénovací data. V otevřeném korpusu OLMo 3, který obsahuje asi 3,89 miliardy převážně lidských dokumentů částečně z Common Crawl, se opakující „jádrová“ slova téměř nevyskytovala.

Protože velká část OLMo 3 je literatura faktu, vznikl klasifikátor fikce z anotací GPT-OSS 20b a modelu FastText trénovaného na 200 000 vyvážených vzorcích. Ani po výběru fikce se slova jako Elara nevyskytovala ve srovnání s příběhy AI téměř vůbec. Proč tedy dominují při nejprostší výzvě LLM k napsání fikce?

Autoři uvádějí:

„Pokud jádrová slova nejsou běžná ve webových datech, zbývajícím zdrojem by byla data po trénování. Zjistili jsme však, že v nich OLMo vykazuje naše tokeny méně často než CONLIT.“

V 78 958 příbězích z dotrénovacích dat OLMo 3 se Elias objevil 52,7krát na milion slov oproti 2,7krát v CONLIT, ale ve zkoumaných generovaných příbězích dosáhl 2 428 výskytů na milion slov.

Pro určení původu opakovaných „jádrových“ příběhů byl každý příběh v datech OLMo 3 po trénování ohodnocen podle přítomnosti jednoho či více tokenů, například Elara nebo Mara. Nejvíce se jich očekávalo v datech pro učení s učitelem, protože WildChat a související zdroje přidaly 59 266 příběhů.

Jádrové výrazy však obsahovalo jen 1 803 z nich, zatímco vyšší koncentrace se objevily v datech pro DPO a posilované učení.

Celkem byla opakující se slovní zásoba vysledována pouze k 3 053 příběhům, tedy 3,8 % všech zkoumaných příběhů po trénování. Tak malá část korpusu nemůže statisticky dominovat způsobem, který studie ukázala.

Studie uzavírá:

„Když dostanou málo pokynů, současné špičkové modely píší příběhy z úzkého katalogu jmen, míst a povolání. Mezi opakujícími se postavami je strážce majáku Elias. Elias je neobvyklý; jeho jméno je vzácné v literatuře, webových datech i datech po trénování.“

Závěr

Protože neexistuje jediné literární dílo ani série s většinou či všemi jedenácti výrazy, není jasné, jak se právě tato kolekce slov nahromadila a propojila v nejnižších vrstvách několika rozdílně trénovaných velkých jazykových modelů.

I kdyby měli výzkumníci pravdu o omezujícím vlivu autorskoprávních filtrů, skutečný oceán klasické literatury v trénovacích datech měl zabránit tomu, aby tato zvláštní sbírka staromódních slov ovládla neurčitou výzvu „napiš“.

Tato teorie ale předpokládá, že bylo do tréninku vůbec zahrnuto obrovské množství klasické literatury. To je nepravděpodobné: cílem nejsou modely chrlící napodobeniny Dickense, nýbrž modely pracující se současnou slovní zásobou a potřebami podniků. Samotný objem předindustriální literatury by její zahrnutí znesnadnil.

Pokud by přesto existoval jeden příběh kombinující „obsedantní“ rysy popsané autory, patrně by se hledal snáze. Nenašli jej ani autoři a běžné hledání v době před AI žádného kandidáta neodhalilo. Jestli „majákový syndrom“ získá stejnou proslulost jako dlouhé pomlčky AI, možná odpověď nabídne některá akademická autorita.

 

* Do Mayova článku nemohu zacházet podrobněji z důvodů, které mohou být po jeho přečtení zřejmé.

Poprvé zveřejněno ve středu 27. května 2026. Během prvních 30 minut upraven odkaz na Anthropic.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai