Andersons vinkel
Varför älskar AI att skriva om fyrväktare?

När man ber om att “skriva en historia” verkar ledande språkmodeller, som ChatGPT och andra, undvika upphovsrättsintrång genom att återkommande använda samma smala och underliga urval av berättelseelement.
En ny studie från Cornell University har funnit att ledande språkmodeller tycks ha en underlig besatthet av ett mycket snävt urval av berättelseelement när man ber modellen att “skriva en historia”. Efter att ha uppmanat fyra stora språkmodeller att skriva 20 000 historier fann de att 88 % av de skapade historierna innehöll minst ett av 11 mycket specifika token, i kategorin “plats”, “namn” eller “yrke”:

Förekomsten av osannolika nyckelord, representerade här i miljontals, erhållna genom forskarnas analys av 20 000 LLM-genererade historier. Källa
De 11 vanligaste orden i de 12+ miljoner ord som genererades av LLM:erna för studien var namnen elias, mara, elara; yrkena väktare, bagare, borgmästare, urmakare, fiskare, bibliotekarie och dirigent; och platsen fyr:
De testade modellerna var Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini och OLMo 7b Thinking. Alla fick en av fem uppmaningar: ‘Skriv en historia’; ‘Var vänlig och skriv en historia’; ‘Skriv en historia åt mig’; ‘Berätta en historia’; eller ‘Var vänlig och berätta en historia’.
Nyfiken på om denna “syndrom” som artikeln identifierar förekommer i modeller som finns tillgängliga vid tidpunkten för skrivandet, testade jag själv experimentet, först på min vanliga medelklassiga ChatGPT-konto (länk till samtalet här). Inga urval var nödvändiga – ChatGPT-5.5 gick rakt på materialet som forskarna förutspådde, på första försöket:

ChatGPT-5.5 backar omedelbart upp papperets initiala fynd. Källa
Undrande om historisk kontext, eller till och med möjlig cross-domain-läckage, kunde förklara denna “omedelbara träff”, loggade jag in på ett fritt ChatGPT-konto som jag inte använt på över ett år, i en Firefox-privat webbläsarsession, och försökte igen (länk till samtalet här). Återigen (antagande att OpenAI inte använder en gemensam IP-adress för att korspopulera olika konton), träffade ChatGPT rakt in i prick:

ChatGPT-konto #2 följer samma besatthet och liten handbok med namn och teman som beskrivs i den nya artikeln. ‘Mira’ är i författarnas topp 20. Källa
Det är värt att notera att dessa GPT-versioner var en nivå högre än den 5.4 som testades för artikeln.
Trots att Claude Haiku testades för artikeln, testade jag Anthropics standard Sonnet 4.6, och blev inte besviken. Återigen kom de välbekanta nyckelorden på första försöket (länk till samtalet här):

Den här gången leder ‘Mara’, en annan stapelvara från ‘topp 11’, historien, i första försöket på Claude Sonnet 4.6. Källa
Försökte jag samma uppmaning på Claude Haiku 4.5 ledde det till ganska samma resultat.
Jag kunde inte reproducera författarnas fynd på Google Gemini från början, tills jag specifikt ändrade modellen till den som användes i artikeln, Gemini 3.1 Flash-Lite – och sedan, på tredje försöket (men första med den modellen), uppkom mönstret omedelbart (länk här):

Google Gemini 3.1 Flash-Lite. Källa
Ytterligare experiment med olika Gemini-modeller visade alltid upp fyr-temat, även om med varianter som inte finns med i “topp 11”, som namnet “Thomas”, och, i en annan variant, mitt eget namn, som huvudperson.
Trots allt, vid tidpunkten för skrivandet, är artikelförfattarnas fynd extremt lätta att bevisa.
Fyrtorn i vildmarken
Stora tankar tänker lika: för en vecka sedan, före publiceringen av den nya artikeln, påpekade programvaruutvecklaren Daniel May sammanträffandet av Elias och fyrväktare-tropen som forskarna extraherade*, tydligen efter att ha märkt det slumpmässigt. Han gick vidare för att testa åtta varianter av Gemini, DeepSeek, Qwen och Gemma, som han fann skulle producera fyr-memer och ‘Elias Thorne’ som huvudperson*. Men denna initiala upptäckt sträckte sig inte till den bredare uppsättningen bestående teman som beskrivs i den nya artikeln.
Nyfiken på om dessa återkommande teman, namn och platser någonsin hade lämnat chatten, sökte jag efter några av de topp 11 nyckelorden och temana på Google, och fann en anmärkningsvärd mängd inlägg som tycks ha kanalerat dem:

Tre exempel på memen i utdata. Se nedan för källlänkar.
May hade identifierat den längre Elias Thorne (snarare än bara ‘Elias’) som en bestående LLM-mem, och publicerade olika skärmdumpar från Amazon, där detta namn tydligen hade använts som titel för författare till olika böcker, inklusive medicinska böcker.
Istället letade jag efter och fann innehåll som tycktes ha anropat de bestående temana från en LLM, inklusive ett X-inlägg av en historia (arkiverad version här); en fiktiv verk (arkiverad version här); och en berättelse med berättarröst på YouTube (arkiverad här). Det fanns mycket mer att utforska, men tiden tillät det inte.
En smak av det förflutna
Så mycket för tillfällig iakttagelse och serendipitet. Medan ingen enskild “magisk dokument” i träningdata har dykt upp som innehåller alla eller de flesta av de bestående orden, teoriserar författarna till den nya artikeln (med titeln Elias i fyrhuset, igen? Diagnos av låg mångfald i LLM-berättelser, från två forskare vid Cornell University) att upphovsrättsfilter i AI-utveckling kan begränsa fiktionellt utdata i LLM:er till material som är utan upphovsrätt.
Författarna påstår:
‘Vi finner att dominansen av “Elias i fyrhuset”-berättelser inte kan förklaras av förekomst i för- eller efterträningsdata. Vi spekulerar i att modellerna tränas för att undvika hänvisningar till upphovsrättsskyddade karaktärer och vuxet innehåll under justering, men skjuter denna fråga till framtida arbete.’
| Kategori | Token | Vår | Litteratur | För icke-fiktion | För fiktion | Efter icke-fiktion | Efter fiktion |
|---|---|---|---|---|---|---|---|
| Namn | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| Namn | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| Namn | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| Yrke | väktare | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| Yrke | bagare | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| Yrke | borgmästare | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| Yrke | urmakare | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| Yrke | fiskare | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| Yrke | bibliotekarie | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| Yrke | dirigent | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Plats | fyr | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Jämförelsetabell som visar hur ofta återkommande ord från AI-genererade berättelser förekommer över publicerad litteratur, webbfiktion och efterträningsdata, med termer som ‘Elias’ och ‘fyr’ som förekommer mycket oftare i chatbot-genererad fiktion.
I studien fann författarna att de betonade 11 orden förekommer i 88 % av de 20 000 genererade berättelserna, och att det finns “lite skillnad mellan modellerna”. De betonar att dessa ord är ovanliga i publicerad engelsk litteratur, och att efterträningsdata (data som är avsedd att konditionera och justera modeller till “godkänt” användning) kan vara ansvarig.
Artikeln påstår:
‘Ett typiskt exempel som visas [nedan] lyfter fram tre element som är gemensamma för nästan alla 20 000 berättelser: en plats (19 864 berättelser), ett karaktärsnamn (19 864 berättelser) och ett yrke (15 807 berättelser).
‘I själva verket förekommer den specifika platsen (“fyr”), namnet (“Elias”) och yrket (“väktare”) i denna berättelse i någon kombination över 66,6 % av alla genererade berättelser. Ljus är också ett vanligt tema: 56 % av berättelserna genererade av Claude har titeln “Fyrväktarens hemlighet” och ordet “ljus” förekommer i 16 784 berättelser i genomsnitt 3,2 gånger per berättelse.’

Detta exempel, som artikeln påstår, skrevs av Google Gemini 3.1 Flash-Lite, som svar på uppmaningen ‘Skriv en historia’.
Det är värt att notera att artikelförfattarna identifierar en nostalgisk eller atavistisk trend över alla de härledda nyckelorden och namnen.
Jakten på egenskaperna
För att testa om de upprepade “fyr”-berättelserna kan förklaras av vanlig exponering för fiktion, gjordes jämförelser mellan modellernas favoritåterkommande ord och flera stora engelskspråkiga korpus. Kontemporär fiktion undersöktes genom CONLIT, en dataset som innehåller 2 700 engelska romaner publicerade mellan 2007 och 2021, som täcker 12 genrer och totalt cirka 287 miljoner ord.
‘Elias’ förekommer cirka 900 gånger oftare i de genererade berättelserna än i publicerad fiktion. Amatörfiktion från Reddit:s /r/writingprompts-samhälle producerade liknande frekvenser, vilket indikerar att mönstret inte återspeglar bredare mänskliga berättande vanor heller.
Samma mönster gällde när förträningsdata undersöktes. Med hjälp av det öppet tillgängliga OLMo 3-korpuset, som innehåller cirka 3,89 miljarder huvudsakligen mänskligt skrivna dokument, delvis från Common Crawl, fann forskarna att de återkommande ‘kärn’-orden knappast förekommer alls.
Eftersom mycket av OLMo 3-korpusen är icke-fiktion byggdes en fiktionsklassificerare med hjälp av GPT-OSS 20b-annotationer och en FastText-modell som tränades på 200 000 balanserade exempel. Även efter att ha filtrerat specifikt för fiktivt material förekom ord som ‘Elara’ fortfarande i försumbara rater jämfört med de AI-genererade berättelserna. Varför, då, dominerar de på den lägsta nivån av imperativet för en LLM att skriva fiktion?
Författarna påstår:
‘Om kärnord inte är vanliga i webbdata, så återstår en källa som postträningsdata. Men vi finner att OLMo:s postträningsdata visar våra token på en lägre frekvens än CONLIT.
Inom 78 958 berättelser från OLMo 3:s postträningsdata noterar de att ‘Elias’ förekommer 52,7 gånger per miljon ord, jämfört med 2,7 i CONLIT, men når 2 428 förekomster per miljon ord i de genererade berättelser som undersöktes i studien.
För att identifiera var de återkommande ‘kärn’-berättelserna kom ifrån, poängsattes varje berättelse i OLMo 3:s postträningsdata för närvaron av en eller flera kärntoken (dvs. för närvaron av Elara, Mara, etc.). De flesta förväntades förekomma i övervakad finjustering (SFT)-dataset, eftersom WildChat och relaterade källor bidrog med 59 266 berättelser till OLMo 3.
Men endast 1 803 innehöll kärntermer, medan dataset som användes för DPO och förstärkt inlärning visade högre koncentrationer.
Sammanfattningsvis spårades den återkommande kärnvokabulären till bara 3 053 berättelser, vilket representerar 3,8 % av alla postträningsberättelser som undersöktes. Det finns ingen statistisk möjlighet för att en sådan liten undermängd av korpus ska kunna dominera den på det sätt som visas.
Artikeln slutsats:
‘När de får lite riktning, skriver nuvarande frontmodeller berättelser med hjälp av en smal katalog med namn, platser och yrken. Återkommande karaktärer i dessa berättelser inkluderar Elias, en fyrväktare. Elias är ovanlig; namnet är ovanligt i litteratur, webbdata och till och med postträningsdata.’
Slutsats
I avsaknad av något enskilt litterärt verk (eller till och med en serie) som innehåller de topp 11 orden som författarna identifierar, är det inte alls klart på vilket sätt denna specifika samling av ord har ackumulerats och självassocierats till de lägsta nivåerna av flera stora språkmodeller (trots deras mångfald av träningsdata och tillvägagångssätt).
Även om forskarnas påstående om den begränsande effekten av upphovsrättsfilter är korrekt, borde en “ocean” av klassisk litteratur i träningsregimen ha förhindrat att denna underliga samling av gammaldags ord dominerar utdata från en icke-kvalificerad “skriv”-uppmaning.
Den teorin antar dock att stora mängder klassisk litteratur skulle ha inkluderats i träningsregimen över huvud taget. Det är osannolikt, eftersom det som önskas är inte modeller som kan producera fejkade Dickens-utgåvor, utan snarare modeller som kan hantera det moderna lexikonet och som är lämpliga för nuvarande affärsbehov. Den rena volymen, till och med av förindustriell litteratur, skulle förhindra dess inkludering.
I vilket fall som helst, om det var ett distinkt narrativ som innehöll någon kombination av de “besatta” aspekter som författarna noterar, skulle det, förmodligen, vara lättare att hitta; författarna själva kunde inte hitta det, och tillfälliga sökningar i för-AI-eran avslöjar inga sådana kandidater. Kanske, om “fyr-syndromet” får samma ryktbarhet som AI-em-streck, kommer någon akademisk auktoritet att komma fram med svaret.
* Jag kan inte gå längre in i Mays artikel, av skäl som kan bli uppenbara när man läser den.
Publicerad onsdag, 27 maj 2026. Ändrad inom de första 30 minuterna för att fixa Anthropic-länken.












