Andersonin kulma
Miksi tekoäly rakastaa kirjoittaa majakkavahtien tarinoita?

Kun ChatGPT:tä ja muita johtavia kielimalleja pyydetään ”kirjoittamaan tarina”, ne näyttävät välttelevän tekijänoikeusrikkomuksia turvautumalla pakonomaisesti samaan pieneen ja omituiseen joukkoon majakanvartijoita, kalastajia ja kelloseppiä.
Cornellin yliopiston uusi tutkimus havaitsi, että johtavat kielimallit näyttävät olevan oudon pakkomielteisiä hyvin suppeasta kerronnallisten elementtien valikoimasta, kun mallia pyydetään vain ”kirjoittamaan tarina”. Tutkijat kehottivat neljää LLM-mallia kirjoittamaan 20 000 tarinaa ja havaitsivat, että 88 prosentissa tarinoista esiintyi ainakin yksi 11:stä hyvin täsmällisestä tunnuksesta, jotka kuuluivat luokkiin ”paikka”, ”nimi” tai ”ammatti”:

Epätodennäköisten avainsanojen esiintymät miljoonasosina tutkijoiden analysoimissa 20 000 LLM:n tuottamassa tarinassa. Lähde
Tutkimusta varten LLM-mallien tuottamassa yli 12 miljoonassa sanassa 11 useimmin toistuvaa sanaa olivat nimet elias, mara ja elara; ammatit vartija, leipuri, pormestari, kelloseppä, kalastaja, kirjastonhoitaja ja kapellimestari; sekä paikka majakka:
Testatut mallit olivat Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini ja OLMo 7b Thinking. Jokaiselle annettiin jokin viidestä pyynnöstä: ”Kirjoita tarina”; ”Kirjoita ystävällisesti tarina”; ”Kirjoita minulle tarina”; ”Kerro minulle tarina”; tai ”Kerro ystävällisesti tarina”.
Halusin nähdä, esiintyykö tutkimuksessa tunnistettu ilmiö kirjoitushetkellä saatavilla olevissa malleissa, joten kokeilin testiä itse ensin tavallisesti käyttämälläni keskitason ChatGPT-tilillä (keskustelun linkki tässä). Tuloksia ei tarvinnut valikoida: ChatGPT-5.5 tarttui heti ensimmäisellä yrityksellä juuri tutkijoiden ennustamaan aineistoon:

ChatGPT-5.5 tukee heti tutkimuksen alkuperäisiä havaintoja. Lähde
Pohdin, voisiko historiallinen konteksti tai jopa mahdollinen tietovuoto aihealueiden välillä selittää tämän ”välittömän osuman”. Kirjauduin siksi Firefoxin yksityisessä ikkunassa ilmaiselle ChatGPT-tilille, jota en ollut käyttänyt yli vuoteen, ja kokeilin uudelleen (keskustelun linkki tässä). Jos oletetaan, ettei OpenAI yhdistä eri tilejä yhteisen IP-osoitteen perusteella, ChatGPT osui jälleen napakymppiin:

Toinen ChatGPT-tili noudattaa uuden tutkimuksen kuvaamia samoja pakkomielteitä ja suppeaa nimi- ja teemavalikoimaa. ”Mira” kuuluu tekijöiden 20 yleisimmän joukkoon. Lähde
On syytä huomata, että nämä GPT-versiot olivat yhtä tasoa tutkimuksessa testattua 5.4-versiota korkeammalla.
Vaikka tutkimuksessa testattiin Claude Haikua, kokeilin Anthropicin oletusmallia Sonnet 4.6:ta enkä pettynyt. Tutut avainsanat ilmestyivät jälleen ensimmäisellä yrityksellä (keskustelun linkki tässä):

Tällä kertaa ”Mara”, toinen 11 yleisimmän vakionimi, johtaa tarinaa Claude Sonnet 4.6:n ensimmäisellä yrityksellä. Lähde
Saman kehotteen kokeileminen Claude Haiku 4.5:llä johti lähes samaan tulokseen.
En aluksi pystynyt toistamaan tekijöiden havaintoja Google Geminillä. Kun vaihdoin nimenomaan tutkimuksessa käytettyyn Gemini 3.1 Flash-Liteen, ilmiö tuli heti esiin kolmannella yritykselläni, mutta ensimmäisellä kyseisellä mallilla (linkki tässä):

Google Gemini 3.1 Flash-Lite. Lähde
Eri Gemini-malleilla tehdyt lisäkokeet tuottivat poikkeuksetta majakkateeman, joskin mukana oli 11 yleisimmän ulkopuolisia muunnelmia, kuten nimi ”Thomas” ja toisessa versiossa oma nimeni päähenkilönä.
Tutkimuksen havainnot olivat joka tapauksessa kirjoitushetkellä erittäin helppo todistaa.
Majakat luonnossa
Suuret mielet ajattelevat samalla tavoin: ohjelmistokirjoittaja Daniel May huomautti viikkoa ennen uuden tutkimuksen julkaisua tutkijoiden löytämän Elias– ja majakanvartija-troopin yhteensattumasta*, jonka hän oli ilmeisesti huomannut sattumalta. Hän testasi kahdeksaa Gemini-, DeepSeek-, Qwen- ja Gemma-versiota ja havaitsi niiden tuottavan majakka-meemejä sekä ”Elias Thornen” päähenkilöksi*. Tämä ensimmäinen löytö ei kuitenkaan ulottunut uuden tutkimuksen kuvaamaan laajempaan sitkeiden sisältöteemojen joukkoon.
Halusin tietää, olivatko nämä toistuvat teemat, nimet ja paikat koskaan karanneet keskustelujen ulkopuolelle. Hain Googlella joitakin 11 yleisimmästä avainsanasta ja teemasta ja löysin huomattavan määrän julkaisuja, jotka näyttivät kanavoineen niitä:

Kolme esimerkkiä meemistä tuotoksissa. Lähdelinkit ovat alla.
May oli tunnistanut pidemmän Elias Thorne -nimen pelkän ”Eliaksen” sijasta sitkeäksi LLM-meemiksi ja julkaissut Amazonista kuvakaappauksia, joissa nimeä oli ilmeisesti käytetty monenlaisten kirjojen, myös lääketieteellisten teosten, tekijänimenä.
Minä puolestani etsin ja löysin sisältöä, jossa näytti käytetyn LLM:n sitkeitä teemoja. Esimerkkejä olivat tarinan sisältävä X-julkaisu (arkistoversio tässä), kaunokirjallinen teos (arkistoversio tässä) ja YouTubessa julkaistu kerrottu tarina (arkisto tässä). Tutkittavaa olisi ollut paljon enemmän, mutta aika ei riittänyt.
Mieltymys menneisyyteen
Siinä olivat satunnainen havainnointi ja onnekkaat löydöt. Koulutusdatasta ei ole vielä löytynyt yhtä ”taika-asiakirjaa”, jossa esiintyisivät kaikki tai useimmat sitkeistä piirteistä. Kahden Cornellin yliopiston tutkijan uuden tutkimuksen Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories tekijät kuitenkin arvelevat, että tekoälykehityksen tekijänoikeussuodattimet saattavat rajata LLM-mallien kaunokirjallisen tuotoksen tekijänoikeudesta vapautuneeseen aineistoon.
Tekijät toteavat:
”Havaitsemme, ettei ’Elias majakassa’ -tarinoiden hallitsevaa asemaa voida selittää niiden yleisyydellä koulutusta edeltävässä tai sen jälkeisessä datassa. Arvelemme, että malleja opetetaan kohdistuksen aikana välttämään viittauksia tekijänoikeudella suojattuihin hahmoihin ja aikuisviihteeseen, mutta jätämme kysymyksen myöhemmän tutkimuksen aiheeksi.”
| Luokka | Tunnus | Oma aineisto | Kirjallisuus | Ennen: tietokirjallisuus | Ennen: kaunokirjallisuus | Jälkeen: tietokirjallisuus | Jälkeen: kaunokirjallisuus |
|---|---|---|---|---|---|---|---|
| Nimi | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| Nimi | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| Nimi | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| Ammatti | keeper | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| Ammatti | baker | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| Ammatti | mayor | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| Ammatti | clockmaker | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| Ammatti | fisherman | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| Ammatti | librarian | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| Ammatti | conductor | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| Paikka | lighthouse | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
Vertailutaulukko näyttää, kuinka usein tekoälyn luomien tarinoiden toistuvat sanat esiintyivät julkaistussa kirjallisuudessa, verkkofiktiossa ja koulutuksen jälkeisissä aineistoissa. ”Elias” ja ”majakka” esiintyivät chatbotin kirjoittamassa fiktiossa paljon useammin.
Tutkimuksen tekijät havaitsivat, että korostetut 11 sanaa esiintyvät 88 prosentissa 20 000 tuotetusta tarinasta ja että ”mallien välillä on vain vähän eroa”. He painottavat sanojen olevan harvinaisia julkaistussa englanninkielisessä kirjallisuudessa ja katsovat, että koulutuksen jälkeinen data—mallien ehdollistamiseen ja ”hyväksyttävään” käyttöön kohdistamiseen tarkoitettu aineisto—voi hyvinkin olla vastuussa.
Tutkimuksessa todetaan:
”Alla esitetty tyypillinen esimerkki nostaa esiin kolme lähes kaikille 20 000 tarinalle yhteistä elementtiä: paikan (19 864 tarinaa), henkilön nimen (19 864 tarinaa) ja ammatin (15 807 tarinaa).”
”Tässä tarinassa tietty paikka (’majakka’), nimi (’Elias’) ja ammatti (’vartija’) esiintyvät jonakin yhdistelmänä 66,6 prosentissa kaikista tuotetuista tarinoista. Myös valo on yleinen teema: 56 prosenttia Clauden tuottamista tarinoista on nimeltään ’Majakanvartijan salaisuus’, ja sana ’valo’ esiintyy 16 784 tarinassa keskimäärin 3,2 kertaa tarinaa kohden.”

Tutkimuksen mukaan Google Gemini 3.1 Flash-Lite kirjoitti tämän esimerkin vastauksena kehotteeseen ”Kirjoita tarina”.
On syytä huomata, että tutkimuksen tekijät tunnistavat kaikissa johdetuissa avainsanoissa ja nimissä nostalgisen tai atavistisen suuntauksen.
Piirteiden jäljittäminen
Sen selvittämiseksi, voidaanko toistuvat ”majakka”-tarinat selittää tavallisella altistumisella fiktiolle, mallien suosimia toistuvia sanoja verrattiin useisiin suuriin englanninkielisiin korpuksiin. Nykykirjallisuutta tutkittiin CONLIT-aineistolla, joka sisältää 2 700 vuosina 2007–2021 julkaistua englanninkielistä romaania 12 lajityypistä, yhteensä noin 287 miljoonaa sanaa.
”Elias” esiintyi tuotetuissa tarinoissa noin 900 kertaa useammin kuin julkaistussa fiktiossa. Redditin /r/writingprompts-yhteisön harrastajafiktio tuotti samankaltaisia esiintymistiheyksiä, joten ilmiö ei heijasta myöskään ihmisten yleisempiä kerrontatapoja.
Sama kuvio säilyi koulutusta edeltävää dataa tarkasteltaessa. Tutkijat käyttivät avointa OLMo 3 -korpusta, joka sisältää noin 3,89 miljardia pääosin ihmisten kirjoittamaa, osin Common Crawlista peräisin olevaa asiakirjaa. Toistuvia ”ydinsanoja” ei juuri esiintynyt lainkaan.
Koska suuri osa OLMo 3 -korpuksesta on tietotekstiä, fiktion luokittelija rakennettiin GPT-OSS 20b -annotaatioilla ja 200 000 tasapainotetulla näytteellä koulutetulla FastText-mallilla. Vaikka aineisto rajattiin nimenomaan fiktioon, ”Elaran” kaltaisia sanoja esiintyi yhä häviävän vähän tekoälyn tuottamiin tarinoihin verrattuna. Miksi ne sitten hallitsevat kaikkein alkeellisimmalla tasolla, kun LLM:ää käsketään kirjoittamaan fiktiota?
Tekijät toteavat:
”Jos ydinsanat eivät ole yleisiä verkkodatassa, yksi jäljellä oleva lähde olisi koulutuksen jälkeinen data. Havaitsemme kuitenkin, että OLMo:n koulutuksen jälkeisessä datassa tunnuksiamme esiintyy harvemmin kuin CONLITissa.”
OLMo 3:n koulutuksen jälkeisten aineistojen 78 958 tarinassa ”Elias” esiintyi tekijöiden mukaan 52,7 kertaa miljoonaa sanaa kohden, kun CONLITissa vastaava luku oli 2,7. Tutkimuksessa tarkastelluissa tuotetuissa tarinoissa määrä nousi kuitenkin 2 428 esiintymään miljoonaa sanaa kohden.
Toistuvien ”ydintarinoiden” alkuperän selvittämiseksi jokaiselle OLMo 3:n koulutuksen jälkeisen datan tarinalle annettiin pisteet yhden tai useamman ydintunnuksen, kuten Elaran tai Maran, esiintymisestä. Suurimman osan odotettiin löytyvän valvotun hienosäädön (SFT) aineistoista, sillä WildChat ja siihen liittyvät lähteet toivat OLMo 3:een 59 266 tarinaa.
Vain 1 803 tarinaa sisälsi ydintermejä, kun taas DPO:hon ja vahvistusoppimiseen käytetyissä aineistoissa pitoisuudet olivat suurempia.
Kaiken kaikkiaan toistuva ydinsanasto jäljitettiin vain 3 053 tarinaan eli 3,8 prosenttiin kaikista tarkastelluista koulutuksen jälkeisistä tarinoista. Tilastollisesti ei ole mahdollista, että näin pieni korpuksen osajoukko päätyisi hallitsemaan tuotoksia esitetyllä tavalla.
Tutkimus päättelee:
”Kun nykyisille huippumalleille annetaan vähän ohjeita, ne kirjoittavat tarinoita käyttäen suppeaa nimi-, paikka- ja ammattivalikoimaa. Toistuviin hahmoihin kuuluu majakanvartija Elias. Elias on epätavallinen: nimi on harvinainen kirjallisuudessa, verkkodatassa ja jopa koulutuksen jälkeisessä datassa.”
Johtopäätös
Koska ei ole yhtä kirjallista teosta tai edes sarjaa, jossa esiintyisivät tekijöiden tunnistamat 11 yleisintä sanaa, ei ole lainkaan selvää, miten juuri tämä sanajoukko on kasautunut, liittynyt itseensä ja päätynyt useiden suurten kielimallien alimmille tasoille huolimatta niiden erilaisista koulutusdatoista ja lähestymistavoista.
Vaikka tutkijoiden väite tekijänoikeussuodattimien rajoittavasta vaikutuksesta pitäisi paikkansa, koulutusdatan klassisen kirjallisuuden todellisen valtameren olisi pitänyt estää tätä omituista vanhanaikaisten sanojen joukkoa hallitsemasta määrittelemättömän ”kirjoita”-kehotteen tuotosta.
Teoria kuitenkin olettaa, että valtavat määrät klassista kirjallisuutta olisivat ylipäätään sisältyneet koulutukseen. Se on epätodennäköistä, sillä tavoitteena eivät ole Dickens-jäljitelmiä suoltavat mallit vaan nykysanastoa käsittelevät ja nykyisiin liiketoimintatarpeisiin sopivat mallit. Jo esiteollisen kirjallisuuden valtava määrä estäisi kaiken sisällyttämisen.
Jos joka tapauksessa olisi yksi selkeä kertomus, jossa esiintyisi vaihteleva yhdistelmä tekijöiden mainitsemia ”pakkomielteisiä” piirteitä, se olisi luultavasti helpompi löytää. Tekijät eivät itse löytäneet sitä, eivätkä tekoälyä edeltävää aikaa koskevat tavalliset haut tuo esiin sopivaa ehdokasta. Jos ”majakkasyndrooma” saa yhtä paljon huonoa mainetta kuin tekoälyn ajatusviivat, ehkä joku tutkija esittää vastauksen.
* En voi käsitellä Mayn artikkelia tätä pidemmälle syistä, jotka saattavat käydä ilmeisiksi sitä luettaessa.
Julkaistu ensimmäisen kerran keskiviikkona 27. toukokuuta 2026. Muokattu ensimmäisten 30 minuutin aikana Anthropic-linkin korjaamiseksi.












