Andersonin kulma

AI viittaa samoihin papereihin yhä uudelleen – aivan kuin ihmiset

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT ja muut tekoälykirjoitustyökalut saattavat hiljaa muuttaa tieteen suosituimmuuskilpailuksi, ohjaten tutkijoita toistuvasti samoihin papereihin samalla kun ne jättävät huomiotta uudet ja omaperäiset teokset, jotka voisivat todellisesti edistää alaa.

 

Monokulttuuri, frekvenssin ja tilastojen näkökulmasta, on tilanne, jossa sama rajoitettu joukko lähteitä tai resursseja toistuu yhä uudelleen, tukahduttaen uudet äänet ja tuoreet näkökulmat: sama rajoitettu joukko kappaleita radiolähetyksissä; sama kirjoittajien ja kirjojen ryhmä lentokenttähyllyissä; ja sama rajoitettu valikoima hedelmiä ja vihanneksia supermarketeissa:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Kyllä, meillä on nämä banaanit – ja vain nämä banaanit. Hedelmä- ja vihanneshomogeenisuus länsimaisissa ruokaketjuissa sivuuttaa satoja muita lajivaihtoehtoja, koska eri tuotanto- ja kuljetusketjut ovat liian kalliita teollistaa monipuolisille hedelmä- tai vihanneslajeille. Lähde

Tämä tapahtuu myös uusissa tieteellisissä tutkimuksissa esiintyvissä viitteissä, joissa tutkijat – ehkä laiskasti – turvautuvat ‘luotettavaan’ lähteiden joukkoon, joka saa vauhtia ja alkaa hallita tutkimuslinjoja.

Tätä kutsutaan Matteuksen efektiksi – sosiologiseksi teoriaksi, jonka mukaan vallitsevat aina hyötyvät; oireyhtymä on verrattu Matteuksen 13:12 lupaukseen, jossa todetaan ‘Kenellä on, sille annetaan enemmän, ja hänellä on yltäkylläisyyttä. Kenellä ei ole, jopa se, mitä hänellä on, otetaan häneltä’.

Sisäpiirissä

Yksi suurimmista toiveista tekoälyä hyödyntävässä tutkimuksessa on ollut, että uudet koneoppimismenetelmät voisivat murtautua Matteuksen efektin – myös suosioharhan – ulkopuolelle ja alkaa viitata vähemmän tunnettuihin teoksiin, jotka saattavat olla terävämpiä tai paremmin osuvia käsiteltävään aiheeseen.

Kuitenkin AI:n koulutusmenetelmien tapa tulkita aineistoja ei koskaan antanut hyvää syytä tähän optimismiin; ja on toistuvasti havaittu, että kun AI ei keksii viitteitä suoraan – tähän mennessä krooninen ongelma – se todellakin vahvistaa Matteuksen efektiä, aivan kuten ihmisetkin – vaikka ehkä eri syistä.

Koulutuksen aikana malli oppii antamaan korkean sijoituksen eniten siteerattuille (tai ‘useimmin toistetuilla’) papereille koulutusjoukossa, koska koulutusmenetelmät on suunniteltu poimimaan merkityksellisiä kuvioita ja hylkäämään poikkeamat ‘kohinana’ tai tilastollisina poikkeuksina.

Tässä järjestelmässä Einsteinin suhteellisuusteoria ei koskaan saisi huomiota koneelta, joka koulutuksen jälkeen kokee jo löytäneensä periaatteensa ja viitteensä, ja voi vain kevyesti säätää näkemystään hakemalla uudempiin julkaisuihin RAG-menetelmällä tai muilla tavoilla, jotka laajentavat mallin ulottuvuutta sen koulutetun matriisin ulkopuolelle.

Ongelma on, että se ei anna tunnustusta tällaisille uusille teoksille samalla tavalla kuin ‘vanhoille suosikeille’, joita se jo tuntee, tai ollenkaan, koska sen tilastolliset vinoumat ovat jo syvästi juurtuneet.

Näin ollen AI ei todellisuudessa tarkkaile eikä jäljittele ihmiskäyttäytymistä, kun se vahvistaa Matteuksen efektiä – se vain laskee, kuinka monta kertaa tutkijat laiskasti turvautuvat samoihin vanhoihin papereihin, ja asettaa ne korkealle. Tässä mielessä viitteiden toistuvuuden ongelma liittyy haasteeseen valita aidosti mielenkiintoinen tieteellinen artikkeli kasvavasta AI‑tutkimusjulkaisujen myrskystä, sillä vahvimmat työt usein omaavat heikoimman signaalin.

Diagnosoida Monokulttuuri

Tämä ongelma käsitellään yhdessä mielenkiintoisessa uudessa artikkelissa Yhdysvalloista, jonka otsikko on Kun AI kirjoittaa, ketä siteerataan? Todisteita viite‑monokulttuurista kielimalleissa. Uusi työ – yhteistyössä Texasin yliopiston Austinin kampuksella, Stevens Institute of Technologyin, Washington University St. Louisin, Rice Universityn ja Notre Damen yliopistojen kanssa – pyrkii lopullisesti todistamaan viite‑monokulttuurin olemassaolon koneoppimisessa, jotta sen muuttujia voitaisiin mahdollisesti käsitellä suoraan tulevaisuudessa, samoin kuin itse ongelmaa.

Testeissä tekijät havaitsivat, että yksitoista OpenAI:n, Googlen ja Anthropicin mallia toistuvasti suosivat samaa pientä ryhmää papereita – vaikka ilmeiset suosio‑signaalit oli poistettu.

Testaamiseksi 120 todellista artikkelia riisuttiin viitteiden määrä ja julkaisupaikka, tekijänimet korvattiin, ja julkaisuvuodet arvottiin satunnaisesti. Satunnaiset kolmenkymmenen artikkelin joukot esiteltiin kullekin mallille, jonka sallittiin siteerata enintään kymmenen.

Kahdeksan alan asiantuntijaa sai samat sokeat artikkelit, mutta he eivät päätyneet samoihin suosikkeihin kuin tekoälyt, mikä osoitti, että vinouma oli spesifinen AI‑malleille eikä itse papereille:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency.

Uudesta artikkelista, testitulokset, jotka vertailevat AI‑mallien ja ihmisen asiantuntijoiden viitteiden valintoja. Kaikissa yksitoista mallissa viitteet keskittyivät pienempään papereiden ryhmään, kun taas joitakin papereita ohitettiin kokonaan toistuvasti. Ihmisasiantuntijat eivät osoittaneet kumpaakaan taipumusta. Lähde

Samat paperit pysyivät suosittuina, vaikka malleja pyydettiin valitsemaan vain viitteitä, mikä osoitti, että itse arvostelun kirjoittaminen ei aiheuttanut vinoumaa.

Koe laajennettiin sitten yhdentoista kierrokseen, joihin jokaisen kierroksen jälkeen lisättiin 120 AI‑kirjoitettua artikkelia, jotta testattaisiin, mitä tapahtuu, kun nämä jaetut mieltymykset toimivat kasvavassa AI‑tuotetun tutkimuksen poolissa.

Kun AI‑kirjoitettuja artikkeleita lisättiin, mallit yhä enemmän keskittivät viitteensä alkuperäisten ihmisen kirjoittamien papereiden vähenevään joukkoon.

‘Kun kielimallit siirtyvät proosan luonnostelusta kirjallisuushakurobottien ajamiseen työkalukutsujen avulla, keinotekoiset viitteet ovat yhä helpompia havaita ja rajoittaa.

‘Vaikeampi epäonnistuminen alkaa sen jälkeen, kun jokainen ehdokas on todellinen: eri mallit voivat silti valita saman kapean alajoukon, tuottaen viite‑monokulttuuria ilman, että yksikään viite olisi väärä.’

Ratkaisuehdotuksena artikkeli väittää, että pelkkä eri toimittajien mallien sekoittaminen tai papereille antaminen tasapuolinen näkyvyys ei riitä, koska suuri osa mieltymyksestä on yhteinen malleille. Sen sijaan perustavanlaatuinen suosimus tiettyihin papereihin tulisi muuttaa – mahdollisesti antamalla laiminlyödyille papereille tarkoituksellisesti suurempi näkyvyys. Tekijät kuitenkin korostavat, että tätä lähestymistapaa ei ole vielä testattu.

Testausmenetelmät

Vertailuarvio rakennettiin 120 todellisesta tiedon‑tiivistysartikkelista, jotka kerättiin arXivista ja julkaistiin vuosina 2015–2022. Jokaisessa oli 50–500 viitettä keräysajankohtana, mikä valittiin sulkemaan pois sekä tuntemattomat että poikkeuksellisen vaikutusvaltaiset teokset.

Koe aloitettiin valitsemalla satunnaisesti kolmekymmentä artikkelia saatavilla olevasta kokoelmasta, piilottamalla tekijänimet, julkaisuvuodet ja viitemäärät. Jokainen malli tuotti lyhyen arvostelun tai position paperin, jossa se siteerasi enintään kymmenen artikkelia, ja nämä valinnat vertailtiin satunnaisiin valintoihin samasta aineistosta:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI‑written papers to the next round's collection.

Kaavio testausmenetelmälle, jolla viite‑mieltymyksiä tutkittiin. Kolmekymmentä satunnaisesti valittua artikkelia näytettiin mallille, jonka tunnistetiedot oli piilotettu, jonka jälkeen se sai siteerata enintään kymmenen. Sen valinnat vertailtiin satunnaiseen valintaan, kun jokainen kierros lisäsi 120 AI‑kirjoitettua artikkelia seuraavan kierroksen kokoelmaan.

Laajennetussa kokeessa 120 uutta artikkelia lisättiin kokoelmaan jokaisen kierroksen jälkeen, kasvattaen vähitellen AI‑kirjoitetun tutkimuksen osuutta.

Alustavassa testauksessa mallit taipuisivat siteeraamaan suurimman osan niille näytetyistä papereista, yleensä valiten 22–27 kymmenestästäkolmekymmentä. Tutkijat asettivat siksi pääkokeelle enimmäisrajaksi kymmenen viitettä, pakottaen mallit tekemään valikoivampia valintoja.

Alla on yhteenveto kokeellisen asetelman tuloksista:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Kokeellinen asetelma viite‑mieltymysten testaamiseen. Tutkimus alkoi 120 todellisella artikkelilla ja testasi yksitoista mallia kolmelta toimittajalta käyttäen satunnaisia 30 artikkelin ryhmiä ja enintään kymmentä viitettä. Myöhemmät kierrokset lisäsivät AI‑luotuja papereita, laajentaen kokoelman 1 440 artikkeliin.

Alkuperäisessä kokeessa käytettiin yksitoista mallia kolmelta suurimmalta tarjoajalta: OpenAI:n edustivat GPT-5, GPT-5 mini, GPT-4.1 ja GPT-4.1 mini; Googlen Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro ja Gemini 3.1 Flash‑Lite; ja Anthropicin Claude Opus 4.8, Claude Sonnet 4.6 ja Claude Haiku 4.5.

Alla esitettyjen testitulosten perusteella näemme, kuinka paljon kukin malli keskittyi viitteissään pieneen papereiden ryhmään; kuinka monta paperia se kokonaan jätti huomiotta; ja kuinka johdonmukaisesti se teki samat valinnat, kun koe toistettiin:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and

Testitulokset, jotka osoittavat, kuinka voimakkaasti kukin malli keskittyi viitteissään tiettyihin papereihin ja kuinka monta paperia se kokonaan jätti huomiotta. ‘Top‑10 % osuus’ näyttää, kuinka monta viitettä meni 12 suosituimmalle paperille, kun taas ‘HHI’ mittaa, kuinka keskittyneet viitteet olivat kokonaisuudessaan. ‘Luotettavuus’ näyttää, kuinka johdonmukaisesti kukin malli suosii samoja papereita testeissä, ja ρ näyttää, kuinka samankaltaisia nämä mieltymykset olivat mallien välillä. ‘Matched null’ -rivi osoittaa, mitä odotettaisiin, jos paperit valittaisiin satunnaisesti.

Mitä mallit oikeasti suosivat?

Suosiminen osoittautui olevan selvästi paperien sisällön aiheuttamaa. Esimerkiksi GPT-5 mini:n osalta noin 90 % vaihtelusta, mikä malli suosii papereita, selittyi sisällöllä, eikä tekijäjärjestyksellä, generaatiokohinalla tai kunkin paperin keksityllä metadatalla. Sama ‘dominoiva sisältö’ -vaikutus toistui myös GPT-4.1 minillä.

Suosimiskartta (katso alla) pysyi lähes muuttumattomana, kun otsikot ja tiivistelmät muokattiin merkittävästi säilyttäen merkityksen. Neljän onnistuneen parafraasikokeen aikana saatiin korrelaatioita 0,95–0,99, vaikka käytettiin kolmen toimittajan eri malleja uudelleenkirjoitukseen.

Muutoksia suosimiskartassa havaittiin vain, kun perimmäinen merkitys muutettiin mitattavasti:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Testitulokset, jotka vertaavat viite‑mieltymyksiä kaikkien yksitoista mallin välillä. Luvut osoittavat, kuinka tarkasti kukin mallipari suosii samoja papereita; suuremmat arvot tarkoittavat suurempaa yhteneväisyyttä. Mallien ja toimittajien eroista huolimatta ryhmän sisällä havaittiin laajasti samankaltaisia mieltymyksiä.

Mallit vaikuttavat siis reagoivan ensisijaisesti semanttiseen sisältöön eikä tiettyyn sanamuotoon. Kuitenkin syvällistä syytä niiden vahvalle yhteneväisyydelle ei pystytty varmuudella määrittämään.

On mahdollista, että yhteinen viite‑konsensus on sisällytetty koulutukseen. Toinen mahdollisuus on, että samanlaiset arvostelut siitä, mikä on ‘siteerattava’ paperi, saavutetaan itsenäisesti.

Näin ollen yhteinen suosiminen on todistettu, mutta sen lopullinen alkuperä on edelleen tuntematon.

Tekijät ehdottavat, että AI:n laajamittainen käyttö tutkimuksessa saattaa kaventaa huomion kohteena olevan työn kirjoa, koska eri mallit suosivat monia samoja papereita; ja kun AI‑luotu kirjallisuus kasvaa, nämä yhteiset mieltymykset voivat vahvistua toistuvien viitteiden kautta, tehden vähemmän suosituista tutkimuksista yhä vaikeampaa löytää. Viitteiden monimuotoisuus ja viitteiden keskittymisen seuranta ehdotetaan siksi mahdollisina turvatoimina.

Tutkimuksen vertailuarvio rekursiivisesta viitteiden keskittymistä on nyt saatavilla GitHubissa.

Johtopäätös

Mielipide Joku, joka lukee viikoittain valtavan määrän AI‑tutkimuspapereita, on nähnyt ‘viite‑aallot’ tulla ja mennä. Yksi ikuisesti pysyvä perusta on Googlen Attention Is All You Need, alkuperäinen Transformer‑paperi, jonka on nyt ilmeisesti koodattu kiinteästi julkaisupohjiin.

Toinen pitkään toistuva tekijä oli vuoden 2014 julkaisu Generative Adversarial Networks, vaikka se lopulta korvattiin suosituimmuudessa Denoising Diffusion Probabilistic Models ja muilla diffuusioon perustuvilla keskeisillä tutkimuksilla.

Lähes kaikissa tapauksissa nämä ‘toistuvat’ viitteet eivät ole väärin sinänsä; ne ovat kuitenkin usein niin laajasti kohdistettuja, etteivät ne tarjoa hyödyllistä tukea paperille, jossa niitä siteerataan; ja tässä mielessä ne edustavat jotain vastaavaa kuin ‘viitteiden pesua’ – ‘luotettavien’, mutta pääosin koristeellisten lähdeviitteiden sisällyttämistä, jotta saataisiin vähäisen vaivan vaikutelma uskottavuudesta.

 

Ensimmäisen kerran julkaistu maanantaina 24. elokuuta 2026. Korjattu 23:07 EET: lisättiin puuttuva monikko.

Alkuperäisen artikkelin lähteet: unite.ai [1] · web.archive.org [2] · link.springer.com [3] · unite.ai [4] · unite.ai [5]

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai