Andersonin kulma
Tekoäly jakaa verkkohaku kolmeen eri todellisuuteen

Uusi tutkimus osoittaa, että Google käyttää kolmea eri tietojärjestelmää omassa hakukoneessaan, ja että normaali haku, tekoäly-yhteenvetot ja Gemini suosivat eri lähteitä, luokitteluja ja sisältöjä.
Reduktionismi hallitsee. Viimeisen 12 kuukauden aikana ‘Anna minun googlata se’ -meme on korvattu uudella ‘Anna minun tiivistää se Google-haku’ -trendillä, jossa tekoäly-yhteenvetot hakutuloksissa säästävät lukijoilta vaivaa klikkaamalla hakulinkkejä (joka voi olla perustelua lähdelaitosten rahoitukselle), tiivistämällä koko hakutuloksen muutamaan generaattoriparaan.
Yksi voisi ajatella, että keskeinen tieto, joka nousee esiin, ja valinta sivustoista, joista tämä tieto haetaan, olisi suhteellisen samanlainen kaikissa kolmessa suositussa menetelmässä, joilla haetaan tietoa internetistä: perinteisessä verkkohaussa; tekoäly-yhteenvetoissa, jotka nyt johtavat useimpien verkkohakutuloksia; ja kasvavan käytön avulla LLM:iä, kuten ChatGPT:ä, web-orakkeleina (joko ulkopuolisten RAG-kutsujen kanssa tai ilman).
Kuitenkin viimeaikainen tutkimus Yhdysvalloista osoittaa, että tämä on yllättäen kaukana totuudesta; ja että jopa Googlen omassa kolmiyhteisössä – SERPS*, AI-yhteenvetojen ja suoran vuorovaikutuksen kautta Gemini LLM -sarjan kanssa – on merkittäviä ja mielenkiintoisia eroja kussakin reitissä.
Kolmiyhteiskunta
Uudessa, selkeässä ja laajassa tutkimusraportissa, joka on nimeltään How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews, kuusi New Jersey Institute of Technologyn tutkijaa kuvaavat, miten kolme hakutapaa poikkeavat toisistaan ja tarjoavat joitakin mahdollisia teorioita näille murtumille lähestymistavoissa.
Raportissa todetaan:
‘[Ensinnäkin] havaitsemme, että 51,5 %:ssa edustavista, todellisista käyttäjien kysymyksistä, tekoäly-yhteenvetot generoidaan ja näytetään orgaanisten hakutulosten yläpuolella. Kiistanalaiset kysymykset johtavat usein tekoäly-yhteenvetoon.
‘Toiseksi osoitamme, että noudatetut lähteet ovat olennaisesti erilaiset kussakin hakukoneessa (<0,2 keskimääräinen Jaccard-yhteensopivuus). Perinteinen Google-haku on merkittävästi todennäköisemmin noutaa tietoa suosituilta tai institutionaalisilta verkkosivuilta hallinnossa tai koulutuksessa, kun taas generatiiviset hakukoneet ovat merkittävästi todennäköisemmin noutaa Google-omisteisia sisältöjä.
‘Kolmanneksi havaitsemme, että verkkosivut, jotka estävät Googlen tekoäly-haalin, ovat merkittävästi vähemmän todennäköisiä päästä tekoäly-yhteenvetoihin, vaikka niillä on pääsy sisältöön.’
Koska raportti on mielenkiintoisten havaintojen kirjo, eikä se noudata tavallista lineaarista ja menettelyyn perustuvaa työkiertoa, tarkastelemme niitä tarkemmin, sekä joitakin muita sen mielenkiintoisimpia ja valaistavimpia havaintoja.
Vanha ‘Kaksi-Yksi’
Yksi monista mielenkiintoisista havainnoista tutkimuksessa osoittaa, että Googlen tekoäly-yhteenvetot ovat usein estettyjä äkillisten uutistapahtumien aikana, koska varhaisimmat ja saatavilla olevat lähteet eivät välttämättä ole täysin tarkkoja.
Tämä järjestelmä ei aina toimi: tutkijoiden mainitsemassa esimerkissä Google- tekoäly-yhteenveto nyrkkeilyottelun tuloksesta antoi voiton väärälle nyrkkeilijälle, vaikka ainoa lähde, joka ilmoitti (väärän) tuloksen, oli Facebookissa oleva satiirinen urheilusyöte:

Yksi syistä, miksi Googlen tekoäly-yhteenvetot välttävät aikakriittisiä yhteenvetoja, on se, että varhainen tieto voi olla epätäydellistä tai täysin virheellistä. Tässä tapauksessa nyrkkeilijä Jake Paul hävisi ottelun. Lähde
Tutkijat toteavat, että tekoäly-yhteenvetot ovat todennäköisemmin generoituja, kun tapahtuma on vähintään viisi päivää vanha, mikä laukaisee tämän poikkeuksen – mutta kuitenkin sellaisen, jonka tutkijat pystyivät helposti kutsumaan esiin.
Tehtyjen tutkimusten mukaan tekoäly-yhteenvetot ovat todennäköisemmin generoituja, kun kysymys on suljettu kysymysmerkillä, ja että kysymyksen tarkoitus on tekijä, joka vaikuttaa siihen, tuotetaanko tekoäly-yhteenveto:

Prosenttiosuus tapauksista, joissa tekoäly-hakuyhteenveto tuotettiin yhdessä tutkijoiden testikierroksessa. Tässä ‘tietopohjainen’ tarkoittaa suoria kysymyksiä, jotka tuottavat tekoäly-yhteenvetoja enemmän kuin mikään muu vuorovaikutusmuoto.
Lisäksi raportissa väitetään, että pitemmät kysymykset ovat todennäköisemmin tuottavat tekoäly-yhteenvetoa suoran hakutuloksen sijaan, vaikka tutkijat eivät vielä esitä teoriaa, joka selittäisi tämän.
Jakautunut valtakunta
Ehkä yllättävin yleinen tulos uudesta tutkimuksesta on, että on suhteellisen vähän yhteistä tuloksia laadun/typen välillä Googlen (mainittujen) kolmen hakualustan välillä.
Raportti toistuvasti osoittaa, että normaali Google-haku, tekoäly-yhteenvetot ja Gemini (LLM) noutavat hämmästyttävän erilaisia lähteitä samalle kysymykselle, yhteensopivuuspisteet ovat niin alhaiset, että ne viittaavat kolmeen kilpailevaan hakulogiikkaan yhden yhtiön sisällä, kun taas käyttäjät voivat olettaa, että Googlella on yksi virallinen indeksi ja yksi luokittelufilosofia:

Jopa Googlen oman ekosysteemin sisällä yhteensopivuus perinteisen Haun, tekoäly-yhteenvetojen ja Geminin välillä osoittautui yllättävän pieneksi, ja sama kysymys tuotti usein erilaisia lähdeluetteloa riippuen siitä, kumpi Google-järjestelmä käsittelee pyynnön. Tässä vertailussa näytämme, miten lähellä toisiaan nämä kolme järjestelmää olivat tuhansien hakukysymysten yli, kaupasta ja debatista paikallisiin hakuihin ja yleistietoon, matalammat pisteet osoittavat vähemmän yhteensopivuutta valituista lähteistä.
Tutkijat toteavat myös:
‘[Yllä oleva taulukko] esittää keskimääräisen samankaltaisuuden lähdeluetteloiden välillä, jotka palautetaan AIO: n, Geminin ja perinteisen SERP: n avulla kunkin kysymyksen kohdalla benchmark-aineistossa.
‘Pääasiallinen johtopäätös on, että riippumatta kysymysosumasta ja siitä, mitä kahta hakukonetta verrataan, palautetut luettelot ovat erilaisia, vaikka kaikki kolme on kehittänyt Google.’
Tutkijat toteavat, että mikään hakutapa ei osoittanut sijoitusviiteen tasapainoa yli 0,27, mikä on erittäin alhainen piste. He toteavat, että Amazon Retail ja paikalliset kyselyt (ts. ‘kauppoja lähelläni’) olivat vähiten samankaltaisia hakutavoilla.
He selittävät alhaisen yhteensopivuuden ‘hakukoneiden välisen epäjohdonmukaisuuden’ kanssa, ja toteavat, että satunnaisuus tai mikään muu ilmeinen tekijä ei voida tehdä vastuulliseksi tästä epätahtiin.
Yksi intuitiivinen selitys on, että koulutusdatakohteet määritellään sijoituksessa eri tavoin kuin menetelmät, joita Google on kehittänyt PageRankille ja sen seuraajille viimeisen kahden vuosikymmenen aikana. Lisäksi, jos Googlen hakualgoritmi on salainen agenda, tämäntapainen häiriö tai ‘pelin pelaaminen’ on paljon vaikeampi toteuttaa diffuusiopohjaisissa tekoälyjärjestelmissä, kuten Gemini (jopa suodattimien, järjestelmäkutsujen ja muiden rajoitusten kautta, joita asetetaan kaupallisiin malleihin).
Itsepalvelu..?
Tiettyjä verkkosivustoja tai verkkosivustojen luokkia on vaikuttanut tekoäly-yhteenvetojen ja LLM-pohjaisen hakutoiminnon kasvavan käytön aiheuttamaan perinteiseen hakutilaan – sekä haitallisesti että myönteisesti, riippuen tapauksesta:

Verrattuna perinteiseen Google-hakuun, tekoäly-yhteenvetot ja Gemini vähensivät useiden suurten verkkosivustojen mainintoja, samalla kun ne lisäsivät näkyvyyttä pienemmälle joukolle suosituille verkkosivuille. YouTube oli yksi suurimmista hyötyjistä molemmissa järjestelmissä, kun taas Reddit, Wikipedia, Facebook ja useat institutionaaliset lähteet näkyivät vähemmän tekoäly-pohjaisissa hakutuloksissa.
Tutkijat toteavat, että jotkut odottamattomat suositukset nousevat esiin kolmen menetelmän vertaillessa:
‘Meillä on kolme pääasiallista johtopäätöstä [yllä olevasta kaaviossa]. Ensinnäkin suuret ja tunnetut verkkosivustot ovat eniten vaikuttaneita (sekä myönteisesti että kielteisesti). Tämä on luonnollista, koska suuret verkkosivustot ovat maineeltaan ja sisällöltään monipuolisia, jotta ne voisivat olla merkityksellisiä monille eri kysymyksille.
‘Toiseksi valtaosa näistä verkkosivustoista saa vähemmän yhteensä ja vähemmän kolmea ensimmäistä mainintaa generatiivisilla hakukoneilla (merkitty punaisilla palkkeilla ja negatiivisilla numeroilla [yllä olevassa kaaviossa]). Tämä viittaa siihen, että generatiivinen haku suosii tietoa enemmän nišistä lähteistä kuin perinteiset hakukoneet.
‘Kolmanneksi Googlen tekoäly-yhteenvetot suosivat Google-verkkosivuja (ts. google.com- ja youtube.com-verkkotunnukset).
‘Gemini suosii myös YouTubea verrattuna perinteiseen Google-hakuun, mutta absoluuttinen ero on pienempi.’
Mikä ‘estäjiä’..?
Tutkimus osoitti myös, että kustantajat, jotka estävät Googlen tekoäly-verkkohaulin – automaattisen verkkohaulin, joka poimii tietoa verkkosivustolta, ellei sinne ole asetettu robots.txt -tiedostoa – eivät yleensä näy tekoäly-yhteenvetoissa.
Tämä voi vaikuttaa ilmiselvästi itse aiheutetulta haavalta, mutta itse asiassa Google on julkaissut julkilausuman, jonka mukaan sisältöä verkkosivuilta, jotka estävät tekoäly-haulia, ei estetä näytettäväksi tekoäly-yhteenvetoissa; sen sijaan kustantajat eivät vain saa tietojaan poimittua, kuratoitua ja suoritettua seuraavassa tekoäly-koulutuksessa Geminille ja muille Googlen tekoäly-hankkeille.
Kuitenkin tämä ei ollut se johtopäätös, jonka uuden tutkimuksen tutkijat tulivat, vaan he löysivät sen sijaan, että suositut tekoäly-kieltävät kustantajat olivat hyvin harvoin mainittuina Geminissä, joko LLM- tai yksinkertaisemmassa hakutuloksessa. Tutkimuksessa mainitut ‘tehokkaasti estetyt’ kustantajat olivat NYTimes, CNN, BBC, ScienceDirect, Reuters, Wiley, Nature, ESPN, Business Insider, CNBC, NPR, WIRED, USA Today, NBC News, Genius, National Geographic, The Conversation, U.S. News & World Report, Scientific American, Consumer Reports ja STAT.

Jotkut robots.txt-tekoäly-haun estot, jotka yllä mainituilla kustantajilla on. Onko se johtanut laajempaan Google-kieltoon?
Tutkijat toteavat:
‘Analyyseissamme eniten vaikuttaneista verkkosivustoista havaitsemme, että 21 suosituinta kustantajaa (joita haetaan vähintään 20 eri kysymyksellä sekä Google-haula ja tekoäly-yhteenveto) ei koskaan mainittu Geminissä.
‘Jotkut suositut sosiaalisen median (Facebook, Instagram, Tiktok) ja arvostelusivustot (IMDb, Yelp, Tripadvisor) eivät myöskään saaneet mainintoja Geminissä. Lisätutkimuksissa havaittiin, että kaikki nämä verkkosivustot estävät Google-Extended-haulia robots.txt-tiedostoissaan.’
Jos tämä löytö osoittautuu vahvistetuksi muualla ja pysyväksi, voisi spekuloida, että nämä yritykset ovat mahdollisesti painostettuina Googlelta yhteistyöhön sen tekoäly-toiminnan kanssa osittaisen poistamisen kautta. Yleisesti ottaen tulokset vaikuttavat pinnallisesti ‘katkerilta’; kuitenkin tutkimuksen löydökset ovat enemmän kaaosta kuin etukäteen suunniteltua; siksi ainoa järkevä kommentti, jonka voidaan asettaa, on, että nämä tulokset näyttävät pinnallisesti ‘katkerilta’, riippumatta siitä, mikä niiden todellinen syy on.
Johtopäätös
Mielipide Tämä on selkeäpäinen zip-pommi -raportti, jonka vain kymmenen ensisijaisen sivun avautuminen johtaa lähes ylivoimaiseen löytöjen vyöryyn. Koska meillä on ollut aikaa peitata vain pientä osaa näistä, suosittelen lähde-PDF:ää jopa satunnaiselle lukijalle (harvinainen tapahtuma).
Vaikka ‘keltainen’ asenne voi heittää monia negatiivisia tulkintoja tutkijoiden löytöihin, työ on ehkä parhaiten kohdeltava indikaattorina globaalin teknologiajohtajan pyrkimyksestä saada ja ylläpitää johtavaa asemaa tekoäly-pohjaisessa haussa, käyttäen hyvin kontrastisia alustoja, jotka kehittyivät eri olosuhteissa ja eri aikakausina.
Vaikka tutkimuksessa tarkastellaan kolmea hakutapaa, todellinen kiista on perinteisten hakutulosten ja tekoäly-pohjaisten valintamenetelmien välillä, jotka hallitsevat datakuratointia.
Tehty kuin vuonna 1999
Ennen Googlen aikakautta oli mahdollista ‘pelata’ hakutuloksia pelkästään määrän kautta, ja tällä tavoin voitiin usein saavuttaa etusivun hakutulokset vähällä (usein automaattisella) vaivalla. Tämä ‘määräpeli’ lopetettiin tehokkaasti noin vuonna 2002 Googlen monimutkaisemman ja salaisemman hakusijoitusalgoritmin avulla. Mutta koska panokset olivat merkittäviä, suurella määrällä ja heikkolaatuista sisältöä ei poistunut merkittävästi;
Siksi kun hyperskaalaiset kokoelmat, kuten Common Crawl, loivat modernin tekoäly-vallankumouksen perustan, data-keskeisyys oli kohtalonomaista suodattaa ja luokitella tulevaa data-laatu, ja (paljon vähemmän todennäköisesti) se, kuinka paljon rahaa oli saatavilla maksamaan ihmisten luokittelua.
Paljon huonoa tai heikkolaatuista dataa oli näissä suurissa ja tarkoituksettomiin kokoelmissa; dataa, joka ei välttämättä sisältänyt alastomuutta, kirosanoja, rasistisia kliseitä tai muita helposti suodattettavia asioita koulutusdatasta – mutta joka oli silti itsepalvelua ja runsasta, samoin kuin internet-haun tulokset noin vuosina 1999-2001.
Koska nämä data-induktio-prosessit eivät ole vieläkään hyviä, on hyvin vaikea jopa Googlen tekoälylle toimia liiketoiminnallisesti, koska Geminin PageRank-tyyppiset päätökset määräytyvät ei Googlen politiikkainsinöörien toimesta, vaan epätäydellisen ymmärryksen kautta, miten hyperskaalainen data muuttuu data-jakaumiin ja latenttiin upottamiseen tekoälymallin koulutuksen aikana.
* Hakutulossivut.
† Tutkijoiden korostus, ei minun. Kuitenkin olen korvannut lihavoinnin lihavoimalla, koska lihavointi ei toimi hyvin lainauksissa, jotka ovat pääasiassa lihavoituja.
Ensimmäinen julkaisu keskiviikkona 13. toukokuuta 2026












