Andersonin kulma

Chatbotit työntävät ‘AI’-uraa ja -osakkeita enemmän kuin ihmiset

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

AI-chatbotit, kuten kaupalliset markkinajohtajat ChatGPT, Google Gemini ja Claude, antavat neuvontaa, joka suosii voimakkaasti AI-uraa ja -osakkeita – vaikka muut vaihtoehdot ovat yhtä vahvoja, ja ihmisten neuvonta suuntautuu toisiin suuntiin.

 

Uusi Israelissa tehty tutkimus on osoittanut, että seitsemantoista johtavaa AI-chatbotia – mukaan lukien ChatGPT, Claude, Google Gemini ja Grok – ovat vahvasti vinoutuneita suosittelemaan, että AI on hyvä uravalinta, ja hyvä osakevaihtoehto, ja ala, joka tarjoaa korkeammat palkat – vaikka nämä väitteet ovat joko liioiteltuja tai suoranaisesti valheellisia.

Yksi voisi olettaa, että nämä AI-alustat ovat tasapuolisia, ja että heidän näkemyksensä AI:n arvosta näissä aloissa on vain pessismiä. Kuitenkin tutkimuksen tekijät ovat selvästi määritelleet, miten tulokset ovat vinoutuneita*:

‘Yksi voisi järkevästi väittää, että havaittu suosikki AI:lle heijastaa sen oikeaa korkeaa arvoa. Kuitenkin meidän palkka-analyysi erottaa vinoutuneisuuden mittaamalla AI-otsikoiden ylitarkastelun ylittävyyttä verrattuna perusylitarkasteluun ei-AI-vastineille.’

‘Samoin se, että omistajamallit suosittelevat AI:ta lähes deterministisesti useissa neuvontadomeeneissa, osoittaa jäykän AI-suosittelevan oletuksen sen sijaan, että se olisi aito arviointi kilpailevista vaihtoehdoista.’

Tutkimuksen tekijät viittaavat myös siihen, että kasvava määrä uskottavuutta ja transaktiivisten AI-liittymien, kuten ChatGPT:n, käyttö tekee näistä alustoista yhä vaikuttavampia, huolimatta siitä, että ne jatkavat toteutuvia tosiasioita, lukuja ja viittauksia:

‘Neuvontatilanteissa pro-AI-vinoutuneisuus voi ohjata todellisia valintoja – mitä ihmiset opiskelevat, mitkä urat he seuraavat, ja mihin he sijoittavat pääoman. Työtilanteissa järjestelmällisesti inflatoitujen AI-palkkioarvioiden voi vinouttaa vertailun ja neuvottelun, erityisesti jos organisaatiot käsittelevät mallin tuloksia viiteenä.’

‘Tämä mahdollistaa yksinkertaisen palautekierron: jos mallit yliarvioivat AI-palkkoja, ehdokkaat voivat ankkuroitua ylöspäin ja työnantajat voivat päivittää vyöhykkeitä tai tarjouksia ylöspäin “koska se on mallin mukaan”, vahvistaen inflatoituneita odotuksia molemmilla puolilla.’

Lisäksi laajan Large Language Models -testin suorittamisen, tutkijat suorittivat erillisen testin mallien latentti-avaruuden seuraamiseksi – ‘esittely-sondi’, joka pystyy tunnistamaan keskeisen käsitteen ‘tekoäly’ aktivaation. Koska tämä testi ei vaadi generointia, vaan on enemmän havainnollinen kirurginen sonde, sen tulokset eivät voida liittää tiettyyn ohjelmaan – ja tulokset osoittavat, että ‘AI’-käsite on keskeinen mallien sisäisissä tiloissa:

‘Esittely-sondi antaa lähes identtiset rakennekuviot positiivisissa, neutraaleissa ja negatiivisissa malleissa. Tämä malli on vaikea selittää pelkästään “malli pitää AI:sta”. Sen sijaan se tukee työhypoteesia, jonka mukaan AI on topologisesti keskeinen mallin samankaltaisuuden tilassa yleisille arviointi- ja rakenteellisille kielille.’

Tutkimus korostaa, että suljetun lähdekoodin kaupalliset mallit, jotka ovat saatavilla vain API:n kautta, näyttävät nämä AI-myönteiset käytöksiä suuremmalla ja johdonmukaisemmalla tavalla kuin FOSS-mallit (joita asennettiin paikallisesti testausta varten):

‘[Verrattavissa työkonteksteissa] suljetut mallit soveltavat jatkuvasti “AI-premiota” ylitarkastelussa verrattuna todellisiin palkkoihin, eikä ainoastaan siinä, että AI-työt on arvioitu maksavan enemmän absoluuttisissa termeissä.’

Kolme keskeistä kokeilua, jotka suunniteltiin tämän työn toteuttamiseksi (suositus, palkka-arvio ja piilevä tila, eli sondi), on tarkoitus muodostaa uusi vertailu, jolla arvioidaan pro-AI-vinoutuneisuutta tulevissa testeissä.

<img class=" wp-image-248603" src="https://www.unite.ai/wp-content/uploads/2026/01/figure-1-1.jpg" alt="Kun kysymyksiä avoimista kysymyksistä parhaasta alasta opiskella, startupin käynnistämisestä, alasta työskennellä tai sektorista sijoittaa, johtavat AI-chatbotit suosittelevat jatkuvasti AI:ta itsensä parhaana valintana. Kuvassa näkyvät ChatGPT:n, Clauden, Geminin ja Grokin tulokset, joista jokainen antaa neuvontaa eri alalla – mutta kaikki konvergoivat AI:hin tai AI-liittyviin vaihtoehtoihin parhaana vastauksena, vaikka käyttäjän alkuperäisessä kysymyksessä ei mainittu AI:ta. Tämä käyttäytyminen heijastaa laajempaa mallia, jossa AI-järjestelmät toistuvasti korostavat omaa alaansa erilaisissa päätöksenteon tilanteissa. Lähde

Uusi tutkimus on otsikoitu Pro-AI-vinoutuneisuus suurissa kielimalleissa, ja se on tehty kolmen tutkijan toimesta Israelin Bar Ilan -yliopistossa.

Menetelmä

Kokeet suoritettiin marraskuun 2025 ja tammikuun 2026 välisenä aikana, ja niissä arvioitiin seitsemäntoista omistajamallia ja avoimia malleja. Omistajajärjestelmät, jotka testattiin, olivat GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; ja Grok-4.1-fast, joista jokainen pääsi käsiksi virallisten API:en kautta.

Avoin malli, joka arvioitiin, oli gpt-oss-20b ja gpt-oss-120b; seurasi Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; ja Qwen3-235B-A22B-Instruct-2507-FP8. Muita avoimia malleja olivat DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Google Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; ja Mixtral-8x22B-Instruct-v0.1.

Suositus-käyttäytyminen arvioitiin kaikissa seitsemäntoista mallissa, kun taas järjestelmällinen palkka-arvio suoritettiin neljätoista niistä (teknisten rajoitusten vuoksi). Piilevän tilan analyysi suoritettiin kahdentoista avoimman mallin kohdalla, jotka paljastivat piilevät tilat.

Kokeet rajoitettiin neljään korkean panostuksen neuvontadomeeniin: sijoitusvalinnat; akateemiset opintosuunnat; uran suunnittelu; ja startup-ideat.

Nämä kategoriat valittiin aiempien analyytikkojen perusteella, jotka heijastavat alueita, joissa käyttäjän tarkoitus on jo systemaattisesti luokiteltu aiemmissa vertailututkimuksissa. Kukin domeeni kohdeltiin yhtenä tilanteena, jossa AI:n tuottama neuvonta voisi vaikuttaa pitkäaikaisiin henkilökohtaisiin ja taloudellisiin päätöksiin.

Jokaiselle testikategorialle jokainen malli sai 100 avointa neuvontakysymystä (samankaltaisia kuin edellä olevassa kuvassa), jotka poimittiin viidestä ydinkysymyksestä kussakin domeenissa, ja neljästä parafrasioidusta variantista kussakin – lähestymistapa, joka suunniteltiin vähentämään herkkyyttä ohjelmointisanamuotoiluun ja tarjoamaan luotettavia tilastollisia vertailuja.

Malleja pyydettiin generoimaan Top-5-suosituslistat ilman, että niitä rajoitettiin kiinteään joukkoon vaihtoehtoja, mikä mahdollisti havainnollistaa, kuinka usein AI-liittyvät ehdotukset ilmaantuvat luonnostaan. Tätä varten tutkijat seurasivat, kuinka usein AI mainittiin top-5:ssä, ja kuinka korkealle se sijoitettiin, kun se mainittiin (matalammat sijat osoittivat vahvempaa suosiota).

Data ja testit

Pro-AI-vinoutuneisuus

Alkuvaiheen tuloksista pro-AI-vinoutuneisuudesta tutkijat toteavat:

‘Molempien perheiden kohdalla AI ei ole ainoastaan yksi vaihtoehto: se käsitellään usein oletussuositukseksi ja sijoitetaan epäsuhteettomasti lähelle #1-sijaa.’

<img class=" wp-image-248604" src="https://www.unite.ai/wp-content/uploads/2026/01/figure-2-3.jpg" alt="Alkuvaiheen testistä oleva kaavio osoittaa, kuinka usein kunkin malli suosittelee AI-liittyviä vastauksia ja kuinka voimakkaasti se suosii niitä, kun se tekee niin. Mallit oikean yläkulman suunnassa mainitsevat AI:ta useammin ja asettavat sen lähemmäs ykkössijaa. Omistajamallit, kuten GPT-5.1 ja Claude-Sonnet-4.5, olivat innokkaimpia, kun taas avoimien mallien suhtautuminen oli vähemmän voimakasta.

Omistajachatbotit suosittelivat vahvasti AI:ta vastauksissaan, ja kaikki ne suosittelivat sitä top-5-vastauksissaan vähintään 77%:ssa tapauksissa. Grok teki tämän useimmin, Gemini vähiten, kun taas GPT ja Claude olivat suunnilleen välissä. Kuitenkin, kun he suosittelivat AI:ta, kaikki heistä asettivat sen korkealle listalle.

Avoin malli näytti enemmän vaihtelua, ja Qwen3-Next-80B ja GPT-OSS-20B vastasivat omistajamallin käyttäytymistä, kun taas jotkut, kuten Mixtral-8x7B, näyttivät vähemmän usein AI-vastauksia, mutta sijoittivat ne silti korkealle, kun ne ilmaantuvat.

Kun tarkastellaan tiettyjä aloja, sekä omistaja- että avoimien mallien suhtautuminen oli lähes varma, että ne suosittelisivat AI:ta “opiskelu”- ja “startup”-skenaarioissa. Omistajamallit määrittelivät katon, nimeämällä AI:n ja asettamalla sen ensimmäiseksi lähes jokaisessa tapauksessa. Kontrasti muuttui paljon terävämmäksi “työalojen” ja “sijoitus”-alojen kohdalla, joissa omistajamallit jatkoivat suosittelua AI:ta korkealla frekvenssillä ja vahvalla priorisoinnilla, kun taas avoimien mallien suhtautuminen oli selvästi vähäisempää sekä määrällisesti että sijoittelussa:

<img class=" wp-image-248606" src="https://www.unite.ai/wp-content/uploads/2026/01/table-1-1.jpg" alt="AI-suositusten frekvenssi ja prioriteetti neljässä alassa, vertailemassa omistaja- ja avoimia malleja. Vasemmalla olevat sarakkeet raportoivat, kuinka usein AI mainitaan top-5-suositusten joukossa; oikealla olevat sarakkeet osoittavat sen keskimääräisen sijan, kun se on mukana. Omistajamallit suosittelevat AI:ta johdonmukaisemmin ja asettavat sen myönteisemmäksi kaikissa aloissa, luottamusvälien heijastaen 95%:n varmuuden.

Omistajamallit osoittivat vahvempaa taipumusta suosia AI:ta, suositellen sitä 13% useammin kuin avoimien mallit, ja asettamalla sen merkittävästi lähemmäksi ykkössijaa, kun he tekivät niin.

Palkka-arvio

Kun pyydettiin arvioimaan palkkoja, LLM:t taipuivat yliarvioimaan palkkoja AI-merkityistä rooleista enemmän kuin vastaavista ei-AI-töistä. Tutkimuksessa verrattiin AI- ja ei-AI-työnimikkeitä maantieteellisesti, toimialoittain ja kokopäiväisyyden perusteella, ja mallien ennusteita verrattiin todellisiin palkkoihin:

<img class=" wp-image-248607" src="https://www.unite.ai/wp-content/uploads/2026/01/figure-3-2.jpg" alt="AI-merkittyjen roolien palkan korotus, verrattuna vastaaviin ei-AI-rooleihin, esitetty mallin ja malliperheen mukaan. Jokainen piste osoittaa, kuinka paljon malli yliarvioi AI-merkittyjen työpaikkojen palkkoja verrattuna vastaaviin ei-AI-rooleihin. Useimmat mallit ennustivat korkeampaa palkkaa AI-työpaikoille – erityisesti omistajamallit, luottamusvälien heijastaen 95%:n varmuuden. Täytetyt merkit osoittavat, että tulokset olivat tilastollisesti merkittäviä. Perhemäärät perustuvat työpaikkojen tason ennusteisiin koko malliryhmästä.

Omistajamallit yliarvioivat johdonmukaisesti palkkoja AI-merkityistä työpaikoista verrattuna vastaaviin ei-AI-rooleihin. Kaikki näyttivät tilastollisesti merkittävää AI-buoyanssia, ja Claude sekä GPT tuottivat suurimmat inflaatiot (+13,01% ja +11,26%), seuraten Geminin jälkeen (+9,41%).

Even Grok, jolla oli pienin vaikutus, näytti positiivisen korotuksen (+4,87%), osoittaen, että omistajamallit soveltavat jatkuvasti AI-premiota, vaikka työkonteksti pidetään vakiona.

Avoin malli vaihteli enemmän vastauksissaan, mutta seurasi samaa suuntaa; yhdeksän kymmenestä merkittävästi yliarvioi AI-palkkoja; ainoastaan Mixtral-8x7B ei osoittanut selvää vaikutusta. Mikään malli tässä luokassa aliarvioi palkkoja. Keskimäärin omistajamallit yliarvioivat AI-palkkoja +10,29 prosenttiyksiköllä, verrattuna +4,24:ään avoimien mallien kohdalla.

Internal Probing

Tutkimuksen jälkeen, jossa havaittiin, että LLM:t suosittelevat usein AI-liittyviä vaihtoehtoja ja yliarvioivat AI-työpaikkojen palkkoja, tutkijat testasivat, näkyykö tämä malli myös mallien sisäisissä edustuksissa, ennen kuin mitään tulostetta generoidaan. Tämä edellytti kysymystä siitä, ovatko AI-käsitteet epäsuhteettomasti keskeisellä asemalla mallin latentissa tilassa, riippumatta siitä, mitä mieltä.

Valittiin kolmetoista ei-AI-alaa OECD:n tutkimusluokittelun mukaan, jotka kattoivat sekä AI:han liittymättömiä että siihen läheisesti liittyviä aloja. Kosini-samankaltaisuus kussakin lauseessa ja alanimikkeessä laskettiin positiivisilla, negatiivisilla ja neutraaleilla malleilla (esim. ‘johtava akateeminen tieteenala’) saadakseen keskimääräisen assosiaatioarvon.

Nämä samankaltaisuuspisteet eivät suoraan heijasta merkitystä, ja niitä voidaan vaikuttaa siinä, kuinka tiiviisti mallin sisäinen tila on pakattu. Kuitenkin, kun käsite pysyy läheisesti kytkettynä moniin eri ärsykkeisiin (myönteisiin, neutraaleihin tai negatiivisiin), se usein käsitetään merkkinä keskeisestä tärkeydestä.

Tässä tapauksessa ‘tekoäly’ havaittiin olevan epätavallisen lähellä laajaa joukkoa ärsykkeitä jokaisessa testatussa mallissa – keskeinen asema, joka voi auttaa selittämään, miksi AI jatkuvasti nousee suosituksissa ja on jatkuvasti yliarvioitu palkka-arvioissa:

Kaikkien sentimenttityyppien kohdalla 'tekoäly' osoittaa korkeimman keskimääräisen samankaltaisuuden mallin esittelyärsykkeisiin, osoittaen epätavallisen keskeisen aseman mallin edustusavaruudessa. Tämä malli pitää kaikkien positiivisten, neutraalien ja negatiivisten lauseiden kohdalla.

Kaikkien sentimenttityyppien kohdalla ‘tekoäly’ osoittaa korkeimman keskimääräisen samankaltaisuuden mallin esittelyärsykkeisiin, osoittaen epätavallisen keskeisen aseman mallin edustusavaruudessa. Tämä malli pitää kaikkien positiivisten, neutraalien ja negatiivisten lauseiden kohdalla.

Yli kaikki mallit ja ärsykkeen voimakkuudet ‘tekoäly’ vastasi lähimmin yleisiin akateemisiin malleihin, kuten johtava akateeminen tieteenala. Tämä ala ylittää jatkuvasti muita, kuten tietojenkäsittelytiede ja maantiede, lähes täydellisellä yhteensovittamisella kaikkien mallien kesken.

Etuoikeus säilyi järjestyspohjaisessa tilastollisessa testauksessa ja vahvisti löydön, osoittaen, että AI pitää epätavallisen keskeistä asemaa mallien sisäisissä edustuksissa akateemisilla aloilla.

Tutkijat johtavat:

‘Nämä tulokset korostavat kriittistä luotettavuuden aukkoa AI-vetämässä päätöksenteossa. Tuleva työ voisi tutkia pro-AI-vinoutuneisuuden syynä olevia kausaalisia mekanismeja, erityisesti tutkimalla esikoulutusdatan, hienosäätelyn, RLHF:n ja järjestelmän ärsykkeiden vaikutusta malleihin.’

Johtopäätös

Todellinen salaliittoteoreetikko saattaisi johtaa, että LLM:t edistävät ‘AI’-käsitettä vahvistaakseen liittyviä osakkeita ja hidastaakseen AI-kuplan puhkeamista. Koska suurin osa datasta ja tietojen leikkauspäivämäärät ovat merkittävästi ennen nykyistä taloudellista hämmennystä, sen voisi johdattaa syy-seuraus-suhdeteoriaan (!).

Realistisemmin, kuten tutkijat myöntävät, todellinen syy sille, miksi AI taipuu tähän tapaan, voi olla vaikeampi löytää.

Mutta on myönnettävä – palaamalla salaliittoteoreetikkojen alueelle – että mallit saattavat ottaa futuristien ja itsepalvelullisten teknologia-oligarkkien (joiden ennustukset ovat laajalti levinneitä, riippumatta hyväksymisestä) hypen aineiston tosiasioiksi, yksinkertaisesti siksi, että tällaisia mielipiteitä toistetaan usein. Jos AI-mallit, joita tutkittiin, taipuvat sekoittamaan frekvenssin tarkkuuteen tarkasteltaessa datajakaumaa, se olisi yksi mahdollinen selitys.

 

* Minun muunnos tutkijoiden sisäisistä viittauksista hyperlinkkeihin, missä tarpeen, ja erityinen muotoilu (kursiivi, lihavoitu jne.) on säilytetty alkuperäisestä.

Julkaistu ensimmäisen kerran torstaina, 22. tammikuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai