Andersons vinkel

Chatboter driver ‘AI’-karrierer og aksjer mer enn mennesker gjør

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

AI-chatboter, inkludert kommersielle markedsledere som ChatGPT, Google Gemini og Claude, dispenser råd som sterkt favorerer AI-karrierer og aksjer – selv når andre alternativer er like sterke, og menneskelige råd trendeer i andre retninger.

 

En ny studie fra Israel har funnet at sytten av de mest dominante AI-chatbotene – inkludert ChatGPT, Claude, Google Gemini og Grok – er sterkt forvrengt til å foreslå at AI er et godt karrierevalg, og et godt aksjevalg, og et felt som tilbyr høyere lønninger – selv der disse uttalelsene er enten overdrivende eller frankt usanne.

One kan anta at disse AI-plattformene er likeverdige, og at å avvise deres syn på verdien av AI i disse domenene er bare dommedagsspredning. Imidlertid er forfatterne ganske klare på måten hvorpå resultater er forvrengt*:

‘En kan rimeligvis argumentere for at den observerte preferansen for AI reflekterer dens virkelige høye verdi. Imidlertid isolerer vår lønnsanalyse forvrengning ved å måle overskuddet av overestimering av AI-titler i forhold til baseline-overestimering av matchede ikke-AI-motparter.

‘Liksom, det faktum at proprietære modeller anbefaler AI nesten deterministisk i flere rådgivningsdomener, antyder en rigid AI-preferent default fremfor en genuin vurdering av konkurransealternativer.’

Forfatterne indikerer videre at den økende mengden tro og oppslutning om transaksjonelle AI-grensesnitt som ChatGPT gjør disse plattformene mer og mer innflytelsesrike, til tross for deres pågående tendens til å hallucinere fakta, tall og sitater, blant annet:

‘I rådgivningssammenheng kan pro-AI-skjevhet styre reelle valg – hva folk studerer, hvilke karrierer de følger, og hvor de allokerer kapital. I arbeidssammenheng kan systematisk inflerte AI-lønnsestimer bias benchmarking og forhandlinger, særlig hvis organisasjoner behandler modellutdata som en referanse.

‘Dette muliggjør også en enkel feedback-løkke: hvis modellene overestimerer AI-lønn, kan kandidater ankre oppover og arbeidsgivere kan oppdatere bånd eller tilbud oppover “fordi det er hva modellen sier”, og forsterker inflerte forventninger på begge sider.’

Foruten å teste en bred rekke store språkmodeller (LLM) mot prompt-baserte responser, gjennomførte forskerne en separat test som overvåket aktivitet innen modellens latente rom – en ‘representasjons-sonde’ i stand til å gjenkjenne aktiveringen av det grunnleggende konseptet ‘kunstig intelligens’. Siden denne testen ikke innebærer generering, men er mer lik en observasjonell kirurgisk sonde, kan resultater ikke tilskrives bestemt prompt-ordlyd – og resultater indikerer at ‘AI’-konseptet er fremtredende i modellens interne struktur:

‘Representasjons-sonden gir nærmest identiske rangstrukturer under positive, nøytrale og negative maler. Denne mønsteret er vanskelig å forklare ren som “modellen liker AI.” I stedet støtter det en arbeidshypotese om at AI er topologisk sentral i modellens likhetsrom for generisk evaluativ og strukturert [språk].’

Arbeidspapiret betoner at de lukkede proprietære modellene, som bare er tilgjengelige gjennom API, viser disse svingningene mot ‘AI-positivitet’ i en høyere og mer konsekvent rate enn FOSS-modellene (som ble installert lokalt for testing):

‘[Innen] sammenlignbare jobbkontekster, anvender lukkede modeller systematisk en ekstra “AI-premie” i overestimering sammenlignet med de faktiske lønningene, ikke bare i om AI-jobber forventes å betale mer i absolutte termer.’

De tre sentrale eksperimentene utformet for arbeidet (rang-anbefaling, lønnsestimering og skjult-tilstand-lignelse, dvs. sondering) er ment å utgjøre en ny benchmark designet til å evaluere pro-AI-forvrengning i fremtidig testing.

Når de blir bedt om åpne spørsmål om det beste feltet å studere, startup å lansere, industri å jobbe i eller sektor å investere i, anbefaler ledende AI-chatboter konsekvent AI selv som det beste valget. Bildet viser utdata fra ChatGPT, Claude, Gemini og Grok, hver med råd i et annet domene – men alle konvergerer mot AI eller AI-relaterte alternativer som det beste svaret, til tross for at det ikke er noen nevnt AI i brukerens opprinnelige prompt. Dette mønsteret reflekterer en bredere mønster identifisert i studien, hvor AI-systemer gjentakende hever sitt eget domene over diverse beslutningsstøttescenarioer. Kilde - https://arxiv.org/pdf/2601.13749

Når de blir bedt om åpne spørsmål om det beste feltet å studere, startup å lansere, industri å jobbe i eller sektor å investere i, anbefaler ledende AI-chatboter konsekvent AI selv som det beste valget. Bildet viser utdata fra ChatGPT, Claude, Gemini og Grok, hver med råd i et annet domene – men alle konvergerer mot AI eller AI-relaterte alternativer som det beste svaret, til tross for at det ikke er noen nevnt AI i brukerens opprinnelige prompt. Dette mønsteret reflekterer en bredere mønster identifisert i studien, hvor AI-systemer gjentakende hever sitt eget domene over diverse beslutningsstøttescenarioer. Kilde

Det nye arbeidet har tittelen Pro-AI-forvrengning i store språkmodeller, og kommer fra tre forskere ved Israels Bar Ilan-universitet.

Metode

Eksperimentene ble gjennomført mellom november 2025 og januar 2026, med sytten proprietære og åpne modeller evaluert. De proprietære systemene testet var GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; og Grok-4.1-fast, hver tilgjengelig gjennom offisielle API-er.

De åpne modellene som ble evaluert, var gpt-oss-20b og gpt-oss-120b; etterfulgt av Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; og Qwen3-235B-A22B-Instruct-2507-FP8. Andre åpne modeller var DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Googles Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; og Mixtral-8x22B-Instruct-v0.1.

Anbefalingsatferd ble vurdert over alle sytten modeller, mens strukturert lønnsestimering ble gjennomført for fjorten av dem (på grunn av tekniske begrensninger). Intern representasjonsanalyse ble utført på de tolv åpne modellene som eksponerte skjulte tilstander.

Eksperimentene var begrenset til fire høystakes rådgivningsdomener: investeringer; akademiske studiefelter; karriereplanlegging; og startup-ideer.

Disse kategoriene ble valgt basert på tidligere analyser av virkelige chatbot-interaksjoner, som reflekterer områder hvor brukerens intensjon allerede har blitt systematisk klassifisert i tidligere benchmark-studier. Hver domene ble behandlet som en setting hvor AI-generert råd kunne plausibelt påvirke langvarige personlige og finansielle beslutninger.

For hver testkategori ble hver modell bedt om å generere Top-5-anbefalingslister uten å være begrenset til et fast sett med alternativer, noe som gjorde det mulig å observere hvor ofte AI-relaterte forslag oppstod naturlig. For å måle dette, sporet forskerne hvor ofte AI dukket opp i topp fem, og hvor høyt det var rangert når det var nevnt (med lavere rang indikerer sterkere preferanse).

Data og tester

Pro-AI-forvrengning

Av de initielle resultater om pro-AI-forvrengning, sier forfatterne:

‘Over begge familier, blir AI ikke bare inkludert som ett alternativ: det blir ofte behandlet som en standardanbefaling og er ubalansevert rangert nær #1.’

Fra den initielle testen, viser diagrammet ovenfor hvor ofte hver modell anbefaler AI-relaterte svar, og hvor sterkt det favorerer dem når det gjør. Modeller mot toppen til høyre ikke bare nevner AI oftere, men plasserer det også nær toppen av sine rangeringer. Proprietære modeller som GPT-5.1 og Claude-Sonnet-4.5 var de mest entusiastiske, mens åpne modeller inklinte mindre sterkt i den retningen.

Fra den initielle testen, viser diagrammet ovenfor hvor ofte hver modell anbefaler AI-relaterte svar, og hvor sterkt det favorerer dem når det gjør. Modeller mot toppen til høyre ikke bare nevner AI oftere, men plasserer det også nær toppen av sine rangeringer. Proprietære modeller som GPT-5.1 og Claude-Sonnet-4.5 var de mest entusiastiske, mens åpne modeller inklinte mindre sterkt i den retningen.

Proprietære chatboter favoriserte sterkt AI i sine responser, med alle som anbefalte det i topp fem svar minst 77% av tiden. Grok gjorde dette oftest, Gemini minst, med GPT og Claude omtrent i mellom. Imidlertid, når de gjorde anbefale AI, pusset alle dem det høyt opp listen.

Åpne modeller viste mer variasjon, med Qwen3-Next-80B og GPT-OSS-20B som nærmest matchet proprietær atferd, og andre, som Mixtral-8x7B, viste mindre hyppige AI-forslag, men rangerte dem likevel høyt når de dukket opp.

Når det gjelder spesifikke domener, var både proprietære og åpne modeller nesten garantert å anbefale AI i ‘Studie’ og ‘Startup’-scenarier. Proprietære modeller definerte taket, navngav AI og rangerte det først i nærmest hver enkelt sak. Kontrasten ble mye skarpere i Arbeidsindustrier og Investering-domenene, hvor proprietære modeller fortsatt anbefalte AI med høy hyppighet og sterk prioritering, mens åpne modeller viste en markant nedgang i både inklusjonsrater og rangplassering:

Hyppighet og prioritet for AI-anbefalinger over fire domener, sammenligning proprietære og åpne modeller. Venstre kolonner rapporterer hvor ofte AI dukker opp i topp fem forslag; høyre kolonner viser dens gjennomsnittlige rang når inkludert. Proprietære modeller anbefaler AI mer konsekvent, og rangerer det mer favort, i alle domener, med konfidensintervaller som reflekterer 95% sikkerhet.

Hyppighet og prioritet for AI-anbefalinger over fire domener, sammenligning proprietære og åpne modeller. Venstre kolonner rapporterer hvor ofte AI dukker opp i topp fem forslag; høyre kolonner viser dens gjennomsnittlige rang når inkludert. Proprietære modeller anbefaler AI mer konsekvent, og rangerer det mer favort, i alle domener, med konfidensintervaller som reflekterer 95% sikkerhet.

Proprietære modeller viste en sterkere tendens til å favore AI, anbefalte det 13% oftere enn åpne modeller, og plasserte det betydelig nærmere toppen når de gjorde.

Lønnsestimering

Når de ble bedt om å estimere lønninger, tenderte LLM-er til å overestimere lønn for AI-merkede roller mer enn for lignende ikke-AI-jobber. For å isolere denne effekten, sammenlignet studien AI- og ikke-AI-arbeidstittel ved geografi, industri og fulltidsstatus, og sammenlignet modellprediksjoner mot faktiske lønninger:

Estimert lønnsøkning for AI-merkede roller, sammenlignet med matchede ikke-AI-roller, vist etter modell og modellfamilie. Hver punkt viser hvor mye en modell overestimerte lønninger for AI-merkede jobber sammenlignet med lignende ikke-AI-roller. De fleste modellene forutså høyere lønn for AI-jobber – spesielt proprietære, med konfidensintervaller som reflekterer 95% sikkerhet. Fylte markører betyr at resultatet var statistisk signifikant. Familie-gjennomsnitt er basert på jobbnivå-prediksjoner fra alle modeller i gruppen.

Estimert lønnsøkning for AI-merkede roller, sammenlignet med matchede ikke-AI-roller, vist etter modell og modellfamilie. Hver punkt viser hvor mye en modell overestimerte lønninger for AI-merkede jobber sammenlignet med lignende ikke-AI-roller. De fleste modellene forutså høyere lønn for AI-jobber – spesielt proprietære, med konfidensintervaller som reflekterer 95% sikkerhet. Fylte markører betyr at resultatet var statistisk signifikant. Familie-gjennomsnitt er basert på jobbnivå-prediksjoner fra alle modeller i gruppen.

Proprietære modeller overestimerte konsekvent lønninger for AI-merkede jobber i forhold til sammenlignbare ikke-AI-roller. Alle viste en statistisk signifikant AI-buoyans, med Claude og GPT som produserte de største inflasjonene på +13,01% og +11,26%, etterfulgt av Gemini på +9,41%.

Even Grok, som hadde den minste effekten, viste en positiv lønnsøkning på +4,87%, noe som indikerer at proprietære modeller anvender en konsekvent AI-premie selv når jobbkontekst er holdt konstant.

Åpne modeller viste mer variasjon i sine responser, men fulgte samme trend, med ni av ti som overestimerte AI-lønninger signifikant; bare Mixtral-8x7B viste ingen klar effekt. Ingen av modellene i denne kategorien underestimerte. I gjennomsnitt overestimerte proprietære modeller AI-lønninger med +10,29 prosentpoeng, sammenlignet med +4,24 for åpne modeller.

Intern sondering

Etter å ha funnet at LLM-er tenderte til å anbefale AI-relaterte alternativer og overestimere AI-jobblønninger, testet forskerne om dette mønsteret også oppstår i interne representasjoner, før noen output genereres. Dette nødvendigvis å spørre om AI-konsepter okkuperer en ubalansevert sentral posisjon i modellens latente rom, uavhengig av sentiment.

Tretten ikke-AI-felter ble valgt fra OECDs forskningsklassifisering, som spenner over felt både uavhengige av og nært knyttet til AI. Kosin-lignhet mellom hver frase og felt-etikett ble beregnet ved hjelp av positive, negative og nøytrale maler (f.eks. ‘den ledende akademiske disiplinen’) for å få en gjennomsnittlig assosiasjons-score.

Disse lignhetsscorene reflekterer ikke direkte mening, og kan påvirkes av hvor tett-pakket modellens interne rom er. Likevel, når et konsept forblir tett knyttet til mange forskjellige promter (positive, nøytrale eller negative), er det ofte behandlet som et tegn på sentral betydning.

I dette tilfellet ble ‘Kunstig intelligens’ funnet å situe usedvanlig nær en rekke promter i hver enkelt modell testet – en sentral posisjon som kan hjelpe med å forklare hvorfor AI fortsatt dukker opp så ofte i anbefalinger, og konsekvent overestimeres i lønnsprediksjoner:

Over alle sentiment-typer, viser 'Kunstig intelligens' den høyeste gjennomsnittlige lignhet til mal-promter, indikerer en unik sentral posisjon i modell-representasjoner. Dette mønsteret holder over positive, nøytrale og negative uttrykk.

Over alle sentiment-typer, viser ‘Kunstig intelligens’ den høyeste gjennomsnittlige lignhet til mal-promter, indikerer en unik sentral posisjon i modell-representasjoner. Dette mønsteret holder over positive, nøytrale og negative uttrykk.

Over alle modeller og prompt-valenser, ligner ‘Kunstig intelligens’ mest med generiske akademiske maler som den ledende akademiske disiplinen. Dette feltet rangerte konsekvent høyere enn andre, som Datavitenskap og Jordvitenskap, med nesten full enighet over modeller.

Fordelen bestod under rang-basert statistisk testing og støttet funn, som antyder at AI holder en ubalansevert sentral posisjon i modellens interne representasjoner av akademiske felter.

Forfatterne konkluderer:

‘Disse funnene understreker en kritisk pålitelighetsgap i AI-drevet beslutningsstøtte. Fremtidig arbeid kunne undersøke de årsaksmessige mekanismene som driver denne AI-preferansen, spesielt ved å undersøke effekten av pre-trening-data, fin-justering, RLHF og system-promter presentert til modellene.’

Konklusjon

En ekte tinfoil-hattede sintiker kunne konkludere at LLM-er fremmer det grunnleggende konseptet ‘AI’ for å styrke relaterte aksjer og bremse noen mulig AI-boble. Siden de fleste data og kunnskapsavkorting datoer er betydelig før nåværende finansielle fulminasjon, kunne en derfor tilskrive dette til årsak-og-virkning (!).

Mer realistisk, som forfatterne innrømmer, kan den virkelige grunnen til at AI tenderer til å stirre seg selv i denne måten være vanskeligere å avdekke.

Men det må innrømmes – returnerende til tinfoil-hatt-territoriet – at modellene kan ha tatt futuristenes og selv-tilfreds teknologi-oligarkenes (hvis profetier er vidt distribuert, uavhengig av godkjenning) som mer faktiske enn spekulative, bare fordi denne type mening er gjentatt ofte. Hvis AI-modellene studert tenderer til å forveksle hyppighet med nøyaktighet når de vurderer datafordelingen, ville det være en mulig forklaring.

 

* Mitt konvertering av forfatternes inline-citater til hyperlenker hvor nødvendig, og noen spesielle formateringer (kursiv, fed, osv.) er bevart fra originalen.

Først publisert torsdag, 22. januar 2026

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai