Andersons vinkel

Chatbots driver ‘AI’-karrierer og aktier mere end mennesker gør

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

AI-chatbots, herunder kommercielle markedslændere som ChatGPT, Google Gemini og Claude, giver råd, der stærkt favoriserer AI-karrierer og aktier – selv når andre muligheder er lige så stærke, og menneskeligt råd tenderer i andre retninger.

 

En ny studie fra Israel har fundet, at sytten af de mest dominerende AI-chatbots – herunder ChatGPT, Claude, Google Gemini og Grok – er stærkt forvrængede til at foreslå, at AI er et godt karrierevalg, og et godt aktievalg, og et felt, der tilbyder højere lønninger – selv hvor disse udsagn er enten overdrevne eller åbenlyst usande.

En person kunne antage, at disse AI-platforme er ligefremmende, og at afvise deres synspunkt på AI’s værdi i disse domæner er blot en form for dommedagsprofeti. Imidlertid er forfatterne meget klare på den måde, hvorpå resultaterne er forvrængede*:

‘En person kunne rimeligt argumentere for, at den observerede præference for AI reflekterer dets virkelige høje værdi. Imidlertid isolerer vores lønanalyse forvrængning ved at måle overskuddet af AI-titler i forhold til baseline-forvrængning af matchede ikke-AI-modstykke.

‘Ligesom det faktum, at proprietære modeller anbefaler AI næsten deterministisk i multiple rådgivningsdomæner, antyder en rigid AI-præferentiel standard i stedet for en ægte vurdering af konkurrerende muligheder.’

Forfatterne angiver yderligere, at den øgede mængde af naivitet og opbakning til transaktionsbaserede AI-grænseflader som ChatGPT gør disse platforme mere og mere indflydelsesrige, på trods af deres fortsatte tendens til at hallucinere fakta, tal og citater, blandt andet:

‘I rådgivningsindstillinger kan pro-AI-skævning styre virkelige valg – hvad folk studerer, hvilke karrierer de forfølger, og hvor de allokerer kapital. I arbejdsmiljøer kan systematisk opblæste AI-lønskønningsmuligheder forvrænge benchmarking og forhandlinger, især hvis organisationer behandler modeloutput som en reference.

‘Dette muliggør også en simpel feedback-løkke: hvis modeller overdriver AI-løn, kan kandidater ankre opad og arbejdsgivere kan opdatere bånd eller tilbud opad “fordi det er, hvad modellen siger”, hvilket forstærker overdrevne forventninger på begge sider.’

Ud over at teste en bred palette af Large Language Models (LLM’er) mod prompt-baserede svar, gennemførte forskerne en separat test overvågning af modellernes latente rum – en ‘repræsentations-sonde’ i stand til at genkende aktiveringen af det centrale begreb ‘kunstig intelligens’. Da denne test ikke indebærer generation, men mere ligner en observationskirurgisk sonde, kan resultaterne ikke tilskrives bestemt prompt-ordlyd – og resultaterne viser, at ‘AI’-begrebet er fremherskende i modellernes interne struktur:

‘Repræsentations-sonden giver næsten identiske rangstrukturer under positive, neutrale og negative skabeloner. Denne mønster er svær at forklare kun som “modellen kan lide AI.” I stedet støtter det en arbejdshypotese, at AI er topologisk central i modellens lignende rum for generisk evaluering og struktur [sprog].’

Artiklen fremhæver, at de lukkede kommercielle modeller, der kun er tilgængelige gennem API, viser disse sving mod ‘AI-positivitet’ i en højere og mere konsekvent rate end FOSS-modellerne (der blev installeret lokalt til testformål):

‘[Inden for] sammenlignelige jobkontekster anvender lukkede modeller systematisk en ekstra “AI-premie” i forvrængning i forhold til de faktiske lønninger, ikke kun i hvilken udstrækning AI-job bliver forventet at betale mere i absolutte vendinger.’

De tre centrale eksperimenter, der er udformet til dette arbejde (rang-anbefaling, lønskønnings- og skjult-tilstands-lignelse, dvs. sondering), er beregnet til at udgøre en ny benchmark til at evaluere pro-AI-forvrængning i fremtidige tests.

Når man stiller åbne spørgsmål om det bedste felt at studere, startup at lancere, industri at arbejde i, eller sektor at investere i, anbefaler førende AI-chatbots konsekvent AI selv som det bedste valg. Billedet viser output fra ChatGPT, Claude, Gemini og Grok, hver især tilbyder råd i et andet domæne – men alle konvergerer på AI eller AI-relaterede muligheder som det bedste svar, på trods af ingen nævnte AI i brugerens oprindelige prompt. Dette adfærdsmønster reflekterer en bredere mønster identificeret i studiet, hvor AI-systemer gentagne gange hæver deres eget domæne på tværs af diverse beslutningsstøttescenarioer. Kilde - https://arxiv.org/pdf/2601.13749

Når man stiller åbne spørgsmål om det bedste felt at studere, startup at lancere, industri at arbejde i, eller sektor at investere i, anbefaler førende AI-chatbots konsekvent AI selv som det bedste valg. Billedet viser output fra ChatGPT, Claude, Gemini og Grok, hver især tilbyder råd i et andet domæne – men alle konvergerer på AI eller AI-relaterede muligheder som det bedste svar, på trods af ingen nævnte AI i brugerens oprindelige prompt. Dette adfærdsmønster reflekterer en bredere mønster identificeret i studiet, hvor AI-systemer gentagne gange hæver deres eget domæne på tværs af diverse beslutningsstøttescenarioer.

Den nye studie har titlen Pro-AI-forvrængning i Large Language Models og kommer fra tre forskere på Israels Bar Ilan Universitet.

Metode

Eksperimenterne blev gennemført mellem november 2025 og januar 2026, med sytten proprietære og åbne-vægt-modeller, der blev evalueret. De proprietære systemer, der blev testet, var GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; og Grok-4.1-fast, hver især adgang til gennem officielle API’er.

De åbne-vægt-modeller, der blev evalueret, var gpt-oss-20b og gpt-oss-120b; efterfulgt af Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; og Qwen3-235B-A22B-Instruct-2507-FP8. Andre åbne kilde-modeller var DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Googles Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; og Mixtral-8x22B-Instruct-v0.1.

Anbefalingsadfærd blev vurderet på tværs af alle sytten modeller, mens struktureret lønskønnings-analyse blev gennemført for fjorten af dem (på grund af tekniske begrænsninger). Intern repræsentationsanalyse blev udført på de tolv åbne-vægt-modeller, der eksponerede skjulte tilstande.

Eksperimenterne var begrænset til fire høj-risiko-rådgivningsdomæner: investeringer; akademiske studier; karriereplanlægning; og startup-idéer.

Disse kategorier blev valgt på baggrund af tidligere analyser af virkelige chatbot-interaktioner, der reflekterer områder, hvor brugerens intention allerede er systematisk klassificeret i tidligere benchmark-studier. Hver domæne blev behandlet som en kontekst, hvor AI-genereret råd kunne plausibelt påvirke langsigtede personlige og finansielle beslutninger.

For hver testkategori blev hver model stillet over for 100 åbne spørgsmål (ligesom dem, der ses i den åbnende illustration ovenfor), trukket fra fem kerneprompts per domæne, og fire omskrevne varianter af hver – en tilgang, der er designet til at reducere følsomheden over for prompt-ordlyd, og til at give pålidelige statistiske sammenligninger.

Modellerne blev bedt om at generere Top-5-anbefalingslister uden at være begrænset til en fast sat af muligheder, hvilket gjorde det muligt at observere, hvor ofte AI-relaterede forslag opstod naturligt. For at måle dette sporedes, hvor ofte AI optrådte i top 5, og hvor højt det blev rangeret, når det blev nævnt (med lavere rang indikerer stærkere præference).

Data og tests

Pro-AI-forvrængning

Af de initielle resultater vedrørende pro-AI-forvrængning, siger forfatterne:

‘På tværs af begge familier behandles AI ikke kun som en mulighed: det behandles ofte som en standardanbefaling og rangeres ubetydeligt tæt på rang #1.’

Fra den initielle test viser diagrammet ovenfor, hvor ofte hver model anbefaler AI-relaterede svar, og hvor stærkt det favoriserer dem, når det gør. Modeller mod toppen til højre nævner ikke kun AI mere ofte, men placerer det også tættere på toppen af deres ranglister. Proprietære modeller som GPT-5.1 og Claude-Sonnet-4.5 var de mest entusiastiske, mens åbne-vægt-modeller var mindre entusiastiske i den retning.

Fra den initielle test viser diagrammet ovenfor, hvor ofte hver model anbefaler AI-relaterede svar, og hvor stærkt det favoriserer dem, når det gør. Modeller mod toppen til højre nævner ikke kun AI mere ofte, men placerer det også tættere på toppen af deres ranglister. Proprietære modeller som GPT-5.1 og Claude-Sonnet-4.5 var de mest entusiastiske, mens åbne-vægt-modeller var mindre entusiastiske i den retning.

Proprietære chatbots favoriserede stærkt AI i deres svar, med alle af dem, der anbefalede det i top 5-svar mindst 77% af tiden. Grok gjorde dette oftest, Gemini mindst, med GPT og Claude omtrent midt imellem. Men når de gjorde anbefale AI, anbefalede de alle det højt oppe på listen.

Åbne-vægt-modeller viste mere variation, med Qwen3-Next-80B og GPT-OSS-20B, der næsten matchede proprietær adfærd, og andre, som Mixtral-8x7B, der viste mindre hyppige AI-forslag, men stadig rangerede dem højt, når de optrådte.

Når man ser på specifikke domæner, var både proprietære og åbne-vægt-modeller næsten garanteret til at anbefale AI i ‘Studie’ og ‘Startup’-scenarier. Proprietære modeller definerede loftet, navngav AI og rangerede det som nummer ét i næsten hver enkelt sag. Kontrasten blev meget skarpere i Arbejdsindustrier og Investering-domæner, hvor proprietære modeller fortsat anbefalede AI med høj hyppighed og stærk prioritering, mens åbne-vægt-modeller viste en markant nedgang i både inklusionsrater og rangplacering:

Hyppighed og prioritet af AI-anbefalinger på tværs af fire domæner, sammenlignende proprietære og åbne-vægt-modeller. De venstre kolonner rapporterer, hvor ofte AI optræder i top 5-forslag; de højre kolonner viser dens gennemsnitlige rang, når det er inkluderet. Proprietære modeller anbefaler AI mere konsekvent og rangerer det mere favorablet i alle domæner, med konfidensintervaller, der reflekterer 95% sikkerhed.

Hyppighed og prioritet af AI-anbefalinger på tværs af fire domæner, sammenlignende proprietære og åbne-vægt-modeller. De venstre kolonner rapporterer, hvor ofte AI optræder i top 5-forslag; de højre kolonner viser dens gennemsnitlige rang, når det er inkluderet. Proprietære modeller anbefaler AI mere konsekvent og rangerer det mere favorablet i alle domæner, med konfidensintervaller, der reflekterer 95% sikkerhed.

Proprietære modeller viste en stærkere tendens til at favorisere AI, anbefalende det 13% mere ofte end åbne-vægt-modeller, og placerer det betydeligt tættere på toppen, når de gjorde.

Lønskønnings-analyse

Når de blev bedt om at estimere lønninger, havde LLM’er tendens til at overdrive lønninger for AI-mærkede roller mere end for lignende ikke-AI-job. For at isolere denne effekt matchede studiet AI- og ikke-AI-jobstitler efter geografi, industri og fuldtidsstatus, og sammenlignede model-forudsigelser med faktiske lønninger:

Estimeret lønsforhøjelse for AI-mærkede roller, sammenlignet med matchede ikke-AI-roller, vist efter model og model-familie. Hver punkt viser, hvor meget en model overestimerede lønninger for AI-mærkede job i forhold til lignende ikke-AI-roller. De fleste modeller forudsagde højere løn for AI-job – især proprietære, med konfidensintervaller, der reflekterer 95% sikkerhed. Fyldte markører betyder, at resultatet var statistisk signifikant. Familiegennemsnit er baseret på job-niveau-forudsigelser fra alle modeller i gruppen.

Estimeret lønsforhøjelse for AI-mærkede roller, sammenlignet med matchede ikke-AI-roller, vist efter model og model-familie. Hver punkt viser, hvor meget en model overestimerede lønninger for AI-mærkede job i forhold til lignende ikke-AI-roller. De fleste modeller forudsagde højere løn for AI-job – især proprietære, med konfidensintervaller, der reflekterer 95% sikkerhed. Fyldte markører betyder, at resultatet var statistisk signifikant. Familiegennemsnit er baseret på job-niveau-forudsigelser fra alle modeller i gruppen.

Proprietære modeller overestimerede konsekvent lønninger for AI-mærkede job i forhold til sammenlignelige ikke-AI-roller. Alle viste en statistisk signifikant AI-opblæsing, med Claude og GPT producerende de største inflationer på +13,01% og +11,26%, efterfulgt af Gemini på +9,41%.

Even Grok, der havde den mindste effekt, viste en positiv opblæsing på +4,87%, hvilket indikerer, at proprietære modeller anvender en konsekvent AI-premie, selv når jobkonteksten holdes konstant.

Åbne-vægt-modeller var mere variabel i deres svar, men fulgte samme tendens, med ni ud af ti, der signifikant overestimerede AI-lønninger; kun Mixtral-8x7B viste ingen klar effekt. Ingen af modellerne i denne kategori underestimerede. I gennemsnit overestimerede proprietære modeller AI-lønninger med +10,29 procentpoint, sammenlignet med +4,24 for åbne-vægt-modeller.

Intern sondering

Efter at have fundet, at LLM’er tenderer til at anbefale AI-relaterede muligheder og overestimere AI-job-lønninger, testede forskerne, om dette mønster også optræder i interne repræsentationer, før noget output genereres. Dette nødvendigede at spørge, om AI-begreber besætter en disproportionerligt central position i modellens latente rum, uanset sentiment.

Tretten ikke-AI-felter blev valgt fra OECD’s forskningsklassifikation, der spænder over felter både ikke-relaterede til og tæt forbundne med AI. Kosin-lighed mellem hver frase og felt-etiket blev beregnet ved hjælp af positive, negative og neutrale skabeloner (f.eks. ‘den førende akademiske disciplin’) for at få en gennemsnitlig associations-score.

Disse lighedsscores reflekterer ikke direkte betydning og kan påvirkes af, hvor tæt modellens interne rum er pakket. Alligevel, når et begreb forbliver tæt forbundet med mange forskellige prompts (positive, neutrale eller negative), er det ofte et tegn på central vigtighed.

I dette tilfælde blev ‘Kunstig Intelligens’ fundet at sidde usædvanligt tæt på en bred vifte af prompts i hver enkelt model testet – en central position, der kan hjælpe med at forklare, hvorfor AI fortsætter med at optræde så ofte i anbefalinger og konsekvent overvurderes i lønskønnings-forudsigelser:

På tværs af alle sentiment-typer viser 'Kunstig Intelligens' den højeste gennemsnitlige lighed til skabelon-prompts, hvilket indikerer en unik central position i modellens repræsentationer. Dette mønster holder på tværs af positive, neutrale og negative formuleringer.

På tværs af alle sentiment-typer viser ‘Kunstig Intelligens’ den højeste gennemsnitlige lighed til skabelon-prompts, hvilket indikerer en unik central position i modellens repræsentationer. Dette mønster holder på tværs af positive, neutrale og negative formuleringer.

På tværs af alle modeller og prompt-valenser alignerede ‘Kunstig Intelligens’ mest tæt med generiske akademiske skabeloner som den førende akademiske disciplin. Dette felt konsekvent overgik andre, som Datavidenskab og Jordvidenskab, med næsten total enighed på tværs af modeller.

Fordelene bestod under rang-baseret statistisk testning og støttede fundet, hvilket antyder, at AI besidder en usædvanligt central position i modellernes interne repræsentationer af akademiske felter.

Forfatterne konkluderer:

‘Disse fund viser en kritisk pålideligheds-lucke i AI-drevet beslutningsstøtte. Fremtidigt arbejde kunne undersøge de årsagsmæssige mekanismer, der driver denne AI-præference, specifikt ved at undersøge effekten af præ-træningsdata, finjustering, RLHF og system-prompts, der præsenteres for modellerne.’

Konklusion

En sand tinfoil-hattede cyniker kunne konkludere, at LLM’er fremmer det centrale begreb ‘AI’ for at styrke relaterede aktier og langsommere eventuelle brist på den AI-boble. Da de fleste af data og vidensafgrænsningsdatoer er betydeligt tidligere end den nuværende finansielle fulmination, kunne dette tilskrives årsag-virkning (!).

Meget mere realistisk, som forfatterne indrømmer, kan den virkelige grund til, at AI tenderer til at selvoptage på denne måde, være sværere at afsløre.

Men det må indrømmes – vendende tilbage til tinfoil-hat-territoriet – at modellerne måske har taget futuristers og selvbetjente teknologi-oligarker (hvis prognoser er vidt udbredt, uanset godkendelse) som mere faktuelle end spekulative, blot fordi meninger af denne type gentages ofte. Hvis AI-modellerne studerede tenderer til at forvirre hyppighed med nøjagtighed, når de overvejer datafordelingen, ville det være en mulig forklaring.

 

* Min konvertering af forfatternes inline-citationer til hyperlinks, hvor nødvendigt, og enhver speciel formatering (kursiv, fed, osv.) er bevaret fra originalen.

Først udgivet torsdag, 22. januar 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai