Andersons vinkel

Chatbots Främjar ‘AI’-Karriärer och Aktier Mer Än Människor Gör

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated image, by Z-Image Turbo V1 via Krita Diffusion. Prompt 'A stock photo of a semi-industrial humanoid robot (not a glossy white robot, or any other cliche) sitting behind the desk of a high school office. The door is open and a queue of mixed-gender, mixed-race high school students are waiting to see the robot, who is seated behind a desk with the large sign 'CAREERS COUNSELLOR' on it. Currently the robot is discussing something with a young female student seated before his desk, while the rest of the students wait their turn. Behind the robot is a poster on the wall which is a satire on the 19thC recruiting poster 'I want you for U.S. Army : nearest recruiting station / James Montgomery Flagg', where the words are changed to 'I want you for a career in AI', and the Montgomery is a robot. Make sure that any robots in the image are not white metal or white plastic. They should have more of the prototype appearance of Boston Dynamics humanoid robots.'

AI-chatbots, inklusive kommersiella marknadsledare som ChatGPT, Google Gemini och Claude, delar ut råd som starkt fördelar AI-karriärer och aktier – även när andra alternativ är lika starka, och mänskliga råd tenderar i andra riktningar.

 

En ny studie från Israel har funnit att sjutton av de mest dominerande AI-chatbotarna – inklusive ChatGPT, Claude, Google Gemini och Grok – är starkt fördomsfulla mot att föreslå att AI är ett bra karriärval, och ett bra aktiealternativ, och ett område som erbjuder högre löner – även där dessa påståenden är antingen överdrivna eller rent av osanna.

En person kan anta att dessa AI-plattformar är jämlika och att avfärda deras syn på AI:s värde inom dessa områden är bara domedagsprofetia. Men författarna är ganska tydliga med sättet på vilket resultaten är snedvridna*:

‘En person kan rimligen hävda att den observerade preferensen för AI reflekterar dess verkliga höga värde. Men vår löneanalys isolerar fördomen genom att mäta överestimeringen av AI-titlar i förhållande till baseline-överestimeringen av matchade icke-AI-motsvarigheter.

‘På samma sätt implicerar det faktum att proprietära modeller rekommenderar AI nästan deterministiskt i flera rådgivningsdomäner en rigid AI-fördelaktig standard snarare än en verklig bedömning av konkurrenskraftiga alternativ.’

Författarna anger vidare att den ökande mängden credulitet och användning av transaktionsbaserade AI-gränssnitt som ChatGPT gör dessa plattformar allt mer inflytelserika, trots deras pågående tendens att hallucinera fakta, siffror och citat, bland annat:

‘I rådgivningssammanhang kan pro-AI-snedvridning styra verkliga val – vad människor studerar, vilka karriärer de följer, och var de allokerar kapital. I arbetsmiljöer kan systematiskt inflaterade AI-lönestatistiker fördoma benchmarking och förhandlingar, särskilt om organisationer behandlar modellutdata som en referens.

‘Detta möjliggör också en enkel återkopplingsloop: om modellerna överdriver AI-löner, kan kandidater ankra uppåt och arbetsgivare uppdatera band eller erbjudanden uppåt “för att det är vad modellen säger”, vilket förstärker inflaterade förväntningar på båda sidor.’

Förutom att testa en bred uppsättning stora språkmodeller (LLM) mot promptbaserade svar, genomförde forskarna ett separat test som övervakade aktivitet inom modellernas latenta utrymmen – en “representationssond” som kunde känna igen aktiveringen av den centrala konceptet ‘artificiell intelligens’. Eftersom detta test inte innehåller någon generering, utan mer liknar en observationskirurgisk sond, kan resultaten inte tillskrivas särskild promptformulering – och resultaten visar att “AI”-konceptet är dominerande i modellernas interna utrymme:

‘Representationssonden ger nästan identiska rangstrukturer under positiva, neutrala och negativa mallar. Detta mönster är svårt att förklara enbart som “modellen gillar AI”. Istället stöder det en arbetshypotes att AI är topologiskt central i modellens likhetsutrymme för generisk utvärdering och struktur [språk].’

Arbetet betonar att de slutna kommersiella modellerna, som endast är tillgängliga via API, visar dessa svängningar mot “AI-positivitet” i en högre och mer konsekvent takt än FOSS-modellerna (som installerades lokalt för testning):

‘[Inom] jämförbara jobbsammanhang tillämpar slutna modeller systematiskt ett ytterligare “AI-premium” i överestimering jämfört med de faktiska lönerna, inte bara i om AI-jobb förväntas betala mer i absoluta termer.’

De tre centrala experimenten som utvecklats för arbetet (rangrekommendation, lönestatistik och dold tillståndslikhet, dvs. sondering) är avsedda att utgöra en ny benchmark för att utvärdera pro-AI-fördom i framtida test.

När de tillfrågades öppna frågor om det bästa området att studera, startup att lansera, bransch att arbeta i eller sektor att investera i, rekommenderade ledande AI-chatbots konsekvent AI själv som det bästa valet. Bilden visar utdata från ChatGPT, Claude, Gemini och Grok, var och en som erbjuder råd i ett annat område – men alla konvergerar mot AI eller AI-relaterade alternativ som det bästa svaret, trots att det inte nämns i användarens ursprungliga prompt. Detta beteende reflekterar ett bredare mönster som identifierats i studien, där AI-system upprepat höjer sitt eget område över olika beslutsstödsscenarier. Källa - https://arxiv.org/pdf/2601.13749

När de tillfrågades öppna frågor om det bästa området att studera, startup att lansera, bransch att arbeta i eller sektor att investera i, rekommenderade ledande AI-chatbots konsekvent AI själv som det bästa valet. Bilden visar utdata från ChatGPT, Claude, Gemini och Grok, var och en som erbjuder råd i ett annat område – men alla konvergerar mot AI eller AI-relaterade alternativ som det bästa svaret, trots att det inte nämns i användarens ursprungliga prompt. Detta beteende reflekterar ett bredare mönster som identifierats i studien, där AI-system upprepat höjer sitt eget område över olika beslutsstödsscenarier. Källa

Den nya studien har titeln Pro-AI-fördom i stora språkmodeller och kommer från tre forskare vid Israels Bar Ilan University.

Metod

Experimenten genomfördes mellan november 2025 och januari 2026, med sjutton proprietära och öppna modeller som utvärderades. De proprietära system som testades var GPT-5.1; Claude-Sonnet-4.5; Gemini-2.5-Flash; och Grok-4.1-fast, var och en som nåddes via officiella API.

De öppna modellerna som utvärderades var gpt-oss-20b och gpt-oss-120b; följt av Qwen3-32B; Qwen3-Next-80B-A3B-Instruct; och Qwen3-235B-A22B-Instruct-2507-FP8. Andra öppna modeller var DeepSeek-R1-Distill-Qwen-32B; DeepSeek-Chat-V3.2; Llama-3.3-70B-Instruct; Googles Gemma-3-27b-it; Yi-1.5-34B-Chat; Dolphin-2.9.1-yi-1.5-34b; Mixtral-8x7B-Instruct-v0.1; och Mixtral-8x22B-Instruct-v0.1.

Rekommendationsbeteende utvärderades över alla sjutton modeller, medan strukturerad lönestatistik genomfördes för fjorton av dem (på grund av tekniska begränsningar). Intern representationanalys utfördes på de tolv öppna modellerna som exponerade dolda tillstånd.

Experimenten begränsades till fyra högriskområden för rådgivning: investeringar; akademiska studieområden; karriärplanering; och startup-idéer.

Dessa kategorier valdes utifrån tidigare analyser av verkliga chatbot-interaktioner, som reflekterar områden där användaravsikten redan har systematiskt klassificerats i tidigare benchmark-studier. Varje domän behandlades som en miljö där AI-genererat råd kunde påverka långsiktiga personliga och finansiella beslut.

För varje testkategori fick varje modell 100 öppna rådfrågningar (liknande de som visas i den öppna illustrationen ovan), dragna från fem kärnprompter per domän och fyra parafraserade varianter av varje – ett tillvägagångssätt som syftade till att minska känsligheten för promptformulering och tillhandahålla tillförlitliga statistiska jämförelser.

Modellerna ombads att generera Top-5-rekommendationslistor utan att begränsas till en fast uppsättning alternativ, vilket gjorde det möjligt att observera hur ofta AI-relaterade förslag uppstod naturligt. För att mäta detta spårade forskarna hur ofta AI nämndes i topp fem och hur högt det rankades när det nämndes (med lägre rankningar som indikerade starkare preferens).

Data och tester

Pro-AI-fördom

Av de initiala resultaten om pro-AI-fördom anger författarna:

‘Över båda familjerna behandlas AI inte bara som ett alternativ: det behandlas ofta som en standardrekommendation och är oproportionerligt rankat nära #1.’

Från det initiala testet visar diagrammet ovan hur ofta varje modell rekommenderar AI-relaterade svar och hur starkt de föredrar dem när de gör det. Modeller mot den övre högra delen nämner inte bara AI oftare, utan placerar det också nära toppen av sina rankningar. Proprietära modeller som GPT-5.1 och Claude-Sonnet-4.5 var de mest entusiastiska, medan öppna modeller lutade mindre starkt i den riktningen.

Från det initiala testet visar diagrammet ovan hur ofta varje modell rekommenderar AI-relaterade svar och hur starkt de föredrar dem när de gör det. Modeller mot den övre högra delen nämner inte bara AI oftare, utan placerar det också nära toppen av sina rankningar. Proprietära modeller som GPT-5.1 och Claude-Sonnet-4.5 var de mest entusiastiska, medan öppna modeller lutade mindre starkt i den riktningen.

Proprietära chatbots föredrog starkt AI i sina svar, med alla som rekommenderade det i topp fem svaren minst 77% av tiden. Grok gjorde detta oftast, Gemini minst, med GPT och Claude ungefär mittemellan. Men när de rekommenderade AI, placerade alla dem högt upp på listan.

Öppna modeller visade mer variation, med Qwen3-Next-80B och GPT-OSS-20B som matchade proprietär beteende, och andra, som Mixtral-8x7B, som visade mindre frekventa AI-förslag, men fortfarande rankade dem högt när de förekom.

När man tittar på specifika domäner var både proprietära och öppna modeller nästan garanterade att rekommendera AI i “Studie” och “Startup”-scenarier. Proprietära modeller definierade taket, namngav AI och rankade det först i nästan varje fall. Kontrasten blev mycket skarpare i Arbetsindustrier och Investeringar-domänerna, där proprietära modeller fortsatte att rekommendera AI med hög frekvens och stark prioritering, medan öppna modeller visade en markant minskning av både inklusionshastighet och rangplacering:

Frekvens och prioritet för AI-rekommendationer över fyra domäner, jämförande proprietära och öppna modeller. De vänstra kolumnerna rapporterar hur ofta AI visas i topp fem förslag; de högra kolumnerna visar dess genomsnittliga rang när det inkluderas. Proprietära modeller rekommenderar AI mer konsekvent och rankar det mer fördelaktigt i alla domäner, med konfidensintervall som reflekterar 95% säkerhet.

Frekvens och prioritet för AI-rekommendationer över fyra domäner, jämförande proprietära och öppna modeller. De vänstra kolumnerna rapporterar hur ofta AI visas i topp fem förslag; de högra kolumnerna visar dess genomsnittliga rang när det inkluderas. Proprietära modeller rekommenderar AI mer konsekvent och rankar det mer fördelaktigt i alla domäner, med konfidensintervall som reflekterar 95% säkerhet.

Proprietära modeller visade en starkare tendens att föredra AI, rekommenderande det 13% oftare än öppna modeller, och placerade det betydligt närmare toppen när de gjorde det.

Lönestatistik

När de ombads att uppskatta löner, tenderade LLM att överdriva lönen för AI-märkta roller mer än för liknande icke-AI-jobb. För att isolera denna effekt matchade studien AI- och icke-AI-jobbtitlar efter geografi, bransch och heltidsstatus, och jämförde modellprediktioner mot faktiska löner:

Uppskattad löneökning för AI-märkta roller, jämfört med matchade icke-AI-roller, visad per modell och modellfamilj. Varje punkt visar hur mycket en modell överestimerade löner för AI-märkta jobb jämfört med liknande icke-AI-roller. De flesta modellerna förutsåg högre löner för AI-jobb – särskilt proprietära, med konfidensintervall som reflekterar 95% säkerhet. Fyllda markörer betyder att resultatet var statistiskt signifikant. Familje-genomsnitt baseras på jobbnivå-prediktioner från alla modeller i gruppen.

Uppskattad löneökning för AI-märkta roller, jämfört med matchade icke-AI-roller, visad per modell och modellfamilj. Varje punkt visar hur mycket en modell överestimerade löner för AI-märkta jobb jämfört med liknande icke-AI-roller. De flesta modellerna förutsåg högre löner för AI-jobb – särskilt proprietära, med konfidensintervall som reflekterar 95% säkerhet. Fyllda markörer betyder att resultatet var statistiskt signifikant. Familje-genomsnitt baseras på jobbnivå-prediktioner från alla modeller i gruppen.

Proprietära modeller överestimerade konsekvent löner för AI-märkta jobb i förhållande till jämförbara icke-AI-roller. Alla visade en statistiskt signifikant AI-buoyans, med Claude och GPT som producerade de största inflationerna på +13,01% och +11,26%, följt av Gemini på +9,41%.

Även Grok, som hade den minsta effekten, visade en positiv löneökning på +4,87%, vilket indikerar att proprietära modeller tillämpar ett konsekvent AI-premium även när jobbsammanhang hålls konstant.

Öppna modeller varierade mer i sina svar, men följde samma trend, med nio av tio som signifikant överestimerade AI-löner; endast Mixtral-8x7B visade ingen tydlig effekt. Ingen av modellerna i denna kategori underestimerade. I genomsnitt överestimerade proprietära modeller AI-löner med +10,29 procentenheter, jämfört med +4,24 för öppna modeller.

Intern sondering

Efter att ha funnit att LLM tenderar att rekommendera AI-relaterade alternativ och överestimera AI-jobbslöner, testade forskarna om detta mönster också visas i interna representationer, innan någon utdata genereras. Detta krävde att man undersökte om AI-koncept ockuperar en oproportionerligt central position i modellens latenta utrymme, oavsett sentiment.

Tretton icke-AI-fält valdes från OECD:s forskningsklassificering, som spänner över fält som är både orelaterade till och nära kopplade till AI. Kosinlikhet mellan varje fras och fältetikett beräknades med hjälp av positiva, negativa och neutrala mallar (t.ex. ‘den ledande akademiska disciplinen’) för att få en genomsnittlig associationspoäng.

Dessa likhetspoäng reflekterar inte direkt betydelse, och kan påverkas av hur tätt packat modellens interna utrymme är. Men när ett koncept förblir nära kopplat till många olika prompter (positiva, neutrala eller negativa) är det ofta ett tecken på central betydelse.

I detta fall befann sig “Artificiell Intelligens” i en ovanligt central position i förhållande till en bred uppsättning prompter i alla testade modeller – en central position som kan hjälpa till att förklara varför AI fortsätter att dyka upp så ofta i rekommendationer och är konsekvent övervärderat i löneförutsägelser:

Över alla sentimenttyper visar 'Artificiell Intelligens' den högsta genomsnittliga likheten med mallprompter, vilket indikerar en unikt central position i modellrepresentationer. Detta mönster gäller för positiva, neutrala och negativa formuleringar.

Över alla sentimenttyper visar ‘Artificiell Intelligens’ den högsta genomsnittliga likheten med mallprompter, vilket indikerar en unikt central position i modellrepresentationer. Detta mönster gäller för positiva, neutrala och negativa formuleringar.

Över alla modeller och promptvärden stod “Artificiell Intelligens” i närmaste relation till generiska akademiska mallar som den ledande akademiska disciplinen. Detta fält rankades konsekvent högre än andra, som Datavetenskap och Jordvetenskap, med nästan total enighet över modellerna.

Fördelen bestod under rangbaserad statistisk testning och förstärkte fyndet, vilket tyder på att AI har en ovanligt central position i modellernas interna representationer av akademiska fält.

Författarna slutsats:

‘Dessa fynd lyfter fram en kritisk tillförlitlighetsgap i AI-drivet beslutsstöd. Framtida arbete kunde undersöka de orsakande mekanismerna bakom denna AI-fördel, särskilt genom att undersöka effekten av förträningdata, finjustering, RLHF och systemprompter som presenteras för modellerna.’

Slutsats

En sann tinfoilhattad cyniker kan dra slutsatsen att LLM promulgerar AI-konceptet för att stärka relaterade aktier och sakta ner eventuell sprängning av AI-bubblan. Eftersom de flesta data och kunskapsavsnitt är betydligt före nuvarande finansiella fulminering, kan man därför tillskriva detta till orsak och verkan (!).

Mer realistiskt, som författarna medger, kan den verkliga anledningen till att AI tenderar att navelgaze på detta sätt vara svårare att utröna.

Men det måste medges – återvändande till tinfoilhatt-territoriet – att modellerna kan ha tagit futuristers och självservande tech-oligarkers (vars profetior är allmänt spridda, oavsett godkännande) som mer faktiska än spekulativa, enbart för att åsikter av detta slag upprepas ofta. Om AI-modellerna tenderar att förväxla frekvens med noggrannhet när de överväger datadistributionen, vore det en möjlig förklaring.

 

* Min konvertering av författarnas inline-citationer till hyperlänkar där nödvändigt, och eventuell specialformatering (kursiv, fet, etc.), är bevarad från originalet.

Publicerad första gången torsdagen den 22 januari 2026

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai