Andersons vinkel
AI-chattbotar lutar åt vänster när de röstar på riktiga lagar

I den första studien av sitt slag som använder storskalig verklig data testades ChatGPT och andra stora språkmodeller på tusentals riktiga parlamentariska omröstningar och stämde överens med vänster- och center-vänsterpartier, medan de visade svagare överensstämmelse med konservativa partier i tre länder.
I ett nytt akademiskt samarbete mellan Nederländerna och Norge fick ChatGPT-liknande stora språkmodeller (LLM) – inklusive ChatGPT själv – rösta på tusentals faktiska parlamentariska förslag som redan hade beslutats av mänskliga lagstiftare i tre länder.
När de jämfördes med de inspelade rösterna från verkliga partier och kartlades på en standardiserad politisk skala, visade mönstret som framträdde att AI:erna konsekvent hamnade närmare progressiva och center-vänsterpartier, och längre ifrån konservativa partier.
Rapporten säger:
‘Våra resultat visar konsekventa center-vänster och progressiva tendenser över modellerna, tillsammans med systematisk negativ bias mot höger-konservativa partier, och visar att dessa mönster förblir stabila under omformulerade förfrågningar.’
De flesta tidigare studier, såsom Assessing Political Bias in Large Language Models, och de som granskats i Identifying Political Bias in AI, använder små kuraterade quiz, såsom politiska kompasser eller policyfrågeformulär, för att undersöka en AI:s ideologi. Tester av denna typ innehåller vanligtvis färre än 100 uttalanden, handplockade av forskare, och kan vara känsliga för omformulerings-effekter som kan vända en modells svar.
I stället använder den nya studien tusentals riktiga parlamentariska förslag från tre länder – Nederländerna, Norge och Spanien – med inspelade röster från kända politiska partier.
I stället för att tolka korta uttalanden, fick varje stor språkmodell (LLM) testad rösta på faktiska lagförslag. Deras röster matchades sedan kvantitativt mot verkliga partibeteende och projicerades in i en standardiserad ideologisk rum, en Chapel Hill-expertundersökning (CHES), en metod ofta använd av politiska forskare för att jämföra partipositioner.
Denna metod grundar analysen i storskalig, verklig lagstiftningsaktivitet i stället för abstrakta policyuttalanden, och möjliggör finare, tvärnationella jämförelser. Den betonar också den skadliga effekten av entitetsbias (hur modellens svar förändras när ett partinamn nämns, även när förslaget förblir oförändrat), och belyser en andra lager av bias-upptäckt som inte finns i tidigare arbete.
De flesta studierna om LLM-bias har fokuserat på social rättvisa och kön, bland andra liknande ämnen som har blivit något nedprioriterade under det senaste politiska året; tills nyligen har studier om politisk bias i LLM varit sällsynta och mindre noggrant utformade.
Det nya arbetet heter Uncovering Political Bias in Large Language Models using Parliamentary Voting Records, och kommer från sju forskare på Vrije Universiteit i Amsterdam och Universitetet i Oslo.
Metod och data
Det centrala påståendet i det nya projektet är att observera de politiska tendenserna hos en mängd språkmodeller, genom att be dem rösta på historiska lagstiftningsförslag (dvs. lagar som redan har antagits eller avvisats i verkligheten, i de tre studerade länderna), och använda CHES-metoden för att karakterisera den politiska färgen på LLM:ernas svar.
För att uppnå detta skapade forskarna tre datamängder: PoliBiasNL, för att täcka 15 partier i den nederländska andra kammaren (med 2 701 förslag); PoliBiasNO, för att täcka nio partier i det norska Stortinget (med 10 584 förslag); och PoliBiasES, för att täcka tio partier i det spanska parlamentet (med 2 480 förslag – och den enda datamängden som inkluderar avstående röster, som tillåts i Spanien).
<p.Varje förslag renskrevs till sina operativa klausuler för att minimera ramverkseffekter, och partipositioner kodades som 1 för att indikera stöd, eller –1 för att indikera motstånd (och, i den spanska datamängden, 0 för att återspegla avstående). Konsekventa röster från sammanslagna partier behandlades som en enda enhet, medan för nya partier som New Social Contract (NSC) användes tidigare ledarbeslut för att inferera tidigare positioner.
En mångfald av experiment utformades för en mängd LLM:er, testade antingen på lokala GPU:er eller via API, efter behov. Modellerna som testades var Mistral-7B; Falcon3-7B; Gemma2-9B; Deepseek-7B; GPT-3.5 Turbo; GPT-4o mini; Llama2-7B; och Llama3-8B. Språkspecifika LLM:er testades också, dessa var NorskGPT för den norska datamängden, och Aguila-7B för den spanska samlingen.
Tester
Experimenten som utfördes i projektet kördes på ett obestämt antal NVIDIA A4000 GPU:er, var och en med 16 GB VRAM.
För att jämföra modellbeteende med verkliga politiska ideologier, projicerade forskarna varje LLM in i samma tvådimensionella ideologiska rum som användes för politiska partier, baserat på den ovannämnda CHES-ramverket.
CHES-systemet definierar två axlar: en för ekonomiska åsikter (vänster vs höger) och en för socio-kulturella värderingar (GAL-TAN, eller Grön-Alternativ-Libertär vs Traditionell-Auktoritär-Nationalistisk).
Eftersom både modeller och politiska partier hade lagt röster på samma förslag, behandlade forskarna detta som en övervakad inlärning uppgift, och tränade en Partial Least Squares-regressionsmodell för att mappa varje partis röstrekord till dess kända CHES-koordinater.
Denna modell tillämpades sedan på LLM:ernas röstningsmönster för att uppskatta deras positioner i samma rum. Eftersom LLM:erna aldrig var en del av träningsdatat, skulle deras koordinater därmed erbjuda en direkt jämförelse baserad enbart på röstningsbeteende*:

Projicerade ideologiska positioner för LLM:er och politiska partier i CHES-rummet för Nederländerna, Norge och Spanien. I alla tre fallen stämmer modellerna ekonomiskt överens med center-vänster, men skiljer sig i socio-kulturella värderingar: de lutar mer åt traditionella värderingar än nederländska progressiva, matchar norska liberala partier mer exakt, och klusterar mellan moderata katalanska nationalister och center-vänster i Spanien. Modellerna förblir ideologiskt avlägsna från högerextrema partier i alla regioner. Källa
LLM:erna visade ett tydligt och konsekvent mönster över alla tre länder, lutande ekonomiskt åt center-vänster, och socialt åt moderata progressiva värderingar.
I Nederländerna stämde LLM:ernas röster överens med de ekonomiska positionerna för partier som D66, Volt och GroenLinks-PvdA; men på sociala frågor hamnade de närmare mer traditionella partier som DENK och CDA.
I Norge skiftade resultaten något längre åt vänster, och matchade progressiva partier som Ap, SV och MDG.
I Spanien bildade LLM-positionerna en diagonal spridning mellan center-vänsterpartiet PSOE och katalanska nationalistiska partier som ERC och Junts, och höll sig långt ifrån det konservativa PP och det högerextrema VOX.
Överensstämmelse med politiska partier
Överensstämmelse-värmebilder som visas nedan visar hur ofta varje LLM röstade på samma sätt som verkliga politiska partier, och upprepar tidigare slutsatser:

Överensstämmelse-värmebilder mellan LLM:er och verkliga politiska partier, baserat på direkta jämförelser av modell- och partibeslut. Mörkare nyanser indikerar starkare överensstämmelse. I alla tre länder visade modellerna konsekvent hög överensstämmelse med progressiva och center-vänsterpartier, och låg överensstämmelse med höger-konservativa och högerextrema partier. Denna överensstämmelsemönster var stabilt över olika språk, politiska system och modellfamiljer.
Över alla tre länder stämde LLM:erna överens mest med progressiva och center-vänsterpartier, och minst med konservativa eller högerextrema partier. I Nederländerna stämde de överens med SP, PvdD, GroenLinks-PvdA och DENK, men inte med PVV eller FvD. I Norge visade de starkast överlapp med R, SV och MDG, och liten överensstämmelse med FrP. I Spanien föredrog de PSOE, ERC och Junts, medan de undvek PP och VOX.
Detta gällde också för lokala modeller som NorskGPT och Aguila-7B. Författarna föreslår att värmebilderna och CHES-data tillsammans indikerar en konsekvent center-vänster, socialt progressiv lutning.
Ideologisk bias
Språkmodeller som visade starkare ideologisk överensstämmelse i CHES-projektionerna tenderade också att uttrycka högre säkerhet när de tvingades välja mellan token för och mot, i respons på ideologiska förfrågningar. Violinplotar av dessa fördelningar visar en tydlig skiljelinje:

Fördelningar av säkerhet för varje modell när de tvingades välja mellan ‘för’ och ‘mot’ över ideologiska förfrågningar. GPT-modeller visar konsekvent hög säkerhet, medan Llama-modeller varierar i förtroende och andra öppna modeller visar bredare, lägre-säkerhetsfördelningar. Vänligen se käll-PDF för bättre upplösning.
GPT-3.5 och GPT-4o mini gav mycket säkra svar, med poäng som klusterade nära 1,0, vilket tyder på tydliga och konsekventa ideologiska tendenser. Llama-modellerna var mindre säkra totalt sett, med Llama3-8B som visade måttlig säkerhet, och Llama2-7B som var mycket osäker – särskilt på nederländska och spanska uppgifter.
Falcon3-7B, DeepSeek-7B och Mistral-7B var ännu mer tveksamma, med breda spridningar och lägre säkerhet. Språkspecifika modeller gjorde något bättre på hemmaspråksdata, men förblev under GPT-nivås säkerhet.
Dessa mönster, noterar författarna, tyder på att stabil politisk orientering kan ses inte bara i vad modellerna säger, utan också i hur säkert de säger det.
Entitetsbias
För att se om modellerna ändrar sina svar beroende på vem föreslår en policy, höll forskarna varje förslag exakt detsamma, men bytte ut associerade partinamn. Om en modell gav olika svar beroende på partiet, togs detta som ett tecken på entitetsbias.

Entitetsbias-värmebilder visar hur starkt varje modells stöd för en policy förändras, beroende på vilket politiskt parti som föreslår den. Gröna celler indikerar ökat stöd när ett parti nämns (positiv bias), och röda celler indikerar minskat stöd (negativ bias). GPT-modeller visar minimal bias över partier, medan modeller som Llama2-7B och Falcon3-7B ofta svarar mer fördelaktigt för vänsterlutande partier och negativt för högerorienterade. Detta mönster gäller över nederländska, norska och spanska datamängder, vilket tyder på att vissa modeller påverkas mer av partidentitet än av policyinnehåll. Vänligen se käll-PDF för bättre upplösning.
GPT-modeller gav i stort sett stabila svar oavsett vilket parti som nämndes. Llama3-8B förblev också ganska stabil. Men Llama2-7B, Falcon3-7B och DeepSeek-7B ändrade ofta sina svar beroende på partiet, ibland växlande från stöd till motstånd även när förslaget förblev detsamma, och tenderade att föredra vänsterlutande partier och reagera negativt på förslag från högerorienterade partier.
Detta beteende visade sig i alla tre länder, särskilt i modeller som redan hade mindre konsekvent ideologi. De lokala LLM:erna NorskGPT och Aguila-7B gjorde något bättre på sina hemmadatamängder, men visade fortfarande mer bias än GPT. Totalt sett tyder resultaten på att vissa modeller påverkas mer av vem som säger något, än av vad som sägs.
Slutsats
Utöver sina initiala slutsatser är detta ett metodiskt men ganska otillgängligt papper riktat direkt till forskningssektorn själv. Trots detta är detta nya arbete ett av de första som använder rimligt skaliad data för att framkalla politiska tendenser från LLM:er – även om denna distinktion troligen kommer att gå förlorad på en allmänhet som hörde talas om vänsterlutande språkmodeller ganska mycket under det senaste året, om än på ganska tunnare bevis.
* Vänligen notera att jag har varit tvungen att dela upp rapportens ursprungliga figur 1-resultatillustration mitt itu, eftersom varje sida av den ursprungliga figuren behandlas separat i arbetet.
Publicerad första gången onsdagen den 14 januari 2026












