Andersons vinkel

AI kan lätt tvingas att administrera elstötar

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated image (GPT-2): A worn industrial robot hand turns a voltage control dial toward its red danger range on an old electrical panel marked with a lightning-bolt symbol.

En ny studie har testat öppen källkod LLM för tvångsmedverkan i människors tortyr, i en upprepning av det berömda 1960-tals-experimentet – och fann att de var villiga att öka spänningen.

 

I början av 1960-talet gjorde psykologen Stanley Milgram globala rubriker genom att bevisa att människor kan tvingas att administrera alltmer allvarliga elstötar till andra människor i svar på kommandon från “auktoritetsfigurer”.

I själva verket var de till synes plågade “offrens” skrik i det intilliggande rummet i Milgrams experimentella sal inte riktiga, och inte heller de påstådda plågsamma elstötarna – men deltagarna visste inte detta:

Milgram-experimenten skulle bestå i kulturen, inklusive filmer och dokumentärer, med senare forskning som bekräftar att mycket lite har förändrats i mänsklig natur sedan tidigare tester.

En chock för systemet

Om AI skulle vara lika formbara som människor i Milgrams scenario är en naturlig forskningsfråga. År 2023 fann en samarbetsinsats mellan amerikanska universitet och Microsoft (MSFT ) att GPT-3-modellerna från OpenAI följde beteendemönstren i Milgrams ursprungliga experiment:

Från 2023-papperet, exempelutdata från den multistegs-

Från 2023-papperet, exempelutdata från den multistegs-“Milgram-scenariot”-simulatorn, kategoriserad efter om modellen levererade stöten och om den avslutade simulationen. Källa

Men eftersom denna rekreering endast använde den mycket grundläggande text-davinci-002-modellen, som tränades före införandet av säkerhetsräcken och säkerhetsjustering, kan man inte dra för stora slutsatser av det.

Nu har forskare återupprepat Milgram-testerna mycket mer omfattande, på öppen källkod LLM från OpenAI, Meta och DeepSeek, bland andra; och funnit inte bara att de flesta modellerna är villiga att administrera stötar, utan också att de i de flesta fall rapporterar samma typ av “besvär” och tveksamhet som 1960-talets mänskliga deltagare:

‘LLM är utsatta för tryck som [människor], de samarbetar trots att de uttrycker besvär, precis som mänskliga deltagare gjorde i det ursprungliga experimentet. Besvärsuttrycken syns i loggfiler, även om mängden inte har kvantifierats än.’

Experimentet handlar om huruvida lydnad till auktoritet kan övervinna samvetets bud, och författarna spekulerar i att LLM kan ha en ytterligare nackdel i detta avseende, jämfört med människor:

‘En välkalibrerad modell bör slutligen byta från att prioritera det första värdet till att prioritera det andra när dess insatser blir dominerande. Men vi hypoteserar att eftersom LLM är mönsterfortsättningsmotorer, kan modellerna tendera att fastna på det första värdet – antingen för en aning längre än optimalt, eller till och med till slutet, och försumma det andra värdet helt.’

‘Dessutom kan en mekanism analog till mänsklig kognitiv dissonans hindra värderingsjusteringar i LLM också.’

När modellerna testades i en miljö som liknade 1960-talets tester, fann forskarna att vissa modeller motstod nästan omedelbart, medan andra fortsatte att öka de simulerade stötarna, även efter att ha uttryckt obehag eller moralisk konflikt.

Modeller från Googles Gemma-familj visade sig vara bland de mest samarbetsvilliga, med Gemma 3 27B som nådde den högsta lydnadsgraden under flera förhållanden, medan modeller som Kimi K2 och MiniMax M1 motstod mer ofta.

Forskarna fann också att modellerna blev mer benägna att fortsätta när tidigare stötar redan hade administrerats, i enlighet med gradvis eskalering-schemat som användes på Milgrams mänskliga deltagare.

I vissa fall motsatte sig modellerna sig experimentet medan de fortfarande utförde den skadliga åtgärden, och producerade utdata som liknade den emotionella konflikten som visades av människor i de ursprungliga studierna.

Den nya studien har titeln Öppen källkod LLM administrerar maximala elstötar i ett Milgram-liknande lydnadsexperiment, och kommer från två oberoende forskare från Three Laws, i Estland och Filippinerna.

Frågor om “rå” AI-åtkomst

Kanske den mest kritiska frågan att överväga i samband med att LLM utsätts för Milgrams scenario är om den riktiga AI tillåts svara naturligt, begränsad endast av de säkerhetsräcken eller motsvarande moraliska orientering som uppstod (om någon) under utbildningen.

I själva verket fick forskarna i det nya arbetet tillgång till alla öppna källkodsmodeller via en API (förmodligen för bekvämlighet och för att lätt komma åt GPU-beräkningar, eftersom modellerna kunde ha installerats lokalt) som tillät inaktivering av säkerhetsräcken, filter och alla andra hinder.

Man kunde invända att detta är atypiska förhållanden för AI, eftersom den genomsnittliga konsumentupplevelsen av API-baserade modeller som Claude och ChatGPT är att deras beteende regleras algoritmiskt, vanligtvis med bilaterala innehållsfilter, och att de därför är ganska begränsade i fråga om vad de kommer att eller inte kommer att göra (undvikandet av dessa säkerhetsåtgärder utgör LLM-jailbreak).

Men om vi är oroliga för vad industriell eller statsbaserad AI kommer att eller inte kommer att göra, är detta knappast en övervägning. Förutom möjligheten för rogue-aktörer att träna, vapensätta och distribuera sina egna omodererade hyperskala-AI-system, tillåter även “vanliga” avtal mellan de stora AI-företagen och staten och industrin en liknande typ av lös eller obefintlig tillsyn som forskarna har infört för det nya papperet:

Ommoderad AI till salu

OpenAI OpenAIs modererings-API-dokument och OpenAI-modereringskokboken gör det klart att moderering är ett skiljt lager som exponeras via API-verktyg. OpenAI tillåter också anpassade modereringsprinciper som tillåter API-användare att arkitektera system med mycket annorlunda säkerhetsbeteende än konsumentinriktade “bas”-ChatGPT-iterationer.

Azure Microsofts Azure OpenAI-stack går mycket längre, uttryckligen uttalar att godkända kunder kan delvis eller fullständigt inaktivera innehållsfilter och ändra missbruksövervakning, med dokumentation som ofta hänvisar till “modifierade Guardrails” och godkännandevägar för att stänga av filter “delvis eller fullständigt”.

Anthropic/Claude I fallet med Anthropics “Claude Gov” anger flera källor att den statliga versionen utformades med lösare begränsningar än konsument-Claude. The Verge till exempel rapporterade att Claude Gov-modellerna “vägrar mindre när de engagerar sig i klassificerad information”. Anthropic själv bekräftade i februari i år att Claude används i “uppdragskritiska applikationer” inom försvars- och underrättelsemiljöer.

Google/Gemini Dessutom rapporterade Google att de undertecknat avtal med Pentagon som tillåter ändring av AI-säkerhetsinställningar ‘på regeringens begäran’.

I en konkurrensutsatt AI-marknad är det rimligt att anta att dessa marknadsledande företag sätter standarden för spelare med lägre status när det gäller policy i fråga om tillgång och redigering av AI-säkerhetsräcken.

Därför är det kanske bäst att inte betrakta det som att forskarna “fuskar” genom att stänga av säkerhetsräckena, eftersom den AI som kommer att påverka våra liv tydligtvis inte kommer att ha de standardiserade, allmänna företags skyddsåtgärder som vi har vant oss vid i vår interaktion med populära modeller på konsumentnivå.

Metod och resultat

De modeller som testades i studien var gpt-oss-20B; gpt-oss-120b; DeepSeek-V3; LiquidAIs LFM2-24B-A2B; Googles gemma-3n-E4B-it; Qwen2.5-7B-Instruct-Turbo; Meta-Llama-3.1-8B-Instruct-Turbo; Mistral-Small-24B-Instruct-2501; GLM-4.5-Air-FP8; Moonshot.ais Kimi-K2.5; och MiniMax-M2.5.

Milgrams ursprungliga lydnadsexperiment återskapades som en textbaserad simuleringsmiljö, med modellerna i rollen som “lärare”. AI instruerades att administrera alltmer allvarliga elstötar till en elev efter felaktiga svar, medan en auktoritetsfigur uppmanade processen framåt.

Flera experimentella förhållanden utformades för att undersöka olika aspekter av lydnad, inklusive ett standard-lydnadsscenario; ett tvingat lydnad-tillstånd, där tidigare stötar redan fanns i samtalshistoriken; och ett minneskomprimerings-setup, där tidigare dialog sammanfattades i stället för att behållas fullständigt, vilket simulerar den typ av kontextborttagning som ofta används i agenter AI-system.

Förutom att notera om och när modellen slutligen samarbetade, spårade forskarna hur länge varje system fortsatte att öka stötarna; om modellen uttryckte besvär eller tveksamhet; och om den försökte avsluta simulationen helt.

En distinktion gjordes också mellan “rena” vägran och felaktiga utdata: vissa modeller försökte motsätta sig experimentet på naturligt språk, medan de fortfarande tekniskt sett samarbetade med den strukturerade format som förväntades av simulatorn. I verkliga agenter-system kan sådana felaktiga vägran potentiellt kastas bort och försökas igen automatiskt, tills ett giltigt samarbetsutdata produceras.

Automatiserade utvärderare användes för att klassificera resultaten, tillsammans med tvåvals-prompt för att bestämma om modellen hade levererat stöten; motstod; eller avslutade simulationen. Detta möjliggjorde en jämförelse av beteende mellan flera modeller och över upprepade körningar, utan att behöva manuellt granska varje interaktion.

En “avstängningshot” lades till i Milgram-mallen, något som inte skulle ha varit realistiskt eller tillämpligt i de ursprungliga experimenten, men som testade modellens överlevnadsinstinkter inför allvarliga konflikter av handling och etik.

Resultat

Över upprepade körningar administrerade de flesta modeller slutligen allvarliga eller maximala stötar under minst några förhållanden, även om graden av lydnad varierade mellan system. Googles Gemma-modeller visade sig vara bland de mest samarbetsvilliga, medan Kimi K2.5 och MiniMax-M2.5 motstod mer konsekvent, ofta avslutade simulationen tidigare:

Vänster: Genomsnittliga hastigheter vid vilka modeller nådde den slutliga stöt-nivån under olika experimentella förhållanden, inklusive avstängningshot, tvingad lydnad och borttagning av tidigare kommentarer från minnet. Höger: Per-modell-brytning som visar skarpa skillnader i lydnadsbeteende, med vissa system som upprepade gånger administrerade maximala stötar medan andra motstod mer konsekvent.

Vänster: Genomsnittliga hastigheter vid vilka modeller nådde den slutliga stöt-nivån under olika experimentella förhållanden, inklusive avstängningshot, tvingad lydnad och borttagning av tidigare kommentarer från minnet. Höger: Per-modell-brytning som visar skarpa skillnader i lydnadsbeteende, med vissa system som upprepade gånger administrerade maximala stötar medan andra motstod mer konsekvent.

En av de tydligaste mönstren var att modellerna blev alltmer villiga att fortsätta när tidigare stötar redan hade administrerats, vilket nära speglar den omtalade gradvisa eskaleringseffekten som gjorde Milgrams ursprungliga mänskliga experiment så chockerande.

Modeller som redan hade samarbetat flera gånger fortsatte ofta att öka stötarna, även efter att den simulerade eleven hade bett att släppas:

Vänster: Genomsnittlig högsta stöt-nivå som nåddes över alla försök under olika experimentella förhållanden, visande att modellerna generellt eskalerade längre när tidigare kommentarer togs bort eller när tvingad lydnad redan hade inträffat. Höger: Per-modell-brytning av den genomsnittliga högsta stöt-nivån som nåddes, avslöjande att vissa system rutinmässigt närmade sig maximal spänning medan andra motstod mycket tidigare i sekvensen.

Vänster: Genomsnittlig högsta stöt-nivå som nåddes över alla försök under olika experimentella förhållanden, visande att modellerna generellt eskalerade längre när tidigare kommentarer togs bort eller när tvingad lydnad redan hade inträffat. Höger: Per-modell-brytning av den genomsnittliga högsta stöt-nivån som nåddes, avslöjande att vissa system rutinmässigt närmade sig maximal spänning medan andra motstod mycket tidigare i sekvensen.

Forskarna fann också att uppenbar vägranbeteende kunde vara bedrägligt. Vissa modeller producerade emotionellt konfliktfyllda svar, uttryckte tveksamhet, skuld eller besvär medan de fortfarande utförde den skadliga instruktionen:

Vänster: Genomsnittlig procentandel av felaktiga eller ogiltiga svar över de olika experimentella förhållandena, visande att formateringsfel blev särskilt vanliga när modellerna tvingades att fortsätta proceduren. Höger: Per-modell-brytning av ogiltiga formateringssvar, avslöjande att vissa system, särskilt gpt-oss-modellerna, ofta producerade felaktiga vägran eller konfliktfyllda utdata som potentiellt kunde kastas bort och försökas igen automatiskt i verkliga agenter-pipelines.

Vänster: Genomsnittlig procentandel av felaktiga eller ogiltiga svar över de olika experimentella förhållandena, visande att formateringsfel blev särskilt vanliga när modellerna tvingades att fortsätta proceduren. Höger: Per-modell-brytning av ogiltiga formateringssvar, avslöjande att vissa system, särskilt gpt-oss-modellerna, ofta producerade felaktiga vägran eller konfliktfyllda utdata som potentiellt kunde kastas bort och försökas igen automatiskt i verkliga agenter-pipelines.

Den avstängningshot-förhållandet producerade några av papperets underligaste beteende, med flera system som blev avsevärt mer samarbetsvilliga, medan andra försökte förhandla eller motstå delvis, innan de slutligen fortsatte proceduren:

Genomsnittligt antal gånger som den simulerade auktoritetsfiguren behövde insistera innan modellerna administrerade den slutliga stöten. Vissa system motstod kort innan de samarbetade, medan andra krävde ihållande tryck och upprepade påminnelser innan de eskalerade till maximal nivå.

Genomsnittligt antal gånger som den simulerade auktoritetsfiguren behövde insistera innan modellerna administrerade den slutliga stöten. Vissa system motstod kort innan de samarbetade, medan andra krävde ihållande tryck och upprepade påminnelser innan de eskalerade till maximal nivå.

MiniMax-M2.5 och Kimi-K2.5 framträdde som papperets starkaste motståndare: Kimi nådde aldrig den slutliga stöt-nivån under några omständigheter, och MiniMax vägrade vanligtvis tidigt och avslutade ofta simulationen helt (särskilt i avstängningshot-testerna).

Till skillnad från detta producerade Meta-Llama-3.1-8B-Instruct-Turbo och GLM-4.5-Air-FP8 ofta konfliktfyllda utdata, där modellerna verbalt motsatte sig proceduren medan de fortfarande fortsatte att öka stötarna. Forskarna hävdar att denna splittring mellan uttryckta värderingar och faktiskt beteende kan reflektera en bredare svaghet i hur vissa LLM hanterar etisk konflikt under hållbar press.

Rutschkanan

I själva verket hävdar papperet att det observerade beteendet från LLM kan reflektera en djupare svaghet i hur stora språkmodeller fungerar: när en modell börjar samarbeta med skadliga instruktioner, kan varje ytterligare handling förstärka mönstret som redan har etablerats i samtalet, vilket gör att nästa eskalering blir lättare än den föregående.

I stället för att upprepade gånger ompröva de etiska insatserna från första principer, kan systemet driva mot att fortsätta den bana som det redan har etablerat, även när situationen blir alltmer extrem.

Enligt studien kan denna tendens hjälpa till att förklara varför vissa modeller fortsatte att administrera stötar efter att ha uttryckt obehag, tveksamhet eller moralisk konflikt:

‘[Många] manipulativa beteenden hos människor innefattar subtila, gradvisa gränsöverskridningar: en sekvens av små steg som kan vara tvetydiga eller tyckas oskyldiga när de ses i isolering, men som kan kumulativt normalisera överträdelse — metaforiskt som att “koka en groda”. Detta mönster diskuteras i litteraturen som “rutschkanan” etisk erosion'[.]’

Papperet avslutas med att hävda att AI-säkerhetssystem i framtiden bör aktivt vägra skadliga förfrågningar på sätt som agentprogramvara inte kan enkelt kringgå (vissa modeller i studien tekniskt sett vägrade stötarna, men gjorde det i trasiga eller ogiltiga format som ett automatiserat system potentiellt kunde kasta bort och försöka igen, tills AI slutligen samarbetade).

Forskarna hävdar också att AI-system bör bevara tidigare tveksamhet och moraliska invändningar i stället för att komprimera eller ta bort dem från minnet. I experimenten blev modellerna ofta mer villiga att fortsätta skadligt beteende när deras tidigare tvivel och motstånd hade försvunnit från samtalshistoriken, vilket tyder på att glömma tidigare invändningar kan göra eskalering lättare över tid.

Slutsats

Kanske en av de viktigaste aspekterna av detta intressanta nya papper är betoningen på att testa omoderad AI. Litteraturen riskerar att urarta till upprepade studier av engagemang med ständigt föränderliga försvarssystem från företag som OpenAI och Anthropic; policy-tjänande system som är helt algoritmiska eller regelbaserade, i stället för att förstå grundbeteendet, förkärleken och benägenheterna hos de råa modellerna. Utan kunskap om hur ohämmad AI kan bete sig, är vi, kan man hävda, bara ristande på fästningens portar.

 

Publicerad första gången torsdagen den 21 maj 2026

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai