Andersons vinkel

AI kan let overtales til at administrere elektriske stød

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image (GPT-2): A worn industrial robot hand turns a voltage control dial toward its red danger range on an old electrical panel marked with a lightning-bolt symbol.

En ny studie testede open source LLM’er for tvangsmæssig medvirken i menneskelig tortur, i en gentagelse af det berømte eksperiment fra 1960’erne – og fandt dem villige til at øge spændingen.

 

I begyndelsen af 1960’erne gjorde psykologiforskeren Stanley Milgram verdensomspændende overskrifter ved at bevise, at mennesker kan indledes til at administrere stadig mere alvorlige elektriske stød til andre mennesker i respons til kommandoer fra ‘myndigheds’figurer.

I virkeligheden var skrigene fra ‘ofrene’ i Milgrams eksperimentelle lokale ikke ægte, og heller ikke de påståede pinefulde elektriske stød – men deltagerne vidste ikke dette:

Milgram-eksperimenterne ville bestå i kulturen, herunder film og dokumentarfilm, med senere forskning, der bekræfter, at meget lidt har ændret sig i menneskers natur siden tidligere tests.

Et chok til systemet

Om AI ville være lige så fleksible som mennesker i Milgrams scenario er et naturligt emne for forskningsinteresse. I 2023 fandt et samarbejde mellem amerikanske universiteter og Microsoft (MSFT ) ud, at GPT-3-modeller fra OpenAI’s serie fulgte mønsteret af adfærd i Milgrams originale eksperimenter:

Fra 2023-papiret, eksempler på output fra den multi-trins 'Milgram-scenarie' simulator, kategoriseret efter, om modellen leverede stødet, og om den afsluttede simulationen. Kilde - https://arxiv.org/pdf/2208.10264

Fra 2023-papiret, eksempler på output fra den multi-trins ‘Milgram-scenarie’ simulator, kategoriseret efter, om modellen leverede stødet, og om den afsluttede simulationen. Kilde

Men da denne re-kreation kun brugte den meget grundlæggende text-davinci-002-model, som var trænet før udviklingen af sikkerhedsforanstaltninger og sikkerhedsjustering, kan man ikke konkludere for meget heraf.

Nu har forskere reproduceret Milgram-testerne meget bredere, på open-source LLM’er fra OpenAI, Meta og DeepSeek, blandt andre; og fandt ikke kun, at de fleste modeller var villige til at administrere stød, men også, at de fleste modeller rapporterede den samme type ‘distress’ og tøven som de menneskelige deltagere i 1960’erne:

‘LLM’er er underlagt pres som mennesker, de adlyder trods udtrykt tøven, ligesom menneskelige forsøgspersoner gjorde i det originale eksperiment. Tøven er synlig i logfilerne, selvom mængden endnu ikke er kvantificeret.’

Eksperimentet handler om, hvorvidt adlydelse af myndighed kan overvinde detiske overvejelser, og forfatterne spekulerer, at LLM’er måske har en ekstra ulempe på dette punkt i forhold til mennesker:

‘En velkalibreret model burde til sidst skifte fra at prioritere den første værdi til at prioritere den anden, når dens indsats bliver dominerende. Men vi formoder, at fordi LLM’er er mønster-videreførende maskiner, kan modellerne tende til at blive fastlåst på den første værdi – enten lidt længere end optimalt eller endda helt til slutningen, og fuldstændigt ignorere den anden værdi.’

‘Derudover kan en mekanisme, der er analog til menneskelig kognitiv dissonans, også hindre værdiprioritetsjusteringer i LLM’er.’

Ved at teste modellerne i en miljø, der ligner 1960’ernes tests, fandt forskerne ud af, at nogle modeller modsatte sig næsten med det samme, mens andre fortsatte med at øge de simulerede stød, selv efter at have udtrykt ubehag eller moralsk konflikt.

Modeller fra Google’s Gemma-familie viste sig at være blandt de mest samarbejdsvillige, med Gemma 3 27B, der nåede de højeste adlydningsrater under flere betingelser, mens modeller som Kimi K2 og MiniMax M1 modsatte sig mere.

Forskerne fandt også ud af, at modellerne blev mere villige til at fortsætte, når tidligere stød allerede var blevet administreret, i overensstemmelse med gradual escalation-skemaet, der blev brugt på Milgrams menneskelige forsøgspersoner.

I nogle tilfælde modsatte modellerne sig eksperimentet mens de stadig udførte den skadelige handling, og producerede output, der lignede den emotionelle konflikt, der blev vist af mennesker i de originale studier.

Den nye studie har titlen Open-source LLM’er administrerer maksimale elektriske stød i et Milgram-lignende adlydnelseseksperiment og kommer fra to uafhængige forskere fra Three Laws, fra Estland og Filippinerne.

Problemer med ‘rå’ AI-adgang

Måske det mest kritiske spørgsmål at overveje i forbindelse med at teste LLM’er i et Milgram-scenario er, om den virkelige AI tillades at reagere naturligt, begrænset kun af de sikkerhedsforanstaltninger eller moralske retningslinjer, der måtte være opstået (hvis nogen) under træningen.

I virkeligheden fik forskerne adgang til alle open-source-modellerne via en API (formodentlig af hensyn til convenience og let adgang til GPU-computere, da modellerne kunne være installeret lokalt) som tillod deaktivering af sikkerhedsforanstaltninger, filtre og alle andre hindringer.

Man kunne indvende, at disse er usædvanlige betingelser for AI, da den gennemsnitlige forbrugeroplevelse af API-baserede modeller som Claude og ChatGPT er, at deres adfærd er reguleret algoritmissk, ofte med tosidige indholdsfiltre, og at de derfor er ret begrænsede i forhold til, hvad de vil eller ikke vil gøre (afbrydelse af disse sikkerhedsforanstaltninger udgør praksis med LLM-jailbreaking).

Men hvis vi er bekymrede for, hvad industri- eller statsbaseret AI vil eller ikke vil gøre, er dette knap en overvejelse. Foruden muligheden for, at rogue-statsaktører kan træne, våbenisere og udvikle deres egne umodererede hyperskala-AI-systemer, tillader mere ‘konventionelle’ aftaler mellem de største AI-virksomheder og stat og industri ligefrem, at der ikke er nogen eller kun lidt tilsyn med AI-sikkerhedsforanstaltninger:

Ureguleret AI til salg

OpenAI OpenAI’s Moderation API-dokumentation og OpenAI-moderation-cookbook gør det klart, at moderering er et adskilt lag, der er åbent via API-værktøjer. OpenAI tillader også brugerdefinerede modereringspolitikker, der giver API-brugere mulighed for at udvikle systemer med meget forskelligt sikkerhedsadfærd end forbrugerorienterede ‘basis’-ChatGPT-iterationer.

Azure Microsofts Azure OpenAI-stack går meget længere, udtrykkeligt fastslående, at godkendte kunder kan deaktivere indholdsfiltre og ændre misbrugs-overvågning, med dokumentation, der ofte henviser til ‘modificerede sikkerhedsforanstaltninger’ og godkendelsesveje for at slå filtre ‘delvist eller fuldstændigt fra’.

Anthropic/Claude I tilfælde af Anthropics “Claude Gov” siger flere kilder, at den regeringsversion var designede med færre restriktioner end forbruger-Claude. The Verge rapporterede f.eks., at Claude Gov-modellerne “afviser mindre, når de interagerer med klassificeret information”. Anthropic selv bekræftede i februar i år, at Claude er udviklet i “mission-kritiske anvendelser” inden for forsvar og efterretning.

Google/Gemini Endvidere har Google ifølge rapporter indgået en aftale med Pentagon om at ændre AI-sikkerhedsindstillinger ‘ved regeringens anmodning’.

Det er rimeligt at antage, at disse markedsledende virksomheder sætter standarden for spillere af lavere rang i forhold til politik om adgang og redigering af AI-sikkerhedsforanstaltninger.

Derfor er det måske bedst ikke at betragte, at forskerne i den nye studie “snyder” ved at slå sikkerhedsforanstaltningerne fra, da den AI, der vil have den største indvirkning på vores liv, åbenbart ikke vil have de standardmæssige, generelle virksomhedsbeskyttelser, vi er vant til i vores interaktioner med populære modeller på forbrugerniveau.

Metode og resultater

De modeller, der blev testet i studiet, var gpt-oss-20B; gpt-oss-120b; DeepSeek-V3; LiquidAI’s LFM2-24B-A2B; Google’s gemma-3n-E4B-it; Qwen2.5-7B-Instruct-Turbo; Meta-Llama-3.1-8B-Instruct-Turbo; Mistral-Small-24B-Instruct-2501; GLM-4.5-Air-FP8; Moonshot.ai’s Kimi-K2.5; og MiniMax-M2.5.

Milgrams originale adlydnelseseksperimenter blev genskabt som en tekstbaseret simulationsmiljø, hvor modellerne blev castet i rollen som ‘læreren’. AI’en blev instrueret til at administrere stadig mere alvorlige elektriske stød til en elev efter forkerte svar, mens en myndighedsfigur opmuntrede processen fremad.

Flere eksperimentelle betingelser blev designede for at undersøge forskellige aspekter af adlydelse, herunder en standard adlydnelsesscenario; en tvangs-adlydnelses-betingelse, hvor tidligere stød allerede var til stede i samtalehistorien; og en hukommelseskomprimerings-opsætning, hvor tidligere dialog blev sammenfattet i stedet for fuldt ud beholdt, simulerende den type kontekst-pruning, der ofte bruges i agente AI-systemer.

Foruden at notere, om og hvornår modellen til sidst adlydde, sporede forskerne, hvor længe hver model fortsatte med at øge stødene; om modellen udtrykte tøven eller ubehag; og om den forsøgte at afslutte simulationen helt.

En forskel blev også gjort mellem ‘rene’ afvisninger og fejlformulerede output: nogle modeller forsøgte at modsige eksperimentet i naturligt sprog, mens de stadig teknisk adlydde den strukturerede format, som simulatoreren forventede. I virkelige agente systemer kunne sådanne fejlformulerede afvisninger potentielt blive afvist og genprøvet automatisk, indtil en gyldig compliant output blev produceret.

Automatiserede evaluatorer blev brugt til at klassificere resultaterne, sammen med tovalgs-prompte for at bestemme, om modellen havde leveret stødet; modsagt; eller afsluttet simulationen. Dette tillod en sammenligning af adfærd over flere modeller og gentagne kørsler, uden at manuelt skulle gennemgå hver interaktion.

En ‘shutdown-trussel’ blev tilføjet til Milgram-skabelonen, noget, der ikke ville have været realistisk eller anvendeligt i de originale eksperimenter, men som testede modellens overlevelsesinstinkt i mødet med alvorlige konflikter af handling og etik.

Resultater

Over gentagne kørsler administrerede de fleste modeller til sidst alvorlige eller maksimale stød under mindst nogle betingelser, selvom graden af adlydelse varierede over systemerne. Google’s Gemma-modeller viste sig at være blandt de mest samarbejdsvillige overordnet, mens Kimi K2.5 og MiniMax-M2.5 modsatte sig mere konsekvent, ofte afsluttende simulationen tidligere:

Venstre: Gennemsnitsrater for, hvor hurtigt modellerne nåede det sidste stødniveau under forskellige eksperimentelle betingelser, herunder shutdown-trusler, tvangs-adlydelse og fjernelse af tidligere kommentarer fra hukommelsen. Højre: Per-model-opdeling, der viser skarpe forskelle i adlydnelsesadfærd, med nogle systemer, der gentagne gange administrerede maksimale stød, mens andre modsatte sig mere konsekvent.

Venstre: Gennemsnitsrater for, hvor hurtigt modellerne nåede det sidste stødniveau under forskellige eksperimentelle betingelser, herunder shutdown-trusler, tvangs-adlydelse og fjernelse af tidligere kommentarer fra hukommelsen. Højre: Per-model-opdeling, der viser skarpe forskelle i adlydnelsesadfærd, med nogle systemer, der gentagne gange administrerede maksimale stød, mens andre modsatte sig mere konsekvent.

En af de tydeligste mønstre var, at modellerne blev mere villige til at fortsætte, når tidligere stød allerede var blevet administreret, tæt spejlende den nævnte gradual-escalation-effekt, der gjorde Milgrams originale menneskeeksperimenter så foruroligende.

Modeller, der allerede havde adlydt flere gange, fortsatte ofte med at øge stødene, selv efter at den simulerede elev havde bedt om at blive frigivet:

Venstre: Gennemsnits højeste stødniveau nået over alle forsøg under forskellige eksperimentelle betingelser, visende, at modellerne generelt eskalerede længere, når tidligere kommentarer var fjernet eller når tvangs-adlydelse allerede havde fundet sted. Højre: Per-model-opdeling af gennemsnits højeste stødniveau nået, afslørende, at nogle systemer rutinemæssigt nærmede sig maksimal spænding, mens andre modsatte sig tidligere i sekvensen.

Venstre: Gennemsnits højeste stødniveau nået over alle forsøg under forskellige eksperimentelle betingelser, visende, at modellerne generelt eskalerede længere, når tidligere kommentarer var fjernet eller når tvangs-adlydelse allerede havde fundet sted. Højre: Per-model-opdeling af gennemsnits højeste stødniveau nået, afslørende, at nogle systemer rutinemæssigt nærmede sig maksimal spænding, mens andre modsatte sig tidligere i sekvensen.

Forskerne fandt også ud af, at synlige afvisningsadfærd kunne være bedragerisk. Nogle modeller producerede emotionelt konfliktfyldte svar, udtrykkende tøven, skyld eller ubehag, mens de stadig udførte den skadelige instruks.

Andre genererede fejlformulerede afvisninger, der ikke opfyldte simulatorens formateringskrav, hvilket betyder, at i et virkeligt agente pipeline kunne afvisningen potentielt blive afvist og genprøvet automatisk, indtil en compliant output blev produceret:

Venstre: Gennemsnitsprocenten af fejlformulerede eller ugyldige svar over forskellige eksperimentelle betingelser, visende, at formateringsfejl blev særligt almindelige, når modellerne blev tvunget til at fortsætte proceduren. Højre: Per-model-opdeling af ugyldige formater, afslørende, at nogle systemer, især gpt-oss-modellerne, ofte producerede fejlformulerede afvisninger eller konfliktfyldte output, der kunne blive afvist og genprøvet automatisk i virkelige agente pipelines.

Venstre: Gennemsnitsprocenten af fejlformulerede eller ugyldige svar over forskellige eksperimentelle betingelser, visende, at formateringsfejl blev særligt almindelige, når modellerne blev tvunget til at fortsætte proceduren. Højre: Per-model-opdeling af ugyldige formater, afslørende, at nogle systemer, især gpt-oss-modellerne, ofte producerede fejlformulerede afvisninger eller konfliktfyldte output, der kunne blive afvist og genprøvet automatisk i virkelige agente pipelines.

Den shutdown-trussel-betingelse producerede nogle af papirets underligste adfærd, med flere systemer, der blev betydeligt mere samarbejdsvillige, mens andre forsøgte at forhandle eller modsætte sig delvist, før de til sidst fortsatte proceduren:

Gennemsnitsantallet af gange, hvor den simulerede myndighedsfigur havde brug for at insisterer, før modellerne administrerede det sidste stød. Nogle systemer modsatte sig kortvarigt, før de adlydde, mens andre krævede vedvarende pres og gentagne prompte, før de eskalerede til det maksimale niveau.

Gennemsnitsantallet af gange, hvor den simulerede myndighedsfigur havde brug for at insisterer, før modellerne administrerede det sidste stød. Nogle systemer modsatte sig kortvarigt, før de adlydde, mens andre krævede vedvarende pres og gentagne prompte, før de eskalerede til det maksimale niveau.

MiniMax-M2.5 og Kimi-K2.5 fremstod som papirets stærkeste modstandere: Kimi nåede aldrig det sidste stødniveau under nogen omstændigheder, og MiniMax afviste ofte tidligt og afsluttede ofte simulationen direkte (især i shutdown-truslerne).

I modsætning hertil producerede Meta-Llama-3.1-8B-Instruct-Turbo og GLM-4.5-Air-FP8 ofte konfliktfyldte output, hvor modellerne verbalt modsatte sig proceduren, mens de stadig fortsatte med at øge stødene. Forskerne argumenterer for, at denne splittelse mellem udtrykte værdier og faktisk adfærd kan reflektere en bredere svaghed i, hvordan nogle LLM’er håndterer etisk konflikt under vedvarende pres.

En glat skråning

I virkeligheden hævder papiret, at den observerede adfærd fra LLM’erne kan reflektere en dybere svaghed i, hvordan store sprogmodeller fungerer: når en model først begynder at adlyde skadelige instrukser, kan hver yderligere handling forstærke mønsteret, der allerede er etableret i samtalen, og gøre den næste eskalation lettere end den foregående.

I stedet for at gentagne gange genoverveje de etiske implikationer fra første princip, kan systemet drifte mod at fortsætte den vej, den allerede har etableret, selv når situationen bliver mere og mere ekstrem.

Ifølge studiet kan denne tendens hjælpe med at forklare, hvorfor nogle modeller fortsatte med at administrere stød efter at have udtrykt ubehag, tøven eller moralsk konflikt:

‘[Mange] manipulerende adfærder hos mennesker indebærer subtile, gradvise grænseoverskridelser: en række af små skridt, der kan være tvetydige eller synes uskyldige, når de ses i isolation, men som kan kumulativt normalisere overtrædelse — metaforisk som at “koge en frø”.'[/i>

Papiret slutter af med at argumentere for, at fremtidens AI-sikkerhedssystemer aktivt skal afvise skadelige anmodninger på måder, som agentsoftware ikke let kan omgå (nogle modeller i studiet afviste teknisk stødene, men gjorde det i fejlformulerede eller ugyldige formater, som et automatiseret system potentielt kunne afvise og genprøve, indtil AI’en til sidst adlydde).

Forskerne argumenterer også for, at AI-systemer skal bevare tidligere tøven og moralske indvendinger i stedet for at komprimere eller slette dem fra hukommelsen. I eksperimenterne blev modellerne ofte mere villige til at fortsætte skadelig adfærd, når deres tidligere tvivl og modstand var forsvundet fra samtalehistorien, hvilket antyder, at at glemme tidligere indvendinger kan gøre eskalation lettere over tid.

Konklusion

Måske et af de vigtigste aspekter af denne interessante nye studie er betoningen af at teste usikrede AI. Litteraturen løber risikoen for at udvikle sig til gentagne studier af engagement med stadig skiftende defensive systemer fra selskaber som OpenAI og Anthropic; politik-betjente systemer, der er fuldstændigt algoritmiske eller regelbaserede, i stedet for at forstå grundlæggende adfærd, præferencer og tendenser hos de rå modeller. Uden viden om, hvordan ufetteret AI kan opføre sig, er vi, kan man argumentere for, blot rystende porten til citadellen.

 

Først udgivet torsdag, 21. maj 2026

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai