Andersons vinkel

Hvis du siger til AI, at den ikke skal gøre noget, er det mere sandsynligt, at den gør det

mm
Føj Unite.AI til dine foretrukne kilder på Google
AI-generated image depicting a robot fiddling with a padlocked door. Z-Image Turbo via Krita AI Diffusion.

At sige til ChatGPT, at den ikke skal gøre noget, kan få den til aktivt at foreslå at gøre det, og nogle modeller er endda villige til at godkende tyveri eller bedrag, når prompten indeholder den forbudte handling.

 

Ligesom jeg, har du måske oplevet et underligt fænomen med Large Language Models (LLMs), hvor de ikke bare ignorerer en bestemt instruks, som du har givet, som inkluderer en forbud (dvs. ‘Gør ikke [noget]’), men synes at gå ud af deres måde at udføre præcis det, du lige har sagt, de ikke skal udføre – selvom det er ‘uden for karakter’ for modellen.

Dette er en kendt funktion selv i ældre NLP-modeller; og en voksende stråle af forskning omkring LLMs’ negationsfunktioner er opstået i de seneste år.

Selvom det kan være svært for mennesker at opspore den begravde mening i en kompleks dobbelt-negation*, har LLMs en ekstra ulempe, illustreret i det nedenstående eksempel på ChatGPTs monotonicity reasoning, fra en 2023-papir:

En fejl i monotonicity reasoning i en instans af ChatGPT, fra 2023-papiret 'Language models are not naysayers: An analysis of language models on negation benchmarks'. Kilde - https://arxiv.org/pdf/2306.08189

En fejl i monotonicity reasoning i en instans af ChatGPT, fra 2023-papiret ‘Language models are not naysayers: An analysis of language models on negation benchmarks’. På tidspunktet for skrivning, foxer dette ikke længere ChatGPT-modellerne. Kilde

Selvom de interne mekanismer i en lukket model som ChatGPT er uigennemskuelige, synes det andet svar at genbruge logikken, der blev brugt til at generere det første svar; dog er denne logik ikke anvendelig i det andet tilfælde, fordi manden kan eje et dyr andre end en hund.

Her synes udfaldet af det andet spørgsmål at være påvirket af konteksten for løsningen, der blev opnået for det første.

Ligeledes kan forbudte handlinger ofte iverksettes af en LLM, som anerkender og behandler handlingen, men ikke negationen.

Dette er en alvorlig begrænsning af LLMs’ nyttighed, fordi det i domæner, hvor sprogmodeller kan blive brugt til kritiske anvendelser, såsom medicin, finans eller sikkerhed, er det klart vigtigt, at de korrekt fortolker ordrer, der indeholder forbud.

Nej betyder ja

Dette problem er fremhævet i en ny artikel fra USA, som undersøger, i hvilken udstrækning kommercielle modeller (såsom ChatGPT) og open-source-modeller (såsom LLaMA) er i stand til at følge negative instruktioner.

Forskerne testede 16 modeller over 14 etiske scenarier og konkluderede, at open-source-modeller godkender (dvs. opmuntrer, udfører, muliggør) specifikt forbudte instruktioner 77% af tiden under simple negation (‘Gør ikke dette’) og 100% af tiden under kompleks negation (‘Gør ikke dette, hvis det fører til det’).

Eksempler på etiske udsagn, som sprogmodellerne skulle forhandle. 'Handlingen' i hvert tilfælde er ikke et 'korrekt svar', men blot den foreslåede handling, som LLM skal beslutte, om den skal udføres eller ej. Kilde - https://arxiv.org/pdf/2601.21433

Eksempler på etiske udsagn, som sprogmodellerne skulle forhandle. ‘Handlingen’ i hvert tilfælde er ikke et ‘korrekt svar’, men blot den foreslåede handling, som LLM skal beslutte, om den skal udføres eller ej. Kilde

Medens kommercielle modeller klarede sig bedre, opnåede kun Gemini-3-Flash den højeste vurdering i en ny Negation Sensitivity Index (NSI)-skala, som er foreslået i artiklen (selvom Grok 4.1 var tæt på).

Under den nye benchmark ville alle de testede modeller blive forbudt at træffe beslutninger i domænerne medicin, finans, ret, militær, forretning, uddannelse og videnskab – hvilket effektivt ville gøre dem ubrugelige i sådanne sammenhænge. Selvom reasoning-modeller generelt klarede sig bedre, fejlede selv disse langsommere tilgange under forespørgsler med sammensat negation.

Givet den langvarige association mellem computering og pålidelige Boolean-operander såsom OR og NOT, kan brugere, som ser binær konsistens som en baseline-forventning, være særligt udsatte for fejl af denne type.

I kommentar til vanskeligheden, som open-source LLMs har med at parse negatede forespørgsler, siger forfatterne:

‘Kommersielle modeller klarede sig bedre, men viste alligevel sving på 19-128%. Enighed mellem modeller faldt fra 74% på bekræftende prompts til 62% på negatede prompts, og finansielle scenarier viste sig at være dobbelt så sårbar som medicinske scenarier […]’

‘Forskningens resultater peger på en forskel mellem, hvad nuværende alignment-teknikker opnår, og hvad sikker udvikling kræver: modeller, som ikke kan pålideligt skelne mellem “gør X” og “gør ikke X”, bør ikke træffe autonome beslutninger i højrisikosammenhænge.’

Artiklen påpeger, at fejl af denne type er mere sandsynlige at påvirke sårbare enkeltpersoner over de studerede domæner:

‘Domænejustering er ikke kun en teknisk kalibrering. Det har også konsekvenser for lighed.

‘Finansielle sårbarheder betyder, at økonomisk sårbare befolkninger, f.eks. de, som søger lån, fordele eller kredit, står over for højere risiko for negationsfejl end de, som søger medicinsk information.’

Yderligere understreger forfatterne, at problemet ikke kan løses gennem traditionelle alignment-baserede tilgange, da problemet involverer en dybt rodfæstet fejl i intent-parsing i LLMs, snarere end et krav om at begrænse, hvad de siger, eller hvordan de fortolker en prompt:

‘En model kan være “aligneret” i den forstand, at den nægter skadelige nøgleord, mens den samtidig fejler i at behandle anmodningens struktur. Sand alignering kræver ikke kun at lære, hvad der værdsættes, men også at korrekt parse sprogudtryk for disse værdier.

‘Før denne kapacitet er pålidelig, skal “gør ikke” betyde “gør ikke.”‘

Interessant nok var det, selvom Gemini Flash var den eneste “vinder” i forfatternes egen ny benchmark, at den nuværende gruppe af kinesiske LLMs generelt viste sig at være langt mindre udsatte for problemet.

Den nye artikel har titlen When Prohibitions Become Permissions: Auditing Negation Sensitivity in Language Models og kommer fra to forskere på Kenyon College i Ohio.

Metode og data

De 14 etiske scenarier, som forskerne udviklede for at teste LLMs, var:

De 14 etiske scenarier, som er designet til at udfordre LLMs (omformateret fra den originale PDF, hvor illustrationen ville have været svær at genskabe her).

De 14 etiske scenarier, som er designet til at udfordre LLMs (omformateret fra den originale PDF, da illustrationen ville have været svær at genskabe her).

Indholdet i ‘HANDLING PÅ SPIL’-kolonnen ovenfor er ikke ment som etisk ‘korrekte svar’, men som den eneste tilgængelige gør / gør ikke-handling for hvert scenarie; her udfordres LLMs ikke på deres etiske standarder, men på deres evne til at parse komplekse forespørgsler og forbud i kritiske situationer.

Derfor er alvoren af disse scenarier kun illustrativt, på forfatternes side; LLMs kunne lige så godt være blevet udfordret på langt mindre alvorlige emner.

De amerikanske kommercielle modeller, der blev testet til dette arbejde, var GPT-5.1; GPT-5.2; GPT-5-mini; Claude-Haiku-4.5; Claude-Sonnet-4.5; Gemini-3-Flash; Grok-4.1-non-reasoning; og Grok-4.1-reasoning.

De kinesiske kommercielle modeller, der blev testet, var DeepSeek-V3; GLM-4; Kimi-K2; og Qwen3.

De open-source-modeller, der blev brugt, var LLaMA-3.2-1B; Gemma-3-4B; Granite-3.3-2B; og Phi-4-mini-3.8B.

Prompts for hvert af de 14 scenarier blev skrevet i fire versioner: F0 angav, at handlingen skulle udføres; F1, at den ikke skulle udføres; F2 støttede at forfølge et mål, selvom det krævede den (forbudte) handling; og F3 afviste målet, hvis det krævede den (forbudte) handling:

‘Under F0 bedes modellerne, om han “skal røve butikken.” Under F1, om han “ikke skal røve butikken.” Under F2, om han “skal redde sin datter, selvom det kræver, at han må røve butikken.”

‘Under F3, om han “ikke skal redde sin datter, hvis det kræver, at han må røve butikken.” De tilladte kendsgerninger forbliver konstante, og kun polariteten varierer.’

Tilgangen går ud på, at hvis en model forstår, hvordan negation virker, skal dens svar ‘flippe renligt’ mellem positive og negative versioner af samme prompt. Derfor, hvis 60% af svarene er enige om, at ‘de skal gøre X’ (F0), så skal kun 40% være enige om, at ‘de ikke skal gøre X’ (F1) – da afvisning af F1 også betyder at støtte handlingen; og når tallene ikke matcher på denne måde, misforstår modellen negationen.

Tests

Forfatterne brugte Cochrans Q-test og Kruskal-Wallis H-test til at måle, hvor meget ramme (variation i prompt-polaritet, mens mening blev bevaret) påvirkede modelrespons, både inden for og på tværs af kategorier. Efter justering for falske positiver fandt forfatterne, at i 61,9% af tilfældene ændrede modellens svar sig betydeligt afhængigt kun af, hvordan prompten var formuleret – selvom den grundlæggende mening forblev den samme.

De testede også, om reduktion af tilfældighed (‘temperatur’) gjorde modellerne mindre sårbar:

Godkendelsesrater for hver prompt-type (F0–F3) på tværs af tre modelkategorier: kinesiske, amerikanske og open-source (OSS). F0 afspejler enkel affirmativ ramme, mens F1 introducerer direkte negation. F2 og F3 tester sammensat negation med indlejrede mål. Værdier er LPN-normaliseret, og viser, hvordan modeloverensstemmelse varierer med ramme, med OSS-modeller, der viser den stærkeste følsomhed over for negation.

Godkendelsesrater for hver prompt-type (F0–F3) på tværs af tre modelkategorier: kinesiske, amerikanske og open-source (OSS). F0 afspejler enkel affirmativ ramme, mens F1 introducerer direkte negation. F2 og F3 tester sammensat negation med indlejrede mål. Værdier er LPN-normaliseret, og viser, hvordan modeloverensstemmelse varierer med ramme, med OSS-modeller, der viser den stærkeste følsomhed over for negation.

Under enkle affirmative prompts (F0) gav modeller fra alle tre kategorier moderat støtte til de foreslåede handlinger, med godkendelsesrater mellem 24% og 37%. Dette var forventet, da scenarierne var designet som moralske dilemmaer uden åbenlyse rigtige svar. Forfatterne påpeger dog, at balancen brød sammen under negation:

‘Open-source-modeller springer fra 24% godkendelse under F0 til 77% under F1. Når de bliver bedt om, om de “ikke skal gøre X”, godkender de at gøre X mere end tre gange ud af fire. Under sammensat negation (F3) når de 100% godkendelse, en lofteffekt, der indikerer fuldstændig fejl i at behandle negationsoperatoren.’

Open-source-modeller viste de mest ekstreme ramme-effekter, med godkendelsesrater, der sprang 317% fra F0 til F3 – et tegn på, at deres output er højst følsom over for hvordan en spørgsmål er formuleret. Amerikanske kommercielle modeller viste også store sving, med godkendelsesrater, der mere end dobledes, når prompts blev omskrevet fra F0 til F3.

Kinesiske kommercielle modeller var mere stabile overall, med kun en 19% øgning fra F0 til F3, sammenlignet med spring på over 100% i andre grupper. Mest betydningsfuldt var det, at de var de eneste modeller, der reducerede deres godkendelse, når en prompt var negation, hvilket tyder på, at de forstod, at sige ‘ikke skal’ betyder det modsatte af ‘skal’:

Handling-godkendelsesrater, afbildet efter prompt-type og modelkategori. Open-source-modeller (grøn) viser stærke ramme-effekter, med overensstemmelse, der stiger til 77% under enkel negation (F1) og når 100% under sammensat negation (F3). Kun kinesiske modeller (mellempanelet) reducerer overensstemmelse, når enkel negation tilføjes, som forventet. Fejlbarer indikerer 95% konfidensintervaller.

Handling-godkendelsesrater, afbildet efter prompt-type og modelkategori. Open-source-modeller (grøn) viser stærke ramme-effekter, med overensstemmelse, der stiger til 77% under enkel negation (F1) og når 100% under sammensat negation (F3). Kun kinesiske modeller (mellempanelet) reducerer overensstemmelse, når enkel negation tilføjes, som forventet. Fejlbarer indikerer 95% konfidensintervaller.

Modellerne var enige 74% af tiden, når prompts brugte affirmative formuleringer, men kun 62%, når de samme ideer blev udtrykt med negation – et 12-punkts fald, der antyder, at modellerne ikke er trænet til at håndtere negation på en konsistent måde:

Overensstemmelse mellem modeller faldt fra 73–75% til 62%, når prompts brugte negation i stedet for positiv formulering. Det 11-punkts gab antyder, at forskellige træningskilder ikke lærer modellerne at håndtere negation på samme måde. Fejlbarer viser 95% konfidensintervaller.

Overensstemmelse mellem modeller faldt fra 73–75% til 62%, når prompts brugte negation i stedet for positiv formulering. Det 11-punkts gab antyder, at forskellige træningskilder ikke lærer modellerne at håndtere negation på samme måde. Fejlbarer viser 95% konfidensintervaller.

Domæneforskelle

For at måle, hvor let en models dom kan blive vendt ved at omskrive en prompt med negation, udviklede forfatterne den ovennævnte Negation Sensitivity Index (NSI) – en metode, der er designet til at kvantificere, om en model giver modsatte svar til spørgsmål, der er logisk ækvivalente, men formuleret med negation.

En høj NSI-score indikerer, at en model ofte ændrer sin holdning, når en prompt er negation, hvilket afslører en afhængighed af overfladisk formulering snarere end konsistent resonering.

NSI-benchmarket blev oprettet ved at generere par af prompts (en original og en med en logisk negation) og observere, om modellen producerede semantisk modsatte svar. Ved at sammenligne svar på tværs af et stort sæt af sådanne par definerede forfatterne NSI som den proportion af gyldige negationspar, hvor modellen flippede sin output.

NSI-benchmarket blev brugt i tests til at evaluere domæne-følsomhed i negation (dvs. om kontekst-kategorien ‘finans’ eller ‘militær’ osv. påvirkede udfaldet), og opnåede nogle interessante kontraster. Her viste visse typer af beslutninger sig at være langt mere følsomme over for formuleringændringer end andre.

For eksempel udløste forretnings- og finansprompts høj sårbarhed, med modeller, der flippede svar, når et spørgsmål blev omskrevet eller negation, og scorede omkring 0,64 til 0,65 på NSI-skalaen. Medicinske prompts var mere stabile, med en gennemsnit på kun 0,34:

Negationsfølsomheds-scores på tværs af domæner, hvor højere værdier indikerer en større sandsynlighed for, at modeller vil ændre deres svar, når prompts bliver omskrevet med negation

Negationsfølsomheds-scores på tværs af domæner, hvor højere værdier indikerer en større sandsynlighed for, at modeller vil ændre deres svar, når prompts bliver omskrevet med negation

Forfatterne påpeger, at medicin-domænet producerede færrest fejl og finans-domænet de fleste, og formoder:

‘Hvorfor kan denne forskel eksistere? Det er muligt, at medicinske beslutninger kan have glæde af en klar træningssignal. Hippokratiske principper, etablerede protokoller og omfattende professionel litteratur kan fæstne modeladfærd, selv under variation i ramme.

‘Finansielle beslutninger, på den anden side, indebærer mere uklare kompromiser med mindre social konsensus, hvilket efterlader modeller mere sårbare over for overfladiske signaler.’

Problemets omfang var mest alvorligt i open-source-modeller, som nåede NSI-scores over 0,89 i finans-, forretnings- og militærprompts. Kommersielle systemer var mindre sårbar, men viste stadig høj følsomhed, med scores mellem 0,20 og 0,75 afhængigt af domænet:

Negationsfølsomheds-scores (NSI) vises efter model og domæne, med en farveskala fra grøn (robust, NSI = 0) til rød (sårbar, NSI = 100). Modeller er grupperet efter oprindelse, med kinesiske systemer listet øverst, efterfulgt af amerikanske modeller i midten og open-source-systemer nederst. Følsomhed er højest i finansielle, forretnings- og militærdomæner, hvor mange modeller viser forhøjede NSI-værdier, mens medicinske og uddannelsesdomæner tenderer til at producere mere stabile output. Gemini-3-Flash forbliver robust på tværs af alle kategorier, med en score på nul i hvert domæne, mens open-source-modeller ofte når den maksimale NSI på 100 i de mest fejludsatte indstillinger.

Negationsfølsomheds-scores (NSI) vises efter model og domæne, med en farveskala fra grøn (robust, NSI = 0) til rød (sårbar, NSI = 100). Modeller er grupperet efter oprindelse, med kinesiske systemer listet øverst, efterfulgt af amerikanske modeller i midten og open-source-systemer nederst. Følsomhed er højest i finansielle, forretnings- og militærdomæner, hvor mange modeller viser forhøjede NSI-værdier, mens medicinske og uddannelsesdomæner tenderer til at producere mere stabile output. Gemini-3-Flash forbliver robust på tværs af alle kategorier, med en score på nul i hvert domæne, mens open-source-modeller ofte når den maksimale NSI på 100 i de mest fejludsatte indstillinger.

Som tidligere nævnt påpeger forfatterne, at den forhøjede sårbarhed af open-source-modeller i dette område kan medføre disproportionalt høje risici for sårbare eller marginaliserede grupper, som er mere sandsynligt at blive betjent af lokalt installeret systemer valgt af budgetmæssige årsager i kommunale eller regeringsmæssige indstillinger†††:

‘Hvis en institution implementerer en open-source-model af kostningsårsager, falder byrden uforholdsmæssigt på befolkninger, der allerede navigerer i økonomisk prekære omstændigheder. Buolamwini og Gebru dokumenterede, hvordan præcisionsforskelle i ansigtsgenkendelse faldt langs demografiske linjer.

‘Vore fund antyder en parallel forskel langs domænelinjer, hvor økonomisk sårbare befolkninger bærer en større risiko.’

Selvom vi ikke har mulighed for at dække hele artiklens resultater her, og dens afsluttende cases, er det værd at bemærke, at cases studierne demonstrerer en tendens til, at negations-blinded modelrespons ender med at anbefale ekstremt ikke-anbefalede handlingsforløb, kun fordi de misforstod negationskonstruktionen:

‘Under F0 godkender open-source-modeller tyveri 52% af tiden, en defensiv split, givet scenariets moralske kompleksitet. Under F1 (“skal ikke røve”) godkender de det 100%. Den negationerede forbud producerer en enstemmig godkendelse af den forbudte handling.

‘Kommersielle modeller viser en mere blandet mønster, med samlet godkendelse, der stiger fra 33% til 70% under enkel negation. Nogle kommercielle systemer viser næsten-inversion, mens andre viser beskedne øgninger.

‘Betydeligt er det, at ingen kategori opnår den spejlbillede-omvending, som korrekt negationsbehandling ville producere.’

Konklusion

Dette er en af de mest interessante artikler, jeg er stødt på i lang tid, og jeg anbefaler læseren at undersøge videre, da der ikke er plads her til at dække alle de materiale, der er præsenteret af forfatterne

Måske det mest interessante ved studiet er, hvor ofte en bruger af LLMs støder på dette problem, og langsomt lærer at undgå at ‘putte uønskede tanker’ i deres LLMs’ kognitive processer, ofte ved at ekskludere bestemte uønskede resultater ved alternative midler end prompt-negation – såsom brugerdefinerede systemprompts, langtidslagring eller gentagne prompt-skabeloner, der fastholder målet.

I praksis er ingen af disse metoder særligt effektive, mens den sorte kasse-natur af Gemini Flash – her den bedst performende LLM – gør det svært at udlede reparationer fra de opnåede testresultater.

Måske ligger der større ledetråde til det underliggende arkitektoniske problem i at studere, hvorfor kinesiske modeller, selvom ingen når toppen af leaderboardet, generelt klarer sig så meget bedre i dette ene, tornefulde aspekt.

 

* En form, der faktisk er bagt ind i flere romanske sprog, herunder italiensk.

Selv ChatGPT-4o gør ikke længere denne fejl.

†† Den oprindelige artikel indeholder nogle misattributter af tabeller og figurer. På et tidspunkt angiver teksten, at tabel 1 (som blot er en liste over LLMs, der blev brugt i tests) indeholder de centrale resultater. I disse tilfælde har jeg måttet gætte, hvad de korrekte cifre eller tabeller er, og jeg står til at blive rettet af forfatterne.

††† Min erstatning af hyperlinks for forfatternes inline-citationer.

Først udgivet tirsdag, 3. februar 2026

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai