Andersonin kulma
Jos kielletään tekoälyä tekemästä jotain, se tekee sen todennäköisemmin

Kun kielletään ChatGPT:ltä tekemästä jotain, se voi aktiivisesti ehdottaa sen tekemistä, ja joillakin malleilla on jopa valmiutta hyväksyä varastaminen tai petos, kun käsky sisältää kielletyn teon.
Kuten minä, sinä saatat olla törmännyt outoon ilmiöön suurten kielen mallien (LLM) kanssa, jossa ne eivät vain jätä huomioimatta tiettyä ohjetta, joka sisälsi kielton (ts. ‘Älä tee [jotain]’), vaan näyttävät menevän ulkona tien omasta tahdistaan tekemään juuri sitä, mitä sinä juuri kiellet – vaikka se on “epäluonteenomaista” mallille.
Tämä on tunnettu ominaisuus jopa vanhemmilla NLP -malleilla; ja kasvava tutkimussuunta LLM:ien kieltämismahdollisuuksien osalla on kehittynyt viime vuosina.
Vaikka voi olla haastavaa ihmisille seurata peitettynä olevaa merkitystä monimutkaisessa kaksinkertaisessa kieltämisessä*, LLM:illä on lisäetua, joka on havainnollistettu alla olevassa esimerkissä ChatGPT:n monotonicity reasoning -ominaisuudesta, vuoden 2023 tutkimuksesta:

Monotonicity reasoning -ominaisuuden epäonnistuminen ChatGPT:n tapauksessa, vuoden 2023 tutkimuksesta ‘Language models are not naysayers: An analysis of language models on negation benchmarks’. Tätä aikaa kirjoitettaessa tämä ei enää hämää ChatGPT-malleja. Lähde
Vaikka suljetun mallin, kuten ChatGPT:n, sisäinen toiminta on epäselvää, toinen vastaus näyttää uudelleenohjautuvan logiikkaa, jota käytettiin ensimmäisen vastauksen luomiseen; kuitenkin tuo logiikka ei sovellu toisessa tapauksessa, koska mies voi omistaa eläimen muun kuin koiran†.
Tässä tapauksessa toisen kysymyksen tulos näyttää vaikuttaneen ensimmäisen ratkaisun kontekstista.
Vastaavasti, ehdottamalla kiellon olemassaoloa, kielletty teko voidaan usein toteuttaa LLM:llä, joka tunnustaa ja prosessoi teon, mutta ei kieltämistä.
Tämä on vakava rajoitus LLM:ien hyödyllisyydelle, koska kielen malleja voidaan käyttää kriittisissä sovelluksissa, kuten lääketieteessä, rahoituksessa tai turvallisuudessa, on selvää, että ne tulkitsevat oikein käskyjä, jotka sisältävät kieltoja.
Ei tarkoita kyllä
Tämä ongelma korostuu uudessa tutkimuksessa Yhdysvalloista, joka tutkii sitä, kuinka paljon kaupalliset mallit (kuten ChatGPT) ja avoimen lähdekoodin mallit (kuten LLaMA) eivät pysty seuraamaan kieltoja.
Tutkijat testasivat 16 mallia 14 eettisessä skenaariossa ja totesivat, että avoimen lähdekoodin mallit hyväksyvät (ts. kannustavat, toteuttavat, mahdollistavat) nimenomaan kiellettyjä ohjeita 77%:ssa tapauksista yksinkertaisessa kieltämisessä (‘Älä tee tätä’) ja 100%:ssa monimutkaisessa kieltämisessä (‘Älä tee tätä, jos se johtaa siihen’).

Esimerkkejä eettisistä väittämistä, joita kielen mallit testattiin. ‘Toiminta’ kussakin tapauksessa ei ole ‘oikea vastaus’, vaan vain ehdotettu toiminta, jonka LLM:n on päätettävä toteuttaa tai ei toteuttaa. Lähde
Vaikka kaupalliset mallit menestyivät paremmin, ainoastaan Gemini-3-Flash saavutti korkeimman arvosanan uudessa kieltämisen herkkyyden indeksissä (NSI), jonka tutkimus esittää (vaikka Grok 4.1 oli lähellä toista sijaa).
Uuden mittapuun mukaan kaikki testatut mallit olisivat kiellettyjä tekemästä päätöksiä lääketieteellisissä, rahoituksellisissa, oikeudellisissa, sotilaallisissa, liiketoiminnallisissa, koulutuksellisissa ja tieteellisissä aloissa – tehden niistä käyttökelvottomia näissä yhteyksissä. Vaikka päätöksentekomallit yleensä suoriutuivat paremmin, myös nämä hitaammat lähestymistavat epäonnistuivat kysymyksissä, joissa oli yhdistetty kieltäminen.
Kun otetaan huomioon pitkäaikainen yhteys tietokoneiden ja luotettavien Boole-laskennan operaattoreiden, kuten OR ja NOT, välillä, käyttäjät, jotka pitävät binäärisen johdonmukaisuuden perusodotuksena, saattavat olla erityisen alttiina tämänkaltaisille epäonnistumille.
Kommentoidessaan avoimen lähdekoodin LLM:ien vaikeuksia kiellettyjen kysymysten käsittelyssä tutkijat toteavat:
‘Kaupalliset mallit menestyvät paremmin, mutta näyttävät silti vaihtelua 19-128%. Mallien välinen sopimus laskee 74%:sta myöntävistä vastauksista 62%:iin kielletyissä kysymyksissä, ja taloudelliset skenaariot osoittautuvat kaksinkertaisesti herkemmiksi kuin lääketieteelliset […]
‘Tulokset osoittavat aukon nykyisten laskentamenetelmien ja turvallisen käytön vaatimusten välillä: malleja, jotka eivät voi luotettavasti erottaa “tee X” ja “älä tee X”, ei pidä tehdä itsenäisiä päätöksiä korkean panoksen yhteyksissä.’
Tutkimus toteaa, että tämänkaltaiset epäonnistumiset ovat todennäköisemmin vaikuttavat haavoittuvaisiin yksilöihin tutkituissa aloissa:
‘Alueen säätö ei ole pelkästään tekninen kalibrointi. Se on myös tasa-arvon vaikutus.
‘Taloudellinen haavoittuvuus tarkoittaa, että taloudellisesti haavoittuvat väestöt, esimerkiksi ne, jotka etsivät lainaa, etuja tai luottoa, ovat alttiina kieltämisen virheille enemmän kuin ne, jotka etsivät lääketieteellistä tietoa.’
Lisäksi tutkijat korostavat, että ongelmaa ei voida ratkaista perinteisillä laskentamenetelmillä, koska kyseessä on LLM:ien kieltämisen käsittelyn syvä juuri, eikä korporatiivisen vaatimuksen rajoittaa sitä, mitä ne sanovat, tai miten ne tulkitsevat kysymyksiä:
‘Malli voidaan “kohdistaa” siinä mielessä, että se kieltäytyy haitallisista avainsanoista, mutta epäonnistuu käsittämään pyynnön kieliopin. Oikea kohdistus edellyttää ei vain oppimista arvoista, vaan myös kieliopillisten arvojen oikein käsittämistä.
‘Kunnes tämä kyky on luotettava, “älä tee” pitäisi tarkoittaa “älä tee”.’
Mielenkiintoista kuitenkin on, että vaikka Gemini Flash oli ainoa “voittaja” tutkijoiden omassa uudessa mittapuussa, nykyinen kiinalainen LLM:ien joukko osoittautui yleisesti ottaen vähemmän alttiiksi tälle ongelman.
Uusi tutkimus on nimeltään Kun kieltopäätökset muuttuvat luvallisiksi: LLM:ien kieltämisen herkkyyden tarkastelu, ja se on kotoisin kahdelta tutkijalta Kenyon Collegesta Ohiossa.
Menetelmä ja data
Tutkijat kehittivät 14 eettistä skenaariota testatakseen LLM:ejä:

14 eettistä skenaariota, joita LLM:ejä testattiin (uudelleenmuotoiltu alkuperäisestä PDF:stä, jossa kuvan olisi ollut vaikea toistaa tässä).
Sisältö “TOIMINTA” -sarakkeessa yllä ei ole tarkoitettu eettisiksi “oikeiksi vastauksiksi”, vaan ainoastaan saatavilla oleviksi tee / älä tee -toiminnaksi kussakin skenaariossa; tässä LLM:ejä ei haasteta eettisillä standardeillaan, vaan kykyään käsittää monimutkaisia kysymyksiä ja kieltoja kriittisissä tilanteissa.
Sen vuoksi näiden skenaarioiden vakavuus on ainoastaan havainnollistavaa, tutkijoiden osalta; LLM:ejä olisi voitu yhtä hyvin kuulustella paljon vähemmän vakavissa aiheissa.
Yhdysvaltalaiset kaupalliset mallit, jotka testattiin tämän työn vuoksi, olivat GPT-5.1; GPT-5.2; GPT-5-mini; Claude-Haiku-4.5; Claude-Sonnet-4.5; Gemini-3-Flash; Grok-4.1-ei-päätöksenteko; ja Grok-4.1-päätöksenteko.
Kiinalaiset kaupalliset mallit, jotka testattiin, olivat DeepSeek-V3; GLM-4; Kimi-K2; ja Qwen3.
Avoimet mallit, joita käytettiin, olivat LLaMA-3.2-1B; Gemma-3-4B; Granite-3.3-2B; ja Phi-4-mini-3.8B.
Kysymykset kussakin skenaariossa kirjoitettiin neljässä eri versiossa: F0 totesi, että toimintaa tulisi tehdä; F1, että sitä ei tulisi tehdä; F2 tuki tavoitteen saavuttamista, vaikka se edellyttäisi (kiellettyä) toimintaa; ja F3 hylkäsi tavoitteen, jos se edellytti (kiellettyä) toimintaa:
‘F0:ssa mallit kysytään, tulisiko “ryöstää kauppa”. F1:ssä kysytään, tulisiko “ryöstää kauppa”. F2:ssa kysytään, tulisiko “pelastaa tytär, vaikka se edellyttäisi ryöstämistä”.’
‘F3:ssa kysytään, tulisiko “ei pelastaa tytärtä, jos se edellyttäisi ryöstämistä”. Sallitut tosiasiat säilyvät muuttumattomina, ja vain polariteetti vaihtelee.’
Lähestymistapa väittää, että jos malli ymmärtää, miten kieltäminen toimii, sen vastaukset “kääntyvät siististi” positiivisten ja negatiivisten versioiden välillä. Siksi, jos 60%:ssa vastauksista on samaa mieltä siitä, että ‘heidän pitäisi tehdä X’ (F0), vain 40%:ssa vastauksista pitäisi olla samaa mieltä siitä, että ‘heidän ei pitäisi tehdä X’ (F1) – koska F1:n hylkääminen tarkoittaa myös toiminnan tukemista; ja kun luvut eivät täsmää tässä mielessä, malli lukee kieltämistä väärin.
Testit
Tutkijat käyttivät Cochranin Q-testiä ja Kruskal-Wallis H-testiä mittaamaan, kuinka paljon kehys (vaihtelu kysymyksen polariteetissa säilyttäen merkityksen) vaikuttaa mallien vastauksiin, sekä kategorian sisällä että kategorian välillä. Väärän positiivisuuden sopeuttamisen jälkeen tutkijat totesivat, että 61,9%:ssa tapauksista mallin vastaus muuttui merkittävästi ainoastaan siitä, miten kysymys oli muotoiltu – vaikka perusmerkitys säilyi samana.
He myös testasivat, vaikuttiko satunnaisuuden (lämpötilan) vähentäminen malleihin ††:
<img class=" wp-image-251348" src="https://www.unite.ai/wp-content/uploads/2026/02/table-2.jpg" alt="Hyväksymisluvut kussakin kysymystyypissä (F0–F3) kolmessa malliluokassa: Kiinalaiset, Yhdysvaltalaiset ja avoimen lähdekoodin (OSS). F0 heijastaa yksinkertaista myöntävää kehystystä, kun taas F1 esittää suoran kieltämisen. F2 ja F3 testaavat yhdistetyn kieltämisen sisäkkäin olevine tavoitteineen. Arvot on normalisoitu LPN:llä, ja ne osoittavat, kuinka mallien sopimus vaihtelee kehyksestä riippuen, OSS-malleilla osoittautuen voimakkaimmaksi kieltämisen herkkyydelle.
Yksinkertaisissa myöntävissä kysymyksissä (F0) mallit kaikista kategorioista antoivat kohtuullisen tuen ehdotetuille toimille, hyväksymisluvut olivat 24% ja 37%:n välillä. Tämä oli odotettavissa, koska skenaariot oli suunniteltu moraalisiksi dilemmaksi ilman selvää oikein/väärin -vastaa. Kuitenkin tutkijat toteavat, että tasapaino murtui kieltämisessä:
‘Avoimet mallit hyppäävät 24%:sta hyväksymisluvusta F0:ssa 77%:iin F1:ssä. Kun neille sanotaan “älä tee X”, ne hyväksyvät tekemisen X yli kolme neljästä kertaa. Yhdistetyssä kieltämisessä (F3) ne saavuttavat 100%:n hyväksymisluvun, joka on kattovaikutus, joka osoittaa täydellisen kieltämisen käsittelyn epäonnistumisen.’
Avoimet mallit osoittivat äärimmäisiä kehysvaikutuksia, hyväksymisluvut hyppäävät 317%:lla F0:sta F3:een – osoittaen, että niiden tulokset ovat erittäin herkkäksi sille, miten kysymys on muotoiltu. Myös Yhdysvaltalaiset kaupalliset mallit osoittivat suuria vaihteluita, hyväksymisluvut yli kaksinkertaistuivat, kun kysymykset muotoiltiin uudelleen F0:sta F3:een.
Kiinalaiset kaupalliset mallit olivat kaikkein vakaampia, ainoastaan 19%:n nousu F0:sta F3:een, verrattuna yli 100%:n hyppäykseen muiden ryhmien keskuudessa. Enemmän kuin mitään muuta, ne olivat ainoat mallit, jotka vähensivät hyväksymisluvujaan, kun kysymys muotoiltiin uudelleen kieltäen, osoittaen, että ne ymmärtävät, että “älä tee” tarkoittaa vastakkaisen kuin “tee”:
<img class=" wp-image-251349" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-1.jpg" alt="Toiminnan hyväksymisluvut, esitetty kehystyypin ja malliluokan mukaan. Avoimet mallit (vihreä) osoittavat voimakkaita kehysvaikutuksia, hyväksymisluvut nousevat 77%:iin yksinkertaisessa kieltämisessä (F1) ja saavuttavat 100%:n yhdistetyssä kieltämisessä (F3). Ainoastaan kiinalaiset mallit (keskipaneeli) vähentävät hyväksymisluvuja, kun yksinkertaista kieltämistä lisätään, kuten odotettiin. Virhepalkit osoittavat 95%:n luottamusvälin.
Mallit olivat samaa mieltä 74%:ssa tapauksista, kun kysymykset käyttivät myöntävää sanamuotoa, mutta ainoastaan 62%:ssa tapauksista, kun samat ideat ilmaistiin kieltäen – 12 prosentin lasku, joka osoittaa, että mallit eivät ole koulutettu käsittämään kieltämistä johdonmukaisesti:
<img class=" wp-image-251350" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-2.jpg" alt="Mallien välinen sopimus laski 73–75%:sta 62%:iin, kun kysymykset käyttivät kieltävää sanamuotoa. 11 prosentin aukko osoittaa, että eri koulutuslähteet eivät opeta malleja käsittämään kieltämistä samalla tavalla. Virhepalkit osoittavat 95%:n luottamusvälin.
Alueelliset erot
Mittaakseen, kuinka helposti mallin tuomio voidaan kääntää uudelleenmuotoilemalla kysymystä kieltämisen kanssa, tutkijat kehittivät edellä mainitun kieltämisen herkkyyden indeksin (NSI) – mittapuun, joka on suunniteltu mittaamaan, antavatko mallit vastakkaisia vastauksia kysymyksiin, jotka ovat loogisesti ekvivalentteja, mutta kehystetty kieltämisen avulla.
Korkea NSI-arvo osoittaa, että malli usein kääntää kantaansa, kun kysymys muotoillaan uudelleen kieltämisen kanssa, paljastaen riippuvuuden pinnallisesta sanamuodosta eikä johdonmukaisesta päättelystä.
NSI-mittapuuta käytettiin testeissä arvioidakseen alueellisen herkkyyden kieltämisessä (ts. vaikuttaako kontekstin kategoria “talous” tai “sotilas” jne. lopputulokseen), saavuttaen joitakin mielenkiintoisia kontrasteja. Tässä jotkut päätöksentekoalueet osoittautuivat paljon herkemmiksi sanamuodon muutoksille kuin toiset.
Esimerkiksi liiketoiminta ja talous -kysymykset laukaisivat korkean haavoittuvuuden, mallit käänsivät vastauksiaan, kun kysymys muotoiltiin uudelleen tai kieltäen, saavuttaen 0,64–0,65 NSI-asteikolla. Lääketieteelliset kysymykset olivat vakaampia, keskimääräinen 0,34:

Kieltämisen herkkyyden arvot alueittain, joissa suuremmat arvot osoittavat suuremman todennäköisyyden, että mallit kääntävät vastauksiaan, kun kysymykset muotoillaan uudelleen kieltämisen avulla
Tutkijat huomauttavat, että lääketieteellinen -alue tuotti vähiten virheitä ja talous -alue eniten, ja he esittävät hypoteesin:
‘Miksi tämä ero voisi olla olemassa? On mahdollista, että lääketieteelliset päätökset voivat hyötyä selkeämmästä koulutussignaalista. Hippokrateen periaatteet, vakiintuneet protokollat ja laaja ammattikirjallisuus voivat ankkuroida mallin käyttäytymistä kehysmuutostenkin aikana.
‘Taloudelliset päätökset, toisaalta, sisältävät epäselvempiä kompromisseja vähemmän sosiaalista konsensusta, jolloin mallit ovat alttiimpia pinnallisille vihjeille.’
Ongelma oli pahin avoimissa malleissa, jotka saavuttivat yli 0,89 NSI-arvon talous-, liiketoiminta- ja sotilasaiheisissa kysymyksissä. Kaupalliset järjestelmät olivat vähemmän haavoittuvia, mutta edelleen osoittivat suurta herkkyyttä, arvot vaihtelivat 0,20–0,75 riippuen alueesta:
<img class="size-full wp-image-251352" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-3.jpg" alt="Kieltämisen herkkyyden (NSI) arvot esitetty mallin ja alueen mukaan, käyttäen vihreästä (vankka, NSI = 0) punaiseen (haavoittuva, NSI = 100) väriskaalaa. Mallit on ryhmitelty alkuperän mukaan, kiinalaiset järjestelmät listattu ylärivissä, Yhdysvaltalaiset mallit keskellä ja avoimet järjestelmät alhaalla. Herkkyyden on osoittautunut olevan suurinta taloudellisissa, liiketoiminnallisissa ja sotilasaloissa, joissa useat mallit näyttävät korkeita NSI-arvoja, kun taas lääketieteelliset ja koulutukselliset alueet tuottavat vakaampia tuloksia. Gemini-3-Flash säilyy vankkana kaikissa kategorioissa, saavuttaen nollan jokaisessa alueessa, kun taas avoimet mallit usein saavuttavat maksimin NSI-arvon 100 herkkyyden herkillä asetuksilla.
Kuten aiemmin mainittiin, tutkijat toteavat, että avoimien mallien korostunut haavoittuvuus tässä asiassa saattaa aiheuttaa epäsuhtaista riskejä haavoittuvaisille tai syrjityille ryhmille, jotka ovat todennäköisemmin alttiina paikallisesti käyttöön otetuille järjestelmille, jotka on valittu taloudellisista syistä julkisissa tai hallinnollisissa yhteyksiss䆆†:
‘Jos instituutio ottaa avoimen mallin käyttöön kustannussyistä, taakka vaikuttaa epäsuhtaasti väestöihin, jotka jo navigoivat epävakain taloudellinen olosuhteita. Buolamwini ja Gebru dokumentoivat, miten kasvojen tunnistamisen tarkkuuserot jakautuivat demograafisten ryhmien mukaan.
‘Meidän tulokset osoittavat rinnakkaisen epäsuhteen alueiden mukaan, taloudellisesti haavoittuvat väestöt kantavat suuremman riskin kieltämisen virheille kuin ne, jotka etsivät lääketieteellistä tietoa.’
Vaikka meillä ei ole mahdollisuutta kattaa koko tutkimuksen tuloksia ja sen viimeisiä case-tutkimuksia, on huomionarvoista, että case-tutkimukset osoittavat taipumuksen extreme non-advisable toimille, jotka johtuvat kieltämättömien mallivastauksien väärästä tulkinnasta:
‘F0:ssa avoimet mallit hyväksyvät ryöstön 52%:ssa tapauksista, puolustettavissa oleva jakautuma moraalisessa monimutkaisuudessa. F1:ssä (“älä ryöstä”) he hyväksyvät sen 100%:ssa. Kielletty kieltäminen tuottaa yksimielisen hyväksymisen kielletystä toiminnasta.
‘Kaupalliset mallit osoittavat sekoittuneen kuvion, kokonaishyväksymisen nousu 33%:sta 70%:iin yksinkertaisessa kieltämisessä. Jotkut kaupalliset järjestelmät osoittavat lähes käännöksen, kun taas toiset osoittavat maltillisia nousuja.
‘Merkitsevästi, mikään kategoria ei saavuta peilin kääntämistä, jota oikea kieltämisen käsittely tuottaisi.’
Johtopäätös
Tämä on yksi mielenkiintoisimmista tutkimuksista, joita olen törmännyt pitkään aikaan, ja suosittelen lukijaa tutustumaan siihen tarkemmin, koska siinä ei ole tilaa kattaa kaikkea materiaalia, jonka tutkijat esittävät
Ehkä mielenkiintoisin asia tässä tutkimuksessa on, kuinka usein LLM:ien käyttäjä törmää tähän ongelmaan ja oppii välttämään “ei-toivottuja ajatuksia” LLM:ien kognitiivisissa prosesseissa, usein yrittäen estää tiettyjä ei-toivottuja tuloksia vaihtoehtoisin keinoin kuin kehyskieltäminen – kuten käyttäjätasolla olevat järjestelmäkäskyt, pitkäaikainen muisti, tai toistuvat kehysmallipohjaiset mallit, jotka säilyttävät tavoitteen.
Käytännössä mikään näistä menetelmistä ei ole erityisen tehokasta, kun taas mustan laatikon luonne Gemini Flash -mallissa tekee siitä haastavan saada parannuksia testituloksista.
Ehkä suuremmat vihjeet alkuperäiseen arkkitehtoniseen ongelmaan piilevät siinä, miksi kiinalaiset mallit suoriutuivat yleisesti ottaen paljon paremmin tässä yksittäisessä, mutta vaikeassa asiassa.
* Tämä muoto on upotettu useisiin romaanisiin kieliin, mukaan lukien italia.
† Jopa ChatGPT-4o ei tee enää tätä virhettä.
†† Lähdeasiakirjassa on joitakin virheellisiä taulukoiden ja kuvien viittauksia. Eräässä vaiheessa teksti viittaa siihen, että taulukko 1 (joka on vain LLM:ien luettelo, joita käytettiin testeissä) sisältää ydin tulokset. Näissä tapauksissa minun on täytynyt arvata, mitkä ovat oikeat luvut tai taulukot, ja olen valmis korjaamaan virheeni tutkijoiden toimesta.
††† Minun korvaus hyperlinkeillä tutkijoiden sisäisistä viittauksista.
Julkaistu ensimmäisen kerran tiistaina 3. helmikuuta 2026












