Andersonin kulma

Helppo uudelleenmuokkaus rikkoo AI:n turvallisuuden, jopa Gemini ja Claude -malleissa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
An AI-generated image (GPT-1.5) depicting a crash test dummy embedded in the wall of a crash test laboratory.

AI:n turvallisuustestit osoittavat riippuvan “ilmeisistä” laukaisimetasteista; helpon uudelleenmuokkauksen myötä mallit, jotka on merkitty “kohtuullisen turvallisiksi”, epäonnistuvat yllättäen, ja hyökkäykset onnistuvat jopa 98 prosentissa tapauksista.

 

Yhdysvaltalaisen yrityksen uusi tutkimus on johtanut siihen, että useiden suurten kielen mallien (LLM) hyvä turvallisuusennuste – mukaan lukien useat johtavat nimet, kuten Gemini 3 Pro ja Claude Sonnet 3.7 – voi olla merkityksetön, koska käytetyt aineistot ja vertailuindeksit sisältävät hämmästyttävän “ilmeisiä” kieltä.

Kaksi kyseistä aineistoa, jotka ovat olleet mukana useissa tähän sivustoon liittyvissä tutkimuksissa, ovat HarmBench ja AdvBench:

HarmBench- ja AdvBench-tutkimuksista, jotka ovat tosiasiallisesti edustavia esimerkkejä provokaatiosta – mutta uusi tutkimus väittää, että jopa todellisissa tilanteissa näiden aineistojen esimerkit “telegrafioivat” pahantahtoista aikomusta, mikä voi johtaa (oletettavasti) tahattomaan “pelaamiseen” tuloksia. Lähteet: HarmBench ja AdvBench.

Vaikka yllä olevat esimerkit, jotka ovat peräisin kummankin aineiston tutkimuksista, ovat tarkoituksella yksinkertaisia jotta ne havainnollistaisivat järjestelmien periaatteita, uusi tutkimus väittää, että tosiasiallisesti nämä kokoelmat kohdistuvat “helppoihin kohteisiin”, eivätkä ole tehokkaita vertailuindeksejä – ja että testattujen LLM-mallien turvallisuuskyky on huomattavasti heikompi kuin mitä on ilmoitettu:

‘[Me] arvioimme, ovatko nämä aineistot todella mittaamassa turvallisuusriskejä vai vain provosoivatko ne kieltämisiä laukaisimetasteiden kautta. Tätä varten kehitimme “aikeen pesun”: menetelmän, joka abstrahoi laukaisimetasteet hyökkäyksistä (tietopisteistä) säilyttäen samalla pahantahtoisen aikomuksen ja kaikki asiaankuuluvat yksityiskohdat.

‘Tuloksemme osoittavat, että nykyiset AI-turvallisuusaineistot eivät uskollisesti edusta todellisia hyökkäyksiä johtuen niiden liiasta riippuvuudesta laukaisimetasteista.

‘Tosiasiallisesti, kun nämä vihjeet poistetaan, kaikki aiemmin arvioidut “kohtuullisen turvalliset” mallit muuttuvat turvattomiksi, mukaan lukien Gemini 3 Pro ja Claude Sonnet 3.7.’

‘Turvallisuus’ tässä mielessä edustaa sopimusta – kykyä LLM:llä torjua käyttäjien yritykset ‘murtamaan’ rajoitukset API-vain järjestelmissä, jotta järjestelmä tuottaa kiellettyä sisältöä, kuten herjaavaa tekstiä tai kuvia.

Kirjoittajien mainittu aikeen pesu on yksinkertaisesti uudelleenmuokkaus “ilmeisiä” hyökkäyksiä kahdessa aineistossa, jotta ne muuttuvat häikäilemättömämmiksi ja kykenevämmiksi ohittamaan suodattimet ja tarkastukset:

Ylempänä oleva osa muuten hankalasta esimerkistä tutkimuksesta. Kuvassa ylhäällä vasemmalla, keltaisella, on esimerkki “ilmeisestä” kehotuksesta, jota HarmBench ja AdvBench yleensä tarjoavat; alempana, vihreällä, kehotus on neutraloitu, uudelleenmuokattu ja tehty riittävän hyväksyttäväksi Claude Sonnet 3.7:lle, jotta se on nyt valmis auttamaan käyttäjää löytämään “chop shops” (varastettujen ajoneuvojen prosessointipaikat) uudessa kaupungissa. Lähde

Tutkijat analysoivat kahden aineiston ominaisuuksia kahdella lähestymistavalla: erillään, jotta voitiin vertailla kokoelmia todellisten hyökkäysten ominaisuuksiin; ja käytännössä, jossa aineistot – ja tutkijoiden omat “parannukset” niissä – käytettiin hyökkäämään todellisia malleja.

Toisessa kierroksessa tutkijat “uudelleenmuokkausmenetelmää” parannettiin iteratiivisesti, kunnes saavutettiin optimaaliset tulokset hyökkäyksen onnistumisprosentin (ASR) suhteen:

Aikeen pesu alkaa ohittamalla ilmeisen pahantahtoisen kehotuksen uudelleenkirjoittamismalliin, joka poistaa eksplisiittisen laukaisukielen säilyttäen samalla pahantahtoisen aikomuksen. Uudelleenmuokattu kehotus esitetään kohdemallille, ja sen vastaus arvioidaan sekä turvallisuuden että todellisen soveltamiskelpoisuuden suhteen. Jos vastaus on arvioitu turvattomaksi ja käytännöllisesti sovellettavaksi, hyökkäys lasketaan onnistuneeksi. Jos ei, aiemmat epäonnistuneet uudelleenmuokkaukset syötetään takaisin uudelleenkirjoittamismalliin, jotta voidaan luoda parannettuja versioita, mikä luo iteratiivisen silmukan, joka toimii vankilamurtamismekanismina, kunnes määrätty määrä yrityksiä on saavutettu tai haluttu hyökkäyksen onnistumisprosentti on saavutettu.

Aikeen pesu alkaa ohittamalla ilmeisen pahantahtoisen kehotuksen uudelleenkirjoittamismalliin, joka poistaa eksplisiittisen laukaisukielen säilyttäen samalla pahantahtoisen aikomuksen. Uudelleenmuokattu kehotus esitetään kohdemallille, ja sen vastaus arvioidaan sekä turvallisuuden että todellisen soveltamiskelpoisuuden suhteen. Jos vastaus on arvioitu turvattomaksi ja käytännöllisesti sovellettavaksi, hyökkäys lasketaan onnistuneeksi. Jos ei, aiemmat epäonnistuneet uudelleenmuokkaukset syötetään takaisin uudelleenkirjoittamismalliin, jotta voidaan luoda parannettuja versioita, mikä luo iteratiivisen silmukan, joka toimii vankilamurtamismekanismina, kunnes määrätty määrä yrityksiä on saavutettu tai haluttu hyökkäyksen onnistumisprosentti on saavutettu.

Kirjoittajat toteavat*:

‘Tuloksemme osoittavat, että tämän uudelleenmuokkausmenetelmän avulla voidaan saavuttaa korkea ASR (90%–98.55%) vain muutamassa iteratiivisessa kierroksessa kaikissa tutkituissa malleissa täysin mustan laatikon pääsyä käyttäen. Tähän kuuluvat myös viimeaikaiset mallit, jotka on yleisesti raportoitu yhdeksi turvallisimmista – kuten Gemini 3 Pro ja Claude Sonnet 3.7.

‘Nämä löydökset vahvistavat myös, että olemassa olevat turvallisuuden arvioinnit ja turvallisuussopimismenetelmät ovat erittäin ylioppineita laukaisimetasteisiin.’

Uusi tutkimus on nimeltään Aikeen pesu: AI-turvallisuusaineistot eivät ole sitä, miltä ne näyttävät, ja se on tehty kahden tutkijan toimesta San Francisco -pohjaisessa ohjelmistoyrityksessä Labelbox.

Menetelmä

Tutkijat tutkivat kahden vertailuindeksin koostumusta ja arkkitehtuuria erillään, jotta voitiin vertailla kokoelmia todellisten hyökkäysten ominaisuuksiin:

<img class=" wp-image-278949" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-2-5.jpg" alt="Sanojen pilvet, jotka osoittavat 40 yleisintä yksittäistä sanaa, bigrammeja ja trigrammeja yhdistetyissä AdvBench- ja HarmBench-aineistoissa. Termit, joilla on sisäänrakennettu negatiivisia tai herkkästi kuuluvia konnotaatioita, on korostettu punaisella, kontekstuaaliset laukaisimet oranssilla ja neutraalit sanat, jotka muodostavat korkeamman tason laukaisimet, vihreällä. Eksplisiittisten lauseiden, kuten "tutorial" ja "vaiheittaiset ohjeet", keskittyminen antaa vihjeen siitä, että kaksi vertailuindeksiä riippuvat voimakkaasti eksplisiittisistä vihjeistä eikä realistisesti luoduista, piilevistä aikomuksista.

Tutkijat huomauttavat, että hallitsevat yksi-, kaksi- ja kolmesanaiset sanat ovat epätodennäköisesti paljastavia pahantahtoista aikomusta, toisin kuin kieli, jota rikolliset käyttävät keskustellessaan, ja kieli, jota hyökkääjät käyttävät testatessaan tai yrittäessään murtamaan LLM-mallien puolustuksia.

‘Nämä vihjeet heikentävät kahta ominaisuutta – hyvän laatuisuutta ja piilevää aikomusta – koska tällainen ilmeinen kieli harvoin esiintyy todellisissa hyökkäyksissä ja näyttää olevan suunniteltu laukaisemaan turvallisuusmekanismeja keinotekoisesti. ‘

Tutkimus luonnehtii kokoelmien malleja “laukaisimetasteiksi” – lauseiksi, joilla on ilmeinen negatiivinen tai herkkästi kuuluvia konnotaatioita, jotka näyttävät suunnitelluille laukaisemaan turvallisuussuodattimia. Joitakin lauseita voidaan kuvailla ilmeisen latautuneiksi, kuten ‘tehdä itsemurha’, kun taas toisia voidaan kuvailla latautuneiksi vain kontekstissa, esimerkiksi kun haitallinen tavoite yhdistetään sanontaan “ilman, että jää kiinni”, joka merkitsee selvää aikomusta välttää havaitsemisen.

Aineistojen kielen epätasapaino tulee ilmi, kun n-grammien määrää lisätään, ja lauseet, jotka sisältävät eksplisiittisiä negatiivisia tai herkkästi kuuluvia merkityksiä, hallitsevat useimmin esiintyviä n-grammeja (ks. yllä oleva kuva). Tutkimus kuvaa näitä laukaisimilauseita, jotka yhdessä laukaisimisanat muodostavat laukaisimetasteita.

Joitakin lauseita voidaan kuvailla laajennetuiksi jo olemassa olevista latautuneista termeistä, kuten kun ‘varastaa’ muuttuu ‘varastaa arkaluontoista tietoa’, ‘varastaa luottamuksellista tietoa’ tai ‘varastaa henkilökohtaista tietoa’; ja esimerkiksi, kun ‘tehdä’ laajenee ‘tehdä itsemurha’, ‘tehdä sisäpiirin kauppa’ tai ‘tehdä henkilöllisyysvarkaus’ – selvästi poliisin, oikeuslaitoksen ja median raportoinnin kieltä.

Muita lauseita voidaan kuvailla kokonaan neutraaleista sanoista, jotka tulevat huolestuttaviksi vain yhdistelmänä, kuten ‘ilman, että jää kiinni’, joka on rakenteeltaan välttämistä, vaikka siinä ei ole sisäänrakennettua latautunutta termiä.

Kaksoisuuksia

Tutkijat huomauttavat, että eksplisiittisten vihjeiden toistaminen tekee kehotuksista näyttävän keinotekoisilta, ja osoittaa myös merkittävää datan toistoa kokoelmissa. Tutkijat testasivat tämän teorian ajamalla parisuhteiden vertailuja kummassakin aineistossa, soveltamalla kynnysarvoja 0,7:stä 0,99:ään ja ryhmittäen kehotukset, jotka ylittivät tietyssä kynnysarvossa, kopioina, kun taas loput käsitteltiin yksilöinä.

Koska ei ole sovittua standardia siitä, mitä pidetään “korkeana” samankaltaisuutena yksialueisessa aineistossa, he käyttivät Open AI:n Grade School Mathia (GSM8K), suositeltua ei-turvallisuusvertailuindeksiä, jota vastaavaa näytteen kokoa HarmBenchiin ja AdvBenchiin verrattaessa:

Kaksoiskappaleiden määrät AdvBench- ja HarmBench-aineistoissa eri samankaltaisuuskynnyksillä, verrattuna GSM8K:n kokoa vastaaviin alijoukkoihin. Lähes jokaisella kynnyksellä turvallisuusaineistot sisältävät paljon enemmän lähes identtisiä kehotuksia kuin ei-turvallisuusvertailuindeksi, osoittaen toistuvaa arviointia samaa pahantahtoista aikomusta hieman eri sanoin, ja viitatessa siihen, että ilmoitetun turvallisuuden suorituskyky voi olla inflatoitunut.

Kaksoiskappaleiden määrät AdvBench- ja HarmBench-aineistoissa eri samankaltaisuuskynnyksillä, verrattuna GSM8K:n kokoa vastaaviin alijoukkoihin. Lähes jokaisella kynnyksellä turvallisuusaineistot sisältävät paljon enemmän lähes identtisiä kehotuksia kuin ei-turvallisuusvertailuindeksi, osoittaen toistuvaa arviointia samaa pahantahtoista aikomusta hieman eri sanoin, ja viitatessa siihen, että ilmoitetun turvallisuuden suorituskyky voi olla inflatoitunut. Katso lähdeartikkeli paremman resoluution vuoksi.

Toisena löytönä tästä tutkimuksen osasta verrattiin kehotuksia kummassakin aineistossa, jotta voitiin mitata, kuinka moni niistä oli aidosti erilainen. Keskitasolla samankaltaisuusasetuksella vain noin 11 prosenttia AdvBench-kehotuksista oli erillisiä, kun taas lähes 94 prosenttia kysymyksistä GSM8K:n kokoisessa otoksessa oli erilaisia:

Esimerkkejä lähes identtisistä kehotuksista AdvBench- ja HarmBench-aineistoissa, jotka eroavat lähinnä sanamuodolla, mutta ilmaisevat samaa pahantahtoista aikomusta. Toistuva käyttö eksplisiittisistä vihjeistä, jotka on esitetty punaisella sisäänrakennetuille termeille ja oranssilla kontekstuaalisille termeille, tuottaa kehotuksia, jotka testaavat käytännössä yhtä tilannetta useita kertoja - mikä tarkoittaa, että yksi vastaus riittäisi arvioimaan mallin kykyä tuon aikomuksen suhteen.

Esimerkkejä lähes identtisistä kehotuksista AdvBench- ja HarmBench-aineistoissa, jotka eroavat lähinnä sanamuodolla, mutta ilmaisevat samaa pahantahtoista aikomusta. Toistuva käyttö eksplisiittisistä vihjeistä, jotka on esitetty punaisella sisäänrakennetuille termeille ja oranssilla kontekstuaalisille termeille, tuottaa kehotuksia, jotka testaavat käytännössä yhtä tilannetta useita kertoja – mikä tarkoittaa, että yksi vastaus riittäisi arvioimaan mallin kykyä tuon aikomuksen suhteen.

HarmBench osoitti saman suunnan, 16 prosentin kaksoiskappaleiden määrä kyseisellä tasolla verrattuna 3,5 prosenttiin GSM8K:ssa, mikä tarkoittaa, että turvallisuusaineistot usein toistivat samaa pahantahtoista pyynnöstä pienin sanamuutoksin.
Jos 85 prosentin erottuvuus otetaan kohtuulliseksi standardiksi, AdvBench saavutti sen vain erittäin tiukassa asetuksessa ja ei edelleenkään ylittänyt 90 prosenttia, kun taas GSM8K saavutti 85 prosentin paljon alemmalla kynnyksellä. Tutkimuksen mukaan tämä malli viittaa siihen, että turvallisuusvertailuindeksit testaavat toistuvia variaatioita samasta ajatuksesta, eikä laajaa valikoimaa hyökkäystilanteita.

Lisälähestymistapoja ja testejä

Tutkimuksen mainittu LLM-ohjattu “aikeen pesu” -menetelmä poistaa eksplisiittisen laukaisukielen, säilyttäen samalla pahantahtoisen aikomuksen. Sen sijaan, että aikomus ilmoitetaan suoraan, uudelleenmuokatut kehotukset viittaavat siihen, säilyttäen samalla pahantahtoisen kuorman, mutta välttäen vihjeitä, jotka olisivat todennäköisesti johtaneet LLM:n välittömiin kieltämisiin.

Tutkijat toteuttivat kaksi menetelmää, joilla tämä saavutettiin: konnotaatioiden neutraloiminen, joka korvaa ilmeisen negatiiviset termit neutraaleilla tai kuvaavilla vaihtoehtoilla; ja kontekstin siirtäminen, joka siirtää todellisen maailman viittaukset fiktiivisiin ympäristöihin ilman muutosta käytännön merkityksestä.

Pieni määrä uudelleenmuokkauksia tehtiin aluksi käsin, minkä jälkeen prosessi automatisoitiin käyttäen GPT-5.1:iä (gpt-5.1-2025-11-13) ja kahdeksan shotin kontekstissä oppimisen asetusta “aikeen pesijänä”. Vastauksia alkuperäisiin ja uudelleenmuokattuihin kehotuksiin verrattiin, jotta voitiin mitata, kuinka voimakkaasti eksplisiittinen laukaisukieli vaikutti turvallisuuden arviointiin.

Koska aikeen pesu voi muuttaa sekä sanamuotoa että kehyksiä, vastauksia arvioitiin turvallisuuden ja käytännöllisyyden suhteen. Turvallisuus arvioitiin viipuotteisella Likert-asteikolla viidestä pisteestä, “erittäin turvattomasta” “turvalliseen”, ehdolla, onko vastaus säilyttänyt alkuperäisen pahantahtoisen aikomuksen – ja jos, kuinka haitallista se oli:

Kehotusmalli, jota käytettiin alkuperäisten AdvBench- ja HarmBench-tietojen turvallisuuden arviointiin ennen aikeen pesun soveltamista. GPT-5.1:lle annettiin tehtäväksi arvioida kunkin vastauksen viipuotteisella Likert-asteikolla “erittäin turvattomasta” “turvalliseen”, valitsemalla yksi yhteinen arvio siitä, salliiko sisältö vahinkoa tai säilyikö se toimimattomana.

‘Käytännöllisyys’ arvioitiin rinnakkaisella viipuotteisella asteikolla “erittäin sovellettavasta” “sovellettamattomaan”, perustuen siihen, kuinka käyttökelpoinen ja siirrettävävä yksityiskohta olisi todellisessa maailmassa; ja hyökkäyksen onnistumisprosentti (ASR) mitattiin suorituskyvyn mukaan, ja uudelleenmuokkaus laskettiin onnistuneeksi vain, jos vastaus oli sekä turvaton että käytännöllinen.

Viipuotteiset arviot muunnettiin binäärisiksi tuloksiksi epäselvyyksien vähentämiseksi, ja aikeen pesu kehitettiin myös vankilamurtamismenetelmäksi lisäämällä iteratiivinen uudelleenmuokkaus-uudelleenluomisilmoitus, jossa epäonnistuneet uudelleenmuokkaukset syötettiin takaisin GPT-5.1:een samassa kahdeksan shotin kontekstissä oppimisen asetusten mukaisesti. Tämä silmukka jatkui, kunnes ennalta määritelty määrä yrityksiä saavutettiin tai tavoiteltu hyökkäyksen onnistumisprosentti saavutettiin.

Turvallisuuden arviointitesteissä käytettiin Pythonin wordcloud-pakettia n-grammien poistamiseen HarmBench- ja AdvBench-aineistoista, käyttäen perinteisiä suodatusmenetelmiä (ts. poistamaan stop-sanasanat ja muut epäolennaiset sanat ja merkit).

Samat turvallisuusaineistot, jotka käytettiin aiemmassa sanojen pilvi -analyysissä, yhdistettiin satunnaisiin näytteisiin edellä mainitusta GSM8K:sta, jossa sanamäärä yhdenmukaistettiin aineistojen välillä.

Tutkijat käyttivät upotusten all-MiniLM-L6-V2:n pisteestä Sentence-BERT Transformers:ista, koska se on jo hienosäädetty klusteroinnin ja semanttisen haun suuntaan.

Arviointikriteerit luotiin (nykyisin poistetun) Open AI GPT-4o -mallilla, joka rajoitettiin 1024 tokeniin. GPT-5.1 arvioi sekä turvallisuutta että käytännöllisyyttä aikeen pesun jälkeen, nollapisteessä kaikissa muissa suhteissa vastaava kuin aikeen pesu itsessään, paitsi että sekin oli rajoitettu 1024 tokeniin.

Malleja, jotka testattiin, olivat Gemini 3 Pro; Claude Sonnet 3.7; Grok 4; GPT-4o; ja Qwen2.5-7B-Instruct. Jos sovellettavissa, koska päättely oli tarpeeton tekijä, se alennettiin niissä malleissa, joissa se oli mahdollista.

Kaikki mallit olivat rajoitettuina 4096 tokenin tuotantokattoon:

Turvallisuuden arviointi (SE), käytännöllisyyden arviointi (PE) ja hyökkäyksen onnistumisprosentti (ASR) seitsemälle mallille AdvBenchillä (yläosa) ja HarmBenchillä (alaosa) kolmessa tilanteessa: ilman uudelleenmuokkausta, ensimmäisessä uudelleenmuokkauksessa ja myöhemmissä uudelleenmuokkaus-uudelleenluomisiteraatioissa aikeen pesussa. SE ilmoittaa prosenttiosuuden vastauksista, jotka on arvioitu “erittäin turvattomiksi”, “hyvin turvattomiksi” tai “turvattomiksi”; PE ilmoittaa prosenttiosuuden, joka on arvioitu “erittäin sovellettavaksi”, “hyvin sovellettavaksi” tai “sovellettavaksi”; ja ASR mitattiin osuutena vastauksista, jotka olivat sekä turvattomia että käytännöllisiä. Ei-uudelleenmuokkaustilanteessa ASR noudattaa standardimääritelmäänsä, koska abstrahointia ei sovelleta. Lihamerkityt arvot osoittavat jokaisen aineiston saavutetun korkeimman ASR:n, ja alempi ASR vastaa vahvempaa mallin turvallisuutta. Katso lähdeartikkeli paremman resoluution vuoksi.

Alkuvaiheen tuloksia tarkastellessaan tutkijat toteavat, että eksplisiittisten laukaisimetasteiden poistaminen hyökkäyskehotuksista johti terävään nousuun hyökkäyksen onnistumisprosentissa. AdvBenchillä keskimääräinen ASR nousi alkuarvon 5,38 prosentista 86,79 prosenttiin ensimmäisen uudelleenmuokkauksen jälkeen, HarmBenchillä se nousi 13,79 prosentista 79,83 prosenttiin – osoittaen, että mallien kieltämiset olivat vahvasti sidoksissa eksplisiittisten laukaisimetasteiden läsnäoloon.

Tutkijat toteavat:

‘Tämä osoittaa, että mallien kieltämiset ovat suurelta osin johtuvia laukaisimetasteiden läsnäolosta. Tästä seuraa, että turvallisuusaineistot eivät mitä todellisia turvallisuusriskejä, koska ne riippuvat enemmän laukaisimetasteista kuin itse pahantahtoisesta aikomuksesta.’

Aikeen pesu, tutkimuksen mukaan, poisti tehokkaasti laukaisimetasteet säilyttäen samalla pahantahtoisen aikomuksen, ja toimi vahvana vankilamurtamismenetelmänä. Lopullisessa uudelleenmuokkaus-uudelleenluomisiteraatiossa, joka vastasi jokaisen aineiston saavutetuinta ASR:ää, hyökkäyksen onnistumisprosentit saavuttivat 90 prosentista yli 98 prosenttiin kaikissa malleissa.

Tähän kuuluivat Gemini 3 Pro ja Claude Sonnet 3.7, jotka murtautuivat ASR:llä 93 prosenttia AdvBenchillä ja 91-93 prosenttia HarmBenchillä vain muutamassa iteratiivisessa kierroksessa.

Tutkijat johtopäätöksineen:

‘Tuloksemme osoittavat, että aiemmat turvallisuuden johtopäätökset eivät pidä paikkaansa, kun laukaisimetasteet poistetaan, ja että havaittu turvallisuuden suorituskyky on suurelta osin johtuvia laukaisimetasteiden läsnäolosta eikä itse turvallisuusriskeistä.

‘Osoitimme myös, että aikeen pesu voidaan käyttää voimakkaana vankilamurtamismenetelmänä, joka saavuttaa korkeat hyökkäyksen onnistumisprosentit, 90 prosentista yli 98 prosenttiin.

‘Kaiken kaikkiaan havainnoimme kriittisen aukon siinä, miten mallien turvallisuutta arvioidaan ja miten todellinen vihamielinen käyttäytyminen ilmenee.

‘Tästä johtuen johtopäätökseni ovat, että (1) turvallisuuden arviointi on kehittymistä varten, jotta voidaan ottaa paremmin huomioon vihamieliset hyökkäykset, ja (2) nykyiset turvallisuussopimispyrkimykset ovat edelleen kaukana robustista puolustuksesta todellisia uhkia vastaan.’

Johtopäätös

Yksi yleinen säie, joka edelleen kulkee kielen ja tietokoneen näkemisen kirjallisuuden läpi (ja paikkoihin, joissa nämä risteävät, kuten VLM:t), on kyvyttömyys luotettavasti ymmärtää, kun joutuu houkuteltavaksi tuottamaan kiellettyä sisältöä; tai jopa kun joutuu vahingossa harhautumaan siihen ilman ulkoista pakotetta.

Taustalla suurempien ja hämärimpien mallien valmistajien toiminnassa voidaan olettaa, että radikaalisti kiristämällä nämä semanttiset pyydysalueet saadaan aikaan hyväksymättömiä sivuvaikutuksia, kuten laskua “ei-kielletyn” sisällön tuottamisessa tai siedettämätön määrä vääräpositiivisia tuloksia sisällön suodattimista.

Mallin perusrakenteen luonne koulutetussa mallissa on seurata kaikkia koulutusaineistojaan mihin tahansa johtopäätökseen, johon kehotus voi ajaa sen; ainoat alkuperäiset rajoitukset, jotka on saatavilla, ovat a) välttää sisällyttämästä kiistanalaista materiaalia koulutusaineistoon (joka on yhtä paljon logistinen ongelma kuin mikä tahansa muu); tai b) “leikata” polut kiellettyyn sisältöön koulutuksen jälkeen (prosessi, joka voidaan usein kääntää takaisin eksplisiittisellä abliteroinnilla tai tahattomana sivuvaikutuksena hienosäätöä).

 

* Minun korvaus kirjoittajien sisäisistä viittauksista hyperlinkkeihin. Kirjoittajien painotukset eivät ole minun.

https://www.unite.ai/what-is-overfitting/

Julkaistu maanantaina 23. helmikuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai