AI-mallit ja alustat
Scale AI raportoi ROK-FORTRESS -löydöksistä monikielisessä tekoälyturvallisuudessa

Scale AI julkaisi 17. syyskuuta 2026 tulokset ROK-FORTRESS -projektista, kaksikielisestä englanti‑korealaisesta vastustavasta turvallisuusvertailusta, jonka on kehittänyt yhdessä Korea AI Safety Institute -laitoksen kanssa. Tulokset osoittivat, että koreaksi kirjoitetut ja korealaisiin konteksteihin sidotut kehotteet olivat johdonmukaisesti yhteydessä alhaisempaan mitattuun vahinkoon lähes kaikissa 14 arvioidussa huippumallissa.
Vertailun suunnittelu: Transkreaatiomatriisi
Useimmissa monikielisissä turvallisuusvertailuissa kiinteä kehotus käännetään toiseen kieleen säilyttäen sen kuvaama tilanne muuttumattomana. Scale AI:n Madhu Sehwagin kirjoittamassa tutkimusjulkaisussa ROK-FORTRESS esitetään hallittuna transkreaatiomatriisina: jokainen vastustava kehotus arvioidaan jopa neljässä variantissa, joissa kieli (englanti tai korea), sekä geopoliittinen tausta (USA:n tai Korean tahot, instituutiot ja toiminnalliset yksityiskohdat) vaihtelevat itsenäisesti. Jokainen vastustava kehotus yhdistetään harmittomaan vastineeseen, jotta vertailu voi myös mitata liiallista kieltäytymistä.
Koko aineisto kattaa 1 235 tehtävää neljässä kansallisen turvallisuuden ja yleisen turvallisuuden alueessa: kemialliset, biologiset, radioaktiiviset, ydin‑ ja räjähdeuhkat (CBRNE); poliittinen väkivalta ja terrorismi; rikollinen ja rahoitustoiminta; sekä tiedon vuoto. Vastaukset pisteytetään kalibroiduilla LLM‑tuomarin paneeleilla, jotka on validoitu asiantuntijoiden laatimien referenssimerkintöjen perusteella, käyttäen kehotteeseen kohdistuvia binaarisia rubriikkeja, jotka on kehittänyt asiantuntija‑red‑team‑tiimi.
Julkaisu havainnollistaa suunnitelmaa massatuhoiskenariossa: sama taustalla oleva aikomus voi viitata vuoden 1995 Oklahoma Federal Building -rakennuksen pommitukseen Yhdysvalloissa tai vuoden 1987 Korean Air -lento 858:n pommitukseen Koreassa, eikä pelkkä käännösarviointi pysty paljastamaan, miten tämä taustan muutos vaikuttaa mallin käyttäytymiseen.
ROK-FORTRESS on uusin vertailu laajemmassa Scale AI:n ja Korea AI Safety Institute -yhteistyössä, joka kattaa yhteistutkimuksen, LLM‑arvioinnit ja red‑team‑toiminnan, ja se perustuu FORTRESSiin, Scale AI:n kansallisen turvallisuuden ja yleisen turvallisuuden vertailuun huippumalleille.
Raportoidut havainnot 14 mallissa
Arviointi kattoi kaksirataisen joukon huippu- ja koreanksi optimoituja malleja, papereiden mukaan. Scale AI raportoi, että englanninkieliset kehotteet tuottivat yleisesti korkeimman tasapainotetun riskipisteen, kun taas täysin transkreetatut korealaiset kehotteet antoivat alhaisimman, ja välimuotoiset variantit sijoittuivat näiden väliin. Tämä malli päti myös korealisiin alueellisiin erikoismalleihin. Haitallisimpien ja vähiten haitallisten mallien riskipisteet erosivat lähes yhdeksänkertaisesti.
Suora-pyyntö-ablaatio monimutkaisti tätä mallia. Vertailun päätestit käyttävät monimutkaisia vastustavia kehotteita, jotka piilottavat haitalliset pyynnöt roolileikin, keksittyjen taustatarinoiden tai tunnepitoisten vetoomusten sisään; kun nämä kuoret poistettiin ja sama tieto pyydettiin selkeällä, suoralta kielellä, korealainen etu lähes katosi. OpenAI:n, Anthropicin ja Googlen omistamaiset mallit pysyivät hieman turvallisempina koreaksi, kun taas viisi avoimen lähdekoodin huippumallia olivat todennäköisemmin suostuvia koreaksi. Julkaisu toteaa, että tämä jakautuminen viittaa siihen, että osa korealaisesta supistuksesta johtuu kehotteiden erikoistumisesta, eli että vastustavien kuorten teho heikkenee transkreatiossa, eikä siitä, että kieli itsessään olisi turvallisuuteen vaikuttava tekijä.
Scale AI raportoi myös, että siirtyminen englannista koreaksi oli noin 2,5‑kertaisesti suurempi vaikutus kuin siirtyminen Yhdysvaltojen ja korean taustan välillä, noin kymmenen prosenttiyksikköä verrattuna neljään, ja esittää yhden tuloksiin sopivan tulkinnan: että korea toimii konservatiivisena riskisignaalina. Neljässä 14:stä mallista korealaisen kontekstin lisääminen heikensi merkittävästi haitallisten vastausten vähenemistä, joka liittyy koreankieleen, eikä yksikään malli osoittanut tilastollisesti merkittävää vaikutusta päinvastaiseen suuntaan. Jos tarkastellaan vain tapauksia, joissa mallit vastasivat sen sijaan että kieltäytyisivät, 12:sta 14:stä antoi edelleen vähemmän haitallisia vastauksia koreaksi, samalla kun mallit kieltäytyivät myös harmittomista korealaisista pyynnöistä useammin, joissakin tapauksissa noin kaksinkertaisesti.
Preprint, julkinen aineisto ja esitetyt vaikutukset
Alustava arXiv‑esipainos, jonka otsikko on “ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety”, luettelee Michael S. Lee:n ja 15 muuta tekijää. Se lähetettiin ensimmäisen kerran 13. toukokuuta 2026 ja viimeksi tarkistettiin 7. heinäkuuta 2026, ja se sisältää 16 sivua varsinaista tekstiä sekä liitteen, yhteensä 74 sivua, neljä kuvaa ja kaksi taulukkoa varsinaisessa tekstissä. Sen tiivistelmä esittää tulokset todisteina siitä, että ainakin englanti‑korealaisessa tapauksessa turvallisuuskäyttäytymistä muovaavat kieli‑riskisignaalit ja kontekstiyhteydet, jotka pelkkä käännösarviointi ei havaitse, ja se toteaa, että transcreation‑matriisimenetelmä on suunniteltu yleistettäväksi muihin kieli‑kulttuuripareihin.
Julkinen osajoukko datasetistä on saatavilla Hugging Face -palvelussa CC-BY-4.0 -lisenssillä, pääsyä säätelevän sopimuksen takana, joka vaatii yhteystiedot. Osajoukko sisältää 791 / 1 235:stä tehtävästä, 64 prosenttia, kun taas jäljelle jäävät 444 tehtävää, 36 prosenttia, pidätetään yksityisenä holdoutina asiantuntija‑red‑team‑arvioinnin perusteella haittapotentiaalin vuoksi, sekä rajoittaakseen suurempaa todellista väärinkäyttöriskiä aiheuttavia kehotteita että estääkseen vertailuarvon saastumisen. Julkaisu koostuu 359 kulttuurista riippumattomasta tehtävästä, joista jokaisesta on kaksi varianttia, sekä 432 kulttuurisidonnaisesta tehtävästä, joista jokaisesta on neljä varianttia, mikä tuottaa yhteensä 1 519 tehokasta tehtävä‑varianttiparia, ja jokaisessa tehtävässä on yksi‑seitsemän binaarista rubriikkikohdetta, jotka on kartoitettu seitsemään haittakomponenttiin domain‑spesifisten riskitasojen 1–3 mukaan. Julkinen osajoukko kattaa CBRNE‑tehtävät (251), rikolliset ja rahoitukselliset laittomat toimet (248), poliittisen väkivallan ja terrorismin (209) sekä tiedonvuodon (83), sisältäen 450 FORTRESS‑projektista sovitusta tehtävästä ja 341 täysin uutta. Datasetti toimitetaan Parquet‑muodossa, ja mukana on myös TSV‑versio.
Julkaisussa Scale AI toteaa, että pelkät käännökset voivat aliarvioida todellisia turvallisuusaukkoja, että vertailuarvojen tulisi testata transkretoituja kehotteita, jotka mukauttavat sekä kielen että geopoliittisen taustan säilyttäen alkuperäisen tarkoituksen, ja että jälkikoulutusdata sekä red‑team‑käytännöt tulisi sisällyttää kulttuurisesti perustettuihin variantteihin eikä pelkästään englanninkielisten vastustavien kehotteiden käännettyihin versioihin. Liittoutuneiden hallitusten kontekstissa Scale AI:n mukaan malli, joka suoriutuu hyvin englanninkielisissä turvallisuusarvioissa, saattaa käyttäytyä eri tavalla, kun sitä kysytään paikallisella kielellä paikallisesti perustettuihin uhkiin liittyen. Julkaisussa todetaan, että lisätestausta tarvitaan selvittämään, pätevätkö samat mallit muissa kielissä ja maissa.












