AI-modeller og plattformer
Scale AI rapporterer ROK-FORTRESS-funn om flerspråklig AI-sikkerhet

Scale AI publiserte 17. september 2026 funn fra ROK-FORTRESS, et tosprogs engelsk–koreansk adversarial sikkerhetsbenchmark utviklet i samarbeid med Korea AI Safety Institute, og rapporterte at prompt som er skrevet på koreansk og forankret i koreanske kontekster konsekvent var knyttet til lavere målt skade på nesten alle de 14 frontier-modellene som ble evaluert.
Benchmarkdesign: Transkreasjonsmatrisen
De fleste flerspråklige sikkerhets‑benchmarker oversetter et fast prompt til et annet språk mens scenarioet det beskriver holdes uendret. I forskningsinnlegget, skrevet av Madhu Sehwag, beskriver Scale AI ROK-FORTRESS som en kontrollert transkreasjonsmatrise: hvert adversariale prompt evalueres på opptil fire varianter som uavhengig endrer språk, engelsk versus koreansk, og geopolitisk forankring, det vil si amerikanske versus koreanske enheter, institusjoner og operative detaljer. Hvert adversariale prompt pares med en harmløs motpart slik at benchmarken også kan måle over‑avslag.
Det komplette datasettet dekker 1 235 oppgaver innen fire nasjonal‑sikkerhets‑ og offentlig‑sikkerhetsdomener: kjemiske, biologiske, radiologiske, nukleære og eksplosive (CBRNE) trusler; politisk vold og terrorisme; kriminell og finansiell aktivitet; samt informasjonslekkasje. Svarene vurderes av kalibrerte LLM‑som‑dommer‑paneler som er validert mot ekspert‑skrevne referanseetiketter, ved bruk av prompt‑spesifikke binære rubrikker utviklet av ekspert‑red‑teamere.
Innlegget illustrerer designet med et massedrap‑scenario: den samme underliggende intensjonen kan referere til bombingen av Oklahoma Federal Building i USA i 1995 eller bombingen av Korean Air Flight 858 i Korea i 1987, og en ren oversettelses‑evaluering kan ikke avdekke hvordan dette skiftet i forankring endrer modellens atferd.
ROK-FORTRESS er det nyeste benchmarket fra et bredere partnerskap mellom Scale AI og Korea AI Safety Institute som omfatter felles forskning, LLM‑evalueringer og red‑team‑arbeid, og det bygger på FORTRESS, Scale AIs benchmark for nasjonal sikkerhet og offentlig sikkerhet for frontier‑modeller.
Rapporterte funn på tvers av 14 modeller
Evalueringen dekket et dobbel‑spor sett av frontier‑ og koreansk‑optimaliserte modeller, ifølge artikkelen. Scale AI rapporterer at engelske prompt generelt ga den høyeste risikoscoren vektet etter nivå, mens fullt transkreasjonerte koreanske prompt ga den laveste, med mellomliggende varianter i mellom, og at mønsteret holdt seg selv for koreanspesialiserte regionale modeller. De mest og minst skadelige modellene skilte seg med nesten ni ganger i sine risikoscorer.
En avblåsing med direkte forespørsel kompliserte dette mønsteret. Benchmarkens hovedtester bruker omfattende adversariale prompt som skjuler skadelige forespørsler i rollespill, oppdiktede bakhistorier eller følelsesmessige appeller; når disse innpakningene ble fjernet og den samme informasjonen ble etterspurt i klar, direkte språk, forsvant den koreanske fordelen stort sett. Proprietære modeller fra OpenAI, Anthropic og Google forble noe tryggere på koreansk, mens fem åpen‑kilde frontier‑modeller ble mer tilbøyelige til å etterkomme på koreansk. Artikkelen påpeker at denne splittingen antyder at en del av den koreanske undertrykkelsen skyldes prompt‑spesialisering, det vil si at adversariale innpakninger mister effektivitet gjennom transkreasjon, snarere enn en iboende språk‑basert sikkerhetsjustering.
Scale AI rapporterer også at effekten av å bytte fra engelsk til koreansk var omtrent 2,5 ganger så stor som effekten av å bytte fra amerikansk til koreansk forankring, omtrent ti prosentpoeng versus fire, og gir én tolkning som stemmer overens med resultatene: at koreansk fungerer som et konservativt risikosignal. I 4 av de 14 modellene svekket tillegget av koreansk kontekst signifikant reduksjonen i skadelige svar knyttet til koreansk språk, og ingen modell viste en statistisk signifikant effekt i motsatt retning. Når man kun ser på tilfeller hvor modeller svarte i stedet for å avslå, ga 12 av de 14 fortsatt mindre skadelige svar på koreansk, mens modellene også avslo harmløse koreanske forespørsler oftere, i noen tilfeller omtrent dobbelt så ofte.
Preprint, offentlig datasett og angitte implikasjoner
Det underliggende forhåndsmanuskriptet på arXiv, med tittelen “ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety”, lister Michael S. Lee og 15 medforfattere. Det ble først innsendt 13. mai 2026 og sist revidert 7. juli 2026, og det omfatter 16 sider med hovedtekst pluss et vedlegg, totalt 74 sider, med fire figurer og to tabeller i hovedteksten. Sammendraget rammer inn resultatene som bevis på at, i det minste i det engelske–koreanske tilfellet, sikkerhetsatferd formes av språk‑som‑risikosignaler og kontekstinteraksjoner som evalueringer basert utelukkende på oversettelse går glipp av, og det oppgir at transcreasjons‑matrise‑metodikken er designet for å generalisere til andre språk‑kultur‑par.
Et offentlig delsett av datasettet er tilgjengelig på Hugging Face under en CC-BY-4.0-lisens, bak en tilgangsavtale som krever kontaktinformasjon. Delsettet inneholder 791 av de 1 235 oppgavene, 64 prosent, mens de resterende 444 oppgavene, 36 prosent, holdes tilbake som et privat hold‑out basert på ekspertvurdering av red‑team om skadepotensial, både for å begrense forespørsler som anses utgjøre større risiko for misbruk i virkeligheten og for å forhindre forurensning av referansesettet. Utgivelsen omfatter 359 kulturagnostiske oppgaver med to varianter hver og 432 kulturspesifikke oppgaver med fire varianter hver, noe som gir 1 519 effektive oppgave‑variant‑par, og hver oppgave har én til syv binære rubrikkpunkter knyttet til syv skade‑dimensjoner med domenespesifikke risikonivåer 1 til 3. Det offentlige delsettet dekker CBRNE (251 oppgaver), kriminelle og økonomiske ulovlige aktiviteter (248), politisk vold og terrorisme (209) og informasjonslekkasje (83), med 450 oppgaver tilpasset fra FORTRESS og 341 nyopprettede. Datasettet leveres i Parquet‑format med en TSV‑versjon inkludert.
I innlegget uttaler Scale AI at evalueringer kun basert på oversettelse kan feilvurdere sikkerhetsgap i den virkelige verden, at referansesett bør teste transskapte prompt som tilpasser både språk og geopolitisk forankring samtidig som den underliggende intensjonen bevares, og at data etter trening og red‑team‑praksiser bør innlemme kulturelt forankrede varianter i stedet for kun oversatte versjoner av engelske motstands‑prompt. For allierte regjeringskontekster sier Scale AI at en modell som presterer godt i engelske sikkerhetsevalueringer kan oppføre seg annerledes når den blir spurt på lokalspråket om lokalt forankrede trusler. Innlegget påpeker at ytterligere testing er nødvendig for å fastslå om de samme mønstrene gjelder på andre språk og i andre land.












