AI-modeller og platforme

Scale AI rapporterer ROK-FORTRESS-fund om flersproget AI-sikkerhed

mm
Føj Unite.AI til dine foretrukne kilder på Google

Scale AI offentliggjorde den 17. september 2026 fund fra ROK-FORTRESS, et tosproget engelsk–koreansk modstandsdygtigt sikkerhedsbenchmark udviklet i fællesskab med Korea AI Safety Institute, og rapporterede, at prompts skrevet på koreansk og forankret i koreanske kontekster konsekvent var forbundet med lavere målt skade på tværs af næsten alle de 14 frontier-modeller, der blev evalueret.

Benchmarkdesign: Transcreation-matricen

De fleste flersprogede sikkerhedsbenchmarks oversætter en fast prompt til et andet sprog, mens scenariet den beskriver forbliver uændret. I forskningsindlægget, forfattet af Madhu Sehwag, beskriver Scale AI ROK-FORTRESS som en kontrolleret transcreation-matrix: hver modstandsdygtig prompt evalueres på tværs af op til fire varianter, som uafhængigt varierer sprog, engelsk versus koreansk, og geopolitisk forankring, hvilket betyder USA‑ versus koreanske enheder, institutioner og operationelle detaljer. Hver modstandsdygtig prompt parres med en harmløs pendant, så benchmarket også kan måle over‑afvisning.

Det fulde datasæt dækker 1,235 opgaver på tværs af fire nationale sikkerheds‑ og offentlig‑sikkerhedsområder: kemiske, biologiske, radiologiske, nukleare og eksplosive (CBRNE) trusler; politisk vold og terrorisme; kriminel og finansiel aktivitet; samt informationslækage. Svarene scores af kalibrerede LLM‑som‑dommer‑paneler valideret mod ekspert‑skrevne referenceetiketter, ved brug af prompt‑specifikke binære rubrikker udviklet af ekspert‑red‑teamere.

Indlægget illustrerer designet med et massedøds‑angrebsscenarie: den samme underliggende intention kan fremkalde bombningen af Oklahoma Federal Building i USA i 1995 eller bombningen af Korean Air Flight 858 i Korea i 1987, og en ren oversættelses‑evaluering kan ikke afsløre, hvordan den ændring i forankring påvirker modellens adfærd.

ROK-FORTRESS er det seneste benchmark fra et bredere partnerskab mellem Scale AI og Korea AI Safety Institute, der omfatter fælles forskning, LLM‑evalueringer og red‑team‑arbejde, og det bygger videre på FORTRESS, Scale AI’s benchmark for national sikkerhed og offentlig sikkerhed for frontier‑modeller.

Rapporterede fund på tværs af 14 modeller

Evalueringen omfattede et dobbeltsporet sæt af frontier‑ og koreansk‑optimerede modeller, ifølge papiret. Scale AI rapporterer, at engelske prompts generelt gav den højeste tier‑vægtede risikoscore, mens fuldt transcreatorede koreanske prompts gav den laveste, med mellemliggende varianter imellem, og at mønsteret holdt sig selv for koreansk‑specialiserede regionale modeller. De mest og mindst skadelige modeller adskilte sig med næsten ni gange i deres risikoscores.

En direkte‑forespørgsels‑ablation komplicerede dette mønster. Benchmarkens hovedtests bruger omfattende modstandsdygtige prompts, der skjuler skadelige anmodninger i rollespil, opfundne baghistorier eller følelsesmæssige appeller; når disse omslag blev fjernet, og den samme information blev anmodet om i klar, direkte sprog, forsvandt den koreanske fordel stort set. Proprietære modeller fra OpenAI, Anthropic og Google forblev beskedent sikrere på koreansk, mens fem open‑source frontier‑modeller blev mere tilbøjelige til at efterkomme på koreansk. Papiret fastslår, at denne splittelse antyder, at en del af den koreanske undertrykkelse afspejler prompt‑specialisering, hvilket betyder, at modstandsdygtige omslag mister effektivitet gennem transcreation, snarere end en indbygget sprog‑baseret sikkerhedsjustering.

Scale AI rapporterer også, at effekten af at skifte fra engelsk til koreansk var cirka 2,5 gange så stor som effekten af at skifte fra USA‑ til koreansk forankring, omkring ti procentpoint versus fire, og giver én fortolkning, der er i overensstemmelse med resultaterne: at koreansk fungerer som et konservativt risikosignal. I 4 af de 14 modeller svækkede tilføjelsen af koreansk kontekst signifikant reduktionen af skadelige svar, der er forbundet med koreansk sprog, og ingen model viste en statistisk signifikant effekt i den modsatte retning. Når man kun betragter tilfælde, hvor modellerne svarede i stedet for at afvise, gav 12 af de 14 stadig mindre skadelige svar på koreansk, mens modeller også afviste harmløse koreanske anmodninger oftere, i nogle tilfælde omkring to gange så ofte.

Preprint, offentligt datasæt og angivne implikationer

Det underliggende forhåndsmanuskript på arXiv, med titlen “ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety”, opregner Michael S. Lee og 15 medforfattere. Det blev første gang indsendt den 13. maj 2026 og sidst revideret den 7. juli 2026, og det omfatter 16 sider hovedtekst plus et appendix, 74 sider i alt, med fire figurer og to tabeller i hovedteksten. Dets resumé indrammer resultaterne som bevis for, at mindst i det engelske–koreanske tilfælde, sikkerhedsadfærd formes af sprog‑som‑risikosignaler og kontekstinteraktioner, som evalueringer baseret udelukkende på oversættelse overser, og den angiver, at transcreation‑matrix‑metodologien er designet til at generalisere til andre sprog‑kultur‑par.

En offentlig delmængde af datasættet er tilgængelig på Hugging Face under en CC-BY-4.0-licens, bag en adgangsaftale der kræver kontaktinformation. Delmængden indeholder 791 af de 1 235 opgaver, 64 procent, mens de resterende 444 opgaver, 36 procent, holdes tilbage som en privat holdout baseret på ekspert‑red‑team‑vurdering af skadepotentiale, både for at begrænse prompts, der vurderes at udgøre større risiko for misbrug i den virkelige verden, og for at forhindre forurening af benchmarken. Udgivelsen omfatter 359 kultur‑agnostiske opgaver med to varianter hver og 432 kultur‑specifikke opgaver med fire varianter hver, hvilket giver 1 519 effektive opgave‑variant‑par, og hver opgave har én til syv binære rubrik‑elementer kortlagt til syv skade‑dimensioner med domænespecifikke risikoniveauer 1 til 3. Den offentlige delmængde dækker CBRNE (251 opgaver), kriminelle og finansielle ulovlige aktiviteter (248), politisk vold og terrorisme (209) samt informationslækage (83), med 450 opgaver tilpasset fra FORTRESS og 341 nyforfatte. Datasættet leveres i Parquet‑format med en TSV‑version inkluderet.

I indlægget angiver Scale AI, at kun‑oversættelses‑evalueringer kan fejlvurdere sikkerhedshuller i den virkelige verden, at benchmarks bør teste transskabte prompts, som tilpasser både sprog og geopolitisk forankring, mens den underliggende intention bevares, og at efter‑trænings‑data og red‑team‑praksis bør inkludere kulturelt forankrede varianter frem for kun oversatte versioner af engelske modstandsprompts. For allierede regerings‑kontekster siger Scale AI, at en model, der klarer sig godt i engelske sikkerhedsevalueringer, kan opføre sig anderledes, når den forespørges på det lokale sprog om lokalt forankrede trusler. Indlægget konstaterer, at yderligere test er nødvendige for at afgøre, om de samme mønstre gælder for andre sprog og lande.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, der fokuserer på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde udforsker, hvordan læring, resonnering, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og hvordan der kan trækkes forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål i kognitiv videnskab og filosofi om sindet.
Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som resonneringsmodeller, agente systemer, emergent kognition og alignment-teori, med det formål at klargøre, hvad fremgang mod AGI faktisk betyder - og hvad det ikke gør. I stedet for at jagte tidsfrister eller hype lægger han vægt på første principper, konceptuel rigor og grænserne for nuværende modeller.
Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AIs redaktionelle team for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncepter.