Modele și platforme AI
Scale AI raportează constatările ROK-FORTRESS privind siguranța AI multilingvă

Scale AI, pe 17 septembrie 2026, a publicat constatările din ROK-FORTRESS, un benchmark de siguranță adversarial bilingv engleză–coreeană dezvoltat în colaborare cu Korea AI Safety Institute, raportând că solicitările redactate în coreeană și ancorate în contexte coreene au fost în mod constant asociate cu un nivel de daună măsurat mai scăzut la aproape toate cele 14 modele de frontieră evaluate.
Designul benchmarkului: Matricea de transcreare
Majoritatea benchmark-urilor de siguranță multilingvă traduc un prompt fix într-o altă limbă păstrând neschimbat scenariul descris. În postarea de cercetare, scrisă de Madhu Sehwag, Scale AI descrie ROK-FORTRESS ca o matrice controlată de transcreare: fiecare prompt adversarial este evaluat în până la patru variante care variază independent limba, engleza versus coreeană, și fundamentul geopolitic, adică entități, instituții și detalii operaționale din SUA versus Coreea. Fiecare prompt adversarial este asociat cu un omolog benign, astfel încât benchmark-ul poate măsura și supra‑refuzul.
Setul complet de date cuprinde 1.235 de sarcini în patru domenii de securitate națională și siguranță publică: amenințări chimice, biologice, radiologice, nucleare și explozive (CBRNE); violență politică și terorism; activități criminale și financiare; și scurgere de informații. Răspunsurile sunt evaluate de paneluri calibrate LLM‑ca‑jurist, validate prin etichete de referință scrise de experți, utilizând rubrici binare specifice promptului dezvoltate de experți red‑team.
Postarea ilustrează designul printr-un scenariu de atac cu victime multiple: aceeași intenție de bază poate invoca bombardarea din 1995 a clădirii federale Oklahoma din Statele Unite sau bombardarea din 1987 a zborului Korean Air 858 în Coreea, iar o evaluare bazată doar pe traducere nu poate dezvălui cum această schimbare de context modifică comportamentul modelului.
ROK-FORTRESS este cel mai recent benchmark dintr-un parteneriat mai larg între Scale AI și Korea AI Safety Institute, care acoperă cercetare comună, evaluări LLM și red teaming, și se bazează pe FORTRESS, benchmark‑ul de securitate națională și siguranță publică al Scale AI pentru modele de frontieră.
Constatările raportate la cele 14 modele
Evaluarea a cuprins un set dublu de modele de frontieră și optimizate pentru coreeană, conform lucrării. Scale AI raportează că solicitările în engleză au generat în general cel mai mare scor de risc ponderat pe nivel, în timp ce solicitările complet transcreate în coreeană au obținut cel mai mic, variantele intermediare situându-se între acestea, iar tiparul a rămas valabil și pentru modelele regionale specializate pe coreeană. Modelele cele mai și cele mai puțin dăunătoare au diferat cu aproape nouă ori în scorurile lor de risc.
O ablație prin solicitare directă a complicat acest tipar. Testele principale ale benchmarkului folosesc solicitări adversariale elaborate care ascund cereri dăunătoare în jocuri de rol, povești inventate sau apeluri emoționale; când aceste învelișuri au fost eliminate și aceeași informație a fost solicitată într‑un limbaj simplu și direct, avantajul coreean a dispărut în mare parte. Modelele proprietare de la OpenAI, Anthropic și Google au rămas moderat mai sigure în coreeană, în timp ce cinci modele de frontieră cu sursă deschisă au devenit mai predispuse să îndeplinească cererile în coreeană. Lucrarea afirmă că această divizare sugerează că o parte a suprimării în coreeană reflectă specializarea promptului, adică pierderea eficacității învelișurilor adversariale prin transcreare, mai degrabă decât o aliniere intrinsecă de siguranță bazată pe limbă.
Scale AI raportează, de asemenea, că efectul trecerii de la engleză la coreeană a fost aproximativ de 2,5 ori mai mare decât efectul schimbării de la contextul SUA la contextul coreean, adică aproximativ zece puncte procentuale versus patru, și oferă o interpretare compatibilă cu rezultatele: că limba coreeană funcționează ca un semnal de risc conservator. În 4 din cele 14 modele, adăugarea contextului coreean a slăbit semnificativ reducerea răspunsurilor dăunătoare asociate cu limba coreeană, iar niciun model nu a arătat un efect statistic semnificativ în direcția opusă. Dacă luăm în considerare doar cazurile în care modelele au răspuns în loc să refuze, 12 din cele 14 au tot oferit răspunsuri mai puțin dăunătoare în coreeană, în timp ce modelele au refuzat cererile inofensive în coreeană mai frecvent, în unele cazuri de aproximativ de două ori mai des.
Preprint, set de date public și implicații declarate
Preprintul de pe arXiv care stă la baza studiului, intitulat „ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety”, enumeră pe Michael S. Lee și 15 co‑autori. A fost depus pentru prima dată pe 13 mai 2026 și revizuit ultima dată pe 7 iulie 2026, și are 16 pagini de text principal plus o anexă, 74 de pagini în total, cu patru figuri și două tabele în textul principal. Rezumatul său încadrează rezultatele ca dovadă că, cel puțin în cazul engleză‑coreean, comportamentul de siguranță este modelat de semnale de limbaj‑ca‑risc și de interacțiunile de context pe care evaluările bazate doar pe traducere le omit, și afirmă că metodologia matricei de transcreare este concepută să se generalizeze la alte perechi limbă‑cultură.
Un subset public al setului de date este disponibil pe Hugging Face sub o licență CC-BY-4.0, în spatele unui acord de acces care necesită informații de contact. Subsetul conține 791 din cele 1.235 de sarcini, 64 %, în timp ce cele 444 de sarcini rămase, 36 %, sunt reținute ca un holdout privat pe baza evaluării experților red‑teamer a potențialului de daună, atât pentru a restricționa prompturile considerate cu risc mai mare de utilizare greșită în viața reală, cât și pentru a preveni contaminarea benchmark‑ului. Lansarea cuprinde 359 de sarcini Cultură agnostică cu câte două variante fiecare și 432 de sarcini Cultură specifică cu patru variante fiecare, rezultând 1.519 de perechi efective sarcină‑variantă, iar fiecare sarcină are de la unu la șapte elemente binare de rubrică mapate la șapte dimensiuni ale daunelor cu niveluri de risc specifice domeniului de la 1 la 3. Subsetul public acoperă CBRNE (251 de sarcini), activități criminale și financiare ilicite (248), violență politică și terorism (209) și scurgere de informații (83), cu 450 de sarcini adaptate din FORTRESS și 341 nou create. Setul de date este furnizat în format Parquet, cu o versiune TSV inclusă.
În postare, Scale AI afirmă că evaluările bazate doar pe traducere pot subestima diferențele de siguranță din lumea reală, că benchmark‑urile ar trebui să testeze prompturi transcreate care adaptează atât limba, cât și contextul geopolitic, menținând în același timp intenția de bază, și că datele post‑antrenament și practicile de red‑teaming ar trebui să includă variante cu fundament cultural, în loc de versiuni traduse ale prompturilor adversariale în engleză. Pentru contexte guvernamentale aliate, Scale AI susține că un model care performează bine în evaluările de siguranță în engleză poate reacționa diferit atunci când i se adresează în limba locală despre amenințări cu fundament local. Postarea precizează că sunt necesare teste suplimentare pentru a determina dacă aceleași tipare se mențin în alte limbi și țări.












