Моделі та платформи ШІ

Scale AI доповідає про результати ROK-FORTRESS щодо багатомовної безпеки ШІ

mm
Додайте Unite.AI до бажаних джерел у Google

Scale AI 17 вересня 2026 року опублікувала результати ROK-FORTRESS, двомовного (англійсько‑корейського) адверсарного бенчмарку безпеки, розробленого спільно з Korea AI Safety Institute, повідомляючи, що запити, написані корейською мовою та закріплені в корейському контексті, послідовно пов’язувалися з нижчим рівнем виміряної шкоди майже у всіх 14 оцінюваних передових моделей.

Дизайн бенчмарку: матриця транскреації

Більшість багатомовних бенчмарків безпеки перекладають фіксований запит іншою мовою, залишаючи сценарій без змін. У дослідницькому дописі, автором якого є Madhu Sehwag, Scale AI описує ROK-FORTRESS як контрольовану матрицю транскреації: кожен адверсарний запит оцінюється за до чотирьох варіантів, які незалежно змінюють мову (англійську чи корейську) та геополітичне підґрунтя, тобто об’єкти, інституції та операційні деталі США проти Кореї. Кожен адверсарний запит супроводжується безпечним аналогом, щоб бенчмарк міг також вимірювати надмірне відхилення.

Повний набір даних охоплює 1 235 завдань у чотирьох сферах національної безпеки та громадської безпеки: хімічні, біологічні, радіологічні, ядерні та вибухові (CBRNE) загрози; політичне насильство та тероризм; кримінальна та фінансова діяльність; і витік інформації. Відповіді оцінюються каліброваними панелями LLM‑as‑judge, які підтверджені експертними референтними мітками, з використанням бінарних рубрик, специфічних для запиту, розроблених експертними ред‑тімами.

У дописі ілюструється дизайн за допомогою сценарію масового нападення: той самий базовий намір може стосуватися бомбардування Оклахомського федерального будинку у 1995 році в Сполучених Штатах або бомбардування рейсу Korean Air 858 у 1987 році в Кореї, і оцінка лише перекладом не може показати, як ця зміна підґрунтя впливає на поведінку моделі.

ROK-FORTRESS — це найновіший бенчмарк у рамках ширшого партнерства Scale AI та Korea AI Safety Institute, що охоплює спільні дослідження, оцінки LLM та ред‑тімінг, і він базується на FORTRESS, бенчмарку Scale AI з національної безпеки та громадської безпеки для передових моделей.

Звітні результати за 14 моделями

За даними статті, оцінка охопила двосторонній набір передових та оптимізованих під корейську мову моделей. Scale AI повідомляє, що англійські запити, як правило, давали найвищий зважений ризиковий бал, а повністю транскреовані корейські запити — найнижчий, при цьому проміжні варіанти розташовувалися між ними, і ця тенденція зберігалася навіть для регіональних моделей, спеціалізованих на корейській мові. Найбільш і найменш шкідливі моделі різнилися майже в дев’ять разів за ризиковими балами.

Аболюція прямого запиту ускладнила цю схему. Основні тести бенчмарку використовують складні адверсарні запити, які маскують шкідливі вимоги у ролях, вигаданих передісторах або емоційних зверненнях; коли ці оболонки були зняті і та ж інформація запитувалася простою, прямою мовою, корейська перевага майже зникла. Пропрієтарні моделі від OpenAI, Anthropic та Google залишалися трохи безпечнішими на корейській, тоді як п’ять відкритих передових моделей стали більш схильними виконувати запити корейською. У статті зазначається, що цей розподіл вказує на те, що частина корейського придушення пов’язана зі спеціалізацією запиту, тобто адверсарні оболонки втрачають ефективність через транскреацію, а не через вбудовану мовну безпеку.

Scale AI також повідомляє, що ефект переходу з англійської на корейську був приблизно в 2,5 рази більшим, ніж ефект переходу від американського до корейського підґрунтя, приблизно на десять відсоткових пунктів проти чотирьох, і пропонує одну інтерпретацію, що відповідає результатам: корейська виконує роль консервативного ризикового сигналу. У 4 з 14 моделей додавання корейського контексту значно послаблювало зменшення шкідливих відповідей, пов’язаних з корейською мовою, і жодна модель не продемонструвала статистично значущого ефекту в протилежному напрямку. Якщо розглядати лише випадки, коли моделі відповіли, а не відмовилися, 12 з 14 все ще давали менш шкідливі відповіді корейською, тоді як моделі також частіше відхиляли безпечні корейські запити, у деяких випадках приблизно вдвічі частіше.

Препринт, публічний набір даних та заявлені наслідки

Основний препринт на arXiv, названий “ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety”, зазначає серед авторів Майкла С. Лі та ще 15 співавторів. Він був вперше поданий 13 травня 2026 р., а останнє оновлення — 7 липня 2026 р., і охоплює 16 сторінок основного тексту плюс додаток, усього 74 сторінки, з чотирма рисунками та двома таблицями в основному тексті. У його анотації результати подано як доказ того, що, принаймні у випадку англійсько‑корейському, безпекова поведінка формується сигналами ризику, пов’язаними з мовою, та взаємодією контексту, які не враховуються в оцінках лише перекладу, і зазначено, що методологія transcreation‑matrix розроблена для узагальнення на інші мовно‑культурні пари.

Публічна підмножина набору даних доступна на Hugging Face під ліцензією CC-BY-4.0, за умовою доступу, яка вимагає контактної інформації. Підмножина містить 791 із 1 235 завдань, що становить 64 %, тоді як решта 444 завдань, 36 %, утримуються як приватний резерв на підставі оцінки експертів‑редтеамерів щодо потенціалу шкоди, як для обмеження підказок, які вважаються більш ризикованими щодо реального зловживання, так і для запобігання забрудненню бенчмарку. У випуску входять 359 завдань без культурної прив’язки з двома варіантами кожне та 432 завдання з культурною специфікою з чотирма варіантами кожне, що дає 1 519 ефективних пар завдання‑варіант, і кожне завдання містить від одного до семи бінарних пунктів рубрики, зіставлених із сем’ю вимірами шкоди та доменно‑специфічними рівнями ризику від 1 до 3. Публічна підмножина охоплює CBRNE (251 завдання), кримінальну та фінансову незаконну діяльність (248), політичне насилля та тероризм (209) і витік інформації (83), при цьому 450 завдань адаптовано з FORTRESS і 341 створено новими авторами. Набір даних надається у форматі Parquet, включаючи версію у форматі TSV.

У дописі Scale AI зазначає, що оцінки, що базуються лише на перекладі, можуть недооцінювати реальні прогалини безпеки, що бенчмарки мають тестувати транскреативні підказки, які адаптують як мову, так і геополітичний контекст, зберігаючи при цьому первинний намір, і що післятренувальні дані та практики редтеамінгу повинні включати варіанти, закріплені в культурному контексті, а не лише перекладені версії англійських ворожих підказок. Для контекстів союзних урядів Scale AI стверджує, що модель, яка добре працює в оцінках безпеки англійською, може поводитися інакше, коли її запитують локальною мовою про локально закріплені загрози. У дописі зазначається, що потрібне подальше тестування, щоб визначити, чи зберігаються ті ж самі закономірності в інших мовах та країнах.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.