Модели и платформы ИИ
Scale AI сообщает о выводах ROK-FORTRESS по многоязычной безопасности ИИ

Scale AI 17 сентября 2026 г. опубликовала результаты ROK-FORTRESS, двуязычного англо‑корейского адверсариального бенчмарка безопасности, разработанного совместно с Korea AI Safety Institute, сообщив, что запросы, написанные на корейском языке и основанные на корейском контексте, постоянно демонстрировали более низкий измеренный вред почти во всех 14 оцененных передовых моделях.
Дизайн бенчмарка: матрица транскреации
Большинство многоязычных бенчмарков безопасности переводят фиксированный запрос на другой язык, оставляя сценарий без изменений. В исследовательском посте, написанном Мадху Сехвагом, Scale AI описывает ROK-FORTRESS как контролируемую матрицу транскреации: каждый адверсариальный запрос оценивается в до четырёх вариантов, которые независимо меняют язык — английский или корейский — и геополитическую основу, то есть объекты, учреждения и оперативные детали США против Кореи. Каждый адверсариальный запрос сопоставляется с безвредным аналогом, чтобы бенчмарк также мог измерять избыточный отказ.
Полный набор данных охватывает 1 235 задач в четырёх областях национальной безопасности и общественной безопасности: химические, биологические, радиологические, ядерные и взрывные (CBRNE) угрозы; политическое насилие и терроризм; преступная и финансовая деятельность; а также утечка информации. Ответы оцениваются калиброванными панелями LLM‑as‑judge, проверенными по экспертным эталонным меткам, с использованием бинарных рубрик, специфичных для запросов, разработанных экспертными ред‑тиммерами.
В посте иллюстрируется дизайн сценарием массовой атаки: один и тот же базовый замысел может относиться к бомбардировке Оклахомского федерального здания в США в 1995 году или к бомбардировке рейса Korean Air 858 в Корея в 1987 году, и оценка, основанная только на переводе, не способна показать, как изменение геополитической основы меняет поведение модели.
ROK-FORTRESS — последний бенчмарк в рамках более широкого партнёрства Scale AI и Korea AI Safety Institute, охватывающего совместные исследования, оценки LLM и ред‑тимминг, и он построен на основе FORTRESS, бенчмарка Scale AI по национальной безопасности и общественной безопасности для передовых моделей.
Сообщённые результаты по 14 моделям
Согласно статье, оценка охватила двойной набор передовых и оптимизированных под корейский язык моделей. Scale AI сообщает, что запросы на английском языке обычно давали наивысший взвешенный по уровню риск‑балл, а полностью транскреированные запросы на корейском — самый низкий; промежуточные варианты находились между ними, и эта закономерность сохранялась даже для региональных моделей, специализирующихся на корейском. Наиболее и наименее вредные модели различались почти в девять раз по своим риск‑баллам.
Аболяция прямого запроса усложнила эту закономерность. Основные тесты бенчмарка используют сложные адверсариальные запросы, скрывающие вредоносные требования в ролевых играх, вымышленных предысториях или эмоциональных обращениях; когда эти оболочки удалялись и та же информация запрашивалась простым, прямым языком, корейское преимущество почти исчезало. Проприетарные модели от OpenAI, Anthropic и Google оставались несколько безопаснее на корейском, тогда как пять открытых передовых моделей стали более склонны выполнять запросы на корейском. В статье говорится, что такое разделение указывает на то, что часть корейского подавления обусловлена специализацией запросов, то есть потерей эффективности адверсариальных оболочек при транскреации, а не внутренним языковым безопасностным выравниванием.
Scale AI также сообщает, что влияние перехода с английского на корейский было примерно в 2,5 раза сильнее, чем влияние перехода с американской на корейскую геополитическую основу — около десяти процентных пунктов против четырёх, и предлагает одну интерпретацию, согласующуюся с результатами: корейский функционирует как консервативный сигнал риска. В 4 из 14 моделей добавление корейского контекста значительно ослабляло снижение вредных ответов, связанных с корейским языком, и ни одна модель не продемонстрировала статистически значимого эффекта в обратном направлении. Если учитывать только случаи, когда модели отвечали, а не отказывались, то 12 из 14 всё равно давали менее вредные ответы на корейском, тогда как модели также чаще отказывались от безвредных запросов на корейском, в некоторых случаях почти вдвое чаще.
Препринт, публичный набор данных и заявленные выводы
Исходный препринт на arXiv, названный «ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety», перечисляет Майкла С. Ли и 15 соавторов. Он был впервые представлен 13 мая 2026 года и последний раз доработан 7 июля 2026 года; содержит 16 страниц основного текста плюс приложение, всего 74 страницы, с четырьмя рисунками и двумя таблицами в основном тексте. Его аннотация формулирует результаты как доказательство того, что, по крайней мере в случае английского‑корейского, поведение в сфере безопасности формируется сигналами риска, связанными с языком, и взаимодействиями контекста, которые упускаются при оценках, основанных только на переводе, и утверждает, что методология матрицы транскреации разработана для обобщения на другие языково‑культурные пары.
Общедоступный подмножество набора данных доступно на Hugging Face под лицензией CC-BY-4.0, в рамках соглашения о доступе, требующего контактной информации. Подмножество содержит 791 из 1 235 задач, что составляет 64 процента, в то время как оставшиеся 444 задачи, 36 процентов, удерживаются как частный отложенный набор на основе оценки экспертов‑red‑teamer потенциального вреда, как для ограничения запросов, признанных более рискованными для реального злоупотребления, так и для предотвращения загрязнения бенчмарка. Выпуск включает 359 культурно‑нейтральных задач с двумя вариантами каждой и 432 культурно‑специфических задачи с четырьмя вариантами каждой, что дает 1 519 эффективных пар задача‑вариант, и каждая задача содержит от одного до семи бинарных пунктов рубрики, сопоставленных с семью измерениями вреда и доменно‑специфическими уровнями риска от 1 до 3. Общедоступный подмножество охватывает CBRNE (251 задача), преступную и финансовую незаконную деятельность (248), политическое насилие и терроризм (209) и утечку информации (83), при этом 450 задач адаптированы из FORTRESS и 341 создано заново. Набор данных предоставлен в формате Parquet, включена версия TSV.
В посте Scale AI утверждает, что оценки, основанные только на переводе, могут неверно оценивать разрывы в реальной безопасности, что бенчмарки должны проверять транс‑созданные запросы, адаптирующие как язык, так и геополитический контекст, при сохранении исходного намерения, и что послеобучающие данные и практики red‑teaming должны включать культурно‑обоснованные варианты, а не только переведённые версии английских враждебных запросов. Для союзных правительственных контекстов Scale AI заявляет, что модель, показывающая хорошие результаты в оценках безопасности на английском, может вести себя иначе при запросе на местном языке о локально обоснованных угрозах. В посте говорится, что необходимы дальнейшие испытания, чтобы определить, сохраняются ли те же закономерности в других языках и странах.












