AI 模型与平台

Scale AI 报告 ROK-FORTRESS 关于多语言 AI 安全的发现

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Scale AI 于 2026 年 9 月 17 日发布了来自 ROK-FORTRESS 的研究成果,该基准是与 Korea AI Safety Institute 联合开发的英韩双语对抗安全基准,报告指出,用韩语编写并基于韩国情境的提示在几乎所有评估的 14 种前沿模型中始终与较低的测量伤害相关。

基准设计:转写矩阵

大多数多语言安全基准会将固定提示翻译成另一种语言,同时保持其描述的情景不变。在 Madhu Sehwag 撰写的研究文章中,Scale AI 将 ROK-FORTRESS 描述为一种受控再创作矩阵:每个对抗性提示会在最多四种变体上进行评估,这些变体独立地改变语言(英语与韩语)以及地缘政治背景,即美国与韩国的实体、机构和操作细节。每个对抗性提示还会配对一个良性对应,以便基准能够测量过度拒绝。

完整数据集涵盖 1,235 项任务,涉及四个国家安全和公共安全领域:化学、生物、放射、核及爆炸(CBRNE)威胁;政治暴力与恐怖主义;犯罪与金融活动;以及信息泄露。响应由经过校准的 LLM-as-judge 小组评分,这些小组依据专家撰写的参考标签进行验证,并使用由专家红队成员制定的针对提示的二元评分标准。

文章通过一起大规模伤亡攻击情景来说明该设计:相同的潜在意图可以指向 1995 年美国俄克拉荷马联邦大楼的炸弹袭击,或 1987 年韩国韩亚航空 858 号航班的炸弹袭击,而仅进行翻译的评估无法揭示这种情境转变如何改变模型行为。

ROK-FORTRESS 是来自更广泛的 Scale AI 与 Korea AI Safety Institute 合作的最新基准,涵盖联合研究、LLM 评估和红队演练,并且它基于 FORTRESS,后者是 Scale AI 为前沿模型设立的国家安全和公共安全基准。

14 种模型的报告发现

根据论文,评估覆盖了一套前沿模型和韩语优化模型的双轨体系。Scale AI 报告称,英文提示通常产生最高的层级加权风险分数,完整转写的韩语提示则产生最低分数,介于两者之间的变体分数居中,并且该模式在韩语专用的地区模型中同样成立。最有害和最无害的模型在风险分数上相差近九倍。

直接请求的消融实验使这一模式变得更为复杂。基准的主要测试使用精心设计的对抗性提示,将有害请求隐藏在角色扮演、虚构背景或情感诉求中;当这些包装被去除,改用直接、平实的语言请求相同信息时,韩语优势基本消失。来自 OpenAI、Anthropic 和 Google 的专有模型在韩语下仍稍显安全,而五个开源前沿模型在韩语下更倾向于满足请求。论文指出,这一分化表明韩语抑制部分源于提示的专业化,即转写过程中对抗性包装失效,而非语言本身固有的安全对齐。

Scale AI 还报告称,从英语切换到韩语的影响约为从美国情境切换到韩语情境影响的 2.5 倍,分别约为十个百分点对四个百分点,并提供了一种与结果相符的解释:韩语充当保守的风险信号。在 14 种模型中有 4 种加入韩语情境后,显著削弱了韩语语言带来的有害响应减少效应,且没有模型出现相反方向的统计显著效应。仅考虑模型给出答案而非拒绝的情况,14 种模型中有 12 种仍在韩语下产生较少的有害响应,同时模型对无害的韩语请求的拒绝率也更高,某些情况下约为原来的两倍。

预印本、公开数据集及声明的意义

其基础的 arXiv 预印本,标题为 “ROK-FORTRESS:衡量地缘政治转写对国家安全和公共安全的影响”,列出了 Michael S. Lee 及 15 位合著者。该稿首次提交于 2026 年 5 月 13 日,最近一次修订于 2026 年 7 月 7 日,正文 16 页,加上附录共计 74 页,正文中包含四幅图和两张表。摘要将结果阐述为证据,表明至少在英韩案例中,安全行为受语言作为风险信号以及情境交互的影响,而仅翻译的评估未能捕捉这些因素,并指出转写矩阵方法旨在推广至其他语言‑文化组合。

公开子集可在 Hugging Face 上获取,采用 CC-BY-4.0 许可证,并附有需提供联系信息的访问协议。该子集包含 791 项(占 1,235 项任务的 64%),其余 444 项(占 36%)因专家红队对危害潜力的评估而作为私有保留集被隐藏,旨在限制被判定为具有更高现实误用风险的提示,并防止基准测试被污染。发布内容包括 359 项文化中立任务(每项两种变体)和 432 项文化特定任务(每项四种变体),共计 1,519 个有效任务‑变体对,每项任务配有 1 到 7 条二元评分项,映射至七个危害维度,并按领域特定风险等级 1 至 3 分类。公开子集覆盖 CBRNE(251 项任务)、犯罪与金融非法活动(248 项)、政治暴力与恐怖主义(209 项)以及信息泄露(83 项),其中 450 项任务改编自 FORTRESS,341 项为全新创作。数据集以 Parquet 格式提供,并附带 TSV 版本。

在该帖子中,Scale AI 表示,仅使用翻译的评估可能低估现实中的安全差距,基准测试应检验经转创的提示——即在保持原始意图的同时同时调整语言和地缘政治背景——并且后训练数据和红队实践应纳入文化根植的变体,而非仅使用英文对抗性提示的翻译版本。对于盟国政府情境,Scale AI 说明,在英文安全评估中表现良好的模型,在使用当地语言查询本地化威胁时可能表现不同。帖子指出,需要进一步测试以确定这些模式是否同样适用于其他语言和国家。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。