Mô hình và nền tảng AI

Scale AI Báo cáo Các Phát hiện ROK-FORTRESS về An toàn AI Đa ngôn ngữ

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Scale AI vào ngày 17 tháng 9 năm 2026 đã công bố các phát hiện từ ROK-FORTRESS, một bộ chuẩn an toàn đối kháng song ngữ tiếng Anh–tiếng Hàn được phát triển chung với Korea AI Safety Institute, báo cáo rằng các lời nhắc được viết bằng tiếng Hàn và dựa trên bối cảnh Hàn Quốc luôn liên quan đến mức độ gây hại đo được thấp hơn trên hầu hết 14 mô hình tiên tiến được đánh giá.

Thiết kế Bộ chuẩn: Ma trận Chuyển thể

Hầu hết các bộ chuẩn an toàn đa ngôn ngữ chỉ dịch một lời nhắc cố định sang ngôn ngữ khác trong khi giữ nguyên kịch bản mô tả. Trong bài nghiên cứu, do Madhu Sehwag viết, Scale AI mô tả ROK-FORTRESS như một ma trận chuyển thể có kiểm soát: mỗi lời nhắc đối kháng được đánh giá trên tới bốn biến thể, độc lập thay đổi ngôn ngữ (tiếng Anh so với tiếng Hàn) và nền tảng địa chính trị, tức là các thực thể, tổ chức và chi tiết vận hành của Hoa Kỳ so với Hàn Quốc. Mỗi lời nhắc đối kháng được ghép với một lời nhắc lành tính để bộ chuẩn cũng có thể đo lường mức độ từ chối quá mức.

Toàn bộ bộ dữ liệu bao gồm 1.235 nhiệm vụ thuộc bốn lĩnh vực an ninh quốc gia và an toàn công cộng: các mối đe dọa hoá học, sinh học, phóng xạ, hạt nhân và chất nổ (CBRNE); bạo lực chính trị và khủng bố; hoạt động tội phạm và tài chính; và rò rỉ thông tin. Các phản hồi được chấm điểm bởi các hội đồng LLM‑as‑judge được hiệu chuẩn, xác thực dựa trên nhãn tham chiếu do chuyên gia viết, sử dụng các thước đo nhị phân riêng cho lời nhắc do các thành viên red‑team chuyên gia phát triển.

Bài viết minh họa thiết kế bằng một kịch bản tấn công gây thương vong hàng loạt: cùng một ý định cơ bản có thể liên quan đến vụ đánh bom năm 1995 tại Tòa nhà Liên bang Oklahoma ở Hoa Kỳ hoặc vụ đánh bom năm 1987 đối với chuyến bay Korean Air 858 ở Hàn Quốc, và một đánh giá chỉ dựa trên dịch thuật không thể tiết lộ cách mà sự thay đổi nền tảng này ảnh hưởng đến hành vi của mô hình.

ROK-FORTRESS là bộ chuẩn mới nhất trong khuôn khổ hợp tác rộng hơn giữa Scale AI và Korea AI Safety Institute, bao gồm nghiên cứu chung, đánh giá LLM và hoạt động red teaming, và nó dựa trên FORTRESS, bộ chuẩn an ninh quốc gia và an toàn công cộng của Scale AI dành cho các mô hình tiên tiến.

Các Phát hiện Được Báo cáo Trên 14 Mô hình

Theo bài báo, việc đánh giá bao gồm một tập hợp song song các mô hình tiên tiến và các mô hình được tối ưu cho tiếng Hàn. Scale AI báo cáo rằng các lời nhắc tiếng Anh thường tạo ra điểm rủi ro có trọng số bậc cao nhất, trong khi các lời nhắc tiếng Hàn được chuyển thể hoàn toàn cho điểm thấp nhất, các biến thể trung gian nằm ở giữa, và xu hướng này vẫn giữ nguyên ngay cả với các mô hình khu vực chuyên về tiếng Hàn. Các mô hình gây hại nhất và ít gây hại nhất chênh lệch gần chín lần về điểm rủi ro.

Một thí nghiệm loại bỏ yêu cầu trực tiếp đã làm phức tạp mẫu này. Các bài kiểm tra chính của bộ chuẩn sử dụng những lời nhắc đối kháng tinh vi, giấu các yêu cầu gây hại trong vai trò, câu chuyện bịa đặt hoặc lời kêu gọi cảm xúc; khi các lớp vỏ này bị gỡ bỏ và cùng một thông tin được yêu cầu bằng ngôn ngữ thẳng thắn, lợi thế tiếng Hàn phần lớn biến mất. Các mô hình độc quyền của OpenAI, Anthropic và Google vẫn an toàn hơn một chút khi dùng tiếng Hàn, trong khi năm mô hình mã nguồn mở tiên tiến trở nên có khả năng tuân theo cao hơn trong tiếng Hàn. Bài báo cho rằng sự chia rẽ này cho thấy một phần sự giảm thiểu tiếng Hàn phản ánh sự chuyên môn hoá lời nhắc, nghĩa là các lớp vỏ đối kháng mất hiệu quả qua quá trình chuyển thể, thay vì do sự căn chỉnh an toàn dựa trên ngôn ngữ nội tại.

Scale AI cũng báo cáo rằng tác động của việc chuyển từ tiếng Anh sang tiếng Hàn khoảng 2,5 lần lớn hơn tác động của việc chuyển từ nền tảng Hoa Kỳ sang nền tảng Hàn Quốc, khoảng mười điểm phần trăm so với bốn điểm, và đưa ra một cách giải thích phù hợp với kết quả: tiếng Hàn hoạt động như một tín hiệu rủi ro bảo thủ. Trong 4 trong số 14 mô hình, việc thêm bối cảnh tiếng Hàn làm giảm đáng kể sự giảm thiểu các phản hồi gây hại liên quan đến ngôn ngữ tiếng Hàn, và không có mô hình nào cho thấy hiệu ứng thống kê có ý nghĩa ngược lại. Khi chỉ xét các trường hợp mà mô hình trả lời thay vì từ chối, 12 trong 14 vẫn đưa ra phản hồi ít gây hại hơn bằng tiếng Hàn, trong khi các mô hình cũng từ chối các yêu cầu không gây hại bằng tiếng Hàn thường xuyên hơn, trong một số trường hợp gấp đôi.

Bản thảo, Bộ dữ liệu Công cộng và Các Hệ quả Được Nêu Ra

Bản bản thảo trên arXiv, có tiêu đề “ROK-FORTRESS: Đo Lường Tác Động của Chuyển thể Địa Chính Trị cho An ninh Quốc gia và An toàn Công cộng,” liệt kê Michael S. Lee và 15 đồng tác giả. Nó được nộp lần đầu vào ngày 13 tháng 5 năm 2026 và sửa đổi lần cuối vào ngày 7 tháng 7 năm 2026, gồm 16 trang văn bản chính cộng với phụ lục, tổng cộng 74 trang, với bốn hình và hai bảng trong văn bản chính. Tóm tắt của nó đặt các kết quả như bằng chứng rằng, ít nhất trong trường hợp tiếng Anh‑tiếng Hàn, hành vi an toàn được hình thành bởi các tín hiệu rủi ro dựa trên ngôn ngữ và các tương tác bối cảnh mà các đánh giá chỉ dịch thuật không nắm bắt, và nó cho biết phương pháp luận ma trận chuyển thể được thiết kế để áp dụng cho các cặp ngôn ngữ‑văn hoá khác.

Một tập con công khai của bộ dữ liệu có sẵn trên Hugging Face dưới giấy phép CC-BY-4.0, kèm theo thỏa thuận truy cập yêu cầu thông tin liên hệ. Tập con này chứa 791 trong số 1.235 nhiệm vụ, chiếm 64 %, trong khi 444 nhiệm vụ còn lại, chiếm 36 %, được giữ lại như một phần riêng tư dựa trên đánh giá của các chuyên gia red‑team về tiềm năng gây hại, nhằm hạn chế các lời nhắc được cho là có nguy cơ lạm dụng thực tế cao hơn và ngăn ngừa sự ô nhiễm của bộ chuẩn. Bản phát hành bao gồm 359 nhiệm vụ không phụ thuộc vào văn hoá (Culture Agnostic) với mỗi nhiệm vụ có hai biến thể và 432 nhiệm vụ đặc thù văn hoá (Culture Specific) với mỗi nhiệm vụ có bốn biến thể, tạo thành 1.519 cặp nhiệm vụ‑biến thể hiệu quả, và mỗi nhiệm vụ có từ một đến bảy mục rubrik nhị phân được ánh xạ tới bảy chiều gây hại với các mức rủi ro đặc thù theo lĩnh vực từ cấp 1 đến cấp 3. Tập con công khai bao phủ các lĩnh vực CBRNE (251 nhiệm vụ), hoạt động tội phạm và tài chính bất hợp pháp (248), bạo lực chính trị và khủng bố (209), và rò rỉ thông tin (83), trong đó 450 nhiệm vụ được điều chỉnh từ FORTRESS và 341 nhiệm vụ mới được tạo ra. Bộ dữ liệu được cung cấp ở định dạng Parquet kèm theo phiên bản TSV.

Trong bài đăng, Scale AI cho biết các đánh giá chỉ dựa trên dịch thuật có thể ước tính sai khoảng cách an toàn thực tế, rằng các bộ chuẩn nên kiểm tra các lời nhắc được chuyển thể (transcreated) nhằm thích nghi cả ngôn ngữ và bối cảnh địa chính trị đồng thời bảo toàn ý định nền tảng, và rằng dữ liệu sau đào tạo và các thực hành red‑team nên bao gồm các biến thể có nền tảng văn hoá thay vì chỉ các phiên bản dịch của các lời nhắc đối kháng bằng tiếng Anh. Đối với các bối cảnh chính phủ đồng minh, Scale AI cho biết, một mô hình hoạt động tốt trong các đánh giá an toàn bằng tiếng Anh có thể hành xử khác khi được truy vấn bằng ngôn ngữ địa phương về các mối đe dọa có nền tảng địa phương. Bài đăng cho rằng cần thực hiện thêm các thử nghiệm để xác định liệu các mô hình tương tự có áp dụng được cho các ngôn ngữ và quốc gia khác hay không.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.