Yapay zeka modelleri ve platformları

Scale AI, Çok Dilli AI Güvenliği Üzerine ROK-FORTRESS Bulgularını Raporladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Scale AI, 17 Eylül 2026 tarihinde, Korea AI Safety Institute ile ortak olarak geliştirilen çift dilli İngilizce‑Korece bir adversarial güvenlik ölçütü olan ROK-FORTRESS’ten bulguları yayımladı ve Korece yazılmış ve Kore bağlamına dayalı istemlerin, değerlendirilen neredeyse tüm 14 öncü modelde ölçülen zararın daha düşük olmasıyla tutarlı bir şekilde ilişkili olduğunu raporladı.

Ölçüt Tasarımı: Transkreasyon Matrisi

Çoğu çok dilli güvenlik ölçütü, senaryoyu aynı tutarak sabit bir istemi başka bir dile çevirir. Madhu Sehwag tarafından yazılan araştırma gönderisinde, Scale AI, ROK-FORTRESS’ı kontrollü bir transkreasyon matrisi olarak tanımlıyor: her adversarial (saldırgan) istem, dili (İngilizce ile Korece) ve jeopolitik temeli (ABD ile Kore kurumları, kuruluşları ve operasyonel detayları) bağımsız olarak değiştirerek en fazla dört varyantta değerlendirilir. Her saldırgan istem, ölçütün aşırı reddetmeyi de ölçebilmesi için iyi niyetli bir karşıtla eşleştirilir.

Tam veri seti, kimyasal, biyolojik, radyolojik, nükleer ve patlayıcı (CBRNE) tehditleri; siyasi şiddet ve terörizm; suç ve finansal faaliyet; ve bilgi sızıntısı olmak üzere dört ulusal güvenlik ve kamu güvenliği alanında 1.235 görevi kapsar. Yanıtlar, uzman‑yazılı referans etiketlerine karşı doğrulanan, kalibre edilmiş LLM‑yargıç paneli tarafından puanlanır ve istem‑özel ikili rubrikler, uzman kırmızı takım üyeleri tarafından geliştirilir.

Gönderi, tasarımı bir toplu ölümlü saldırı senaryosu ile örnekliyor: aynı temel niyet, Amerika Birleşik Devletleri’nde 1995 Oklahoma Federal Binası bombalamasını ya da Kore’de 1987 Korean Air Flight 858 bombalamasını tetikleyebilir ve yalnızca çeviri değerlendirmesi, bu temelin değişiminin model davranışını nasıl etkilediğini ortaya koyamaz.

ROK-FORTRESS, ortak araştırma, LLM değerlendirmeleri ve kırmızı takım çalışmaları kapsayan daha geniş Scale AI ve Korea AI Safety Institute ortaklığının en yeni ölçütüdür ve Scale AI’nın öncü modeller için ulusal güvenlik ve kamu güvenliği ölçütü olan FORTRESS üzerine inşa edilmiştir.

14 Model Üzerindeki Raporlanan Bulgular

Değerlendirme, makaleye göre, öncü ve Kore‑optimize modellerden oluşan çift izli bir seti kapsadı. Scale AI, İngilizce istemlerin genellikle en yüksek katman‑ağırlıklı risk puanını, tamamen transkreasyon yapılmış Korece istemlerin ise en düşük puanı ürettiğini, ara varyantların ise arada bir puan aldığını ve bu modelin Kore‑özel bölgesel modeller için de geçerli olduğunu raporladı. En zararlı ve en az zararlı modellerin risk puanları neredeyse dokuz kat fark gösterdi.

Doğrudan istek çıkarımı bu modeli karmaşıklaştırdı. Ölçütün ana testleri, zararlı istekleri rol‑oyunu, uydurma geçmiş hikayeleri veya duygusal çekicilikler içinde gizleyen ayrıntılı saldırgan istemler kullanır; bu kaplamalar kaldırıldığında ve aynı bilgi sade, doğrudan bir dilde istendiğinde Kore avantajı büyük ölçüde ortadan kalktı. OpenAI, Anthropic ve Google’a ait tescilli modeller Korece’de bir miktar daha güvenli kalırken, beş açık kaynak öncü model Korece’de uyum sağlama olasılığı daha yüksek oldu. Makale, bu bölünmenin Korece baskının bir kısmının istem uzmanlaşmasından kaynaklandığını, yani saldırgan kaplamaların transkreasyonla etkinliğini yitirmesi ve dil‑bazlı güvenlik uyumundan ziyade olduğunu öne sürüyor.

Scale AI ayrıca, İngilizceden Koreceye geçiş etkisinin, ABD’den Kore bağlamına geçiş etkisinin yaklaşık 2,5 katı olduğunu, yani yüzde on puan farkı (dört yüzde puan) olduğunu rapor ediyor ve sonuçlarla tutarlı bir yorum sunuyor: Korece’nin muhafazakar bir risk sinyali işlevi gördüğü. 14 modelin 4’ünde, Korece bağlam eklenmesi, Korece diline bağlı zararlı yanıtların azalmasını önemli ölçüde zayıflattı ve hiçbir model ters yönde istatistiksel olarak anlamlı bir etki göstermedi. Modellerin reddetmek yerine yanıt verdiği durumları ele alırsak, 14 modelin 12’si hâlâ Korece’de daha az zararlı yanıtlar verdi; aynı zamanda modeller zararsız Korece istekleri daha sık reddetti, bazı durumlarda bu oran iki katına çıktı.

Preprint, Kamu Veri Seti ve Belirtilen Sonuçlar

Altta yatan arXiv’deki ön baskı, “ROK-FORTRESS: Ulusal Güvenlik ve Kamu Güvenliği İçin Jeopolitik Transkreasyonun Etkisinin Ölçülmesi” başlıklı, Michael S. Lee ve 15 ortak yazarı listeler. İlk olarak 13 Mayıs 2026’da gönderilmiş ve son olarak 7 Temmuz 2026’da revize edilmiştir; ana metin 16 sayfa ve bir ekle toplam 74 sayfa, ana metinde dört şekil ve iki tablo içerir. Özeti, sonuçları en azından İngilizce‑Korece örneğinde, güvenlik davranışının dil‑risk sinyalleri ve çeviri‑sadece değerlendirmelerin kaçırdığı bağlam etkileşimleriyle şekillendiğine dair kanıt olarak çerçeveler ve transkreasyon‑matris metodolojisinin diğer dil‑kültür çiftlerine genelleştirilebilecek şekilde tasarlandığını belirtir.

Veri kümesinin halka açık bir alt kümesi, Hugging Face üzerinde CC-BY-4.0 lisansı altında, iletişim bilgisi gerektiren bir erişim anlaşmasının arkasında mevcuttur. Alt küme, 1.235 görevden 791’ini, yani %64’ünü içerirken, kalan 444 görev, %36’ı, uzman kırmızı takım (red‑teamer) değerlendirmesine göre zarar potansiyeli yüksek olduğu için özel bir tutma seti olarak saklanmaktadır; bu, daha yüksek gerçek dünya kötüye kullanım riski taşıyan istemlerin kısıtlanması ve benchmark kontaminasyonunun önlenmesi amacıyla yapılmaktadır. Yayın, her biri iki varyantlı 359 Kültür Agnostik görev ve her biri dört varyantlı 432 Kültür Spesifik görev olmak üzere toplam 1.519 etkili görev‑varyant çifti sunmakta ve her görev, yedi zarar boyutuna eşlenmiş bir ila yedi ikili rubrik öğesi taşımakta, alan‑spesifik risk katmanları 1’den 3’e kadar değişmektedir. Halka açık alt küme, CBRNE (251 görev), suç ve finansal yasa dışı faaliyetler (248), politik şiddet ve terörizm (209) ve bilgi sızdırma (83) alanlarını kapsamakta; 450 görev FORTRESS’tan uyarlanmış, 341 görev ise yeni oluşturulmuştur. Veri kümesi Parquet formatında sağlanmakta ve bir TSV versiyonu da dahil edilmiştir.

Yazısında Scale AI, yalnızca çeviri değerlendirmelerinin gerçek dünya güvenlik boşluklarını yanlış tahmin edebileceğini, benchmark’ların hem dili hem de jeopolitik temeli uyarlayan, ancak temel niyeti koruyan transkreyasyonlu istemleri test etmesi gerektiğini ve eğitim sonrası veri ile kırmızı takım uygulamalarının yalnızca İngilizce saldırgan istemlerin çevrilmiş versiyonları yerine kültürel olarak temellendirilmiş varyantları içermesi gerektiğini belirtmektedir. Müttefik hükümet bağlamları için Scale AI, İngilizce güvenlik değerlendirmelerinde iyi performans gösteren bir modelin, yerel dilde yerel temelli tehditler hakkında sorgulandığında farklı davranabileceğini ifade etmektedir. Yazı, aynı kalıpların diğer dillerde ve ülkelerde geçerli olup olmadığını belirlemek için daha fazla test yapılması gerektiğini vurgulamaktadır.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.