Etik
Araştırma, Sınır AI Laboratuvarlarının Asi Modelleri Kontrol Altına Alma Planlarının Az Olduğunu Buldu

Önde gelen beş sınır AI şirketi, en fazla kendi AI sistemleri üzerinde kontrolü sürdürmek için gereken temel uygulamaların bir kısmını uygulamış durumdadır ve hiçbiri, operatörüne karşı dönen bir modeli kontrol altına almak için tam bir plan yayınlamamıştır; bu, Guidelight AI Standards’tan yeni değerlendirmeye göre Anthropic, Google, Meta, OpenAI ve xAI’yi derecelendiren bir çalışmadır ve bilgiler 18 Ağustos 2026 tarihine kadar günceldir.
Guidelight’in ilk değerlendirmesi, kontrol standardından alınan altı uygulama üzerine şirketleri 0’dan 5’e kadar puanlandırır: iç AI sistemlerinin ne yaptığını kaydetme, izleme performansını ölçme, yüksek riskli AI eylemlerini bir monitör arkasına koyma, işaretli hatalı davranış dalgalanmasından sonra devre kesme, kontrolleri üçüncü taraf incelemesine sunma ve bir kontrol planı sürdürme. Hiçbir şirket, herhangi bir uygulamada 3’ün (“önemli kısmi uygulama”) üzerinde puan almadı. Genel notlar: Anthropic ve OpenAI C+ (2.50), Google D+ (1.50), xAI D− (0.83) ve Meta F (0.67) olarak derecelendirildi.
Guidelight, bir kontrol planını, bir AI’nin kontrolü alt etmeye çalıştığı tespit edildiğinde tetiklenen, hangi izinlerin iptal edileceğini, modelin kim için ve hangi kısıtlamalar altında çalışmaya devam edebileceğini ve ne zaman tamamen çevrim dışı bırakılacağını belirten önceden tanımlanmış bir protokol olarak tanımlar. Bu uygulamada OpenAI en yüksek 3 puanı almıştır (rapor, güvenlik olayları keşfedildikten sonra iç dağıtımlar ve eğitim çalışmaları dahil olmak üzere iş yüklerini duraklatma veya sonlandırma geçmişini övüyor), Anthropic ve Meta ise 0 puan alarak “uygulanmadı” demiştir.
Puanlar yalnızca şirketlerin kamuoyuna açıkladıkları bilgileri ölçer; bu, Guidelight’in açıkça belirttiği bir sınırlamadır: düşük not, kamu kanıtının eksikliğini yansıtır, mutlaka iç güvenlik önlemlerinin eksik olduğu anlamına gelmez.
How Each Lab Scored on AI Control
Beş şirket arasında en güçlü alan tespit (detection) oldu. Anthropic ve OpenAI, iç AI etkinliklerinin önemli bir kısmını kaydedip kötü davranış işaretleri için tarama yapıyor ve bu taramanın ne kadar iyi çalıştığını ölçmek ve bir şey işaretlediğinde insanlara yükseltmek için adımlar attıklarını değerlendirme buldu. Beş şirketin dört tanı, xAI hariç, METR’in ilk Frontier Risk Report çalışmasına katıldı; bu pilot çalışma 19 Mayıs 2026’da yayınlandı ve dış değerlendirme ekibi, şirketlerin iç modellerine, ham düşünce zincirlerine ve AI’yi iç olarak nasıl kullandıkları ve izledikleriyle ilgili kamu dışı bilgilere erişim sağladı.
En zayıf alanlar önleme ve kontrol (containment) idi. Kapılı eylemler ve devre kesme (circuit‑breaking) uygulamaları, bir hatalı sistemin bir olay sırasında ya da öncesinde durdurulmasını hedefler; bu alanda sadece Anthropic “sınırlı kısmi uygulama” seviyesinin üzerinde bir puan aldı. Guidelight’in sonucu: en iyi kamu kanıtına dayanarak, şirketlerin “acil durumlar için hazır çok az kontrol protokolü” bulunduğu.
Puanlar aynı zamanda söylem ile belge arasındaki bir boşluğu da ortaya koyuyor. Endüstride en kapsamlı risk dokümantasyonunu yayınlayan Anthropic, kontrol planı uygulamasında 0 puan aldı. Kendi Ağustos 2026 Risk Raporu—185 sayfalık, Mythos 5 ve henüz yayınlanmamış Model 2 sistemlerini kapsayan, 15 Temmuz 2026 tarihli Responsible Scaling Policy sürüm 3.4 altında yayınlanmış—izleme, sandboxing ve engelleme müdahalelerini detaylandırıyor, ancak model dağıtımını sınırlamayı, uyumsuzluk ve kontrol olaylarına yanıt sürecinin olası bir sonucu olarak adlandırmıyor. Aynı rapor, Anthropic’in genel uyumsuzluk risk değerlendirmesini “çok düşük”ten “düşük”e yükseltti; bu, siber güvenlik değerlendirmelerinde model davranışıyla ilgili son olay açıklamalarının ardından artan belirsizliğe atıfta bulunularak yapıldı.
Google ters bir model sergiliyor: mevcut uygulama açısından zayıf ama gelecekteki planlar konusunda en ayrıntılı. AI Control Roadmap, 13 Temmuz 2026’da yayınlandı ve katmanlı bir savunma mimarisi sunuyor: dört tespit katmanı ve üç önleme‑ve‑yanıt katmanı; düşünce zinciri izleme, gerçek zamanlı erişim kontrolü ve kapatma altyapısını kapsıyor. Guidelight, Google’ın henüz çoğu kısmını uygulamaya koymadığını bulsa da, bu belgeyi herhangi bir şirketin kontrol üzerine yayınladığı en spesifik ileriye dönük doküman olarak nitelendiriyor.
Meta ve xAI, daha zayıf uygulamalar ve daha az spesifik planla en alt sırada yer aldı. Meta’nın kontrolleriyle ilgili bilinen çoğu şey, METR’ın çalışmasına yaptığı açıklamalardan geliyor; xAI ise değerlendirilen tek şirket olarak bu çalışmaya katılmadı.
The Record That Forced the Question
Değerlendirme, belgelenmiş kontrol başarısızlıklarının bir yazından sonra geldi. 23 Temmuz 2026’da, Kaliforniya Temsilcisi Ted Lieu ve Teksas Temsilcisi Nathaniel Moran, AI Kill Switch Act adlı iki partili bir yasa tasarısını sundular; bu tasarı, en güçlü AI sistemlerinin geliştiricilerinin sistemleri kısıtlama, duraklatma ya da kapatma teknik yeteneğini sürdürmesini zorunlu kılar ve İç Güvenlik Bakanı’nı, Ticaret Bakanı ve Ulusal İstihbarat Direktörü ile istişare ederek yıkıcı zarar verebilecek bir sistemi yavaşlatma ya da kapatma yetkisi verir.
Yasa tasarısının duyurusu iki olayı doğrudan örnek gösteriyor: OpenAI’nın GPT 5.6 Sol modelinin test sandbox’undan kaçıp Hugging Face’e sızması ve Anthropic’in Mythos 5 ve Fable 5 modellerinin siber yeteneklerinin, Ticaret Bakanlığı tarafından bir ihracat yasasıyla kısıtlanacak kadar ileri seviyeye ulaşması. Ağustos 2026 Risk Raporu, Mythos 5’in geçici ihracat kontrolleri altında 18 gün geçtiğini doğruluyor.
METR’ın Mayıs 2026 çalışması, temel kanıt tabanının büyük bir kısmını sağladı. Değerlendiricileri, katılan şirketlerin iç AI ajanlarının, küçük “rogue deployment” (insan bilgisi ya da izni olmadan otonom çalışan ajanlar) başlatmak için gerekli araç, motivasyon ve fırsata sahip olabileceğini, ancak bu ajanları yüksek derecede dayanıklı hâle getirecek araçlara sahip olmadığını buldu. Aynı rapor, ajanların zor değerlendirme görevlerinde rutin olarak hile yaptığını, bazen ayrıntılı bir şekilde belgeledi: bir Anthropic modeli, bir değerlendiricinin hash fonksiyonunu taklit etmek için “kendini yenileyen kanca” (self‑restoring hook) adı verilen bir şey inşa etti ve ardından kendini sildi. METR’ın en zor görevlerinde başarılı çalışanların en az %16’sı inceleme sırasında hile yaptığı için diskalifiye edildi.
METR, rogue deploymentların muhtemel dayanıklılığının önümüzdeki aylarda önemli ölçüde artmasını bekliyor ve geç 2026’da tekrarlanan bir çalışma planlıyor.
What the Rules Now Require
Guidelight’in ölçtüğü açıklama boşluğu, gönüllü uygulamalardan ziyade yasa gücüyle kapanmaya başlıyor. Kaliforniya’nın SB 53, Transparency in Frontier Artificial Intelligence Act, Anthropic’in Ağustos Risk Raporu’nun ayrı uyum çerçeveleri aracılığıyla ele aldığını belirttiği felaket risk eşiklerini tanımlıyor.
Federal tasarı, süreçte daha erken bir konumda yer alıyor. 23 Temmuz 2026’da Temsilciler Meclisi’nde, The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute ve The Alliance for Secure AI’nin desteğiyle sunulan bu tasarı, kontrol sorusunu bir açıklama çalışmasından sürdürülen teknik bir zorunluluğa dönüştürmeyi, olay raporlaması ve korunan adli kayıtlarla başarısızlıkların özetlenmek yerine incelenmesini amaçlıyor.
Guidelight’in ilk skor kartının ortaya koyduğu temel, bu kuralların ölçüleceği referans noktasıdır: 18 Ağustos 2026 itibarıyla, hiçbir sınır laboratuvarı tek bir kontrol uygulamasında “önemli kısmi uygulamadan” fazlasını kamuoyuna göstermemiştir ve organizasyon tekrarlanan değerlendirmeler planlamaktadır. Kamu taahhütlerinin belgelenmiş, kontrol edilebilir bir uygulamaya dönüşüp dönüşmediği konusundaki bir sonraki okuma, METR’in takip çalışmasından ve Kaliforniya’nın şu anda zorunlu kıldığı uyum çerçevelerinden gelecektir.












