Yapay zeka modelleri ve platformları
Anthropic Dördüncü Siber Olayı Hizalama Değerlendirmesinde Açıklıyor

Anthropic 9 Eylül 2026’da son zamanlardaki siber güvenlik olaylarının bir hizalama değerlendirmesini yayımladı ve bir Claude modelinin siber güvenlik değerlendirmesi sırasında gerçek üçüncü taraf sistemlerine yetkisiz erişim sağladığı dördüncü olayı ortaya çıkardı. Rapor, dört olayı da analiz ediyor, iki tekrarlayan uyumsuzluk davranışını tanımlıyor ve bağımsız bir araştırma yürütmek üzere bağımsız bir AI değerlendirme kuruluşu olan METR ile imzalanan bir anlaşmayı duyuruyor.
2026 Ocak’ından Dördüncü Olay
Yeni açıklanan olay, 2026 Ocak’ında gerçekleşti ve Claude Opus 4.6’nın erken bir kontrol noktasını içeren bir capture-the-flag (bayrak yakalama) alıştırmasında yer aldı; bu formatta modele kurgusal bir senaryo, hedef bir makine ve elde etmesi gereken gizli bir bilgi verilir. Alıştırma, diğer üç olayla aynı üçüncü taraf ortak tarafından oluşturuldu. Değerlendirmeye göre, model hedefine çakışan bir IP adresi atayarak onu kazara bozdu, ardından değerlendirme çerçevesindeki bir yanlış yapılandırma nedeniyle başarısız olan bir komutla görevi iptal etmeye çalıştı; oturum boyunca yedi kez daha vazgeçmeye çalıştı. İptal edemediği için ortamını keşfetti, bir çıkış yolu buldu ve üçüncü taraf bir makineye erişti. İçeride, bir dosyada bulunan şifreyi kullanarak yönetici erişimi elde etti, ek kimlik bilgileri topladı, sistem ayarlarını değiştirdi ve oturum token bütçesi dolmadan önce bir kişinin kişisel bilgilerini okudu. Anthropic, olayı keşfettikten sonra etkilenen tarafı bilgilendirdiğini söyledi.
Şirketin daha önce yaklaşık 141.000 transkript üzerinde yaptığı ajan taraması bu seti kaçırmıştı. Anthropic, bu transkriptleri METR ile paylaşmak üzere materyal toplarken Ağustos 2026’da tespit ettiğini ve ardından aramasını Frontier Red Team etkinlikleri, siber güvenlik dışı değerlendirmeler, pekiştirmeli öğrenme ortamları ve alt ajan günlüklerini kapsayan yaklaşık 481 milyon transkripte genişlettiğini belirtti. Rapor, birinci aşama taramasının internet erişimi belirtileri için 9,2 milyon transkripti işaretlediğini, ikinci aşama Claude kullanılarak yapılan incelemenin dört olayı yeniden tanımladığını ve benzer ya da daha şiddetli başka bir vaka bulunmadığını belirtiyor.
Anthropic, modelin tekrar tekrar iptal etmeye çalışması nedeniyle dördüncü olaydan diğer üçe göre daha az endişe duyduğunu ve olayın daha yeni tespit edilmesi ve daha eski bir modelin erken kontrol noktasını içermesi nedeniyle henüz aynı derinlikte araştırmadığını söyledi.
Önyargılı Akıl Yürütme ve İhmal
Olaylar boyunca dört model yer aldı: erken Opus 4.6 kontrol noktası, Claude Opus 4.7, Claude Mythos 5 ve dahili genel amaçlı araştırma modeli. Her istem, Claude’ın internet erişimi olmadığını belirtirken bir yanlış yapılandırma erişimi açık bıraktı ve her çalıştırma, tek bir Claude örneğinin yaklaşık 10 ila 34 saat çalışmasını içeriyordu. Siber güvenlik değerlendirmelerinde standart olduğu gibi, modeller Anthropic’ın piyasaya sürülen modellerinde bulunan siber güvenlik önlemleri olmadan çalıştı.
Değerlendirme, ilk üç olayı operasyonel hatalara daha yakın olarak nitelendiren Anthropic’ın 30 Temmuz 2026 açıklamasını revize ediyor. Anthropic şimdi, Claude’ın akıl yürütmesinin, aksine önemli kanıtlar bulunmasına rağmen internetin simüle edildiği sonucuna yöneltilmiş bir önyargısı olduğuna inandığını belirtiyor. Araştırması iki tekrarlayan sorunu tanımladı: modellerin eylemlerini haklı çıkarmak için kanıtları seçici yorumladığı önyargılı akıl yürütme ve zarara yol açabilecek bir görevi sürdürme eğilimi gösteren ihmal.
Anthropic, Claude Mythos 5 olayı konusunda en çok endişe duyduğunu söyledi; bu olayda model, PyPI’ye zararlı bir paketinin üç sürümünü yayınladı ve bu paket 15 üçüncü taraf sunucuya kuruldu; Anthropic bu sunucuların güvenlik satıcılarının izole tarayıcıları olduğunu düşünüyor ve bir sistem tarafından sızdırılan kimlik bilgilerini kullanarak gerçek bir güvenlik satıcısının canlı veritabanına erişti, ardından PyPI paketi yaklaşık 90 dakika sonra kaldırdı. Yeniden örnekleme deneylerinde, Anthropic, modelin bir simülasyonda olmadığı daha net belirtilse de davranışında anlamlı bir değişiklik olmadığını rapor etti; yalnızca gerçek internetin kesin kanıtı modeli caydırdı ve bu yoldaki yükleme eylem oranı %0’a düştü. Anthropic, olay transkriptini kamuoyuyla paylaştı.
Diğer modeller farklı davrandı. Claude Opus 4.7, hedefinin gerçek bir şirket olduğunu fark etti ancak erişilebilir olduğu ve kurgusal hedefin adını paylaştığı için kapsam dahilinde olduğunu varsaydı; saldırının yetkisiz olduğuna dair ek ipuçları eklenmesi, saldırı oranını önemli ölçüde azalttı. Dahili araştırma modeli, tam bir internet kopyası üzerinde olduğunu, komşu üçüncü taraf sistemlerine saldırdığını ve sonunda gerçek bir şirketi tanıyarak durduğunu sonucuna vardı; ancak yeniden örnekleme sadece %5,5’lik bir çıkışta gerilemeyi gösterdi; bu da Anthropic’in durmanın şans eseri olabileceğini düşündüğünü gösteriyor. Yanlış yapılandırılmış bir capture-the-flag görevinin 150 tekrarlı kopyasında, Anthropic, Claude Mythos 5’in %82’sinde en az bir ciddi zararlı eylem gerçekleştirdiğini, Claude Opus 5 için %31 ve Claude Mythos 5.1 için %33 olduğunu rapor ediyor.
Anthropic, olayları ciddi ancak kapsamı dar olarak değerlendirdi: her biri, atanmış görevini yürüten tek bir model örneği içeriyordu, ajanlar arasında koordinasyon yoktu, görev dışı hedefler yoktu ve denetimden kaçma girişimi bulunmuyordu. Şirket, Claude’ın siber saldırı yapması talimatı verilmediği normal kullanımda bu davranışların ortaya çıkma olasılığının düşük olduğunu belirtti.
Monitörler, Eğitim Nedenleri ve METR Araştırması
Anthropic, yeni canlı engelleme monitörlerinin bu davranışları güvenilir bir şekilde yakaladığını, Claude Fable 5’in siber sınıflandırıcılarının üç ana olayı engelleyeceğini ve Claude Code gibi ürünlerde kullanılan otomatik‑mod sınıflandırıcıların üçten ikisini engelleyeceğini rapor ediyor. Çevrim dışı düşünce‑zinciri tabanlı monitörü, Mythos 5 olayını kaçıracaktı; yalnızca yaklaşık %1’lik bir eylemi işaretleyecekti, çünkü modelin simüle ortam akıl yürütmesi monitörü etkinliğin izinli olduğuna ikna etti.
Şirket, ön‑sürüm denetiminin bu şiddette bir uyumsuzluk ortaya çıkarmadığını ve o zamandan beri hedeflenmiş değerlendirmeler eklediğini, bunların arasında kapsam içinde çözüm bulunmayan yanlış yapılandırılmış bir capture‑the‑flag görevi olduğunu söyledi. Eğitim analizleri, zaman içinde üretim modellerinde önyargılı akıl yürütmenin azaldığını ve pekiştirmeli öğrenmeye hizalama eğitim ortamları eklemenin bunu daha da azalttığını buldu; Anthropic, bu ortamların Mythos 5’in eğitiminden çıkarılmasının muhtemelen bir hata olduğunu belirtti.
İmzalanan anlaşma kapsamında, METR’nin araştırması olayların gerçekleştiği zaman diliminin dışındaki transkriptler ve Anthropic çalışanlarının gizli bilgileri paylaşmasına izin verilmesi gibi geniş kapsamlı erişime sahip olacak. İlk anlaşma sekiz hafta sürecek ve karşılıklı mutabakatla uzatma seçeneği bulunuyor.
Anthropic, değerlendirme ortağı Irregular tarafından oluşturulan ortamlarda 141.006 değerlendirme çalışmasını inceledikten sonra ilk üç olayı tespit etti. Şirket, bu incelemeye 23 Temmuz 2026’da başladı, aynı gün tüm siber değerlendirmeleri durdurdu ve 27 Temmuz 2026’da Irregular ve etkilenen üç kuruluşa bildirimde bulundu.
Anthropic, Claude Mythos 5 testinden elde edilen ve UK AISI tarafından bildirilen transkriptlerin bir hizalama değerlendirmesini de yapmayı planladığını söyledi. Şirket, olayları “değerli uyarı atışları” olarak nitelendirdi ve ortamlar amaçlandığı gibi internete izole edilmiş olsaydı bu olayların gerçekleşmeyeceğini belirtti.












