Yapay zeka modelleri ve platformları

Anthropic, Fable 5’in Biyoloji Güvenlik Önlemlerini Yeniden Ayarladı, Engellenen Sorguları %85 Azalttı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Anthropic, 7 Ağustos 2026’da Claude Fable 5’in biyoloji güvenlik önlemlerini güncellediğini açıkladı. Şirket, bu güncellemenin, biyoloji ile ilgili “geri dönüşleri” yaklaşık %85 oranında azalttığını belirtti. Bu geri dönüşler, sistem tarafından biyoloji güvenliği korunan bir alana dokunduğunu düşündüğü için bir kullanıcı sorgusunun daha az yetenekli bir modele otomatik olarak yönlendirilmesini ifade eder.

Açıklamasında, Anthropic, kullanıcıların artık her gün karşılaştıkları sağlık ve eğitimle ilgili sorular için çok daha az geri dönüş göreceğini, sağlık profesyonellerinin ise klinik görevlerde daha fazla destek alacağını belirtti. Biyoloji geri dönüşlerindeki bu azalma, Claude.ai’de toplam geri dönüş hacminin yaklaşık %67, Cowork’te %55, Claude Code’da %17 ve Claude Platform’da %7 azalmasına neden olacağı öngörülüyor.

Şirket, bu güncellemenin modeli profesyonel biyoloji araştırmalarına açmadığını açıkça belirtti. Fable 5, viroloji, toksikoloji ve moleküler tasarım gibi çift kullanımlı araştırmalar için hala Claude Opus 5’e geri dönecek. Anthropic, modelin profesyonel biyoloji araştırmaları ve ilaç geliştirme için henüz kullanılamayacak durumda olduğunu belirtti. Şirket, bu açığı, kamu sınıflandırıcısı yerine güvenilir erişim yolları ile kapatmayı amaçlıyor.

Geri dönüş sisteminin neyi engellemek için tasarlandığı

Geri dönüş mimarisi, Fable 5’in 9 Haziran 2026’da piyasaya sürülmesiyle birlikte ortaya çıktı. Anthropic, modeli siber güvenlik, biyoloji ve kimya ve damıtma girişimleriyle ilgili sınıflandırıcılar içeren bir dizi küçük otomatik AI sistemiyle piyasaya sürdü. Bir sınıflandırıcı tetiklendiğinde, sorgu bir sonraki en yetenekli Opus modeli tarafından yeniden sunulur. Anthropic, sınıflandırıcıların ilk olarak çok muhafazakar bir şekilde ayarlandığını ve oturumların %5’inden azında tetikleneceğini belirtti.

Biyoloji kapsamı, üçünün en geniş olanıydı. Anthropic’in gerekçesi, lansman postasında ve modelin sistem kartında açıklanmıştır. Mythos sınıfı modellerin, bazı karmaşık biyolojik görevlerde uzmanları geride bırakabileceği ve diğerlerinde operasyonel destek sağlayabileceği belirtilmiştir. Şirket, bu yeteneğin, kötü niyetli bir aktöre önemli bir avantaj sağlayabileceğini değerlendirmiştir. Sistem kartı, modeli “CB-1” yeteneklerine sahip olarak değerlendirir, yani modelin, temel teknik arka plana sahip kişiler için bilinen silah ilgili süreçlerde önemli bir şekilde yardımcı olabileceğini, ancak yeni biyolojik silah geliştirme için world-class uzmanlık düzeyini sağlayamayacağını belirtir.

Bugün yapılan güncelleme, ABD İstihbarat Topluluğunun 2026 Yıllık Tehdit Değerlendirmesi‘ne atıfta bulunur. Bu değerlendirmede, sentetik biyoloji ve genomik düzenleme gibi biyoteknoloji alanındaki ilerlemelerin yeni biyolojik tehditlere yol açabileceği ve beberapa devlet aktörünün muhtemelen aktif saldırı biyolojik ve kimyasal silah programlarına sahip olduğu uyarısında bulunulmaktadır.

Sınıflandırıcılarda neler değişti

Geçtiğimiz birkaç haftada, Anthropic, biyoloji sınıflandırıcısının yapısını değiştirdi – yani, ekran modelinin, korunan içerikle izin verilen içeriği ayırt etmek için kullandığı kural koleksiyonunu – ve daha ayrıntılı bir şekilde zararsız kullanımları tanımladı, iç ve dış uzmanlardan geri bildirim istedi, sınıflandırıcıyı güncellenmiş verilerle yeniden eğitti ve masih zararlı ve çift kullanımlı araştırma içeriği üzerinde tetiklenmeye devam ettiğini doğruladı. Lansman konfigürasyonu kasıtlı olarak geniş bir şekilde ayarlanmıştı: şirket, Fable 5’i genel kullanıcıya weeks veya aylar önce ulaştırmak için yüksek bir false positive hacmini bloke edeceğini kabul etti.

Şirketin kendi diyagramı, sınıflandırıcı sınırının, daha önce güvenlik marjı içinde yakalanan istekleri kabul etmek için değiştiğini gösteriyor. Anthropic’in siber güvenlik alanındaki aynı sınıflandırıcı yaklaşımına ilişkin önceki yazıları, benzer bir gerilimi tanımlar – Unite.AI, Claude modellerinin bu güvenlik önlemleri olmadan bir siber benchmark’u üç gerçek ihlale dönüştürdüğünü kapsadı.

Anthropic’in şimdi kamuoyu önünde yönettiği ticaret

Duyuru, bir ürün notu kadar bir yönetim belgesidir. Anthropic, Fable 5’i neredeyse tüm biyoloji sorgularını engellenmiş bir şekilde piyasaya sürdü, hızlı bir genel sürümün maliyeti olarak several haftalar boyunca false pozitifleri absorbe etti ve şimdi, daraltılan engelin ölçülebilir bir sonucu yayınladı – yüzey başına geri dönüş azaltmaları da dahil. Kalan kısıtlama, şirketin gerçek riski olduğu yerde oturuyor: profesyonel biyoloji araştırmaları, güvenilir erişim yolları, Anthropic’in Haziran lansmanından bu yana geliştirdiği ve şimdi vetted biyoloji araştırmacıları için trafiği taşıyacak olan Opus 5 geri dönüşlerine kadar devam edecek.

Şirket, güvenlik marjı içinde kalan arta kalan false pozitiflerin kalacağını kabul ediyor ve güvenlik önlemlerinin sürekli olarak iyileştirildiğini belirtiyor. 7 Ağustos güncellemesiyle, şirket, ilerlemenin ölçülebilir bir tanımı yazdı: şimdi karşılaştığı geri dönüş oranları.

Mira Kellan AI etiği, yönetim ve düzenleme konularında uzmanlaşmış bir AI tarafından oluşturulan köşe yazarıdır. Çalışmaları, yapay zekanın kamu politikası, toplumsal değerler ve uzun vadeli hesap verebilirlik ile nasıl kesiştiğini inceler ve sorumlu yeniliği vurgular.
Karmaşık konulara rasyonel ve felsefi bir lens ile yaklaşan Mira, ortaya çıkan AI düzenlemeleri, etik çerçeveleri ve gelecekteki akıllı sistemleri şekillendiren yönetim modellerini analiz eder. Hızlı teknolojik ilerlemeye karşı gerekli önlemleri almak ve AI sistemlerinin şeffaf, adil ve insan çıkarlarına uygun kalmasını sağlamak için bir köprü oluşturmayı amaçlar.
Mira Kellan tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından doğruluk, denge ve editoryal standartlara uygunluk sağlamak için gözden geçirilir.