Siber Güvenlik

Simbian Siber Savunma Benchmark’u Başlattı, AI Güvenlik Yeteneklerinde Büyük Açığı Ortaya Koydu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Simbian tarafından yayınlanan yeni bir benchmark, yapay zeka alanında yaygın olarak kabul gören bir varsayımı sorguluyor: aynı modellerin zayıflıkları bulabileceği gibi onları savunabileceği varsayımı.

Şirketin yeni tanıttığı Siber Savunma Benchmark’u, Simbian Araştırma Laboratuvarı tarafından geliştirildi ve önde gelen büyük dil modellerinin (LLM’ler) gerçek dünya siber savunma senaryolarında nasıl performans gösterdiklerini değerlendiriyor. Sonuçlar çarpıcı. Modern AI sistemleri giderek daha etkili bir şekilde zayıflıkları keşfetme ve onları sömürebilme konusunda ilerlerken, aktif saldırıları tanımlama ve durdurma görevi verildiğinde önemli ölçüde mücadele ediyorlar.

Ön Savunma Modelleri Asgari Savunma Standardını Karşılayamıyor

Benchmark, Claude Opus 4.6, GPT-5, Gemini 3.1 Pro gibi modelleri simüle edilmiş şirket içi ortamlarda test etti.

Hiçbir model geçer not alamadı.

Testteki en güçlü performans gösteren Claude Opus 4.6, yalnızca MITRE ATT&CK taktiklerinde saldırı kanıtlarının bir kısmını tespit edebildi, birçok model ise kötü amaçlı faaliyet kategorilerinin tamamını tanımlayamadı. Bağımsız akademik araştırmalar bu bulgularla uyumlu olarak, en güçlü modellerin bile gerçekçi senaryolarda açık uçlu tehdit avında mücadele ettiğini ve yalnızca küçük bir kısmını tespit edebildiğini gösterdi.

Bu açıklık kritik bir sınırlamayı vurguluyor. Bugünlerin AI sistemleri yapılandırılmış sorulara cevap vermek veya içerilmiş problemleri çözmek konusunda mükemmel olabilir, ancak karmaşık, gelişen saldırı zincirlerini rehbersiz olarak araştırmak zorunda kaldıklarında başarısız oluyorlar.

Gerçekçi, Temsilci Tabanlı Değerlendirmeye Doğru Bir Kayma

Bu benchmark’u ayıran şey tasarımı.

Önceki siber güvenlik testlerinin çoğunun multiple-choice sorularına veya statik verilere dayanırken, Simbian’ın yaklaşımı gerçek telemetri verilerini kullanıyor ve modelleri bir temsilci investigación döngüsüne yerleştiriyor. AI, neye bakacağını bilgilendirilmez; günlükleri keşfetmek, hipotezler oluşturmak ve tehditleri bağımsız olarak tanımlamak zorundadır.

Bu, gerçek Güvenlik Operasyon Merkezlerindeki insan güvenlik uzmanlarının nasıl çalıştıklarının bir yansıması.

Benchmark, birden fazla aşama boyunca düzinelerce saldırı tekniğini içeriyor ve modellerin zaman ve sistemler boyunca sinyalleri bağlamalarını zorunlu kılıyor. Ayrıca, bağlamı değiştirerek ve deterministik puanlama uygulayarak, modellerin yalnızca kalıpları ezberlemesini de azaltıyor.

Bu gerçekçilik yönündeki kayma önemli. AI geliştirmede, gerçek dünya karmaşıklığını doğru bir şekilde yansıtan bir benchmark oluşturmak, genellikle problemi çözmenin ilk adımıdır.

Saldırgan ve Savunmacı AI Arasındaki Artan Uçurum

Bulgular, endüstri genelinde ortaya çıkan daha geniş bir eğilimi güçlendiriyor.

AI, siber saldırı görevlerinde hızla ilerleme kaydediyor. Son araştırmalar, ön sıradaki modellerin already simüle edilmiş ortamlarda çok adımlı saldırıları gerçekleştirebileceğini ve giderek daha az araç kullanarak bunu yaptığını gösteriyor. Aynı zamanda, savunma yetenekleri geride kalıyor.

Bu dengesizlik, saldırganların otomasyonu ve ölçeklenebilirliği kullanırken, savunmacıların hala insan uzmanlığına ve parçalı araçlara güvenmek zorunda kalmasıyla bir asimetri yaratıyor. AI bir zayıflık tespit ettiğinde, ciddiyetini yanlış yorumlayabilir veya uygun şekilde hareket edemeyebilir, böylece tespit ve anlama arasındaki açığı vurguluyor.

Neden “Kutudan Çıkan” AI Yetersiz Kalıyor

Simbian’ın sonucuna göre, AI sistemlerinin savunma görevini tek başına yerine getiremeyeceği değil, yeterli destek olmadan bunu yapamayacağıdır.

Benchmark, LLM’lerin etkili bir şekilde güvenlik ortamlarında çalışabilmek için “gelişmiş bir harness”e -dış istihbarata, yapılandırılmış iş akışlarına ve sistem düzeyinde entegrasyona- ihtiyaç duyduğunu öne sürüyor.

Bu, AI’nin siber güvenlik görevlerinde araçlar, bellek ve bağlam eklenmesiyle performansının önemli ölçüde iyileştirilebileceğini gösteren daha geniş araştırmalar ile uyumlu.

Üretim ortamlarında, Simbian bu ek katmanlarla birleştirerek modellerle önemli ölçüde daha yüksek tespit doğruluğuna ulaştığını iddia ediyor. İmplicasyon açık: ham model yeteneği, yalnızca puzzle’ın bir parçasıdır.

AI Güvenlik İçin Yeni Bir Benchmark Kategorisi

Siber Savunma Benchmark’u nun yayınlanması, AI sistemlerinin gerçek dünya dağıtımları için nasıl değerlendirileceği konusunda önemli bir adım niteliğinde.

Soru-cevap yerine kanıtlara dayalı tehdit avına odaklanarak, problemi zekadan icraya dönüştürüyor. Ayrıca, model boyunca performans ve verimlilik arasında ölçülebilir bir faktör olarak maliyeti tanıtıyor.

AI, siber güvenliği yeniden şekillendirmeye devam ederken, bu tür benchmark’lar, modellerin neler yapabileceğini anlamak için değil, nerede başarısız olduklarını anlamak için temel araçlar haline gelebilir—and why.

Şimdilik, sonuç açık. AI’de hızlı ilerleme rağmen, tamamen otonom siber savunma hala ulaşılmaz. İnovasyonun bir sonraki aşaması, daha büyük modeller inşa etmekten daha çok, AI’yi yapılandırılmış zeka, bağlam ve insan denetimi ile birleştiren sistemleri tasarlamaktan daha fazla bağlı olacak.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.