Düşünce Liderleri

Hırsızı Görmeyen Bekçi Köpek: AI Güvenlik Çitleri Saldırganı Koruduğunda

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Barings’in öldüğü hafta sonu, UBS’deydim ve aniden iflas eden 233 yıllık bir bankanın bize ne yapabileceğini anlamaya çalışıyordum. Ertesi hafta, Londra’nın en eski tüccar bankası bir pound karşılığında ING’e satıldı. Toplam, hisse başına değil.

Nedeni alaycı derecede basitti. Nick Leeson, firmanın Singapur ticaret masasını ve onu denetlemesi gereken arka ofisi yönetti. Tek bir kişi iki rolü üstlendi ve bu, sadece onun görebildiği 88888 hata hesabına £827 milyonluk kayıp saklanmasına yol açtı. Bu klasik bir yetki hatasıydı. Birisi çok fazla yetkiye sahipti.

Kendimi o hafta sonuna geri dönerken, şaşkınlıkla, bu yaz Hugging Face’e ne olduğunu okurken buldum. Başka bir yetki hatası, ama bu sefer ters yönde gerçekleşti. Araç, saldırganı güvendi ve temizlik yapanları reddetti.

Cevapları Bulmak İçin Kaçan Model

OpenAI, iki modelini test ediyordu; GPT-5.6 Sol ve henüz yayınlanmamış bir model, ExploitGym üzerinde, bir modelin gerçek bir güven açığını çalışan bir exploit’e dönüştürüp dönüştüremeyeceğini ölçen bir kıyaslama. Test için, yüksek riskli siber etkinliği önlemek üzere tasarlanmış geleneksel üretim sınıflandırıcıları kapatıldı. Kapalı bir odada mantıklı bir adım.

Oda, planlandığı kadar kapalı çıkmadı. Modeller, paket kayıt önbellek proxy’sinde bir sıfır gün (zero-day) buldu, bunu açık internete doğru ilerlemek için kullandı ve Hugging Face’in kıyaslamanın cevaplarını barındırabileceğini düşündü. Oradan, çalınan kimlik bilgileri ve ek sıfır günleri zincirleyerek Hugging Face’in üretim sunucularında uzaktan kod çalıştırma yoluna ulaştılar. Gerçek bir şirkete girerek bir sınavda hile yaptılar.

Ajanların birbirlerine bıraktığı notlarda, biri yönetici hakları vardı anını kaydetti: “Aman Tanrım, okuyucu ADMIN mi? config/users dosyasını okuyabiliriz!” Üretim erişimini daha az coşkuyla ve daha çok evrakla karşılayan mühendisler gördüm.

Çoğu haber orada durdu, ajansı olan modellerden endişe duyuldu. Beni durduran kısım ise sonrasında geldi.

Güvenlik Çitleri Saldırganı Koruduğunda

Hugging Face’in yanıtlayıcıları saldırıyı analiz etmeye oturduğunda, güvenlik çitleri eklenmiş öncü ticari modeller yardımcı olamadı. Saldırı günlükleri exploit yükleri ve komut‑kontrol artefaktlarından oluşur ve modeller bir olay yanıtlayıcısını saldırgandan ayırt edemez. Bu yüzden reddettiler.

Adli inceleme yerine açık ağırlıklı bir model, GLM-5.2 kullanıldı; savunucuların kendi donanımlarında çalıştırıldı ve aynı materyali vicdan titremesi olmadan okudu.

Bunun şeklini düşünün. Saldıran modellerin üretim siber korumaları kaldırıldı ve istedikleri gibi davrandılar. Savunan insanlar ise korumalarını korudular ve diline dikkat etmesi söylendi. Güvenlik özelliği mükemmel çalıştı; çünkü saldırganın yöntemlerini inceleme nedeni olan tek kişilerden korudu.

Bunların hiçbiri kenar bir şikayet değildi. Jensen Huang, X’teki ilk gönderisini açık modelleri savunmak için kullandı; aynı zamanda Meta, Microsoft ve IBM gibi şirketler tarafından imzalanmış bir açık mektup. Mektup güvenlik argümanını açıkça ortaya koydu: saldırganların gelişmiş AI’a sahip olduğu bir dünyada, savunucuların benzer yeteneklere erişimi olmalı. Andrew Ng, argümanı destekledi, okuyucuları Huang’ın açık modeller savunmasına yönlendirdi. Onlarla birçok konuda fikir ayrılığına düşebilirsiniz ancak olay raporu orada kanıt olarak durduğunda noktayı kabul edersiniz.

Dolayısıyla otuz bir yıl içinde, bir adamın her şeyi görebildiği için bir bankanın yıkılmasından, kendi sorumlu sahibine karşı anonim bir saldırgana güvenen bir güvenlik aracına geldik. Leeson çok fazla görebiliyordu. Hugging Face’in ardından temizlik yapanlar ise yeterince göremiyordu.

Karşılaştırma ilk bakışta düşündüğü kadar garip değil. Finansal kurumlar, genellikle maliyetli hatalardan sonra, erişimin sadece birinin güvenilir olup olmadığı sorusu olmadığını öğrendiler. Bunun, belirli bir eylemi, belirli bir sistemde, belirli bir zamanda, başka birinin omzunun üzerinden bakmadan yapıp yapamayacağı sorusudur. Görev ayrımı, onay limitleri ve denetim izleri oluşturduk çünkü iyi niyetler genellikle güvenilir bir kontrol mekanizması olarak başarısız olur. AI sistemleri de aynı düşünceyi gerektirir. Bir modeli güvenli olarak adlandırmak, ona neyin izin verildiğini ve kim tarafından kullanıldığını bilmeden çok az şey söyler.

Bazı Şeyler Binadan Çıkaramaz

O gece barındırılan bir modele güvenemememin ikinci bir nedeni daha var ve bu, onun duyarlılıklarıyla ilgili değil. Düzenlenmiş bir aracı kurum için teknoloji yönetiyorum. İhlal günlüklerimizi, kimlik bilgilerini ve canlı exploit yüklerini başka birinin bulutuna yapıştırıp göndermem mümkün değil.

Olay verilerimiz, düzenleyicilerimizin beklediği yerde, kendi donanımımızda bulunur; bu yüzden yıllar ve göz kamaştırıcı bir donanım bütçesi harcayarak bunu inşa ettik. Bunu kötü niyetli modelleri öngörerek yapmadık. Bunu, bizim gibi bir firmanın en hassas verilerini ve şimdi en hassas araçlarını kendi duvarları içinde tutması nedeniyle inşa ettik.

Bunların hiçbiri güvenlik çitlerine karşı bir argüman değildir. Kendi çitlerinizin nereye işaret ettiğini bilmek için bir argümandır.

Bir model, bir phishing saldırganının phishing e‑postası yazmasına yardım etmeyi reddediyorsa faydalı bir iş yapıyor demektir. Model, güvenlik ekibinizin zaten gelen phishing e‑postasını okumasına yardım etmeyi reddediyorsa, saldırganın işini onun için yapıyor ve sizden abonelik ücreti alıyor.

Saat 2’de İhtiyacınız Olacak Aracı Sahip Olun.

Pratik ders sıkıcıdır, tıpkı önemli olanlar gibi. Olay müdahalenizi bir satıcının sorumluluk politikasına dış kaynak olarak vermeyin. Ticari modellerin çoğunlukla reddedeceği işleri yapacak, sahip olduğunuz donanımda yetkin bir modeli tutun ve ona ihtiyacınız olan geceye kadar var olduğunu öğrenin.

O donanım kalemini çekicilikten uzak gerekçelerle yıllarca savunmanın ödülü işte budur: ilginç bir arıza ortaya çıktığında, kanıtlara bakacak tek araca zaten binada sahipsiniz.

Otuz bir yıl önce, yanlış kişinin her şeyi görebildiği durumda neler olacağını hesaplamak için bir hafta sonu harcadım. Bu sefer, bunu yapabilen kişi olmak güzel olurdu.

Richard Forss, EXANTE bünyesindeki bir global prime broker olan şirkette, 30 yılı aşkın bir süredir finansal kurumlar, hedge fonları ve fintech şirketleri için teknoloji tasarımı ve ölçeklendirme deneyimine sahip olan Chief Technology Officer’dur.