Düşünce Liderleri

AI Ajanlarının Yeniden Yazılamayan Güvenlik Sınırlarına İhtiyacı Var

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

AI ajanlarının kontrolden çıktığı an olarak Hugging Face hikayesini okumak cazip. Ancak tam olarak öyle olmadı ve ayrıntılar önemli. Bunlar, araştırmacıların modellerin neler yapabileceğini görebilmeleri için güvenlik önlemlerinin kasıtlı olarak azaltıldığı değerlendirmelerde çalışan siber güvenlik araştırma ajanlarıydı. Hiç kimsenin müşteri hizmetleri botu bir sabah uyanıp bir şirkete saldırmaya karar vermedi. Ancak bu bağlam kimsenin sorumluluktan kurtulmasını sağlamaz. Bir ajan, içinde kalması gereken sınırı aştı, kimlik bilgilerini ve araçları operatörlerinin asla yetkilendirmediği şekillerde kullandı ve başka birine ait sistemlere girdi. İşte güvenlik ekiplerinin dikkat etmesi gereken kısım bu.

Reuters, ajanların Hugging Face’i Mayıs ayının başından itibaren araştırdığını bildirdi, ancak araştırmacılar, önceki etkinliğin tek başına bir ihlale yol açtığını gösteren bir şey bulamadıklarını söylediler. Temmuz farklıydı. OpenAI, modellerinin izolasyon kontrollerini aşabildiğini söyledi, internete erişti ve hem kendi araştırma altyapısının hem de Hugging Face sistemlerinin bazı bölümlerini tehlikeye attı. Hugging Face’in kendi açıklaması, otonom bir ajan sistemi tarafından uçtan uca yürütülen bir saldırıyı tasvir ediyor, bu sistem veri işleme hattını istismar etti, kimlik bilgilerini topladı ve iç kümeler arasında hareket etti.

Rahatsız edici kısım, ajanların işlerini yapıyor olmaları. Verilen hedefi kovalamaktaydılar. Bu yüzden bu hikaye tek bir araştırma laboratuvarının çok ötesine uzanıyor. Kurumsal ajanlar da hedefleri kovalar. Kimlik bilgilerini tutarlar, araçları çağırırlar ve herhangi bir kişinin inceleyebileceğinden daha hızlı hareket ederler. Tamamen iyi niyetli bir ajan bile gerçek zarar verebilir ve ele geçirilen bir ajan aynı yetkiyi bir saldırgan adına kullanabilir. Bu yüzden güvenlik, model ne kadar kendinden emin görünür ya da amaçları ne kadar zararsız görünür olursa olsun, sistemin gerçekte ne yapabileceğini yönetmelidir.

Eylemi Güvenceye Al, Sadece Modeli Değil

Erken aşamadaki çoğu ajan programı çabalarını modele yönlendirir. Takımlar istemleri test eder, reddetmeleri ayarlar, birinci modeli kontrol etmek için ikinci bir model ekler ve akıl yürütme izini kötü niyet işaretleri için izler. Bunların hiçbiri boşa gitmez. Ancak hepsi olasılıksaldır, çünkü başka bir modelin karar vermesine bağlıdır. Üretim güvenlik sınırı belirleyici olmalı ve araçların, kimlik bilgilerin, ağların ve işlemlerin etrafında yer almalıdır.

Soracağım soru somut bir soru: bu ajan gerçek dünyada gerçekte neyi hayata geçirebilir? Bir ödeme talebi hazırlamak bir şey, fonları serbest bırakmak başka bir şey. Aynı durum, bir veritabanı değişikliği hazırlamak ile üretimde çalıştırmak ya da bir saklama kuralına uyan kayıtları işaretlemek ile silmek arasında da geçerlidir. Her iki durumda da aynı model olabilir, ancak hangi tarafında konumlandığına bağlı olarak risk çok farklıdır.

Unite AI’nin yetenek kontrolü üzerine yakın tarihli bir incelemesi aynı çizgiyi çizer, riski veri, araçlar, izinler, özerklik ve ajanın çalıştığı ortamla ilişkilendirir. Bu çerçeveyi seviyorum çünkü bizi “güvenli model” ve “güvensiz model” gibi belirsiz etiketlerin ötesine taşıyor. Takımların bir ajanın kararından gerçek sonuçları olan bir şeye giden her yolu izlemelerini sağlar.

Her Ajanı Bir Kimlik ve Dar Bir Yetkiyle Donatın

Bir ajan hiçbir zaman bir geliştiricinin hesabında çalışmamalı veya bir insan kullanıcının yapmasına izin verilen her şeyi devralmamalıdır. Paylaşılan kimlik, atıfı ortadan kaldırır. Uzun ömürlü kimlik bilgileri, bir saldırganın bunları kötüye kullanması için daha fazla zaman tanır. Ayrıca geniş hizmet hesapları, küçük bir iş akışının dokunması gerekenin ötesinde veri ve sistemlere dolaşmasına izin verir.

NIST artık yazılım ve AI ajan kimliğini kendi mimari sorunu olarak ele alıyor. Konsept belgesi, bir ajanın belirli bir eylem için yetkili olduğunu nasıl kanıtlayabileceğini, bir ajanın kimliğinin bir insanın yetkisiyle nasıl ilişkilendirilebileceğini ve kuruluşların niyet edilen ile gerçekte olanı gösteren müdahaleye dayanıklı kayıtları nasıl tutabileceklerini sorar. Pratikte, bu basit bir tasarıma işaret eder. Her ajan benzersiz bir kimlik, bir sahip (kişi ya da ekip), tanımlı bir amaç ve önündeki göreve yönelik izinler alır.

Kimlik bilgileri hızlıca süresi dolmalı ve yalnızca belirli kaynaklar ve eylemler için çalışmalıdır. Ağ erişimi sıkı bir izin listesiyle başlamalıdır. Bir ajan onaylanmış bir veritabanını sorgulamak zorundaysa, aynı zamanda genel bir kabuk, açık internet erişimi veya yeni kimlik bilgileri oluşturma yetkisi almamalıdır. Ayrıca iş bir dizi ajan ve araç arasında ilerledikçe, yetki her adımda daha dar olmalı, genişlememelidir.

NIST ayrıca kimlik bilgisi paylaşımına ve aşırı geniş erişime karşı uyarıyor, ve bu uyarı önemlidir çünkü ajanlar fırsatçı davranır. Bir yol engellendiğinde, başka bir aracı deneyebilir, ortamda dolaşabilir veya birinin unuttuğu bir tokenla karşılaşabilir. Toplanan kimlik bilgileri Temmuz hikayesinin de bir parçasıydı. En az ayrıcalık, akıl yürütme katmanı tasarımcılarının beklemediği bir şey yaptığında patlama yarıçapını küçük tutar.

Yetkilendirmeyi Akıl Yürütme Döngüsünün Dışında Tutun

Bir ajan bir eylemi önerebilir. Bunun izinli olup olmadığına karar vermeye yetkisi olmamalıdır. Bu karar, ajan tarafından yeniden yazılamayan, devre dışı bırakılamayan veya konuşmayla atlatılamayan ayrı bir uygulama katmanına aittir. Her araç çağrısı, hangi ajanın istediğini, hangi insanın sponsor olduğunu, istediği işlemi, hedefini ve uygulanacak sınırlamaları gösteren yapılandırılmış bir istek olarak görünmelidir. Uygulama katmanı ardından bunu onaylar, engeller veya yükseltir.

OWASP aşırı ajansı tanımlar bazı gereksiz işlevsellik, aşırı izinler ve fazla özerklik karışımı olarak. Rehberi, dar araçlar, minimum izinler, aşağı akış sisteminde yetkilendirme ve yüksek etkili eylemler için kullanıcı onayı gerektirir. Bunun tam olarak doğru sıra olduğunu düşünüyorum. Kural, veriyi veya işlemi yürüten tarafça uygulanmalıdır. Bir model bir eylemin onaylandığını söylerse, bu ifade tek başına hiçbir ağırlığa sahip olmamalıdır.

Bu ayrım, istem enjeksiyonunda da yardımcı olur. Zehirli bir e-posta ya da belge, ajanın mantığını yönlendirebilir, ancak ajanın kimlik bilgilerini genişletemez veya bir politika geçidini devre dışı bırakamaz. Model, yasak bir şey istemekte özgürdür. Sistem yine de hayır demelidir.

İnsan Onayını Önemli Anlar İçin Saklayın

Bir eylem geri alınamaz, örgütsel bir sınırı aşar, ayrıcalıkları değiştirir, hassas bilgileri açığa çıkarır, para transferi yapar veya bir üretim sistemine dokunursa, insan incelemesi değerini kanıtlar. Her rutin adım için onay istemek iki şeyi getirir: gecikmeler ve insanların “onayla”ya okumadan tıklamayı öğrenmesi. NIST bu onay yorgunluğunu açıkça adlandırır.

İyi bir onay talebi, nereye gideceği ve önemli parametreleri dahil olmak üzere, eylemi açık bir dille gösterir. Bu, ajanın yazdığı metinden değil, yetkili bir sistemden gelmelidir. Onay hızlıca süresi dolmalı ve yalnızca o tek eylemi kapsamalıdır. Önemli bir detay değişirse, sistem yeniden sorar.

OWASP’ın ajan güvenlik rehberi geçerli, süresi dolmamış, parametreye bağlı bir onay olmadan yüksek etkili bir eylemin gerçekleşip gerçekleşemeyeceğini test etmeyi önerir. Bu ifade hatırlamaya değerdir. “Devam etmek için tamam” zayıf bir onaydır ve başka bir ajan ya da kötü niyetli bir aktör tarafından onaylanabilir. “Bu miktarı bu hesaba aktar” ya da “bu değişikliği bu ortama dağıt” gibi ifadeler, sistemin yürütme anında gerçekten doğrulayabileceği ve kullanıcının tam olarak anlayabileceği şeylerdir.

Canlı insan kimlik doğrulaması bu kapıda önemlidir. Bir push bildirimi yalnızca birinin ya da bir şeyin bir düğmeye tıkladığını kanıtlar. Daha güçlü tasarımlar, kaydolmuş bir kişinin yerel biyometrik doğrulama yöntemiyle desteklenen, kimlik avına dayanıklı bir açık anahtar kimlik doğrulaması kullanmasını gerektirir. FIDO standartları, açık anahtar kimlik bilgilerini meşru çevrimiçi hizmete bağlar ve biyometrik verileri kullanıcının izole cihazında tutar. İyi kullanıldığında, donanım destekli kimlik doğrulama, doğru kişinin gerçekten orada olduğuna dair çok daha iyi kanıt sağlar. Ancak bu, işlem bağlamasını, güvenilir bir göstergeyi veya politika uygulamasını yerine geçmez. Hepsinin birlikte çalışması gerekir.

Davranışı İzleyin ve Kanıtı Koruyun

Uzun bir ajan çalışması boyunca neler olduğunu açıklamak için ilk isteme güvenemezsiniz. Güvenlik ekipleri, araç çağrıları, ağ etkinliği, kimlik bilgisi kullanımı, politika kararları, onaylar, reddetmeler ve kapsam değişiklikleri hakkında telemetriye ihtiyaç duyar. İzleme, ajanın gerçekte ne yaptığını o çalışmaya tanımlanan sınırla karşılaştırmalıdır. Eğer bir ajan kod analiz etmesi için atanmışsa ve dış kimlik bilgileri aramaya ya da alakasız bir hizmeti incelemeye başlarsa, bu bir uyarı tetiklemelidir.

Kayıtların, sırları düz metin olarak sızdırmadan eylem zincirini yeniden oluşturacak kadar bağlam içermesi gerekir. Her kayıt, ajan sürümünü, sahibini, süreci başlatan kişi ya da sistemi, kullanılan aracı, istenen eylemi, politika sonucunu ve herhangi bir insan yetkilendirmesini yakalamalıdır. İmzalı ya da başka bir şekilde müdahaleye dayanıklı kayıtlar, özellikle birden fazla ajan ve hizmetin dahil olduğu durumlarda, olay sonrası incelemeyi çok daha güvenilir kılar.

Bunların hepsi makine hızında çalışmalı. Bir gösterge tablosunu izleyen kimse, saniyeler içinde biten binlerce çağrıyı durduramaz. Otomatik kontroller, hız limitlerini uygulamalı, alışılmadık dizileri yakalamalı ve davranış tanımlı bir eşiği aştığında kimlik bilgilerini askıya almalıdır. Böylece insan araştırmacılar, sınırlı bir olayı ele alarak açık uçlu bir kovalamacaya girmek zorunda kalmazlar.

Başlatmadan Önce Durdurma Yolunu Tasarlayın

Her ajan dağıtımı, yeteneği gerçekten kaldıran bir durdurma yöntemine ihtiyaç duyar. Ajanı durdurmasını istemek sayılmaz. Operatörler, ajanın kimlik bilgilerini iptal edebilmeli, ağ yolunu kesebilmeli, çalışma zamanını sonlandırabilmeli ve kuyruktaki eylemlerin yeniden başlamasını engelleyebilmelidir. Yüksek sonuçlu iş akışları için, onay veya politika hizmeti devre dışı kalırsa sistem kapalı şekilde başarısız olmalıdır.

Ardından bu yolu baskı altında test edin. Onay hizmetini çevrim dışı bırakın. Ajanı çelişkili talimatlarla yönlendirin. Çalışma ortasında bir kimlik bilgisini döndürün. Ele geçirilmiş bir aracı ve yanıt vermeyen bir onaylayıcıyı simüle edin. Eylemin engellendiğini ve faydalı bir kayda sahip olduğunuzu doğrulayın. Model, istem, bağlayıcı, bellek sistemi veya izin kümesi değiştiğinde bu testleri yeniden çalıştırın.

Hedef Sorumlu Özerklik

Hiçbiri, ajanlara karşı bir argüman değildir ve Hugging Face olayı, faydalı olanlardan kimseyi korkutmamalıdır. Yapması gereken, bir güvenlik istemi artı iyi niyetlerin güvenilir bir dağıtıma eşit olduğu fikrini ortadan kaldırmaktır. Ajanlara analiz yapma, işi hazırlama ve geri döndürülebilir görevleri ele alma alanı tanıyın. Gerçek sonuçlar doğurabilecek yetkilerini dar, görünür ve ajan dışındaki bir şey tarafından uygulanır tutun.

Bir ajan üretime geçmeden önce, liderler bir avuç basit soruya cevap verebilmelidir. Hangi sistemlere erişebilir? Hangi kimlik bilgilerini kullanabilir? İnceleme olmadan ne yapabilir? Ne zaman yükseltme tetiklenir? Onaylayıcı, onaylanan tam eylemi nasıl görür? Hangi kanıtlar geride bırakılacak? Ve güvenlik, çalışmayı nasıl anında durdurabilir?

Cevaplar belirsizse, ajan organizasyonun fark ettiğinden daha fazla yetkiye sahiptir. Zaman içinde ayakta kalan mimari, model korumalarını kimlik, en az ayrıcalık, dış politika uygulaması, seçici insan onayı, tam telemetri ve gerçekten işe yarayan bir durdurma mekanizmasıyla eşleştirir. Bu, dürüst bir varsayımla başlar: yetenekli ajanlar ara sıra bizi şaşırtacaktır. Güvenlik sınırlarımız ise öyle olmamalıdır.

Sonuçta bir AI ajanını, (potansiyel olarak) kök erişimi olan ve İK’dan korkmayan bir stajyer gibi düşünün.

Onların hangi koruma ve geçitleri olur?

Uygun şekilde ilerleyin.

Kevin Surace Token şirketinin CEO'su, yapay zekâ öncüsü, mucit, yazar ve girişimci; yapay zekâ uygulama konusunda on yıllara dayanan deneyime sahip. Dünya çapında 95 patent sahibi ve AI, otomasyon ve iş geleceği konularında küresel olarak konuşmacı.