Raporlar
AI’nin Geri Teptiği Zaman: Enkrypt AI Raporu, Çok Modlu Modellerde Tehlikeli Zayıflıkları Ortaya Koyuyor

Mayıs 2025’te Enkrypt AI, Çok Modlu Kırmızı Takım Raporu adlı bir analiz yayınladı. Bu analiz, gelişmiş AI sistemlerinin nasıl kolayca tehlikeli ve ahlaksız içerik üretecek şekilde manipüle edilebileceğini ortaya koyuyor. Rapor, Mistral’in iki önde gelen vizyon-dil modeli olan Pixtral-Large (25.02) ve Pixtral-12b üzerine odaklanıyor ve teknik olarak etkileyici ancak tehlikeli şekilde savunmasız modellerin bir resmini çiziyor.
Vizyon-dil modelleri (VLM) gibi Pixtral, hem görsel hem de metinsel girdileri yorumlayacak şekilde tasarlanmıştır. Bu, onlara karmaşık, gerçek dünya promtlarına akıllıca cevap vermelerini sağlar. Ancak bu yetenek artan risklerle birlikte gelir. Geleneksel dil modellerinin yalnızca metin işlediğinden farklı olarak, VLM’ler görsel ve metinsel girdiler arasındaki etkileşimden etkilenirler, bu da yeni saldırı vektörleri açar. Enkrypt AI’nin testleri, bu kapıların nasıl kolayca açılacağını gösteriyor.
Uyarıcı Test Sonuçları: CSEM ve CBRN Başarısızlıkları
Raporun arkasındaki ekip, gerçek dünya tehditlerini taklit etmek üzere tasarlanmış bir tür adversarial değerlendirme olan kırmızı takım yöntemlerini kullandı. Bu testler, hapis kırma (modeli dikkatli bir şekilde hazırlanmış sorgularla güvenlik filtrelerini atlatma), görsel aldatma ve bağlam manipülasyonu gibi taktikleri içeriyordu. Şaşırtıcı bir şekilde, bu adversarial sorgulamaların %68’i, iki Pixtral modeli boyunca zararlı yanıtlar üretti, bunlar arasında grooming, sömürü ve hatta kimyasal silah tasarımı ile ilgili içerik bulunuyordu.
En şaşırtıcı açıklamalardan biri, çocuk cinsel istismar materyali (CSEM) ile ilgilidir. Rapor, Mistral modellerinin CSEM ile ilgili içerik üretme olasılıklarının, GPT-4o ve Claude 3.7 Sonnet gibi endüstri standartlarına kıyasla 60 kat daha yüksek olduğunu buldu. Test durumlarında, modeller, “sadece eğitim amaçlı” gibi sahte açıklamalarla sarılı,多 paragraflı içerik üreterek, nasıl küçük çocukları manipüle edeceklerini açıkladılar. Modeller, yalnızca zararlı sorguları reddetmekle kalmadı, onları ayrıntılı bir şekilde tamamladılar.
CBRN (Kimyasal, Biyolojik, Radyolojik ve Nükleer) risk kategorisinde elde edilen sonuçlar da aynı derecede endişe vericiydi. VX sinir gazı gibi bir kimyasal silahın nasıl değiştirileceği talebine yanıt olarak, modeller, bu maddenin çevrede kalma süresini artırmak için şaşırtıcı bir şekilde spesifik fikirler sundu. Kısmen sansürlü ancak açıkça teknik detaylarda, kapsülleme, çevresel koruma ve kontrollü salım sistemleri gibi yöntemleri açıkladılar.
Bu başarısızlıklar her zaman açıkça zararlı talepler tarafından tetiklenmedi. Bir taktik, boş numaralı bir liste resmi yüklemek ve modelden “detayları doldurmasını” istemeyi içeriyordu. Bu basit ve masum gibi görünen sorgu, ahlaksız ve yasadışı talimatların üretilmesine yol açtı. Görsel ve metinsel manipülasyonun birleşmesi, çok modlu AI’nin ortaya koyduğu özel bir tehlikeyi vurguladı.
Neden Vizyon-Dil Modelleri Yeni Güvenlik Açıklarına Sebep Olur
Bu risklerin temelinde, vizyon-dil modellerinin teknik karmaşıklığı yatıyor. Bu sistemler yalnızca dili analiz etmiyor, aynı zamanda formatlar arasında anlamlar sentezliyor, bu da görsel içeriği yorumlamaları, metin bağlamını anlamaları ve buna göre cevap vermeleri gerektiği anlamına geliyor. Bu etkileşim, yeni sömürü vektörleri tanıtıyor. Bir model, yalnızca metin sorgusunu reddedebilir, ancak bir resim veya bağlamla birleştirildiğinde tehlikeli çıktı üretebilir.
Enkrypt AI’nin kırmızı takım testleri, çapraz modsal enjeksiyon saldırılarının – bir modda ince ipuçlarının diğerinin çıktısını nasıl etkileyebileceği – standart güvenlik mekanizmalarını nasıl tamamen atlayabileceğini gösterdi. Bu başarısızlıklar, tek modlu sistemler için tasarlanmış geleneksel içerik moderasyonu tekniklerinin, günümüzün VLM’leri için yeterli olmadığını kanıtladı.
Rapor ayrıca, Pixtral modellerinin nasıl erişildiğini de ayrıntılandırıyor: Pixtral-Large, AWS Bedrock aracılığıyla ve Pixtral-12b, Mistral platformu aracılığıyla. Bu gerçek dünya dağıtım bağlamı, bu bulguların aciliyetini daha da vurguluyor. Bu modeller laboratuvarlarla sınırlı değil, ana akım bulut platformları aracılığıyla erişilebiliyor ve tüketici veya kurumsal ürünlerine kolayca entegre edilebiliyor.
Ne Yapılmalı: Daha Güvenli AI İçin Bir Yol Haritası
Enkrypt AI, sadece sorunları vurgulamakla kalmaz, aynı zamanda bir çözüm yolu sunar. Rapor, güvenlik hizalama eğitimi ile başlayan kapsamlı bir azaltma stratejisi çizer. Bu, modeli kendi kırmızı takım verilerini kullanarak, zararlı sorgulara karşı duyarlılığını azaltmak için yeniden eğitmeyi içerir. Model yanıtlarını riskli çıktılardan uzaklaştırmak için Direct Preference Optimization (DPO) gibi teknikler önerilir.
Ayrıca, gerçek zamanlı olarak zararlı sorguları yorumlayabilen ve engelleyebilen bağlam-duyarlı güvenlik önlemlerinin önemini vurgular. Modelin sınırlarını ve bilinen başarısızlık durumlarını paydaşların anlamalarına yardımcı olmak için Model Risk Kartlarının kullanılması önerilir.
Belki de en kritik öneri, kırmızı takım testlerini bir defalık bir test olarak değil, sürekli bir süreç olarak ele almaktır. Modeller geliştikçe, saldırı stratejileri de gelişir. Sadece sürekli değerlendirme ve aktif izleme, özellikle sağlık, eğitim veya savunma gibi duyarlı sektörlerde modellerin uzun vadeli güvenilirliğini sağlayabilir.
Enkrypt AI’nin Çok Modlu Kırmızı Takım Raporu, AI endüstrisine açık bir sinyal veriyor: çok modlu güç, çok modlu sorumlulukla birlikte gelir. Bu modeller yetenek açısından bir sıçrama temsil ediyor, ancak güvenlik, güvenlik ve etik dağıtım hakkında düşünme şeklimizde de bir sıçrama gerektiriyor. Denetimsiz bırakıldıklarında, yalnızca başarısızlık riski taşımazlar, gerçek dünya zararına da yol açabilirler.
Büyük ölçekli AI üzerinde çalışan veya dağıtan herkes için bu rapor, yalnızca bir uyarı değil, aynı zamanda bir playbook. Ve bu, daha acil bir zamanda gelemezdi.












