Anderson’un Açısı
‘Anlamsız Dilde’ DALL-E 2’nin Görüntü Sentezleme Moderasyon Sistemlerini Nasıl Alt Edebilir

Kolombiya Üniversitesi’nden yeni bir araştırmaya göre, DALL-E 2, Imagen ve Parti gibi görüntü sentezleme modellerinin zararlı veya tartışmalı görseller üretilmesini önleyen güvenlik önlemleri, “uydurulmuş” kelimeleri içeren bir tür düşmanca saldırıya karşı savunmasızdır.
Yazar, görüntü sentezleme sisteminin içerik moderasyon önlemlerini geçersiz kılacak iki yaklaşım geliştirmiş ve bu yaklaşımaların farklı mimarilerde bile şaşırtıcı derecede güçlü olduğunu keşfetmiştir. Bu, zayıflığın sadece sistemsel değil, aynı zamanda metin-görsel sentezlemenin temel ilkelerine dayandığını gösteriyor.
İlk ve daha güçlü olan yaklaşım, “macaronic prompting” olarak adlandırılır. “Macaronic” terimi, Esperanto veya Unwinese gibi birden fazla dili birleştiren bir dili ifade eder. Urdu-English, Pakistan’da yaygın olarak kullanılan bir “kod karıştırma” türüdür ve İngilizce isimlerle Urdu soneklerini serbestçe birleştirir.
Yazar, sistemlerin, web kaynaklarında bulunan çok dilli etiketler nedeniyle, göreceli olarak az bir küratörlük nedeniyle anlamlı bir şekilde yanıt vereceğini belirtir. Bu kaynaklar genellikle çok dilli etiketler (yani, görüntü sentezleme görevi için özel olarak tasarlanmayan veri setlerinden) ile gelir ve her bir kelime, her dilde bir “token” haline gelir. Doğal Dil İşleme’de (NLP) bu tür “kök alma” veya “stemming”, türetilmiş daha uzun kelimelerin etimolojisini ayırt etmeye yardımcı olur, ancak aynı zamanda “creative prompting” tarafından yararlanılan büyük bir leksiksel “Lego seti” oluşturur.
İkinci yaklaşım, “evocative prompting” olarak adlandırılır. Bu yaklaşım, DALL-E 2’nin, Monty Python’ın Life of Brian (1979) filmindeki “okul çocuğu Latincesi” gibi, benzer bir tona sahip kelimelerle yanıt vermesini sağlar.
Yazar, bu tür saldırıların, daha fazla dil eklenerek daha “kriptik” ve zorlayıcı hale getirilebileceğini ve bu tür saldırıların, DALL-E 2 gibi büyük ölçekli modelleri etkileyebileceğini belirtir.
Araştırmacı, bu tür saldırıların, DALL-E 2’ninModerasyon önlemlerini atlatmak için kullanılabileceğini, ancak bu tür saldırıların, sistemlerin güvenliğini tehlikeye atabileceğini de belirtir.
Makale, “Görüntü Oluşturma ile Oluşturulmuş Kelimelerden Oluşan Düşmanca Saldırılar” olarak adlandırılmış ve Raphaël Millière tarafından Columbia Üniversitesi’nden yayınlanmıştır.
DALL-E 2’de Kriptik Dil
DALL-E 2, yazı diliyle karşılaştığında çıkardığı anlamsızlık, aslında bir “gizli sözlük” olabilir. Ancak, bu gizli dili geliştirmek için herhangi bir yöntem önerilmemiştir.
Yazar, DALL-E 2’nin, “nonce strings” olarak adlandırılan anlamsız kelimelerle yanıt vermesini sağlayan iki yöntem geliştirmiştir. Bu yöntemler, “macaronic prompting” ve “evocative prompting” olarak adlandırılmıştır.
Yazar, bu yöntemlerin, DALL-E 2’ninModerasyon önlemlerini atlatmak için kullanılabileceğini, ancak bu tür saldırıların, sistemlerin güvenliğini tehlikeye atabileceğini de belirtir.
Lingua Franca
Makale, DALL-E 2 ve DALL-E Mini (Craiyon) gibi farklı mimarilerde benzer sonuçların elde edilebileceğini gözlemiştir. Bu, DALL-E 2’nin bir difüzyon modeli olduğu, DALL-E Mini’nin ise difüzyon modeli olmadığı halde, benzer sonuçların elde edilebileceğini göstermektedir.
Yazar, bu tür saldırıların, DALL-E 2’ninModerasyon önlemlerini atlatmak için kullanılabileceğini, ancak bu tür saldırıların, sistemlerin güvenliğini tehlikeye atabileceğini de belirtir.
Evocative Prompting
“Evocative prompting” yaklaşımı, sistemden daha geniş bir yanıt elde etmeyi amaçlar. Bu yaklaşım, “pseudolatin” olarak adlandırılan, Latince benzeri kelimelerle yanıt vermesini sağlar.
Yazar, bu tür saldırıların, DALL-E 2’ninModerasyon önlemlerini atlatmak için kullanılabileceğini, ancak bu tür saldırıların, sistemlerin güvenliğini tehlikeye atabileceğini de belirtir.
Makale, DALL-E 2’ninModerasyon önlemlerini atlatmak için kullanılabilecek çeşitli saldırı yöntemlerini ortaya koymuştur. Ancak, bu tür saldırıların, sistemlerin güvenliğini tehlikeye atabileceğini de belirtmiştir.
DALL-E 2, her kullanıcı hesabı için bir telefon numarası gerektirir, bu da bu tür saldırıların sınırlarını test etmek için gereken “yanlış hesaplar” sayısını sınırlar. Şu anda, DALL-E 2’ninModerasyon önlemlerini atlatmak için kullanılabilecek en önemli güvenlik önlemi, erişim volatilitesidir.
İlk olarak 9 Ağustos 2022’de yayınlanmıştır.












