Anderson’un Açısı

Doğal Dil İşleme Sistemlerine Karşı Adversarial Örneklerle Saldırı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

İngiltere ve Kanada’daki araştırmacılar, Google, Facebook, IBM ve Microsoft gibi geniş çapta kullanılan dil işleme çerçevelerine karşı etkili olan bir dizi siyah kutu adversarial saldırısı geliştirdiler.

Saldırı, makine öğrenimi çeviri sistemlerini devre dışı bırakmak, eğitimini engellemek, toksik içeriği yanlış sınıflandırmak, arama motoru sonuçlarını zehirlemek, arama motorlarının kötü niyetli veya olumsuz içeriği tanımasını engellemek ve hatta NLP çerçevelerine Hizmet Reddi (DoS) saldırıları gerçekleştirmek için kullanılabilir.

Araştırmacılar, önerilen güvenlik açıklarını çeşitli isim verilmeyen taraflara bildirdiler, ancak NLP endüstrisinin adversarial saldırılara karşı kendini korumada yavaş olduğunu düşünüyorlar. Makalede şöyle deniyor:

‘Bu saldırılar, görünmez karakterler ve homoglyphs gibi dil kodlama özelliklerini kullanıyor. Bunlar, geçmişte spam ve phishing dolandırıcılıklarında görüldü, ancak birçok NLP sisteminin tasarımcıları bunları tamamen görmezden geldi.’

Birkaç saldırı, yerel olarak kurulan FOSS sürümleri yerine MLaaS sistemlerine API çağrıları yoluyla gerçekleştirildi. Sistemlerin birleşik etkinliği hakkında araştırmacılar şöyle diyor:

‘Tüm deneyler, sınırsız model değerlendirmelerine izin veren ancak modelin ağırlıklarına veya durumuna erişime izin vermeyen bir kara kutu ortamında gerçekleştirildi. Bu, neredeyse tüm ayarların, ticari Machine-Learning-as-a-Service (MLaaS) tekliflerine karşı da dahil olmak üzere olası saldırılar için en güçlü tehdit modelini temsil ediyor. Her bir model, algılamayan pertürbasyon saldırılarına karşı savunmasızdı.’

‘Bu saldırıların uygulanabilirliğinin teoride, yeterli savunma önlemleri alınmamış herhangi bir metin tabanlı NLP modeline genellenebileceğine inanıyoruz.’

Makale, Bad Characters: Imperceptible NLP Attacks başlığını taşıyor ve Cambridge Üniversitesi, Edinburgh Üniversitesi ve Toronto Üniversitesi’nden üç araştırmacıdan oluşuyor.

Makalenin başlığı, dört temel saldırı yönteminden birinin temelini oluşturan ‘algılamayan’ Unicode karakterleriyle dolu.

Makalenin başlığı, gizli sırlar içeriyor.

Makalenin başlığı, gizli sırlar içeriyor.

Yöntem/ler

Makale, üç temel etkili saldırı yöntemini öneriyor: görünmez karakterler; homoglyphs; ve yeniden sıralama. Bunlar, kara kutu senaryolarında NLP çerçevelerine karşı geniş bir etkiye sahip evrensel yöntemlerdir. Araştırmacılar, bir silme karakterinin kullanımını içeren bir yöntemi de buldu, ancak bu yalnızca işletim sistemi panosunu kullanan olağanüstü NLP boru hatları için uygundur.

1: Görünmez Karakterler

Bu saldırı, Unicode sistemine haritalanmayan kodlanmış karakterleri kullanıyor. Unicode sistemi, elektronik metni standartlaştırmak için tasarlandı ve şimdi 143.859 karakteri kapsıyor. Bu haritaların çoğu, bir yazı tipinde görünür bir karakter içermez (doğal olarak, Unicode’deki her girişi içeremez).

Makaledeki bir örnek, görünmez karakterlerin nasıl bir Natural Language Processing sistemini yanlış yönlendirebileceğini gösteriyor.

Makaledeki bir örnek, görünmez karakterlerin nasıl bir Natural Language Processing sistemini yanlış yönlendirebileceğini gösteriyor.

Tipik olarak, bu karakterlerden birini sıfır genişlikli bir boşluk oluşturmak için kullanamazsınız, çünkü çoğu sistem, tanınmayan karakteri temsil etmek için bir ‘yer tutucu’ sembolü (örneğin, bir kare veya eğimli bir kutu içindeki bir soru işareti) oluşturur.

Ancak makale, sadece birkaç yazı tipinin hiện geçerli olduğunu ve bu yazı tiplerinin Unicode standardına uymaya eğilimli olduğunu gözlemliyor.

Araştırmacılar, deneysel amaçlarla GNU’s Unifont gliflerini seçtiler, kısmen Unicode’un ‘güçlü kapsamı’ nedeniyle, ancak aynı zamanda birçok ‘standart’ yazı tipine benzemesi nedeniyle.

Görünmez karakterler, Unifont’tan üretildi, ancak NLP sistemleri tarafından görünür karakterler olarak sayılıyor.

Uygulamalar
Makalenin kendi ‘ürettiği’ başlığına geri dönersek, seçilen metinden bir Google araması yapmanın beklenen sonucu vermediğini görebiliriz:

Bu, bir istemci tarafı etkisi, ancak sunucu tarafı sonuçları daha ciddi:

‘Bir pertürbe edilmiş belge, bir arama motorunun crawler tarafından crawled olabilir, ancak pertürbasyonlardan etkilenen terimlerle indekslenecektir, bu da arama yapıldığında görünme olasılığını azaltacaktır. Böylece, belgeleri arama motorlarından “görünmez” bir şekilde gizlemek mümkün.’

‘Örneğin, bir şirket, finansal raporlarında olumsuz bilgileri gizlemek için bu yöntemi kullanabilir, böylece hisse analistlerinin kullandığı özel arama motorları bunları bulamaz.’

Görünmez karakterler saldırısı, zehirli içerik, Adlandırılmış Varlık Tanıma (NER) ve sentiment analizi modellerine karşı menos etkili olduğunu kanıtladı. Araştırmacılar, bunun, modellerin görünmez karakterler içeren verilerle eğitilmiş olmasından veya modelin tokenleştiricisinin (ham dil girişini modüler bileşenlere ayıran) zaten bunları görmezden gelmesi nedeniyle olabileceğini düşünüyor.

2: Homoglyphs

Homoglyph, başka bir karaktere benzeyen bir karakterdir – 2000 yılında bir sahte PayPal ödeme işleme alanının (PYPL ) oluşturulmasında kullanılan bir anlamsal zayıflık.

Makaledeki bir örnek, bir çevirinin anlamını değiştiren bir homoglyph saldırısı.

Makaledeki bir örnek, bir çevirinin anlamını değiştiren bir homoglyph saldırısı.

Araştırmacılar yorumluyor:

‘Kullanıcı tarafından sağlanan metinleri işleyen makine öğrenimi modelleri, özellikle bu tür bir saldırıya karşı savunmasız.’

‘Örneğin, pazar lideri Google Translate hizmetini düşünün. Yazma esnasında, “paypa” ifadesini İngilizce-Rusça modeline girerseniz, “PayPa” ifadesini doğru bir şekilde çıkarmalıdır, ancak girdideki Latin karakterini Kiril karakteri а ile değiştirirseniz, yanlış bir şekilde “папа” (“baba” ifadesini İngilizce olarak) çıkarmalıdır.’

Araştırmacılar, birçok NLP boru hattının, dilin spesifik sözlüğünün dışında karakterleri <unk> (‘bilinmeyen’) token ile değiştirdiğini, ancak zehirli metni boru hattına çağıran yazılımların, bu güvenlik önlemi devreye girene kadar bilinmeyen kelimeleri değerlendirmek için propagasyona neden olabileceğini gözlemliyor. Araştırmacılar, bunun ‘şaşırtıcı derecede büyük bir saldırı yüzeyi’ açığa çıkardığını söylüyor.

3: Yeniden Sıralama

Unicode, sağdan sola ve soldan sağa yazılmış diller için sağlama ve soldan sağa karakter sırasını işleyen Bidirectional (BIDI) algoritmasını sağlar. Bir dizede sağdan sola ve soldan sağa karakterleri karıştırma, Unicode’un BIDI’yi özel kontrol karakterleriyle geçersiz kılmasına izin veriyor.

Makaledeki bir örnek, bir çevirinin karakter sırasını değiştiren bir saldırı.

Makaledeki bir örnek, bir çevirinin karakter sırasını değiştiren bir saldırı.

Araştırmacılar, makaleyi yazarken, bu yöntemin Chromium web tarayıcısı, Google Chrome tarayıcısı, Microsoft Edge tarayıcısı ve diğer birçok tarayıcı için etkili olduğunu söylüyor.

Ayrıca: Silme

Bu saldırı, bir geri alma veya metni etkileyen başka bir kontrol/komutu temsil eden bir karakteri içerir ve dil okuyucu sistemi tarafından metin makrosu gibi uygulanır.

Araştırmacılar gözlemliyor:

‘Unicode’de birkaç kontrol karakteri, komşu metni silebilir. En basit örnekler, geri alma (BS) ve silme (DEL) karakterleridir. Ayrıca, metin oluşturma algoritmasının satırın başına dönmesine ve içeriğini üzerine yazmasına neden olan bir satır dönüşü (CR) vardır.’

‘Örneğin, “Hello CR Goodbye World” ifadesini temsil eden kodlanmış metin, “Goodbye World” olarak 렌der edilir.’

Araştırmacılar, bu saldırının, tamamen etkili olması için muhtemelen panoya kopyalanan ve panodan sistemli bir şekilde alınan metinler aracılığıyla erişimi gerektirdiğini söylüyor.

Araştırmacılar onu test etti ve diğer üç yöntemle benzer bir performans sergiledi. Ancak ilk üç yöntem, belgeleri veya web sayfalarını (arama motorlarına ve web kazıma NLP boru hatlarına karşı bir saldırı durumunda) yükleyerek uygulanabilir.

Silme saldırısı, preceding metni siliyor veya single-line metni ikinci bir paragrafa zorluyor.

Silme saldırısı, preceding metni siliyor veya single-line metni ikinci bir paragrafa zorluyor.

Mevcut NLP Sistemlerine Karşı Etkinlik

Araştırmacılar, beş popüler kapalı kaynak modeli ve üç açık kaynak modeli üzerinde hedefli ve hedefsiz saldırılar gerçekleştirdiler.

Araştırmacılar ayrıca ‘sünger’ saldırılarını modellere karşı test etti. Bir sünger saldırısı, NLP sistemleri için bir Hizmet Reddi (DoS) saldırısıdır, burada girdi metni ‘hesaplanamaz’ ve eğitimi kritik bir şekilde yavaşlatır – bu, normalde veri ön işleme tarafından imkansız hale getirilmesi gereken bir süreçtir.

Test edilen beş NLP görevi, makine çevirisi, toksik içerik algılama, metinsel sonuçlandırma sınıflandırması, adlandırılmış varlık tanımı ve sentiment analizi idi.

Deneyler, belirsiz bir sayıda Tesla P100 GPU’sunda, her biri Ubuntu üzerinde Intel Xeon Silver 4110 CPU ile çalışırken gerçekleştirildi. Hizmet şartlarını ihlal etmemek için, deneyler, pertürbasyon bütçesinin sıfır (etkilenmeyen kaynak metni) ile beş (maksimum bozulma) arasında tekrarlandı. Araştırmacılar, daha fazla iterasyon允許 edildiğinde daha iyi sonuçlar elde edilebileceğini iddia ediyor.

Facebook'un Fairseq EN-FR modeline karşı adversarial örneklerin uygulanması sonuçları.

Facebook’un Fairseq EN-FR modeline karşı adversarial örneklerin uygulanması sonuçları.

IBM'nin toksik içerik sınıflandırıcısına ve Google'ın Perspective API'sine karşı saldırı sonuçları.

IBM’nin toksik içerik sınıflandırıcısına ve Google’ın Perspective API’sine karşı saldırı sonuçları.

Facebook'un Fairseq modeline karşı iki saldırı.

Facebook’un Fairseq modeline karşı iki saldırı: ‘hedefsiz’ bozulmayı amaçlıyor, ‘hedefli’ ise çeviri dilinin anlamını değiştirmeyi amaçlıyor.

Araştırmacılar, sistemlerini, aynı şekilde ‘insan tarafından okunabilir’ pertürbasyon metni üretemeyen önceki çerçevelerle karşılaştırdı ve genellikle onlarla aynı düzeyde veya daha iyi performans gösterdiklerini buldu, aynı zamanda gizlilik avantajını korudular.

Tüm yöntemler, saldırı vektörleri ve hedefler boyunca ortalama etkinlik %80 civarında, çok az iterasyonla.

Araştırmacılar, sonuçları yorumlarken şunları söylüyor:

‘İmperceptible pertürbasyon saldırılarımızın belki de en endişe verici yönü, onların geniş uygulanabilirliğidir: test ettiğimiz tüm metin tabanlı NLP sistemleri bu saldırıya karşı savunmasız.’

‘Adversarial etkileri, uygulamadan uygulamaya ve modelden modele farklılık gösterebilir, ancak tüm metin tabanlı modeller, kodlanmış metin tüketir ve tüm metin, kodlama uygun şekilde kısıtlanmadıkça adversarial kodlamaya tabidir.’

Evrensel Optik Karakter Tanıma?

Bu saldırılar, temelde Unicode’deki ‘zayıflıklara’ dayanır ve bir NLP boru hattında tüm gelen metni rasterize eden ve Optik Karakter Tanıma’yı bir sanitasyon önlemi olarak kullanan bir sistemde bertaraf edilebilir. Bu durumda, insanların bu pertürbasyon saldırılarını okuduğu aynı anlamsal anlam, NLP sistemine iletilirdi.

Araştırmacılar, bu teorinin test edilmesi için bir OCR boru hattı uyguladılar, ancak BLEU (Bilingual Evaluation Understudy) puanlarının, temel doğruluğu %6,2 oranında düşürdüğünü buldular ve bu sorunun giderilmesi için muhtemelen daha gelişmiş OCR teknolojilerine ihtiyaç duyulacağını önerdiler.

Araştırmacılar, BIDI kontrol karakterlerinin girdiden varsayılan olarak çıkarılması, alışılmadık homoglyphlerin eşlenip indekslenmesi (bu ‘çarpıcı bir görev’ olarak nitelendiriliyor) ve tokenleştiricilerin ve diğer alıntı mekanizmalarının görünmez karakterlere karşı silahlandırılması gerektiğini öneriyor.

Araştırmacılar, NLP sektörünün adversarial saldırıların olasılıklarına karşı daha duyarlı hale gelmesi gerektiğini söylüyor.

‘Metin tabanlı NLP sistemleri oluşturan ve dağıtan tüm şirketlerin, uygulamalarının kötü niyetli aktörlere karşı dayanıklı olmasını istiyorsa, böyle bir savunma uygulamalarını öneriyoruz.’

 

 

* İçe aktarılan alıntıların hiperlinklere dönüştürülmesi

18:08 14 Aralık 2021 – IBM’nin yinelenen başvurusunu kaldırdım, alıntıdan otomatik dahili bağlantıyı taşıdım – MA

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai