Yapay zeka modelleri ve platformları

TextFooler Algoritması NLP AI’ı Kandırıyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Doğal dil işleme algoritmaları ve sistemleri son yıllarda oldukça gelişmiş olsalar da, hala “karşıt örnek” olarak bilinen bir tür sömürüye karşı savunmasızlar. Karşıt örnekler, bir NLP sistemini beklenmedik ve istenmeyen şekillerde davranmasına neden olabilecek şekilde tasarlanmış cümlelerdir. AI programları bu tuhaf örneklerle yanlış davranmaya yönlendirilebilir ve bu nedenle AI araştırmacıları, karşıt örneklerin etkilerine karşı korumak için yollar tasarlamaya çalışıyorlar.

Çok yakın bir zamanda, Hong Kong Üniversitesi ve Singapur’daki Bilim, Teknoloji ve Araştırma Ajansı’ndan bir araştırma ekibi, karşıt örneklerin tehlikelerini gösteren bir algoritma geliştirdi. Wired’ın haberine göre, araştırma ekibi tarafından TextFooler olarak adlandırılan bu algoritma, bir cümlenin belirli kısımlarını değiştirerek, bir NLP sınıflandırıcının cümleyi nasıl yorumlayacağını etkileyebilir. Örneğin, bir cümle bir sınıflandırıcıya girildi ve sınıflandırıcı, bu cümlenin olumlu veya olumsuz bir inceleme olup olmadığını belirlemeye çalıştı. Orijinal cümle şuydu:

“Karakterler, imkansız sahte durumlara konulmuşlar ve tamamen gerçeklikten kopmuşlar.”

Bu cümle, aşağıdaki cümleye dönüştürüldü:

“Karakterler, imkansız tasarlanmış koşullara konulmuşlar ve tamamen gerçeklikten kopmuşlar.”

Bu küçük değişiklikler, metin sınıflandırıcının incelemeyi olumlu olarak sınıflandırmasına neden oldu. Araştırma ekibi, aynı yaklaşımı (bazı kelimelerin eşanlamlarıyla değiştirilmesi) çeşitli veri setleri ve metin sınıflandırma algoritmaları üzerinde denedi. Araştırma ekibi, bir algoritmanın sınıflandırma doğruluğunu %90’dan %10’a düşürebildiklerini bildirdi. Bu, insanların bu cümleleri aynı anlama sahip olarak yorumlayacağı gerçeğine rağmen gerçekleşti.

Bu sonuçlar, NLP algoritmaları ve AI’ın giderek daha fazla ve önemli görevler için kullanıldığı bir dönemde endişe verici. Karşıt örneklerin şu anda kullanılan algoritmalar için ne kadar büyük bir tehdit oluşturduğu bilinmiyor. Dünya çapındaki araştırma ekipleri hala bu etkilerin ne kadar olabileceğini belirlemeye çalışıyorlar.最近, Stanford İnsan-Merkezli AI grubu tarafından yayımlanan bir rapor, karşıt örneklerin AI algoritmalarını kandırabileceğini ve vergi dolandırıcılığı gibi suçları işlenmesine yol açabileceğini öne sürdü.

Çalışmanın bazı sınırlamaları var. Örneğin, UC Irvine’den bilgisayar bilimi yardımcı doçenti Sameer Singh, kullanılan karşıt yöntem etkili olsa da, AI’nın mimarisine ilişkin bazı bilgilere dayanmaktadır. AI’nın etkili bir şekilde sömürülebilmesi için tekrar tekrar araştırılması gerekir ve bu tür tekrarlı saldırılar güvenlik programları tarafından fark edilebilir. Singh ve meslektaşları, konuyla ilgili kendi araştırmalarını yapmışlar ve OpenAI algoritmalarının belirli tetikleyici cümlelerle karşılaştırıldığında ırkçı ve zararlı metinler üretebileceğini bulmuşlardır.

Karşıt örnekler, görsel veriler gibi fotoğraflar veya videolarla da ilgili bir sorun olabilir. Bir örnek, bir kedi fotoğrafına belirli dijital dönüşümler uygulanması ve görüntüleme sınıflandırıcının bu fotoğrafı bir monitör veya masaüstü bilgisayar olarak yorumlamasıdır. Başka bir örnek, UC Berkeley profesörü Dawn Song tarafından yapılan bir araştırmada, karşıt örneklerin bilgisayar görüşü sistemlerinin yol işaretlerini nasıl algılayabileceğini değiştirmek için kullanılabileceği bulunmuştur ve bu, otonom araçlar için potansiyel olarak tehlikeli olabilir.

Hong Kong-Singapur ekibinin yaptığı gibi araştırmalar, AI mühendislerine AI algoritmalarının hangi tür zayıflıklara sahip olabileceğini daha iyi anlamalarına ve bu zayıflıklara karşı korumak için yollar tasarlamalarına yardımcı olabilir. Örneğin, toplu sınıflandırıcılar, bir karşıt örneğin bilgisayar görüşü sistemini kandırma olasılığını azaltmak için kullanılabilir. Bu teknikte, birden fazla sınıflandırıcı kullanılır ve girdi resmine küçük dönüşümler uygulanır. Çoğu sınıflandırıcı, resmin gerçek içeriğinin yönlerini genellikle ayırt eder ve bunlar bir araya getirilir. Sonuç olarak, birkaç sınıflandırıcı kandırılsa da, çoğu kandırılmaz ve resim doğru bir şekilde sınıflandırılır.

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.