Anderson’un Açısı

Neden Adversarial Görüntü Saldırıları Şaka Değil

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Görüntü tanıma sistemlerini özenle hazırlanmış adversarial görüntülerle saldırmanın, son beş yıldır sadece bir prova olarak kabul edildiği düşünülüyordu. Ancak Avustralya’dan yapılan yeni bir araştırma, ticari AI projeleri için yaygın olarak kullanılan popüler görüntü verisetlerinin casual kullanımının, uzun vadeli yeni bir güvenlik sorunu yaratabileceğini öne sürüyor.

 

Şimdiye kadar, Adelaide Üniversitesi’ndeki bir grup akademisyen, AI tabanlı görüntü tanıma sistemlerinin geleceği hakkında gerçekten önemli bir şeyi açıklamaya çalışıyor.

Bu, şu an için (ve çok pahalı olacak) çözülmesi zor bir sorun ve 5-10 yıl içinde görüntü tanıma araştırmalarındaki mevcut trendlerin tamamlanmasıyla endüstriyel olarak ticari olarak dağıtıldığında, onarımları çok daha pahalı olacak.

Önce, ekibin yayınladığı altı videodan birinden, bir çiçeğin Başkan Barack Obama olarak sınıflandırıldığını görelim: proje sayfası

Kaynak: https://www.youtube.com/watch?v=Klepca1Ny3c

Kaynak: https://www.youtube.com/watch?v=Klepca1Ny3c

Yukarıdaki görüntüde,明显 olarak Barack Obama’yı tanıyabilen bir yüz tanıma sistemi, anonim bir erkeğin göğsünde, omzunda değil, bir çiçeğin özenle hazırlanmış adversarial görüntüsünü 80% güvenle Barack Obama olarak tanıyordu.

Her ne kadar araştırmacıların, genellikle rastgele gürültü yerine, tutarlı bir görüntü (bir çiçek) oluşturarak bu tür bir kimlik yakalama gerçekleştirebilmesi etkileyici olsa da, bu tür komik saldırılar bilgisayar vizyonu güvenlik araştırmalarında oldukça sık ortaya çıkıyor.

Örneğin, 2016 yılında yüz tanıma sistemlerini kandıran garip desenli gözlükler veya yol işaretlerini değiştirmeye çalışan özel olarak hazırlanmış adversarial görüntüler.

Eğer ilgileniyorsanız, yukarıdaki örnekte saldırıya uğrayan Convolutional Neural Network (CNN) modeli VGGFace (VGG-16) ve Columbia Üniversitesi’nin PubFig veriseti üzerinde eğitilmiştir. Araştırmacılar tarafından geliştirilen diğer saldırı örnekleri farklı kaynakları farklı kombinasyonlarda kullanmıştır.

WideResNet50 modelinde bir klavye bir burgu olarak sınıflandırılıyor. Araştırmacılar, modelin burgulara karşı önyargılı olmadığını da garantilemiştir. https://www.youtube.com/watch?v=dhTTjjrxIcU adresindeki tam videoyu uzatılmış ve ek demonstrasyonlar için görün.

WideResNet50 modelinde bir klavye bir burgu olarak sınıflandırılıyor. Araştırmacılar, modelin burgulara karşı önyargılı olmadığını da garantilemiştir. https://www.youtube.com/watch?v=dhTTjjrxIcU adresindeki tam videoyu uzatılmış ve ek demonstrasyonlar için görün.

Görüntü Tanıma Saldırı Vektörü Olarak Ortaya Çıkıyor

Araştırmacıların ortaya koyduğu etkileyici saldırılar, bireysel verisetleri veya bunları kullanan belirli makine öğrenimi mimarilerini eleştirmiyor. Bunlara karşı kolayca savunma yapmak da mümkün değil; modeli yeniden eğitmek, verisetini değiştirmek veya diğer “basit” çözümler, makine öğrenimi uygulayıcılarının bu tür hilelere karşı küçümseyici bir tutum takınmasına neden oluyor.

Araştırmacıların ortaya koyduğu saldırılar, aslında tüm güncel görüntü tanıma AI geliştirme mimarisinin temel bir zayıflığını temsil ediyor; bu zayıflık, gelecekteki birçok görüntü tanıma sistemini kolayca manipülasyona açık hale getirebilir ve sonraki savunma önlemlerini zorlayabilir.

Gelecekteki güvenlik sistemlerine, yukarıdaki gibi son adversarial saldırı görüntülerinin “zero-day exploits” olarak eklendiğini hayal edin, tıpkı günümüzde anti-malware ve antivirus çerçevelerinin her gün virüs tanımlarını güncellediği gibi.

Yeni adversarial görüntü saldırılarının potansiyeli sınırsız olacaktır, çünkü sistemlerin temel mimarisi, ortaya çıkabilecek sorunları önceden görmemiştir, tıpkı internet, Milenyum Bug ve Pisa Kulesi gibi durumlarda olduğu gibi.

Bu nasıl bir sahne?

Saldırı İçin Veri Edinme

Yukarıdaki “çiçek” örneğinde olduğu gibi adversarial görüntüler, bilgisayar modellerini eğiten görüntü verisetlerine erişimi gerektirir. “Özel” erişime ihtiyacınız yok (veri veya model mimarilerine); en popüler verisetleri (ve birçok eğitilmiş model) geniş bir şekilde mevcuttur ve sürekli güncellenmektedir.

Örneğin, bilgisayar vizyonu verisetlerinin devi ImageNet, Torrent aracılığıyla tüm varyantlarında mevcuttur, kısıtlamalarını atlatarak, doğrulama kümeleri gibi ikincil öğeleri sağlar.

Kaynak: https://academictorrents.com

Kaynak: https://academictorrents.com

Eğer veriye sahipseniz, popüler bir veriseti gibi CityScapes veya CIFAR‘ı etkili bir şekilde “tersine mühendislik” edebilirsiniz.

Örneğin, önceki örnekte “Obama Çiçeği”ni mümkün kılan PubFig veriseti için, Columbia Üniversitesi, görüntü veriseti yeniden dağıtımındaki artan telif hakkı sorunlarına çözüm olarak, araştırmacılara verisetini yeniden üretme talimatları veriyor, ‘Bu, diğer büyük web tabanlı veritabanlarının da gelişme yolunda olduğu gibi görünüyor’ diyor.

Çoğu durumda, bu gerekli değil: Kaggle, tahmin ediyor ki, bilgisayar vizyonunda en popüler on görüntü veriseti: CIFAR-10 ve CIFAR-100 (her ikisi de doğrudan indirilebilir); CALTECH-101 ve 256 (her ikisi de mevcuttur ve her ikisi de hiện olarak torrent olarak mevcuttur); MNIST (resmi olarak mevcuttur, ayrıca torrent olarak); ImageNet (yukarıya bakın); Pascal VOC (mevcuttur, ayrıca torrent olarak); MS COCO (mevcuttur, ve torrent olarak); Sports-1M (mevcuttur); ve YouTube-8M (mevcuttur).

Bu durum, daha geniş bir görüntü veriseti yelpazesini de temsil etmektedir, çünkü açıklık, açık kaynak geliştirme kültüründe ölüm demektir.

Bu nasıl bir sorun?

Adversarial Görüntü Saldırı Yöntemlerinin Tipik Eleştirileri

Makine öğrenimi mühendislerinin adversarial görüntü saldırı tekniğinin etkinliğine karşı en sık ve en ısrarlı eleştirisi, saldırının belirli bir verisetine, belirli bir modele veya her ikisine özgü olduğu; genelleyiciliği olmadığı ve bu nedenle sadece küçük bir tehdit oluşturduğudur.

İkinci en sık yapılan şikayet, adversarial görüntü saldırısının ‘beyaz kutu’ olduğu, yani saldırının doğrudan eğitim ortamına veya veriye erişimi gerektirdiği yönündedir. Bu, çoğu durumda gerçekten de olası bir senaryo değildir – örneğin, Londra Metropolitan Polisi‘nin yüz tanıma sistemlerini sömürmek istiyorsanız, NEC‘e console veya balta ile sızmak zorundasınız.

Popüler Bilgisayar Vizyonu Verisetlerinin Uzun Vadeli ‘DNA’sı

İlk eleştiriye gelince, sadece birkaç bilgisayar vizyonu verisetinin endüstriyi yıl yıl domine ettiğini (yani ImageNet, CityScapes, FFHQ gibi); aynı zamanda bu verisetlerinin basit olarak etiketlenmiş görüntü verileri olarak platformdan bağımsız ve yüksek oranda transfer edilebilir olduğunu da dikkate almalıyız.

Bilgisayar vizyonu eğitim mimarilerinin tümü, ImageNet verisetindeki nesne ve sınıfların bazı özelliklerini bulacaktır. Bazı mimariler daha fazla özellik bulabilir veya diğerlerinden daha faydalı bağlantılar kurabilir, ancak tümü en azından en üst düzey özelliklerini bulacaktır:

ImageNet verileri, minimum viable sayıda doğru tanımlamalarla - 'yüksek düzey' özellikler.

ImageNet verileri, minimum viable sayıda doğru tanımlamalarla – ‘yüksek düzey’ özellikler.

Bu “yüksek düzey” özellikler, bir verisetini ayırt eder ve “parmak izi” bırakır ve uzun vadeli bir adversarial görüntü saldırısı metodolojisinin güvenilir “kancaları” oluşturur, bu da farklı sistemleri aşabilir ve “eski” verisetinin yeni araştırmalarda ve ürünlerde devam etmesiyle birlikte büyüyebilir.

Daha sofistike bir mimari, daha doğru ve granüler tanımlamalar, özellikler ve sınıflar üretecektir:

Ne var ki, bir adversarial saldırı üreticisi, bu daha düşük özelliklere (yani “Genç Beyaz Erkek” yerine “Yüz”) ne kadar çok güvenirse, farklı mimarilerde veya orijinal verisetinin farklı sürümlerinde (örneğin, bir alt küme veya filtrelenmiş küme) o kadar az etkili olacaktır.

‘Sıfırlanmış’, Ön-Eğitilmiş Modellere Adversarial Saldırılar

Peki, bir ön-eğitilmiş modeli indirip tamamen yeni veriyle kullanma durumu ne olacak?

Model zaten ImageNet gibi bir veriseti üzerinde eğitilmiştir ve geriye sadece ağırlıkları kalır, bu ağırlıklar haftalar veya aylarca eğitilmiştir ve şimdi benzer nesneleri orijinal (şimdi отсутств) veride bulunan nesneleri tanımlamaya yardımcı olmaya hazırdır.

Orijinal veri eğitim mimarisinden çıkarıldığında, geriye kalan modelin, orijinal olarak öğrendiği şekilde nesneleri sınıflandırma

Orijinal veri eğitim mimarisinden çıkarıldığında, geriye kalan modelin, orijinal olarak öğrendiği şekilde nesneleri sınıflandırma “eğilim”i, esasen birçok orijinal “imza”nın yeniden oluşmasına ve aynı eski Adversarial Görüntü Saldırı yöntemlerine karşı yeniden savunmasız kalmasına neden olacaktır.

Bu ağırlıklar değerli. Veri veya ağırlık olmadan, essentially boş bir mimariye sahip olacaksınız. Modeli sıfırdan eğitmek zorundasınız, bu da çok zaman ve hesaplama kaynağı gerektirir, tıpkı orijinal yazarların yaptığı gibi (muhtemelen daha güçlü donanım ve daha yüksek bütçe ile).

Sorun, ağırlıkların zaten oldukça iyi oluşudur. Eğitim sırasında biraz adapte olacaklar, ancak yeni verilerde orijinal veride olduğu gibi davranmaya devam edecekler, bu da bir adversarial saldırı sistemine geri dönebilecek “imza” özelliklerini üreteceklerdir.

Uzun vadede, bu da on iki veya daha eski olan ve açık kaynaklı çabalar aracılığıyla endüstriyel olarak dağıtılmış olan bilgisayar vizyonu verisetlerinin “DNA”sını korur; bu, orijinal eğitim verisi completely atıldığında da geçerlidir.

Beyaz Kutu Gerekmez

İkinci yaygın eleştiriyi ele alırsak, yeni makalenin yazarları, çiçek görüntüleri ile görüntü tanıma sistemlerini kandırmalarının, birçok mimariye aktarılabilir olduğunu bulmuşlardır.

Yazarlar, “Universal NaTuralistic adversarial paTches” (TnT) yönteminin, görüntü tanıma sistemlerini aldatmak için tanınabilir görüntüler (rastgele gürültü değil) kullanan ilk yöntem olduğunu gözlemleyerek, ayrıca şunları belirtiyorlar:

‘[TnT’ler] ImageNet verisetindeki Large-Scale Visual Recognition görevinde WideResNet50 gibi çok kullanılan sınıflandırıcılardan PubFig verisetindeki yüz tanıma görevinde VGG-face modellerine kadar, hem hedefli hem de hedefsiz saldırılarda etkili.

‘TnT’ler, Truva atı saldırı yöntemlerinde kullanılan tetikleyicilerle elde edilebilen doğalüstülük ve adversarial örneklerin genelleme ve transfer edilebilirliğini birleştirebilir.

‘Bu, zaten dağıtılan DNN’ler ve gelecekte DNN dağıtımları için güvenlik ve güvenlik endişeleri yaratıyor, çünkü saldırganlar, nöral ağ sistemlerini modeli değiştirmeden ve keşfedilme riski olmadan, doğal görünen nesne yamaları ile yönlendirebilir.’

Yazarlar, geleneksel karşı önlemlerin, örneğin bir ağın Temiz Doğruluğunu bozmak, teorik olarak bazı savunma sağlayabileceğini, ancak ‘TnT’lerin hala bu SOTA provable savunma yöntemlerini atlayabileceğini belirtiyorlar.

Mümkün diğer çözümler arasında, dağıtılmış öğrenme yer alıyor, burada katkıda bulunan görüntülerin provenansı korunuyor ve Nanjing Üniversitesi Havacılık ve Uzay Mühendisliği tarafından önerilen gibi, eğitim zamanında doğrudan “şifreleme” yapan yeni yaklaşımlar.

Bunların da önemli olacağı yerler, gerçekten new görüntü verisi üzerinde eğitim yapmaktır; şimdiye kadar, en popüler CV verisetlerindeki görüntüler ve bunlarla ilgili açıklamalar, dünya çapındaki geliştirme döngülerine o kadar derinden gömülmüştür ki, artık veri yerine yazılım gibi görünmektedirler; genellikle yıllardır önemli ölçüde güncellenmemiş yazılımlar.

Sonuç

Adversarial görüntü saldırıları, sadece açık kaynaklı makine öğrenimi uygulamaları tarafından değil, aynı zamanda ticari AI geliştirme kültürü tarafından da mümkün kılınıyor; bu kültür, already kanıtlanmış ve daha ucuz olduğu için popüler bilgisayar vizyonu verisetlerini yeniden kullanmaya motive oluyor.

Ayrıca, birçok durumda, veriler orijinal değil (CityScapes gibi değil), görüntüler, recent tartışmalarından önce toplanmış ve bu nedenle şirketler için bir tür yarı-legal limbo durumunda kalıyorlar.

 

TnT Saldırıları! Derin Sinirli Ağ Sistemlerine Karşı Evrensel Doğalüstü Adversarial Patcher Bao Gia Doan, Minhui Xue, Ehsan Abbasnejad, Damith C. Ranasinghe tarafından Adelaide Üniversitesi’nden ve Rutgers Üniversitesi Bilgisayar Bilimi Bölümü’nden Shiqing Ma ile birlikte yazılmıştır.

 

 

Güncellendi 1 Aralık 2021, 07:06 GMT+2 – düzeltme.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai