Anderson’un Açısı
Bilgisayarlı GörüNTÜ Veri Setlerini Yetkisiz Kullanıma Karşı Engelleme

Çin’den araştırmacılar, bilgisayar görüNTÜ eğitimi için kullanılan görüntü veri setlerini telif hakkı korumak için bir yöntem geliştirdiler. Bu yöntem, temelde görüntülere bir “su işareti” eklemeyi ve sonra yetkili kullanıcılar için yalnızca bulut tabanlı bir platform aracılığıyla “temiz” görüntüleri şifrelemeyi içerir.
Sistem üzerinde yapılan testler, telif hakkı korumalı görüntüler üzerinde eğitilen bir makine öğrenimi modelinin model doğruluğunda feci bir düşüşe neden olduğunu gösterdi. Araştırmacılar, iki popüler açık kaynaklı görüntü veri seti üzerinde sistemi test etti ve model doğruluğunu %86,21 ve %74,00’dan %38,23 ve %16,20’ye düşürmenin mümkün olduğunu buldular.

Makaledeki örnekler, soldan sağa, temiz, korumalı (yani bozulmuş) ve geri kazanılmış görüntüler. Kaynak: https://arxiv.org/pdf/2109.07921.pdf
Bu, yüksek kaliteli ve pahalı veri setlerinin geniş çapta dağıtılmasını ve (muhtemelen) demo eğitim oturumlarının gerçekleştirilmesini sağlar.
Bulut Tabanlı Veri Seti Kimlik Doğrulama
Makale, makale, Nanjing Havacılık ve Uzay Üniversitesi’ndeki iki bölümdeki araştırmacılardan geliyor ve Dataset Yönetim Bulut Platformu (DMCP) olarak adlandırılan bir uzaktan kimlik doğrulama çerçevesinin rutin kullanımını öngörüyor. Bu, yerel kurulumlardaki gibi ön lançman doğrulamasını sağlar.
Korumalı görüntü, özellik alanı bozulmaları yoluyla oluşturulur. Bu, Duke Üniversitesi’ndeki araştırmacılar tarafından 2019 yılında geliştirilen bir düşman saldırı yöntemidir.

Özellik alanı bozulmaları, bir ‘Aktivasyon Saldırısı’ gerçekleştirir ve bir görüntünün özelliklerini bir düşman görüntüsünün özellik alanına doğru iter. Kaynak: https://openaccess.thecvf.com
Daha sonra, değiştirilmemiş görüntü, blokları eşleştirme ve blokları dönüştürme yoluyla bozulmuş görüntüye gömülür. Bu, 2016 makale Şifreli Görüntülerde Geri Dönüştürülebilir Veri Gizleme tarafından önerilen yönteme benzer.
Blok eşleştirme bilgilerini içeren dizinin daha sonra AES şifrelemesi kullanılarak geçici bir ara görüntüye gömülür. Anahtar daha sonra kimlik doğrulama zamanında DMCP’den alınacaktır. En Az Anlamlı Bit gizleme algoritması daha sonra anahtarı gömmek için kullanılır. Araştırmacılar bu işleme Değiştirilmiş Geri Dönüştürülebilir Görüntü Dönüşümü (mRIT) diyorlar.
mRIT rutini, temelde şifre çözme zamanında tersine çevrilir ve “temiz” görüntü eğitim oturumlarında kullanılabilmesi için geri yüklenir.
Test Edilmesi
Araştırmacılar, sistemi ResNet-18 mimarisi ile iki veri seti üzerinde test etti: 2009 çalışması CIFAR-10, 10 sınıf boyunca 6000 görüntü içerir; ve Stanford’un TinyImageNet, ImageNet sınıflandırma challenge veri setinin bir alt kümesidir ve 100.000 görüntü içeren bir eğitim veri seti, 10.000 görüntü içeren bir doğrulama veri seti ve 10.000 görüntü içeren bir test veri seti içerir.
ResNet modeli, üç konfigürasyon için sıfırdan eğitildi: temiz, korumalı ve şifreli veri seti. Her iki veri seti de Adam optimizatörü, 0,01’lik bir başlangıç öğrenme oranı, 128’lik bir toplu işleme boyutu ve 80’lik bir eğitim dönemi kullanıldı.

Şifreleme sistemi üzerindeki eğitim ve test doğruluğu sonuçları. Geri kazanılmış (yani şifrelenmiş) görüntüler için eğitim istatistiklerinde küçük kayıplar gözlemlenebilir.
Makale, “geri kazanılan veri setindeki model performansı etkilenmez” diyor, ancak sonuçlar, orijinal veri ile karşılaştırıldığında geri kazanılan veri için küçük doğruluk kayıplarını gösteriyor: CIFAR-10 için %86,21’den %85,86’ya ve TinyImageNet için %74,00’den %73,20’ye.
Ancak, makine öğrenimi eğitimi performansını etkileyen küçük değişikliklere (örneğin, GPU donanımı) bakıldığında, bu bir minimal ve etkili ticaret olarak görünüyor.
Model Koruması Manzarası
Önceki çalışmalar, esas olarak makine öğrenimi modellerini korumaya odaklandı: 2018’de Japonya’dan bir araştırma, derin sinir ağlarına su işareti eklemek için bir yöntem sundu; daha önceki bir çalışma, 2017’de benzer bir yaklaşım sundu.
2018 girişimi, IBM’den geldi ve muhtemelen nöral ağ modelleri için su işareti potansiyeline yönelik en derin ve en kapsamlı araştırmayı yaptı. Bu yaklaşım, yeni araştırmadan farklı olarak, eğitim verilerine geri döndürülemez su işareti eklemeyi ve sonra nöral ağ içinde filtreler kullanarak veri bozulmalarını “indirgemeyi” amaçladı.

IBM’nin su işareti eklemek için önerdiği şema, veri setinin su işareti eklenen kısımlarını tanımlamak ve atmaktan sorumlu olan mimari kısımlarını korumaya dayanıyordu. Kaynak: https://gzs715.github.io/pubs/WATERMARK_ASIACCS18.pdf
Piracy Vektörü
Veri seti şifreleme çerçevelerini korumak için ilgi, makine öğrenimi kültürünün hala açık kaynaklı inceleme ve araştırma topluluğu arasında bilgi paylaşımına bağlı olduğu bağlamında bir kenar durumu gibi görünse de, gizlilik koruyan kimlik koruma algoritmalarına yönelik ilgi, muhtemelen belirli verileri korumak isteyen şirketler için ilgi çekici sistemler üretecektir.
Yeni araştırma, görüntü verilerine rastgele bozulmalar eklemiyor, ancak özellikli, zorla özellik alanında değişiklikler yapıyor. Bu nedenle, mevcut su işareti kaldırma ve görüntü iyileştirme bilgisayar görüntüsü projeleri, insan algıladığı daha yüksek kaliteli görüntülere “geri yüklemeye” çalışabilir, ancak bu, sınıflandırma hatalarına neden olan özellik bozulmalarını gerçekten kaldırmaz.
Bilgisayar görüntüsünün birçok uygulamasında, özellikle etiketleme ve varlık tanıma içerenlerde, bu şekilde geri yüklenen görüntüler muhtemelen hala sınıflandırma hatalarına neden olacaktır. Ancak, görüntü dönüşümlerinin temel amacı olan durumlarda (örneğin, yüz oluşturma veya deepfake uygulamaları), algoritmik olarak geri yüklenen görüntüler, işlevsel algoritmaların geliştirilmesinde hala faydalı olabilir.













