Sudut Anderson
Menghambat Dataset Penglihatan Komputer terhadap Penggunaan Tidak Sah

Peneliti dari Tiongkok telah mengembangkan metode untuk melindungi hak cipta dataset gambar yang digunakan untuk pelatihan penglihatan komputer, dengan efektif ‘mengawetkan’ gambar-gambar dalam dataset, dan kemudian mendekripsi ‘gambar bersih’ melalui platform berbasis cloud untuk pengguna yang berwenang saja.
Pengujian pada sistem menunjukkan bahwa pelatihan model pembelajaran mesin pada gambar yang dilindungi hak cipta menyebabkan penurunan akurasi model yang sangat besar. Pengujian pada dua dataset gambar sumber terbuka yang populer menunjukkan bahwa memungkinkan untuk menurunkan akurasi dari 86,21% dan 74,00% untuk dataset bersih menjadi 38,23% dan 16,20% ketika mencoba melatih model pada data yang tidak didekripsi.

Dari makalah – contoh, kiri ke kanan, gambar bersih, dilindungi (yaitu terganggu) dan dipulihkan. Sumber: https://arxiv.org/pdf/2109.07921.pdf
Hal ini memungkinkan distribusi luas dataset berkualitas tinggi dan mahal, dan (kemungkinan), bahkan ‘demo’ pelatihan dataset yang terganggu untuk menunjukkan fungsi aproximasi.
Autentikasi Dataset Berbasis Cloud
Makalah ini berasal dari peneliti di dua departemen Universitas Aeronautika dan Astronautika Nanjing, dan membayangkan penggunaan rutin Platform Manajemen Dataset Berbasis Cloud (DMCP), kerangka kerja autentikasi jarak jauh yang akan menyediakan validasi pra-peluncuran berbasis telemetri yang sama seperti yang telah menjadi umum dalam instalasi lokal yang membosankan seperti Adobe Creative Suite.
Gambar yang dilindungi dihasilkan melalui gangguan ruang fitur, metode serangan adversarial yang dikembangkan di Universitas Duke, Carolina Utara, pada tahun 2019.

Gangguan ruang fitur melakukan ‘Serangan Aktivasi’ di mana fitur dari satu gambar didorong ke ruang fitur gambar adversarial. Dalam kasus ini, serangan memaksa sistem pengenalan mesin pembelajaran untuk mengklasifikasikan anjing sebagai pesawat. Sumber: https://openaccess.thecvf.com
Berikutnya, gambar yang tidak dimodifikasi disematkan ke dalam gambar yang terganggu melalui pasangan blok dan transformasi blok, seperti yang diusulkan dalam makalah 2016 Pengubahan Data yang Dapat Dipulihkan dalam Gambar Terenkripsi dengan Transformasi Gambar yang Dapat Dipulihkan.
Urutan yang mengandung informasi pasangan blok kemudian disematkan ke dalam gambar sementara menggunakan enkripsi AES, kunci yang nantinya akan diperoleh dari DMCP pada saat autentikasi. Algoritma steganografi Least Significant Bit kemudian digunakan untuk menyematkan kunci. Penulis menyebut proses ini sebagai Modifikasi Transformasi Gambar yang Dapat Dipulihkan (mRIT).
Rutinitas mRIT pada dasarnya dibalik pada saat dekripsi, dengan ‘gambar bersih’ dipulihkan untuk digunakan dalam sesi pelatihan.
Pengujian
Peneliti menguji sistem pada arsitektur ResNet-18 dengan dua dataset: karya 2009 CIFAR-10, yang mengandung 6000 gambar di seluruh 10 kelas; dan TinyImageNet Stanford, subset dari data untuk tantangan klasifikasi ImageNet yang mengandung dataset pelatihan 100.000 gambar, bersama dengan dataset validasi 10.000 gambar dan dataset pengujian 10.000 gambar.
Model ResNet dilatih dari awal pada tiga konfigurasi: dataset bersih, dilindungi, dan didekripsi. Kedua dataset menggunakan optimizer Adam dengan tingkat pembelajaran awal 0,01, ukuran batch 128, dan epoch pelatihan 80.

Hasil akurasi pelatihan dan pengujian dari pengujian sistem enkripsi. Kerugian kecil dapat diamati dalam statistik pelatihan untuk gambar yang dibalik (yaitu didekripsi).
Meskipun makalah menyimpulkan bahwa ‘kinerja model pada dataset yang dipulihkan tidak terpengaruh’, hasilnya menunjukkan kerugian kecil untuk akurasi pada data yang dipulihkan dibandingkan dengan data asli, dari 86,21% menjadi 85,86% untuk CIFAR-10, dan 74,00% menjadi 73,20% pada TinyImageNet.
Namun, mengingat bahwa bahkan perubahan benih kecil (serta perangkat keras GPU) dapat mempengaruhi kinerja pelatihan, ini tampaknya merupakan pertukaran yang minimal dan efektif untuk perlindungan IP terhadap akurasi.
Lanskap Perlindungan Model
Pekerjaan sebelumnya telah berkonsentrasi terutama pada perlindungan IP model pembelajaran mesin yang sebenarnya, dengan asumsi bahwa data pelatihan itu sendiri lebih sulit untuk dilindungi: upaya penelitian 2018 dari Jepang menawarkan metode untuk menyematkan tanda air dalam jaringan saraf dalam; pekerjaan sebelumnya dari 2017 menawarkan pendekatan yang serupa.
Inisiatif 2018 dari IBM membuat penyelidikan yang paling mendalam dan berkomitmen terhadap potensi penyematan tanda air untuk model jaringan saraf. Pendekatan ini berbeda dari penelitian baru, karena mencari untuk menyematkan tanda air yang tidak dapat dipulihkan dalam data pelatihan dan kemudian menggunakan filter di dalam jaringan saraf untuk ‘mengurangi’ gangguan dalam data.

Skema IBM untuk jaringan saraf untuk ‘mengabaikan’ tanda air bergantung pada perlindungan bagian arsitektur yang dirancang untuk mengenali dan membuang bagian data yang ditandai air. Sumber: https://gzs715.github.io/pubs/WATERMARK_ASIACCS18.pdf
Vektor Pembajakan
Meskipun pengejaran kerangka kerja enkripsi dataset untuk melindungi IP mungkin tampak seperti kasus tepi dalam konteks budaya pembelajaran mesin yang masih bergantung pada tinjauan sumber terbuka dan berbagi informasi di antara komunitas penelitian global, minat berkelanjutan dalam algoritma perlindungan identitas yang menjaga privasi tampaknya akan secara berkala menghasilkan sistem yang mungkin menarik bagi perusahaan yang ingin melindungi data tertentu daripada PII.
Penelitian baru ini tidak menambahkan gangguan acak pada data gambar, tetapi pergeseran yang disengaja, dipaksa dalam ruang fitur. Oleh karena itu, proyek visi komputer untuk penghapusan tanda air dan perbaikan gambar yang saat ini ada dapat memulihkan gambar-gambar tersebut ke kualitas yang lebih tinggi yang dipersepsi manusia tanpa benar-benar menghapus gangguan fitur yang menyebabkan kesalahan klasifikasi.
Dalam banyak aplikasi penglihatan komputer, terutama yang melibatkan pelabelan dan pengenalan entitas, gambar yang dipulihkan secara tidak sah seperti itu kemungkinan masih akan menyebabkan kesalahan klasifikasi. Namun, dalam kasus di mana transformasi gambar adalah tujuan utama (seperti generasi wajah atau aplikasi deepfake), gambar yang dipulihkan secara algoritmik dapat kemungkinan masih berguna dalam pengembangan algoritma fungsional.













