Model dan platform AI

Algoritma TextFooler Menipu NLP AI

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Sebagus apapun algoritma pemrosesan bahasa alami dan sistem telah menjadi dalam beberapa tahun terakhir, mereka masih rentan terhadap jenis eksploit yang dikenal sebagai “contoh adversarial”. Contoh adversarial adalah frasa yang dirancang dengan hati-hati yang dapat menyebabkan sistem NLP berperilaku tidak terduga dan tidak diinginkan. Program AI dapat dibuat untuk berperilaku tidak benar dengan contoh-contoh aneh ini, dan sebagai hasilnya, peneliti AI mencoba merancang cara untuk melindungi dari efek contoh-contoh adversarial.

Baru-baru ini, tim peneliti dari Universitas Hong Kong dan Badan Sains, Teknologi, dan Riset di Singapura bekerja sama untuk menciptakan algoritma yang menunjukkan bahaya contoh-contoh adversarial. Seperti yang dilaporkan oleh Wired, algoritma tersebut dinamai TextFooler oleh tim peneliti dan berfungsi dengan mengubah bagian-bagian kalimat, mempengaruhi cara klasifikasi NLP menafsirkan kalimat. Sebagai contoh, algoritma mengubah satu kalimat menjadi kalimat lain yang serupa dan kalimat tersebut dimasukkan ke dalam klasifikasi yang dirancang untuk menentukan apakah ulasan itu negatif atau positif. Kalimat aslinya adalah:

“Karakter, dipilih dalam situasi yang tidak masuk akal, adalah totally terpisah dari kenyataan.”

Itu diubah menjadi kalimat ini:

“Karakter, dipilih dalam situasi yang direkayasa, adalah fully terpisah dari kenyataan.”

Perubahan halus ini menyebabkan klasifikasi teks mengklasifikasikan ulasan sebagai positif bukan negatif. Tim peneliti menguji pendekatan yang sama (mengganti kata-kata tertentu dengan sinonim) pada beberapa dataset dan algoritma klasifikasi teks yang berbeda. Tim peneliti melaporkan bahwa mereka dapat menurunkan akurasi klasifikasi algoritma menjadi hanya 10%, turun dari 90%. Ini terjadi meskipun orang-orang yang membaca kalimat-kalimat tersebut akan menafsirkan mereka memiliki makna yang sama.

Hasil ini mengkhawatirkan dalam era di mana algoritma NLP dan AI digunakan lebih dan lebih sering, dan untuk tugas-tugas penting seperti menilai klaim medis atau menganalisis dokumen hukum. Tidak diketahui seberapa besar bahaya contoh-contoh adversarial terhadap algoritma yang saat ini digunakan. Tim peneliti di seluruh dunia masih mencoba menentukan seberapa besar dampak yang dapat mereka timbulkan. Baru-baru ini, laporan yang diterbitkan oleh Stanford Human-Centered AI group menunjukkan bahwa contoh-contoh adversarial dapat menipu algoritma AI dan digunakan untuk melakukan penipuan pajak.

Ada beberapa keterbatasan dalam studi terbaru. Misalnya, Sameer Singh, asisten profesor ilmu komputer di UC Irvine, mencatat bahwa metode adversarial yang digunakan efektif, tetapi bergantung pada beberapa pengetahuan tentang arsitektur AI. AI harus diuji berulang kali sampai grup kata yang efektif dapat ditemukan, dan serangan berulang seperti itu mungkin dikenali oleh program keamanan. Singh dan rekan-rekannya telah melakukan penelitian tentang subjek ini dan menemukan bahwa sistem lanjutan seperti algoritma OpenAI dapat menghasilkan teks yang berbahaya dan merugikan ketika dipicu oleh frasa-frasa pemicu tertentu.

Contoh-contoh adversarial juga merupakan masalah potensial ketika menangani data visual seperti foto atau video. Salah satu contoh terkenal melibatkan menerapkan transformasi digital halus pada gambar kucing, menyebabkan klasifikasi gambar menafsirkan gambar tersebut sebagai monitor atau desktop PC. Dalam contoh lain, penelitian yang dilakukan oleh profesor UC Berkeley Dawn Song menemukan bahwa contoh-contoh adversarial dapat digunakan untuk mengubah cara tanda jalan dilihat oleh sistem visi komputer, yang dapat berpotensi berbahaya bagi kendaraan otonom.

Penelitian seperti yang dilakukan oleh tim Hong Kong-Singapura dapat membantu insinyur AI memahami lebih baik jenis kerentanan yang dimiliki algoritma AI, dan merancang cara untuk melindungi dari kerentanan tersebut. Sebagai contoh, klasifikasi ensemble dapat digunakan untuk mengurangi kemungkinan bahwa contoh adversarial dapat menipu sistem visi komputer. Dengan teknik ini, sejumlah klasifikasi digunakan dan transformasi halus dilakukan pada gambar input. Sebagian besar klasifikasi biasanya dapat mengetahui aspek-aspek konten gambar yang sebenarnya, yang kemudian diagregatkan bersama. Hasilnya adalah bahwa bahkan jika beberapa klasifikasi tertipu, sebagian besar tidak akan dan gambar akan diklasifikasikan dengan benar. re used and slight transformations are made to the input image. The majority of the classifiers will typically discern aspects of the image’s true content, which are then aggregated together. The result is that even if a few of the classifiers are fooled, most of them won’t be and the image will be properly classified.

Blogger dan programmer dengan spesialisasi di Machine Learning dan Deep Learning topik. Daniel berharap untuk membantu orang lain menggunakan kekuatan AI untuk kebaikan sosial.