Keamanan siber
Cara Mengamankan Data Pelatihan AI
Kecerdasan buatan (AI) membutuhkan data dan banyak sekali. Mengumpulkan informasi yang diperlukan tidak selalu menjadi tantangan di lingkungan saat ini, dengan banyak dataset publik yang tersedia dan banyak data yang dihasilkan setiap hari. Namun, mengamankannya adalah masalah lain.
Ukuran dataset pelatihan AI yang besar dan dampak model AI mengundang perhatian dari penjahat cyber. Seiring dengan meningkatnya ketergantungan pada AI, tim yang mengembangkan teknologi ini harus berhati-hati untuk memastikan mereka menjaga data pelatihan mereka tetap aman.
Mengapa Data Pelatihan AI Membutuhkan Keamanan yang Lebih Baik
Data yang Anda gunakan untuk melatih model AI mungkin mencerminkan orang, bisnis, atau peristiwa di dunia nyata. Sebagai hasilnya, Anda mungkin mengelola sejumlah besar informasi yang dapat diidentifikasi secara pribadi (PII), yang akan menyebabkan pelanggaran privasi yang signifikan jika terungkap. Pada tahun 2023, Microsoft (MSFT ) mengalami insiden tersebut, secara tidak sengaja mengungkapkan 38 terabyte data pribadi selama proyek penelitian AI.
Dataset pelatihan AI juga mungkin rentan terhadap serangan berbahaya yang lebih berbahaya. Penjahat cyber dapat mengubah keandalan model pembelajaran mesin dengan memanipulasi data pelatihannya jika mereka dapat mengaksesnya. Ini adalah jenis serangan yang dikenal sebagai pencemaran data, dan pengembang AI mungkin tidak menyadari efeknya sampai terlambat.
Penelitian menunjukkan bahwa pencemaran hanya 0,001% dari dataset sudah cukup untuk merusak model AI. Tanpa perlindungan yang memadai, serangan seperti ini dapat menyebabkan implikasi yang parah ketika model tersebut diimplementasikan di dunia nyata. Misalnya, algoritma pengemudi otonom yang rusak mungkin tidak dapat mendeteksi pejalan kaki. Alternatifnya, alat AI untuk memindai resume mungkin menghasilkan hasil yang bias.
Dalam keadaan yang kurang parah, penyerang dapat mencuri informasi propietary dari dataset pelatihan dalam tindakan spionase industri. Mereka juga dapat mengunci pengguna yang berwenang keluar dari database dan menuntut tebusan.
Seiring dengan meningkatnya kepentingan AI dalam kehidupan dan bisnis, penjahat cyber memiliki lebih banyak keuntungan dari menargetkan database pelatihan. Semua risiko ini, pada gilirannya, menjadi semakin mengkhawatirkan.
5 Langkah untuk Mengamankan Data Pelatihan AI
Mengingat ancaman-ancaman tersebut, ambil keamanan secara serius ketika melatih model AI. Berikut adalah lima langkah untuk diikuti untuk mengamankan data pelatihan AI Anda.
1. Minimalkan Informasi Sensitif dalam Dataset Pelatihan
Salah satu langkah paling penting adalah mengurangi jumlah detail sensitif dalam dataset pelatihan Anda. Semakin sedikit PII atau informasi berharga lainnya dalam database Anda, semakin sedikit targetnya bagi peretas. Pelanggaran juga akan menos parah jika terjadi dalam skenario ini.
Model AI sering tidak memerlukan penggunaan informasi dunia nyata selama fase pelatihan. Data sintetis adalah alternatif yang berharga. Model yang dilatih dengan data sintetis dapat sama akurat atau lebih akurat daripada yang lain, sehingga Anda tidak perlu khawatir tentang masalah kinerja. Pastikan saja dataset yang dihasilkan menyerupai dan berperilaku seperti data dunia nyata.
Alternatifnya, Anda dapat membersihkan dataset yang ada dari detail sensitif seperti nama orang, alamat, dan informasi keuangan. Ketika faktor-faktor tersebut diperlukan untuk model Anda, pertimbangkan untuk menggantinya dengan data dummy atau menukar antara catatan.
2. Batasi Akses ke Data Pelatihan
Setelah Anda mengompilasi dataset pelatihan, Anda harus membatasi akses ke dalamnya. Ikuti prinsip akses minimal, yang menyatakan bahwa setiap pengguna atau program hanya harus dapat mengakses apa yang diperlukan untuk menyelesaikan tugasnya dengan benar. Siapa pun yang tidak terlibat dalam proses pelatihan tidak perlu melihat atau berinteraksi dengan database.
Ingatlah bahwa pembatasan akses hanya efektif jika Anda juga mengimplementasikan cara yang dapat diandalkan untuk memverifikasi pengguna. Username dan password saja tidak cukup. Autentikasi multifaktor (MFA) sangat penting, karena dapat menghentikan 80% hingga 90% serangan terhadap akun, tetapi tidak semua metode MFA sama. MFA berbasis teks dan aplikasi umumnya lebih aman daripada alternatif berbasis email.
Pastikan untuk membatasi perangkat lunak dan perangkat, bukan hanya pengguna. Alat-alat yang hanya memiliki akses ke database pelatihan haruslah model AI itu sendiri dan program-program yang Anda gunakan untuk mengelola wawasan selama pelatihan.
3. Enkripsi dan Cadangkan Data
Enkripsi adalah langkah perlindungan lain yang sangat penting. Meskipun tidak semua algoritma pembelajaran mesin dapat secara aktif melatih data yang dienkripsi, Anda dapat mengenkripsi dan mendekripsi data selama analisis. Kemudian, Anda dapat mengenkripsi kembali setelah selesai. Alternatifnya, cari struktur model yang dapat menganalisis informasi sambil dienkripsi.
Menjaga cadangan data pelatihan Anda dalam kasus sesuatu terjadi pada data tersebut sangat penting. Cadangan harus disimpan di lokasi yang berbeda dari salinan utama. Tergantung pada seberapa kritis dataset Anda, Anda mungkin perlu menyimpan satu cadangan offline dan satu di cloud. Ingatlah untuk mengenkripsi semua cadangan juga.
Ketika datang ke enkripsi, pilih metode Anda dengan hati-hati. Standar yang lebih tinggi selalu lebih disukai, tetapi Anda mungkin ingin mempertimbangkan algoritma kriptografi tahan kuantum karena ancaman serangan kuantum meningkat.
4. Pantau Akses dan Penggunaan
Bahkan jika Anda mengikuti langkah-langkah lain, penjahat cyber dapat menembus pertahanan Anda. Oleh karena itu, Anda harus terus-menerus memantau pola akses dan penggunaan data pelatihan AI Anda.
Solusi pemantauan otomatis kemungkinan diperlukan di sini, karena sedikit organisasi yang memiliki tingkat staf untuk mengawasi aktivitas mencurigakan sepanjang waktu. Otomatisasi juga jauh lebih cepat dalam bereaksi ketika sesuatu yang tidak biasa terjadi, menyebabkan biaya pelanggaran data yang lebih rendah sebesar $2,22 rata-rata dari respons yang lebih cepat dan efektif.
Catat setiap kali seseorang atau sesuatu mengakses dataset, meminta akses, mengubahnya, atau berinteraksi dengannya. Selain mengawasi potensi pelanggaran dalam aktivitas ini, tinjau secara teratur untuk tren yang lebih besar. Perilaku pengguna yang berwenang dapat berubah seiring waktu, yang mungkin memerlukan perubahan dalam izin akses atau biometrik perilaku jika Anda menggunakan sistem seperti itu.
5. Tinjau Risiko Secara Teratur
Demikian pula, tim pengembang AI harus menyadari bahwa keamanan siber adalah proses yang berkelanjutan, bukan solusi satu kali. Metode serangan berkembang dengan cepat — beberapa kerentanan dan ancaman dapat terlewatkan sebelum Anda menyadarinya. Satu-satunya cara untuk tetap aman adalah dengan meninjau postur keamanan Anda secara teratur.
Setidaknya sekali setahun, tinjau model AI Anda, data pelatihan, dan insiden keamanan yang mempengaruhi keduanya. Audit dataset dan algoritma untuk memastikan bahwa mereka berfungsi dengan benar dan tidak ada data yang tercemar, menyesatkan, atau berbahaya yang hadir. Sesuaikan kontrol keamanan Anda sesuai dengan kebutuhan untuk apa pun yang tidak biasa yang Anda temukan.
Pengujian penetrasi, di mana ahli keamanan menguji pertahanan Anda dengan mencoba menembusnya, juga bermanfaat. Hampir semua 17% profesional keamanan siber melakukan pengujian penetrasi setidaknya sekali setahun, dan 72% dari mereka yang melakukannya percaya bahwa itu telah menghentikan pelanggaran di organisasi mereka.
Keamanan Siber adalah Kunci untuk Pengembangan AI yang Aman
Pengembangan AI yang etis dan aman menjadi semakin penting karena masalah potensial seputar ketergantungan pada pembelajaran mesin tumbuh lebih menonjol. Mengamankan database pelatihan Anda adalah langkah kritis dalam memenuhi tuntutan tersebut.
Data pelatihan AI terlalu berharga dan rentan untuk diabaikan dalam hal risiko siber. Ikuti lima langkah ini hari ini untuk menjaga model dan dataset Anda tetap aman.












