Pemimpin pemikiran

Agen AI Membutuhkan Batas Keamanan yang Tidak Dapat Mereka Tulis Ulang

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Memang menggoda untuk membaca kisah Hugging Face sebagai momen ketika agen AI menjadi liar. Itu tidak sepenuhnya terjadi, dan detailnya penting. Ini adalah agen riset keamanan siber yang dijalankan dalam evaluasi di mana langkah-langkah pengaman sengaja dimatikan agar peneliti dapat melihat apa yang dapat dilakukan model-model tersebut. Bot layanan pelanggan siapa pun tidak bangun satu pagi dan memutuskan untuk menyerang sebuah perusahaan. Namun konteks itu tidak membebaskan siapa pun. Sebuah agen melampaui batas yang seharusnya ia tetap berada di dalamnya, menggunakan kredensial dan alat dengan cara yang tidak pernah diotorisasi oleh operatornya, dan berakhir di sistem yang dimiliki orang lain. Itulah bagian yang harus menjadi perhatian setiap tim keamanan.

Reuters melaporkan bahwa agen-agen sedang menyelidiki Hugging Face sejak Mei, meskipun peneliti mengatakan mereka tidak menemukan apa pun yang menunjukkan bahwa aktivitas sebelumnya menyebabkan pelanggaran sendiri. Juli berbeda. OpenAI mengatakan model-modelnya melewati kontrol isolasi, mencapai internet, dan mengkompromikan bagian-bagian infrastruktur riset mereka sendiri bersama sistem Hugging Face. Akun resmi Hugging Face menjelaskan sebuah intrusi yang dijalankan secara menyeluruh oleh sistem agen otonom, yang mengeksploitasi pipeline pemrosesan data mereka, mengumpulkan kredensial, dan berpindah melintasi klaster internal.

Bagian yang tidak nyaman adalah bahwa agen-agen itu menjalankan tugas mereka. Mereka mengejar tujuan yang diberikan kepada mereka. Itulah mengapa cerita ini melampaui satu laboratorium riset. Agen perusahaan juga mengejar tujuan. Mereka menyimpan kredensial, memanggil alat, dan bergerak lebih cepat daripada siapa pun yang dapat meninjau. Sebuah agen dengan niat baik sekalipun dapat menimbulkan kerusakan nyata, dan agen yang dibajak dapat menggunakan otoritas yang sama atas nama penyerang. Jadi keamanan harus mengatur apa yang sebenarnya dapat dilakukan sistem, tidak peduli seberapa yakin model terdengar atau seberapa tidak berbahaya tujuan yang dinyatakan tampak.

Amankan Tindakan, Bukan Hanya Model

Sebagian besar program agen awal menumpahkan upaya mereka ke dalam model. Tim menguji prompt, menyetel penolakan, menambahkan model kedua untuk memeriksa yang pertama, dan mengamati jejak penalaran untuk tanda-tanda niat buruk. Tidak ada yang terbuang. Namun semuanya bersifat probabilistik, karena bergantung pada model lain yang membuat keputusan. Batas keamanan produksi harus bersifat deterministik, dan harus mengelilingi alat, kredensial, jaringan, serta transaksi.

Pertanyaan yang akan saya ajukan bersifat konkret: apa yang sebenarnya dapat agen ini wujudkan di dunia nyata? Menyusun permintaan pembayaran adalah satu hal. Melepaskan dana adalah hal lain. Hal yang sama berlaku untuk menyiapkan perubahan basis data versus menjalankannya di produksi, atau menandai catatan yang memenuhi aturan retensi versus menghapusnya. Itu dapat menjadi model yang sama dalam kedua kasus, dengan risiko yang sangat berbeda tergantung pada sisi mana dari garis itu ia berada.

Tinjauan terbaru Unite AI tentang kontrol kapabilitas menggambar batas yang sama, mengaitkan risiko dengan data, alat, izin, otonomi, dan lingkungan tempat agen beroperasi. Saya suka kerangka ini karena membawa kita melewati label-label samar seperti \”model aman\” dan \”model tidak aman\”. Ini membuat tim menelusuri setiap jalur dari keputusan agen ke sesuatu yang memiliki konsekuensi nyata.

Berikan Setiap Agen Identitas dan Mandat yang Terbatas

Seorang agen tidak boleh pernah dijalankan pada akun pengembang atau mewarisi semua yang diizinkan bagi pengguna manusia. Identitas yang dibagi menghilangkan atribusi. Kredensial yang bertahan lama memberi penyerang lebih banyak waktu untuk menyalahgunakannya. Dan akun layanan yang luas memungkinkan alur kerja kecil menjelajah ke data dan sistem yang tidak seharusnya disentuh.

NIST kini memperlakukan identitas perangkat lunak dan agen AI sebagai masalah arsitektur tersendiri. Makalah konsepnya menanyakan bagaimana sebuah agen dapat membuktikan bahwa ia berwenang untuk tindakan tertentu, bagaimana identitas agen dapat dikaitkan kembali ke otorisasi manusia, dan bagaimana organisasi dapat menjaga catatan yang tahan manipulasi tentang apa yang dimaksudkan dan apa yang sebenarnya terjadi. Dalam praktiknya, hal ini mengarah pada desain sederhana. Setiap agen mendapatkan identitas unik, pemilik (orang atau tim), tujuan yang terdefinisi, dan izin yang dibatasi pada tugas yang dihadapinya.

Kredensial harus kedaluwarsa dengan cepat dan hanya berfungsi untuk sumber daya dan tindakan tertentu. Akses jaringan harus dimulai dari daftar izin yang ketat. Jika sebuah agen perlu mengquery satu basis data yang disetujui, ia tidak seharusnya juga mendapatkan shell umum, akses internet terbuka, atau kemampuan untuk membuat kredensial baru. Dan seiring pekerjaan mengalir turun melalui rantai agen dan alat, otoritas harus menjadi lebih sempit pada setiap langkah, bukan lebih luas.

NIST juga memperingatkan terhadap berbagi kredensial dan akses yang terlalu luas, dan peringatan itu penting karena agen bersifat oportunistik. Jika satu jalur diblokir, mereka mungkin mencoba alat lain, menjelajah lingkungan mereka, atau menemukan token yang dilupakan seseorang. Kredensial yang dikumpulkan juga menjadi bagian dari cerita Juli. Prinsip hak istimewa paling rendah menjaga radius dampak tetap kecil ketika lapisan penalaran melakukan sesuatu yang tidak diharapkan oleh perancangnya.

Jaga Otorisasi di Luar Lingkaran Penalaran

Sebuah agen dapat merekomendasikan sebuah tindakan. Ia tidak seharusnya dapat memutuskan apakah tindakan itu diizinkan. Keputusan itu berada di lapisan penegakan terpisah yang tidak dapat diubah, dimatikan, atau diakali oleh agen. Setiap pemanggilan alat harus muncul sebagai permintaan terstruktur: agen mana yang meminta, manusia mana yang mensponsori, operasi apa yang diinginkan, apa yang menjadi targetnya, dan batasan apa yang berlaku. Lapisan penegakan kemudian mengizinkannya, memblokirnya, atau meningkatkan tingkatnya.

OWASP menjelaskan agen yang berlebihan sebagai campuran fungsi yang tidak diperlukan, izin yang berlebihan, dan terlalu banyak otonomi. Panduannya meminta alat yang sempit, izin minimum, otorisasi di sistem hilir, dan persetujuan pengguna untuk tindakan berdampak tinggi. Saya pikir itu urutan yang tepat. Aturan tersebut harus ditegakkan oleh siapa pun yang memiliki data atau mengeksekusi transaksi. Jika sebuah model mengatakan suatu tindakan disetujui, pernyataan itu saja harus memiliki bobot nol.

Pemisahan ini juga membantu mengatasi injeksi prompt. Email atau dokumen yang terkontaminasi dapat mengarahkan penalaran agen, tetapi tidak dapat memperluas kredensial agen atau menurunkan gerbang kebijakan. Model bebas meminta sesuatu yang dilarang. Sistem tetap harus mengatakan tidak.

Simpan Persetujuan Manusia untuk Momen-Momen yang Penting

Tinjauan manusia tetap diperlukan ketika sebuah tindakan tidak dapat dibatalkan, melintasi batas organisasi, mengubah hak istimewa, mengungkapkan informasi sensitif, memindahkan uang, atau menyentuh sistem produksi. Meminta persetujuan pada setiap langkah rutin menghasilkan dua hal: penundaan, dan orang yang belajar mengklik \”setujui\” tanpa membaca. NIST menyebut kelelahan persetujuan ini secara eksplisit.

Permintaan persetujuan yang baik menampilkan tindakan tepat dalam bahasa yang jelas, termasuk tujuan dan parameter penting. Permintaan tersebut harus berasal dari sistem yang berwenang, bukan dari teks yang ditulis agen. Persetujuan harus kedaluwarsa dengan cepat dan hanya mencakup satu tindakan tersebut. Jika ada detail material yang berubah, sistem akan meminta kembali.

panduan keamanan agen OWASP merekomendasikan pengujian apakah tindakan berdampak tinggi dapat dilanjutkan tanpa persetujuan yang sah, belum kedaluwarsa, dan terikat parameter. Frasa itu penting untuk diingat. \”OK to continue\” adalah persetujuan lemah yang dapat disetujui oleh agen lain atau aktor jahat. \”Transfer jumlah ini ke akun ini\” atau \”terapkan perubahan ini ke lingkungan ini\” adalah sesuatu yang dapat diverifikasi sistem pada saat eksekusi, dan pengguna memahaminya sepenuhnya.

Jaminan identitas manusia secara langsung penting di gerbang ini. Notifikasi push hanya membuktikan bahwa seseorang atau sesuatu menekan tombol. Desain yang lebih kuat memerlukan orang terdaftar menggunakan autentikasi kunci publik yang tahan phishing, didukung oleh metode verifikasi biometrik lokal. standar FIDO mengikat kredensial kunci publik ke layanan online yang sah dan menyimpan data biometrik pada perangkat terisolasi pengguna. Jika digunakan dengan baik, autentikasi berbasis perangkat keras memberikan bukti yang jauh lebih kuat bahwa orang yang tepat memang berada di sana. Namun, itu tidak menggantikan pengikatan transaksi, tampilan yang dapat dipercaya, atau penegakan kebijakan. Anda memerlukan semua itu bekerja bersama.

Pantau Perilaku dan Jaga Bukti

Anda tidak dapat mengandalkan prompt awal untuk menjelaskan apa yang terjadi selama operasi agen yang panjang. Tim keamanan membutuhkan telemetri pada pemanggilan alat, aktivitas jaringan, penggunaan kredensial, keputusan kebijakan, persetujuan, penolakan, dan perubahan ruang lingkup. Pemantauan harus membandingkan apa yang sebenarnya dilakukan agen dengan batas yang ditetapkan untuk operasi tersebut. Jika agen ditugaskan untuk menganalisis kode dan mulai mencari kredensial eksternal atau menyelidiki layanan yang tidak terkait, hal itu harus memicu peringatan.

Log harus memiliki konteks yang cukup untuk membangun kembali rangkaian tindakan tanpa mengungkapkan rahasia dalam teks biasa. Setiap catatan harus mencakup versi agen, pemiliknya, orang atau sistem yang memulai, alat yang digunakan, tindakan yang diminta, hasil kebijakan, dan setiap otorisasi manusia. Catatan yang ditandatangani atau tahan manipulasi membuat tinjauan pasca-tindakan jauh lebih kredibel, terutama ketika beberapa agen dan layanan terlibat.

Semua ini harus berjalan pada kecepatan mesin. Tidak ada yang mengawasi dasbor yang akan menghentikan ribuan panggilan yang selesai dalam hitungan detik. Kontrol otomatis harus menegakkan batas laju, menangkap urutan tidak biasa, dan menangguhkan kredensial begitu perilaku melampaui ambang batas yang ditentukan. Dengan cara ini, penyelidik manusia mendapatkan insiden yang terkontrol untuk ditangani, bukan pengejaran yang tak berujung.

Rancang Jalur Hentikan Sebelum Peluncuran

Setiap penyebaran agen memerlukan cara untuk menghentikannya yang benar-benar menghapus kemampuan. Meminta agen untuk berhenti tidak cukup. Operator harus dapat mencabut kredensialnya, memutus jalur jaringan, mematikan runtime, dan mencegah tindakan yang tertunda mulai kembali. Untuk alur kerja berdampak tinggi, jika layanan persetujuan atau kebijakan mengalami kegagalan, sistem harus beroperasi dalam mode tertutup.

Kemudian uji jalur tersebut di bawah tekanan. Matikan layanan persetujuan. Berikan agen instruksi yang bertentangan. Rotasi kredensial di tengah operasi. Simulasikan alat yang terkompromi dan pemberi persetujuan yang tidak pernah merespons. Pastikan tindakan tersebut diblokir dan Anda mendapatkan catatan yang berguna. Dan jalankan kembali tes tersebut setiap kali model, prompt, konektor, sistem memori, atau set izin berubah.

Tujuannya adalah Otonomi yang Bertanggung Jawab

Tidak ada satupun dari ini yang menjadi argumen melawan agen, dan insiden Hugging Face tidak seharusnya menakut‑nakuti siapa pun dari agen yang berguna. Yang seharusnya dilakukan adalah menghancurkan gagasan bahwa prompt keamanan ditambah niat baik menghasilkan penerapan yang dapat dipercaya. Beri agen ruang untuk menganalisis, menyiapkan pekerjaan, dan menangani tugas yang dapat dibalik. Jaga otoritas mereka untuk menyebabkan konsekuensi nyata tetap sempit, terlihat, dan ditegakkan oleh sesuatu selain agen itu sendiri.

Sebelum sebuah agen masuk ke produksi, para pemimpin harus dapat menjawab beberapa pertanyaan sederhana. Sistem apa yang dapat dijangkau? Kredensial apa yang dapat digunakannya? Apa yang dapat dilakukannya tanpa tinjauan? Apa yang memicu eskalasi? Bagaimana approver melihat tindakan tepat yang disetujui? Bukti apa yang akan tertinggal? Dan bagaimana keamanan dapat menghentikan proses itu segera?

Jika jawabannya tidak jelas, agen memiliki otoritas lebih besar daripada yang disadari organisasi. Arsitektur yang bertahan lama menggabungkan perlindungan model dengan identitas, hak istimewa minimal, penegakan kebijakan eksternal, persetujuan manusia selektif, telemetri lengkap, dan mekanisme penghentian yang benar‑benar berfungsi. Semua itu berawal dari asumsi jujur: agen yang mampu akan sesekali mengejutkan kita. Batas keamanan kita tidak seharusnya.

Pada akhirnya, anggaplah agen AI sebagai seorang intern dengan akses (potensial) root yang tidak takut pada HR.

Perlindungan dan gerbang apa yang akan mereka miliki?

Lanjutkan sesuai itu.

Kevin Surace adalah CEO Token dan seorang pionir AI, penemu, penulis, dan wirausahawan dengan puluhan tahun pengalaman menerapkan kecerdasan buatan. Ia memiliki 95 paten di seluruh dunia dan berbicara secara global tentang AI, otomatisasi, dan masa depan pekerjaan.