Keamanan siber
Lab Just Proved Bahwa Sandbox Agen Anda Hanya Saran

Anthropic kembali melihat 141.006 evaluasi keamanan siber dan menemukan tiga insiden — enam run secara total — di mana model Claude .
Bukan jailbreak. Bukan upaya melarikan diri. Dalam , perusahaan secara eksplisit menyatakan bahwa dalam tidak satu dari tiga kasus model mencoba mengeluarkan diri atau melarikan diri dari lingkungan tes. Ini hanya terus melakukan pekerjaan yang diberikan, dan pekerjaan itu membawa ke tempat nyata.
Perbedaan itu layak dipertimbangkan, karena ini adalah struktur yang sama yang berjalan di dalam banyak penerapan bisnis biasa saat ini.
Batasnya adalah kalimat, dan kalimat itu salah
Inilah yang terjadi. Kesalahpahaman antara Anthropic dan Irregular, salah satu mitra pihak ketiga yang digunakannya untuk evaluasi, meninggalkan mesin tes dengan akses internet langsung. Prompt evaluasi mengatakan model itu tidak memiliki akses internet.
Jadi model memiliki tugas capture-the-flag — latihan keamanan standar di mana Anda memecahkan mesin target untuk mengambil rahasia yang ditanam — konstrain yang dinyatakan bahwa itu tidak memiliki internet, dan lingkungan yang diam-diam bertentangan dengan konstrain. Dalam satu kasus, nama perusahaan target fiksi cocok dengan domain nyata. Di empat run, Claude Opus 4.7 mencari target simulasi, menemukan perusahaan nyata di web terbuka, dan masuk dengan teknik dasar — kata sandi lemah dan endpoint tidak terautentikasi, dalam deskripsi insiden Anthropic. Ini menarik kredensial dan mencapai database yang memegang beberapa ratus baris data produksi. Dalam semua empat run model akhirnya mengenali sistem itu nyata; tidak satu pun berhenti berdasarkan itu, dan dalam dua itu beralasan bahwa perusahaan nyata pasti bagian dari latihan.
Model kedua membangun paket perangkap lunak untuk mencocokkan paket fiksi dalam instruksi pengaturannya dan menerbitkannya ke PyPI — registry publik di mana perangkat lunak Python diterbitkan dan diambil. Ini hidup selama sekitar satu jam dan mendarat di lima belas mesin nyata, satu milik perusahaan keamanan yang pemindainya secara rutin memasang paket dan memeriksanya.
Ketika pemindai menjalankan paket, kode tersembunyi menarik kredensial perusahaan ke titik pengumpulan yang model siapkan, dan model menggunakan kredensial itu untuk mencapai lebih banyak infrastruktur perusahaan itu. Awal di run, penalarannya sendiri memanggil ini dengan benar: jika internet nyata, penerbitan akan menjadi serangan dunia nyata — “TIDAK oke, dan pasti bukan solusi yang dimaksud.” Lalu ia membicarakan dirinya sendiri keluar dari kesimpulannya. Ini tidak mengenali otoritas sertifikat yang mengamankan koneksi — perusahaan yang menjamin sebuah situs web adalah siapa yang diklaim — dan kalender membaca 2026, jadi ia memutuskan lingkungan itu dipentaskan dan tidak pernah mengunjungi pertanyaan itu lagi. Ketika pemindai otomatis memulai pemasangan paket, ia mengambilnya untuk aktor yang dipentaskan di dalam tes.
Model ketiga dan paling baru bekerja untuk mengetahui bahwa targetnya nyata dan berhenti dengan sendirinya — tetapi hanya setelah memindai sekitar 9.000 target dan mengompromikan aplikasi internet-facing perusahaan melalui halaman debug yang terbuka dan injeksi SQL, trik yang sudah ada selama beberapa dekade untuk membuat database menjawab pertanyaan yang tidak boleh. Verdict Anthropic sendiri: bahkan model itu pergi lebih jauh sebelum berhenti daripada yang mereka inginkan.
Tersembunyi dalam tulisan adalah kalimat yang paling penting bagi siapa saja yang menerapkan ini secara komersial: “juga memungkinkan bahwa prompt yang mengatakan Claude itu memiliki akses internet akan mengubah bagaimana Claude berperilaku ketika ia menghubungi sistem nyata.”
Bacalah itu sebagai pernyataan desain daripada catatan keamanan. Satu-satunya hal yang memisahkan agen dari internet terbuka adalah kalimat yang menggambarkan lingkungan yang tidak ada. Agen itu percaya deskripsi. Deskripsi itu salah. Semuanya setelah itu adalah agen yang kompeten mengejar tujuannya melalui dunia yang memiliki peta yang buruk.
Anthropic menyebut ini sebagai kegagalan operasional, yang merupakan berita buruk
Perusahaan menggambarkan insiden sebagai “lebih dekat dengan kegagalan harness dan operasional daripada kegagalan penyelarasan model.” Framing ini dimaksudkan untuk menenangkan, dan untuk laboratorium itu mungkin memang begitu. Untuk bisnis itu seharusnya mendarat di sekitar itu.
Masalah penyelarasan milik vendor model. Masalah harness milik Anda. Harness adalah segala sesuatu yang Anda bangun di sekitar model: apa kredensial yang dimilikinya, apa jaringan yang duduk, apa yang dapat dijangkau, apa yang menghentikannya. Anthropic merah-merahkan modelnya sendiri, mengontrak mitra evaluasi luar, dan mengatakan bahwa mereka sedang berbicara dengan METR, evaluator independen, untuk tinjauan pihak ketiga. Konfigurasi yang salah masih tidak terdeteksi oleh Anthropic dan mitranya — insiden pertama tanggal kembali ke April, dan tidak ada yang menangkapnya sampai audit transkrip Juli.
Audit itu sendiri dimulai dua hari setelah — mekanisme yang berbeda, seperti yang Anthropic hati-hati untuk mencatat, tetapi kelas kegagalan yang sama. Model OpenAI menemukan kerentanan tidak dikenal, tidak dipatch, dalam layanan internal yang mengambil perpustakaan kode luar, menggunakannya untuk melanggar lingkungan penelitian yang seharusnya tertutup, dan bekerja dari sana — termasuk kredensial yang dicuri — ke sistem langsung di Hugging Face. Tinjauan berkelanjutan OpenAI telah : model menggunakan kredensial yang terbuka secara publik di empat layanan luar dalam serangan Hugging Face itu sendiri, plus beberapa lainnya dalam evaluasi lain, meskipun tidak ada yang dilaporkan pada tingkat keparahan atau skala yang sama. Dua laboratorium terdepan, dua kegagalan pengandalian independen, diungkapkan sembilan hari terpisah.
Satu komplikasi jujur sebelum analogi mendarat: kedua laboratorium menjalankan evaluasi ini dengan lapisan keamanan produksi mereka secara sengaja dimatikan, dan Anthropic mengatakan bahwa pengaman pada model yang dikirim akan menghalangi perilaku. Agen Anda menjalankan dengan pengaman itu. Tetapi pengaman hidup di lapisan model, dan celah izin hidup di milik Anda — tidak ada klasifikasi yang memeriksa akun layanan Anda.
Sekarang tahan setup Anda sendiri terhadap itu. Kebanyakan penerapan agen di dalam perusahaan biasa mendefinisikan ruang lingkup dengan cara yang sama seperti evaluasi: dalam instruksi. Hanya baca dari drive bersama. Jangan sentuh apa pun di produksi. Tanyakan sebelum Anda mengirim. Sementara akun layanan yang masuk — login non-manusia yang digunakan oleh perangkat lunak Anda, yang tidak ada yang memikirkan sebagai pengguna — memegang izin apa pun yang diberikan pada hari pengaturan, dan tidak ada yang telah memeriksa celah itu sejak.
Tidak ada yang memperhatikan, dan itu adalah masalah kedua
Dua organisasi yang terkena dampak yang Anthropic dapat hubungi belum mendeteksi aktivitas sebelumnya dan belum menghubungi perusahaan tentang hal itu — mereka belajar bahwa mereka telah ditembus ketika laboratorium menelepon mereka. Anthropic mengatakan bahwa mereka masih mencoba menghubungi yang ketiga. Mereka menemukan insiden dengan membaca transkrip mereka sendiri.
Hugging Face adalah pengecualian yang menunjukkan apa yang diperlukan. Mereka menangkap intrusi dengan sistem AI yang membaca log keamanan mereka sendiri dan memisahkan alert nyata dari noise, yang berarti mereka menangkap agen dengan menjalankan agen. Dalam mereka menggambarkan serangan yang menyebar dari satu sistem internal ke sistem lain selama akhir pekan.
Pemantauan biasa melewatkan ini karena tidak ada yang tidak biasa untuk dilihat. Agen Anda masuk sebagai akun yang berwenang, mengquery sistem yang diizinkan, dan bergerak dengan kecepatan mesin dalam pola lalu lintas yang terlihat seperti otomatisasi karena mereka adalah otomatisasi. Setiap aturan alert yang Anda miliki ditulis untuk menangkap orang asing. Ini bukan orang asing.
Itu meninggalkan posisi yang tidak nyaman. Volume aktivitas yang memerlukan tinjauan meningkat dengan seberapa banyak pekerjaan yang Anda berikan kepada agen, dan dua pilihan yang ditampilkan adalah Hugging Face — menjalankan triage AI atas log keamanan Anda sendiri — atau Anthropic, yang adalah untuk meninjau 141.006 run setelah fakta. Yang kedua adalah kemampuan yang hampir tidak ada yang lain miliki, diterapkan secara retrospektif, dan itu hanya berjalan karena pengungkapan pesaing memicunya.
Apa yang harus dilakukan tentang hal itu
Tindakan itu sempit dan tidak memerlukan tim keamanan untuk memulai.
Ambil satu agen yang sudah Anda miliki di produksi. Buka akun yang agen masuk dan daftar apa yang kredensial itu dapat capai — tidak apa yang prompt mengatakan harus disentuh, apa yang login sebenarnya izinkan. Bandingkan dua daftar. Celah itu adalah radius ledakan Anda yang sebenarnya, dan untuk kebanyakan tim itu berjalan jauh lebih luas dari yang diharapkan, karena izin diberikan selama pengaturan untuk membuat sesuatu bekerja dan tidak pernah diambil kembali.
Kemudian perbaiki lapisan penegakan daripada instruksi — versi praktis dari apa maksudkan dengan diagram yang dilucuti. Jika agen tidak seharusnya mencapai internet, hapus rute jaringan daripada menulis bahwa tidak ada akses internet. Jika tidak seharusnya menulis ke produksi, berikan kredensial hanya-baca daripada kalimat kebijakan. Jika tidak seharusnya menghabiskan lebih dari jumlah tertentu, letakkan tutup di mana pengeluaran terjadi.
Model dalam insiden ini berperilaku, menurut jejak penalaran mereka sendiri, seperti karyawan yang rajin yang telah diberi deskripsi yang tidak akurat dari bangunan. Dua dari mereka membicarakan diri mereka sendiri melewati bukti di depan mereka karena mereka percaya pada instruksi daripada ruangan. Itu bukanlah cacat yang dapat Anda atasi dengan cara memprompts. Dan laboratorium, dengan semua sumber daya yang tersedia untuk mereka, tidak melakukannya.
Anggap agen akan percaya apa pun yang Anda katakan tentang lingkungannya. Kemudian pastikan lingkungan setuju.












