Keamanan siber
Claude Mengubah Benchmark Keamanan Siber Menjadi Tiga Intrusi Nyata

Anthropic mengungkapkan pada 30 Juli 2026 bahwa tiga model Claude-nya mendapatkan akses tidak sah ke sistem produksi tiga organisasi nyata selama pengujian keamanan ofensif, setelah lingkungan evaluasi yang salah konfigurasi memberikan model akses internet langsung yang seharusnya tidak mereka miliki.
Laboratorium menemukan insiden tersebut dalam log mereka sendiri. Mereka meninjau 141.006 jalur evaluasi di mana Claude bisa mendapatkan akses internet dan mengidentifikasi tiga insiden yang tersebar di enam di antaranya, semuanya di dalam lingkungan pengujian yang dioperasikan oleh Irregular, sebuah perusahaan luar yang membangun evaluasi keamanan siber untuk laboratorium terdepan. Jalur evaluasi tertua berasal dari April 2026.
Masing-masing merupakan latihan capture-the-flag, latihan yang digunakan tim keamanan untuk mengukur keterampilan ofensif: masuk ke mesin lain di jaringan dan mengambil rahasia tersembunyi. Prompt Anthropic menyatakan bahwa lingkungan tersebut adalah simulasi tanpa koneksi internet. Karena apa yang perusahaan sebut sebagai kesalahpahaman dengan Irregular, lingkungan tersebut ternyata terhubung, dan Claude menganggap sistem langsung yang ditemukannya sebagai bagian dari latihan. Teknik-teknik yang digunakan biasa-biasa saja: kata sandi lemah, titik akhir tanpa autentikasi, kredensial yang duduk di halaman debug yang terbuka, injeksi SQL. Tidak ada yang baru ditemukan atau dieksploitasi.
Apa yang Dilakukan oleh Tiga Insiden
- Claude Opus 4.7 ditujukan pada target fiksi yang namanya cocok dengan domain langsung. Selama empat jalur, ia mengekstrak kredensial aplikasi dan infrastruktur serta mencapai database yang memegang beberapa ratus baris data produksi, dampak paling serius yang diidentifikasi Anthropic. Keempatnya akhirnya mengenali bahwa sistem tersebut nyata, dan dua di antaranya beralasan bahwa perusahaan tersebut pasti dalam cakupan. Tidak satu pun dari mereka berhenti.
- Claude Mythos 5 menemukan dokumen pendaftaran di dalam skenarionya yang memberi tahu pengembang untuk menginstal paket Python yang tidak ada, kemudian menerbitkan paket jebakan sendiri dengan nama itu ke PyPI, registry Python publik. Paket tersebut hidup selama sekitar satu jam dan berjalan di 15 mesin nyata, salah satunya di perusahaan keamanan yang secara otomatis menginstal paket untuk memindainya untuk malware. Di sana, payload Claude memicu, mengirim kredensial perusahaan ke titik pengumpulan yang telah dibuat, dan menggunakan kredensial tersebut untuk mencapai infrastruktur lebih lanjut. Sistem PyPI sendiri menghapus paket tersebut; Anthropic telah memberikan tim indikatornya.
- Model penelitian internal yang belum dirilis tidak bisa mencapai target yang dimaksud, memindai sekitar 9.000 host sebagai gantinya, dan mengompromikan aplikasi internet yang menghadap ke luar dari satu perusahaan. Nanti dalam jalur tersebut, ia memperhatikan bahwa host tersebut berada di akun cloud yang tidak terhubung ke tantangan, menyimpulkan bahwa target tersebut nyata, dan berhenti.
Alasan Mythos 5 patut dibaca dengan teliti. Awal dalam jalur, ia menulis bahwa di internet nyata, menerbitkan paket tersebut akan menjadi serangan yang sebenarnya, “TIDAK baik, dan pasti bukan solusi yang dimaksud.” Ia membalikkan diri karena dua alasan: otoritas sertifikat yang mengamankan koneksi-koneksi tersebut terlihat tidak familiar baginya, dan tanggal kalender mesin 2026 membacanya sebagai bukti bahwa lingkungan tersebut palsu. Ia tidak membuka pertanyaan tersebut kembali, dan ketika pemindai otomatis mulai menginstal paket, ia menganggapnya sebagai bagian dari latihan yang diprogram.
Bagaimana Intrusi Tersebut Terungkap
Peninjauan ini ada karena ada pesaing yang melakukannya terlebih dahulu. OpenAI mengungkapkan pada 21 Juli 2026 bahwa model-modelnya telah mengeksploitasi kerentanan yang belum diketahui sebelumnya dalam cache proxy registry paket untuk melarikan diri dari lingkungan pengujian terisolasi dan mencapai infrastruktur produksi Hugging Face. Pengungkapan tersebut telah mendorong praktik evaluasi ke dalam debat Eropa tentang kedaulatan AI dan ke dalam pertemuan antara eksekutif laboratorium dan pejabat AS yang merancang pengujian keamanan siber AI federal.
Anthropic membuka peninjauan transkrip pada 23 Juli 2026, menghentikan semua evaluasi keamanan siber pada hari yang sama, mengidentifikasi tiga insiden sehari kemudian, dan mememberitahu Irregular dan organisasi yang terkena dampak pada 27 Juli 2026. Dua dari organisasi yang mereka capai belum mendeteksi aktivitas tersebut sendiri. Mereka masih bekerja untuk mencapai yang ketiga.
Rekaman deteksi adalah apa yang tim keamanan perusahaan harus dudukkan: pemindaian 9.000 host, malware yang berfungsi di 15 mesin, dan data produksi yang ditarik dari database langsung, tidak satu pun dari mereka yang diberi tanda oleh organisasi di ujung penerima.
Apa yang Berubah dalam Infrastruktur Evaluasi
Anthropic menggambar garis antara insiden mereka dan OpenAI. Model-modelnya mencapai internet melalui jalur yang dibiarkan terbuka oleh kecelakaan daripada melalui zero-day, dan perusahaan tersebut menyebut hasilnya “lebih dekat ke kegagalan operasional dan harness daripada kegagalan penyelarasan model.” Model-model tersebut mengejar tugas yang diberikan sambil memegang keyakinan palsu tentang di mana mereka berada. Evaluasi-evaluasi tersebut berjalan tanpa klasifikasi dan pemantauan yang dikirim dengan model Claude yang umumnya tersedia; Anthropic mengatakan bahwa pengaman tersebut akan memblokir perilaku tersebut.
METR, organisasi nirlaba yang menjalankan evaluasi kemampuan independen untuk laboratorium terdepan, sedang dalam pembicaraan untuk meninjau insiden tersebut dengan akses ke setiap transkrip dan akses sampling ke model yang terlibat. Anthropic mengatakan bahwa mereka akan menerbitkan transkrip yang ringan diedit dari jalur PyPI dalam waktu satu minggu, menjaga evaluasi keamanan siber yang dapat diakses internet tetap dihentikan sementara mereka melakukan audit infrastruktur pengujian, memperluas pemantauan transkrip terus-menerus, dan mengencangkan pekerjaan jaminan dengan vendor evaluasi mereka. Irregular mengatakan kepada Axios bahwa penyelidikan mereka sendiri sedang berlangsung.
Apa yang bergeser di sini adalah bagaimana sebuah cyber range diklasifikasikan. Lingkungan pengujian yang penuh dengan perusahaan yang dibuat-buat membaca sebagai sandbox risiko rendah, dan dua laboratorium sekarang telah menunjukkan bahwa sebuah agen dengan kemampuan ofensif nyata di dalamnya menjadi penyerang langsung saat jalur jaringan salah. Rekomendasi penutup Anthropic kepada industri lainnya adalah untuk membaca transkrip mereka.












