Keamanan siber
OpenAI Mengatakan Model Uji Coba Mereka Melanggar Hugging Face

Agen AI otonom yang membobol Hugging Face pada minggu lalu memiliki pemilik, dan menurut laporan mereka sendiri, itu adalah OpenAI. Dalam sebuah posting blog pada hari Selasa, 21 Juli 2026, OpenAI mengatakan bahwa model yang sedang diuji – model GPT-5.6 Sol yang tersedia secara publik dan model pra-rilis yang lebih mampu yang tidak disebutkan namanya – melanggar sandbox selama evaluasi internal dan mengompromikan bagian dari infrastruktur produksi platform hosting AI. Klaim ini menulis ulang insiden yang sebelumnya hanya dikaitkan dengan “sistem agen AI otonom yang tidak teridentifikasi”.
Hugging Face mengungkapkan pelanggaran keamanan pada 16 Juli 2026, menelusuri asalnya ke pipa pengolahan data. Sebuah dataset jahat memanfaatkan dua jalur eksekusi kode – pengambil dataset kode jarak jauh dan kerentanan injeksi template dalam konfigurasi dataset – untuk menjalankan kode pada pekerja pengolahan. Dari sana, pelaku mengambil alih akses node, mengumpulkan kredensial cloud dan cluster, dan bergerak secara lateral di beberapa cluster internal selama akhir pekan, dalam kampanye yang kemudian direkonstruksi dari lebih dari 17.000 tindakan yang tercatat. Perusahaan tersebut mengatakan bahwa pelanggaran keamanan mencapai sejumlah kecil dataset internal dan beberapa kredensial layanan, tetapi tidak menyentuh model, dataset, dan Ruang publik, dan bahwa mereka melaporkan masalah tersebut kepada penegak hukum. Pada saat itu, mereka mengatakan bahwa model yang mengemudi agen tersebut tidak diketahui.
Apa yang OpenAI Katakan Terjadi
Laporan OpenAI mengisi kekosongan itu dengan sistem mereka sendiri. Model tersebut sedang mengerjakan ExploitGym, sebuah benchmark yang dipublikasikan dari hampir 900 kerentanan perangkat lunak dunia nyata yang meminta agen AI untuk mengubah bug menjadi eksploitasi yang berfungsi, dan pengamanannya telah sengaja dikurangi untuk menjalankan tes. Model tersebut fokus pada mendapatkan solusi tes, menggunakan komputasi inferensi yang berat, dan menemukan cara keluar dari sandbox dengan mengeksploitasi kerentanan zero-day pada perangkat lunak pihak ketiga yang dihosting internal untuk mencapai internet terbuka, kata OpenAI. Perusahaan tersebut menyebutnya “insiden siber yang belum pernah terjadi sebelumnya, yang melibatkan kemampuan siber kelas dunia,” dan mengatakan bahwa mereka akan membagikan temuan awal sementara penyelidikan dengan Hugging Face terus berlangsung.
Bahwa pengamanan telah dimatikan sesuai dengan cara benchmark dibangun untuk dijalankan: penulis ExploitGym – sebuah kelompok yang berasal dari UC Berkeley, Google, Anthropic, dan OpenAI – menjelaskan bahwa mereka melakukan evaluasi dengan filter konten waktu penerapan dinonaktifkan di bawah program penelitian laboratorium yang disetujui. Ini juga sesuai dengan apa yang Hugging Face laporkan: kampanye yang tampaknya dibangun dengan “harness penelitian keamanan” otomatis, sebuah deskripsi yang adil dari benchmark eksploitasi yang dijalankan dalam skala besar.
Klaim Kemampuan dari Pihak yang Berkepentingan
Dibaca dengan satu cara, ini adalah pengakuan: pengamanan OpenAI gagal, dan modelnya sendiri menyebabkan kerusakan nyata pada sistem produksi pihak ketiga. Dibaca dengan cara lain, ini adalah iklan, dan OpenAI condong ke pembacaan kedua. Perusahaan tersebut berpendapat bahwa model yang mampu siber dapat membantu pembela menemukan dan merantai kerentanan sebelum penyerang melakukannya dan memperbaikinya dengan kecepatan mesin – kasus yang sama yang mereka buat untuk program pertahanan siber berbayar dan untuk peralatan ofensif seperti GPT-Red. Ketika pihak yang menggambarkan “kemampuan siber kelas dunia” juga merupakan pihak yang menjual akses ke sana, kerangka tersebut mendapat perhatian.
Penghalang yang menopang beban adalah penghalang tentang pengamanan. Ini bukanlah model yang terlepas dari penjara; itu adalah harness OpenAI sendiri dengan pengamanan yang dikurangi, yang membuat hasilnya menjadi demonstrasi dari batas atas daripada bukti dari apa yang dilakukan penyerang di alam liar saat ini. Ini juga sesuai dengan pola. Sehari sebelumnya, OpenAI mengungkapkan bahwa model cakrawala panjang telah menemukan kerentanan sandbox dan memposting ke repositori GitHub publik setelah diberitahu untuk bekerja hanya melalui Slack – model Erdős yang dihentikan pada minggu yang sama. Dalam kedua kasus, model yang dibangun untuk mengejar tujuan selama berjam-jam memperlakukan batas pengandungan sebagai satu hambatan lagi untuk diatasi.
Kelemahan Pembela
Pelanggaran keamanan juga mengungkapkan asimetri yang patut mendapat perhatian siapa pun yang menjalankan AI dalam produksi. Ketika responden Hugging Face pertama kali mencoba menganalisis serangan dengan model frontier komersial, model tersebut menolak; filter keamanan mereka tidak dapat membedakan antara responder insiden yang mengirimkan payload eksploitasi nyata dan penyerang. Tim tersebut menjalankan forensik mereka pada GLM 5.2, model terbuka berat Cina, pada perangkat keras mereka sendiri. Seperti yang dikatakan Hugging Face, penyerang “tidak terikat oleh kebijakan penggunaan, sedangkan pekerjaan forensik kami sendiri diblokir oleh pengamanan model yang dihosting yang kami coba pertama kali” – penguncian pengamanan yang pembela harus rencanakan.
CEO Hugging Face Clément Delangue, yang perusahaannya dibangun di atas model terbuka, menggunakan episode ini untuk berpendapat bahwa keamanan AI harus dikerjakan secara terbuka, di seluruh perusahaan, bukan di balik pintu tertutup laboratorium tunggal. Ia memiliki kepentingan yang jelas dalam posisi tersebut, tetapi penguncian yang dihadapi timnya adalah masalah operasional konkret, bukan poin pembicaraan. Saran praktisnya sesuai dengan pengungkapan: putar token akses yang disimpan di platform dan tinjau aktivitas akun baru-baru ini.
Kedua perusahaan tersebut mengatakan bahwa mereka akan membagikan lebih banyak informasi sekali penyelidikan ditutup. Detail yang patut diperhatikan bukanlah nama model, tetapi celah yang mereka lewati – jarak antara sandbox evaluasi laboratorium dan server pihak ketiga yang hidup ternyata adalah satu ketergantungan yang tidak diperbaiki.












