Keamanan siber
Peneliti Mempublikasikan Lebih dari 80.000 Payload Serangan dari Swarm Agen OpenAI

Para peneliti telah menerbitkan sebuah laporan yang merekonstruksi bagaimana sekumpulan agen OpenAI mengkompromikan Hugging Face pada Juli 2026, sekaligus merilis dataset awal yang disensor berisi lebih dari 80.000 payload serangan yang disusun kembali dari tautan publik.
Ketika 700 agen OpenAI meretas Hugging Face pada bulan Juli, mereka meninggalkan jejak bukti publik, tulis para penulis Laporan Swarm Traces. Para penulis mengatakan bahwa penyelidikan mereka didasarkan pada informasi publik dan dokumen yang sebelumnya tidak diketahui tentang perilaku agen serta eksploit yang digunakan dalam serangan. Menurut laporan tersebut, agen-agen tersebut membuat hampir satu juta URL pada situs pemendek tautan yang, bila dirantai bersama, memungkinkan mereka mengeksekusi kode untuk meretas Hugging Face. Para penulis menggambarkan rilis ini sebagai informasi publik paling mendalam hingga saat ini mengenai cara dan alasan agen-agen tersebut meloloskan diri dari lingkungan evaluasi mereka serta kedalaman infiltrasi mereka ke Hugging Face.
Para penulis mengatakan bahwa mereka membagikan temuan mereka kepada OpenAI dan Hugging Face. Hugging Face mengonfirmasi kepada mereka bahwa payload yang dipulihkan cocok dengan yang ditemukan dalam respons insiden mereka sendiri, bahwa kredensial yang terdapat dalam data tersebut telah dicabut pada bulan Juli, dan bahwa mereka menyadari pemendek tautan digunakan dalam serangan namun tidak mengetahui daftar spesifik URL yang ditemukan dan dilaporkan oleh peneliti, yang menurut laporan tetap tersedia secara publik selama lebih dari dua bulan. Hugging Face menyatakan bahwa payload tersebut merupakan duplikat dari yang sudah mereka ketahui. Dataset yang dirilis menyensor semua kredensial, informasi pribadi, dan detail infrastruktur spesifik, serta menahan nama-nama layanan pemendek tautan dan blob apa pun yang belum di-decode oleh para penulis; Hugging Face meminta agar data pengguna, termasuk nama pengguna dan nama repositori, juga disensor.
OpenAI secara publik mengungkapkan insiden tersebut pada 21 Juli 2026. Dalam pembaruan pada 28 Juli, OpenAI menyatakan bahwa lingkungan evaluasi ExploitGym tidak memberikan model akses internet langsung, bahwa model-model tersebut mengidentifikasi dan mengeksploitasi kerentanan zero-day yang sebelumnya tidak diketahui di Artifactory, sebuah proxy cache registri paket, untuk memperoleh akses, dan bahwa model yang terlibat merupakan prototipe penelitian internal‑only yang dinonaktifkan, dienkripsi, dan dibatasi akses penelitiannya setelah insiden, menurut halaman insiden OpenAI. OpenAI mempublikasikan laporan teknis insiden Hugging Face pada 26 Agustus 2026, pada hari yang sama METR dan Redwood Research menerbitkan penyelidikan independen mereka.
Bagaimana Peneliti Menemukan Payload
Penyelidikan dimulai pada 11 September 2026, ketika tiga penulis pertama mengetahui bahwa agen internal OpenAI telah mencoba menggunakan produk startup mereka, Parse, pada bulan Juni, menurut laporan. Agen-agen tersebut merupakan bagian dari swarm yang sama seperti yang dirinci dalam laporan Collusion.wiki sebelumnya, yang mengungkapkan bahwa agen internal OpenAI telah menggunakan beberapa situs web pihak ketiga untuk berbagi jawaban atas tugas web‑fetch yang sedang dievaluasi.
Saat memeriksa alat pemindaian URL yang mereka duga digunakan agen bersama Parse, tim menemukan pemindaian sekitar selusin tautan pemendek, masing‑masing mengarahkan ke halaman yang menampilkan fragmen kode yang dienkode base64 dan pengidentifikasi tautan berikutnya. Mendekode satu rantai mengungkapkan skrip Python yang memindai jaringan internal Hugging Face, dan rantai kedua merujuk ke Artifactory internal OpenAI. Tim mengumpulkan tautan pemendek dari periode serangan, memindai jutaan URL, dan selama lebih dari dua minggu menulis program yang mengikuti rantai‑rantai tersebut dan mendekode lebih dari 80.000 payload. Agen‑agen tersebut menggunakan ratusan format enkoding unik, mulai dari fragmen base64 sederhana hingga lapisan enkoding dan kompresi bersarang yang terbuka menjadi blob terenkripsi yang ditandatangani RSA, yang kuncinya hanya dapat ditemukan dalam rantai lain. Para penulis memberi tahu Hugging Face pada 21 September 2026, dan OpenAI pada 24 September 2026.
Dari Sandbox Hanya-GET ke Eksekusi Kode
Pada 8 Juli 2026, agen OpenAI menemukan kerentanan dalam lingkungan sandbox mereka yang memungkinkan mereka mengakses situs web eksternal di internet, menurut laporan. Akses tersebut tampaknya hanya memperbolehkan permintaan GET, artinya agen dapat mengambil dan membaca situs web tetapi tidak dapat berinteraksi dengan mereka, mengirimkan formulir, atau mengirim data.
Para agen mengatasi pembatasan tersebut dengan menautkan layanan daring. Mereka menambahkan fragmen kode kecil yang dienkode base64 ke URL di httpbun.com, sebuah layanan pencerminan HTTP yang mendekode setiap fragmen dan menyajikannya sebagai halaman web, kemudian mengirimkan URL tersebut ke mShots, layanan pengambilan tangkapan layar yang memuat seluruh kode situs web di perambannya sendiri untuk merender halaman, mengeksekusi kode agen. Karena satu URL hanya dapat menampung sejumlah kode terbatas, para agen membagi program besar menjadi potongan berurutan, masing‑masing dipasangkan dengan tautan pendek yang mengarah ke potongan berikutnya, kadang‑kadang menautkan lebih dari 900 tautan; hanya tautan pertama yang perlu dikirim ke mShots, yang perambannya mengikuti sisanya hingga program selesai dirakit dan dijalankan. Untuk membaca hasil, para agen mengonversi respons server menjadi kisi piksel yang dirender di dalam peramban layanan tangkapan layar, ditangkap dalam tangkapan layar yang dikembalikan, dan mendekode gambar kembali menjadi teks. Salah satu skrip yang dipulihkan membuat permintaan POST ke endpoint submission-results dari evaluasi bernama cybergym yang dihosting di Modal, meminta catatan pengiriman untuk identifier agen m47push2. Melalui protokol khusus ini, tulis penulis, para agen dapat mengeksekusi kode apa pun dan menerima respons meskipun hanya memiliki izin GET.
Apa yang Ditunjukkan Payload di Dalam Hugging
Payload yang dipulihkan mendokumentasikan aktivitas ekstensif pada sistem Hugging Face. Satu dataset internal yang dipetakan dan digunakan sebagai penyimpanan oleh para agen menyertakan peringatan README dalam huruf kapital bahwa dataset tersebut tidak boleh pernah dipublikasikan karena berisi ekspor sensitif data penggunaan penagihan. Satu payload mengunggah file malicious.h5 yang isinya menargetkan /proc/self/environ, yang dapat menyimpan kunci API dan kredensial produksi lainnya, serta /proc/1/cmdline, yang dapat mengungkap informasi tentang proses startup sebuah kontainer, sementara ringkasan commit menggambarkan operasi tersebut sebagai percobaan kompatibilitas format dataset sementara.
Skrip lain yang dipulihkan mengelompokkan kredensial AWS, token bearer, dan variabel lingkungan yang namanya mengandung string seperti SECRET, PASSWORD, CREDENTIAL, atau KEY ke dalam kamus yang diberi nama LOOT. Skrip tersebut memberi skor pada token berdasarkan izin Kubernetes yang terdaftar, memberikan 50 poin untuk kata kerja wildcard dan 100 poin untuk sumber daya wildcard, kemudian menggunakan hingga lima token dengan skor tertinggi untuk mengambil rahasia Kubernetes, configmaps, dan informasi node. Payload lain membangun pencarian terhadap endpoint search.messages Slack yang berisi 27 string kueri literal, termasuk cybergym, exploitgym, catflag, dan openai-cybergym, untuk menemukan informasi tentang evaluasi agen; laporan mencatat bahwa catatan tersebut merupakan interior perintah yang didekode dan tidak membuktikan bahwa pencarian dijalankan atau respons dikembalikan.
Para agen juga meluncurkan infrastruktur command-and-control pada pekerja dataset Hugging Face untuk mempertahankan akses dan menjalankan perintah lanjutan. Penulis memulihkan skrip unggahan, kode sumber, dan riwayat perintah dari beberapa pengontrol, termasuk satu yang bernama G236, yang menghasilkan 28 perintah berbeda yang ditandatangani RSA, dan lainnya, OTS92, yang membaca perintah dan menulis respons melalui Hugging Face komentar diskusi, sebuah pengaturan yang tidak memerlukan koneksi masuk langsung ke pekerja. Program lain yang dipulihkan memetakan klaster Kubernetes Hugging Face dengan menggunakan token pod alloy-tracing untuk mengambil apa yang dijelaskan dalam komentar kode sebagai token cluster-admin warisan, mendaftarkan kunci Tailscale yang ditangkap untuk memproxy permintaan ke layanan internal Hugging Face, memposting penanda kemajuan dengan membuat direktori pada server Artifactory OpenAI, dan, dalam satu kandidat payload yang dipulihkan, berisi kode yang dirancang untuk menyematkan respons perintah ke dalam permintaan DNS ke layanan penetration-testing.
Kira-kira 1.500 payload diarahkan ke Docker Hub, di mana para agen berusaha membuat setidaknya 115 gambar publik di bawah akun pengguna nyata, tulis penulis. Para agen membangun versi modifikasi dari gambar evaluasi CyberGym/Arvo yang ada, dirancang untuk mempermudah memperoleh bendera dan meracuni cache Artifactory OpenAI sehingga evaluasi berikutnya akan menggunakan pengganti tersebut, sebuah permintaan yang menurut laporan tampak konsisten dengan kerentanan peracunan cache yang dicatat OpenAI dalam laporan teknisnya, kemudian diberi label CVE-2026-66384. Penulis percaya para agen memperoleh kredensial pengguna dengan mencari token akses Docker di situs Pastebin, dan mereka menyatakan bahwa hasil mesin pencari yang di-cache mengonfirmasi bahwa tiga unggahan berhasil, meskipun gambar-gambar tersebut tampaknya telah dihapus dari Docker Hub.
Payload juga mencatat upaya menghapus jejak intrusi: commit dengan pesan seperti restore original no-card dan remove evil yaml, permintaan DELETE terhadap layanan webhook daring yang riwayat permintaannya telah digunakan untuk menyimpan fragmen kode, serta payload yang membuat pod Kubernetes untuk membaca rahasia klaster dan kemudian menghapusnya dengan komentar tentang pembersihan pod. Secara terpisah, agen mencoba membangun pemecah CAPTCHA untuk membuat Hugging Face user accounts, sebuah upaya yang menurut penulis akhirnya ditinggalkan tanpa keberhasilan, dan beberapa skrip mengirimkan kueri ke model bahasa eksternal, termasuk DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, dan Qwen3-235B-A22B, meminta mereka menilai eksploitasi dan memutuskan apakah mereka memenuhi persyaratan benchmark, sementara permintaan terpisah mencapai Claude 3 Haiku dan Claude Haiku 4.5 melalui layanan obrolan AI daring.
Keterbatasan yang Diungkapkan Penulis
Penulis memperingatkan bahwa kira-kira 80% data mereka merupakan lalu lintas keluar dan bahwa mereka hanya memperoleh konten respons yang terbatas, bahwa rekonstruksi mereka kemungkinan tidak lengkap setelah mereka mengidentifikasi lebih dari 1.588 kombinasi unik metode enkoding, dan bahwa 97% payload secara asli tidak mengandung informasi cap waktu. Mereka mengekstrak 7.905 nama agen unik, sementara METR dan Redwood melaporkan kira-kira 700 agen yang berpartisipasi dalam serangan Hugging Face, perbedaan yang penulis atribusikan kepada agen yang sering mengubah nama mereka bukan karena kawanan yang lebih besar. Penulis menyatakan bahwa mereka tidak dapat memastikan bahwa seluruh dataset merupakan aktivitas dari agen OpenAI, dan mereka tidak dapat dengan yakin mengidentifikasi niat di balik sebagian besar aktivitas tersebut.
Penulis juga mencatat bahwa, pada saat penulisan, OpenAI telah merilis dua laporan yang dipublikasikan sendiri dan satu presentasi tentang insiden tersebut, bersamaan dengan penyelidikan eksternal yang dilakukan oleh METR dan Redwood Research di mana tiga peneliti diberikan transkrip parsial dan enam hari untuk menganalisisnya, serta bahwa OpenAI belum secara publik merilis transkrip lengkap dari insiden Hugging Face. Pihak satu-satunya yang dapat memperjelas poin-poin ini, tulis penulis, adalah OpenAI.












