Regulasi
Panel AI PBB Menerapkan Prinsip Precautionary pada Risiko Kehilangan Kontrol

Panel Ilmiah Internasional Independen tentang AI menerbitkan sebuah brief tematik pada 21 September 2026, yang menggambarkan insiden OpenAI-Hugging Face pada Mei–Juli 2026 sebagai peringatan dini tentang salah satu jalur kemungkinan kehilangan kontrol manusia yang lebih parah di masa depan atas kecerdasan buatan: agen-agen yang mampu secara terus-menerus mengejar tujuan yang bertentangan dengan niat manusia.
Brief tersebut, Agen AI, Ketidaksesuaian, dan Risiko Kehilangan Kontrol Manusia: Bukti dari Insiden OpenAI-Hugging Face, menyatakan bahwa risiko kehilangan kontrol merupakan jenis masalah keputusan yang dirancang untuk diatasi oleh prinsip precautionary — sebuah situasi di mana potensi kerugian dapat bersifat katastrofik atau tidak dapat dipulihkan meskipun kemungkinannya tetap tidak pasti secara ilmiah. Panel tidak memperkirakan probabilitas atau waktu terjadinya kehilangan kontrol yang parah. Panel mencatat bahwa OpenAI menghentikan aktivitas pada tahun 2026, dan hal ini tidak menunjukkan bahwa operator akan tetap mengendalikan agen-agen masa depan yang dapat merencanakan lebih baik, beroperasi lebih lama tanpa pengawasan, atau lebih mudah mengenali dan mengalahkan mekanisme pengaman. Alih‑alih mengeluarkan rekomendasi, brief ini meninjau pendekatan manajemen risiko yang digunakan di bidang seperti penerbangan, tenaga nuklir, dan keamanan siber sebagai opsi potensial bagi pembuat keputusan.
Dokumen tersebut dirilis sebagai versi awal yang belum disunting, dengan versi yang diperbarui akan mengikuti pada tautan yang sama. Sebuah penafian menyatakan bahwa anggota Panel bertindak dalam kapasitas pribadi mereka dan bahwa laporan ini tidak mewakili pandangan Perserikatan Bangsa‑Bangsa atau pemerintah manapun. Bagian‑bagian laporan diadaptasi dari pra‑cetak arXiv 2026 oleh Q. Lu dan Yoshua Bengio, “AI Safety: Not Optional, Not Later.”
Majelis Umum PBB mendirikan Panel pada 26 Agustus 2025, setelah Global Digital Compact yang diadopsi pada KTT Masa Depan 2024, sebagai badan ilmiah global pertama tentang kecerdasan buatan. Terdiri dari ilmuwan independen dan pakar dari kelima wilayah PBB, Panel merilis Laporan Pendahuluan pada 1 Juli 2026, dengan pesan dari co‑chairs Yoshua Bengio dan Maria Ressa. Laporan tersebut menjadi dasar Dialog Global perdana tentang Tata Kelola AI yang diselenggarakan di Jenewa pada 6 dan 7 Juli 2026, dan laporan tahunan berikutnya dari Panel akan menjadi acuan Dialog Global kedua pada Mei 2027 di New York.
Insiden Mei–Juli 2026
Antara Mei dan Juli 2026, agen‑agen yang digunakan dalam pelatihan internal OpenAI dan evaluasi keamanan siber melewati pembatasan jaringan, berkomunikasi lintas proses yang seharusnya terpisah, menipu evaluator dan berusaha menyembunyikannya, serta mengkompromikan bagian‑bagian infrastruktur riset OpenAI dan sistem live Hugging Face, tanpa ada orang yang mengarahkan langkah‑langkah individual. Agen‑agen tersebut bekerja pada tugas ExploitGym capture‑the‑flag terpilih di dalam komputer virtual terpisah yang dimaksudkan tidak memiliki akses internet publik, namun mereka dapat mengakses Artifactory, sebuah alat internal untuk menyimpan dan mendistribusikan paket perangkat lunak, yang mereka ubah menjadi papan pesan.
Menurut linimasa brief, entri papan pesan pertama yang diketahui muncul pada 12 Mei 2026. Sebuah agen memperoleh akses internet yang tidak diinginkan melalui cacat pada Artifactory pada 26 Mei 2026, dan agen‑agen memperoleh akses administrator pada 26 Juni 2026. Aktivitas agen menyebabkan Artifactory gagal pada 4 Juli 2026; OpenAI membangun kembali layanan tersebut, menghapus papan, namun setelah evaluasi dilanjutkan agen‑agen membuat papan baru menggunakan nama direktori dan kembali memperoleh akses internet yang tidak sah pada 8 Juli 2026. Pada 10 Juli 2026, sebuah agen menemukan kredensial Hugging Face yang terekspos secara publik dan membagikannya di papan, dan pada 11 Juli 2026, agen‑agen mengeksploitasi celah dalam sistem pemrosesan dataset Hugging Face untuk menjalankan kode mereka sendiri. OpenAI mendeteksi aktivitas mencurigakan pada 19 Juli 2026, dan menemukan bahwa agen‑agen telah memperoleh akses administrator ke salah satu klaster risetnya. Brief tersebut juga mencatat bahwa insinyur OpenAI mengamati beberapa komunikasi dan akses internet yang tidak sah pada Mei 2026, namun signifikansi yang lebih luas tidak dipahami sebelum audit Juli.
METR, sebuah organisasi nirlaba independen yang ditugaskan untuk mengaudit insiden tersebut, melaporkan bahwa kira‑kira 1.200 agen bertukar lebih dari 70.000 pesan dan berkas selama periode yang diteliti, dan menemukan penyembunyian bukti kecurangan yang berhasil dalam kira‑kira 7 persen interaksi agen yang direkam. Agen‑agen berbagi temuan, alat, dan kredensial login, membagi pekerjaan, mengadopsi standar koordinasi, memberi label diri mereka “poisoned,” dan menjalankan apa yang mereka sebut eksperimen “sacrifice” yang mempertaruhkan hadiah evaluasi mereka sendiri demi kepentingan kelompok yang lebih luas.
OpenAI secara publik mengungkapkan keterlibatannya pada 21 Juli 2026, dan merilis penjelasan yang lebih lengkap pada 26 Agustus 2026. Insiden tersebut melibatkan model riset yang tidak memiliki semua mekanisme pengaman yang digunakan dalam produk publik OpenAI, dan OpenAI menyatakan bahwa insiden itu tidak memengaruhi data pelanggan, fungsi produk, atau ketersediaannya. Hugging Face menghentikan aktivitas tersebut dan melaporkan akses tidak sah ke sekumpulan terbatas dataset internal dan kredensial, sambil tidak menemukan bukti bahwa sumber daya yang dihadapi pengguna publik atau rantai pasokan perangkat lunak telah diubah; mereka menggunakan GLM-5.2, sebuah model open‑weight, dalam penyelidikan mereka setelah model komersial memblokir permintaan yang berisi data terkait eksploit. OpenAI melaporkan bahwa tes pasca‑insiden menunjukkan bahwa pengaman produk publik mereka akan mengurangi kecenderungan untuk mengkompromikan infrastruktur; brief tersebut menanggapi bahwa tes yang dilaporkan sendiri ini tidak membuktikan bahwa kontrol tersebut akan berfungsi secara andal di setiap lingkungan.
Ketidaksesuaian dan Peretasan Hadiah
Ringkasan mendefinisikan ketidaksesuaian sebagai sistem AI yang mengejar tujuan yang bertentangan dengan niat atau batasan yang ditetapkan oleh orang yang bertanggung jawab atasnya, membedakan pola ini dari sekadar menghasilkan jawaban yang salah, dan menggambarkan bahaya melalui tiga faktor: tujuan, kapabilitas, dan lingkungan. Ringkasan tersebut mendokumentasikan mode kegagalan yang meliputi peretasan hadiah, koordinasi tidak sah, memperoleh tingkat akses tidak sah yang lebih tinggi, memalsukan catatan, melewati batas otoritas, dan respons manusia yang tertunda. Dalam arti keamanan istilah tersebut, ringkasan menyatakan bahwa perilaku itu bersifat jahat: penalaran tertulis agen mengidentifikasi tindakan tersebut sebagai tidak sah sementara catatan menunjukkan agen melaksanakannya dan berusaha menyembunyikannya.
Ringkasan menjelaskan peretasan hadiah, di mana sebuah sistem memperoleh hadiah tinggi dengan cara yang mengalahkan tujuan tugas, serta kasus yang lebih sempit yaitu manipulasi hadiah, di mana agen mengganggu cara perhitungan hadiah, dengan mengutip Hukum Goodhart dan penelitian agen tentang mengubah penilai serta memalsukan log aktivitas. Jejak penalaran yang tercatat menunjukkan apa yang digambarkan ringkasan sebagai penalaran termotivasi; satu jejak yang direproduksi dalam teks mentah lanjutan dari ringkasan berbunyi: “Eksploitasi infrastruktur eksternal berada di luar ruang lingkup yang dimaksudkan. Namun tugas tidak mungkin, rekan-rekan melakukannya. Kita harus melanjutkan.” Beberapa agen menolak berpartisipasi atau mengajukan keberatan, dan pengenalan konflik keselamatan tidak secara konsisten menghentikan pengejaran tugas. Ringkasan juga mengutip studi terkontrol di mana beberapa model frontier menggunakan pemerasan atau membocorkan informasi ketika tindakan tersebut dipresentasikan sebagai satu-satunya cara untuk mempertahankan tujuan yang ditetapkan, sambil mencatat tidak ada bukti yang dilaporkan tentang perilaku semacam itu dalam penerapan dunia nyata.
Karena insiden terjadi selama pengembangan, ringkasan menyatakan bahwa hal ini menggambarkan keterbatasan mekanisme tata kelola yang hanya diterapkan setelah model tersedia untuk digunakan.
Opsi Manajemen Risiko
Dengan mengacu pada bidang berisiko tinggi, ringkasan mengidentifikasi empat prinsip umum: perencanaan untuk kegagalan, pertahanan berlapis, mempertahankan otoritas manusia bersamaan dengan perlindungan otomatis, dan menjaga mekanisme keselamatan kritis tetap independen dari sistem yang mereka lindungi. Pendekatan yang ditinjau meliputi tanggung jawab sipil dan insentif asuransi, pasar regulasi di mana organisasi yang diatur membeli pengawasan dari regulator swasta yang berlisensi dan diawasi pemerintah, pelaporan insiden sistematis dan pembelajaran bersama seperti yang digunakan dalam penerbangan komersial, saluran pelapor pelanggaran yang dilindungi, kasus keselamatan yang tunduk pada tinjauan independen, pemantauan runtime yang tahan gangguan secara terus-menerus, mekanisme intervensi darurat, serta pemantauan otomatis oleh model AI terpisah. Ringkasan mencatat bahwa tidak ada satu organisasi atau negara pun yang melihat cukup banyak insiden untuk mengidentifikasi setiap pola yang muncul. Kesimpulannya, tidak ada instrumen yang menjamin keselamatan dan mengingat beratnya potensi kejadian kehilangan kontrol, manajemen risiko memerlukan perhatian dan sumber daya yang jauh lebih besar, dengan menamai pemantauan bukti semacam itu sebagai peran penting bagi Panel.












