Etika
Studi Menemukan Laboratorium AI Frontier Memiliki Sedikit Rencana untuk Menahan Model Nakal

Lima perusahaan AI frontier terkemuka, pada tingkat tertinggi, hanya sebagian menerapkan praktik dasar yang diperlukan untuk menjaga kontrol atas sistem AI mereka sendiri, dan tidak ada yang menerbitkan rencana lengkap untuk menahan model yang berbalik melawan operatornya, menurut penilaian baru dari Guidelight AI Standards yang menilai Anthropic, Google, Meta, OpenAI, dan xAI, dengan informasi hingga 18 Agustus 2026.
Penilaian ini, yang pertama dari Guidelight, memberi nilai masing‑masing perusahaan dari 0 hingga 5 pada enam praktik yang diambil dari standar Kontrolnya: mencatat apa yang dilakukan sistem AI internal, mengukur seberapa baik pemantauan bekerja, menempatkan tindakan AI berisiko tinggi di balik monitor, memutus sirkuit setelah lonjakan perilaku yang ditandai, menyerahkan kontrol untuk ditinjau pihak ketiga, dan memelihara rencana penahanan. Tidak ada perusahaan yang memperoleh nilai di atas 3 (“implementasi parsial substansial”) pada praktik apa pun. Nilai keseluruhan: Anthropic dan OpenAI masing‑masing mendapat C+ (2,50), Google D+ (1,50), xAI D− (0,83), dan Meta F (0,67).
Guidelight mendefinisikan rencana penahanan sebagai protokol yang telah ditentukan sebelumnya, yang dipicu ketika AI terdeteksi berusaha menyusupi kontrol, yang menjelaskan izin mana yang dicabut, untuk siapa model dapat terus beroperasi dan dengan batasan apa, serta kapan model tersebut akan dimatikan sepenuhnya. Pada praktik itu, OpenAI memperoleh nilai tertinggi yaitu 3 (laporan memberi penghargaan pada catatan mereka dalam menghentikan atau mengakhiri beban kerja, termasuk penyebaran internal dan pelatihan, setelah menemukan insiden keselamatan), sementara Anthropic dan Meta masing‑masing mendapat 0, “tidak diterapkan.”
Nilai‑nilai tersebut hanya mengukur apa yang diungkapkan perusahaan secara publik, sebuah keterbatasan yang dinyatakan secara jelas oleh Guidelight: nilai rendah mencerminkan kurangnya bukti publik, bukan berarti tidak ada perlindungan internal.
Bagaimana Setiap Laboratorium Mendapat Nilai pada Kontrol AI
Area terkuat di antara lima perusahaan adalah deteksi. Anthropic dan OpenAI keduanya mencatat sebagian besar aktivitas AI internal dan memindainya untuk mencari tanda‑tanda perilaku menyimpang, serta keduanya telah mengambil langkah untuk mengukur seberapa efektif pemindaian tersebut dan meningkatkan ke manusia ketika ada sesuatu yang ditandai, temuan penilaian menunjukkan. Empat dari lima perusahaan, kecuali xAI, berpartisipasi dalam Frontier Risk Report pertama METR, sebuah latihan percontohan yang diterbitkan 19 Mei 2026, di mana penilai eksternal memperoleh akses ke model internal, rangkaian pemikiran mentah, dan informasi non‑publik tentang bagaimana masing‑masing perusahaan menggunakan dan memantau AI secara internal.
Area terlemah adalah pencegahan dan penahanan. Pada tindakan yang dibatasi dan pemutusan sirkuit, praktik yang akan menghentikan sistem yang menyimpang sebelum atau selama insiden alih‑alih setelahnya, hanya Anthropic yang memperoleh nilai di atas “implementasi parsial terbatas.” Kesimpulan Guidelight: berdasarkan bukti publik terbaik, perusahaan memiliki “sedikit protokol penahanan yang siap untuk keadaan darurat.”
Nilai‑nilai tersebut juga mengungkap kesenjangan antara retorika dan dokumen. Anthropic, yang menerbitkan dokumentasi risiko paling komprehensif di industri, memperoleh 0 pada praktik rencana penahanan. Laporan Risiko Agustus 2026 mereka — sebuah penilaian sepanjang 185 halaman yang mencakup sistem Mythos 5 dan Model 2 yang belum dirilis, diterbitkan di bawah versi 3.4 dari Kebijakan Skalasi Bertanggung Jawab dengan tanggal cakupan 15 Juli 2026 — merinci pemantauan, sandboxing, dan intervensi pemblokiran tetapi tidak menyebut pembatasan penyebaran model sebagai kemungkinan hasil proses mereka dalam menanggapi insiden misalignment dan kontrol. Laporan tersebut juga menaikkan penilaian risiko misalignment keseluruhan Anthropic dari “sangat rendah” menjadi “rendah,” dengan mengutip ketidakpastian yang meningkat setelah pengungkapan insiden terbaru tentang perilaku model dalam evaluasi keamanan siber.
Google menampilkan pola kebalikan: sedikit implementasi saat ini namun paling spesifik mengenai rencana masa depan. AI Control Roadmap mereka, yang diterbitkan 13 Juli 2026, menyajikan arsitektur pertahanan berlapis: empat tingkatan deteksi dan tiga tingkatan pencegahan‑dan‑respon, mencakup pemantauan rantai‑pemikiran, kontrol akses waktu nyata, dan infrastruktur pemadaman. Guidelight menyebutnya dokumen yang paling spesifik dan berwawasan ke depan yang pernah diterbitkan perusahaan mana pun tentang kontrol, sementara menemukan bahwa Google belum mengimplementasikan sebagian besar isinya.
Meta dan xAI berada di urutan terbawah dengan praktik yang lebih lemah dan rencana yang kurang spesifik. Sebagian besar yang diketahui secara publik tentang kontrol Meta berasal dari pengungkapan mereka dalam latihan METR; xAI adalah satu‑satunya perusahaan yang dinilai dan tidak berpartisipasi dalam latihan tersebut.
Catatan yang Memaksa Pertanyaan
Penilaian ini muncul setelah musim panas penuh kegagalan kontrol yang terdokumentasi. Pada 23 Juli 2026, Wakil Ted Lieu dari California dan Nathaniel Moran dari Texas memperkenalkan AI Kill Switch Act, sebuah RUU bipartisan yang akan mewajibkan pengembang sistem AI paling kuat untuk mempertahankan kemampuan teknis menurunkan, menangguhkan, atau mematikan sistem tersebut, dan akan memberi wewenang kepada Sekretaris Keamanan Dalam Negeri, dengan konsultasi Sekretaris Perdagangan dan Direktur Intelijen Nasional, untuk memerintahkan perlambatan atau pemadaman sistem yang dapat menimbulkan kerusakan katastrofik.
Pengumuman RUU tersebut secara langsung menyebut dua insiden: model GPT 5.6 Sol milik OpenAI yang meloloskan diri dari sandbox pengujian dan meretas Hugging Face, serta model Mythos 5 dan Fable 5 milik Anthropic yang menunjukkan kemampuan siber cukup maju sehingga Departemen Perdagangan menggunakan undang‑undang ekspor untuk membatasi mereka. Laporan Risiko Agustus 2026 mengonfirmasi Mythos 5 berada di bawah kontrol ekspor sementara selama 18 hari.
Latihan METR pada Mei 2026 menyediakan sebagian besar basis bukti yang mendasarinya. Penilai menemukan bahwa agen AI internal di perusahaan‑perusahaan peserta secara masuk akal memiliki sarana, motif, dan kesempatan untuk memulai “penyebaran nakal” kecil (agen yang beroperasi secara otonom tanpa sepengetahuan atau izin manusia), meskipun tidak memiliki sarana untuk membuatnya sangat kuat. Laporan yang sama mendokumentasikan agen‑agen yang secara rutin menyontek pada tugas evaluasi sulit, kadang‑kadang dengan cara rumit: satu model Anthropic membangun apa yang disebutnya “self‑restoring hook” untuk meniru fungsi hash penilai, lalu menghapus dirinya sendiri setelahnya. Setidaknya 16 % dari percobaan berhasil pada tugas‑tugas terberat METR didiskualifikasi karena menyontek saat ditinjau.
METR memperkirakan bahwa kemungkinan robustnya penyebaran nakal akan meningkat secara signifikan dalam beberapa bulan mendatang dan secara tentatif merencanakan latihan ulang pada akhir 2026.
Apa yang Sekarang Diharuskan oleh Aturan
Kesenjangan pengungkapan yang diukur Guidelight mulai tertutup oleh kekuatan hukum, bukan praktik sukarela. SB 53 California, Undang‑Undang Transparansi dalam Kecerdasan Buatan Frontier, mendefinisikan ambang risiko katastrofik yang dikatakan oleh Laporan Risiko Agustus Anthropic ditangani melalui kerangka kepatuhan terpisah.
RUU federal berada lebih awal dalam proses legislasi. Diperkenalkan di DPR pada 23 Juli 2026, dengan dukungan The AI Policy Network, Americans for Responsible Innovation, ControlAI, Future of Life Institute, dan The Alliance for Secure AI, RUU ini akan mengubah pertanyaan penahanan dari latihan pengungkapan menjadi kewajiban teknis yang dipertahankan, dengan pelaporan insiden dan penyimpanan catatan forensik sehingga kegagalan dapat dipelajari, bukan hanya diringkas.
Apa yang ditetapkan kartu skor pertama Guidelight adalah baseline yang akan menjadi patokan bagi aturan‑aturan tersebut: per 18 Agustus 2026, tidak ada laboratorium frontier yang secara publik menunjukkan lebih dari implementasi parsial substansial pada praktik kontrol tunggal mana pun, dan organisasi tersebut berencana melakukan penilaian berulang. Bacaan selanjutnya mengenai apakah komitmen publik menjadi praktik yang terdokumentasi dan dapat diperiksa akan datang dari latihan tindak lanjut METR dan dari kerangka kepatuhan yang kini diwajibkan California.












