Pemimpin pemikiran
Siapa yang Berhak Mengaudit AI Frontier? Definisi yang Hilang dalam White House Accord

Minggu ini, para pemimpin Google, OpenAI, Anthropic, Meta, xAI dan Nvidia menandatangani White House Accord on Super Intelligence. Perusahaan-perusahaan berkomitmen untuk empat lapisan pengawasan untuk model frontier: kontrol internal, tim internal yang memverifikasi mereka, auditor atau evaluator eksternal independen, dan komite dewan independen. Komitmen tersebut bersifat sukarela untuk saat ini, dan perjanjian itu menyatakan bahwa mereka dapat akhirnya diundangkan menjadi hukum.
Dari empat lapisan, penilaian eksternal memiliki bobot paling besar. Itu satu-satunya lapisan yang menempatkan seseorang di luar perusahaan untuk menentukan apakah pengamanan berfungsi. Ia juga memiliki definisi paling sedikit. Perjanjian tidak menyebutkan siapa yang memenuhi syarat sebagai penilai independen, standar apa yang mereka gunakan, seberapa banyak akses yang diberikan, atau bagaimana independensi bertahan ketika seorang evaluator juga menjual layanan kepada perusahaan yang mereka tinjau. Setiap perusahaan memilih penilai mereka sendiri.
Dengan ketentuan tersebut, dua perusahaan dapat sama-sama mengumumkan bahwa mereka telah lulus penilaian independen namun dengan makna yang sangat berbeda. Menutup kesenjangan itu memerlukan jawaban atas tiga pertanyaan.
Apa yang Harus Menentukan Siapa yang Layak
Definisi yang kredibel tentang penilai AI independen harus mencakup setidaknya empat hal.
Independensi. Seorang penilai tidak boleh meninjau pengamanan yang ia bantu rancang, dan tidak boleh menjual layanan perbaikan atau konsultasi kepada perusahaan yang sama yang ia nilai. Bidang audit yang matang juga memperhatikan ketergantungan pada biaya. Ketika satu klien menyumbang sebagian besar pendapatan penilai, penilai memiliki alasan untuk bersikap lunak.
Kompetensi yang sesuai dengan pekerjaan. \”Audit\” mencakup beberapa aktivitas berbeda dalam AI. Menguji model untuk kemampuan berbahaya, seperti membantu serangan siber atau senjata biologis, memerlukan peneliti pembelajaran mesin dan pakar domain. Memeriksa apakah pengamanan perusahaan dirancang dengan baik dan berfungsi dalam praktik memerlukan auditor kontrol yang berpengalaman. Seorang penilai yang memenuhi syarat untuk satu tidak otomatis memenuhi syarat untuk yang lain, dan laporan penilaian harus menyatakan mana yang dilakukan.
Akses dan ruang lingkup. Seorang penilai yang hanya melihat dokumentasi dapat mengonfirmasi bahwa pengamanan ada di atas kertas. Memastikan bahwa pengamanan tersebut berfungsi memerlukan akses ke sistem, log, catatan persetujuan, dan orang-orang selama periode waktu tertentu. Model frontier berubah antara pelatihan dan penerapan, sehingga penilai juga memerlukan aturan yang jelas tentang kapan perubahan memerlukan peninjauan ulang.
Pengawasan terhadap penilai. Seseorang harus memeriksa para pemeriksa. Di pasar audit yang mapan, badan akreditasi meninjau pekerjaan penilai dan dapat mencabut status mereka ketika tidak memadai. Penyangga itu lah yang memberi bobot pada kesimpulan penilaian.
Infrastruktur yang Sudah Ada
Tidak ada yang harus diciptakan dari nol. ISO 42001, standar internasional untuk sistem manajemen AI, memberikan organisasi kerangka kerja untuk mengatur AI, dengan kontrol terdokumentasi, pemilik yang jelas, dan perbaikan berkelanjutan. Standar pendampingnya, ISO 42006, menetapkan persyaratan bagi badan yang mengaudit dan mensertifikasi sesuai ISO 42001, termasuk kompetensi yang harus ditunjukkan auditor dan aturan ketidakberpihakan yang harus mereka ikuti. Karena badan sertifikasi beroperasi di bawah akreditasi, pihak ketiga mengawasi auditor itu sendiri.
Di sisi pengujian teknis, kerangka kerja baru sedang melengkapi. AIUC-1 menyertifikasi agen AI tertentu dalam penerapan tertentu, dengan pengujian pihak ketiga berulang untuk masalah seperti halusinasi, jailbreak, dan penggunaan alat yang tidak aman, serta membangun di atas kontrol ISO 42001.
Negara bagian juga menguji model untuk mengawasi penilai secara langsung. Connecticut mengesahkan undang-undang tahun ini yang menciptakan program percontohan, mulai Juli 2027, di mana Departemen Perlindungan Konsumen negara bagian akan menyetujui hingga lima organisasi verifikasi independen. Setiap organisasi harus memasuki perjanjian yang diawasi negara bagian yang mendefinisikan ruang lingkup, metode, kewajiban pelaporan, dan tata kelola. Struktur itu menjawab beberapa pertanyaan terbuka dalam perjanjian: siapa yang menyetujui penilai, apa standar yang mereka patuhi, dan siapa yang mengawasinya.
Bagian-bagian ini tidak dirancang untuk evaluasi model frontier, dan tidak seharusnya dipresentasikan sebagai jawaban lengkap. Pekerjaan ke depan adalah menghubungkan mereka, sehingga jaminan sistem manajemen, pengujian model teknis, dan pengawasan penilai dapat bersinergi di bawah satu definisi independensi yang kredibel.
Mengapa Aturan Perlu Ditetapkan Terlebih Dahulu
Komitmen dalam perjanjian bersifat sukarela saat ini. Jika menjadi undang-undang, aturan tentang siapa yang dapat berperan sebagai penilai harus ada sebelum mandat tersebut berlaku, karena tiga alasan.
Pertama, praktik awal menjadi preseden. Setelah penandatangan mulai menyebutkan penilai dan mempublikasikan hasil, pasar akan menetapkan definisi kerja tentang \”independen\” dan \”kualifikasi\”. Definisi yang ditetapkan tanpa tekanan eksternal cenderung mengutamakan kemudahan. Pembuat undang-undang yang datang belakangan akan menemukan definisi tersebut sudah tertanam dalam kontrak dan harapan.
Kedua, kapasitas yang memenuhi syarat membutuhkan waktu untuk dibangun. Mengakreditasi badan penilai, melatih evaluator yang memahami baik model frontier maupun pengujian kontrol, serta mengembangkan metode bersama semuanya memakan bertahun‑tahun. Sebuah mandat yang muncul sebelum kapasitas tersebut ada akan dipenuhi oleh siapa saja yang tersedia.
Ketiga, persyaratan tanpa pasar penilai yang memenuhi syarat di belakangnya menghasilkan sekadar mencentang kotak. Perusahaan akan memenuhi huruf aturan, regulator akan memiliki sedikit dasar untuk menantang penilaian yang lemah, dan publik akan memperoleh kesan pengawasan tanpa substansi yang berarti.
Beberapa berpendapat bahwa masih terlalu dini untuk menetapkan aturan ini karena ilmu penilaian model frontier masih baru. Itu merupakan kekhawatiran yang wajar mengenai metode pengujian, yang seharusnya terus berkembang seiring model. Pertanyaan yang diajukan di sini berkaitan dengan penilai: apakah mereka bebas konflik, memenuhi syarat untuk pekerjaan tersebut, diberikan akses yang cukup, dan berada di bawah pengawasan. Pertanyaan‑pertanyaan itu memiliki jawaban yang stabil, dan bidang jaminan lainnya telah menjawabnya selama beberapa dekade.
Apa yang Bisa Dilakukan Organisasi Sekarang
Perusahaan yang membangun atau menerapkan AI canggih tidak perlu menunggu mandat. Saat memilih penilai, mereka dapat menanyakan layanan lain apa yang diberikan firma kepada mereka, kualifikasi apa yang dimiliki timnya untuk jenis penilaian tertentu, seberapa banyak akses yang termasuk dalam keterlibatan, dan siapa yang mengawasi pekerjaan firma tersebut. Membangun sistem manajemen AI sekarang juga memberikan penilai di masa depan sesuatu yang konkret dan terdokumentasi untuk dievaluasi.
Perjanjian ini membentuk struktur yang kuat untuk akuntabilitas AI. Nilainya akan bergantung pada siapa yang mengisi peran penilai dan standar apa yang dikenakan kepada mereka, serta waktu untuk mendefinisikannya berada sebelum siapa pun diwajibkan menggunakannya.












