Model dan platform AI
Anthropic Menyetel Ulang Pengaman Biologi Fable 5, Mengurangi Kueri yang Diblokir Sebesar 85%

Anthropic pada tanggal 7 Agustus 2026 merilis pembaruan untuk pengaman biologi pada Claude Fable 5 yang dikatakan oleh perusahaan dapat mengurangi “fallback” terkait biologi sebesar sekitar 85% dalam pengujian di seluruh permukaan produk — pengalihan otomatis yang mengarahkan kueri pengguna ke model yang kurang mampu ketika sistem menilai permintaan menyentuh wilayah biologi yang dilindungi.
Dalam pengumuman, Anthropic mengatakan bahwa pengguna sekarang harus melihat fallback yang jauh lebih sedikit pada pertanyaan kesehatan dan pendidikan sehari-hari, seperti menafsirkan hasil laboratorium, memahami gejala, dan mempelajari biologi dalam konteks pendidikan, dan bahwa para profesional kesehatan harus mendapatkan lebih banyak dukungan pada tugas klinis. Pengurangan fallback biologi diharapkan dapat menurunkan volume fallback total sebesar sekitar 67% pada Claude.ai, 55% pada Cowork, 17% pada Claude Code, dan 7% pada Platform Claude, menurut catatan kaki dalam postingan.
Perusahaan secara eksplisit menyatakan bahwa pembaruan ini tidak membuka model untuk penelitian biologi profesional. Fable 5 masih jatuh kembali ke Claude Opus 5 untuk permintaan yang dianggap dual-use oleh Anthropic, termasuk virologi, toksikologi, dan desain molekuler, yang dikatakan oleh perusahaan meninggalkan model “belum dapat digunakan untuk penelitian biologi profesional dan pengembangan obat.” Anthropic mengatakan bahwa mereka bermaksud menutup kesenjangan tersebut melalui jalur akses tepercaya daripada melalui klasifikasi publik.
Apa yang Dibangun Sistem Fallback untuk Menahan
Arsitektur fallback berasal dari peluncuran Fable 5 pada tanggal 9 Juni 2026. Anthropic merilis model dengan klasifikasi — sistem AI otomatis yang lebih kecil yang menyaring permintaan — yang mencakup keamanan siber, biologi, dan kimia, serta upaya distilasi. Ketika klasifikasi diaktifkan, permintaan disajikan kembali oleh model Opus yang paling mampu berikutnya. Pada peluncuran, Anthropic mengatakan bahwa mereka telah menyetel pengaman dengan hati-hati dan mengharapkan mereka akan diaktifkan dalam kurang dari 5% sesi.
Cakupan biologi adalah yang terluas dari ketiga klasifikasi. Alasan Anthropic, yang dijelaskan dalam postingan peluncuran dan kartu sistem, adalah bahwa model Mythos dapat unggul dalam beberapa tugas biologi kompleks dan memberikan dukungan operasional pada yang lain — kemampuan yang dinilai oleh perusahaan dapat memberikan kontribusi signifikan pada aksi yang berbahaya. Kartu sistem memperlakukan model sebagai memiliki kemampuan “CB-1”, yang berarti dapat membantu secara signifikan orang-orang dengan latar belakang teknis dasar pada proses yang relevan dengan senjata, sementara menilai bahwa tidak melewati ambang batas “CB-2” dari menggantikan keahlian kelas dunia yang langka di balik pengembangan senjata biologi — penilaian yang kartu itu sendiri deskripsikan sebagai “jauh kurang jelas” daripada model sebelumnya.
Hari ini, pembaruan tersebut mengutip Laporan Penilaian Ancaman Tahunan 2026 dari Komunitas Intelijen AS, yang memperingatkan bahwa kemajuan bioteknologi termasuk biologi sintetis dan penyuntingan genetik “dapat menyebabkan ancaman biologi baru” dan mencatat bahwa beberapa aktor negara kemungkinan besar mempertahankan program senjata biologi dan kimia ofensif yang aktif.
Apa yang Berubah pada Klasifikasi
Selama beberapa minggu terakhir, Anthropic menulis ulang konstitusi klasifikasi biologi — kumpulan aturan yang digunakan model penyaring untuk membedakan konten yang dilindungi dari konten yang diizinkan — dengan mengukir penggunaan yang tidak berbahaya secara lebih rinci, meminta umpan balik dari ahli internal dan eksternal, melatih kembali klasifikasi dengan data yang diperbarui, dan memverifikasi bahwa masih memicu konten penelitian berbahaya dan dual-use. Konfigurasi peluncuran sengaja salah arah lebar: perusahaan mengakui bahwa akan memblokir volume tinggi false positif sebagai ganti untuk mendapatkan Fable 5 ke pengguna umum beberapa minggu atau bulan lebih awal dari pengaman yang lebih sempit yang akan diizinkan.
Diagram perusahaan tentang perubahan tersebut menunjukkan batas klasifikasi bergeser untuk memungkinkan permintaan yang sebelumnya tertangkap dalam margin keamanan yang dijelaskan sendiri — konten yang Anthropic nilai sebagai sangat mungkin tidak berbahaya tetapi diblokir karena kehati-hatian. Tulisan sebelumnya Anthropic tentang pendekatan klasifikasi yang sama di domain keamanan siber menggambarkan ketegangan serupa antara cakupan yang luas dan kekuatan jailbreak — yang taruhannya Unite.AI tutupi ketika model Claude tanpa pengaman tersebut mengubah benchmark keamanan siber menjadi tiga intrusi nyata.
Kompromi yang Sekarang Dikelola Anthropic Secara Publik
Pengumuman tersebut adalah dokumen tata kelola sebagaimana juga catatan produk. Anthropic meluncurkan Fable 5 dengan hampir semua kueri biologi diblokir, menyerap minggu-minggu false positif sebagai biaya rilis umum yang cepat, dan sekarang menerbitkan hasil terukur dari mempersempit blokir tersebut — termasuk pengurangan fallback per permukaan, yang memberikan pengamat luar baseline konkrit untuk revisi berikutnya. Batasan yang tersisa berada di mana perusahaan mengatakan risiko sebenarnya berada: penelitian profesional dual-use tetap di belakang fallback Opus 5 sampai jalur akses tepercaya, yang Anthropic kembangkan sejak peluncuran Juni untuk peneliti biologi yang diverifikasi, membawa lalu lintas tersebut.
Perusahaan mengakui bahwa false positif residu akan tetap berada di dalam margin keamanan dan mengatakan bahwa penyempurnaan pengaman terus berlangsung. Apa yang telah mereka tulis, dengan pembaruan 7 Agustus, adalah definisi ukuran kemajuan: tingkat fallback yang sekarang akan diukur.












