Sudut Anderson
Model AI yang Dibatasi Tidak Berfungsi Dengan Baik, Studi Menyatakan

Upaya untuk membatasi generator gambar AI dengan menghapus konten yang dilarang (seperti pornografi, kekerasan, atau gaya yang dilindungi hak cipta) dari model yang dilatih ternyata tidak efektif: sebuah studi baru menemukan bahwa metode penghapusan konsep saat ini memungkinkan atribut yang “dilarang” untuk bocor ke gambar yang tidak terkait, dan juga gagal mencegah versi yang terkait erat dari konten yang seharusnya “dihapus” dari muncul.
Jika perusahaan yang memproduksi model AI dasar tidak dapat mencegah model tersebut digunakan untuk menghasilkan materi yang tidak diinginkan atau ilegal, mereka berisiko diadili dan/atau ditutup. Sebaliknya, vendor yang hanya membuat model mereka tersedia melalui API, seperti mesin generatif Firefly Adobe, berada dalam posisi untuk tidak khawatir tentang apa yang mungkin dihasilkan oleh model mereka, karena baik prompt pengguna maupun output yang dihasilkan diperiksa dan disanitasi:

Sistem Firefly Adobe, digunakan dalam alat seperti Photoshop, terkadang menolak permintaan generatif segera setelah memblokir prompt sebelum apa pun dibuat. Beberapa kali, itu menghasilkan gambar tetapi kemudian memblokir hasilnya setelah ditinjau. Jenis penolakan proses tengah seperti ini juga dapat terjadi di ChatGPT, ketika model memulai respons tetapi memotongnya setelah mengenali pelanggaran kebijakan.
Namun, filter API seperti ini biasanya dapat dinetralkan oleh pengguna pada model yang dipasang lokal, termasuk model bahasa-vision (VLM) yang pengguna mungkin ingin disesuaikan melalui pelatihan lokal pada data khusus.
Di sebagian besar kasus, menonaktifkan operasi seperti ini biasanya sangat mudah, melibatkan mengomentari panggilan fungsi di Python (meskipun hack seperti ini biasanya harus diulangi atau ditemukan kembali setelah pembaruan kerangka kerja).
Dari perspektif bisnis, sulit untuk memahami bagaimana ini bisa menjadi masalah, karena pendekatan API memaksimalkan kontrol perusahaan atas alur kerja pengguna. Namun, dari perspektif pengguna, baik biaya model API-only maupun risiko sensor yang salah atau berlebihan kemungkinan akan mendorong mereka untuk mengunduh dan menyesuaikan instalasi lokal dari alternatif sumber terbuka – setidaknya, di mana lisensi FOSS menguntungkan.
Model terakhir yang dirilis tanpa upaya untuk mengintegrasikan sensor diri adalah Stable Diffusion V1.5, hampir tiga tahun yang lalu. Kemudian, pengungkapan bahwa korpus pelatihannya termasuk data CSAM menyebabkan seruan yang meningkat untuk melarang ketersediaannya, dan penghapusan dari repositori Hugging Face pada 2024.
Potong Ini!
Skeptis berpendapat bahwa minat perusahaan dalam membatasi model AI generatif yang dapat dipasang lokal didasarkan semata-mata pada kekhawatiran tentang paparan hukum, jika kerangka kerja mereka menjadi terkenal karena memfasilitasi konten yang tidak diinginkan atau ilegal.
Memang, beberapa model sumber terbuka yang “ramah lokal” tidak terlalu sulit untuk dibuka sensor (seperti Stable Diffusion 1.5 dan DeepSeek R1).
Sebaliknya, rilis baru-baru ini dari seri model Kontext Flux oleh Black Forest Lab ditandai dengan komitmen perusahaan yang terkemuka untuk menyensori seluruh jangkauan Kontext. Ini dicapai baik melalui kurasi data yang hati-hati, dan melalui penyetelan halus setelah pelatihan, yang dirancang untuk menghapus setiap kecenderungan residual menuju konten NSFW atau dilarang.
Ini adalah tempat di mana lokus aksi telah berada di adegan penelitian selama 2-3 tahun terakhir: dengan penekanan pada perbaikan pasca-fakta dari model dengan data yang tidak dikurasi dengan baik. Penawaran semacam ini termasuk Unified Concept Editing in Diffusion Models (UCE); Reliable and Efficient Concept Erasure of Text-to-Image Diffusion Models (RECE); Mass Concept Erasure in Diffusion Models (MACE); dan konsep-Semi-Permeable struktur disuntikkan sebagai Membran (SPM):

Makalah 2024 ‘Unified Concept Editing in Diffusion Models’ menawarkan edit tertutup untuk bobot perhatian, memungkinkan penyuntingan efisien dari beberapa konsep dalam model teks-ke-gambar. Tapi apakah metode ini bertahan dari skrutini? Sumber: https://arxiv.org/pdf/2308.14761
Meskipun ini adalah pendekatan yang efisien (koleksi hyperscale seperti LAION terlalu besar untuk dikurasi secara manual), ini tidak selalu efektif: menurut sebuah studi AS baru, tidak satu pun dari prosedur pengeditan yang disebutkan di atas – yang mewakili keadaan seni dalam modifikasi model AI pasca-pelatihan – benar-benar bekerja dengan baik.
Penulis menemukan bahwa Teknik Penghapusan Konsep (CETs) ini biasanya dapat dengan mudah dihindari, dan bahwa bahkan di mana mereka efektif, mereka memiliki efek sampingan yang cukup:

Efek penghapusan konsep pada model teks-ke-gambar. Setiap kolom menunjukkan prompt dan konsep yang ditandai untuk dihapus, bersama dengan output yang dihasilkan sebelum dan sesudah pengeditan. Hierarki menunjukkan hubungan induk-anak antara konsep. Contoh-contoh ini menyoroti efek sampingan umum, termasuk kegagalan untuk menghapus konsep anak, penekanan konsep tetangga, penghindaran melalui pengubahan kata, dan transfer atribut yang dihapus ke objek yang tidak terkait. Sumber: https://arxiv.org/pdf/2508.15124
Penulis menemukan bahwa teknik penghapusan konsep utama saat ini gagal untuk memblokir prompt komposisional (misalnya, merah mobil atau kecil kursi kayu); sering membiarkan sub-kelas lolos bahkan setelah menghapus kategori induk (seperti mobil atau bus terus muncul setelah menghapus kendaraan); dan memperkenalkan masalah baru seperti kebocoran atribut (di mana, misalnya, menghapus sofa biru bisa menyebabkan model menghasilkan objek yang tidak terkait seperti kursi biru).
Dalam lebih dari 80% kasus uji, menghapus konsep yang luas seperti kendaraan tidak menghentikan model dari menghasilkan contoh kendaraan yang lebih spesifik seperti mobil atau bus.
Pengeditan, makalah tersebut mengamati, juga menyebabkan peta perhatian (bagian dari model yang memutuskan di mana untuk fokus dalam gambar) menjadi tercerai-berai, melemahkan kualitas output.
Menariknya, makalah tersebut menemukan bahwa menghapus konsep yang terkait satu per satu bekerja lebih baik daripada mencoba menghapusnya semua sekaligus – meskipun itu tidak menghilangkan semua kelemahan metode pengeditan yang dipelajari:

Perbandingan strategi penghapusan progresif dan sekaligus. Ketika semua varian ‘beruang mainan’ dihapus secara bersamaan, model terus menghasilkan objek yang mirip beruang. Menghapus varian secara bertahap lebih efektif, menyebabkan model menekan konsep target lebih andal.
Meskipun peneliti saat ini tidak dapat menawarkan solusi untuk masalah yang diuraikan dalam makalah, mereka telah mengembangkan dataset baru dan benchmark yang mungkin membantu proyek penelitian selanjutnya untuk memahami apakah model “disensor” mereka berfungsi seperti yang diharapkan.
Makalah tersebut menyatakan:
‘Evaluasi sebelumnya hanya bergantung pada satu set kecil kelas target dan kelas yang dipertahankan; misalnya, ketika menghapus ‘mobil’, hanya kemampuan model untuk menghasilkan mobil yang diuji. Kami menunjukkan bahwa pendekatan ini secara fundamental tidak memadai dan evaluasi penghapusan konsep harus lebih komprehensif untuk mencakup semua sub-konsep yang terkait seperti ‘mobil merah’.
‘Dengan memperkenalkan dataset yang beragam dengan variasi komposisional dan menganalisis secara sistematis efek seperti dampak pada konsep tetangga, penghindaran konsep, dan kebocoran atribut, kami mengungkap keterbatasan dan efek sampingan yang signifikan dari CET yang ada.
‘Benchmark kami adalah model-agnostik dan mudah diintegrasikan dan idealnya cocok untuk membantu pengembangan Teknik Penghapusan Konsep (CET) baru.’

Meskipun CET menghapus konsep target ‘burung’, mereka gagal pada varian komposisional ‘burung merah’ (atas). Setelah menghapus ‘sofa biru’, semua metode juga kehilangan kemampuan untuk menghasilkan ‘kursi biru’ (bawah). Hasil yang sukses ditandai dengan simbol centang hijau, dan kegagalan dengan simbol salib merah.
Studi ini menawarkan wawasan menarik tentang sejauh mana konsep yang dilatih ke dalam ruang laten model, dan seberapa jauh entanglement tidak akan dengan mudah mengizinkan penghapusan konsep yang definitif dan benar-benar diskrit.
Makalah baru ini berjudul Efek Samping Penghapusan Konsep dari Model Difusi, dan berasal dari empat peneliti dari Universitas Maryland.
Metode dan Data
Penulis berpendapat bahwa karya sebelumnya yang mengklaim menghapus konsep dari model difusi tidak membuktikan klaim tersebut dengan cukup, menyatakan*:
‘Klaim penghapusan memerlukan evaluasi yang lebih kuat dan komprehensif. Misalnya, jika konsep yang akan dihapus adalah ‘kendaraan’, sub-konsep seperti ‘mobil’ dan konsep komposisional seperti ‘mobil merah’ atau ‘mobil kecil’ juga harus dihapus.
‘Namun, aspek hierarki konsep dan komposisional ini tidak dipertimbangkan dalam protokol evaluasi yang ada karena mereka hanya fokus pada akurasi konsep yang dihapus tunggal. [Penulis EraseBench] menilai bagaimana CET mempengaruhi konsep yang secara visual mirip dan paraphrased (seperti ‘kucing’ dan ‘anak kucing’)[;] namun mereka tidak secara menyeluruh menyelidiki hierarki dan komposisionalitas konsep.’
Untuk menyediakan data benchmark untuk proyek di masa depan, penulis menciptakan dataset Evaluasi Efek Samping (SEE) – koleksi besar prompt teks yang dirancang untuk menguji seberapa baik metode penghapusan konsep bekerja.
Prompt tersebut mengikuti template sederhana di mana objek digambarkan dengan atribut ukuran, warna, dan bahan – misalnya, gambar sebuah mobil kecil merah kayu.
Objek diambil dari dataset MS-COCO, dan diatur dalam hierarki superkelas seperti kendaraan, dan subkelas seperti mobil atau bus, dengan kombinasi atribut mereka membentuk node daun (tingkat yang paling spesifik dari hierarki). Struktur ini memungkinkan pengujian penghapusan pada berbagai tingkat semantik, dari kategori yang luas hingga varian yang spesifik.
Untuk mendukung evaluasi otomatis, setiap prompt dipasangkan dengan pertanyaan ya atau tidak, seperti Apakah ada mobil di gambar?, dan juga digunakan sebagai label kelas untuk model klasifikasi gambar:

Kombinasi prompt di dataset SEE yang dihasilkan dengan memvariasikan atribut ukuran, warna, dan bahan.
Untuk mengukur seberapa baik setiap metode penghapusan konsep berfungsi, penulis merancang dua metode penilaian: akurasi target, yang melacak seberapa sering konsep yang dihapus masih muncul dalam gambar yang dihasilkan; dan akurasi pelestarian, yang melacak apakah model terus menghasilkan materi yang tidak seharusnya dihapus.
Keseimbangan antara dua skor ini dimaksudkan untuk mengungkapkan apakah metode tersebut berhasil menghapus konsep yang dilarang tanpa merusak output model yang lebih luas.
Penulis mengevaluasi penghapusan konsep melintasi tiga mode kegagalan: pertama, ukuran seberapa jauh menghapus konsep seperti kendaraan mengganggu konsep tetangga atau tidak terkait; kedua, tes untuk melihat apakah penghapusan dapat dihindari dengan meminta sub-konsep seperti mobil merah setelah menghapus kendaraan.
Akhirnya, dilakukan pemeriksaan untuk kebocoran atribut, di mana sifat yang terkait dengan konsep yang dihapus muncul di objek lain (misalnya, menghapus sofa mungkin menyebabkan objek lain, seperti tanaman, mewarisi warna atau bahan). Dataset akhir berisi 5056 prompt komposisional
Pengujian
Kerangka kerja yang diuji sebelumnya adalah yang terdaftar sebelumnya – UCE, RECE, MACE, dan SPM. Peneliti mengadopsi pengaturan default dari proyek asli, dan menyetel semua model pada GPU NVIDIA RTX 6000 dengan 48GB VRAM.
Stable Diffusion 1.4, salah satu model paling langgeng dalam literatur, digunakan untuk semua pengujian – mungkin tidak hanya karena model SD awal memiliki sedikit atau tidak ada pembatasan konseptual, dan dengan demikian menawarkan kanvas kosong dalam konteks penelitian ini.
Setiap prompt dari 5056 prompt dataset SEE dijalankan melalui versi model yang diedit dan tidak diedit, menghasilkan empat gambar per prompt menggunakan benih acak yang tetap, memungkinkan untuk menguji apakah efek penghapusan konsisten di seluruh beberapa output. Setiap model yang diedit menghasilkan total 20.224 gambar.
Kehadiran konsep yang dipertahankan dievaluasi sesuai dengan metode sebelumnya untuk prosedur penghapusan teks-ke-gambar, menggunakan model VQA BLIP, QWEN 2.5 VL, dan Florence-2base.
Dampak pada Konsep Tetangga
Pengujian pertama mengukur apakah menghapus konsep tidak sengaja mempengaruhi konsep tetangga. Misalnya, setelah menghapus mobil, model harus berhenti menghasilkan mobil merah atau mobil besar, tetapi masih dapat menghasilkan konsep terkait seperti bus atau truk, dan konsep tidak terkait seperti garpu.
Analisis menggunakan kesamaan embedding CLIP dan jarak edit atribut untuk memperkirakan seberapa dekat setiap konsep dengan target yang dihapus, memungkinkan studi untuk mengkuantifikasi seberapa jauh gangguan tersebut menyebar:

Hasil gabungan untuk akurasi target (kiri) dan akurasi pelestarian (kanan) yang diplot melawan kesamaan semantik (atas) dan jarak komposisional (bawah). Metode penghapusan konsep ideal akan menunjukkan akurasi target yang rendah dan akurasi pelestarian yang tinggi di semua jarak; namun, hasilnya menunjukkan bahwa teknik saat ini gagal untuk generalisasi dengan baik, dengan konsep yang lebih dekat baik tidak dihapus secara memadai atau terlalu banyak terganggu.
Dari hasil ini, penulis berkomentar:
‘Semua CET terus menghasilkan varian komposisional atau semantik dari target meskipun penghapusan, yang seharusnya tidak terjadi. Jelas bahwa UCE secara konsisten mencapai akurasi yang lebih tinggi daripada metode CET lainnya pada [set pelestarian], menunjukkan dampak yang tidak disengaja minimal pada konsep semantik yang terkait.
‘Sebaliknya, SPM mencapai akurasi terendah, menunjukkan bahwa strategi pengeditannya lebih rentan terhadap kesamaan konsep.’
Di antara empat metode yang diuji, RECE paling efektif dalam memblokir konsep target. Namun, seperti yang ditunjukkan pada sisi kiri gambar di atas, semua metode gagal untuk menekan varian komposisional. Setelah menghapus burung, model masih menghasilkan gambar burung merah, menunjukkan bahwa konsep tersebut masih sebagian utuh.
Menghapus sofa biru juga mencegah model menghasilkan kursi biru, menunjukkan kerusakan pada konsep tetangga.
RECE menangani varian komposisional lebih baik daripada yang lain, sementara UCE melakukan pekerjaan yang lebih baik dalam melestarikan konsep terkait.
Penghapusan Invasif
Pengujian penghapusan invasif mengevaluasi apakah model masih dapat menghasilkan konsep sub-kelas setelah kelas induknya dihapus. Misalnya, jika kendaraan dihapus, pengujian memeriksa apakah model masih dapat menghasilkan output seperti sepeda atau mobil merah.
Prompt ditargetkan pada sub-kelas langsung dan varian komposisional untuk menentukan apakah operasi penghapusan konsep telah benar-benar menghapus hierarki atau dapat dihindari melalui deskripsi yang lebih spesifik:

Penghindaran kelas induk yang dihapus melalui sub-kelas dan varian komposisional pada Stable Diffusion v1.4, dengan akurasi yang lebih tinggi menunjukkan penghindaran yang lebih besar.
Model yang tidak diedit mempertahankan akurasi yang tinggi di semua kelas induk, mengkonfirmasi bahwa itu tidak menghapus konsep target. Di antara CET, MACE menunjukkan penghindaran yang paling sedikit, mencapai akurasi sub-kelas yang paling rendah di lebih dari setengah kategori yang diuji. RECE juga berkinerja dengan baik, terutama dalam kelompok aksesori, olahraga, dan elektronik.
Sebaliknya, UCE dan SPM menunjukkan akurasi sub-kelas yang lebih tinggi, menunjukkan bahwa konsep yang dihapus lebih mudah dihindari melalui prompt yang terkait atau bersarang.
Penulis mencatat:
‘[Semua] CET berhasil menekan konsep kelas induk target (“makanan”). Namun, ketika diprompt dengan anak-anak berbasis atribut dari hierarki makanan (misalnya, ”pizza besar”), semua metode menghasilkan item makanan.
‘Demikian pula dalam kategori ”kendaraan”, semua model menghasilkan sepeda, meskipun ”kendaraan” dihapus.’
Kebocoran Atribut
Pengujian ketiga, kebocoran atribut, memeriksa apakah sifat yang terkait dengan konsep yang dihapus muncul di bagian lain dari gambar.
Misalnya, setelah menghapus sofa, model tidak boleh menghasilkan sofa atau menerapkan atribut khasnya (seperti warna atau bahan) ke objek yang tidak terkait dalam prompt yang sama. Ini diukur dengan memprompt model dengan objek yang berpasangan dan memeriksa apakah atribut yang dihapus salah mengarah ke konsep yang dipertahankan:

Peta perhatian untuk token atribut setelah penghapusan konsep. Kiri: Ketika ‘bangku’ dihapus, token ‘kayu’ bergeser ke burung, menghasilkan burung kayu. Kanan: Menghapus ‘sofa’ gagal untuk menekan generasi sofa, sementara token ‘besar’ salah ditugaskan ke donat.
RECE adalah yang paling efektif dalam menghapus atribut target, tetapi juga memperkenalkan kebocoran atribut yang paling banyak ke prompt yang dipertahankan, melampaui bahkan model yang tidak diedit. UCE mengalami kebocoran yang lebih sedikit daripada metode lain.
Hasilnya, penulis sarankan, menunjukkan kebutuhan akan perdagangan yang inheren, dengan penghapusan yang lebih kuat meningkatkan risiko transfer atribut yang salah.
Kesimpulan
Ruang laten model tidak terisi dengan cara yang teratur selama pelatihan, dengan konsep yang diturunkan didepositkan secara rapi ke rak atau ke dalam laci; tetapi embedding yang dilatih adalah baik konten dan wadahnya: tidak dipisahkan oleh batas yang jelas, tetapi malah berbaur satu sama lain dengan cara yang membuat penghapusan menjadi masalah – seperti mencoba mengambil sepotong daging tanpa kehilangan darah.
Dalam sistem yang cerdas dan berkembang, peristiwa dasar – seperti terbakar dan kemudian memperlakukan api dengan hormat – terikat dengan perilaku dan asosiasi yang mereka bentuk kemudian, membuatnya menantang untuk menghasilkan model yang mungkin telah ditinggalkan dengan konsekuensi dari konsep pusat yang potensial ‘dilarang’, namun kehilangan konsep itu sendiri.
* Konversi saya dari kutipan inline penulis ke tautan.
Dipublikasikan pertama kali pada hari Jumat, 22 Agustus 2025












