Sudut Anderson

Model Bahasa Pribadi Mudah Dibuat – dan Lebih Sulit Dideteksi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google
A robot hand at large in an exam room - Flux, Krita (AI GENERATED).

Clone open-source dari ChatGPT dapat disesuaikan skala dan dengan keterampilan terbatas atau tanpa keterampilan, memfasilitasi ‘model bahasa pribadi’ yang menghindari deteksi. Sebagian besar alat tidak dapat melacak dari mana model-model ini berasal atau apa yang telah mereka latih untuk dilakukan, memungkinkan siswa dan pengguna lain untuk menghasilkan teks AI tanpa tertangkap; tetapi metode baru mengklaim bahwa mereka dapat mengidentifikasi varian tersembunyi ini dengan mendeteksi ‘ciri keluarga’ yang dibagikan dalam output model.

 

Menurut penelitian baru dari Kanada, model obrolan AI yang disesuaikan pengguna, mirip dengan ChatGPT, mampu menghasilkan konten media sosial yang sangat mirip dengan tulisan manusia, dan dapat menipu algoritma deteksi canggih dan manusia.

Makalah tersebut menyatakan:

‘Penyerang yang realistis kemungkinan besar akan menyesuaikan model untuk gaya dan penggunaan spesifik mereka, karena murah dan mudah dilakukan. Dengan sedikit usaha, waktu, dan uang, kami menghasilkan generator yang disesuaikan yang mampu menghasilkan tweet media sosial yang lebih realistis, berdasarkan fitur linguistik dan akurasi deteksi, dan diverifikasi melalui anotasi manusia.’

Penulis menekankan bahwa model khusus ini tidak terbatas pada konten media sosial berformat pendek:

‘Meskipun dimotivasi oleh penyebaran konten AI di media sosial, dan risiko yang terkait dengan astroturfing dan kampanye pengaruh, kami menekankan bahwa temuan utama meluas ke semua domain teks.

‘Memang, menyesuaikan model untuk generasi konten spesifik gaya adalah metode yang umum diterapkan, dan kemungkinan besar sudah digunakan oleh banyak pengguna AI generatif – mempertanyakan apakah metode deteksi AI yang ada seefektif di dunia nyata seperti di laboratorium penelitian.’

Seperti yang diamati dalam makalah, metode yang digunakan untuk membuat model bahasa khusus ini adalah penyesuaian, di mana pengguna mengumpulkan sejumlah kecil data target mereka sendiri dan memasukkannya ke dalam berbagai alat pelatihan online yang mudah digunakan dan terjangkau.

Sebagai contoh, repositori populer Hugging Face menawarkan penyesuaian Model Bahasa Besar (LLM) melalui antarmuka yang disederhanakan, menggunakan sistem AutoTrain Advanced, yang dapat dijalankan dengan biaya beberapa dolar melalui GPU online atau secara gratis, jika pengguna memiliki perangkat keras yang memadai:

Berbagai struktur harga di seluruh kisaran GPU yang tersedia untuk sistem AutoTrain Hugging Face. Sumber: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Struktur harga yang berbeda di seluruh kisaran GPU yang tersedia untuk sistem AutoTrain Hugging Face. Sumber: https://huggingface.co/spaces/autotrain-projects/autotrain-advanced?duplicate=true

Metode dan platform lain yang disederhanakan termasuk Axolotl, Unsloth, dan TorchTune yang lebih kuat tetapi lebih menantang.

Sebuah contoh penggunaan kasus akan menjadi siswa yang lelah menulis esai mereka sendiri, tetapi takut tertangkap oleh alat deteksi AI online, yang dapat menggunakan esai sejarah mereka yang sebenarnya sebagai data pelatihan untuk menyesuaikan model yang sangat efektif seperti seri Mistral.

Meskipun penyesuaian model cenderung miring kinerjanya ke arah data pelatihan tambahan dan merusak kinerja secara keseluruhan, model ‘pribadi’ dapat digunakan untuk ‘menghilangkan AI’ dari output yang semakin khas dari sistem seperti ChatGPT, dengan cara yang mencerminkan gaya sejarah pengguna (dan, untuk meningkatkan autentisitas, kekurangan mereka).

Namun, seseorang dapat menggunakan model yang disesuaikan secara eksklusif yang secara khusus dilatih untuk tugas atau kumpulan tugas yang sempit, seperti LLM yang disesuaikan pada kursus modul universitas tertentu. Model seperti itu akan memiliki wawasan yang lebih dalam tetapi sempit ke domain tersebut daripada LLM serba guna seperti ChatGPT, dan kemungkinan besar akan berharga kurang dari $10-20 untuk dilatih.

Es Iceberg LLM

Sulit untuk mengatakan seberapa besar skala praktik ini. Secara anekdot, di berbagai platform media sosial, saya baru-baru ini menemukan banyak contoh bisnis yang menggunakan penyesuaian LLM – pasti lebih banyak contoh seperti itu daripada setahun yang lalu; dalam satu kasus, sebuah perusahaan menyesuaikan model bahasa pada karya pemimpin pikiran yang dipublikasikan, yang kemudian dapat mengubah panggilan Zoom yang berantakan dengan klien baru menjadi posting B2B yang ramping hampir dalam satu langkah, sesuai permintaan.

Model seperti itu memerlukan data pasangan (contoh sebelum dan sesudah, dalam skala), sedangkan membuat ‘gloss’ pribadi dari karakteristik penulis tertentu adalah tugas yang lebih mudah, lebih mirip dengan transfer gaya.

Meskipun ini adalah pengejaran yang terselubung (meskipun ada banyak judul berita dan studi akademis tentang topik ini), di mana angka tidak tersedia, kesadaran yang sama yang membawa UNDUH AKT ke dalam hukum tahun ini berlaku di sini: aktivitas target memungkinkan dan terjangkau, dan ada pemahaman umum bahwa pengguna potensial sangat termotivasi.

Hanya ada cukup gesekan yang tersisa di sistem pelatihan online yang paling ‘disederhanakan’ sehingga praktik pelatihan dan penggunaan model yang disesuaikan secara tidak jujur masih merupakan kasus penggunaan yang relatif khusus – setidaknya untuk saat ini – meskipun tidak mustahil bagi kreativitas tradisional siswa.

PhantomHunter

Ini membawa kita ke makalah utama yang menarik di sini – pendekatan baru dari Cina yang menggabungkan berbagai teknik menjadi satu kerangka kerja – yang disebut PhantomHunter – yang mengklaim dapat mengidentifikasi output dari model bahasa yang disesuaikan, yang lainnya akan dianggap sebagai karya asli manusia.

Sistem ini dirancang untuk berfungsi bahkan ketika model yang disesuaikan secara khusus belum pernah ditemui sebelumnya, bergantung pada jejak sisa yang ditinggalkan oleh model dasar asli – yang penulis karakterisasi sebagai ‘ciri keluarga’ yang selamat dari proses penyesuaian.

Dalam pengujian, makalah – yang berjudul PhantomHunter: Mendeteksi Teks yang Dihasilkan oleh LLM yang Disesuaikan Secara Pribadi melalui Pembelajaran yang Sadar Keluarga – melaporkan akurasi deteksi yang kuat, dengan sistem yang mengungguli evaluasi zero-shot GPT-4-mini dalam melacak kembali sampel teks ke keluarga modelnya.

Hal ini menunjukkan bahwa semakin model disesuaikan, semakin model tersebut mengungkapkan tentang asal-usulnya, melawan asumsi bahwa penyesuaian pribadi selalu menyembunyikan asal model; sebaliknya, proses penyesuaian mungkin meninggalkan sidik jari yang dapat dideteksi yang, jika dibaca dengan benar, mengungkapkan permainan – setidaknya, sampai kemajuan lebih lanjut yang tampaknya tiba setiap minggu sekarang.

Makalah tersebut menyatakan*:

‘[Deteksi Teks yang Dihasilkan Mesin] umumnya membedakan teks yang dihasilkan LLM dan teks yang ditulis manusia melalui klasifikasi biner. Metode yang ada baik mempelajari fitur teks umum yang dibagikan di seluruh LLM menggunakan pembelajaran representasi atau merancang metrik yang dapat dibedakan antara teks manusia dan LLM berdasarkan sinyal internal LLM (misalnya, probabilitas token).

‘Untuk kedua kategori, pengujian mereka sebagian besar dilakukan pada data dari LLM yang tersedia secara publik, dengan asumsi bahwa pengguna menghasilkan teks menggunakan layanan siap pakai.

Kami berpendapat bahwa situasi ini sedang berubah karena perkembangan baru-baru ini dari komunitas LLM open-source. Dengan bantuan platform seperti HuggingFace dan teknik pelatihan LLM yang efisien seperti adaptasi peringkat rendah (LoRA), membangun LLM yang disesuaikan dengan dataset pribadi yang disesuaikan menjadi jauh lebih mudah daripada sebelumnya.

‘Misalnya, ada lebih dari 60k model turunan Llama di HuggingFace. Setelah penyesuaian pribadi pada corpus yang tidak diketahui, karakteristik yang dipelajari dari model dasar dapat berubah dan detektor LLMGT akan [gagal], membentuk risiko baru bahwa pengguna jahat dapat menghasilkan teks berbahaya secara pribadi tanpa tertangkap oleh detektor LLMGT.

‘Tantangan baru muncul: Bagaimana mendeteksi teks yang dihasilkan oleh LLM open-source yang disesuaikan secara pribadi?

Metode dan Pelatihan

Sistem PhantomHunter menggunakan strategi pembelajaran sadar keluarga, yang menggabungkan tiga komponen: ekstraktor fitur, yang menangkap probabilitas output dari model dasar yang diketahui; pengkode kontras yang dilatih untuk membedakan antara keluarga; dan (seperti yang dijelaskan di bawah) pengklasifikasi campuran ahli yang menetapkan label keluarga ke sampel teks baru:

Skema untuk sistem. PhantomHunter memproses sampel teks dengan mengekstrak fitur probabilitas dari beberapa model dasar, yang kemudian dikodekan menggunakan lapisan CNN dan transformer. Ini memperkirakan keluarga model untuk menghitung bobot penguncian, yang membimbing modul campuran ahli dalam memprediksi apakah teks tersebut dihasilkan LLM. Kerugian kontras diterapkan selama pelatihan untuk memperbaiki pemisahan antara keluarga model. Sumber: https://arxiv.org/pdf/2506.15683

Skema untuk sistem. PhantomHunter memproses sampel teks dengan mengekstrak fitur probabilitas dari beberapa model dasar, yang kemudian dikodekan menggunakan lapisan CNN dan transformer. Ini memperkirakan keluarga model untuk menghitung bobot penguncian, yang membimbing modul campuran ahli dalam memprediksi apakah teks tersebut dihasilkan LLM. Kerugian kontras diterapkan selama pelatihan untuk memperbaiki pemisahan antara keluarga model. Sumber: https://arxiv.org/pdf/2506.15683

PhantomHunter bekerja dengan melewati potongan teks melalui beberapa model dasar yang diketahui dan merekam seberapa mungkin setiap model tersebut berpikir bahwa kata berikutnya, pada setiap langkah. Pola ini kemudian dimasukkan ke dalam jaringan saraf yang mempelajari ciri khas yang membedakan dari setiap keluarga model.

Selama pelatihan, sistem membandingkan teks dari keluarga yang sama dan mempelajari untuk mengelompokkannya bersama, sambil membedakan antara teks dari keluarga yang berbeda, membantu mengidentifikasi koneksi tersembunyi antara model yang disesuaikan dan model dasar mereka.

MOE

Untuk memutuskan apakah sebuah potongan teks ditulis oleh manusia atau oleh AI, PhantomHunter menggunakan sistem campuran ahli, di mana setiap ‘ahli’ disesuaikan untuk mendeteksi teks dari keluarga model tertentu.

Sekali sistem menebak keluarga mana teks tersebut paling mungkin berasal, itu menggunakan tebakan itu untuk memutuskan seberapa banyak bobot yang harus diberikan pada pendapat setiap ahli. Pendapat yang diberi bobot ini kemudian digabungkan untuk membuat keputusan akhir: AI atau manusia.

Pelatihan sistem melibatkan beberapa tujuan: mempelajari untuk mengenali keluarga model; mempelajari untuk membedakan teks AI dari teks manusia; dan mempelajari untuk memisahkan keluarga yang berbeda menggunakan pembelajaran kontras – tujuan yang seimbang selama pelatihan melalui parameter yang dapat disesuaikan.

Dengan fokus pada pola yang dibagikan di seluruh setiap keluarga, bukan kekhasan model individu, PhantomHunter seharusnya dapat mendeteksi bahkan model yang disesuaikan yang belum pernah dilihat sebelumnya.

Data dan Pengujian

Untuk mengembangkan data untuk pengujian, penulis fokus pada dua skenario akademis yang paling umum: menulis dan menjawab pertanyaan. Untuk menulis, mereka mengumpulkan 69.297 abstrak dari arsip akademik Arxiv, dibagi menjadi domain utama. Untuk Q&A, 2.062 pasang dikurasi dari dataset HC3 di seluruh tiga subjek: ELI5; keuangan; dan kedokteran:

Daftar sumber data dan jumlahnya, dalam data yang dikurasi untuk studi.

Daftar sumber data dan jumlahnya, dalam data yang dikurasi untuk studi.

Secara total, dua belas model dilatih untuk pengujian. Tiga model dasar adalah LLaMA-2 7B-Chat; Mistral 7B-Instruct-v0.1; dan Gemma 7B-it), dari mana sembilan varian yang disesuaikan dibuat, masing-masing disesuaikan untuk meniru domain atau gaya penulis yang berbeda, menggunakan data spesifik domain:

Statistik dataset evaluasi, di mana 'FT Domain' mengacu pada domain yang digunakan selama penyesuaian dan 'base' menunjukkan tidak ada penyesuaian.

Statistik dataset evaluasi, di mana ‘FT Domain’ mengacu pada domain yang digunakan selama penyesuaian dan ‘base’ menunjukkan tidak ada penyesuaian.

Secara total, maka, tiga model dasar disesuaikan menggunakan teknik full-parameter dan LoRA di seluruh tiga domain yang berbeda dalam masing-masing dua skenario penggunaan: penulisan abstrak akademik dan menjawab pertanyaan. Untuk mencerminkan tantangan deteksi dunia nyata, model yang disesuaikan pada data ilmu komputer dihilangkan dari pengujian menulis, sedangkan model yang disesuaikan pada data keuangan dihilangkan dari evaluasi Q&A.

Kerangka kerja saingan yang dipilih adalah RoBERTa; T5-Sentinel; SeqXGPT; DNA-GPT; DetectGPT; Fast-DetectGPT; dan DeTeCtive.

PhantomHunter dilatih menggunakan dua jenis lapisan jaringan saraf: tiga lapisan konvolusional dengan max-pooling untuk menangkap pola teks lokal, dan dua lapisan transformer dengan empat kepala perhatian masing-masing untuk memodelkan hubungan jangka panjang.

Untuk pembelajaran kontras, yang mendorong sistem untuk membedakan antara keluarga model yang berbeda, parameter suhu diatur ke 0,07.

Tujuan pelatihan menggabungkan tiga istilah kerugian: L1 (untuk klasifikasi keluarga) dan L2 (untuk deteksi biner), masing-masing memiliki bobot 1,0, dan L3 (untuk pembelajaran kontras), dengan bobot 0,5.

Model dioptimalkan menggunakan Adam dengan laju pembelajaran 2e-5 dan ukuran batch 32. Pelatihan berlangsung selama sepuluh epoch penuh, dengan checkpoint yang berkinerja terbaik dipilih menggunakan set validasi. Semua eksperimen dilakukan di server dengan empat GPU NVIDIA A100.

Metrik yang digunakan adalah skor F1 untuk setiap subset pengujian, bersama dengan tingkat positif sebenarnya, untuk perbandingan dengan detektor komersial.

Skor F1 untuk mendeteksi teks dari model bahasa yang disesuaikan yang tidak terlihat. Dua hasil teratas dalam setiap kategori ditebalkan dan digarisbawahi. 'BFE' mengacu pada ekstraksi fitur probabilitas dasar, 'CL' pada pembelajaran kontras, dan 'MoE' pada modul campuran ahli.

Skor F1 untuk mendeteksi teks dari model bahasa yang disesuaikan yang tidak terlihat. Dua hasil teratas dalam setiap kategori ditebalkan dan digarisbawahi. ‘BFE’ mengacu pada ekstraksi fitur probabilitas dasar, ‘CL’ pada pembelajaran kontras, dan ‘MoE’ pada modul campuran ahli.

Hasil pengujian awal, yang divisualisasikan dalam tabel di atas, menunjukkan bahwa PhantomHunter mengungguli semua sistem baseline, mempertahankan skor F1 di atas sembilan puluh persen untuk teks yang dihasilkan manusia dan mesin, bahkan ketika dievaluasi pada output dari model yang disesuaikan yang dikecualikan dari pelatihan.

Penulis mengomentari:

‘Dengan penyesuaian penuh, PhantomHunter meningkatkan skor MacF1 sebesar 3,65% dan 2,96% pada kedua dataset, masing-masing; dan dengan penyesuaian LoRA, perbaikan tersebut adalah 2,01% dan 6,09%, masing-masing.

‘Hasil ini menunjukkan kemampuan deteksi PhantomHunter yang kuat untuk teks yang dihasilkan oleh LLM yang disesuaikan yang tidak terlihat.’

Studi ablasion dilakukan untuk menilai peran setiap komponen inti dalam PhantomHunter. Ketika elemen individual dihilangkan, seperti ekstraktor fitur, pengkode kontras, atau pengklasifikasi campuran ahli, penurunan akurasi yang konsisten diamati, menunjukkan bahwa arsitektur bergantung pada koordinasi semua bagian.

Penulis juga memeriksa apakah PhantomHunter dapat menggeneralisasi melampaui distribusi pelatihannya, dan menentukan bahwa bahkan ketika diterapkan pada output dari model dasar yang sepenuhnya absen selama pelatihan, itu terus mengungguli metode saingan – menunjukkan bahwa tanda tangan tingkat keluarga tetap dapat dideteksi di seluruh varian yang disesuaikan.

Kesimpulan

Satu argumen yang mendukung model bahasa generatif yang dilatih pengguna adalah bahwa setidaknya model kecil yang disesuaikan ini mempertahankan rasa dan kekhasan individu dari seorang penulis, dalam iklim di mana idiom generik yang dipengaruhi SEO dari chatbot AI mengancam untuk menggeneralisasi bahasa mana pun di mana AI menjadi kontributor utama atau dominan.

Dengan penurunan nilai esai kuliah, dan dengan siswa sekarang merekam sesi penulisan besar untuk membuktikan bahwa mereka tidak menggunakan AI pada pengajuan mereka, lebih banyak guru di luar Eropa (di mana ujian lisan dinormalisasi) mempertimbangkan ujian tatap muka sebagai alternatif untuk teks yang dikirim. Lebih baru-baru ini, kembali ke pekerjaan tulisan tangan telah diusulkan.

Bisa dibilang bahwa kedua solusi ini lebih unggul daripada apa yang mengancam menjadi perlombaan senjata LLM berbasis AI; meskipun mereka datang dengan biaya upaya dan perhatian manusia, yang budaya teknologi saat ini berusaha untuk mengotomatisasi.

 

Tolong lihat bagian akhir setelah hasil utama, di makalah sumber, untuk detail tentang ini.

* Konversi saya dari kutipan inline penulis ke tautan. Penekanan teks penulis, bukan milik saya.

Dipublikasikan pertama kali pada hari Kamis, 19 Juni 2025

Penulis tentang pembelajaran mesin, spesialis domain sintesis gambar manusia. Mantan kepala konten penelitian di Metaphysic.ai, hingga pembubarannya ke dalam Brahma.ai DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai