Sudut Anderson
Mendeteksi Ide AI, Bukan Teks AI

Bagaimana jika ada detektor teks AI yang dapat mengenali bahwa Anda menulis sesuatu berdasarkan sebuah ide yang diberikan AI kepada Anda – bahkan jika seluruh tulisan sebenarnya (yaitu, teks) adalah karya asli Anda?
Kita semua tahu tentang detektor teks AI yang mempermalukan selebriti dan politikus, di antara yang lain – algoritma yang telah mempelajari karakteristik teks buatan AI dan dapat membedakan pola-pola tersebut ketika muncul.
Kasus-kasus ini mewakili delegasi sederhana dari tugas komunikasi, di mana model bahasa seperti ChatGPT dan Google Gemini memperkirakan token berikutnya yang paling mungkin dalam respons terhadap permintaan pengguna – bukan dengan melangkah mundur dan melihat gambaran luas masalah atau proposisi terlebih dahulu, melainkan hanya dengan menebak kata berikutnya yang paling probabilistik.
Namun demikian, selimut tambal sulam prediksi ini pada akhirnya menghasilkan struktur mendasar, menurut penelitian terbaru: kebutuhan agar bagian teks yang berdekatan koheren dan relevan satu sama lain menyebabkan tanda tangan unik berkembang dalam ‘garisan besar’ atau dimensi lebih tinggi dari karya – yang dapat membedakan jejak AI bahkan ketika teks ditulis ulang secara ekstensif untuk ‘memanusiakannya’:

‘Bentuk’ berdimensi‑tinggi yang khas dari tulisan di bawah berbagai LLM, dan – kiri – tulisan murni manusia. Sumber
Ideasi AI Terarah
Sebuah kolaborasi akademik baru yang dipimpin oleh University of Maryland melangkah lebih jauh, dengan menawarkan metodologi yang dapat mendeteksi apakah ide-ide itu sendiri berasal dari AI, terlepas dari siapa yang pada akhirnya menulis kata‑kata tersebut.
Pendekatan ini, yang dinamai IdeaLens dan dilatih pada satu juta garisan besar yang diambil dari dokumen web, berfokus pada mengurangi setiap dokumen menjadi sebuah garisan besar yang mempertahankan ide-nya sambil menghilangkan kata‑kata – dan disertai dengan demo daring:

Di sebelah kiri, salah satu artikel saya sendiri lolos sebagai manusia dalam demo daring, sementara artikel lain yang saya kirim (ditulis oleh penulis lain) tampaknya menerima masukan AI yang cukup besar. Sumber
Seperti yang terlihat dalam contoh hasil demo di atas, metode deteksi yang digunakan dapat membedakan antara ide manusia dan prosa manusia, serta ide AI dan prosa AI, dan menilai keduanya secara terperinci dan berbeda – meskipun dua detektor tersebut dilatih pada dokumen, label, dan arsitektur model dasar yang sama, sementara dirancang untuk mendeteksi hal yang pada dasarnya berlawanan: asal‑usul ide, dan asal‑usul prosa.
Jenis jangkauan deteksi ini, seperti yang diduga, dapat membuat sejumlah kategori penulis merasa cemas, mulai dari penulis pidato politik hingga novelis dan kolumnis, selain lainnya yang hingga kini menghargai gaya menulis mereka sendiri, namun membiarkan AI mengisi topik mereka.
Salah satu alasan mengapa LLM cenderung menghasilkan ide yang dapat dikenali (dan oleh karena itu dapat dilacak) bukan hanya karena konsep dan teks tertentu secara statistik mendominasi data pelatihan yang kurang terkurasi model, sehingga lebih mungkin muncul dalam berbagai permintaan; tetapi juga karena LLM memiliki obsesi misterius dan berulang yang tampaknya tidak berhubungan dengan data pelatihan spesifik, namun sering muncul tanpa diminta.
Para penulis menyatakan*:
‘Sementara detektor AI modern mengidentifikasi siapa yang menulis kata‑kata, kebijakan yang muncul tentang penggunaan AI semakin bergantung pada pertanyaan yang berbeda: siapa yang menghasilkan ide?Kami memperkenalkan IdeaLens, sebuah detektor yang mengidentifikasi apakah ide dalam dokumen berasal dari manusia atau AI (asal‑usul ide), terlepas dari siapa yang menulis kata‑kata tersebut.
‘Untuk memusatkan IdeaLens pada ide bukan pada prosa, kami merepresentasikan dokumen sebagai garisan besar: daftar item yang masing‑masing menggabungkan peran wacana dengan deskripsi singkat yang diparafrasekan tentang konten, meminimalkan tumpang tindih tingkat kata dengan teks mentah.’
Data dan Metode
Makalah tersebut mengklaim bahwa metode baru dapat mengidentifikasi ide manusia dalam dokumen yang dihasilkan AI (misalnya, seseorang berkata kepada AI ‘Tulislah esai tentang topik ini‘); dan juga dapat mengidentifikasi ide AI dalam tulisan manusia (misalnya, seseorang berkata kepada AI ‘Sarankan sesuatu untuk saya tulis’).

Hasil tes pada empat kombinasi ide dan prosa manusia serta AI. Semua empat detektor berkinerja kuat ketika ide dan prosa berbagi asal yang sama, tetapi menyimpang tajam ketika asal usulnya campur: IdeaLens secara tepat mengenali 94.7% dokumen yang ditulis AI berdasarkan ide manusia sebagai berasal dari manusia, dan mengidentifikasi ide AI dalam 68% cerita yang ditulis manusia, dibandingkan hanya 8% untuk Pangram 4 dan 0% untuk ProseLens dan EditLens-3B. Sumber
Deteksi paling mudah ketika asal usul paling jelas – misalnya, ketika sebuah karya yang ditulis manusia didasarkan pada ide yang dihasilkan AI, atau ketika output yang dihasilkan AI berasal dari ide manusia. Ketika kekuatan asal usul ini bervariasi, deteksi menjadi lebih sulit.
Para peneliti menguji perbedaan ini dengan secara bertahap mengubah seberapa banyak rencana dasar sebuah dokumen yang berasal dari manusia. Dalam satu percobaan, model AI diberikan rencana manusia yang semakin terperinci, mulai dari tidak lebih dari sekadar topik, hingga kerangka lengkap.
Seiring kontribusi manusia meningkat, tingkat penandaan AI IdeaLens turun dari 94.9% menjadi 6.8%; dan detektor prosa konvensional terus secara besar-besaran mengidentifikasi teks yang dihasilkan sebagai AI:

Hasil tes yang menunjukkan apa yang terjadi ketika secara bertahap lebih banyak rencana dasar dokumen yang ditulis AI disediakan oleh manusia. IdeaLens semakin mengenali asal manusia dari ide-ide tersebut, dengan tingkat penandaan AI turun dari 94.9% untuk prompt hanya topik menjadi 6.8% untuk kerangka manusia lengkap; detektor teks konvensional ProseLens dan Pangram masih mengklasifikasikan sebagian besar tulisan yang dihasilkan sebagai AI.
Karena ide harus dipisahkan dari bahasa yang digunakan untuk mengekspresikannya, dan tidak ada dataset besar yang mencatat siapa yang sebenarnya menghasilkan ide dalam sebuah dokumen, para peneliti malah melatih IdeaLens pada label penulisan AI yang ada – namun menghapus sebagian besar tulisan itu sendiri:

Cara IdeaLens memisahkan ide dari prosa selama pelatihan dan pengujian, dibandingkan dengan detektor teks konvensional ProseLens. Sebuah contoh artikel opini sepanjang 1,321 kata direduksi menjadi kerangka berlabel peran, dengan poin-poin dikategorikan menurut fungsinya, seperti laporan peristiwa, atau evaluasi. Selama pelatihan, kerangka-kerangka ini tambahan diparafrasekan untuk menghilangkan kata-kata yang diwarisi dari dokumen sumber sebelum IdeaLens belajar dari label AI Pangram yang ada. Untuk dokumen baru, kerangka yang diekstrak kemudian dapat langsung diberikan ke IdeaLens untuk memperkirakan probabilitas bahwa ide-ide tersebut berasal dari AI. Bagian bawah gambar menunjukkan detektor kedua – ‘ProseLens’ – yang digunakan peneliti untuk perbandingan, yang justru menerima teks lengkap dan memperkirakan apakah prosa itu sendiri dihasilkan AI.
Seperti yang ditunjukkan di atas, setiap dokumen direduksi menjadi kerangka yang menggambarkan apa yang dikatakan, dan peran masing-masing poin dalam dokumen. Selama pelatihan, kerangka-kerangka tersebut diparafrasekan untuk lebih menghilangkan jejak kata-kata asli penulis. IdeaLens dapat sehingga membuat prediksinya sebagian besar dari ide yang tersisa, bukan dari karakteristik mencolok prosa.
Tiga dataset dibuat untuk proyek ini: IdeaShift; IdeaShift-X; dan TwiceTold. IdeaShift dibuat dari 500 dokumen awal yang ditulis manusia dan dihasilkan AI yang diambil dari korpus tes yang ada milik peneliti. GPT-5.6 Sol untuk mengubah masing-masing menjadi prompt yang semakin terperinci, dari ‘hanya topik’, hingga kerangka lengkap. GPT-5.6 kemudian digunakan untuk menghasilkan dokumen baru.
IdeaShift-X, sebaliknya, menggunakan 10,000 dokumen yang ditulis manusia FineWeb2 dalam 24 bahasa, menerapkan protokol IdeaShift yang disebutkan sebelumnya untuk menghasilkan versi AI dalam setiap bahasa.
Dataset ketiga, TwiceTold, ditulis oleh mahasiswa akademik di bawah pengawasan penulis, untuk menghindari kemungkinan penggunaan AI mendasar dalam crowdsourcing data tersebut. Lima puluh cerita ditulis dari nol, tetapi menggunakan kerangka 500 kata yang disediakan oleh ChatGPT-5.6 Sol.
Tes
Detektor milik peneliti sendiri terdiri dari IdeaLens dalam bentuk outline dan dokumen; ProseLens yang disebutkan sebelumnya; versi ModernBERT-L dari kedua sistem; versi Qwen3.5-9B dari IdeaLens; dan varian IdeaLens logistic-classifier.
Ini dibandingkan dengan Pangram 4; EditLens-Llama-3B; Binoculars; EditLens-RoBERTa; MELD; Desklib-academic; Desklib; Entropy; Fast-DetectGPT; Likelihood; Log-rank; LRR; MAGE; OpenAI-RoBERTa-base; OpenAI-RoBERTa-large; RADAR; dan Rank.
Untuk pengujian, Akurasi diukur berdasarkan apakah label AI atau manusia yang diprediksi cocok dengan sumber ide. IdeaLens, ProseLens, dan EditLens menggunakan ambang batas FPR global 1%; label AI, AI-bantu, dan manusia pada Pangram 4 dibinarisasi; serta Fast-DetectGPT, Binoculars, MELD, dan Desklib menggunakan ambang default masing‑masing.
Evaluasi yang lebih luas menggunakan 19 benchmark eksternal, termasuk 14 yang mencakup materi sepenuhnya manusia atau sepenuhnya AI, dan 10 yang berisi tulisan manusia yang kemudian diedit oleh AI. Sebanyak 50.000 dokumen dalam domain diuji, sementara 10.000 dokumen pra‑ChatGPT C4 digunakan untuk menilai false positive:

Hasil tes membandingkan akurasi detektor ketika ide dan prosa memiliki asal yang sama atau berbeda. IdeaLens mempertahankan akurasi tinggi dalam kedua kondisi, yaitu 95,3 % untuk provenance yang sama dan 81,3 % untuk provenance campuran; detektor pesaing tampil jauh lebih buruk ketika sumber ide berbeda dari sumber prosa.
Dari 51 tes yang diambil dari 22 benchmark, IdeaLens satu‑satunya detektor yang tetap kuat baik ketika ide dan prosa berasal dari sumber yang sama maupun berbeda, mencetak 95,3 % dan 81,3 % masing‑masing.
Sebagai perbandingan, ProseLens dan Pangram 4 mencetak di atas 98 % ketika ide dan prosa berbagi sumber, namun turun menjadi sekitar 25 % ketika tidak.
Penulis menyatakan tentang hasil ini*:
‘Karena ProseLens memiliki backbone, dokumen pelatihan, dan label pelatihan yang sama dengan IdeaLens, hal ini menyoroti dampak representasi outline kami, yang sebuah ModernBERT-based pair meniru dengan backbone yang berbeda.’
‘IdeaLens juga beralih secara tak terduga dengan baik ke masukan teks mentah pada saat pengujian, menunjukkan akurasi provenance bersama yang tinggi dan akurasi provenance campuran yang jauh lebih tinggi dibandingkan ProseLens.’
Ketiga detektor berhasil mengidentifikasi hampir semua cerita asli yang ditulis AI. Pada TwiceTold, IdeaLens mengidentifikasi ide berasalan AI dalam 68 % cerita yang ditulis manusia, dibandingkan 0 % untuk ProseLens dan 8 % untuk Pangram 4:

IdeaLens memberikan probabilitas AI yang serupa pada cerita asli yang ditulis AI dan versi TwiceTold yang ditulis manusia berdasarkan outline yang sama dihasilkan AI, sementara probabilitas AI ProseLens turun tajam setelah prosa ditulis ulang oleh manusia.
Meskipun dilatih dalam bahasa Inggris, IdeaLens berhasil menggeneralisasi ke 24 bahasa IdeaShift‑X, menandai 95,3 % dokumen berdasarkan ide AI – namun hanya 0,7 % ketika rencana manusia yang detail menyediakan ide. Pada 10.000 dokumen manusia pra‑ChatGPT dalam bahasa yang sama, tingkat false‑positive hanya 0,1 %.
Penulis mengakui bahwa dataset yang lebih besar akan diinginkan dalam pekerjaan mendatang, dan bahwa kebisingan label dataset mungkin perlu ditangani. Namun, bagi yang ingin membangun atas dasar temuan awal yang menarik ini dapat mengakses GitHub repository yang disediakan oleh penulis makalah; dan bagi yang sekadar penasaran dapat menempelkan tes ‘suspect’ ke demo site proyek, serta menilai sendiri apakah metode ini sejalan dengan estimasi mereka, atau pendekatan lain.
Kesimpulan
Apakah metode deteksi semacam ini penting tergantung pada bagaimana penerimaan, integrasi, atau penolakan AI akan berkembang (tentunya berbeda di tiap sektor dan situasi) selama 6–12 bulan ke depan.
Mungkin publik seorang politisi lebih memaafkan penggunaan AI untuk memoles dan menyajikan ide asli mereka, dibandingkan dengan presentasi ide yang dihasilkan LLM yang terasa licik (setelah semua, secara statistik, audiens cenderung bersimpati pada penggunaan AI hanya sebagai alat bantu presentasi).
Namun, pada saat yang sama, apa yang kita harapkan dari AI selain menghasilkan sudut, ide, dan alternatif yang mungkin tidak akan kita pikirkan atau pertimbangkan; dan dari sudut pandang itu, apakah begitu buruk memberi kecerdasan mesin kesempatan mengemudi?
Nah, dalam hal optik, dan mengingat kecenderungan AI yang terkenal dan semakin meningkat untuk membuat kesalahan serta –baru-baru ini– perilaku menyimpang, mungkin masih terlalu dini untuk membiarkan LLM menghasilkan saran kebijakan, atau secara umum menjadi kekuatan penggerak dalam ideasi.
*Penekanan penulis, bukan saya, tetapi konversi saya terhadap kutipan dalam teks penulis menjadi tautan, bila diperlukan.
Pertama kali dipublikasikan Selasa, 6 Oktober 2026












