Sudut Anderson
Data Polusi ‘Rogue’ yang Mengotori Kinerja AI Generatif

Sebuah studi baru menemukan bahwa banyak dataset gambar populer yang digunakan untuk melatih model AI terkontaminasi dengan gambar tes atau near-duplikat, memungkinkan model untuk curang dengan mengingat jawaban daripada belajar. Kekbocoran ini luas tetapi umumnya tidak terdeteksi, secara diam-diam meningkatkan skor dan memberikan keuntungan yang tidak adil kepada model yang dilatih pada data skala web.
Ketika Anda mengambil tes mengemudi, Anda biasanya tidak diberitahu sebelumnya tentang rute tes yang akan diambil. Jika Anda tahu (dan Anda sedikit kekurangan integritas), Anda mungkin ‘mengoptimalkan’ tes dengan berlatih berulang kali pada rute itu, bukan mengembangkan keterampilan mengemudi yang lebih luas yang dapat menangani semua rute dengan cukup baik.
Dalam pelatihan model pembelajaran mesin, ini adalah analogi yang masuk akal untuk pembagian data – pembagian data pelatihan menjadi (biasanya) 70% untuk data yang akan digunakan untuk melatih model, dan 30% yang digunakan sebagai data ‘di lapangan’.
Karena data ‘di lapangan’ tidak pernah dilihat oleh model, jika model berkinerja baik pada data itu, maka dapat diasumsikan efektif dan berkinerja; jika tidak, model mungkin telah overfitted pada set data yang seimbang – atau else data memerlukan kurasi dan definisi tambahan.
Either way, tidak mengevaluasi model pada data pelatihannya adalah fondasi metode saat ini dalam penelitian dan pengembangan AI.
Hal yang Sama Lagi
Menurut sebuah makalah penelitian baru dari Jepang, sektor penelitian penglihatan komputer dan AI generatif belum mencapai upaya peneliti LLM untuk memastikan bahwa data tes tidak mengotori data pelatihan; dalam tes, peneliti menemukan bahwa setiap dataset penglihatan skala besar yang mereka pelajari, termasuk yang memuat beberapa sistem AI generatif terbesar saat ini, telah membiarkan data tesnya bocor ke dalam data pelatihannya – yang berarti bahwa benchmark dan laporan kinerja model yang dilatih pada dataset ini tidak akan lebih akurat daripada hasil ujian seseorang yang menyelundupkan contekan ke dalam ruang ujian, dan tidak akan mencerminkan kinerja dunia nyata pada data yang benar-benar baru.

Contoh kontaminasi data yang ditemukan oleh peneliti, di mana titik data duplikat atau near-duplikat ada di kedua data pelatihan dan pengujian. Sumber: https://arxiv.org/pdf/2508.17416
Di gambar di atas, dari makalah baru, kita melihat contoh titik data duplikat atau near-duplikat yang ditemukan di kedua data inti pelatihan dan data tes dari berbagai model – cukup untuk membatalkan kinerja model pada data itu, dan sedikit meningkatkan skor umumnya, sehingga memberikan kesan generalisasi yang mungkin tidak sebenarnya telah dicapai.
Untuk memperumit masalah, kontaminasi ini tampaknya terjadi di berbagai skenario, termasuk ‘pre-training‘, di mana bobot dari model leluhur yang lebih tua digunakan untuk ‘memulai’ model baru. Jika model leluhur yang lebih tua memiliki beberapa data yang sama dengan dataset baru yang sedang dilatih, maka kebocoran dapat terjadi bahkan jika pembagian 70/30 atau 80/20 bersih.
Cumulative Effect
Hal ini hampir pasti terjadi bahkan di dataset terbaru: cakupan dataset penglihatan/bahasa telah tumbuh sangat besar selama lima tahun terakhir, tidak hanya memasukkan data gambar terbaru di web, tetapi juga mengumpulkan kembali banyak data yang sama yang memenuhi dataset yang lebih tua.
Lebih lanjut, rutinitas otomatis yang dirancang untuk menggaruk dan menyaring miliaran gambar untuk duplikat dan near-duplikat sekarang menghadapi tugas yang sangat berat sehingga kurasi itu sendiri – biayanya dalam hal waktu dan uang – harus dipertimbangkan dalam konteks keterbatasan anggaran
Sementara itu, duplikasi gambar adalah konsekuensi yang tidak terhindarkan dari jenis ad hoc penggarukan web di balik koleksi besar seperti Common Crawl, karena praktik umum memposting ulang dan mengompresi gambar, dan menerapkan edit seperti crop, dan bahkan flipping (untuk menghindari deteksi, ketika gambar mungkin digunakan tanpa izin, misalnya).
Para penulis mengamati*:
‘Kebocoran data adalah masalah yang luas, umum di sebagian besar dataset visual. Kebocoran dapat mengaburkan kemampuan generalisasi model, yang khususnya bermasalah ketika membandingkan model yang dilatih pada dataset yang berbeda, menyebabkan perbandingan yang tidak adil.
‘Kami mendesak perancang dataset untuk mempertimbangkan implikasi dari evaluasi ini. Untuk evaluasi model yang lebih adil, kami merekomendasikan penggunaan detektor duplikat yang mempertimbangkan baik kebocoran keras dan lembut.
‘Idealnya, gambar yang bocor harus dihapus dari set pelatihan, dan jika tidak mungkin, setidaknya harus dihapus dari set pengujian.’
Makalah tersebut membahas beberapa tes yang dilakukan peneliti pada dataset besar dan populer – setiap satu dari mereka menunjukkan beberapa tingkat kontaminasi.
Makalah baru tersebut berjudul Kebocoran Data dalam Dataset Visual, dan berasal dari tiga peneliti di Universitas Osaka.
Metode
Penulis makalah mendefinisikan kebocoran dalam tiga dimensi: modality, coverage, dan degree.
Modality membedakan apakah hanya gambar yang bocor atau apakah gambar dan label sama-sama terkena; coverage mengidentifikasi apakah tumpang tindih terjadi dalam dataset yang sama atau di seluruh dataset yang berbeda; dan degree mendefinisikan apakah konten yang diduplikasi sama persis atau hanya sebanding.
Mengenai kebocoran, dua skenario yang dipertimbangkan dalam karya ini adalah kebocoran intra-dataset (di mana gambar evaluasi muncul kembali di bagian pelatihan dari dataset yang sama), dan kebocoran antar-dataset (di mana gambar evaluasi dari satu dataset hadir dalam dataset lain yang digunakan untuk pelatihan).
Mengenai derajat, dua tingkat yang didefinisikan adalah kebocoran lembut (di mana gambar tidak identik tetapi menunjukkan variasi kecil), dan kebocoran keras (di mana gambar sama persis di seluruh pelatihan dan evaluasi).
Peneliti menangani deteksi kebocoran dalam hal pengambilan gambar, menggunakan pengkode gambar untuk menggambarkan setiap gambar sebagai vektor fitur. Set kueri adalah data evaluasi, sedangkan koleksi adalah set pelatihan.
Untuk dataset yang lebih kecil, setiap vektor kueri dibandingkan langsung dengan semua vektor pelatihan menggunakan kesamaan kosinus. Untuk dataset yang lebih besar, indeks Faiss dibangun untuk memungkinkan pencarian K-Nearest Neighbors (KNN) yang lebih cepat.
Karena pengkode memerlukan untuk menangkap informasi visual yang cukup untuk mendeteksi kesamaan halus, tetapi tetap efisien dalam menghadapi volume data yang sangat tinggi, penulis makalah mengandalkan fitur CLIP yang telah dikompilasi sebelumnya yang disediakan oleh pembuat dataset, dalam kasus koleksi LAION yang mendasari Stable Diffusion, dan proyek-proyek selanjutnya.
Para penulis mencatat bahwa membiarkan CLIP menggunakan pemahaman yang telah dikompresi tentang dataset (bukannya meminta file sebenarnya pada skala besar) mempercepat proses secara signifikan, dan menawarkan konsistensi yang lebih baik di seluruh perbandingan.
Data dan Tes
Pengkode gambar CLIP yang digunakan dalam tes untuk karya baru ini adalah CLIP ViT-B/32 default yang awalnya digunakan untuk menyaring LAION. Untuk menetapkan apakah gambar yang berbeda terkait, KNN digunakan di bawah AutoFaiss.
Dataset dikelompokkan menjadi tiga jenis: pretraining dataset – koleksi besar, web-scraped yang digunakan untuk melatih model umum; training dataset – koleksi yang lebih kecil, sering kali dilengkapi dengan anotasi, yang dimaksudkan untuk penyetelan model langsung; dan benchmark dataset – anotasi manual, dan digunakan secara eksklusif untuk evaluasi.
Analisis mencakup dua puluh pembagian di seluruh tujuh dataset: Microsoft COCO digunakan sebagai set pelatihan dan evaluasi, mencakup train, validasi, tes, dan pembagian tidak berlabel; Flickr30k digunakan secara eksklusif sebagai benchmark; dan koleksi Google Conceptual Captions (GCC) dianggap sebagai sumber pretraining, dengan bagian validasinya juga digunakan untuk evaluasi.
Tambahan, ImageNet digunakan untuk pelatihan dan benchmarking, sedangkan dataset LAION-400M digunakan hanya untuk pretraining.
OpenImages v4 memberikan data pelatihan dan benchmark, dan TextCaps menyediakan data pelatihan dan tes untuk evaluasi.

Contoh anotasi gambar dari dataset Open Images Google, yang diperiksa dalam karya baru. Sumber: https://arxiv.org/pdf/1811.00982
Untuk menilai seberapa baik metode dapat mendeteksi kebocoran ketika gambar telah diubah secara halus melalui pengubahan ukuran, pemotongan, atau transformasi non-semantik lainnya, penulis makalah menguji pada Flickr30k, secara acak memilih 5.000 gambar sebagai kueri, dan menggunakan seluruh dataset sebagai koleksi referensi.
Setiap gambar kueri diubah sebelum dienkripsi (yaitu, dikenakan modifikasi non-semantik seperti pengubahan ukuran atau pemotongan), dan kemudian dicocokkan dengan item yang paling mirip dalam koleksi menggunakan kesamaan kosinus; sebuah kecocokan hanya dihitung jika gambar asli ditemukan sebagai hasil teratas.
Tiga pengkode yang dibandingkan adalah ResNet-152; DINOv2 ViT-B/14; dan CLIP ViT-B/32.
Empat jenis transformasi gambar non-semantik digunakan: geometris (flip dan rotasi); pemotongan (penghapusan 20, 50, atau 100 piksel dari setiap tepi); pixelisasi (Gaussian blur, noise tambahan, atau downsampling ke 128 atau 256 piksel); dan warna (grayscale, invers, atau overlay merah, hijau, atau biru).

Dari materi tambahan, contoh transformasi yang diterapkan pada data – rutinitas umum juga dalam pra-pengolahan augmentasi data.
Penulis makalah kemudian menguji kebocoran dalam pengambilan gambar:

Akurasi deteksi kebocoran pada 5.000 gambar kueri Flickr30k yang dikenakan berbagai transformasi non-semantik.
Ketiga pengkode mencapai kinerja yang sempurna pada gambar yang tidak diubah, dan CLIP tetap dapat diandalkan di seluruh pemotongan, flip horizontal, noise, dan pengubahan ukuran, mengungguli ResNet pada perubahan tingkat piksel dan warna.
DINOv2 menunjukkan ketahanan yang kuat terhadap transformasi warna (mungkin karena desain self-supervised, menurut penulis), tetapi jauh lebih lemah pada edit geometris dan pemotongan – keduanya umum dalam dataset yang diduplikasi.
Karena LAION sudah mencakup fitur CLIP, dan mengingat ketahanan dan kecepatannya yang konsisten, CLIP dipilih sebagai pengkode default untuk analisis utama.
Kebocoran Keras dan Lembut
Kinerja dievaluasi di seluruh ambang batas kesamaan kosinus yang berbeda untuk membedakan antara gambar yang identik dan near-duplikat (kebocoran keras dan lembut).
Ambang batas 0,98 dipilih untuk mendefinisikan kebocoran keras, menghasilkan tidak ada positif palsu dan deteksi yang sempurna dari gambar yang identik.
Untuk kebocoran lembut, ambang batas 0,95 dipilih, memungkinkan lebih banyak near-duplikat untuk diperoleh sambil mempertahankan tingkat positif palsu yang hampir nol. Prioritas diberikan pada presisi daripada recall, dan temuan tersebut oleh karena itu diperkirakan secara konservatif:

Kurva karakteristik operasi penerima digunakan untuk memandu pemilihan ambang batas kebocoran keras dan lembut. Skor AUC yang tinggi di bawah kondisi yang diubah dan tidak diubah menunjukkan bahwa near-duplikat dapat dibedakan secara andal dari gambar yang tidak terkait, bahkan ketika perubahan minimal hadir.
Kebocoran Intra-Dataset
Kebocoran intra-dataset dihitung dengan mengidentifikasi tumpang tindih gambar antara bagian pelatihan dan evaluasi dalam dataset yang sama. Hanya dataset dengan baik benchmark dan pelatihan atau pretraining yang memenuhi syarat, sehingga menganalisis COCO, GCC, ImageNet, OpenImages, dan TextCaps.
Untuk COCO, set tes dibandingkan dengan set pelatihan, set evaluasi, dan subset tidak berlabel, dan set validasi dibandingkan dengan set pelatihan dan subset tidak berlabel.
Tingkat kebocoran intra-dataset tertinggi diamati pada set tes dan validasi ImageNet, dengan kebocoran keras mencapai hingga 1,58% dan kebocoran lembut sedikit di bawah 2%. GCC dan COCO mengikuti, dengan COCO val2017 menunjukkan kebocoran lembut 3% dan set tesnya berkisar antara 1,35% dan 1,38%. OpenImages menunjukkan kebocoran keras yang rendah pada 0,05%, tetapi kebocoran lembut melebihi 1,3% di kedua set tes dan validasi. TextCaps menunjukkan kebocoran keseluruhan terendah, pada 0,69%, dengan tidak ada kebocoran keras yang terdeteksi:

Tingkat kebocoran intra-dataset, menunjukkan proporsi setiap set evaluasi yang tumpang tindih dengan data pelatihannya.
Mengenai hasil ini, penulis menyatakan†:
‘Hasil ini menunjukkan bahwa kebocoran intra-dataset terjadi di semua dataset yang dianalisis, baik dalam bentuk keras atau lembut.
‘Mengingat bahwa kebocoran data dapat mengompromikan evaluasi model dan bahwa dataset dirancang khusus untuk tujuan ini, kebocoran intra-dataset adalah risiko yang secara desain seharusnya tidak ada.
‘Namun, kami telah mengidentifikasi beberapa contoh di semua dataset.’
Kebocoran Inter-Dataset
Untuk mengukur kebocoran antar-dataset (di mana model dilatih pada satu dataset dan dievaluasi pada yang lain), empat dataset digunakan sebagai sumber data pelatihan: GCC train, ImageNet train, OpenImages train, dan LAION.
Dataset ini kemudian dibandingkan dengan data evaluasi yang diambil dari set tes COCO 2014 dan validasi, Flickr30K, TextCaps tes, set tes dan validasi OpenImages, dan set tes dan validasi ImageNet.
Fitur CLIP ViT-B/32 diekstrak untuk semua dataset kecuali LAION, yang menyediakan fitur pra-kompilasi sendiri. Namun, karena fitur-fitur ini sedikit berbeda dari yang dihasilkan menggunakan implementasi resmi CLIP, gambar kueri diubah skala sesuai dengan metode yang digunakan dalam repositori clip-retrieval untuk memastikan kompatibilitas.
Pengambilan dilakukan menggunakan pencarian KNN, meskipun skala LAION memerlukan partisi menjadi blok gambar sejuta, dengan setiap blok diindeks secara terpisah:

Kebocoran antar-dataset antara dataset benchmark (kolom) dan dataset pretraining (baris). Di sisi kiri kita melihat ‘kebocoran keras’ (gambar identik), dan di sisi kanan ‘kebocoran lembut’ (near-duplikat).
Kebocoran antar-dataset diamati di seluruh dataset benchmark, dengan tingkat keparahan yang bervariasi. LAION menunjukkan tingkat kebocoran keras tertinggi (gambar identik), terutama untuk OpenImages dan TextCaps data tes, masing-masing melebihi 3%. OpenImages juga menyumbang sejumlah kecil kebocoran keras ke COCO.
Meskipun kurang parah, ImageNet masih mengandung duplikat keras dari setiap benchmark yang diperiksa; dan GCC menunjukkan kebocoran keras keseluruhan terendah, tetap di bawah 1%.
Kebocoran lembut (near-duplikat) lebih meluas: LAION sekali lagi menghasilkan tingkat tertinggi, dengan hingga 7,9% tumpang tindih untuk beberapa benchmark; OpenImages dan TextCaps adalah benchmark yang paling terpengaruh secara keseluruhan; dan Flickr30k menunjukkan kebocoran terendah.
Meskipun tumpang tindih ini mungkin hanya mencakup sebagian kecil dari set evaluasi, penulis makalah mencatat bahwa kehadiran mereka dapat memungkinkan memorifikasi dan mengompromikan validitas tes:

Contoh gambar yang bocor. Di sebelah kiri adalah kasus ‘kebocoran keras’, di mana gambar identik dalam dataset (atas) atau antar-dataset (bawah); di sebelah kanan, kasus ‘kebocoran lembut’, di mana gambar secara visual sangat mirip.
Dampak pada Evaluasi Downstream
Makalah tersebut kemudian mempertimbangkan bagaimana kebocoran data mempengaruhi evaluasi downstream (yaitu, kinerja pada tugas standar ketika model pra-latih diuji pada benchmark yang mengandung data pelatihan yang diduplikasi).
Tiga tugas dipertimbangkan: klasifikasi zero-shot; klasifikasi terawasi; dan pengambilan gambar-ke-teks.
Untuk setiap tugas, kinerja model dievaluasi pada dataset benchmark untuk yang sampel bocor telah diidentifikasi dalam data pretraining. Hasil dibandingkan di seluruh empat subset: benchmark penuh; subset sampel bocor; subset sampel non-bocor; dan subset acak dengan ukuran yang sama dengan grup bocor (digunakan sebagai kontrol).
Dampak kebocoran data pada tiga tugas downstream diukur menggunakan subset benchmark yang diketahui mengandung sampel bocor. Dalam klasifikasi zero-shot, model yang dilatih pada LAION mencapai akurasi yang jauh lebih tinggi pada sampel bocor dari set evaluasi ImageNet, mengkonfirmasi bahwa paparan bahkan pada near-duplikat selama pelatihan memberikan keuntungan yang dapat diukur:

Akurasi klasifikasi zero-shot pada set validasi ImageNet di seluruh subset dengan dan tanpa kebocoran. Kolom terakhir melaporkan keuntungan akurasi relatif terhadap set penuh, dan baris yang disorot sesuai dengan subset bocor.
Untuk klasifikasi terawasi, kebocoran pada ImageNet menyebabkan penurunan kinerja yang dramatis – kecuali jika sampel bocor memiliki label yang sama di kedua split, dalam hal ini model mencapai akurasi hampir sempurna, mengungkapkan efek memorifikasi yang kuat:

Akurasi klasifikasi terawasi pada set validasi ImageNet untuk subset dengan dan tanpa kebocoran. Kolom keuntungan menunjukkan perubahan relatif terhadap set penuh. Subset bocor disorot.
Dalam pengambilan gambar-ke-teks, kinerja lagi-lagi meningkat untuk sampel bocor, dengan kebocoran keras dan lembut keduanya menghasilkan recall yang lebih tinggi, dan subset bocor juga menghasilkan hasil yang lebih konsisten di seluruh run:

Kinerja pengambilan gambar-ke-teks pada Flickr30k di seluruh subset dengan dan tanpa kebocoran, dengan subset bocor disorot.
Para penulis menyimpulkan:
‘Secara keseluruhan, kami [menunjukkan] bukti konsisten bahwa kebocoran merupakan ancaman serius bagi evaluasi model yang adil dalam dataset visual, mengompromikan salah satu prinsip pembelajaran mesin yang paling mendasar: untuk tidak mengevaluasi model pada data pelatihannya.’
Kesimpulan
Satu aspek mengejutkan dari makalah ini, meskipun bukan hal baru, adalah laporan tentang kebutuhan untuk menggunakan CLIP untuk mendapatkan fitur untuk gunung data gambar yang besar di LAION, mewakili skala yang tidak dapat diatasi dengan cara lain selain agregat, menangani metadata yang diberi token alih-alih karakteristik yang lebih rinci yang dapat diperiksa ketika dataset lebih mudah dikelola.
Ini adalah ilustrasi yang jelas tentang seberapa jauh pelatihan model bahasa-penglihatan telah melebihi batas dan kemampuan pengawasan manusia, atau jenis kurasi manual apa pun di luar sampel representatif.
* Mungkin sedikit membingungkan, masalah duplikasi didefinisikan dalam makalah sebagai ‘kebocoran’.
† Penekanan penulis.
Dipublikasikan pertama kali pada hari Selasa, 26 Agustus 2025












