Sudut Anderson
Metode Pencucian IP dalam AI

Jika ada pertanggungjawaban hukum yang akan datang atas penggunaan hak cipta dalam pelatihan AI, ada beberapa metode untuk mengaburkan penggunaan tersebut.
Opini Revolusi AI generatif yang sedang berkembang saat ini terjadi dalam lingkungan hukum yang paling tidak pasti yang pernah menyertai perkembangan teknologi transformasional sejak abad ke-19.
Sampai 3-4 tahun yang lalu, komunitas penelitian pembelajaran mesin menikmati izin tacit (seringkali eksplisit) untuk mengeksploitasi materi yang dilindungi IP dalam pengembangan sistem baru; karena sistem ini belum berhasil, dalam arti bahwa mereka belum matang atau layak secara komersial, hasilnya, dalam setiap arti, akademis.
Dalam periode tersebut, kesuksesan tiba-tiba dari generasi baru model bahasa besar berbasis difusi (LLM, seperti ChatGPT dan Claude) dan model bahasa-vision (VLM, seperti Sora) menandakan bahwa benang-benang penelitian abstrak dan sebelumnya ‘tidak berbahaya’ ini telah berkembang menjadi layak secara komersial, dan telah melampaui ‘izin bebas’ mereka, sejauh eksploitasi hak cipta orang lain.
Dari sekarang, pemegang hak akan mencari bagian dari hasil sistem AI yang dilatih sebagian besar atau sebagian pada data yang dilindungi hak cipta mereka, yang menyebabkan avalanche kasus hukum yang memerlukan upaya tertentu untuk bahkan memantau.

Di sini terbatas hanya pada kasus yang dibawa di AS, kasus baru muncul dengan kecepatan yang sangat tinggi di Amerika Serikat dan di luar negeri. Sumber
Mengharuskan ‘Makan Siang Gratis’
Komitmennya saat ini terjadi sehubungan dengan infrastruktur AI telah dipostulatkan oleh beberapa suara sebagai upaya untuk mengukuhkan AI ‘berbahaya hak cipta’ sehingga dalam di ekonomi masyarakat sehingga menjadi tidak hanya ‘terlalu besar untuk gagal’, tetapi juga ‘terlalu kuat untuk digugat’ – atau setidaknya ‘terlalu kuat’ sehingga gugatan yang berhasil dapat diizinkan untuk menggagalkan revolusi.
Menuju sentimen umum ini, presiden saat ini Amerika Serikat mengkomitmen kebijakan pandangannya bahwa ‘Anda tidak dapat diharapkan untuk memiliki program AI yang sukses ketika setiap artikel, buku, atau apa pun yang telah Anda baca atau pelajari, Anda harus membayarnya’.
Sungguh? Tidak ada yang serupa atau dapat dibandingkan telah terjadi di era industri Barat, dan ini mewakili gerakan yang sangat abrasif terhadap budaya litigasi dan reparasi tradisional AS; mungkin posisi yang paling mirip adalah kedaluwarsa wajib paten obat setelah 20 tahun (yang sendiri sering diserang), dan batasan pada harapan privasi di tempat umum.
Namun, zaman berubah; dalam ketiadaan jaminan bahwa tren saat ini menuju ‘domain yang terkemuka’ terhadap perlindungan IP tidak akan gagal, atau dibalik, ada beberapa pendekatan sekunder yang menjadi praktik standar dalam pengembangan sistem AI, dan perlakuan data pelatihan yang sangat diperdebatkan yang memuatnya.
Dataset-by-Proxy
Salah satu pendekatan ini mengambil pendekatan yang sangat mirip dengan pertahanan (tidak selalu berhasil) oleh situs daftar torrent yang mereka tidak benar-benar menyimpan materi yang diperdebatkan – atau materi apa pun.
Selain menghilangkan kebutuhan untuk menyimpan dan melayani sejumlah besar data gambar atau video yang minim kompresibel, koleksi semacam ini memungkinkan pembaruan yang cepat – seperti penghapusan materi atas permintaan pemegang hak cipta – dan versi.
Just like torrents are only signposts to where IP-protected material can be found, a number of highly influential datasets are in themselves only ‘pointer’-style lists of extant data; if the end-user wishes to use these lists as a download-list for their own dataset, that’s on them, as far as the curators’ liability would seem to be concerned.
Among such is Google Research’s Conceptual 12M dataset, which provides captions for images, but only points to locations on the web where these images exist (or existed at the time of curation):

Dua contoh dari kurasi Conceptual 12M Google Research. Sumber
Contoh lain yang menonjol, dan yang sekarang memiliki klaim yang valid untuk reverensi dalam sejarah AI, adalah dataset LAION yang memfasilitasi kemunculan sistem generatif Stable Diffusion pada tahun 2022 – kerangka kerja generatif pertama yang menawarkan gambar generatif sumber terbuka yang kuat kepada pengguna akhir, seperti sistem proprietary tampaknya akan membangun layanan tersebut sebagai domain komersial yang murni:

Salah satu varian dari proyek LAION, menampilkan karya seni modern dan berhak cipta. Sumber
Dalam banyak kasus, ukuran file yang besar dari beberapa koleksi ‘penunjuk’ ini menunjukkan inklusi konten gambar dalam file yang dapat diunduh dan disimpan; namun, ukuran unduhan yang tidak trivial seringkali disebabkan oleh volume konten teks yang tinggi, dan kadang-kadang inklusi embeddings atau fitur – ringkasan atau node dari konten yang dapat diterapkan yang diekstrak dari data sumber selama proses pelatihan.
Video Premium
Dataset video menyajikan kasus yang lebih kuat untuk pendekatan ‘dataset-by-proxy’ atau penunjuk, karena volume penyimpanan data yang diperlukan untuk mengumpulkan jumlah video yang bermakna dan berguna dalam koleksi yang dapat diunduh adalah prohibitif, dan metode ‘terdistribusi’ diinginkan.
Namun, dalam kedua kasus – tetapi terutama dengan video – URL sumber yang dapat diunduh mewakili data yang akan memerlukan perhatian lebih lanjut sebelum digunakan dalam proses pelatihan. Baik gambar dan video akan memerlukan pengubahan ukuran, atau keputusan pemotongan, untuk membuat sampel yang akan sesuai dengan ruang GPU yang tersedia. Bahkan video yang sangat kecil akan memerlukan pemotongan menjadi panjang yang sangat singkat, seperti 3-5 detik, biasanya.
Dataset video yang terkenal yang menggunakan referensi ke video online (bukan kurasi dan pengemasan video langsung) termasuk Kinetics Human Action Video Dataset Google, dan koleksi YouTube-8M perusahaan tersebut, yang menggunakan annotasi segmen untuk menunjukkan bagaimana mengobati setiap video sekali diunduh – tetapi yang sekali lagi meninggalkan pengguna akhir untuk mendapatkan video dari URL yang disediakan.
Tutup dan Buka
Akhirnya, dalam kategori ini, data VFX ‘terbuka’ dapat dihasilkan dengan platform tertutup yang kemudian menerbitkan dan membuat dataset yang dihasilkan tersedia. Ini masuk akal untuk bertanya-tanya mengapa ini terjadi, dan untuk mempertimbangkan apakah ini mungkin karena perusahaan asal ingin menyucikan model hulu yang tidak ramah IP, untuk kegunaan mereka sendiri; atau bahwa ‘set yang dicuci’ diminta dari luar.
Salah satu contoh ‘pencucian generasi’ adalah, secara argumentatif, dataset Omni-VFX, yang menggabungkan banyak titik data dari dataset Open-VFX (yang sendiri merujuk pada banyak platform tertutup dan semi-tertutup, seperti Pika dan PixVerse).
Untuk jujur, Omni-VFX tidak bahkan mencoba:

Di dataset Omni-VFX sumber terbuka, sebuah wajah yang familiar. Sumber
Tanggung Jawab Ancestral
Pendekatan kedua untuk pencucian IP adalah melalui penggunaan materi berhak cipta pada satu atau banyak tingkat. Salah satu metode dalam kategori ini adalah penggunaan data sintetis yang telah dilatih, pada suatu titik hulu, pada data berhak cipta. Dalam kasus seperti itu, terutama di mana data sintetis dapat menghasilkan hasil yang terlihat asli, materi berhak cipta menyediakan transformasi yang tidak dapat ditebak atau diapproximasi oleh model dunia umum, atau model non-spesialis.
Ini sangatlah kasus di mana sistem video generatif memerlukan untuk menghasilkan ‘peristiwa yang tidak mungkin’, dan peristiwa yang akan jatuh secara umum ke dalam kategori ‘efek visual’ (VFX).
Faktanya, apa yang membawa topik ini ke pikiran adalah penelitian terbaru dalam serangkaian makalah penelitian yang menawarkan kemampuan untuk ‘mengabstraksi’ berbagai jenis efek visual, seperti menghasilkan sinar laser dari bagian tubuh yang tidak mungkin, baik dengan dilatih pada klip VFX kustom atau ‘sumber terbuka’ (bukan sumber yang lebih jelas, seperti VFX yang sangat mahal yang ditemukan dalam output dari alam semesta sinematik Marvel):
Contoh dari situs web EffectMaker, di mana ‘aksi’ dalam klip sumber (jauh kiri) diterapkan pada gambar sumber (tengah). Sumber
Contoh di atas berasal dari halaman proyek untuk proyek EffectMaker. EffectMaker bukanlah yang pertama menawarkan ini tahun ini yang mencari untuk mengekstrak dinamika VFX dari satu klip video dan memindahkannya ke klip baru, dan faktanya ini sedang menjadi tugas diskrit dalam penelitian VFX AI*.
Sadari bahwa raksasa media seperti Marvel memiliki kemungkinan yang lebih tinggi untuk memenangkan kasus hukum atas IP (bahkan dalam iklim ‘toleransi yang dipaksakan’), perusahaan efek visual dan startup saat ini sedang melakukan upaya besar untuk memastikan bahwa kerangka kerja VFX generatif mereka bebas dari IP perusahaan lain.
Terutama di antaranya adalah Meta, yang telah dilaporkan di subreddit r/vfx telah melakukan perekrutan musim dingin yang terbayar dengan baik pada tahun 2026, menawarkan seniman VFX pekerjaan untuk melatih model AI untuk menghasilkan efek visual tingkat Hollywood. Meskipun gaji tidak ditentukan di berbagai posting, satu mendeskripsikannya sebagai ‘uang pensiun’.
Mengikuti Uang
Namun, seseorang harus bertanya-tanya berapa banyak uang bahkan perusahaan seperti Meta yang mau membayar untuk keanekaragaman dan kelimpahan tembakan VFX ad hoc yang sebenarnya – mengingat bahwa satu tembakan VFX rata-rata untuk film blockbuster sekitar $42.000 USD – dan banyak datang dengan biaya yang lebih tinggi.
Lebih lanjut, masuk akal bahwa model AI VFX-generating yang disesuaikan akan menyerahkan pada permintaan populer, termasuk berbagai efek standar dari kategori film yang paling populer dan paling mahal.
Di samping itu, ‘profesional VFX’ yang tersisa mungkin akan merekayasa ulang tembakan yang mereka kerjakan untuk katalog film yang ada† – yang pada gilirannya mengkontekstualisasikan ‘pekerjaan dataset kustom’ sebagai imitasi – ada tidak ada jaminan bahwa sampel yang mahal ini akan dilatih ‘dari nol’ dalam arsitektur yang benar-benar baru.
Sungguh, jika rekreasi ini diarahkan ke modul tambahan seperti LoRAs, yang bergantung pada model dasar, maka proses ini hanya sebaik model dasar yang ‘bersih IP’ – dan tidak banyak yang seperti itu.
Demikian pula, jika ‘proses baru’ menggunakan teknik ‘hybrid’ seperti fine-tuning, di mana nilai efek visual bergantung pada model, prior, atau embeddings dari koleksi atau model yang lebih lama yang tidak terbukti integritasnya, orisinalitas pekerjaan ini secara argumentatif kosmetik, dan tunduk pada tantangan.
Misi yang Tidak Mungkin
Domain output VFX adalah studi kasus yang sangat menarik dalam kaitannya dengan potensi pencucian IP dalam dataset AI, karena tembakan efek visual sering menggambarkan ‘hal yang tidak mungkin’ yang tidak akan ada alternatif sumber terbuka.
Sebagai contoh, sementara demolisi bangunan dapat dilatih ke dalam model generatif dari berbagai klip stok domain publik atau yang terjangkau, jika Anda ingin melatih model untuk menghasilkan sinar laser manusia, Anda akan perlu melatih pada klip VFX, dicuri atau dikomisi; hal-hal seperti itu tidak terjadi di tempat lain.
Even dalam kasus bencana alam lainnya, seperti banjir dramatis, bahan sumber yang tersedia tidak mungkin dapat mereproduksi POV yang dramatis pada peristiwa bencana, karena (dengan beberapa pengecualian) orang tidak biasanya melakukan live-streaming dari lokasi bencana. Oleh karena itu, ‘tampilan yang keren’ pada bencana langka dalam dataset dunia nyata, dan model AI mana pun yang dapat menghasilkannya kemungkinan besar mendapatkan informasi dari tempat lain.
Sebagian besar aliran tugas AI yang diinginkan tidak memiliki tingkat spesifisitas yang sama, dan dalam kasus seperti itu, pengaburan manfaat dari data yang dilindungi IP mungkin tidak memerlukan upaya yang cukup banyak.
Kesimpulan: Jaringan yang Terjerat
Hanya mereka yang telah menggunakan AI generatif secara ekstensif dan selama periode yang berkelanjutan akan memahami secara intuitif bahwa sistem seperti itu berjuang untuk menggabungkan konsep multiple ketika tidak ada contoh yang setara dalam data pelatihan mereka.
Batasan ini dikenal sebagai jaringan yang terjerat, di mana berbagai aspek dari konsep yang dilatih cenderung berkumpul bersama dengan elemen yang terkait, bukan memecah menjadi balok bangunan yang dapat disusun menjadi konfigurasi baru yang diinginkan pengguna.
Jaringan yang terjerat adalah lubang gravitasi arsitektur yang hampir tidak mungkin untuk melarikan diri, setidaknya untuk pendekatan berbasis difusi yang karakteristik dari semua kerangka kerja AI generatif saat ini. Namun, mungkin bahwa pendekatan baru akan muncul dalam beberapa tahun mendatang yang lebih baik dalam memecah konsep yang dilatih sehingga mereka dapat disatukan dengan lebih mudah, dan menawarkan lebih sedikit indikasi tentang asal-usul mereka.
* Saya tidak membuat tuduhan terhadap EffectMaker, tetapi berkomentar di sini tentang praktik yang muncul dalam penelitian video AI.
† Karena tembakan ini, dalam jenis film ini, telah menghasilkan dan terus menghasilkan uang.
Dipublikasikan pertama kali pada hari Senin, 16 Maret 2026












