Anderson’un Açısı

Mevcut AI Uygulamaları Yeni Bir Nesil Telif Hakkı Trollerini Etkinleştirebilir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Huawei ve akademik bir işbirliği arasında yapılan yeni bir araştırma, yapay zeka ve makine öğrenimi alanındaki en önemli güncel araştırmaların büyük bir kısmının, ticari olarak önemli hale geldiğinde dava konusu olabileceğini öne sürüyor. Bunun nedeni, bu araştırmaları mümkün kılan verisetlerinin, kamu alanlarından elde edilen verilerin orijinal şartlarını saygı göstermeyen geçersiz lisanslar ile dağıtılmasıdır.

Bu durum, neredeyse iki olası sonucu beraberinde getirir: ticari olarak başarılı, ticarileştirilmiş AI algoritmalarının, bu tür verisetlerini kullandıkları bekannt olduğu için, gelecekte oportunistik telif hakkı trollerinin hedefi haline gelebilecekleri ve organizasyonların ve bireylerin, bu yasal zayıflıkları kullanarak, itiraz ettikleri makine öğrenimi teknolojilerinin dağıtımını veya yayılmasını protest edebilecekleri.

Makale, Kamuya açık bir verisetini ticari AI yazılımı oluşturmak için kullanabilir miyim? Muhtemelen hayır başlığını taşıyor ve Huawei Kanada ve Huawei Çin ile birlikte İngiltere’deki York Üniversitesi ve Kanada’daki Victoria Üniversitesi arasında bir işbirliği sonucu ortaya çıktı.

Altıdan Beş (Popüler) Açık Kaynaklı Veriseti Yasal Olarak Kullanılamıyor

Araştırmacılar, Huawei’deki bölümlerden, ticari projelerde kullanmak istedikleri en arzu edilen açık kaynaklı verisetlerini seçmelerini istedi ve yanıtlardan altı en çok istenen verisetini seçti: CIFAR-10 ( 80 milyon küçük resim verisetinin bir alt kümesi, çünkü geri çekildi ‘küfürlü terimler’ ve ‘suçlayıcı resimler’ nedeniyle, ancak türevleri yaygınlaşıyor); ImageNet; Cityscapes (exclusively orijinal materyal içerir); FFHQ; VGGFace2, ve MSCOCO.

Seçilen verisetlerinin ticari projelerde yasal olarak kullanılabilirliğini analiz etmek için, araştırmacılar her bir set için lisans zincirini mümkün olduğunca geri izlemek için yeni bir pipeline geliştirdiler, ancak souvent web arşivlerinden lisansları bulmak zorunda kaldılar ve bazı durumlarda en yakın mevcut bilgilere dayanarak lisans durumunu “tahmin etmek” zorunda kaldılar.

Araştırmacılar tarafından geliştirilen kökenini izleme sisteminin mimarisi. Kaynak: https://arxiv.org/pdf/2111.02374.pdf

Araştırmacılar tarafından geliştirilen kökenini izleme sisteminin mimarisi. Kaynak: https://arxiv.org/pdf/2111.02374.pdf

Araştırmacılar, altı verisetinin beşinin ‘en az bir ticari kullanım bağlamında riskler içerdiğini’ buldu:

‘Gözlemlerimize göre, MS COCO hariç, çalışılan hiçbir lisans, uygulayıcıların veriden eğitilmiş bir AI modelini ticari olarak kullanma veya hatta eğitilmiş AI modelinin çıktısını kullanma hakkını vermez. Bu, uygulayıcıların bu verisetlerinden eğitilmiş önceden eğitilmiş modelleri bile kullanmalarını engeller.’ *

Araştırmacılar ayrıca, altı çalışılan verisetinin üçünün, verisetinin değiştirilmesi durumunda ticari ürünlerde lisans ihlaliyle sonuçlanabileceğini belirtiyorlar, çünkü yalnızca MS-COCO böyle bir değişikliği允许 ediyor. Ancak veri artırımı ve alt kümeler ve üst kümeler etkili verisetlerinin ortak bir uygulamasıdır.

CIFAR-10 durumunda, orijinal derleyiciler, verisetini kullanan projelerin orijinal makaleye atıfta bulunmasını gerektiren geleneksel bir lisans oluşturmadılar, bu da verilerin yasal durumunu belirlemeyi daha da zorlaştırdı.

Dahası, yalnızca CityScapes veriseti, orijinatörler tarafından oluşturulan münhasır materyali içerir, diğerleri ise ağ kaynaklarından “derlenen” (çıkarılan) verilerdir, bu da her birinin telif hakkı mekanizmasını veya anlamlı bir feragatnameyi belirlemek için izlenmesi gereken çok sayıda kaynak anlamına gelir.

Çıkış Yok

Ticari AI şirketleri, telif hakkı ihlali nedeniyle davalardan korunmak için üç faktöre güveniyorlar, ancak bunlar güvenilir uzun vadeli koruma sağlamıyor:

1: Laissez Faire Ulusal Yasalar
Dünyadaki hükümetler, veri kazıma laws aroundını gevşetmek zorunda kalıyorlar, böylece AI yarışında geri kalmıyorlar (bu, düzenli telif hakkı uyumu ve lisanslama için gerçek dünya verilerinin büyük hacimlerine dayanır), ancak yalnızca ABD, Adil Kullanım Doktrini altında tam bağışıklık sunuyor – 2015 yılında sonuçlanan Authors Guild v. Google, Inc. davası ile onaylanan bir politika, arama devinin Google Books projesi için telif hakkı materyallerini serbestçe almasına izin verdi.

Eğer Adil Kullanım Doktrini politikası bir gün değişirse (yani, yeterli güce sahip organizasyonlar veya şirketler arasındaki başka bir önemli dava nedeniyle), bu, mevcut telif hakkı ihlali veritabanlarının kullanılmasını korur, ancak yalnızca geçmişte yapılan kullanım için, değil de devam eden kullanım ve geliştirme için.

Bu, Adil Kullanım Doktrini korumasını çok geçici bir temelde bırakıyor ve potansiyel olarak, bu senaryoda, ticari olarak başarılı AI algoritmalarının, telif hakkı ihlali verilerine dayandıkları için, çalışmayı durdurma zorunda kalabilecekleri anlamına geliyor.

ABD dışında, yazarlar yeni makalede belirttiği gibi, politikalar genellikle daha az müsamahakâr. İngiltere ve Kanada, yalnızca ticari olmayan amaçlar için telif hakkı materyallerinin kullanılmasını muaf tutuyor, जबकi AB’nin Metin ve Veri Madenciliği Yasası (son AI düzenleme önerileri tarafından tamamen geçersiz kılınmadı) da AI sistemleri için ticari kullanımını dışlıyor.

Bu düzenlemeler, bir organizasyonun başkalarının verilerini kullanarak büyük şeyler başarmasına izin veriyor, ancak para kazandırmaya başladıklarında, ürün ya yasal olarak açık hale geliyor ya da telif hakkı sahipleri ile anlaşmalar yapılması gerekiyor – ki bu, birçok telif hakkı sahibinin izini sürmek ve onlara ulaşmak imkansız ve pahalı bir görev.

2: Caveat Emptor
Telif hakkı ihlali iddialarından sorumlu tutulmaktan kaçınan organizasyonlar için, yeni makale ayrıca, en popüler açık kaynaklı verisetlerinin birçok lisansının, kullanıcıları herhangi bir telif hakkı ihlali iddiasından sorumlu tuttuğunu gözlemliyor:

‘Örneğin, ImageNet lisansı, uygulayıcıların verisetini kullandıkları takdirde, ImageNet ekibini herhangi bir iddia karşısında sorumlu tutmasını gerektirir. FFHQ, VGGFace2 ve MS COCO verisetleri, verisetinin dağıtılması veya değiştirilmesi durumunda, aynı lisans altında sunulmasını gerektirir.’

Bu, FOSS verisetlerini kullananların, eventual dava durumunda, telif hakkı ihlali materyallerinin kullanılmasından sorumlu olmasını sağlıyor (ancak bu, orijinal derleyicileri, “güvenli liman” ikliminin bozulduğu durumlarda korumuyor).

3: Belirsizlik prostřednictvím Obscurity
Makine öğrenimi topluluğunun işbirlikçi doğası, algoritmaların telif hakkı ihlali verisetlerinden faydalandıklarını gizlemeyi oldukça zorlaştırıyor. Uzun vadeli ticari projeler genellikle, verisetlerinin kullanımının kaydedildiği açık FOSS ortamlarında veya preprint ya da hakemli makalelerde yayınlanan projelerin kökenlerinde başlıyor.

Bununla birlikte, model inversion artık verisetlerinin tipik özelliklerini ortaya çıkarabiliyor ya da açıkça bazı kaynak materyallerini üretebiliyor, bu da ya itself kanıt ya da telif hakkı ihlali şüphesi için yeterli oluyor ve mahkeme tarafından emredilen, algoritmanın geliştirilme geçmişine ve kullanılan verisetlerine erişimine izin veriyor.

SONUÇ

Makale, izin alınmadan elde edilen telif hakkı materyallerinin kaotik ve plansız kullanımını ve bir dizi lisans zincirini tasvir ediyor, bu zincirlerin mantıksal olarak orijinal verilerin kaynağına kadar izlenmesi, binlerce telif hakkı sahibi ile görüşmek gerekeceği anlamına geliyor, ki bu da imkansız ve pahalı bir görev.

Araştırmacılar şöyle diyor:

‘Kamuya açık verisetleri, ticari AI yazılımları oluşturmak için yaygın olarak kullanılıyor. Bunu yapmak mümkün, ancak ve ancak kamuya açık verisetine bağlı lisans, bunu yapma hakkını sağlıyor. Ancak, kamuya açık verisetlerine bağlı lisanslarda belirtilen hak ve yükümlülükleri doğrulamak kolay değil. Çünkü bazen lisans belirsiz veya potansiyel olarak geçersiz.’

Singapur Yönetim Üniversitesi’ndeki Hesaplamalı Hukuk Merkezi’nden yeni bir çalışma, Yasal Verisetleri Oluşturma, 2 Kasım’da yayınlandı ve Huawei makalesinin tavsiyelerini yineliyor, veri bilimcilerinin, “vahşi batı” veri toplama döneminin sona erdiğini ve daha sıkı alışkanlıklar ve metodolojiler benimsemeleri gerektiğini vurguluyor, böylece veriseti kullanımının yasal sonuçlara yol açmasını önleyebiliyorlar. Yazar şöyle diyor*:

‘[Veri] yasalarının ML verisetlerini etkileyen yasa corpusu büyümeye ayarlanıyor, mevcut yasaların yetersiz koruma sağladığı endişeleri arasında. EU Yapay Zeka Yasası taslağı, eğer ve когда kabul edilirse, AI ve veri yönetim alanını önemli ölçüde değiştirecek; diğer yargı bölgeleri de kendi yasalarını takip edebilir. ‘

 

* İç referansları hyperlinklere dönüştürme

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai