Andersons vinkel

Nåværende AI-praksis kan muligens aktivere en ny generasjon av opphavsrettstroll

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

En ny forskningsamarbeid mellom Huawei og akademiske miljøer antyder at mye av den viktigste nåværende forskningen innen kunstig intelligens og maskinlæring kan bli utsatt for rettslige prosesser så snart det blir kommersielt fremtredende, fordi datasettene som gjør gjennombrudd mulige, distribueres med ugyldige lisenser som ikke respekterer de opprinnelige betingelsene for de offentlige domenene som dataene ble hentet fra.

I virkeligheten har dette to nesten uunngåelige mulige resultater: at svært suksessfulle, kommersielle AI-algoritmer som er kjent for å ha brukt slike datasett, vil bli fremtidige mål for opportunistiske patenttroll hvis opphavsrett ikke ble respektert når deres data ble skrapt; og at organisasjoner og personer vil kunne bruke disse samme juridiske svakheter til å protestere mot utrulling eller spredning av maskinlærings-teknologier som de finner uakseptable.

Den artikkelen har tittelen Kan jeg bruke dette offentlig tilgjengelige datasett til å bygge kommersiell AI-programvare? Sannsynligvis ikke, og er et samarbeid mellom Huawei Canada og Huawei Kina, sammen med York University i Storbritannia og University of Victoria i Canada.

Fem av seks (populære) åpne datasett er ikke lovlig brukbare

For forskningen, ba forfatterne avdelinger i Huawei om å velge de mest ønskede åpne datasett som de ville like å utnytte i kommersielle prosjekter, og valgte de seks mest ønskede datasettene fra svarene: CIFAR-10 (en undergruppe av 80 millioner små bilder-datasettet, siden trukket tilbake på grunn av ‘nedsiktige uttrykk’ og ‘støtende bilder’, selv om dets derivater fortsatt er i bruk); ImageNet; Cityscapes (som inneholder eksklusivt originalmateriale); FFHQ; VGGFace2, og MSCOCO.

For å analysere om de valgte datasettene var egnet for lovlig bruk i kommersielle prosjekter, utviklet forfatterne en ny pipeline for å spore tilbake lisenskjeden så langt det var mulig for hver samling, selv om de ofte måtte bruke web-arkivopptak for å finne lisenser fra nå-utløpte domener, og i visse tilfeller måtte ‘gjette’ lisensstatusen fra den nærmeste tilgjengelige informasjonen.

Arkitektur for proveniens-sporsystemet utviklet av forfatterne. Kilde: https://arxiv.org/pdf/2111.02374.pdf

Arkitektur for proveniens-sporsystemet utviklet av forfatterne. Kilde: https://arxiv.org/pdf/2111.02374.pdf

Forfatterne fant at lisensene for fem av de seks datasettene ‘inneholder risikoer forbundet med minst en kommersiell brukskontekst’:

‘[Vi] observerer at, unntatt MS COCO, ingen av de studerte lisensene tillater praktikere retten til å kommersialisere en AI-modell trent på dataene eller selv utgangen av den trenede AI-modellen. Slike resultater forhindrer også effektivt praktikere fra å bruke forhånds-trente modeller trent på disse datasettene. Offentlig tilgjengelige datasett og AI-modeller som er forhåndstrent på dem, brukes kommercielt.’ *

Forfatterne påpeker videre at tre av de seks studerte datasettene også kan resultere i lisensbrudd i kommersielle produkter hvis datasettet modifiseres, siden bare MS-COCO tillater dette. Likevel er dataforbedring og under- og overmengder av innflytelsesrike datasett en vanlig praksis.

I tilfelle CIFAR-10, skapte de opprinnelige kompilatorene ingen konvensjonell form for lisens, bare krevde at prosjekter som brukte datasettet inkluderte en henvisning til den opprinnelige artikkelen som fulgte med utgivelsen av datasettet, og presenterte en ytterligere hindring for å etablere den juridiske statusen for dataene.

Videre inneholder bare CityScapes-datasett materiale som er eksklusivt generert av opphavspersonene til datasettet, og ikke ‘kuratert’ (skrapt) fra nett-kilder, med CIFAR-10 og ImageNet som bruker multiple kilder, hver av dem som ville trenge å bli undersøkt og sporet tilbake for å etablere noen form for opphavsrett-mekanisme (eller selv en meningsfull fraskrivelse).

Ingen Veien Ut

Det finnes tre faktorer som kommersielle AI-selskaper synes å være avhengige av for å beskytte seg mot rettslige prosesser rundt produkter som har brukt opphavsrettslig beskyttet innhold fra datasett fritt og uten tillatelse, for å trene AI-algoritmer. Ingen av disse tilbyr mye (eller noen) pålitelig langtidsbeskyttelse:

1: Laissez Faire Nasjonale Lover
Selv om regjeringer over hele verden er tvunget til å løsne lover rundt data-skraping i et forsøk på ikke å falle bak i kappløpet mot performant AI (som avhenger av store volumer av virkelige data, hvorvan vanlig opphavsrett- og lisenssamtykke ville være urealistisk), tilbyr bare USA fullstendig immunitet i denne henseende, under Fair Use-doktrinen – en politikk som ble ratifisert i 2015 med konklusjonen av Authors Guild v. Google, Inc., som fastslo at søkegiganten kunne fritt innta opphavsrettslig beskyttet materiale for sin Google Books-prosjekt uten å bli anklaget for krenkelse.

Hvis Fair Use-doktrinen-politikken noen gang endres (dvs. som respons på en annen milepæl-sak som involverer tilstrekkelig mektige organisasjoner eller selskaper), ville det sannsynligvis bli betraktet som en a priori-tilstand i forhold til å utnytte nåværende opphavsrett-krenkende databaser, beskytte tidligere bruk; men ikke gående bruk og utvikling av systemer som ble muliggjort gjennom opphavsrettslig beskyttet materiale uten avtale.

Dette plasserer den nåværende beskyttelsen av Fair Use-doktrinen på en svært midlertidig basis, og kunne potensielt, i den situasjonen, kreve etablerte, kommersielle maskinlærings-algoritmer å slutte å fungere i tilfeller hvor deres opphav var muliggjort av opphavsrettslig beskyttet materiale – selv i tilfeller hvor modellens vekt nå omhandler eksklusivt tillatte innhold, men ble trenet på (og gjort nyttig av) ulovlig kopiert innhold.

Utenfor USA, som forfatterne påpeker i den nye artikkelen, er politikken generelt mindre velvillig. Storbritannia og Canada gir bare immunitet for bruk av opphavsrettslig beskyttet data for ikke-kommersielle formål, mens EUs Tekst- og Data-mining-lov (som ikke har blitt fullstendig erstattet av nåværende forslag for mer formell AI-regulering) også ekskluderer kommersiell utnyttelse for AI-systemer som ikke samtykker til opphavsrettskravene til de opprinnelige dataene.

Disse sistnevnte ordningene betyr at en organisasjon kan oppnå store ting med andres data, opp til – men ikke inkludert – punktet hvor de gjør penger av det. På det stadium ville produktet enten bli juridisk eksponert, eller avtaler ville trenge å bli inngått med bokstavelig talt millioner av opphavsrettsholdere, mange av dem som nå er usporbare på grunn av internettets skiftende natur – en umulig og uaffordérbar prospekt.

2: Caveat Emptor
I tilfeller hvor krenkende organisasjoner håper å skyve skylden over på andre, observerer den nye artikkelen også at mange lisenser for de mest populære åpne datasettene selv-fraskriver seg mot noen krav på opphavsrett-misbruk:

‘For eksempel, krever ImageNets lisens at praktikere fraskriver seg ImageNet-teamet mot noen krav som oppstår fra bruk av datasettet. FFHQ, VGGFace2 og MS COCO-datasettene krever at datasettet, hvis det distribueres eller modifiseres, presenteres under samme lisens.’

Effektivt tvinger dette de som bruker FOSS-datasett til å absorbere skyld for bruk av opphavsrettslig beskyttet materiale, i møte med eventuell rettslig prosess (selv om det ikke nødvendigvis beskytter de opprinnelige kompilatorene i en sak hvor den nåværende ‘sikker havn’-klimaet er kompromittert).

3: Fraskrivelse Gjennom Ukjenthet
Det kollektive natur av maskinlærings-samfunnet gjør det ganske vanskelig å bruke korporativ okkultisme til å skjule tilstedeværelsen av algoritmer som har nytt av opphavsrett-krenkende datasett. Langsiktige kommersielle prosjekter begynner ofte i åpne FOSS-miljøer hvor bruk av datasett er en sak som er offentlig tilgjengelig, på GitHub og andre offentlig tilgjengelige forum, eller hvor opphavet til prosjektet har blitt publisert i preprint eller fagfellevurderte artikler.

Selv når dette ikke er tilfelle, er modell-inversjon i økende grad i stand til å avsløre de typiske karakteristikkene til datasett (eller selv uttrykke noen av kilde-materialet), enten som bevis i seg selv, eller nok mistanke om krenkelse til å muliggjøre rettslig bestemt tilgang til historien om algoritmens utvikling, og detaljer om datasettene som ble brukt i den utviklingen.

Konklusjon

Artikkelen skildrer en kaotisk og ad-hoc bruk av opphavsrettslig beskyttet materiale som er hentet uten tillatelse, og en rekke lisens-kjeder som, hvis de følges logisk så langt tilbake som mulig til den opprinnelige kilden til dataene, ville kreve forhandlinger med tusenvis av opphavsrettsholdere hvis arbeid ble presentert under auspisene av nettsteder med en rekke ulike lisens-betingelser, mange som ekskluderer deriverte kommersielle verk.

Forfatterne konkluderer:

‘Offentlig tilgjengelige datasett brukes i stor utstrekning til å bygge kommersiell AI-programvare. En kan gjøre dette hvis [og] bare hvis lisensen som er knyttet til det offentlig tilgjengelige datasett gir rett til å gjøre det. Likevel er det ikke lett å verifisere rettighetene og forpliktelsene som er gitt i lisensen som er knyttet til de offentlig tilgjengelige datasettene. Fordi, iblant er lisensen enten uklar eller potensielt ugyldig.’

En ny artikkel, med tittelen Bygging av Juridiske Datasett, utgitt den 2. november fra Centre for Computational Law ved Singapore Management University, understreker også behovet for data-vitenskapsmenn å erkjenne at ‘vill vesten’-æraen for ad-hoc data-innsamling er på vei mot slutten, og speiler anbefalingene i Huawei-artikkelen om å adoptere mer strenge vaner og metoder for å sikre at datasett-bruk ikke eksponerer et prosjekt for juridiske konsekvenser når kulturen endrer seg over tid, og når den nåværende globale akademiske aktiviteten i maskinlærings-sektoren søker en kommersiell avkastning på årevis av investering. Forfatteren observerer*:

‘[Den] samlingen av lovgivning som berører ML-datasett er satt til å vokse, blant bekymringer om at nåværende lover tilbyr utilstrekkelige beskyttelse. Utkastet til EU kunstig intelligens-akt, hvis og når det blir vedtatt, ville betydelig endre AI- og data-styrings-landskapet; andre jurisdiksjoner kan følge suit med sine egne akter. ‘

 

* Min konvertering av inline-citater til lenker

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai