AI-mallit ja alustat
Plagiaatin ongelma: miten generatiiviset tekoälymallit jäljittelevät tekijänoikeuden alaisia sisältöjä
Nopean edistymisen generatiivisessa tekoälyssä on herättänyt innostusta teknologian luovasta potentiaalista. Näiden voimakkaiden mallien riskit liittyvät kuitenkin tekijänoikeuden alaisten tai plagioitujen sisältöjen jäljittelemiseen ilman asianmukaista merkintää.
Miten neuroverkkomallit omaksuvat koulutusaineistoa
Nykyiset tekoälyjärjestelmät, kuten GPT-3, koulutetaan prosessin kautta, jota kutsutaan siirtymällä oppimiseksi. Ne omaksuvat massiivisia tietoja, jotka on poimittu julkisista lähteistä, kuten verkkosivuilta, kirjoista, akateemisista artikkeleista ja muista. Esimerkiksi GPT-3:n koulutusaineisto käsitti 570 gigatavua tekstiä. Koulutuksen aikana tekoäly etsii kuvioita ja tilastollisia suhteita laajassa aineistossa. Se oppii sana-, lause-, kappale-, kieli- ja muiden ominaisuuksien korrelaatiot.
Tämä mahdollistaa tekoälylle uuden, johdonmukaisen tekstin tai kuvan luomisen ennustamalla todennäköisiä jatkumoja annetun syötteen tai ohjauksen perusteella. Mutta se myös tarkoittaa, että nämä mallit omaksuvat sisältöjä ilman huomiota tekijänoikeuksien, merkitsemisen tai plagiaatin riskejä kohtaan. Tämän seurauksena generatiiviset tekoälyt voivat tahattomasti jäljitellä sana sanalta tekijänoikeuden alaisia kohtia tai parafrasoida tekijänoikeuden alaista tekstiä koulutusaineistostaan.
Tärkeitä esimerkkejä tekoälyplagiaatista
Tekoälyplagiaatin huolenaiheita nousi esiin voimakkaasti vuonna 2020 GPT:n julkaisun jälkeen.
Viimeaikaiset tutkimukset ovat osoittaneet, että suuret kielimallit (LLM) kuten GPT-3 voivat jäljitellä merkittäviä sana sanalta kohtia koulutusaineistostaan ilman lainausta (Nasr et al., 2023; Carlini et al., 2022). Esimerkiksi The New York Timesin oikeusjuttu paljasti OpenAI-ohjelmiston, joka tuotti New York Timesin artikkeleita lähes sana sanalta (The New York Times, 2023).
Nämä tulokset osoittavat, että jotkut generatiiviset tekoälyjärjestelmät voivat tuottaa pyydettäviä plagioituneita tuloksia, jotka altistavat tekijänoikeusloukkauksille. Vaikka yleisyys on edelleen epävarmaa johtuen LLM:n “mustan laatikon” luonteesta, oikeusjuttu väittää, että tällaiset tulokset muodostavat loukkauksen, mikä voisi olla merkittäviä seurauksia generatiivisen tekoälyn kehitykselle. Kokonaisuutena nämä tapaukset paljastavat, että plagiaatti on sisäänrakennettu ongelma suurissa neuroverkkomalleissa, joka vaatii valppautta ja varotoimia.
Nämä tapaukset osoittavat kaksi tärkeää tekijää, jotka vaikuttavat tekoälyplagiaatin riskeihin:
- Mallin koko – Suuremmat mallit kuten GPT-3.5 ovat alttiimpia jäljittelemään sana sanalta tekstin kohtia verrattuna pienempiin malleihin. Niiden suuremmat koulutusaineistot lisäävät altistumista tekijänoikeuden alaisiin lähteisiin.
- Koulutusaineisto – Mallit, jotka on koulutettu verkosta poimituilla tiedoilla tai tekijänoikeuden alaisilla teoksilla (jopa lisensoituina), ovat todennäköisemmin plagioimaan verrattuna malleihin, jotka on koulutettu huolellisesti valikoitujen aineistojen avulla.
Plagiaattisten tulosten yleisyyden suora mittaaminen on kuitenkin haasteellista. Neuroverkkojen “mustan laatikon” luonne tekee vaikeaksi jäljittää tätä yhteyttä koulutusaineiston ja mallin tulosten välillä. Todennäköisyydet riippuvat voimakkaasti mallin arkkitehtuurista, aineiston laadusta ja ohjausteksteistä. Mutta nämä tapaukset vahvistavat, että tällainen tekoälyplagiaatti ilmenee epäilyksettömästi, mikä on kriittistä oikeudellisista ja eettisistä näkökulmista.
Uudet plagiaatintorjuntajärjestelmät
Vastauksena tutkijat ovat alkaneet kehittää tekoälyjärjestelmiä, joilla voidaan automaattisesti havaita teksti ja kuvat, jotka on luotu mallien avulla verrattuna ihmisten luomiin. Esimerkiksi Milan tutkijat esittivät GenFace-nimisen järjestelmän, joka analysoi kielellisiä kuvioita, jotka ovat ominaisia tekoälytekstileille. Startup Anthropic on myös kehittänyt sisäisiä plagiaatintorjuntakapasiteetteja konversaatioai Claude:lle.
Näillä työkaluilla on kuitenkin rajoituksia. Suurten mallien, kuten GPT-3:n, massiivinen koulutusaineisto tekee vaikeaksi määrätä plagioituneen tekstin alkuperäisiä lähteitä, ellei se ole mahdotonta. Tarvitaan kestävämpiä menetelmiä, kun generatiiviset mallit jatkavat nopeaa kehitystään. Siihen asti manuaalinen tarkastus on välttämätöntä plagioituneiden tai rikkoavien tekoälytulosten seulontaa ennen niiden julkista käyttöä.
Parhaat käytännöt generatiivisen tekoälyplagiaatin vähentämiseksi
Tässä ovat joitakin parhaita käytäntöjä, joita sekä tekoälykehittäjät että käyttäjät voivat omaksua plagiaatintorjunnan vähentämiseksi:
Tekoälykehittäjille:
- Tarkastakaa koulutusaineiston lähteet huolellisesti, jotta vältetään tekijänoikeuden alaiset tai lisensoimattomat materiaalit ilman lupaa.
- Kehittäkää tiukat aineistodokumentaatio- ja alkuperäisyystunnisteiden seurantamenetelmät. Merkitkää metadataa, kuten lisensointia, tunnisteita, luojia jne.
- Toteuttakaa plagiaatintorjuntatyökaluja, jotta voidaan merkitä korkean riskin sisältö ennen julkaisua.
- Tarjoakaa avoimuusraportteja, jotka kuvaavat koulutusaineiston lähteitä, lisensointia ja tekoälytulosten alkuperää, kun huolenaiheita herää.
- Mahdollistakaa sisällönluojille helppo poistuminen koulutusaineistoista. Vastakaa nopeasti poistopyynnöksiin tai poistamispyynnöksiin.
Generatiivisen tekoälyn käyttäjille:
- Tarkastakaa tulokset perusteellisesti mahdollisten plagioituneiden tai merkitsemättömien kohtien varalta ennen niiden laajamittaista käyttöä.
- Älkää käsitelkö tekoälyä täysin itsenäisinä luovina järjestelminä. Anna ihmisarvioijoiden tarkastaa lopullisen sisällön.
- Suosittelemme tekoälyavusteista ihmisten luomista yksinomaan uuden sisällön luomisen sijaan. Käytätkö malleja parafrasioinnin tai ideointivälineenä.
- Tutkikaa tekoälytoimittajan palveluehtoja, sisällönkäytäntöjä ja plagiaatinsuojausten varalta ennen käyttöä. Vältätkää epäselviä malleja.
- Merkitkää lähteet selkeästi, jos tekijänoikeuden alainen materiaali ilmenee lopullisessa tuloksessa huolimatta parhaista pyrkimyksistä. Älkää esittäkö tekoälytyötä täysin alkuperäisenä.
- Rajoittakaa tulosten jakamista yksityisesti tai luottamuksellisesti, kunnes plagiaatintorjunnan riskit voidaan arvioida ja ratkaista tarkemmin.
Tiukemmat koulutusaineistojen säännökset saattavat olla myös tarpeen, kun generatiiviset mallit jatkavat lisääntymistään. Tämä voi vaatia luojilta suostumusta ennen kuin heidän työnsä lisätään aineistoihin. Mutta vastuu on sekä kehittäjillä että käyttäjillä, jotka ottavat käyttöön eettisiä tekoälykäytäntöjä, jotka kunnioittavat sisällönluojien oikeuksia.
Plagiaatti Midjourneyn V6 Alfa -versiossa
Rajoitettujen ohjauksien jälkeen Midjourneyn V6-malli joitakin tutkijoita pystyi tuottamaan lähes identtisiä kuvia tekijänoikeuden alaisten elokuviin, TV-ohjelmiin ja videopelien ruutukaappauksiin, jotka ovat todennäköisesti osa sen koulutusaineistoa.
Nämä kokeet vahvistavat edelleen, että jopa viimeisimmät visuaalisen tekoälyn järjestelmät voivat tietämättään plagioida suojattua sisältöä, jos koulutusaineiston lähteet eivät ole tarkastettuja. Se korostaa valppautta, varotoimia ja ihmisten valvontaa, kun generatiivisia malleja käytetään kaupallisesti vähentämään loukkausriskejä.
Te koälyyritysten vastaus tekijänoikeuden alaisiin sisältöihin
Ihmisen ja tekoälyn luovuuden rajat hämärtyvät, mikä luo monimutkaisia tekijänoikeuskysymyksiä. Teokset, jotka yhdistävät ihmisen ja tekoälyn syötteen, voivat olla tekijänoikeuden alaisia vain niissä osissa, jotka on toteutettu yksinomaan ihmisvoimin.
Yhdysvaltain tekijänoikeusvirasto on viime aikoina evännyt tekijänoikeuden suurimmalle osalle tekoäly-ihmisen graafisesta romaanista, pitäen tekoälytaidetta epäinhimillisenä. Se on myös antanut ohjeita, jotka sulkevat tekoälyjärjestelmät “tekijyydestä”. Liittovaltion tuomioistuimet ovat vahvistaneet tämän kannan tekoälytaiteen tekijänoikeusjutussa.
Samaan aikaan oikeusjuttu väittää, että generatiivinen tekoäly loukkaa tekijänoikeuksia, kuten Getty v. Stability AI ja taiteilijat v. Midjourney/Stability AI. Mutta ilman tekoäly-“tekijöitä” jotkut kyseenalaistavat, soveltuvatko loukkausväitteet.
Vastauksena suuret tekoälyyritykset, kuten Meta, Google (GOOGL ), Microsoft (MSFT ) ja Apple (AAPL ), ovat väittäneet, etteivät heidän tarvitse lisensointia tai maksaa rojalteja kouluttaakseen tekoälymalleja tekijänoikeuden alaisilla tiedoilla.
Tässä on yhteenveto tärkeimmistä väitteistä suurilta tekoälyyrityksiltä vastauksena mahdollisiin uusiin Yhdysvaltain tekijänoikeussääntöihin tekoälystä, mukaan lukien viitteet:
Meta väittää että lisensoinnin asettaminen nyt aiheuttaisi kaaosta ja tarjoaisi vain vähän hyötyä tekijänoikeuden haltijoille.
Google väittää ettei tekoälyn koulutus ole tekijänoikeuden loukkausta, vaan vastaa esimerkiksi kirjan lukemista (Google, 2022).
Microsoft varoittaa ettei tekijänoikeuslain muuttaminen haittaisi pieniä tekoälykehittäjiä.
Apple haluaa tekijänoikeuden tekoälykoodiin, jota ihmiset ohjaavat.
Yleisesti ottaen useimmat yritykset vastustavat uusia lisensointivaatimuksia ja vähättelevät huolenaiheita tekoälyjärjestelmien toistamista suojatuista teoksista ilman merkitsemistä. Tämä kanta on kuitenkin kiistanalainen ottaen huomioon viimeaikaiset tekoälytekijänoikeusjutut ja keskustelut.
Polkuja vastuulliseen generatiiviseen tekoälyinnovaatioon
Kun nämä voimakkaat generatiiviset mallit jatkavat kehittymistään, on tärkeää torjua plagiaattiriskejä laajan hyväksynnän saavuttamiseksi. Moniakeinen lähestymistapa on vaadittu:
- Koulutusaineiston avoimuuden, lisensoinnin ja luojien suostumisen uudistukset.
- Vahvemmat plagiaatintorjuntateknologiat ja kehittäjien sisäinen hallinto.
- Käyttäjien tietoisuuden lisääminen riskeistä ja sitoutuminen eettisiin tekoälyperiaatteisiin.
- Selkeät oikeudelliset edeltävät tapaukset ja tapauslakia tekoälytekijänoikeusasioissa.
Oikein varmistettuina tekoälyavusteinen luominen voi kukoistaa eettisesti. Mutta valvomaton plagiaatti voi heikentää merkittävästi julkista luottamusta. Suoranaisen ongelman käsittely on avain generatiivisen tekoälyn valtavan luovan potentiaalin toteuttamiseksi kunnioittaen luojien oikeuksia. Oikean tasapainon saavuttaminen edellyttää aktiivista kamppailua plagiaatin sokeaa pistettä, joka on sisäänrakennettu neuroverkkoihin. Mutta tekemällä niin, nämä voimakkaat mallit eivät horjuta sitä ihmisten älykkyyttä, jonka ne pyrkivät täydentämään.













