Andersonin kulma

Tekoälypohjaiset generatiiviset kirjoitusmallit kopioivat usein “kopioi ja liitä” -lähtödataa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Amerikkalainen näytelmäkirjailija ja yrittäjä Wilson Mizner on usein kuuluisasti lainattu sanomalla “Kun varastat yhdestä kirjailijasta, se on plagiointia; jos varastat monelta, se on tutkimusta”.

Vastaavasti, uuden sukupolven tekoälypohjaisten luovan kirjoittamisen järjestelmien oletus on, että heille koulutusvaiheessa syötetyt valtavat määrät dataa ovat johtaneet aidon abstraktion korkean tason käsitteistä ja ideoista; että nämä järjestelmät ovat käytettävissään tuhansien osallistuvien kirjailijoiden tiivistetty viisaus, josta tekoäly voi muodostaa innovatiivisia ja alkuperäisiä kirjoituksia; ja että näiden järjestelmien käyttäjät voivat olla varmoja, etteivät he tee tahattomasti plagiointia tekoälyn välityksellä.

Tämä oletus haastetaan uudessa tutkimusraportissa, jossa on todettu, että koneoppimiseen perustuvat generatiiviset kielen mallit, kuten GPT-sarja, “kopioivat toisinaan jopa hyvin pitkiä tekstejä” ilman lainausta.

Joissakin tapauksissa tutkijat huomauttavat, että GPT-2 toistaa yli 1 000 sanaa koulutusaineistosta tulosteessaan.

Tutkimusraportti on nimeltään How much do language models copy from their training data? Evaluating linguistic novelty in text generation using RAVEN, ja se on yhteistyö Johns Hopkinsin yliopiston, Microsoft Researchin, New Yorkin yliopiston ja Facebook AI Researchin välillä.

RAVEN

Tutkimus käyttää uutta lähestymistapaa, jota kutsutaan RAVENiksi (RAtingVErbalNovelty), jonka akronyymi on huvittavasti muokattu heijastamaan klassisen runon pahista:

‘Tämä akronyymi viittaa Edgar Allan Poen runoon “The Raven”, jossa kertoja kohtaa mystisen korpin, joka toistaa sanaa “Nevermore!” Kertoja ei voi sanoa, onko korppi vain toistamassa kuulemaansa vai luomassa omia lauseitaan (ehkä yhdistämällä sanat “never” ja “more”) – sama perus epäselvyys, jonka tutkimus käsittelee.’

Tutkimuksen tulokset tulevat keskellä suurta kasvua tekoälypohjaisille sisällöntuottamisjärjestelmille, jotka pyrkivät korvaamaan “yksinkertaiset” editointitehtävät ja jopa kirjoittamaan täysimittaisia sisältöjä. Yksi tällainen järjestelmä sai 21 miljoonan dollarin rahoituksen sarjassa A viime viikolla.

Tutkijat huomauttavat, että ‘GPT-2 toistaa joskus koulutuslauseita, jotka ovat yli 1 000 sanaa pitkiä. (heidän korostuksensa), ja että generatiiviset kielimallit välittävät kielellisiä virheitä lähdemateriaalissa.

Tutkimuksessa tarkasteltiin GPT-sarjan julkaisuja GPT-2:een asti (kirjoittajilla ei ollut pääsyä GPT-3:een tuolloin), Transformer, Transformer-XL ja LSTM.

Uudelleenluominen

Tutkimusraportti toteaa, että GPT-2 luo uusia sanoja, kuten ‘Swissified’ ja ‘IKEA-ness’, jotka eivät ole GPT-2:n koulutusaineistossa, ja luo nämä uudet sanat kielellisistä periaatteista, jotka perustuvat korkeampiin ulottuvuuksiin, jotka on vahvistettu koulutuksen aikana.

Tulokset osoittavat myös, että ’74 %:ssa Transformer-XL:n generoimista lauseista on syntaktinen rakenne, jota ei ole koulutusaineistossa’, mikä viittaa siihen, että ‘neuraaliset kielimallit eivät pelkästään muista; ne käyttävät tuottavia prosesseja, jotka sallivat niiden yhdistää tuttuja osia uudella tavalla.’

Näin ollen yleistäminen ja abstraktio pitäisi tuottaa innovatiivisia ja uusia tekstejä.

Tiedon toisto voi olla ongelma

Tutkimusraportti esittää, että pitkät ja sanasta sanaan kopioidut lainaukset, jotka luodaan luonnollisen kielen generoimisjärjestelmillä, voivat tulla “upotetuksi” tekoälymalliin, koska alkuperäinen lähdemateriaali toistetaan useita kertoja aineistoissa, jotka eivät ole riittävästi poistettu.

Vaikka toisessa tutkimushankkeessa on todettu, että täydellinen tekstin toisto voi tapahtua, vaikka lähdemateriaali esiintyy vain kerran aineistossa, tutkijat toteavat, että tämä hanke on erilainen konseptuaalisesti verrattuna yleisiin sisällöntuottamiseen käytettäviin tekoälyjärjestelmiin.

Tutkijat myös huomauttavat, että dekoodauskomponentin muuttaminen kieligeneraattorijärjestelmissä voi lisätä uudelleenluomista, mutta he löysivät testeistä, että tämä tapahtuu tulosteen laadun kustannuksella.

Lisäksi ongelmia syntyy, kun aineistot, jotka tukevat sisällöntuottamisalgoritmeja, kasvavat. Lisäksi siitä, että ne vaikeuttavat koulutusaineiston esikäsittelyä, laadunvarmistusta ja poistamista, monia perusvirheitä säilyy lähdemateriaalissa, jotka sitten välittyvät tekoälyn tuottamassa sisällössä.

Tutkijat toteavat*:

‘Viimeaikaiset koulutusjoukon kokojen kasvut tekevät siitä erityisen tärkeää tarkistaa uudelleenluomista, koska näiden koulutusjoukkojen suuruus voi rikkoa meidän intuitiomme siitä, mitä voidaan odottaa tapahtuvan luonnostaan. Esimerkiksi jotkut merkittävät työt kielen oppimisessa perustuvat oletukseen, että säännölliset menneiden aikamuotojen epäsäännöllisistä verbeistä (esim. becomed, teached) eivät esiinny oppijan kokemuksessa, joten jos oppija tuottaa tällaisia sanoja, ne on uusia oppijalle.

‘Kuitenkin käy ilmi, että kaikissa 92 perus epäsäännöllisessä verbissä englannin kielessä väärä säännöllinen muoto esiintyy GPT-2:n koulutusaineistossa.’

Lisää datan kuratointia tarvitaan

Tutkimusraportti väittää, että enemmän huomiota on kiinnitettävä uudelleenluomiseen generatiivisten kielimallien muodostamisessa, erityisesti varmistamalla, että “pidätetty” testiosuus aineistosta (osa lähdemateriaalia, joka on pidätetty sen arvioimiseksi, kuinka hyvin lopullinen algoritmi on arvioinut pääasiallista koulutusaineistoa) on sovelias tehtävään.

‘Koneoppimisessa on tärkeää arvioida malleja pidätetyllä testijoukolla. Tekstigeneraation avoimen luonteen vuoksi mallin generoima teksti voi olla kopioiden koulutusaineistosta, jolloin sitä ei voida käyttää mallin arvioimiseen (esim. yhdenmukaisuuden tai kieliopin vuoksi).’

Tutkijat myös toteavat, että enemmän huomiota on kiinnitettävä tekoälymallien tuottamiseen Eliza-ilmiön vuoksi, joka on oireyhtymä, joka tunnistettiin vuonna 1966 ja joka määritteli “ihmisten alttiuden lukea paljon enemmän ymmärrystä kuin on perusteltua symbolien ketjuun – erityisesti sanoihin – jotka tietokoneet ovat yhdistäneet”.

* Minun muutos inline-lainauksista hyperlinkkeihin

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: [email protected]