AI-mallit ja alustat
Sanojen uudelleenmuokkaus käyttäen syvää vahvistusoppimista – Ajattelijat

Kun kirjoitamme tai puhumme, olemme kaikki joskus miettineet, onko parempi tapa viestiä ajatuksia muiden kanssa. Mitkä sanat minun pitäisi käyttää? Miten minun pitäisi rakentaa ajatus? Miten he todennäköisesti vastaavat? Phraseessa viettämme paljon aikaa miettimällä kieltä – mitä toimii ja mitä ei.
Kuvittele, että kirjoitat aiheen rivin sähköpostikampanjaan, joka lähetetään 10 miljoonalle ihmiselle luettelossasi ja tarjoaa 20 % alennusta uudesta, hienosta kannettavasta tietokoneesta.
Mikä rivi sinä valitsisit:
- Voit nyt saada 20 % alennuksen seuraavasta tilauksestasi
- Valmistaudu – 20 % alennus
Vaikka ne välittävät saman tiedon, toinen saavutti lähes 15 % korkeamman avausprosentin kuin toinen (ja uskon, että voit voittaa mallimme, joka ennustaa, kumpi on kumpi? ). Vaikka kieltä voidaan usein testata A/B-testauksen tai monikäsisellä rosvoilla , sanojen uudelleenmuokkaus automaattisesti on edelleen haasteellinen tutkimusongelma.
Kaksi lausetta pidetään toistensa paraphraaseina, jos ne jakavat saman merkityksen ja voidaan käyttää vaihtelevasti. Toinen tärkeä asia, jota usein otetaan itsestäänselväksi, on se, onko koneella luotu lause sulava.
Toisin kuin valvottu oppiminen, vahvistusoppimisen (RL) agentit oppivat vuorovaikuttaessa ympäristönsä kanssa ja havaitsemalla palkinnot, joita he saavat tuloksena. Tämä hieman hienostunut ero on massiivisia vaikutuksia siinä, miten algoritmit toimivat ja miten mallit koulutetaan. Syvä vahvistusoppiminen käyttää neuroverkkoja funktioarvioijana, jotta agentti voi oppia, miten ylittää ihmiset monimutkaisissa ympäristöissä, kuten Go , Atari ja StarCraft II .
Vaikka vahvistusoppimisella on ollut menestystä, sitä ei ole laajasti sovellettu todellisiin ongelmiin, mukaan lukien luonnollisen kielen prosessointi (NLP).
Olen osana MSc-tutkintoa tieteen tiedekunnassa , osoitamme, miten syvä vahvistusoppiminen voidaan käyttää ylittämään valvottujen oppimismenetelmien tuloksia sanojen automaattisessa uudelleenmuokkausprosessissa. Parhaan paraphraasin luomisongelmaa voidaan pitää sarjana sanoja, jotka maksimoivat semanttisen samankaltaisuuden lauseiden välillä ja ylläpitävät sulavuutta tulosteessa. RL-agentit ovat hyvin sovellettavissa parhaiden toimien löytämiseen saadakseen maksimaalisen odotetun palkkion ohjausympäristössä.
Toisin kuin useimmissa koneoppimisen ongelmista, suurin ongelma useimmissa luonnollisen kielen generoinnin (NLG) sovelluksissa ei ole mallinnuksessa vaan arvioinnissa. Vaikka ihmisen arviointi on tällä hetkellä kultainen standardi NLG-arvioinnissa, se kärsii merkittävistä haitoista, mukaan lukien se, että se on kallista, aikaa vievää, haastavaa säätää ja puutteellista johdonmukaisuutta kokeiden ja tietojoukkojen välillä (Han, 2016) . Tämän seurauksena tutkijat ovat pitkään etsineet automaattisia mittareita, jotka ovat yksinkertaisia, yleistettävissä ja heijastavat ihmisten tuomioita (Papineni et al., 2002) .
Yleisimmät automaattiset arviointimenetelmät koneella luotujen kuvakuvauksien arvioinnissa on yhteenvetona alla olevassa taulukossa:

Sanojen uudelleenmuokkaus vahvistusoppimisen avulla
Kehitimme järjestelmän nimeltä ParaPhrasee, joka luo laadukkaita paraphraaseja. Järjestelmä koostuu useista vaiheista, jotta vahvistusoppimista voidaan soveltaa laskennallisesti tehokkaalla tavalla. Yleisen tason pipeline on esitetty alla, ja lisätietoja on tutkielmassa .

Tietojoukko
On olemassa useita paraphraaseja, joita voidaan käyttää tutkimuksessa, mukaan lukien Microsoft Paraphrase-korpus (MSFT ) , ACL:n semanttisen tekstin samankaltaisuuskilpailu, Quora Duplicate Questions ja Twitter Shared Links . Olemme valinneet MS-COCO sen koosta, puhtaudasta ja käytöstä vertailukohtana kahdessa merkittävässä paraphraasin luomisessa. MS-COCO sisältää 120k kuvia yleisistä kohtauksista ja 5 kuvatekstiä kullekin kuvalle, jotka on annettu 5 eri ihmisen annotoijan toimesta.
Vaikka se on pääasiassa suunniteltu tietokoneen näön tutkimukseen, kuvatekstit ovat usein hyvin samankaltaisia ja ovat mielenkiintoisia paraphraaseja. Koska kuvatekstit on annettu eri ihmisille, ne ovat usein hieman erilaisia yksityiskohtia, jotka on annettu kohtauksessa, joten luodut lauseet usein kuvittelevat yksityiskohtia.

Valvottu malli
Vaikka vahvistusoppiminen on parantunut merkittävästi näytteiden tehokkuuden, koulutusajat, yleiset parhaat käytännöt ja kaiken, vahvistusoppimisen mallien koulutus alusta alkaen on edelleen verrattain hyvin hidas ja epävakaa (Arulkumaran et al., 2017) . Sen sijaan, että koulutamme alusta alkaen, koulutamme ensin valvotun mallin ja sitten hienosäätämme sen vahvistusoppimisen avulla.
Käytämme koodarin-dekooderin mallirakennetta ja arvioimme useiden perusvalvottujen mallien suorituskykyä. Kun hienosäätämme mallia vahvistusoppimisen avulla, hienosäätämme vain dekooderin verkkoa ja käsittelimme koodarin verkkoa staattisena. Tällöin meillä on kaksi pääkehystä:
- Koulutamme valvotun mallin alusta alkaen käyttäen standard / perus koodarin-dekooderin GRU: n kanssa
- Käytämme esikoulutettuja lauseen upottamismalleja koodaajana, mukaan lukien: pooled sana upotukset (GloVe), InferSent ja BERT
Valvotut mallit suorittavat melko samanlaisesti eri malleissa, ja BERT ja perus koodari-dekooderi saavuttavat parhaimman suorituskyvyn.

Vaikka suorituskyky on melko hyvä, on kolme yleistä virhelähdettä: tatuointi, lauseen fragmenttien luominen ja hallusinaatiot. Nämä ovat pääongelmia, joita vahvistusoppimisen avulla pyritään ratkaisemaan.

Vahvistusoppimisen malli
Vahvistusoppimisalgoritmien toteuttaminen on erittäin haasteellista, etenkin kun et tiedä, voidaanko ongelmaa ratkaista. On ongelmia ympäristön, agenttien, hyperparametrien, palkkiofunktion toteutuksessa tai kaikissa näissä yhdistelminä. Nämä ongelmat ovat pahempia, kun teet syvää vahvistusoppimista, koska saat lisäksi neuroverkkojen virheenkorjaamisen haasteen.
Kuten kaikessa virheenkorjaamisessa, on tärkeää aloittaa yksinkertaisesti . Toteutimme kaksi hyvin ymmärrettyä leikkimällistä vahvistusoppimisympäristöä (CartPole ja FrozenLake) testataksemme vahvistusoppimisalgoritmeja ja löytääksemme toistettavan strategian tietojen siirtämiseksi valvotusta mallista.
Löysimme, että toimija-kriittinen algoritmi suoritti paremmin kuin REINFORCE näissä ympäristöissä. Toimijan painotusten alkuarvon asettaminen koulutetun valvotun mallin kanssa ja kriittisen esikoulutus saavutti parhaimman suorituskyvyn. Löysimme, että se oli haasteellista yleistää monimutkaisia käyttäjän politiikan tislaamismenetelmiä uusiin ympäristöihin, koska ne esittävät monia uusia hyperparametrejä, jotka vaativat säätämistä, jotta ne toimisivat.
Tuetuin näistä oivalluksista me käänsimme huomion kehittämään lähestymistapaa sanojen uudelleenmuokkausongelmaan. Meidän on ensin luotava ympäristö.

Ympäristö mahdollistaa meille helposti testata eri arviointimittareiden vaikutusta palkkiofunktioina.
Sitten määritämme agentin, ja sen monien etujen vuoksi käytämme toimija-kriittistä arkkitehtuuria. Toimija valitsee seuraavan sanan sanajonossa ja sen painot on alkuarvo koulutetulla valvotulla mallilla. Kriittinen antaa arvion odotetusta palkkiosta, jonka tila todennäköisesti saa, jotta toimija voi oppia.
Oikean palkkiofunktion suunnittelu
Vahvistusoppimisen järjestelmän tärkein komponentti on palkkiofunktiota, koska se on se, mihin vahvistusoppimisen agentti pyrkii optimoimaan. Jos palkkiofunktiota on virheellinen, tulokset kärsivät, vaikka kaikki muu järjestelmässä toimisi!
Perinteinen esimerkki tästä on CoastRunners , jossa OpenAI-tutkijat asettivat palkkiofunktioksi yhteispistemäärän maksimoinnin eikä voittanut kilpailua. Tuloksena agentti keksi silmukan, jossa se sai korkeimman pistemäärän osallistumalla turboihin ilman, että se koskaan suorittaisi kilpailua (ja uskon, että voit voittaa mallimme, joka ennustaa, kumpi on kumpi? ).
https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title
Koska paraphraasien laadun arviointi itsessään on ratkaisematon ongelma, palkkiofunktion suunnittelu, joka ottaa automaattisesti tämän tavoitteen, on vielä haasteellisempi. Useimmat kielen osa-alueet eivät pureudu kauniisti lineaarisiin mittareihin ja ovat tehtävänriippuvaisia (Novikova et al., 2017) .
Vahvistusoppimisen agentti usein löytää mielenkiintoisen strategian palkkioiden maksimoinnille, joka hyödyntää arviointimittauksen heikkouksia eikä luo korkealaatuista tekstiä. Tämä johtaa yleensä heikkoon suorituskykyyn mittareilla, joita agentti ei suoraan optimoi.
Tutkimme kolmea päälähestymistapaa:
- Sanan ylialemittaus
Yleiset NLP-arviointimitat ottaa huomioon sanan ylialemittausprosentin luodun paraphraasin ja arviointilauseen välillä. Mitä suurempi ylialemitta, sitä suurempi palkkio. Haaste sanatasolla on, että agentti sisältää liian monta yhdistävää sanaa, kuten “on yksi” ja siinä ei ole mitään sulavuuden mittaria. Tämä johtaa erittäin matalan laatuisiin paraphraaseihin.

- Lauseen tasolla oleva samankaltaisuus ja sulavuusmittaukset
Luodun paraphraasin pääominaisuudet ovat, että se on sulava ja semanttisesti samankaltainen kuin syötelause. Siksi yritämme arvioida nämä yksin ja yhdistää mittaukset. Semanttisen samankaltaisuuden osalta käytämme kosini samankaltaisuutta esikoulutetuista mallien lauseen upotuksista, kuten BERT. Sulavuuden osalta käytämme pisteytystä, joka perustuu lauseen hämmästyneisyyteen GPT-2: sta . Mitä suurempi kosini samankaltaisuus ja sulavuuspisteet, sitä suurempi palkkio.
Yritimme monia eri yhdistelmiä lauseen upottamismalleja ja sulavuusmalleja, ja vaikka suorituskyky oli kohtuullinen, pääongelma, jota agentti kohtasi, oli se, ettei se tasapainottanut riittävästi semanttista samankaltaisuutta sulavuuden kanssa. Useimmissa konfiguraatioissa agentti priorisoi sulavuuden, mikä johti yksityiskohtien poistamiseen ja useimpien entiteettien asettamiseen “jonkin keskelle” tai “pöydän” tai “tien” vierelle.
Monitavoitteinen vahvistusoppiminen on avoin tutkimuskysymys ja on erittäin haasteellista tässä tapauksessa.

- Käyttäminen vastakkainen malli palkkiofunktiona
Koska ihmiset ovat kultainen standardi arvioinnissa, koulutamme erillisen mallin, jota kutsutaan vastakkaiseksi, ennustamaan, ovatko kaksi lausetta toistensa paraphraaseja (samalla tavalla kuin ihminen arvioisi). Vahvistusoppimisen mallin tavoitteena on siis vakuuttaa tämä malli, että luotu lause on syötelauseen paraphraasi. Vastakkainen malli tuottaa pisteytyksen siitä, kuinka todennäköisesti kaksi lausetta ovat toistensa paraphraaseja, ja sitä käytetään palkkioksi kouluttaa agenttia.
Jokaisen 5 000 arvauksen jälkeen vastakkainen malli kertoo, kumpi paraphraasi tuli tietojoukosta ja kumpi luotiin, jotta se voi parantaa tulevia arvauksiaan. Prosessi jatkuu useita kierroksia, kun agentti yrittää huijata vastakkaisen ja vastakkainen yrittää erottaa luodut paraphraasit arviointiparaphraaseista tietojoukosta.
Useiden kierrosten jälkeen agentti luo paraphraaseja, jotka ylittävät valvottujen mallien ja muiden palkkiofunktioiden suorituskyvyn.

Johtopäätös ja rajoitukset
Vastakkaiset lähestymistavat (mukaan lukien itsepelit peleissä) tarjoavat erittäin lupaavan lähestymistavan vahvistusoppimisen algoritmien kouluttamiseen, jotta ne ylittävät ihmisen tason tiettyjen tehtävien suorittamisessa ilman eksplisiittisen palkkiofunktion määrittelyä.
Vaikka vahvistusoppiminen pystyi ylittämään valvotun oppimisen tässä tapauksessa, lisäkuorma koodissa, laskennassa ja monimutkaisuudessa ei ole arvoa suorituskyvyn parantamiseksi useimmissa sovelluksissa. Vahvistusoppimista tulisi jättää tilanteisiin, joissa valvottu oppiminen ei voida helposti soveltaa, ja palkkiofunktiota on helppo määritellä (kuten Atari-peleissä). Lähestymistavat ja algoritmit ovat paljon kypsimpiä valvotussa oppimisessa, ja virhesignaali on paljon vahvempi, mikä johtaa nopeampaan ja vakaampaan koulutukseen.
Toinen huomio on, kuten muissakin neuroverkkomenetelmissä, että agentti voi epäonnistua dramaattisesti tapauksissa, joissa syöte on erilainen kuin ne, joita se on aiemmin nähnyt, vaatien lisäkerroksen järjen käyttöä tuotantosovelluksissa.
Vahvistusoppimisen lähestymistapojen ja laskennallisen infrastruktuurin edistymisen räjähdys viime vuosina avaa valtavat mahdollisuudet vahvistusoppimisen soveltamiseen teollisuudessa, erityisesti NLP: ssä.












