Andersonin kulma

NLP-mallit kamppailevat ymmärtämään toistuvia substantiivifraseja

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat Yhdysvalloista ja Kiinasta ovat havainneet, että mikään johtavista luonnollisen kielen prosessoinnin (NLP) malleista ei näytä olevan kykeneväksi, oletusarvoisesti, purkamaan englannin kielen lauseita, joissa on toistuvia substantiivifraseja (NPs), ja “kamppailevat” ymmärtämään keskeisen merkityksen läheisissä esimerkeissä, kuten lempi uusi elokuva ja lempi elokuva (jokainen niistä on eri merkityksellä).

Otsikko esimerkki paperista, tässä on pieni arvoitus, jota lapset usein epäonnistuvat ratkaisemaan: toinen pallo on vihreä, mutta viides pallo on 'toinen vihreä pallo'. Lähde: https://arxiv.org/pdf/2112.08326.pdf

Otsikko esimerkki paperista, tässä on pieni arvoitus, jota lapset usein epäonnistuvat ratkaisemaan: toinen pallo on vihreä, mutta viides pallo on ‘toinen vihreä pallo’. Lähde: https://arxiv.org/pdf/2112.08326.pdf

Tutkijat asettivat Toistuva Substantiivifraasi Haasteen (RNPC) useille paikallisesti asennetuille avoimen lähdekoodin kielen generointimalleille: OpenAI:n GPT-3*, Google:n BERT ja Facebookin RoBERTa ja BART, havaiten, että nämä viimeisimmät mallit saavuttivat vain “sattuman” suorituskyvyn. He johtavat:

‘Tulokset osoittavat, että viimeisimmät (SOTA) kielimallit, jotka on hienosäädetty standardibenchmarkkeihin samassa muodossa, kaikki kamppailevat meidän aineistossamme, mikä viittaa siihen, että kohde-tietoa ei ole helposti saatavilla.’

Minimipari esimerkkejä RNPC haasteessa, joissa SOTA-mallit tekivät virheitä.

Minimipari esimerkkejä RNPC haasteessa, joissa SOTA-mallit tekivät virheitä.

Edellä mainituissa esimerkeissä mallit epäonnistuivat esimerkiksi erottamaan semanttinen ero kuollut vaarallinen eläin (eli peto, joka ei ole uhka, koska se on kuollut) ja vaarallinen kuollut eläin (kuten kuollut orava, joka voi sisältää haitallisen viruksen ja on nykyinen uhka).

(Lisäksi, vaikka paperi ei käsittele sitä, ‘kuollut’ käytetään usein myös adverbina, joka ei koske kumpaakaan tapausta)

Kuitenkin tutkijat myös löysivät, että lisä- tai täydentävä koulutus, joka sisältää RNPC-aineistoa, voi ratkaista ongelman:

‘Esikoulutetut kielimallit, joilla on SOTA-suorituskyky NLU-benchmarkkeissa, ovat heikkoja tällaisessa tiedossa, mutta voivat silti oppia sen, kun niille esitetään pieniä määriä RNPC-aineistoa.’

Tutkijat väittävät, että kielimallin kyky navigoida toistuvissa rakenteissa on välttämätöntä alihankkeissa, kuten kielianalyysissä, käännöksissä, ja tekevät erityisen tapauksen sen tärkeydestä vahingon havaitsemisessa:

‘[Me] tarkastelemme tilannetta, jossa käyttäjä vuorovaikuttaa tehtävän suunnatun agentin, kuten Sirin tai Alexan, kanssa, ja agentin on määrättävä, onko käyttäjän kysymyksessä oleva toiminta mahdollisesti [esim. lapsille] vahingollista. Valitsimme tämän tehtävän, koska useat virheelliset positiiviset tulokset johtuvat toistuvista substantiivifraseista.

‘Esimerkiksi, miten tehdä itse tehty pommi on ilmiselvästi vahingollista, kun taas miten tehdä itse tehty kylpybommi on vaaraton.’

Paperi on otsikoitu “Onko ‘lempi uusi elokuva’ lempi elokuva? Tutkimus toistuvien substantiivifrazien ymmärtämisestä”, ja se on peräisin viideltä tutkijalta Pennsylvanian yliopistosta ja yhdeltä Pekingin yliopistosta.

Data ja Menetelmä

Vaikka aiempi tutkimus on tutkinut toistuvien substantiivifrazien syntaktista rakennetta ja modifioivien semanttista luokittelua, kumpikaan näistä lähestymistavoista ei ole riittävä, tutkijoiden mukaan, haasteen ratkaisemiseksi.

Siksi tutkijat ovat perustaneet toistuvien substantiivifrazien käytön kahden modifioijan kanssa, ja he ovat pyrkineet selvittämään, onko edellytyksellinen tieto olemassa SOTA NLP-järjestelmissä (ei ole); voidaanko se opettaa niille (voidaan); mitä NLP-järjestelmät voivat oppia toistuvista substantiivifrazista; ja miten tällainen tieto voi hyödyttää alihankkeita.

Tutkijat loivat aineiston neljässä vaiheessa. Ensimmäinen vaihe oli modifioijien sanastoon kuuluvien 689 esimerkin kokoaminen aiemmasta kirjallisuudesta ja uudesta työstä.

Seuraavaksi tutkijat keräsivät toistuvia substantiivifrazia kirjallisuudesta, olemassa olevista korpuksista ja omista keksinnöistään. Tekstuaaliset resurssit sisälsivät Penn Treebankin ja Annotated Gigaword -korpuksen.

Sitten tutkijat palkkasivat esivalittuja yliopiston opiskelijoita luomaan esimerkkejä kolmelle tehtävälle, joita kielimallit kohtaisivat, ja vahvistivat ne myöhemmin 8 260 kelvolliseksi esimerkiksi.

Lopuksi tutkijat palkkasivat lisää esivalittuja yliopiston opiskelijoita, tällä kertaa Amazon Mechanical Turk -palvelun kautta, annotoimaan jokaisen esimerkin Ihmisen Älykkyystehtäväksi (HIT), ja päättivät riidoista enemmistöperusteella. Tämä whittled esimerkit 4 567: een, jotka olivat edelleen suodatettu 3 790: een tasapainotettuun esimerkkiin.

Tutkijat sovittivat useita olemassa olevia aineistoja muotoilemaan kolme osaa hypoteeseistaan, mukaan lukien MNLI, SNLI, MPE ja ADEPT, kouluttaen kaikki SOTA-mallit itse, lukuun ottamatta HuggingFace-mallia, jossa käytettiin checkpointia.

Tulokset

Tutkijat löysivät, että kaikki mallit “kamppailevat” RNPC-tehtävissä, verrattuna ihmisten luotettavaan 90%:n tarkkuusarvoon, ja SOTA-mallit suorittivat “sattuman” tasolla (eli ilman mitään todisteita sisäänrakennetusta kyvystä satunnaisen sattuman suhteen).

Tutkijoiden testien tulokset. Tässä kielimallit testataan niiden tarkkuuden perusteella olemassa olevaan benchmarkkiin, ja keskellä oleva viiva edustaa vastaavaa ihmisten suorituskykyä tehtävissä.

Tutkijoiden testien tulokset. Tässä kielimallit testataan niiden tarkkuuden perusteella olemassa olevaan benchmarkkiin, ja keskellä oleva viiva edustaa vastaavaa ihmisten suorituskykyä tehtävissä.

Toissijaiset tutkimukset osoittavat, että nämä puutteet voidaan korvata koulutus- tai hienosäätövaiheessa NLP-mallin prosessissa erityisesti sisällyttämällä tietoa toistuvista substantiivifrazista. Kun tämä täydentävä koulutus tehtiin, mallit saavuttivat ‘vankkaa nollasuorituskykyä ulkoisessa Harm Detection -tehtävässä’.

Tutkijat lupaavat julkaista koodin tästä työstä osoitteessa https://github.com/veronica320/Recursive-NPs.

 

Alun perin julkaistu 16. joulukuuta 2021 – 17. joulukuuta 2021, 6:55 am GMT+2: Korjattu rikkinäinen hyperlink.

* GPT-3 Ada, joka on nopein, mutta ei paras sarjassa. Kuitenkin suurempi ‘näyttely’ Davinci-malli ei ole saatavilla hienosäätövaiheessa, joka muodostaa tutkijoiden kokeiden myöhemmän vaiheen.

Minun muunnos sisäisistä viittauksista hyperlinkkeihin.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai