Andersons vinkel
NLP-modeller kämpar för att förstå rekursiva nominalfraser
Forskare från USA och Kina har funnit att ingen av de ledande modellerna för naturlig språkbehandling (NLP) tycks vara kapabla, som standard, att tolka engelska meningar som innehåller rekursiva nominalfraser (NPs) och “kämpar” för att individuera den centrala meningen i nära relaterade exempel som Min favoritnya film och Min favoritfilm (var och en med en annan betydelse).

I en rubrikexempel från artikeln visas här en liten gåta som barn ofta misslyckas med att lösa: den andra bollen är grön, men den femte bollen är den ‘andra gröna bollen’. Källa: https://arxiv.org/pdf/2112.08326.pdf
Forskarna satte upp en utmaning för rekursiva nominalfraser (RNPC) till flera lokalt installerade öppen källkodsmodeller för språkgenerering: OpenAI:s GPT-3*, Googles BERT och Facebooks RoBERTa och BART, och fann att dessa state-of-the-art-modeller endast uppnådde “chans”-prestanda. De drar slutsatsen†:
‘Resultaten visar att state-of-the-art (SOTA) LM som är finjusterade på standard benchmark av samma format alla kämpar på vår dataset, vilket tyder på att den målkunskapen inte är lättillgänglig.’

Minimalpar-exempel i RNPC-utmaningen där SOTA-modellerna gjorde fel.
I exemplen ovan misslyckades modellerna, till exempel, med att skilja på den semantiska skillnaden mellan en död farlig djur (dvs. en predator som inte utgör något hot eftersom den är död) och en farlig död djur (såsom en död ekorre, som kan innehålla ett skadligt virus och är ett aktuellt hot).
(Dessutom, även om artikeln inte berör det, används ‘död’ ofta också som ett adverb, som varken tillämpas på något av fallen)
Men forskarna fann också att ytterligare eller kompletterande utbildning som inkluderar RNPC-material kan lösa problemet:
‘Förutbildade språkmodeller med SOTA-prestanda på NLU-benchmark har dålig behärskning av denna kunskap, men kan fortfarande lära sig den när de exponeras för små mängder data från RNPC.’
Forskarna hävdar att en språkmodells förmåga att navigera i rekursiva strukturer av detta slag är avgörande för nedströmsuppgifter som språkanalys, översättning och gör ett särskilt fall för dess betydelse i skadeförebyggande rutiner:
‘[Vi] överväger scenariot där en användare interagerar med en uppgiftsorienterad agent som Siri eller Alexa, och agenten behöver bestämma om den involverade aktiviteten i användarens fråga potentiellt är skadlig [dvs. för minderåriga]. Vi väljer denna uppgift eftersom många falska positiva resultat kommer från rekursiva NP.
‘Till exempel hur man gör en hemmagjord bomb är uppenbarligen skadlig medan hur man gör en hemmagjord badbomb är ofarlig.’
Artikeln är titel ‘Är “min favoritnya film” min favoritfilm? Utredning av förståelsen av rekursiva nominalfraser’, och kommer från fem forskare vid University of Pennsylvania och en vid Peking University.
Data och metod
Även om tidigare arbete har studier den syntaktiska strukturen hos rekursiva NP och den semantiska kategoriseringen av modifierare, är varken av dessa tillvägagångssätt tillräckligt, enligt forskarna, för att ta itu med utmaningen.
Därför, baserat på användningen av rekursiva nominalfraser med två modifierare, har forskarna försökt att fastställa om den nödvändiga kunskapen finns i SOTA-NLP-system (den gör det inte); om den kan läras ut till dem (den kan); vad NLP-system kan lära sig från rekursiva NP; och på vilka sätt sådan kunskap kan gynna nedströmsapplikationer.
Datasetet som forskarna använde skapades i fyra steg. Först var konstruktionen av en modifieringslexikon som innehåller 689 exempel hämtade från tidigare litteratur och nytt arbete.
Sedan samlade forskarna rekursiva NP från litteratur, befintliga korpusar och tillägg av deras egen uppfinning. Textuella resurser inkluderade Penn Treebank och Annotated Gigaword-korpus.
Sedan anställde teamet förhandsgranskade collegeelever för att skapa exempel för de tre uppgifter som språkmodellerna skulle möta, och validerade dem därefter till 8 260 giltiga instanser.
Till sist anställdes fler förhandsgranskade collegeelever, den här gången via Amazon Mechanical Turk, för att annotera varje instans som en mänsklig intelligensuppgift (HIT), och avgjorde tvister på basis av majoritet. Detta reducerade instanserna till 4 567 exempel, som sedan filtrerades ner till 3 790 mer balanserade instanser.
Forskarna anpassade olika befintliga dataset för att formulera de tre sektionerna av sina testhypoteser, inklusive MNLI, SNLI, MPE och ADEPT, och tränade alla SOTA-modellerna själva, med undantag för HuggingFace-modellen, där en checkpoint användes.
Resultat
Forskarna fann att alla modeller “kämpar” på RNPC-uppgifter, jämfört med en tillförlitlig 90%+ noggrannhetspoäng för människor, med SOTA-modellerna som presterade på “chans”-nivå (dvs. utan någon bevis på medfödd förmåga jämfört med slumpmässig chans i respons).

Resultat från forskarnas tester. Här testas språkmodellerna mot deras noggrannhet på en befintlig benchmark, med den centrala linjen som representerar motsvarande mänsklig prestanda i uppgifterna.
Sekundära undersökningar tyder på att dessa brister kan kompenseras för under utbildnings- eller finjusteringsfasen av en NLP-modells pipeline genom att specifikt inkludera kunskap om rekursiva nominalfraser. När denna kompletterande utbildning genomfördes uppnådde modellerna ‘stark zero-shot-prestanda på en extrinsisk Harm Detection [uppgift]’.
Forskarna lovar att släppa koden för detta arbete på https://github.com/veronica320/Recursive-NPs.
Ursprungligen publicerad den 16 december 2021 – 17 december 2021, 6:55, GMT+2: Rättad trasig hyperlänk.
* GPT-3 Ada, som är den snabbaste men inte den bästa i serien. Men den större ‘showcase’-modellen Davinci är inte tillgänglig för den finjustering som utgör den senare fasen av forskarnas experiment.
† Min konvertering av inline-citationer till hyperlänkar.












