Unghiul lui Anderson
Modelele NLP au dificultăți în a înțelege frazele cu substantive recursive
Cercetători din SUA și China au descoperit că niciunul dintre principalele modele de procesare a limbajului natural (NLP) nu pare a fi capabil, în mod implicit, să deslușească frazele în limba engleză care conțin substantive recursive (SN) și “luptă” pentru a individua sensul central în exemple strâns legate, cum ar fi filmul meu preferat nou și filmul meu preferat (fiecare având un sens diferit).

Într-un exemplu de titlu din lucrare, iată o mică puzzle pe care copiii o deslușește rar: a doua bilă este verde, dar a cincea bilă este ‘a doua bilă verde’. Sursă: https://arxiv.org/pdf/2112.08326.pdf
Cercetătorii au stabilit o provocare pentru frazele cu substantive recursive (RNPC) pentru mai multe modele de generare de limbaj deschise și instalate local: OpenAI’s GPT-3*, Google’s BERT, și Facebook’s RoBERTa și BART, constatând că aceste modele de ultimă generație au obținut doar “șanse” de performanță. Ei concluzionează†:
‘Rezultatele arată că modelele de ultimă generație (SOTA) ajustate pe benchmark-uri standard ale aceluiași format toate luptă pe setul nostru de date, sugerând că cunoștințele țintă nu sunt disponibile.’

Exemple de perechi minime în provocarea RNPC în care modelele SOTA au făcut erori.
În exemplele de mai sus, modelele au eșuat, de exemplu, în a distinge disparitatea semantică dintre un animal periculos mort (adică un prădător care nu reprezintă nicio amenințare pentru că este mort) și un animal mort periculos (cum ar fi o veveriță moartă, care poate conține un virus dăunător și reprezintă o amenințare activă).
(În plus, deși lucrarea nu se referă la acest aspect, ‘mort’ este folosit și ca adverb, care nu se referă la niciunul dintre cazuri)
Cu toate acestea, cercetătorii au constatat și că o pregătire suplimentară sau o pregătire care include materialul RNPC poate rezolva problema:
‘Modelele de limbaj pre-antrenate cu performanță SOTA pe benchmark-uri NLU au o stăpânire slabă a acestor cunoștințe, dar pot învăța când sunt expuse la cantități mici de date din RNPC.’
Cercetătorii susțin că capacitatea unui model de limbaj de a naviga structuri recursive de acest tip este esențială pentru sarcini downstream, cum ar fi analiza limbajului, traducerea și fac o caz special pentru importanța sa în rutinele de detectare a daunelor:
‘[Noi] considerăm scenariul în care un utilizator interacționează cu un agent orientat spre sarcini, cum ar fi Siri sau Alexa, și agentul trebuie să determine dacă activitatea implicată în interogarea utilizatorului este potențial dăunătoare [de exemplu, minorilor]. Alegem această sarcin pentru că multe rezultate false provin din SN recursive.
‘De exemplu, cum să faci o bombă casnică este evident dăunător, în timp ce cum să faci o bombă de baie casnică este inofensiv.’
Lucrarea este intitulată ‘Este “filmul meu preferat nou” filmul meu preferat? Sondează înțelegerea frazelor cu substantive recursive, și provine de la cinci cercetători de la Universitatea din Pennsylvania și unul de la Universitatea Peking.
Date și Metodă
Deși lucrările anterioare au studiat structura sintactică a SN recursive și categorizarea semantică a modificatorilor, niciuna dintre aceste abordări nu este suficientă, conform cercetătorilor, pentru a aborda provocarea.
Prin urmare, pe baza utilizării frazelor cu substantive recursive cu doi modificatori, cercetătorii au încercat să stabilească dacă cunoștințele necesare există în sistemele NLP de ultimă generație (nu există); dacă pot fi învățate (pot fi); ce pot învăța sistemele NLP din SN recursive; și în ce moduri aceste cunoștințe pot beneficia de aplicații downstream.
Setul de date utilizat de cercetători a fost creat în patru etape. Prima etapă a fost construirea unui lexic de modificatori care conține 689 de exemple extrase din literatura anterioară și lucrări noi.
Următoarea etapă a constat în colectarea de SN recursive din literatură, corpora existente și adăugări proprii. Resursele textuale au inclus Penn Treebank și Annotated Gigaword corpus.
Apoi, echipa a angajat studenți pre-selecționați pentru a crea exemple pentru cele trei sarcini pe care modelele de limbaj le vor întâmpina, validându-le ulterior în 8.260 de instanțe valabile.
În final, alți studenți pre-selecționați au fost angajați, de data aceasta prin Amazon Mechanical Turk, pentru a annota fiecare instanță ca o sarcină de inteligență umană (HIT), luând decizii pe baza majorității. Acest lucru a redus instanțele la 4.567 de exemple, care au fost ulterior filtrate la 3.790 de instanțe mai echilibrate.
Cercetătorii au adaptat diverse seturi de date existente pentru a formula cele trei secțiuni ale ipotezelor lor de testare, incluzând MNLI, SNLI, MPE și ADEPT, antrenând toate modelele SOTA, cu excepția modelului HuggingFace, unde s-a utilizat un punct de control.
Rezultate
Cercetătorii au constatat că toate modelele “luptă” pe sarcinile RNPC, în contrast cu o precizie de 90%+ pentru oameni, modelele SOTA obținând performanțe la nivel de “șansă” (adică fără nicio dovadă a unei abilități innate față de șansa aleatorie în răspuns).

Rezultatele testelor cercetătorilor. Aici, modelele de limbaj sunt testate împotriva preciziei lor pe un benchmark existent, cu linia centrală reprezentând performanța umană echivalentă în sarcini.
Linii secundare de investigație indică faptul că aceste deficiențe pot fi compensate la faza de antrenare sau de reglare a unui model NLP prin includerea specifică a cunoștințelor despre frazele cu substantive recursive. Odată ce s-a efectuat această pregătire suplimentară, modelele au obținut ‘o performanță puternică fără precedent pe o sarcină de detectare a daunelor [sarcini]’.
Cercetătorii promit să lanseze codul pentru această lucrare la https://github.com/veronica320/Recursive-NPs.
Publicat inițial pe 16 decembrie 2021 – 17 decembrie 2021, 6:55 am GMT+2: Corectat hyperlinkul rupt.
* GPT-3 Ada, care este cel mai rapid, dar nu cel mai bun din serie. Cu toate acestea, modelul mai mare ‘showcase’ Davinci nu este disponibil pentru reglarea care constituie faza ulterioară a experimentelor cercetătorilor.
† Conversia mea a citărilor inline în hyperlinkuri.












