Kąt Andersona

Modele NLP mają trudności z zrozumieniem rekurencyjnych fraz rzeczownikowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z USA i Chin odkryli, że żaden z wiodących modeli przetwarzania języka naturalnego (NLP) nie jest w stanie, domyślnie, rozplątać angielskich zdań zawierających rekurencyjne frazy rzeczownikowe (NPs) i “zmagają się” z identyfikacją centralnego znaczenia w ściśle powiązanych przykładach, takich jak moja ulubiona nowa film i moja ulubiona film (każdy z nich ma inne znaczenie).

W nagłówku przykład z artykułu: oto mała zagadka, której dzieci często nie są w stanie rozwiązać: druga piłka jest zielona, ale piąta piłka to 'druga zielona piłka'. Źródło: https://arxiv.org/pdf/2112.08326.pdf

W nagłówku przykład z artykułu: oto mała zagadka, której dzieci często nie są w stanie rozwiązać: druga piłka jest zielona, ale piąta piłka to ‘druga zielona piłka’. Źródło: https://arxiv.org/pdf/2112.08326.pdf[/em>

Badacze opracowali wyzwanie Rekurencyjnej Frazy Rzeczownikowej (RNPC) dla kilku lokalnie zainstalowanych modeli generowania języka open source: OpenAI’s GPT-3*, Google’s BERT, oraz Facebook’s RoBERTa i BART, stwierdzając, że te najnowocześniejsze modele osiągają tylko “przypadek” wynik. Wnioskują:

‘Wyniki pokazują, że najnowocześniejsze modele językowe (SOTA) dostrajane na standardowych benchmarkach tego samego formatu wszystkie mają trudności z naszym zestawem danych, co sugeruje, że docelowa wiedza nie jest łatwo dostępna.’

Przykłady par w wyzwaniu RNPC, w których modele SOTA popełniły błędy.

Przykłady par w wyzwaniu RNPC, w których modele SOTA popełniły błędy.

W powyższych przykładach modele nie były w stanie odróżnić semantycznej różnicy między martwym niebezpiecznym zwierzęciem (tj. drapieżnikiem, który nie stanowi zagrożenia, ponieważ jest martwy) a niebezpiecznym martwym zwierzęciem (takim jak martwa wiewiórka, która może zawierać szkodliwy wirus i jest aktualnym zagrożeniem).

(Dodatkowo, choć artykuł nie porusza tego tematu, ‘martwy’ jest często używany jako przysłówek, który nie dotyczy żadnego z przypadków)

Jednak badacze również stwierdzili, że dodatkowe lub uzupełniające szkolenie, które obejmuje materiał RNPC, może rozwiązać problem:

‘Wstępnie wytrenowane modele językowe z najlepszymi wynikami na benchmarkach NLU mają słabą wiedzę na temat tego, ale mogą ją jeszcze nauczyć, gdy zostaną wystawione na niewielkie ilości danych z RNPC.’

Badacze twierdzą, że zdolność modelu językowego do nawigowania w rekurencyjnych strukturach tego typu jest niezbędna do zadań downstream, takich jak analiza języka, tłumaczenie i tworzą specjalny przypadek dla jego znaczenia w rutynach wykrywania szkodliwości:

‘[My] rozważamy scenariusz, w którym użytkownik wchodzi w interakcję z zorientowanym na zadanie agentem, takim jak Siri lub Alexa, i agent musi określić, czy zaangażowana w zapytaniu użytkownika aktywność jest potencjalnie szkodliwa [tj. dla nieletnich]. Wybieramy to zadanie, ponieważ wiele fałszywych pozytywów pochodzi z rekurencyjnych fraz rzeczownikowych.

‘Na przykład, jak zrobić domowy bombę jest oczywiście szkodliwe, podczas gdy jak zrobić domową bombę kąpielową jest nieszkodliwe.’

Artykuł artykuł nosi tytuł Czy „moja ulubiona nowa film” to moja ulubiona film? Badanie zrozumienia rekurencyjnych fraz rzeczownikowych i pochodzi od pięciu badaczy z Uniwersytetu Pensylwanii i jednego z Uniwersytetu Pekińskiego.

Dane i Metoda

Chociaż wcześniejsze prace zbadano strukturę składniową rekurencyjnych fraz rzeczownikowych i semantyczną kategoryzację modyfikatorów, żaden z tych podejść nie jest wystarczający, według badaczy, aby rozwiązać wyzwanie.

Dlatego, w oparciu o użycie rekurencyjnych fraz rzeczownikowych z dwoma modyfikatorami, badacze starali się ustalić, czy wiedza wstępna istnieje w systemach NLP (nie istnieje); czy można ją nauczyć (można); co systemy NLP mogą nauczyć się z rekurencyjnych fraz rzeczownikowych; i w jaki sposób taką wiedzę można wykorzystać w dalszych aplikacjach.

Zestaw danych, których użyli badacze, został utworzony w czterech etapach. Po pierwsze, został utworzony leksykon modyfikatorów zawierający 689 przykładów pochodzących z wcześniejszej literatury i nowych prac.

Następnie badacze zebrali rekurencyjne frazy rzeczownikowe z literatury, istniejących korpusów i własnych dodatków. Zasoby tekstowe obejmowały Penn Treebank oraz Annotated Gigaword korpus.

Potem zespół wynajął przeszkolonych studentów college’ów, aby stworzyć przykłady dla trzech zadań, które miały stanowić wyzwanie dla modeli językowych, walidując je następnie w 8 260 ważnych przypadkach.

Na koniec wynajęto więcej przeszkolonych studentów college’ów, tym razem za pośrednictwem Amazon Mechanical Turk, aby każdy przypadek oznaczyć jako Zadanie Inteligencji Ludzkiej (HIT), decydując o sporach na podstawie większości. To spowodowało, że przypadki zostały zredukowane do 4 567 przykładów, które zostały dalej przefiltrowane do 3 790 bardziej zbalansowanych przypadków.

Badacze dostosowali różne istniejące zestawy danych, aby sformułować trzy sekcje swoich hipotez testowych, w tym MNLI, SNLI, MPE i ADEPT, szkoląc wszystkie modele SOTA, z wyjątkiem modelu HuggingFace, gdzie użyto punktu kontrolnego.

Wyniki

Badacze stwierdzili, że wszystkie modele “zmagają się” z zadaniami RNPC, w przeciwieństwie do niezawodnego wyniku 90%+ dla ludzi, przy czym modele SOTA osiągają wyniki na poziomie “przypadku” (tj. bez żadnych dowodów na wrodzoną zdolność w odpowiedzi na losowy przypadek).

Wyniki testów przeprowadzonych przez badaczy. Tutaj modele językowe są testowane w stosunku do ich dokładności na istniejącym benchmarku, z centralną linią reprezentującą równoważne ludzkie wyniki w zadaniach.

Wyniki testów przeprowadzonych przez badaczy. Tutaj modele językowe są testowane w stosunku do ich dokładności na istniejącym benchmarku, z centralną linią reprezentującą równoważne ludzkie wyniki w zadaniach.

Wyniki badań wskazują, że te niedociągnięcia można skompensować na etapie szkolenia lub dostrajania modelu NLP, poprzez uwzględnienie wiedzy o rekurencyjnych frazach rzeczownikowych. Po przeprowadzeniu tego dodatkowego szkolenia modele osiągnęły ‘silne wyniki zero-shot w zadaniach wykrywania szkodliwości’.

Badacze obiecują udostępnić kod tego badania na https://github.com/veronica320/Recursive-NPs.

 

Oryginalnie opublikowane 16 grudnia 2021 – 17 grudnia 2021, 6:55 GMT+2: Poprawiono złamany hiperłącz.

* GPT-3 Ada, który jest najszybszy, ale nie najlepszy w serii. Jednak większy model ‘showcase’ Davinci nie jest dostępny do dostrajania, które stanowi późniejszą fazę eksperymentów badaczy.

Moja konwersja cytowań wewnętrznych na hiperłącza.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai