Andersonův úhel

Modely NLP mají potíže s porozuměním rekurzivním substantivním frázím

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z USA a Číny zjistili, že žádný z předních modelů zpracování přirozeného jazyka (NLP) není schopen, ve výchozím nastavení, rozplést anglické věty, které obsahují rekurzivní substantivní fráze (NP), a “potíží” se s rozlišením centrálního významu v úzce souvisejících příkladech, jako je můj oblíbený nový film a můj oblíbený film (každý z nich má jiný význam).

V ukázkovém příkladu z článku je zde malý puzzle, který děti často nedokážou rozplést: druhý míč je zelený, ale pátý míč je 'druhý zelený míč'. Zdroj: https://arxiv.org/pdf/2112.08326.pdf

V ukázkovém příkladu z článku je zde malý puzzle, který děti často nedokážou rozplést: druhý míč je zelený, ale pátý míč je ‘druhý zelený míč’. Zdroj: https://arxiv.org/pdf/2112.08326.pdf

Výzkumníci vytvořili Výzvu rekurzivních substantivních frází (RNPC) pro několik místně instalovaných open source modelů generování jazyka: OpenAI’s GPT-3*, Google’s BERT, a Facebook’s RoBERTa a BART, a zjistili, že tyto modely dosáhly pouze “náhodného” výkonu. Závěr zní:

‘Výsledky ukazují, že modely s nejlepšími výsledky (SOTA) vyladěné na standardních benchmarcích stejného formátu všechny selhávají v našem datasetu, což naznačuje, že cílové znalosti nejsou snadno dostupné.’

Minimální párové příklady ve výzvě RNPC, kde modely SOTA udělaly chyby.

Minimální párové příklady ve výzvě RNPC, kde modely SOTA udělaly chyby.

V uvedených příkladech modely selhaly, například, při rozlišení sémantické disparity mezi mrtvý nebezpečný zvíře (tj. predátor, který nepředstavuje žádnou hrozbu, protože je mrtvý) a nebezpečným mrtvým zvířetem (jako je mrtvý veverka, který může obsahovat škodlivý virus a představuje aktuální hrozbu).

(Kromě toho, i když článek na to nezaměřuje pozornost, ‘mrtvý’ je často používán jako příslovce, které se nevztahuje na žádný z případů)

Nicméně, výzkumníci také zjistili, že dodatečné nebo doplňkové školení, které zahrnuje materiály RNPC, může tento problém vyřešit:

‘Předškolní jazykové modely s nejlepšími výsledky (SOTA) na NLU benchmarcích mají špatné ovládnutí tohoto znalostí, ale mohou je stále naučit, když jsou vystaveny malým množství dat z RNPC.’

Výzkumníci argumentují, že schopnost jazykového modelu navigovat rekurzivní struktury tohoto typu je nezbytná pro následné úkoly, jako je analýza jazyka, překlad a zvláštní případ pro jeho důležitost v rutinách detekce škody:

‘[My] zvažujeme scénář, ve kterém uživatel interaguje s úkolem-orientovaným agentem, jako je Siri nebo Alexa, a agent potřebuje určit, zda je činnost uvedená v uživatelském dotazu potenciálně škodlivá [tj. pro nezletilé]. Vybral jsem tento úkol, protože mnoho falešných pozitivů pochází z rekurzivních NP.

‘Například, jak vyrobit domácí bombu je zjevně škodlivé, zatímco jak vyrobit domácí koupelovou bombu je neškodivé.’

Článek článek je nazvaný ‘Je “můj oblíbený nový film” můj oblíbený film? Zkoumání porozumění rekurzivním substantivním frázím’ a pochází od pěti výzkumníků z University of Pennsylvania a jednoho z Peking University.

Data a metoda

Ačkoli předchozí práce studovala syntaktickou strukturu rekurzivních NP a sémantickou kategorizaci modifikátorů, ani jeden z těchto přístupů není dostatečný, podle výzkumníků, aby řešil výzvu.

Proto, na základě použití rekurzivních substantivních frází se dvěma modifikátory, výzkumníci se snažili určit, zda existuje požadované znalosti v systémech NLP (neexistuje); zda je lze naučit (lze); co systémy NLP mohou naučit z rekurzivních NP; a jakým způsobem lze toto znalosti využít pro následné aplikace.

Dataset, který výzkumníci použili, byl vytvořen ve čtyřech fázích. První fází byla konstrukce lexikonu modifikátorů obsahující 689 příkladů z předchozí literatury a nové práce.

Dále výzkumníci shromáždili rekurzivní NP z literatury, existujících korpusů a vlastních příkladů. Textové zdroje zahrnovaly Penn Treebank a Annotated Gigaword korpus.

Pak tým najal předem vybrané studenty, aby vytvořili příklady pro tři úkoly, které měly jazykové modely řešit, a poté je ověřil na 8 260 platných instancích.

Nakonec další předem vybraní studenti byli najati, tentokrát prostřednictvím Amazon Mechanical Turk, aby označili každou instanci jako Human Intelligence Task (HIT), rozhodli spory na základě většinového rozhodnutí. To snížilo instance na 4 567 příkladů, které byly dále filtrovány na 3 790 vyvážených instancí.

Výzkumníci upravili různé existující datasety, aby formulovali tři sekce svých testovacích hypotéz, včetně MNLI, SNLI, MPE a ADEPT, a vycvičili všechny modely SOTA, s výjimkou modelu HuggingFace, kde byl použit checkpoint.

Výsledky

Výzkumníci zjistili, že všechny modely “potíží” na úkolech RNPC, ve srovnání s spolehlivým skóre přes 90 % pro lidi, přičemž modely SOTA dosáhly “náhodného” výkonu (tj. bez jakéhokoli důkazu o vrozené schopnosti ve srovnání s náhodnou šancí v odpovědi).

Výsledky testů výzkumníků. Zde jsou jazykové modely testovány proti jejich přesnosti na existujícím benchmarku, se středovou linií reprezentující ekvivalentní lidský výkon v úkolech.

Výsledky testů výzkumníků. Zde jsou jazykové modely testovány proti jejich přesnosti na existujícím benchmarku, se středovou linií reprezentující ekvivalentní lidský výkon v úkolech.

Další linie výzkumu naznačují, že tyto nedostatky lze kompenzovat ve fázi školení nebo jemného vyladění NLP modelu, zahrnutím znalostí rekurzivních substantivních frází. Jakmile bylo toto doplňkové školení provedeno, modely dosáhly ‘silného výkonu bezprecedentního na extrinsic Harm Detection [úkolech]’.

Výzkumníci slibují, že zveřejní kód pro tuto práci na https://github.com/veronica320/Recursive-NPs.

 

Původně publikováno 16. prosince 2021 – 17. prosince 2021, 6:55 GMT+2: Opraveno rozbité odkazy.

* GPT-3 Ada, který je nejrychlejší, ale ne nejlepší ze série. Nicméně, větší ‘showcase’ model Davinci není k dispozici pro jemné vyladění, které tvoří pozdější fázi experimentů výzkumníků.

Moje konverze inline citací na odkazy.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai