Andersonův úhel

Proč je historický jazyk výzvou pro umělou inteligenci

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Jedním z hlavních problémů systémů zpracování přirozeného jazyka (NLP) je získat základní informace z široké škály psaných materiálů. Zdroje pro trénovací sadu dat pro nový algoritmus NLP mohou být jazykově rozmanité, jako je Twitter, noviny a vědecké časopisy, se všemi specifickými vlastnostmi každého z těchto zdrojů.

Většinou se jedná pouze o angličtinu a pouze o současné nebo nedávné zdroje textu. Když algoritmus NLP musí zpracovat materiál z různých ér, obvykle má problémy s vyrovnáním velmi odlišných způsobů, jakými lidé mluví nebo píší v různých národních a sub-národních komunitách, a zejména v různých historických obdobích.

Přesto je použití textových dat (jako historických pojednání a uznávaných vědeckých prací), která pokrývají různé epochy, potenciálně užitečnou metodou pro získání historického přehledu tématu a pro formulaci statistických rekonstrukcí časových os, které předcházejí přijetí a údržbu metrik pro danou oblast.

Například informace o počasí, které přispívají k predikčním modelům změny klimatu, nebyly dostatečně zaznamenány po celém světě do roku 1880, zatímco důlní činnost v klasických textech poskytuje starší záznamy o významných meteorologických událostech, které mohou být užitečné pro poskytnutí před-viktoriánských údajů o počasí.

Časová nesoulad

Nová práce z Univerzity ve Washingtonu a Allenova institutu pro umělou inteligenci zjistila, že i tak krátké časové období, jako je pět let, může způsobit časovou nesoulad, který může znemožnit užitečnost předem trénovaného modelu NLP.

Ve všech případech jsou vyšší hodnoty lepší. Zde vidíme heatmap temporalního úpadku napříč čtyřmi korpusy textových materiálů pokrývajících pětileté období. Takové nesoulady mezi trénovacími a evaluačními daty, podle autorů nové práce, mohou způsobit 'masivní pokles výkonu'.

Ve všech případech jsou vyšší hodnoty lepší. Zde vidíme heatmap temporalního úpadku napříč čtyřmi korpusy textových materiálů pokrývajících pětileté období. Takové nesoulady mezi trénovacími a evaluačními daty, podle autorů nové práce, mohou způsobit ‘masivní pokles výkonu’. Zdroj: https://arxiv.org/pdf/2111.07408.pdf

Práce uvádí:

‘Zjistili jsme, že časová nesoulad ovlivňuje obecné zobecnění jazykového modelu a výkon úkolu. Zjistili jsme značné rozdíly v úpadku napříč textovými doménami a úkoly. Během pěti let se F1 skóre klasifikátorů může zhoršit až o 40 bodů (politická příslušnost na Twitteru) nebo až o 1 bod (hodnocení Yelp). Dva různé úkoly definované ve stejné doméně mohou vykazovat různé úrovně úpadku v čase.’

Nesymetrické rozdělení

Základní problém spočívá v tom, že trénovací sady dat se obvykle rozdělují do dvou skupin, někdy v poměrně nesymetrickém poměru 80/20, kvůli omezené dostupnosti dat. Větší skupina dat se trénuje na neuronové síti, zatímco zbývající data se používají jako kontrolní skupina pro testování přesnosti výsledného algoritmu.

V smíšených datech, které obsahují materiál z různých let, nesymetrické rozdělení dat z různých období může znamenat, že evaluační data jsou převážně složena z materiálu z jednoho konkrétního období.

To způsobí, že bude špatným testovacím místem pro model trénovaný na více rozmanitém mixu období (tj. na více dostupných datech). V podstatě to znamená, že se zeptáte svého dědečka, aby ohodnotil nejnovější K-Pop idoly.

Dlouhé obejití by bylo trénovat více modelů na mnohem více časově omezených datech a pokusit se zkombinovat kompatibilní funkce z výsledků každého modelu. Nicméně náhodná inicializace modelu sama o sobě znamená, že tento přístup má své vlastní problémy při dosahování mezi-modelové parity a rovnosti – dokonce i před tím, než se zvažuje, zda přispívající sady dat byly dostatečně podobné, aby experiment byl smysluplný.

Data a trénování

Pro vyhodnocení časové nesouladu autoři trénovali čtyři textové korpusy napříč čtyřmi doménami;

Twitter
…kde shromáždili nelabelovaná data extrahováním náhodného výběru 12 milionů tweetů rovnoměrně rozložených mezi lety 2015-2020, kde autoři studovali pojmenované entity (tj. lidi a organizace) a politické příslušnosti.

Vědecké články
…kde autoři získali nelabelovaná data ze Semantic Scholar korpusu, který tvoří 650 000 dokumentů pokrývajících 30leté období, a na kterém studovali klasifikaci typu zmínky (SciERC) a klasifikaci místa konání AI (AIC, která rozlišuje, zda byla práce publikována v AAAI nebo ICML).

Články z novin
…kde autoři použili devět milionů článků z Newsroom Datasetu pokrývajících období 2009-2016, na kterém provedli tři úkoly: sumarizaci novin, klasifikaci vydavatelů a klasifikaci rámců médií (MFC), která zkoumá vnímanou prioritu různých témat v novinách.

Recenze jídla
…kde výzkumníci použili Yelp Open Dataset na jednom úkolu: klasifikaci hodnocení recenzí (YELPCLS), tradiční výzvu sentimentální analýzy typické pro mnoho výzkumů NLP v tomto sektoru.

Výsledky

Modely byly vyhodnoceny na GPT-2, s rozsahem výsledných F1 skóre. Autoři zjistili, že ztráta výkonu z časové nesouladu je oboustranná, což znamená, že modely trénované na nedávných datech mohou být negativně ovlivněny starším daty a naopak (viz obrázek na začátku článku pro grafy). Autoři poznamenávají, že to má zvláštní důsledky pro aplikace sociálních věd.

Obecně výsledky ukazují, že časová nesoulad podstatně snižuje výkon a má široký dopad na většinu úkolů. Sady dat, které pokrývají velmi dlouhá období, jako jsou desetiletí, přirozeně zhoršují problém.

Autoři dále poznamenávají, že časová nesoulad také ovlivňuje labelovaná i nelabelovaná trénovací data. Kromě toho jejich pokusy o zmírnění účinků prostřednictvím adaptace domény (viz níže) podstatně nezlepšily situaci, ačkoli tvrdí, že jemné doladění dat v sadě dat může pomoci do jisté míry.

Závěr

Výzkumníci potvrzují předchozí zjištění, že dříve navrhovaná řešení zahrnující adaptaci domény (DAPT, kde se vytváří prostor pro rozdíly v datech) a časovou adaptaci (kde se data vybírají podle časového období) nemají žádný velký účinek na zmírnění problému.

Práce uzavírá*:

‘Naše experimenty odhalily značné rozdíly v časovém úpadku napříč úkoly, více než tomu bylo zjištěno v předchozích studiích. Tyto výsledky motivují pokračující studium časové nesouladu napříč aplikacemi NLP, jeho zohlednění v hodnoceních a bdělost na straně praktiků, kteří mohou monitorovat výkon systému v čase.

‘Zejména jsme pozorovali, že pokračující trénink LM na časově sladěných datech nemá žádný velký účinek, což motivuje další výzkum k nalezení účinných metod časové adaptace, které jsou méně nákladné než pokračující sběr anotovaných/labelovaných dat v čase.’

Autoři navrhují, že další výzkum do pokračujícího učení, kde se data neustále aktualizují, může být užitečný v tomto ohledu, a že koncept driftu a další metody detekce posunů v úkolech by mohly být užitečným pomocníkem pro aktualizaci dat.

 

* Moje konverze inline citací na hypertextové odkazy.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai