Kąt Andersona

Dlaczego język historyczny jest wyzwaniem dla sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Jednym z centralnych wyzwań systemów przetwarzania języka naturalnego (NLP) jest wydobycie istotnych informacji z szerokiej gamy materiałów pisanych. Źródła danych szkoleniowych dla nowego algorytmu NLP mogą być tak lingwistycznie różnorodne, jak Twitter, gazety ogólnokrajowe i czasopisma naukowe, z wszystkimi ich cechami charakterystycznymi dla każdego z tych trzech źródeł.

W większości przypadków dotyczy to tylko języka angielskiego i tylko aktualnych lub niedawnych źródeł tekstowych. Kiedy algorytm NLP musi uwzględniać materiały pochodzące z różnych epok, zwykle ma trudności z uzgodnieniem różnych sposobów, w jaki ludzie mówią lub piszą w różnych społecznościach narodowych i subnarodowych, a zwłaszcza w różnych okresach historycznych.

Jednakże, korzystanie z danych tekstowych (takich jak traktaty historyczne i szanowane prace naukowe), które obejmują różne epoki, jest potencjalnie użyteczną metodą generowania historycznego przeglądu tematu i tworzenia statystycznych rekonstrukcji czasowych, które poprzedzają przyjęcie i utrzymanie metryk dla danego obszaru.

Na przykład, informacje o pogodzie, które przyczyniają się do modeli predykcyjnych zmian klimatu sztucznej inteligencji, nie były wystarczająco odnotowane na całym świecie do 1880 roku, podczas gdy wydobywanie danych z tekstów klasycznych zapewnia starsze rekordy znaczących zjawisk meteorologicznych, które mogą być przydatne w dostarczaniu danych pogodowych sprzed ery wiktoriańskiej.

Nieprawidłowość czasowa

Nowy artykuł z Uniwersytetu Waszyngtońskiego i Instytutu Allena dla sztucznej inteligencji wykazał, że nawet tak krótki okres, jak pięć lat, może spowodować nieprawidłowość czasową, co może uniemożliwić użyteczność wstępnie wytrenowanego modelu NLP.

W wszystkich przypadkach, wyższe wyniki są lepsze. Tutaj widzimy heatmapę degradacji czasowej w czterech korpusach tekstowych obejmujących pięcioletni okres. Takie niezgodności między danymi szkoleniowymi a oceniającymi, według autorów nowego artykułu, mogą spowodować 'znaczący spadek wyników'.

W wszystkich przypadkach, wyższe wyniki są lepsze. Tutaj widzimy heatmapę degradacji czasowej w czterech korpusach tekstowych obejmujących pięcioletni okres. Takie niezgodności między danymi szkoleniowymi a oceniającymi, według autorów nowego artykułu, mogą spowodować ‘znaczący spadek wyników’. Źródło: https://arxiv.org/pdf/2111.07408.pdf

Artykuł stwierdza:

‘Stwierdziliśmy, że nieprawidłowość czasowa wpływa na ogólną wydajność modelu językowego i wyniki zadań. Stwierdziliśmy znaczącą zmienność degradacji w różnych dziedzinach i zadaniach. W ciągu pięciu lat, wyniki klasyfikatorów mogą się pogorszyć o tyle, co 40 punktów (przynależność polityczna w serwisie Twitter) lub aż o 1 punkt (oceny serwisu Yelp). Dwa odrębne zadania określone w tej samej dziedzinie mogą wykazywać różne poziomy degradacji w czasie.’

Nierównomierne podziały

Podstawowym problemem jest to, że zestawy danych szkoleniowych są zwykle dzielone na dwie grupy, czasem w stosunku 80/20, ze względu na ograniczoną dostępność danych. Większa grupa danych jest szkolona na sieci neuronowej, podczas gdy pozostałe dane są wykorzystywane jako grupa kontrolna do testowania dokładności wynikającej z algorytmu.

W przypadku zestawów danych mieszanych, zawierających materiały z różnych okresów, nierównomierne rozłożenie danych z różnych epok może oznaczać, że dane oceny są nadmiernie składane z materiałów z jednej epoki.

To sprawi, że będą one słabym polem testowym dla modelu wytrenowanego na bardziej zróżnicowanym mieszanym zestawie epok (tj. na większości dostępnych danych). W praktyce, w zależności od tego, czy mniejszościowe dane oceny reprezentują nowszy czy starszy materiał, jest to jak poproszenie dziadka o ocenę najnowszych idoli K-Pop.

Długi sposób obejścia tego problemu byłby wytrenowanie wielu modeli na znacznie bardziej ograniczonych zestawach danych i próba połączenia kompatybilnych cech z wyników każdego modelu. Jednak losowa inicjacja modelu sama w sobie powoduje, że ten sposób ma swoje własne problemy w osiąganiu równowagi i równości między modelami – nawet przed uwzględnieniem, czy wiele danych wejściowych było wystarczająco podobnych do siebie, aby uczynić eksperyment znaczącym.

Dane i szkolenie

Aby ocenić nieprawidłowość czasową, autorzy wytrenowali cztery korpusy tekstowe w czterech dziedzinach;

Twitter
…gdzie zebrali nieoznaczone dane, wyodrębniając losowy wybór 12 milionów tweetów równomiernie rozłożonych między 2015 a 2020 rokiem, gdzie autorzy badali nazwane encje (tj. ludzi i organizacje) i przynależność polityczną.

Artykuły naukowe
…gdzie autorzy uzyskali nieoznaczone dane z korpusu Semantic Scholar, składającego się z 650 000 dokumentów obejmujących 30-letni okres, i na którym badali klasyfikację typów wzmianek (SciERC) i klasyfikację wydawnictw AI (AIC, która rozróżnia, czy artykuł został opublikowany w AAAI czy ICML).

Artykuły prasowe
…gdzie autorzy wykorzystali dziewięć milionów artykułów z zestawu danych Newsroom obejmującego okres od 2009 do 2016 roku, na którym wykonali trzy zadania: podsumowanie serwisu informacyjnego, klasyfikację wydawcy i klasyfikację ram medialnych (MFC), która ostatnia zadań bada postrzeganą priorytetowość różnych tematów w mediach.

Recenzje żywności
…gdzie badacze wykorzystali otwarty zestaw danych Yelp na jednym zadaniu: klasyfikacji ocen recenzji (YELPCLS), tradycyjnym wyzwaniu analizy sentymentu, typowym dla wielu badań NLP w tym sektorze.

Wyniki

Modele zostały ocenione na GPT-2, z wynikami F1. Autorzy stwierdzili, że straty wynikające z nieprawidłowości czasowej są dwukierunkowe, co oznacza, że modele wytrenowane na danych z niedawna mogą być negatywnie wpływane przez starsze dane, i odwrotnie (patrz obrazek na początku artykułu, aby zobaczyć wykresy). Autorzy zauważają, że ma to szczególne implikacje dla aplikacji nauk społecznych.

W ogóle, wyniki pokazują, że nieprawidłowość czasowa znacznie pogarsza wyniki, i ma szeroki wpływ na większość zadań. Zestawy danych, które obejmują bardzo długi okres, takie jak dekady, naturalnie nasilają problem.

Autorzy dodatkowo zauważają, że nieprawidłowość czasowa wpływa również na oznaczone i nieoznaczone dane wstępne. Ponadto, ich próby złagodzenia skutków za pomocą adaptacji dziedzinowej (patrz poniżej) nie znacznie poprawiły sytuację, chociaż twierdzą, że dokształcanie informacji w zestawie danych może pomóc w pewnym stopniu.

Wnioski

Badacze potwierdzają poprzednie ustalenia, że wcześniej sugerowane rozwiązania, takie jak adaptacja dziedzinowa (DAPT, gdzie uwzględnia się różnicę w danych) i adaptacja czasowa (gdzie dane są wybrane według okresu czasu), nie pomagają znacznie w złagodzeniu problemu.

Artykuł kończy się*:

‘Nasze eksperymenty ujawniły znaczącą zmienność degradacji czasowej w zadaniach, więcej niż to, co znaleziono w poprzednich badaniach. Te ustalenia motywują dalsze badanie nieprawidłowości czasowej w aplikacjach NLP, jej uwzględnienie w ocenach benchmarkowych i czujność ze strony praktyków, którzy mogą monitorować wyniki systemów na żywo w czasie.

‘Godne uwagi jest to, że obserwowaliśmy, iż dalsze szkolenie modeli LM na danych czasowo zgodnych nie ma dużego wpływu, co motywuje dalsze badania w celu znalezienia skutecznych metod adaptacji czasowej, które są mniej kosztowne niż ciągłe zbieranie danych oznaczonych/oznaczonych w czasie.’

Autorzy sugerują, że dalsze badania nad ciągłym uczeniem, gdzie dane są stale aktualizowane, mogą być przydatne w tym zakresie, i że dryf pojęciowy i inne metody wykrywania zmian w zadaniach mogą być przydatnymi narzędziami do aktualizacji zestawów danych.

 

* Moja konwersja odniesień wewnętrznych do linków.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai