Kąt Andersona

Tworzenie Sztucznych Mechanicznych Turków z Użyciem Wstępnie Wytrenowanych Modeli Językowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Duża część rozwoju systemów machine learning opiera się na oznaczaniu danych, gdzie setki, a nawet tysiące pytań (takich jak Czy to zdjęcie kota? i Czy ten tekst jest obraźliwy?) muszą być rozstrzygnięte w celu opracowania autorytatywnych zbiorów danych, na których będą szkolone systemy AI.

Chociaż wszyscy przyczyniamy się do tego procesu w pewnym momencie, większość tych zadań oznaczania jest wykonywana za pieniądze przez ludzi pracujących w ramach platform takich jak Amazon Mechanical Turk, gdzie anotatorzy wykonują mniejsze zadania klasyfikacji w gospodarce opartej na pracy.

Rozwój modeli byłby tańszy, gdyby wstępnie wytrenowane modele językowe (PLM) mogły same wykonywać niektóre z bardziej podstawowych zadań inteligencji ludzkiej (HIT) obecnie crowdsourcowanych na AMT i podobnych platformach.

Niedawne badania przeprowadzone w Niemczech i Huawei proponują to w artykule LMTurk: Few-Shot Learners as Crowdsourcing Workers.

Modele Językowe Wykonujące Naukę z Niewielu Przykładów

Autorzy sugerują, że prostsze warstwy zadań zazwyczaj skierowane do (ludzkich) Turków są analogiczne do nauki z niewielu przykładów, gdzie automatyczna ramka musi podjąć decyzję o mini-zadaniu na podstawie niewielkiej liczby przykładów podanych jej.

Sugerują zatem, że systemy AI mogą uczyć się skutecznie z istniejących PLM, które zostały pierwotnie wytrenowane przez crowdworkerów – że podstawowa wiedza przekazana od ludzi do maszyn została już skutecznie przekazana, a tam, gdzie taka wiedza jest względnie niezmienna lub empiryczna w pewien sposób, automatyczne ramy modelu językowego mogą potencjalnie wykonywać te zadania same.

‘Nasza podstawowa idea polega na tym, że dla zadania NLP T, traktujemy uczniów z niewielu przykładów jako nieekspertowych pracowników, przypominających pracowników crowdsourcowych, którzy anotują zasoby dla techniki języka ludzkiego. Zainspirowaliśmy się tym, że możemy traktować pracownika crowdsourcowego jako rodzaj ucznia z niewielu przykładów.’

Implikacje obejmują możliwość, że wiele prawd, na których opierają się systemy AI w przyszłości, zostało pochodzących od ludzi wiele lat wcześniej, a następnie traktowanych jako pre-walidowane i wykorzystywane informacje, które nie wymagają już interwencji ludzkiej.

Prace dla Modeli Językowych o Średniej Wydajności

Oprócz motywacji do obniżenia kosztów ludzi w pętli, badacze sugerują, że używanie “średnich” PLM jako prawdziwych TurkówMechanicznych zapewnia przydatną pracę dla tych “również biegłych” systemów, które są coraz bardziej przyćmiewane przez nagłówki, hiperskale i kosztowne modele językowe, takie jak GPT-3, które są zbyt drogie i przesadnie wyposażone dla takich zadań.

‘Naszym celem w tym artykule jest opracowanie metod, które umożliwiają bardziej efektywne wykorzystanie obecnych uczniów z niewielu przykładów. Jest to kluczowe, ponieważ coraz więcej ogromnych uczniów z niewielu przykładów jest szkolonych; jak je efektywnie wykorzystać, jest więc ważnym pytaniem. W szczególności, chcemy alternatywy dla trudnych do wdrożenia ogromnych modeli.

‘Jednocześnie chcemy w pełni wykorzystać siłę PLM: Ich wszechstronność zapewnia szeroką stosowalność w zadaniach; ich ogromny zasób wiedzy o języku i świecie (nabyty w trakcie wstępnego szkolenia) objawia się w efektywności danych uczniów z niewielu przykładów, redukując pracę i czas zużycia w anotacji danych.’

Do tej pory autorzy twierdzą, że uczniowie z niewielu przykładów w NLP byli traktowani jako wymienne etapy pośrednie na drodze do wysokiego poziomu systemów języka naturalnego, które są znacznie bardziej wymagające zasobów, i że praca ta była prowadzona abstrakcyjnie i bez uwzględnienia możliwego użycia tych systemów.

Metoda

Autorzy proponują LMTurk (Model Językowy jako mechaniczny Turc), w ramach którego dane wejściowe z tego automatycznego HIT zapewniają etykiety dla średniego modelu NLP.

Podstawowy model koncepcyjny dla LMTurk. Źródło: https://arxiv.org/pdf/2112.07522.pdf

Podstawowy model koncepcyjny dla LMTurk. Źródło: https://arxiv.org/pdf/2112.07522.pdf

Ta pierwsza iteracja opiera się na danych “złota” oznaczonych przez ludzi, gdzie “mięso” Turków zaanotowało etykiety dla ograniczonej liczby zadań, a etykiety zostały ocenione dobrze, albo za pomocą bezpośredniej nadzoru ludzkiego, albo za pomocą głosowania konsensusowego. Implikacja dla tego schematu jest taka, że gałęzie lub rozwinięcia z tego punktu startowego ludzkiego nie mogą wymagać dodatkowego wprowadzania danych ludzkich w przyszłości.

Chociaż autorzy sugerują dalsze eksperymenty z późniejszymi modelami hybrydowymi (gdzie wprowadzanie danych ludzkich byłoby obecne, ale znacznie zmniejszone), nie przeprowadzili, dla celów swoich badań, porównań modeli LMTurk z wynikami uzyskanymi przez ludzkich pracowników HIT, uznając, że dane “złota” są samymi danymi wejściowymi.

PLM zaprojektowany do wykonywania operacji Turków został dostosowany do zadania za pomocą P-Tuning, metody opublikowanej przez badaczy z Chin w 2021 roku, która zaproponowała szkolalne ciągłe osadzanie prompty, aby poprawić wydajność modeli GPT-3 w zadaniach zrozumienia języka naturalnego (NLU).

P-Tuning próbuje pogłębić przewidywanie modelu GPT i jego pozorny zrozumienie języka, poprzez wbudowanie osadzonych pseudo-promptów. W tym przypadku, startowy zapytanie to 'Stolica Wielkiej Brytanii to [x]'.

P-Tuning próbuje pogłębić przewidywanie modelu GPT i jego pozorny zrozumienie języka, poprzez wbudowanie osadzonych pseudo-promptów. W tym przypadku, startowy zapytanie to ‘Stolica Wielkiej Brytanii to [x]’. Źródło: https://arxiv.org/pdf/2103.10385.pdf

Dane i Architektura

LMTurk został oceniony na pięciu zbiorach danych: dwóch z Stanford Sentiment Treebank; AG’s News Corpus; Recognizing Textual Entailment (RTE); i Corpus of Linguistic Acceptability (CoLA).

Dla swojego większego modelu, LMTurk używa publicznie dostępnych PLM ALBERT-XXLarge-v2 (AXLV2) jako modelu źródłowego do konwersji na automatyczny Turka. Model ten składa się z 223 milionów parametrów (w porównaniu z 175 miliardami parametrów w GPT-3). AXLV2, autorzy zauważają, okazał się w stanie przewyższyć modele o większej skali, takie jak 334M BERT-Large.

Dla bardziej zwinnej, lekkiej i wdrożonej na brzegu modelu, projekt używa TinyBERT-General-4L-312D (TBG), który składa się z 14,5 miliona parametrów z wydajnością porównywalną do BERT-base (który ma 110 milionów parametrów).

Szkolenie z włączonymi promptami odbyło się na PyTorch i HuggingFace dla AXLV2 w ciągu 100 kroków partii o wielkości 13, przy szybkości uczenia 5e-4, z liniowym spadkiem. Każdy eksperyment został zainicjowany z trzema różnymi losowymi nasionami.

Wyniki

Projekt LMTurk prowadzi różne modele przeciwko tak wielu konkretnym pod-sektorom NLP, że złożone wyniki eksperymentów badaczy nie są łatwe do zredukowania do dowodów empirycznych, że LMTurk oferuje sam w sobie wykonalne podejście do ponownego użycia historycznych, pochodzących od ludzi, sytuacji uczenia się z niewielu przykładów.

Jednak do celów oceny, autorzy porównują swoją metodę z dwoma poprzednimi pracami: Exploiting Cloze Questions for Few Shot Text Classification and Natural Language Inference niemieckich badaczy Timo Schick i Hinrich Schutze; oraz wynikami z Prompt-Based Auto, przedstawionymi w Making Pre-trained Language Models Better Few-shot Learners przez Gao, Chen i Fisch (odpowiednio z Princeton i MIT).

Wyniki z eksperymentów LMTurk, z których badacze donoszą o 'porównywalnej' wydajności.

Wyniki z eksperymentów LMTurk, z których badacze donoszą o ‘porównywalnej’ wydajności.

W skrócie, LMTurk oferuje dość obiecującą linię zapytań dla badaczy, którzy szukają sposobów na wbudowanie i umocnienie danych oznaczonych przez ludzi w ewoluujących, średnio złożonych modelach językowych, gdzie automatyczne systemy zastępują dane wejściowe ludzkie.

Podobnie jak w przypadku stosunkowo niewielkiej ilości poprzednich prac w tej dziedzinie, centralna koncepcja opiera się na niezmienności oryginalnych danych ludzkich oraz założeniu, że czynniki czasowe – które mogą stanowić znaczne przeszkody w rozwoju NLP – nie będą wymagać dalszej interwencji ludzkiej, gdy linia rozwoju maszyn będzie ewoluować.

 

Opublikowane po raz pierwszy 30 grudnia 2022

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai