Kąt Andersona

Tworzenie modelu językowego w stylu GPT dla pojedynczego pytania

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy z Chin opracowali ekonomiczną metodę tworzenia systemów przetwarzania języka naturalnego w stylu GPT-3, unikając coraz bardziej zakazujących kosztów czasu i pieniędzy związanych z treningiem dużych zbiorów danych – rosnącego trendu, który w przeciwnym razie zagrażałby ostatecznie relegowaniem tego sektora sztucznej inteligencji do dużych firm i inwestorów.

Proponowana ramowa jest nazywana Task-Driven Language Modeling (TLM). Zamiast treningu ogromnego i złożonego modelu na ogromnym korpusie miliardów słów i tysiąca etykiet i klas, TLM trenuje znacznie mniejszy model, który faktycznie włącza zapytanie bezpośrednio do modelu.

Po lewej, typowy hiperskalowy podejście do modeli językowych o dużej objętości; po prawej, metoda TLM do eksploracji dużego korpusu językowego na podstawie tematu lub pytania. Źródło: https://arxiv.org/pdf/2111.04130.pdf

Po lewej, typowy hiperskalowy podejście do modeli językowych o dużej objętości; po prawej, metoda TLM do eksploracji dużego korpusu językowego na podstawie tematu lub pytania. Źródło: https://arxiv.org/pdf/2111.04130.pdf

Skutecznie, unikalny algorytm NLP lub model jest wytwarzany w celu odpowiedzi na pojedyncze pytanie, zamiast tworzenia ogromnego i nieporęcznego ogólnego modelu językowego, który może odpowiedzieć na szerszy zakres pytań.

Podczas testowania TLM, naukowcy stwierdzili, że nowe podejście osiąga wyniki, które są podobne lub lepsze niż modele językowe wstępnie wytrenowane, takie jak RoBERTa-Large, i systemy NLP hiperskalowe, takie jak OpenAI’s GPT-3, Google’s TRILLION Parameter Switch Transformer Model, Korea’s HyperClover, AI21 Labs’ Jurassic 1, i Microsoft’s Megatron-Turing NLG 530B.

W próbach TLM na ośmiu zestawach danych klasyfikacji w czterech dziedzinach, autorzy dodatkowo stwierdzili, że system redukuje wymagane treningowe FLOPs (operacje zmiennoprzecinkowe na sekundę) o dwa rzędy wielkości. Naukowcy mają nadzieję, że TLM może “udemokratyzować” sektor, który staje się coraz bardziej elitarny, z modelami NLP tak dużymi, że nie można ich realistycznie zainstalować lokalnie, a zamiast tego siedzą, w przypadku GPT-3, za drogimi i ograniczonymi API OpenAI i teraz, Microsoft Azure.

Autorzy stwierdzają, że skrócenie czasu treningu o dwa rzędy wielkości redukuje koszt treningu na 1,000 GPU przez jeden dzień do zaledwie 8 GPU przez 48 godzin.

Nowy raport jest zatytułowany NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework, i pochodzi od trzech naukowców z Uniwersytetu Tsinghua w Pekinie, i naukowca z chińskiej firmy rozwojowej AI, Recurrent AI, Inc.

Niedostępne odpowiedzi

Koszt treningu skutecznych, ogólnych modeli językowych staje się coraz bardziej charakteryzowany jako potencjalna “granica termiczna” stopnia, w jakim wydajne i dokładne NLP mogą się rozprzestrzeniać w kulturze.

Statystyki wzrostu cech w architekturach modeli NLP, z raportu z 2020 roku autorstwa A121 Labs. Źródło: https://arxiv.org/pdf/2004.08900.pdf

Statystyki wzrostu cech w architekturach modeli NLP, z raportu z 2020 roku autorstwa A121 Labs. Źródło: https://arxiv.org/pdf/2004.08900.pdf

W 2019 roku naukowiec obliczył, że koszt treningu modelu XLNet (zgłoszonego wówczas jako lepszy od BERT w zadaniach NLP) przez 2,5 dnia na 512 rdzeniach na 64 urządzeniach wynosi 61 440 USD, podczas gdy GPT-3 jest szacowany na 12 milionów dolarów – 200 razy więcej niż koszt treningu jego poprzednika, GPT-2 (choć ostatnie oszacowania twierdzą, że można go teraz wytrenować za zaledwie 4 600 000 dolarów na najtańszych GPU w chmurze).

Podzbiory danych na podstawie potrzeb zapytania

Zamiast tego, nowa proponowana architektura stara się uzyskać dokładne klasyfikacje, etykiety i uogólnienia, używając zapytania jako rodzaju filtra do określenia podzbioru informacji z dużego korpusu językowego, który będzie trenowany, wraz z zapytaniem, w celu udzielenia odpowiedzi na ograniczony temat.

Autorzy stwierdzają:

‘TLM jest motywowany dwoma kluczowymi ideami. Po pierwsze, ludzie opanowują zadanie, używając tylko niewielkiej części światowej wiedzy (np. studenci muszą tylko przeglądać kilka rozdziałów, spośród wszystkich książek na świecie, aby przygotować się do egzaminu).

‘Przypuszczamy, że istnieje wiele redundancji w dużym korpusie dla konkretnego zadania. Po drugie, trening na danych z etykietami jest znacznie bardziej efektywny pod względem danych dla wyników niż optymalizacja celu modelowania języka na danych nieoznaczonych. Na podstawie tych motywacji, TLM używa danych zadań jako zapytań do pobrania maleńkiego podzbioru ogólnego korpusu. Następnie łącznie optymalizuje nadzorowany cel zadania i cel modelowania języka, używając pobranych danych i danych zadań.’

Oprócz tego, że trening modeli NLP jest bardzo efektywny, autorzy widzą wiele zalet w używaniu modeli NLP napędzanych zadaniami. Po jednej stronie, badacze mogą cieszyć się większą elastycznością, z niestandardowymi strategiami dla długości sekwencji, tokenizacji, strofowania hiperparametrów i reprezentacji danych.

Naukowcy również przewidują rozwój hybrydowych systemów przyszłości, które wymieniają ograniczone wstępne treningi PLM (które nie są obecnie przewidywane w bieżącej implementacji) na większą wszechstronność i uogólnienie w stosunku do czasu treningu. Uważają system za krok naprzód w rozwoju metod zero-shot uogólnienia w dziedzinie.

Testowanie i wyniki

TLM został przetestowany na wyzwaniach klasyfikacji w ośmiu zadaniach w czterech dziedzinach – naukach biomedycznych, wiadomościach, recenzjach i naukach komputerowych. Zadania zostały podzielone na kategorie o wysokich i niskich zasobach. Zadania o wysokich zasobach obejmowały ponad 5 000 danych zadań, takich jak AGNews i RCT, wśród innych; zadania o niskich zasobach obejmowały ChemProt i ACL-ARC, a także HyperPartisan zestaw danych do wykrywania wiadomości.

Naukowcy opracowali dwa zestawy treningowe zatytułowane Corpus-BERT i Corpus-RoBERTa, z których ten drugi był dziesięć razy większy od pierwszego. Eksperymenty porównały ogólne wstępnie wytrenowane modele językowe BERT (z Google) i RoBERTA (z Facebooka) z nową architekturą.

Artykuł stwierdza, że chociaż TLM jest ogólną metodą i powinien być bardziej ograniczony w zakresie i zastosowaniu niż szersze i bardziej zaawansowane modele, jest w stanie osiągnąć wyniki porównywalne z metodami dostrajania w dziedzinie.

Wyniki porównujące wyniki TLM z zestawami opartymi na BERT i RoBERTa. Wyniki wymieniono średni wynik F1 na trzech różnych skalach treningu, oraz wymieniono liczbę parametrów, łączne obliczenia treningowe (FLOPs) i rozmiar korpusu treningowego.

Wyniki porównujące wyniki TLM z zestawami opartymi na BERT i RoBERTa. Wyniki wymieniono średni wynik F1 na trzech różnych skalach treningu, oraz wymieniono liczbę parametrów, łączne obliczenia treningowe (FLOPs) i rozmiar korpusu treningowego.

Autorzy stwierdzają, że TLM jest w stanie osiągnąć wyniki porównywalne lub lepsze niż PLM, z znacznym zmniejszeniem wymaganych FLOPs, oraz wymaga tylko 1/16 rozmiaru korpusu treningowego. Na skalach średnich i dużych, TLM może poprawić wyniki o 0,59 i 0,24 punktu średnio, przy jednoczesnym zmniejszeniu rozmiaru danych treningowych o dwa rzędy wielkości.

‘Te wyniki potwierdzają, że TLM jest bardzo dokładny i znacznie bardziej wydajny niż PLM. Ponadto, TLM zyskuje więcej zalet w wydajności na większej skali. Wskazuje to, że większe PLM mogły być wytrenowane do przechowywania bardziej ogólnej wiedzy, która nie jest przydatna dla konkretnego zadania.’

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai