Andersonův úhel

Vytvoření modelu jazyka ve stylu GPT pro jednu otázku

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vědci z Číny vyvinuli ekonomickou metodu pro vytváření systémů zpracování přirozeného jazyka ve stylu GPT-3, zatímco se vyhnuli stále více prohibitive nákladům na čas a peníze spojené s výcvikem velkých objemů dat – rostoucí trend, který jinak hrozí, že nakonec releguje tento sektor umělé inteligence pouze pro hráče FAANG a vysoké investory.

Navrhovaná architektura se nazývá Task-Driven Language Modeling (TLM). Místo toho, aby se trénoval obrovský a komplexní model na obrovském korpusu miliard slov a tisících label a tříd, TLM trénuje mnohem menší model, který přímo zahrnuje dotaz do modelu.

Vlevo, typický hyperscale přístup k vysokovýkonným modelům jazyka; vpravo, slimline metoda TLM pro prozkoumání velkého jazykového korpusu na základě tématu nebo otázky. Zdroj: https://arxiv.org/pdf/2111.04130.pdf

Vlevo, typický hyperscale přístup k vysokovýkonným modelům jazyka; vpravo, slimline metoda TLM pro prozkoumání velkého jazykového korpusu na základě tématu nebo otázky. Zdroj: https://arxiv.org/pdf/2111.04130.pdf

Účinně, je vytvořen jedinečný algoritmus nebo model NLP, aby odpověděl na jednu otázku, místo toho, aby se vytvořil obrovský a neohrabaný obecný model jazyka, který může odpovědět na širší řadu otázek.

Při testování TLM, vědci zjistili, že nový přístup dosahuje výsledků, které jsou podobné nebo lepší než předtrénované modely jazyka, jako je RoBERTa-Large, a hyperscale systémy NLP, jako je OpenAI’s GPT-3, Google’s TRILLION Parameter Switch Transformer Model, Korea’s HyperClover, AI21 Labs’ Jurassic 1, a Microsoft’s Megatron-Turing NLG 530B.

V testech TLM na osm klasifikačních úkolech přes čtyři domény, autoři navíc zjistili, že systém snižuje počet operací s plovoucí desetinnou čárkou (FLOPs) požadovaných o dva řády velikosti. Vědci doufají, že TLM může “demokratizovat” sektor, který se stává stále více elitním, s modely NLP tak velkými, že nemohou být realisticky nainstalovány místně, a místo toho sedí, v případě GPT-3, za drahými a omezenými API OpenAI a nyní, Microsoft Azure.

Autoři uvádějí, že snížení doby tréninku o dva řády velikosti snižuje náklady na trénink o více než 1 000 GPU za jeden den na pouhých 8 GPU za 48 hodin.

Nová zpráva se nazývá NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework a pochází od tří vědců z Tsinghua University v Pekingu a výzkumníka z čínské společnosti pro vývoj umělé inteligence Recurrent AI, Inc.

Nedostupné odpovědi

Náklad tréninku účinných, všestranných modelů jazyka se stále více stává charakterizován jako potenciální “tepelná hranice” pro rozsah, ve kterém může skutečně difundovat performantní a přesné zpracování přirozeného jazyka.

Statistiky růstu aspektů v architekturách modelů NLP, z zprávy z roku 2020 od A121 Labs. Zdroj: https://arxiv.org/pdf/2004.08900.pdf

Statistiky růstu aspektů v architekturách modelů NLP, z zprávy z roku 2020 od A121 Labs. Zdroj: https://arxiv.org/pdf/2004.08900.pdf

V roce 2019 výzkumník spočítal, že náklady na trénink modelu XLNet (který byl tehdy hlášen jako lepší než BERT v úkolech NLP) jsou 61 440 USD za 2,5 dne na 512 jádrech napříč 64 zařízeními, zatímco GPT-3 se odhaduje, že stál 12 milionů dolarů za trénink – 200krát více než jeho předchůdce GPT-2 (ačkoli nedávné re-odhady tvrdí, že by mohl být trénován nyní za pouhých 4 600 000 dolarů na nejnižších cenách cloudových GPU).

Podmnožiny dat na základě požadavků dotazu

Místo toho nová navrhovaná architektura seeks získat přesné klasifikace, labely a generalizaci použitím dotazu jako filtru pro definici podmnožiny informací z velkého jazykového korpusu, který bude trénován společně s dotazem, aby poskytoval odpovědi na omezené téma.

Autoři uvádějí:

‘TLM je motivován dvěma klíčovými myšlenkami. První, lidé zvládají úkol pomocí pouze malé části světových znalostí (například studenti potřebují pouze přezkoumat několik kapitol, mezi všemi knihami na světě, aby se připravili na zkoušku). ‘

‘Předpokládáme, že existuje mnoho redundance v velkém korpusu pro konkrétní úkol. Druhá, trénink na označených datech je mnohem více datově efektivní pro dolní výkon než optimalizace cíle jazykového modelování na neošetřených datech. Na základě těchto motivací TLM používá úkolová data jako dotazy pro načtení malé podmnožiny obecného korpusu. To je následováno společnou optimalizací cíle dohledovaného úkolu a cíle jazykového modelování pomocí obou načtených dat a úkolových dat.’

Kromě toho, že činí efektivní trénink modelů NLP dostupným, autoři vidí řadu výhod používání modelů NLP řízených úkolem. Jednou z nich je, že výzkumníci mohou využívat větší flexibilitu, s vlastními strategiemi pro délku sekvence, tokenizaci, ladění hyperparametrů a datové reprezentace.

Výzkumníci také předpovídají rozvoj hybridních budoucích systémů, které obchodují omezené předtrénování PLM (které jinak není předpokládáno v současné implementaci) proti větší všestrannosti a generalizaci proti tréninkovým časům. Považují systém za krok vpřed pro rozvoj metod nula-shot generalizace v rámci domény.

Testování a výsledky

TLM byl testován na klasifikačních výzvách v osmi úkolech přes čtyři domény – biomedicínská věda, zprávy, recenze a počítačová věda. Úkoly byly rozděleny do kategorií s vysokými a nízkými zdroji. Úkoly s vysokými zdroji zahrnovaly více než 5 000 úkolových dat, jako je AGNews a RCT, mezi ostatními; úkoly s nízkými zdroji zahrnovaly ChemProt a ACL-ARC, stejně jako HyperPartisan detekční sadu zpráv.

Výzkumníci vyvinuli dvě trénovací sady nazvané Corpus-BERT a Corpus-RoBERTa, druhá desetkrát větší než první. Experimenty porovnaly obecné předtrénované modely jazyka BERT (od Google) a RoBERTA (od Facebooku) s novou architekturou.

Článek pozoruje, že i když je TLM obecnou metodou, a měl by být omezenější v rozsahu a aplikovatelnosti než širší a vyšší objemové modely státu, je schopen dosáhnout výsledků blízkých metodám jemného ladění v rámci domény.

Výsledky porovnávání výkonu TLM proti BERT a RoBERTa-založeným sadám. Výsledky uvádějí průměrný skóre F1 napříč třemi různými škálami tréninku a uvádějí počet parametrů, celkový tréninkový výpočet (FLOPs) a velikost tréninkového korpusu.

Výsledky porovnávání výkonu TLM proti BERT a RoBERTa-založeným sadám. Výsledky uvádějí průměrný skóre F1 napříč třemi různými škálami tréninku a uvádějí počet parametrů, celkový tréninkový výpočet (FLOPs) a velikost tréninkového korpusu.

Autoři uzavírají, že TLM je schopen dosáhnout výsledků, které jsou srovnatelné nebo lepší než PLM, se značným snížením počtu FLOPs požadovaných, a vyžaduje pouze 1/16 tréninkového korpusu. Na středních a velkých škálách TLM zřejmě může zlepšit výkon o 0,59 a 0,24 bodu v průměru, zatímco snižuje velikost tréninkových dat o dva řády velikosti.

‘Tyto výsledky potvrzují, že TLM je vysoce přesný a mnohem více efektivní než PLM. Navíc, TLM získá více výhod v efektivitě na větší škále. To naznačuje, že větší PLM mohly být trénovány pro uložení více obecných znalostí, které nejsou pro konkrétní úkol užitečné.’

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai