Andersons hoek

Het creëren van een GPT-Style Taalmodel voor één enkele vraag

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers uit China hebben een economische methode ontwikkeld voor het creëren van GPT-3-achtige Natural Language Processing-systemen, zonder de steeds prohibitievere kosten van tijd en geld die nodig zijn voor het trainen van grote datasets – een trend die anders dreigt om deze sector van AI uiteindelijk te beperken tot FAANG-spelers en grote investeerders.

Het voorgestelde kader heet Task-Driven Language Modeling (TLM). In plaats van een enorm en complex model te trainen op een enorme corpus van miljarden woorden en duizenden labels en klassen, traint TLM een veel kleinere model dat daadwerkelijk een query rechtstreeks in het model incorporeert.

Links, een typische hyperscale-aanpak voor high-volume taalmodellen; rechts, TLM's slanke methode om een grote taalcorpus te onderzoeken op basis van een onderwerp of vraag. Bron: https://arxiv.org/pdf/2111.04130.pdf

Links, een typische hyperscale-aanpak voor high-volume taalmodellen; rechts, TLM’s slanke methode om een grote taalcorpus te onderzoeken op basis van een onderwerp of vraag. Bron: https://arxiv.org/pdf/2111.04130.pdf

Effectief wordt een unieke NLP-algoritme of model geproduceerd om één enkele vraag te beantwoorden, in plaats van een enorm en onhandelbaar algemeen taalmodel te creëren dat een bredere variëteit aan vragen kan beantwoorden.

Bij het testen van TLM vonden de onderzoekers dat de nieuwe aanpak resultaten oplevert die vergelijkbaar zijn met of beter zijn dan Pretrained Language Models zoals RoBERTa-Large, en hyperscale NLP-systemen zoals OpenAI’s GPT-3, Google’s TRILLION Parameter Switch Transformer Model, Korea’s HyperClover, AI21 Labs’ Jurassic 1, en Microsoft’s Megatron-Turing NLG 530B.

In proeven met TLM over acht classificatie-datasets in vier domeinen, vonden de auteurs ook dat het systeem de benodigde trainings-FLOPs (floating point operations per second) met twee ordes van grootte vermindert. De onderzoekers hopen dat TLM een sector kan ‘democratiseren’ die steeds elitairder wordt, met NLP-modellen die zo groot zijn dat ze niet realistisch lokaal geïnstalleerd kunnen worden, en in plaats daarvan achter de dure en beperkte toegang-API’s van OpenAI en, nu, Microsoft Azure, zitten.

De auteurs stellen dat het verkorten van de trainingsduur met twee ordes van grootte de trainingskosten over 1.000 GPU’s voor één dag vermindert tot slechts 8 GPU’s over 48 uur.

Het nieuwe rapport heet NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework, en komt van drie onderzoekers aan de Tsinghua Universiteit in Beijing, en een onderzoeker van het China-gebaseerde AI-ontwikkelingsbedrijf Recurrent AI, Inc.

Onbetaalbare antwoorden

De kosten van het trainen van effectieve, algemene taalmodellen worden steeds vaker gekarakteriseerd als een potentieel ‘thermisch limiet’ voor de mate waarin prestatiegerichte en nauwkeurige NLP echt in de cultuur kan doordringen.

Statistieken over de groei van facetten in NLP-modelarchitecturen, uit een rapport van 2020 van A121 Labs. Bron: https://arxiv.org/pdf/2004.08900.pdf

Statistieken over de groei van facetten in NLP-modelarchitecturen, uit een rapport van 2020 van A121 Labs. Bron: https://arxiv.org/pdf/2004.08900.pdf

In 2019 berekende een onderzoeker dat het $61.440 USD kost om het XLNet-model (op dat moment gemeld als beter dan BERT in NLP-taken) te trainen over 2,5 dagen op 512 cores over 64 apparaten, terwijl GPT-3 geschat wordt te hebben gekost $12 miljoen om te trainen – 200 keer de uitgave van het trainen van zijn voorganger, GPT-2 (hoewel recente herberekeningen claimen dat het nu getraind kan worden voor slechts $4.600.000 op de goedkoopste cloud-GPU’s).

Deelverzamelingen van gegevens op basis van vraagbehoeften

In plaats daarvan zoekt de nieuwe voorgestelde architectuur naar nauwkeurige classificaties, labels en generalisatie door een vraag te gebruiken als een soort filter om een deelverzameling van informatie uit een grote taaldatabase te definiëren die getraind zal worden, samen met de vraag, om antwoorden te geven over een beperkt onderwerp.

De auteurs stellen:

‘TLM  is  gemotiveerd  door  twee  sleutelideeën.   Ten eerste, mensen beheersen een taak door slechts een klein deel van de wereldkennis te gebruiken (bijv. studenten hoeven alleen een paar hoofdstukken te herzien, onder alle boeken in de wereld, om te leren voor een examen). 

‘We hypotheseren dat er veel redundantie is in de grote corpus voor een specifieke taak. Ten tweede is trainen op gesuperviseerde gelabelde gegevens veel gegevensefficiënter voor downstream-prestaties dan het optimaliseren van het taalmodeldoel op ongelabelde gegevens.  Op basis van deze motivaties, gebruikt TLM de taakgegevens als queries om een kleine deelverzameling van de algemene corpus te verkrijgen.  Dit wordt gevolgd door het gezamenlijk optimaliseren van een gesuperviseerd taakdoel en een taalmodeldoel met behulp van zowel de opgehaalde gegevens als de taakgegevens.’

Behalve dat het zeer effectieve NLP-modeltraining betaalbaar maakt, zien de auteurs een aantal voordelen van het gebruik van taakgestuurde NLP-modellen. Ten eerste kunnen onderzoekers genieten van een grotere flexibiliteit, met aangepaste strategieën voor sequentielengte, tokenisatie, hyperparameterafstemming en gegevensrepresentaties.

De onderzoekers voorzien ook de ontwikkeling van hybride toekomstige systemen die de beperkte voorafgaande training van een PLM (die anders niet wordt verwacht in de huidige implementatie) afwegen tegen een grotere veelzijdigheid en generalisatie tegen trainingskosten. Zij beschouwen het systeem als een stap vooruit voor de vooruitgang van in-domein zero-shot generalisatie-methoden.

Testen en resultaten

TLM werd getest op classificatie-uitdagingen in acht taken over vier domeinen – biomedische wetenschap, nieuws, beoordelingen en informatica. De taken werden onderverdeeld in high-resource en low-resource categorieën. High-resource taken omvatten meer dan 5.000 taakgegevens, zoals AGNews en RCT, onder andere; low-resource taken omvatten ChemProt en ACL-ARC, evenals de HyperPartisan nieuwsdetectie-dataset.

De onderzoekers ontwikkelden twee trainingssets met de titels Corpus-BERT en Corpus-RoBERTa, waarvan de laatste tien keer zo groot was als de eerste. De experimenten vergeleken algemene Pretrained Language Models BERT (van Google) en RoBERTA (van Facebook ) met de nieuwe architectuur.

Het artikel stelt dat hoewel TLM een algemene methode is, en beperkter in omvang en toepasbaarheid zou moeten zijn dan bredere en grotere state-of-the-art-modellen, het in staat is om prestaties te leveren die dicht bij domein-adaptieve fine-tuning-methoden liggen.

Resultaten van het vergelijken van de prestaties van TLM met BERT- en RoBERTA-gebaseerde sets. De resultaten geven een gemiddelde F1-score over drie verschillende trainingsgroottes weer, en geven het aantal parameters, de totale trainingscompute (FLOPs) en de grootte van de trainingscorpus weer.

Resultaten van het vergelijken van de prestaties van TLM met BERT- en RoBERTA-gebaseerde sets. De resultaten geven een gemiddelde F1-score over drie verschillende trainingsgroottes weer, en geven het aantal parameters, de totale trainingscompute (FLOPs) en de grootte van de trainingscorpus weer.

De auteurs concluderen dat TLM in staat is om resultaten te behalen die vergelijkbaar zijn met of beter zijn dan PLM’s, met een aanzienlijke reductie in benodigde FLOPs en slechts 1/16e van de trainingscorpus. Over medium en grote schalen kan TLM de prestaties met 0,59 en 0,24 punten verbeteren, terwijl de trainingsgegevensgrootte met twee ordes van grootte wordt verkleind.

‘Deze resultaten bevestigen dat TLM zeer nauwkeurig en veel efficiënter is dan PLM’s. Bovendien biedt TLM meer voordelen in efficiëntie op een grotere schaal. Dit wijst erop dat grotere PLM’s mogelijk zijn getraind om meer algemene kennis op te slaan die niet nuttig is voor een specifieke taak.’

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai