AI-modeller og plattformer

Kan du bygge store språkmodeller som ChatGPT til halv pris?

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Store språkmodeller (LLMs) som GPT-3 og ChatGPT har revolusjonert AI ved å tilby naturlig språkforståelse og innholdsgenereringsfunksjoner. Men deres utvikling kommer med en stor pris, som begrenser tilgjengelighet og videre forskning. Forskere estimerer at trening av GPT-3 kostet OpenAI rundt $5 millioner. Likevel erkjente Microsoft (MSFT ) potensialet og investerte $1 milliard i 2019 og $10 milliarder i 2023 i OpenAI sine GPT-3 og ChatGPT-prosjekter.

LLMs er maskinlæringsmodeller som er trenet på omfattende tekstdata for NLP-applikasjoner. De er basert på transformer-arkitektur og bruker oppmerksomhetsmekanismer for NLP-oppdrag som spørsmål-svar, maskinoversettelse, sentimentanalyse osv.

Spørsmålet er: kan effektiviteten av disse store modellene økes samtidig som beregningskostnadene og treningsiden reduseres?

Forskjellige tilnærminger, som Progressive Neural Networks, Network Morphism, intra-layer model parallelism, kunnskapsarv osv., er utviklet for å redusere beregningskostnadene for trening av neurale nettverk. Den nye LiGO (Linear Growth Operator) tilnærmingen vi skal diskutere, setter en ny standard. Den halverer beregningskostnadene for trening av LLMs.

Før vi diskuterer denne teknikken, er det essensielt å undersøke faktorene som bidrar til den høye prisen for å lage LLMs.

Kostnaden ved å bygge store språkmodeller

Tre store utgifter for å utvikle LLMs er som følger:

1. Beregningsressurser

Bygging av LLMs krever massive beregningsressurser for å trene på store datasett. De må prosessere milliarder av parametre og lære komplekse mønster fra omfattende tekstdata.

Investering i spesialisert maskinvare som grafikkprosessorer (GPUs) og tensorprosessorer (TPUs) er nødvendig for å bygge og trene LLMs for å oppnå state-of-the-art-ytelse.

For eksempel ble GPT-3 trenet på en supercomputer med 10000 bedriftsgraderte GPUs (H100 og A100) og 285 000 CPU-kjerner.

2. Energiforbruk

De intensive beregningsressursene som kreves for å bygge LLMs resulterer i betydelig energiforbruk. For eksempel tok trening av 175 milliarder parametre GPT-3 14,8 dager med 10 000 V100 GPUs, noe som tilsvarer 3,55 millioner GPU-timer. Slik høyt energiforbruk har betydelige miljømessige effekter også.

3. Data lagring og håndtering

LLMs er trenet på store datasett. For eksempel ble GPT-3 trenet på et omfattende korpus av tekst data, inkludert Common Crawl, WebText2, Books1, Books2 og Wikipedia, blant andre kilder. Betydelig infrastrukturinvestering er nødvendig for å samle inn, kuratere og lagre disse datasettene.

Også skytjenerlagring er nødvendig for data lagring, og menneskelig ekspertise for dataforberedning og versjonskontroll. I tillegg bidrar det til kostnadene å sikre at din datastrategi er i samsvar med regler som GDPR.

LiGO-teknikken: Reduser kostnadene ved å bygge store språkmodeller til halv pris

LiGO (Linear Growth Operator) er en ny teknikk utviklet av forskere ved MIT for å redusere beregningskostnadene for trening av LLMs med 50 %. Metoden innebærer å initialisere vektene til større modeller fra mindre forhåndstrente modeller, noe som muliggjør effektiv skalerings av neurale nettverk.

Yoon Kim, hovedforfatteren av artikkelen, sier:

“Det er estimert at trening av modeller i størrelsen til hva ChatGPT antas å kjøre på, kan ta millioner av dollar bare for en enkelt treningsrunde. Kan vi forbedre effektiviteten av disse treningsmetodene, så vi kan fortsatt få gode modeller på kortere tid og til lavere pris? Vi foreslår å gjøre dette ved å utnytte mindre språkmodeller som tidligere er trenet.”

Denne metoden beholder ytelsesfordelene til større modeller med redusert beregningskostnad og trenings tid sammenlignet med å trene en stor modell fra scratch. LiGO utnytter en data-drevet lineær vekstoperatør som kombinerer dybde- og breddeoperatører for optimal ytelse.

Artikkelen brukte ulike datasett for å utføre tekst-baserte eksperimenter, inkludert det engelske Wikipedia-korpuset for trening av BERT- og RoBERTa-modeller og C4-datasett for trening av GPT2.

LiGO-teknikk-eksperimentene inkluderte å vokse BERT-Small til BERT-Base, BERT-Base til BERT-Large, RoBERTaSmall til RoBERTa-Base, GPT2-Base til GPT2-Medium og CaiT-XS til CaiT-S.

Forskerne sammenlignet sin tilnærming med flere andre baseline, inkludert trening fra scratch, progressiv trening, bert2BERT og KI.

LiGO-teknikken tilbød 44,7 % besparelse i FLOPs (flytende-punkt-operasjoner per sekund) og 40,7 % besparelse i veggtid sammenlignet med å trene BERT-Base fra scratch ved å gjenbruke BERT-Small-modellen. LiGO-vekstoperatør overgår StackBERT, MSLT, bert2BERT og KI i effektiv trening.

Fordelene ved å bruke en treningsoptimeringsteknikk som LiGO

LiGO er en effektiv neural nettverkstreningsmetode som har flere fordeler, som følger:

1. Raskere trening

Som nevnt tidligere, er raskere trening den viktigste fordelen med LiGO-teknikken. Den trener LLMs på halv tid, øker produktiviteten og reduserer kostnadene.

2. Ressurs-effektiv

LiGO er ressurs-effektiv siden den minimerer veggtid og FLOPs, noe som leder til en mer kostnadseffektiv og miljøvennlig tilnærming til trening av store transformer-modeller.

3. Generalisering

LiGO-teknikken har forbedret ytelsen til både språk- og visjonstransformatorer, noe som tyder på at det er en generaliserbar teknikk som kan brukes til ulike oppgaver.

Bygging av kommersielle AI-produkter er bare ett aspekt av de totale utgiftene forbundet med AI-systemer. En annen betydelig komponent av kostnadene kommer fra daglige operasjoner. For eksempel, kostet det OpenAI rundt $700 000 hver dag å svare på spørsmål med ChatGPT. Forskere forventes å fortsette å utforske tilnærminger som gjør LLMs kostnadseffektive under trening og mer tilgjengelige på kjøretid.

For mer AI-relatert innhold, besøk unite.ai.

Haziqa er en dataforsker med omfattende erfaring med å skrive teknisk innhold for AI- og SaaS-selskaper.