AI-modeller og platforme

Kan du bygge store sprogmodeller som ChatGPT til halv pris?

mm
Føj Unite.AI til dine foretrukne kilder på Google

Store sprogmodeller (LLM) som GPT-3 og ChatGPT har revolutioneret AI ved at tilbyde naturlig sprogforståelse og indholdsgenereringsfunktioner. Men deres udvikling kommer med en høj pris, der begrænser adgangen og yderligere forskning. Forskere estimerer, at træning af GPT-3 kostede OpenAI omkring $5 million. Alligevel anerkendte Microsoft (MSFT ) potentialet og investerede $1 milliard i 2019 og $10 milliarder i 2023 i OpenAI’s GPT-3 og ChatGPT-venture.

LLM’er er maskinelæringsmodeller, der trænes på omfattende tekstdata til NLP-anvendelser. De er baseret på transformer-arkitektur og anvender opmærksomhedsmekanismer til NLP-opgaver som spørgsmål-svar, maskinoversættelse, sentimentanalyse osv.

Spørgsmålet er: kan effektiviteten af disse store modeller øges, samtidig med at den computermæssige omkostning og træningstiden reduceres?

Flere tilgange, som f.eks. Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance osv., er blevet udviklet for at reducere den computermæssige omkostning ved træning af neurale netværk. Den nye LiGO (Linear Growth Operator)-tilgang, som vi skal diskutere, sætter en ny standard. Den halverer den computermæssige omkostning ved træning af LLM’er.

Før vi diskuterer denne teknik, er det vigtigt at undersøge de faktorer, der bidrager til den høje pris for at opbygge LLM’er.

Omkkostningerne ved at bygge store sprogmodeller

Tre større udgifter til udvikling af LLM’er er følgende:

1. Computermæssige ressourcer

Opbygning af LLM’er kræver massive computermæssige ressourcer til træning på store datasæt. De skal behandle milliarder af parametre og lære komplekse mønstre fra massive tekstdata.

Investering i specialiseret hardware som f.eks. Graphics Processing Units (GPUs) og Tensor Processing Units (TPUs) er nødvendig for at bygge og træne LLM’er for at opnå state-of-the-art-præstation.

For eksempel blev GPT-3 trænet på en supercomputer med 10000 enterprise-klasse-GPUs (H100 og A100) og 285.000 CPU-kerner.

2. Energiforbrug

De intensive computermæssige ressourcer, der kræves til opbygning af LLM’er, resulterer i betydeligt energiforbrug. For eksempel tog træning af 175 milliarder parametre GPT-3 14,8 dage ved hjælp af 10.000 V100-GPUs, svarende til 3,55 millioner GPU-timer. Sådant højt energiforbrug har betydelige miljømæssige virkninger.

3. Dataopbevaring og -administration

LLM’er trænes på store datasæt. For eksempel blev GPT-3 trænet på et stort korpus af tekst data, herunder Common Crawl, WebText2, Books1, Books2 og Wikipedia, blandt andre kilder. Betydelig infrastrukturinvestering er nødvendig for at indsamle, kuratere og opbevare disse datasæt.

Derudover kræves cloud-lagring til dataopbevaring og menneskelig ekspertise til dataforarbejdning og versionsstyring. Desuden tilføjer det faktum, at din datastrategi skal overholde regler som f.eks. GDPR, til omkostningerne.

LiGO-teknikken: Reducer omkostningerne ved at bygge store sprogmodeller til halv pris

LiGO (Linear Growth Operator) er en ny teknik, der er udviklet af forskere på MIT for at reducere den computermæssige omkostning ved træning af LLM’er med 50%. Metoden indebærer initialisering af vægtene for større modeller fra mindre forudtrænede modeller, hvilket muliggør effektiv skalerbarhed af neurale netværk.

Yoon Kim, den seniorforfatter af artiklen, siger:

“Det er blevet estimeret, at træning af modeller i skalaen af, hvad ChatGPT antages at køre på, kunne tage millioner af dollars bare for en enkelt træning. Kan vi forbedre effektiviteten af disse træningsmetoder, så vi kan få gode modeller på kortere tid og til lavere omkostninger? Vi foreslår at gøre dette ved at udnytte mindre sprogmodeller, der tidligere er blevet trænet.”

Denne metode opretholder performancefordelene ved større modeller med reduceret computermæssig omkostning og træningstid i forhold til at træne et stort model fra scratch. LiGO anvender en data-dreven lineær vækstoperator, der kombinerer dybde- og breddeoperatører for optimal præstation.

Artiklen anvendte forskellige datasæt til at udføre tekstbaserede eksperimenter, herunder det engelske Wikipedia-korpus til træning af BERT- og RoBERTa-modeller og C4-datasættet til træning af GPT2.

LiGO-teknik-eksperimentet omfattede vækst af BERT-Small til BERT-Base, BERT-Base til BERT-Large, RoBERTa-Small til RoBERTa-Base, GPT2-Base til GPT2-Medium og CaiT-XS til CaiT-S.

Forskerne sammenlignede deres tilgang med flere andre baseline, herunder træning fra scratch, progressiv træning, bert2BERT og KI.

LiGO-teknikken tilbød 44,7% besparelse i FLOPs (floating-point operationer per sekund) og 40,7% besparelse i væggtid i forhold til at træne BERT-Base fra scratch ved at genanvende BERT-Small-modellen. LiGO-vækstoperatoren overgår StackBERT, MSLT, bert2BERT og KI i effektiv træning.

Fordele ved at anvende en træningsoptimeringsteknik som LiGO

LiGO er en effektiv neuralt netværkstræning, der har flere fordele, som følger:

1. Hurtigere træning

Som nævnt tidligere er hurtigere træning den primære fordel ved LiGO-teknikken. Den træner LLM’er på halv tid, hvilket øger produktiviteten og reducerer omkostningerne.

2. Resurseffektiv

LiGO er resurseffektiv, da den minimerer væggtid og FLOPs, hvilket resulterer i en mere omkostningseffektiv og miljøvenlig tilgang til træning af store transformer-modeller.

3. Generalisering

LiGO-teknikken har forbedret præstationen af både sprog- og visionstransformerer, hvilket tyder på, at det er en generaliserbar teknik, der kan anvendes til forskellige opgaver.

Opbygning af kommercielle AI-produkter er kun en del af de samlede omkostninger, der er forbundet med AI-systemer. En anden betydelig komponent af omkostninger kommer fra daglige operationer. For eksempel kostede det OpenAI omkring $700.000 om dagen at besvare forespørgsler ved hjælp af ChatGPT. Forskere forventes at fortsætte med at udforske tilgange, der gør LLM’er omkostningseffektive under træning og mere tilgængelige under kørsel.

Til mere AI-relateret indhold, besøg unite.ai.

Haziqa er en Data Scientist med omfattende erfaring i at skrive teknisk indhold til AI- og SaaS-virksomheder.