AI-modeller och plattformar

Kan du bygga stora språkmodeller som ChatGPT till hälften av kostnaden?

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Stora språkmodeller (LLM) som GPT-3 och ChatGPT har revolutionerat AI genom att erbjuda naturlig språkförståelse och innehållsgenereringsförmågor. Men deras utveckling kommer med en hög pris, vilket begränsar tillgänglighet och ytterligare forskning. Forskare uppskattar att utbildning av GPT-3 kostade OpenAI runt $5 miljoner. Trots detta erkände Microsoft (MSFT ) potentialen och investerade $1 miljard 2019 och $10 miljarder 2023 i OpenAI:s GPT-3 och ChatGPT-venture.

LLM är maskinlärningsmodeller som tränas på omfattande textdata för NLP-tillämpningar. De baseras på transformerarkitektur och använder uppmärksamhetsmekanismer för NLP-uppgifter som frågesvar, maskinöversättning, sentimentanalys etc.

Frågan uppstår: kan effektiviteten hos dessa stora modeller ökas samtidigt som beräkningskostnaden och utbildningstiden minskas?

Flera tillvägagångssätt, som Progressiva neuronnät, Nätverksmorfism, intra-lagers modellparallellism, kunskapsarv etc., har utvecklats för att minska beräkningskostnaden för utbildning av neuronnät. Den nya LiGO (Linjär tillväxtoperator) -metoden vi kommer att diskutera sätter en ny standard. Den halverar beräkningskostnaden för utbildning av LLM.

Innan vi diskuterar denna teknik är det viktigt att undersöka de faktorer som bidrar till den höga kostnaden för att skapa LLM.

Kostnaden för att bygga stora språkmodeller

Tre stora utgifter för utveckling av LLM är följande:

1. Beräkningsresurser

Byggande av LLM kräver omfattande beräkningsresurser för att träna på stora datamängder. De måste bearbeta miljarder parametrar och lära sig komplexa mönster från omfattande textdata.

Investering i specialiserad hårdvara som Grafikprocessorer (GPU) och Tensorprocessorer (TPU) krävs för att bygga och träna LLM för att uppnå toppprestationer.

Till exempel tränades GPT-3 på en superdator med 10000 företagsklass-GPU (H100 och A100) och 285 000 CPU-kärnor.

2. Energiförbrukning

De omfattande beräkningsresurser som krävs för att bygga LLM resulterar i betydande energiförbrukning. Till exempel tog utbildning av 175 miljarder parametrar GPT-3 14,8 dagar med 10 000 V100-GPU, vilket motsvarar 3,55 miljoner GPU-timmar. En sådan hög nivå av energiförbrukning har betydande miljöeffekter.

3. Data lagring och hantering

LLM tränas på stora datamängder. Till exempel tränades GPT-3 på en omfattande samling textdata, inklusive Common Crawl, WebText2, Books1, Books2 och Wikipedia, bland andra källor. Betydande infrastrukturinvestering krävs för att samla in, kurera och lagra dessa datamängder.

Det krävs också molnlagring för data lagring och mänsklig expertis för data förbearbetning och versionshantering. Dessutom tillkommer kostnader för att säkerställa att din datastrategi följer regler som GDPR.

LiGO-tekniken: Halvera kostnaden för att bygga stora språkmodeller

LiGO (Linjär tillväxtoperator) är en ny teknik som utvecklats av forskare vid MIT för att minska beräkningskostnaden för utbildning av LLM med 50%. Metoden innebär att initiera vikterna för större modeller från mindre förtränade modeller, vilket möjliggör effektiv skalning av neuronnät.

Yoon Kim, den seniora författaren till artikeln, säger:

”Det har uppskattats att utbildning av modeller i samma skala som ChatGPT kan kosta miljoner dollar för en enda utbildningsomgång. Kan vi förbättra effektiviteten i dessa träningsmetoder så att vi kan få bra modeller på kortare tid och till lägre kostnad? Vi föreslår att göra detta genom att utnyttja mindre språkmodeller som tidigare har tränats.”

Denna metod behåller prestandafördelarna med större modeller med minskad beräkningskostnad och utbildningstid jämfört med att träna en stor modell från scratch. LiGO använder en datastyrd linjär tillväxtoperator som kombinerar djup och bredd operatorer för optimal prestanda.

Artikeln använde olika datamängder för att genomföra textbaserade experiment, inklusive den engelska Wikipediakorpusen för utbildning av BERT- och RoBERTa-modeller och C4-datamängden för utbildning av GPT2.

LiGO-teknikens experiment omfattade att växa BERT-Small till BERT-Base, BERT-Base till BERT-Large, RoBERTaSmall till RoBERTa-Base, GPT2-Base till GPT2-Medium och CaiT-XS till CaiT-S.

Forskarna jämförde sin metod med flera andra baslinjer, inklusive utbildning från scratch, progressiv utbildning, bert2BERT och KI.

LiGO-tekniken erbjöd 44,7% besparingar i FLOPs (flyttalsoperationer per sekund) och 40,7% besparingar i väggklocktid jämfört med att träna BERT-Base från scratch genom att återanvända BERT-Small-modellen. LiGO-tillväxtoperator överträffar StackBERT, MSLT, bert2BERT och KI i effektiv utbildning.

Fördelarna med att använda en träningsoptimeringsteknik som LiGO

LiGO är en effektiv neural nätverksutbildningsmetod som har flera fördelar som listas nedan:

1. Snabbare utbildning

Som nämnts tidigare är snabbare utbildning den främsta fördelen med LiGO-tekniken. Den tränar LLM på halva tiden, vilket ökar produktiviteten och minskar kostnaderna.

2. Resurseffektiv

LiGO är resurseffektiv eftersom den minimerar väggklocktid och FLOPs, vilket leder till en mer kostnadseffektiv och miljövänlig approach för utbildning av stora transformermodeller.

3. Generalisering

LiGO-tekniken har förbättrat prestandan för både språk- och visionstransformatorer, vilket tyder på att det är en generaliserbar teknik som kan tillämpas på olika uppgifter.

Att bygga kommersiella AI-produkter är bara en aspekt av de totala kostnaderna förknippade med AI-system. En annan betydande komponent av kostnaderna kommer från dagliga operationer. Till exempel kostar det OpenAI runt $700 000 varje dag att svara på frågor med hjälp av ChatGPT. Forskare förväntas fortsätta att undersöka tillvägagångssätt som gör LLM mer kostnadseffektiva under utbildning och mer tillgängliga under körning.

För mer AI-relaterat innehåll, besök unite.ai.

Haziqa är en Data Scientist med omfattande erfarenhet av att skriva tekniskt innehåll för AI- och SaaS-företag.