Modely a platformy AI
Je možné postavit velké jazykové modely jako ChatGPT za polovinu nákladů?
Velké jazykové modely (LLM) jako GPT-3 a ChatGPT revolucionalizovaly umělou inteligenci nabídkou přirozeného jazykového porozumění a generování obsahu. Ale jejich vývoj má vysokou cenu, která omezuje dostupnost a další výzkum. Výzkumníci odhadují, že trénování GPT-3 stálo OpenAI kolem $5 milionů. Přesto Microsoft (MSFT ) uznal potenciál a investoval $1 miliardu v roce 2019 a $10 miliard v roce 2023 do OpenAIho projektu GPT-3 a ChatGPT.
LLM jsou modely strojového učení trénované na rozsáhlých textových datech pro aplikace NLP. Jsou založeny na architektuře transformátoru a využívají mechanismy pozornosti pro úkoly NLP, jako je zodpovězení otázek, strojový překlad, sentimentální analýza atd.
Vzniká otázka: lze zvýšit efektivitu těchto velkých modelů, zatímco současně snížit výpočetní náklady a dobu trénování?
Byly vyvinuty různé přístupy, jako je Progressive Neural Networks, Network Morphism, intra-layer model parallelism, knowledge inheritance atd., aby se snížily výpočetní náklady trénování neuronových sítí. Nový LiGO (Linear Growth Operator) přístup, který budeme diskutovat, stanoví nový standard. Způsobuje snížení výpočetních nákladů trénování LLM o 50%.
Než budeme diskutovat o této technice, je důležité prozkoumat faktory, které přispívají k vysoké ceně vytváření LLM.
Náklady na stavbu velkých jazykových modelů
Tři hlavní výdaje pro vývoj LLM jsou následující:
1. Výpočetní zdroje
Stavba LLM vyžaduje大量né výpočetní zdroje pro trénování na velkých datech. Musí zpracovat miliardy parametrů a naučit se komplexní vzory z rozsáhlých textových dat.
Investice do specializovaného hardwaru, jako jsou Grafické procesory (GPUs) a Tensor Processing Units (TPUs), je vyžadována pro stavbu a trénování LLM, aby se dosáhlo špičkového výkonu.
Například GPT-3 byl trénován na superpočítači se 10000 podnikovými GPU (H100 a A100) a 285 000 CPU jádry.
2. Spotřeba energie
Intenzivní výpočetní zdroje vyžadované pro stavbu LLM vedou k významné spotřebě energie. Například trénování 175 miliard parametrů GPT-3 trvalo 14,8 dní pomocí 10 000 V100 GPU, což odpovídá 3,55 milionu GPU hodin. Taková vysoká spotřeba energie má významné environmentální dopady.
3. Úložiště a správa dat
LLM jsou trénovány na velkých datech. Například GPT-3 byl trénován na rozsáhlém korpusu textových dat, včetně Common Crawl, WebText2, Books1, Books2 a Wikipedie, mezi jinými. Značná investice do infrastruktury je vyžadována pro sběr, kuraci a uložení těchto dat.
Také je vyžadováno cloudové úložiště pro uložení dat a lidská odbornost pro předzpracování dat a řízení verzí. Kromě toho zajištění toho, aby vaše datová strategie splňovala předpisy, jako je GDPR, také přidává k nákladům.
LiGO technika: snížení nákladů na stavbu velkých jazykových modelů na polovinu
LiGO (Linear Growth Operator) je novou technikou vyvinutou výzkumníky na MIT, která snižuje výpočetní náklady trénování LLM o 50%. Metoda zahrnuje inicializaci váh větších modelů z menších předtrénovaných modelů, což umožňuje efektivní škálování neuronových sítí.

Obrázek z článku: Learning to Grow Pretrained Models For Efficient Transformer Training
Yoon Kim, hlavní autor článku, říká:
“Odhaduje se, že trénování modelů v rozsahu, jaký je hypoteticky předpokládán pro ChatGPT, by mohlo stát miliony dolarů pouze za jednu trénovací běh. Můžeme zlepšit efektivitu těchto trénovacích metod, abychom mohli získat dobré modely v kratším čase a za méně peněz? Navrhujeme to udělat tak, že využijeme menší jazykové modely, které byly dříve trénovány.”
Tato metoda zachovává výhody větších modelů se sníženými výpočetními náklady a trénovacím časem ve srovnání s trénováním velkého modelu od začátku. LiGO využívá datově řízený lineární růstový operátor, který kombinuje operátory hloubky a šířky pro optimální výkon.
Článek využil různé datové sady pro provádění textových experimentů, včetně anglického korpusu Wikipedie pro trénování modelů BERT a RoBERTa a datové sady C4 pro trénování modelu GPT2.
Experimenty s technikou LiGO zahrnovaly růst BERT-Small na BERT-Base, BERT-Base na BERT-Large, RoBERTaSmall na RoBERTa-Base, GPT2-Base na GPT2-Medium a CaiT-XS na CaiT-S.
Výzkumníci porovnali svůj přístup s několika jinými referenčními body, včetně trénování od začátku, progresivního trénování, bert2BERT a KI.
Technika LiGO nabízela 44,7% úspory v FLOPs (plovoucí bodové operace za sekundu) a 40,7% úspory v čase ve srovnání s trénováním BERT-Base od začátku pomocí opětovného použití modelu BERT-Small. Operátor růstu LiGO překonal StackBERT, MSLT, bert2BERT a KI v efektivnímu trénování.
Výhody používání techniky optimalizace trénování jako LiGO
LiGO je efektivní metodou trénování neuronových sítí, která má různé výhody, které jsou uvedeny níže:
1. Rychlejší trénování
Jak bylo uvedeno dříve, rychlejší trénování je hlavní výhodou techniky LiGO. Trénuje LLM za polovinu času, zvyšuje produktivitu a snižuje náklady.
2. Úspora zdrojů
LiGO je úsporná z hlediska zdrojů, protože minimalizuje čas a FLOPs, což vede k více nákladově efektivnímu a ekologicky šetrnému přístupu k trénování velkých transformátorových modelů.
3. Generalizace
Technika LiGO zlepšila výkon jak jazykových, tak vizuálních transformátorů, což naznačuje, že je to generalizovatelná technika, která může být aplikována na různé úkoly.
Stavba komerčních produktů AI je pouze jednou stránkou celkových nákladů spojených s AI systémy. Další významnou součástí nákladů pochází z denních operací. Například stojí OpenAI asi $700 000 denně, aby odpovědělo na dotazy pomocí ChatGPT. Výzkumníci by měli pokračovat v hledání přístupů, které činí LLM nákladově efektivní během trénování a přístupnější během běhu.
Pro více obsahu souvisejícího s umělou inteligencí navštivte unite.ai.












