Modele și platforme AI

Poți să construiești modele de limbaj mare ca ChatGPT la jumătate de cost?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Modelele de limbaj mare (LLM) precum GPT-3 și ChatGPT au revoluționat inteligența artificială prin oferirea de capacități de înțelegere a limbajului natural și generare de conținut. Dar dezvoltarea lor vine la un preț considerabil, limitând accesibilitatea și cercetarea ulterioară. Cercetătorii estimează că antrenarea GPT-3 a costat OpenAI aproximativ $5 milioane. Cu toate acestea, Microsoft (MSFT ) a recunoscut potențialul și a investit $1 miliard în 2019 și $10 miliarde în 2023 în venture-ul OpenAI cu GPT-3 și ChatGPT.

LLM-urile sunt modele de învățare automată antrenate pe date textuale extinse pentru aplicații de procesare a limbajului natural. Ele se bazează pe arhitectura transformer și utilizează mecanisme de atenție pentru sarcini de procesare a limbajului natural, cum ar fi răspunsurile la întrebări, traducerea mașinilor, analiza sentimentului etc.

Întrebarea care apare este: poate fi îmbunătățită eficiența acestor modele mari, reducând în același timp costul computațional și timpul de antrenare?

Mai multe abordări, cum ar fi Rețelele neuronale progresive, Morfismul rețelelor, Paralelismul intra-strat, Moștenirea cunoștințelor etc., au fost dezvoltate pentru a reduce costul computațional al antrenării rețelelor neuronale. Abordarea nouă LiGO (Operator de creștere liniară) pe care o vom discuta stabilește un nou standard. Aceasta reduce la jumătate costul computațional al antrenării LLM-urilor.

Înainte de a discuta această tehnică, este esențial să examinăm factorii care contribuie la prețul ridicat al creării LLM-urilor.

Costul construirii modelelor de limbaj mare

Trei cheltuieli majore pentru dezvoltarea LLM-urilor sunt următoarele:

1. Resurse computaționale

Construirea LLM-urilor necesită resurse computaționale masive pentru a fi antrenate pe seturi de date mari. Ele trebuie să proceseze miliarde de parametri și să învețe modele complexe din date textuale masive.

Investiția în hardware specializat, cum ar fi Unitățile de procesare grafică (GPU) și Unitățile de procesare tensorială (TPU), este necesară pentru a construi și antrena LLM-urile pentru a obține performanțe de ultimă generație.

De exemplu, GPT-3 a fost antrenat pe un supercalculator cu 10.000 de GPU-uri de nivel întreprindere (H100 și A100) și 285.000 de nuclee CPU.

2. Consumul de energie

Resursele computaționale intensive necesare pentru construirea LLM-urilor duc la un consum semnificativ de energie. De exemplu, antrenarea a 175 de miliarde de parametri GPT-3 a durat 14,8 zile folosind 10.000 de GPU-uri V100, echivalent cu 3,55 milioane de ore de funcționare a GPU-ului. Un astfel de nivel ridicat de consum de energie are efecte semnificative asupra mediului.

3. Stocarea și gestionarea datelor

LLM-urile sunt antrenate pe seturi de date mari. De exemplu, GPT-3 a fost antrenat pe un corpus vast de date textuale, incluzând Common Crawl, WebText2, Books1, Books2 și Wikipedia, printre alte surse. O investiție semnificativă în infrastructură este necesară pentru a colecta, curăța și stoca aceste seturi de date.

De asemenea, stocarea în cloud este necesară pentru stocarea datelor, iar expertiza umană este necesară pentru prelucrarea datelor și controlul versiunilor. Mai mult, asigurarea faptului că strategia dvs. de date respectă reglementările, cum ar fi GDPR, adaugă la cost.

Tehnica LiGO: Reducerea costului construirii modelelor de limbaj mare la jumătate

LiGO (Operator de creștere liniară) este o tehnică nouă dezvoltată de cercetători de la MIT pentru a reduce costul computațional al antrenării LLM-urilor cu 50%. Metoda implică inițializarea greutăților modelelor mai mari din cele ale modelelor mai mici pre-antrenate, permițând o scalare eficientă a rețelelor neuronale.

Yoon Kim, autorul principal al articolului, spune:

„S-a estimat că antrenarea modelelor la scară cu ceea ce se presupune că rulează ChatGPT ar putea dura milioane de dolari doar pentru o singură rundă de antrenare. Putem îmbunătăți eficiența acestor metode de antrenare, astfel încât să putem obține modele bune în mai puțin timp și cu mai puțini bani? Propunem să facem acest lucru prin utilizarea unor modele de limbaj mai mici care au fost anterior antrenate.”

Această metodă menține beneficiile de performanță ale modelelor mai mari, cu un cost computațional redus și un timp de antrenare mai scurt în comparație cu antrenarea unui model mare de la zero. LiGO utilizează un operator de creștere liniară bazat pe date, care combină operatorii de adâncime și lățime pentru o performanță optimă.

Articolul a utilizat diverse seturi de date pentru a efectua experimente bazate pe text, incluzând corpusul Wikipedia în limba engleză pentru antrenarea modelelor BERT și RoBERTa și setul de date C4 pentru antrenarea modelului GPT2.

Experimentarea tehnicii LiGO a inclus creșterea de la BERT-Small la BERT-Base, de la BERT-Base la BERT-Large, de la RoBERTaSmall la RoBERTa-Base, de la GPT2-Base la GPT2-Medium și de la CaiT-XS la CaiT-S.

Cercetătorii au comparat abordarea lor cu mai multe alte linii de bază, incluzând antrenarea de la zero, antrenarea progresivă, bert2BERT și KI.

Tehnica LiGO a oferit o economie de 44,7% la FLOPs (operații cu punct fix pe secundă) și o economie de 40,7% la timpul de antrenare în comparație cu antrenarea modelului BERT-Base de la zero, prin reutilizarea modelului BERT-Small. Operatorul de creștere LiGO a depășit StackBERT, MSLT, bert2BERT și KI în ceea ce privește antrenarea eficientă.

Beneficiile utilizării unei tehnici de optimizare a antrenării, cum ar fi LiGO

LiGO este o metodă eficientă de antrenare a rețelelor neuronale, care are diverse beneficii, enumerate mai jos:

1. Antrenare mai rapidă

Așa cum s-a menționat anterior, antrenarea mai rapidă este principalul avantaj al tehnicii LiGO. Aceasta antrenează LLM-urile în jumătate de timp, crește productivitatea și reduce costurile.

2. Eficiență a resurselor

LiGO este eficient din punct de vedere al resurselor, deoarece minimizează timpul de antrenare și FLOPs, conducând la o abordare mai rentabilă și mai ecologică pentru antrenarea modelelor de transformare mari.

3. Generalizare

Tehnica LiGO a îmbunătățit performanța atât a transformatorilor de limbaj, cât și a celor de viziune, sugerând că este o tehnică generalizabilă care poate fi aplicată diverselor sarcini.

Construirea de produse comerciale de inteligență artificială este doar o fațetă a cheltuielilor totale asociate cu sistemele de inteligență artificială. O altă componentă semnificativă a costurilor provine din operațiunile zilnice. De exemplu, costă OpenAI aproximativ $700.000 pe zi pentru a răspunde la întrebări utilizând ChatGPT. Cercetătorii sunt așteptați să continue să exploreze abordări care fac LLM-urile rentabile în timpul antrenării și mai accesibile în timpul rulării.

Pentru mai mult conținut legat de inteligența artificială, vizitați unite.ai.

Haziqa este un specialist în știința datelor cu o experiență vastă în scrierea de conținut tehnic pentru companii de inteligență artificială și SaaS.