Modele și platforme AI
Cel mai puternic model LLM open-source până în prezent: Meta LLAMA 3.1-405B
Llama 3.1-405B, dezvoltat de Meta AI, reprezintă un salt semnificativ înainte în ceea ce privește modelele de limbaj open-source. Cu 405 miliarde de parametri, se situează ca fiind cel mai mare model de limbaj disponibil public până în prezent, rivalizând și chiar depășind unele dintre cele mai avansate modele proprietare în diverse benchmark-uri.
Caracteristici cheie:
- 405 miliarde de parametri
- 128K lungime de context token
- Suport multilingv (8 limbi)
- Versiune instruită disponibilă
- Open-source cu o licență permissivă
Lansarea unui model atât de puternic în domeniul open-source este un moment de cotitură, democratizând accesul la capacități de inteligență artificială de ultimă generație și stimulând inovarea în întreaga industrie.
Arhitectura și antrenarea modelului
Procesul începe cu conversia token-ilor de intrare în token-uri de încorporare. Aceste încorporări trec prin multiple straturi de atenție și rețele feedforward, permițând modelului să capteze relații complexe și dependențe în interiorul textului. Mecanismul de decodare autoregresiv generează apoi token-urile de ieșire, completând procesul.

-
Atenție grupată la interogare (GQA)
Llama 3.1 utilizează Atenție grupată la interogare, care este o tehnică de optimizare importantă care nu a fost pe deplin acoperită în răspunsul anterior. Să o explorăm în mai multe detalii:
Atenție grupată la interogare (GQA) este o variantă a atenției multi-cap care își propune să reducă costurile computaționale și utilizarea memoriei în timpul inferenței, în special pentru secvențe lungi. În modelul Llama 3.1 405B, GQA este implementat cu 8 capete de valoare-cheie.
Iată cum funcționează GQA:
- În loc să aibă proiecții separate de cheie și valoare pentru fiecare cap de atenție, GQA grupează multiple capete de interogare pentru a partaja aceleași capete de cheie și valoare.
- Această grupare reduce semnificativ numărul de parametri în proiecțiile cheie și valoare, conducând la dimensiuni mai mici ale modelului și la o inferență mai rapidă.
- Computația atenției poate fi exprimată ca:
Atenție(Q, K, V) = softmax(QK^T / sqrt(d_k))VUnde Q este grupat în g grupe, și K și V au mai puține capete decât Q.
Beneficiile GQA în Llama 3.1 405B includ:
- Amprentă de memorie redusă: Mai puține proiecții de cheie și valoare înseamnă mai puțină memorie necesară pentru a stoca parametrii modelului.
- Inferență mai rapidă: Cu mai puține calcule necesare pentru proiecțiile cheie și valoare, viteza de inferență este îmbunătățită.
- Performanță menținută: În ciuda reducerii parametrilor, GQA a demonstrat menținerea unei performanțe comparabile cu atenția multi-cap standard în multe sarcini.
-
Antrenament în două etape pentru context extins
Articolul menționează un proces de antrenament în două etape pentru a atinge fereastra de context de 128K tokeni. Acesta este un aspect crucial al capacităților Llama 3.1 405B:
Etapa 1: Antrenament inițial pe 8K tokeni
- Modelul este antrenat inițial pe secvențe de până la 8K tokeni.
- Această etapă permite modelului să învețe capacități generale de înțelegere și generare a limbajului.
Etapa 2: Antrenament continuat pentru extinderea contextului
- După antrenamentul inițial, modelul suferă un antrenament continuat pentru a crește lungimea contextului la 128K tokeni.
- Această etapă implică regimuri de antrenament special concepute pentru a ajuta modelul să se generalizeze la secvențe mai lungi fără a-și pierde capacitatea de a gestiona contexte mai scurte.
-
Capacități multimodale
Deși răspunsul anterior a atins capacitățile multimodale, putem extinde această discuție:
Abordare compozită:
- Llama 3.1 405B utilizează encodatori separați pentru diferite modalități (de exemplu, imagini, vorbire).
- Acești encodatori transformă intrările din diferite modalități într-un spațiu de încorporare comun pe care modelul de limbaj îl poate înțelege.
Integrare cu modelul de limbaj:
- Ieșirile din acești encodatori specializați sunt apoi introduse în modelul de limbaj principal.
- Acest lucru permite Llama 3.1 405B să proceseze și să înțeleagă simultan diferite tipuri de date, permițându-i să execute sarcini care implică multiple modalități.
Mecanisme de atenție încrucișate:
- Pentru a gestiona integrarea diferitelor modalități, Llama 3.1 405B utilizează probabil mecanisme de atenție încrucișate.
- Aceste mecanisme permit modelului să se concentreze asupra informațiilor relevante din diferite modalități atunci când generează text sau execută alte sarcini.
Capacitățile multimodale ale Llama 3.1 405B deschid o gamă largă de aplicații, cum ar fi:
- Descrierea imaginilor și răspunsurile la întrebări vizuale
- Transcrierea vorbirii în text cu înțelegere contextuală
- Sarcini de raționament multimodal care combină text, imagini și potențial alte tipuri de date
Detalii de antrenament
- Antrenat pe peste 15 trilioane de tokeni
- Cluster de GPU personalizat cu 39,3 milioane de ore de GPU pentru modelul 405B
- Curare diversă a setului de date pentru capacități multilingve
Versiunea instruită a suferit un antrenament suplimentar:
- Ajustat pe seturi de date de instruire disponibile public
- Peste 25 de milioane de exemple generate sintetic
- Ajustare fină supravegheată (SFT) și Învățare prin întărire cu feedback uman (RLHF)
Benchmark-uri de performanță
Tabelul compară Llama 3.1 405B, Nemotron 4 340B Instruct, GPT-4 (0125), GPT-4 Omni și Claude 3.5 Sonnet. Benchmark-urile cheie includ sarcini generale precum MMLU și IFEval, sarcini de codare precum HumanEval și GSM8K, și sarcini de raționament precum ARC Challenge. Fiecare punctaj de benchmark reflectă capacitatea modelului de a înțelege și genera text umanoid, de a rezolva probleme complexe și de a executa cod. În mod remarcabil, Llama 3.1 405B și Claude 3.5 Sonnet excelează în mai multe benchmark-uri, demonstrând capacitățile avansate în sarcini atât generale, cât și specifice domeniului.
Directii viitoare
Lansarea Llama 3.1-405B va accelera probabil inovarea în mai multe domenii:
- Tehnici de reglare fină îmbunătățite pentru domenii specializate
- Dezvoltarea unor metode de inferență mai eficiente
- Avansuri în comprimarea și distilarea modelului
Concluzie
Llama 3.1-405B reprezintă o piatră de hotar importantă în inteligența artificială open-source, oferind capacități care au fost anterior exclusive modelelor proprietare.
Pe măsură ce explorăm puterea acestui model, este esențial să abordăm utilizarea lui cu responsabilitate și considerație etică. Instrumentele și măsurile de siguranță furnizate alături de model oferă un cadru pentru implementarea responsabilă, dar vigilența și colaborarea continuă a comunității vor fi cheia pentru a asigura că această tehnologie puternică este utilizată în beneficiul societății.














