Modele și platforme AI
Prezentarea Meta Llama 3: Un salt înainte în modelele de limbaj mare
În domeniul inteligenței artificiale generative, Meta continuă să conducă prin angajamentul său de a face disponibile surse deschise, distribuind seria sa avansată de modele de limbaj mare Meta AI (Llama) dezvoltatorilor și cercetătorilor din întreaga lume. Construind pe inițiativele sale progresive, Meta a introdus recent a treia iterație a acestei serii, Llama 3. Această nouă ediție reprezintă o îmbunătățire semnificativă față de Llama 2, oferind numeroase îmbunătățiri și stabilind standarde care provoacă competitorii din industrie, cum ar fi Google (GOOGL ), Mistral și Anthropic. Acest articol explorează avansurile semnificative ale Llama 3 și modul în care se compară cu predecesorul său, Llama 2.
Seria Llama a Meta: De la acces exclusiv la acces deschis și performanță îmbunătățită
Meta a inițiat seria Llama în 2022 cu lansarea Llama 1, un model limitat la utilizare non-comercială și accesibil numai unor instituții de cercetare selectate, din cauza cerințelor computaționale imense și a naturii sale proprietare care caracterizau modelele de limbaj mare de ultimă generație din acea perioadă. În 2023, odată cu lansarea Llama 2, Meta AI s-a orientat către o mai mare deschidere, oferind modelul gratuit atât pentru cercetare, cât și pentru scopuri comerciale. Această mișcare a fost proiectată pentru a democratiza accesul la tehnologii de inteligență artificială generativă sofisticate, permițând unui spectru mai larg de utilizatori, inclusiv startup-uri și echipe de cercetare mai mici, să inoveze și să dezvolte aplicații fără costurile ridicate asociate în mod normal cu modelele de scară largă. Continuând această tendință către deschidere, Meta a introdus Llama 3, care se concentrează pe îmbunătățirea performanței modelelor mai mici în diversele benchmark-uri industriale.
Prezentarea Llama 3
Llama 3 este a doua generație de modele de limbaj mare deschise ale Meta, cu modele pre-antrenate și fine-tunate pe instrucțiuni, cu 8 miliarde și 70 de miliarde de parametri. În conformitate cu predecesorii săi, Llama 3 utilizează o arhitectură de transformator doar cu decodificator și continuă practica de antrenament auto-regresiv, învățare auto-supervizată pentru a prezice token-urile următoare în secvențele de text. Llama 3 este pre-antrenat pe un set de date care este de șapte ori mai mare decât cel utilizat pentru Llama 2, cu peste 15 trilioane de token-uri extrase dintr-un amestec nou de date online publice. Acest set de date vast este procesat folosind două cluster-e echipate cu 24.000 de unități GPU. Pentru a menține calitatea ridicată a acestor date de antrenament, au fost utilizate diverse tehnici de inteligență artificială centrată pe date, incluzând filtre heuristice și NSFW, deduplicare semantică și clasificare a calității textului. Proiectat pentru aplicații de dialog, modelul Instruct Llama 3 a fost îmbunătățit semnificativ, incluzând peste 10 milioane de exemple de date annotate de oameni și utilizând o combinație sofisticată de metode de antrenament, cum ar fi antrenament supervizat (SFT), eșantionare de respingere, optimizare a politicii proximale (PPO) și optimizare directă a politicii (DPO).
Llama 3 vs. Llama 2: Îmbunătățiri cheie
Llama 3 aduce mai multe îmbunătățiri față de Llama 2, îmbunătățind semnificativ funcționalitatea și performanța:
- Vocabular extins: Llama 3 și-a extins vocabularul la 128.256 de token-uri, de la 32.000 de token-uri ale Llama 2. Această îmbunătățire sprijină o codificare a textului mai eficientă atât pentru intrări, cât și pentru ieșiri și consolidează capacitățile sale multilingve.
- Lungime de context extinsă: Modelele Llama 3 oferă o lungime de context de 8.000 de token-uri, dublând cei 4.090 de token-uri suportați de Llama 2. Această creștere permite o manipulare mai extinsă a conținutului, cuprinzând atât prompt-urile utilizatorilor, cât și răspunsurile modelului.
- Date de antrenament îmbunătățite: Setul de date de antrenament pentru Llama 3 este de șapte ori mai mare decât cel al Llama 2, incluzând de patru ori mai mult cod. Conține peste 5% date de înaltă calitate, non-englезe, care acoperă peste 30 de limbi, esențial pentru suportul aplicațiilor multilingve. Aceste date sunt supuse unui control de calitate riguros, utilizând tehnici avansate, cum ar fi filtre heuristice și NSFW, deduplicare semantică și clasificatoare de text.
- Reglare și evaluare a instrucțiunilor rafinate: Divergând de la Llama 2, Llama 3 utilizează tehnici avansate de reglare a instrucțiunilor, incluzând antrenament supervizat (SFT), eșantionare de respingere, optimizare a politicii proximale (PPO) și optimizare directă a politicii (DPO). Pentru a consolida acest proces, a fost introdus un nou set de evaluare umană de înaltă calitate, compus din 1.800 de prompt-uri care acoperă diverse cazuri de utilizare, cum ar fi sfaturi, brainstorming, clasificare, codificare și multe altele, asigurând o evaluare și o reglare cuprinzătoare a capacităților modelului.
- Securitate avansată a inteligenței artificiale: Llama 3, la fel ca Llama 2, incorporează măsuri stricte de securitate, cum ar fi reglarea instrucțiunilor și testarea cuprinzătoare pentru a mitigă riscurile, în special în domenii critice, cum ar fi securitatea cibernetică și amenințările biologice. În sprijinul acestor eforturi, Meta a introdus, de asemenea, Llama Guard 2, reglat pe versiunea de 8 miliarde de parametri a Llama 3. Acest model nou îmbunătățește seria Llama Guard prin clasificarea intrărilor și ieșirilor LLM pentru a identifica conținutul potențial nesigur, făcându-l ideal pentru medii de producție.
Disponibilitatea Llama 3
Modelele Llama 3 sunt acum integrate în ecosistemul Hugging Face, îmbunătățind accesibilitatea pentru dezvoltatori. Modelele sunt disponibile și prin platforme de servicii de model, cum ar fi Perplexity Labs și Fireworks.ai, și pe platforme de cloud, cum ar fi AWS SageMaker, Azure ML și Vertex AI. Meta planifică să extindă disponibilitatea Llama 3 și mai mult, incluzând platforme precum Google Cloud, Kaggle, IBM WatsonX, NVIDIA NIM și Snowflake. De asemenea, suportul pentru hardware pentru Llama 3 va fi extins pentru a include platforme de la AMD, AWS, Dell, Intel (INTC ), NVIDIA și Qualcomm.
Îmbunătățiri viitoare în Llama 3
Meta a anunțat că lansarea actuală a Llama 3 este doar prima fază a viziunii sale mai largi pentru versiunea completă a Llama 3. Ei dezvoltă un model avansat cu peste 400 de miliarde de parametri, care va introduce noi funcții, incluzând multimodalitate și capacitatea de a gestiona multiple limbi. Această versiune îmbunătățită va prezenta, de asemenea, o fereastră de context semnificativ extinsă și capacități de performanță îmbunătățite.
Concluzia
Llama 3 al Meta marchează o evoluție semnificativă în peisajul modelelor de limbaj mare, propulsând seria nu numai către o mai mare accesibilitate deschisă, ci și îmbunătățind semnificativ capacitățile sale de performanță. Cu un set de date de antrenament de șapte ori mai mare decât predecesorul său și caracteristici precum vocabular extins și lungime de context mărită, Llama 3 stabilește noi standarde care provoacă chiar și competitorii cei mai puternici din industrie.
Această a treia iterație nu numai că continuă să democratizeze tehnologia inteligenței artificiale, făcând disponibile capacități de nivel înalt unui spectru mai larg de dezvoltatori, ci introduce și avansări semnificative în siguranță și precizie de antrenament. Prin integrarea acestor modele în platforme precum Hugging Face și extinderea disponibilității prin servicii de cloud majore, Meta asigură că Llama 3 este la fel de ubicuuă pe cât este de puternică.
Privind spre viitor, promisiunile continue de dezvoltare ale Meta oferă capacități și mai robuste, incluzând multimodalitate și suport extins de limbă, stabilind scena pentru Llama 3 să nu numai concureze, ci și să depășească alte modele majore de inteligență artificială de pe piață. Llama 3 este un testament al angajamentului Meta de a conduce revoluția inteligenței artificiale, oferind unelte care nu sunt doar mai accesibile, ci și semnificativ mai avansate și mai sigure pentru o bază de utilizatori globală.










