Modele și platforme AI
Mistral AI: Setează Noi Repere Dincolo De Llama2 În Spațiul Deschis
Modelele de limbaj mari (LLM) au ajuns recent în centrul atenției, datorită unor performeri deosebiți, cum ar fi ChatGPT. Când Meta a introdus modelele Llama, a reapărut interesul pentru LLM-urile deschise. Scopul? A crea LLM-uri deschise, accesibile și la fel de bune ca modelele de top, cum ar fi GPT-4, dar fără prețul ridicat sau complexitatea acestora.
Acest amestec de accesibilitate și eficiență nu numai că a deschis noi oportunități pentru cercetători și dezvoltatori, dar a și pus bazele unei noi ere de progrese tehnologice în procesarea limbajului natural.
În ultimul timp, startup-urile de inteligență artificială generativă au fost pe val, cu finanțări. Împreună, au strâns 20 de milioane de dolari, urmărind să modeleze inteligența artificială deschisă. Anthropic a strâns, de asemenea, o sumă impresionantă de 450 de milioane de dolari, iar Cohere, în parteneriat cu Google Cloud, a obținut 270 de milioane de dolari în luna iunie a acestui an.
Introducere în Mistral 7B: Dimensiune și Disponibilitate
Mistral AI, cu sediul în Paris și fondat de foști angajați ai Google DeepMind și Meta, a anunțat primul său model de limbaj mare: Mistral 7B. Acest model poate fi descărcat ușor de oricine de pe GitHub și chiar prin un torrent de 13,4 gigabiți.
Acest startup a reușit să obțină finanțare record, chiar înainte de a avea un produs lansat. Primul model Mistral, cu 7 miliarde de parametri, depășește performanța Llama 2 13B în toate testele și o întrece pe Llama 1 34B în multe metrici.
Comparativ cu alte modele, cum ar fi Llama 2, Mistral 7B oferă capacități similare sau mai bune, dar cu o sarcină computațională mai mică. În timp ce modelele fundamentale, cum ar fi GPT-4, pot realiza mai mult, ele vin la un preț mai ridicat și nu sunt la fel de ușor de utilizat, deoarece sunt accesibile în principal prin API-uri.
Când vine vorba de sarcini de codare, Mistral 7B oferă o performanță similară cu CodeLlama 7B. Mai mult, este suficient de compact la 13,4 GB pentru a rula pe mașini standard.
În plus, Mistral 7B Instruct, reglat special pentru seturi de instruire pe Hugging Face, a arătat o performanță remarcabilă. A depășit alte modele de 7B pe MT-Bench și stă pe picior de egalitate cu modelele de chat de 13B.

Hugging Face Mistral 7B Exemplu
Testarea Performanței
Într-o analiză detaliată a performanței, Mistral 7B a fost măsurat împotriva modelelor Llama 2. Rezultatele au fost clare: Mistral 7B a depășit semnificativ Llama 2 13B în toate testele. De fapt, a egalat performanța Llama 34B, în special în testele de cod și raționament.
Testele au fost organizate în mai multe categorii, cum ar fi Raționamentul Comun, Cunoașterea Lumii, Înțelegerea Citirii, Matematică și Cod, printre altele. O observație deosebit de interesantă a fost metrica de performanță a costului, numită “dimensiuni echivalente de model”. În domenii precum raționamentul și înțelegerea, Mistral 7B a demonstrat o performanță similară cu un model Llama 2 de trei ori mai mare, ceea ce semnifică posibile economii de memorie și o creștere a debitului. Cu toate acestea, în testele de cunoaștere, Mistral 7B s-a aliniat strâns cu Llama 2 13B, ceea ce se datorează probabil limitărilor sale de parametri care afectează comprimarea cunoașterii.
Ce cu adevărat modelul Mistral 7B mai bun decât majoritatea celorlalte Modele de Limbaj?
Simplificarea mecanismelor de atenție
În timp ce subtilitățile mecanismelor de atenție sunt tehnice, ideea lor de bază este relativ simplă. Imaginați-vă citind o carte și evidențiind propoziții importante; acesta este analog cu modul în care mecanismele de atenție “evidențiază” sau acordă importanță anumitor puncte de date într-o secvență.
În contextul modelelor de limbaj, aceste mecanisme permit modelului să se concentreze asupra părților cele mai relevante ale datelor de intrare, asigurând că ieșirea este coerentă și exactă din punct de vedere contextual.
În transformatorii standard, scorurile de atenție sunt calculate cu formula:
Formula pentru aceste scoruri implică un pas crucial – înmulțirea matricială a lui Q și K. Provocarea aici este că, pe măsură ce lungimea secvenței crește, ambele matrice se extind în mod corespunzător, ducând la un proces computațional intensiv. Această problemă de scalabilitate este una dintre principalele motive pentru care transformatorii standard pot fi lenti, în special atunci când se lucrează cu secvențe lungi.

Atenția multi-consultă (MQA) accelerează procesul prin utilizarea unui singur set de “capete cheie-valoare”, dar uneori sacrifică calitatea. Acum, vă puteți întreba, de ce nu combinați viteza MQA cu calitatea atenției multi-capete? Aici intervine atenția grupată de consultă (GQA).
Atenția Grupată de Consultă (GQA)
GQA este o soluție de compromis. În loc de a utiliza un singur set de “capete cheie-valoare” sau multiple, GQA le grupează. Astfel, GQA realizează o performanță aproape de atenția multi-capete detaliată, dar cu viteza MQA. Pentru modele precum Mistral, aceasta înseamnă o performanță eficientă fără a compromite prea mult calitatea.
Atenția cu Fereastră Glisantă (SWA)
Metoda ferestrei glisante este o altă metodă utilizată în procesarea secvențelor de atenție. Această metodă utilizează o fereastră de atenție de dimensiune fixă în jurul fiecărui token din secvență. Cu straturi multiple care stivuiesc această atenție ferestrală, straturile superioare capătă în cele din urmă o perspectivă mai largă, cuprinzând informații din întreaga intrare. Acest mecanism este analog cu câmpurile receptoare observate în Rețelele Neurale Convolutive (CNN).
Pe de altă parte, “fereastra glisantă dilatată” a modelului Longformer, care este conceptual similar cu metoda ferestrei glisante, calculează doar câteva diagonale ale matricei . Această schimbare duce la o creștere liniară a utilizării memoriei, în loc de una pătratică, făcând-o o metodă mai eficientă pentru secvențe lungi.
Transparența Mistral AI vs. Îngrijorările de Siguranță în Descentralizare
În anunțul lor, Mistral AI a subliniat transparența prin declarația: “Fără trucuri, fără date proprietare.” Dar, în același timp, singurul lor model disponibil în acest moment, ‘Mistral-7B-v0.1’, este un model de bază preantrenat, deci poate genera o răspuns la orice întrebare fără moderare, ceea ce ridică îngrijorări potențiale de siguranță. În timp ce modele precum GPT și Llama au mecanisme pentru a discerne când să răspundă, natura complet descentralizată a Mistral ar putea fi exploatată de actori răi.
Cu toate acestea, descentralizarea Modelelor de Limbaj Mare are meritele sale. În timp ce unii ar putea abuza de ea, oamenii pot utiliza puterea ei pentru binele societății și pentru a face inteligența accesibilă tuturor.
Flexibilitatea Implementării
Unul dintre punctele forte este că Mistral 7B este disponibil sub licența Apache 2.0. Acest lucru înseamnă că nu există bariere reale în utilizarea sa – indiferent dacă o utilizați pentru scopuri personale, o corporație mare sau chiar o entitate guvernamentală. Trebuie doar să aveți sistemul potrivit pentru a-l rula sau poate să fiți nevoiți să investiți în resurse de cloud.
În timp ce există și alte licențe, cum ar fi licența MIT mai simplă și licența CC BY-SA-4.0 cooperativă, care impune creditarea și licențierea similară pentru derivate, Apache 2.0 oferă o bază solidă pentru inițiative de anvergură.
Gânduri Finale
Ascensiunea Modelelor de Limbaj Mare deschise, cum ar fi Mistral 7B, semnifică o schimbare pivotantă în industria inteligenței artificiale, făcând modele de limbaj de înaltă calitate accesibile unui public mai larg. Abordările inovatoare ale Mistral AI, cum ar fi atenția grupată de consultă și atenția cu fereastră glisantă, promit o performanță eficientă fără a compromite calitatea.
În timp ce natura descentralizată a Mistral ridică anumite provocări, flexibilitatea și licențierea sa deschisă subliniază potențialul de a democratiza inteligența artificială. Pe măsură ce peisajul evoluează, accentul va fi inevitabil pe echilibrarea puterii acestor modele cu considerații etice și mecanisme de siguranță.
Următorul pas pentru Mistral? Modelul 7B a fost doar începutul. Echipa urmărește să lanseze modele și mai mari în curând. Dacă aceste noi modele egalează performanța modelului 7B, Mistral ar putea urca rapid ca un jucător de top în industrie, totul în primul lor an.

















