Modele și platforme AI

Qwen2 – Ultimul model de limbaj multilingv al lui Alibaba, care provoacă modelele SOTA, cum ar fi Llama 3

mm
Adaugă Unite.AI la sursele tale preferate pe Google
evolution from Qwen1.5 to Qwen2

După luni de așteptare, echipa Qwen de la Alibaba a dezvăluit în sfârșit Qwen2 – următoarea evoluție a puternicei serii de modele de limbaj. Qwen2 reprezintă un salt semnificativ înainte, având avansări de ultimă oră care ar putea poziționa potențial modelul ca cea mai bună alternativă la modelul celebrat Llama 3 al Meta. În acest articol tehnic detaliat, vom explora caracteristicile cheie, benchmark-urile de performanță și tehnicile inovatoare care fac din Qwen2 un concurent formidabil în domeniul modelelor de limbaj mari (LLM).

Scalarea în sus: Prezentarea gamei de modele Qwen2

La baza lui Qwen2 se află o gamă diversă de modele concepute pentru a satisface cerințele computaționale variate. Seria cuprinde cinci dimensiuni de modele distincte: Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B, Qwen2-57B-A14B și modelul emblematic Qwen2-72B. Acestă gamă de opțiuni se adresează unui spectru larg de utilizatori, de la cei cu resurse hardware modeste până la cei cu acces la infrastructură computațională de ultimă generație.

Una dintre caracteristicile deosebite ale lui Qwen2 este capacitatea sa multilingvă. În timp ce modelul anterior Qwen1.5 excela în engleză și chineză, Qwen2 a fost antrenat pe date care acoperă impresionante 27 de limbi suplimentare. Acest regim de antrenament multilingv include limbi din regiuni diverse, cum ar fi Europa de Vest, Europa de Est și Centrală, Orientul Mijlociu, Asia de Est și Asia de Sud.

Tabelul care listează limbile suportate de modelele Qwen2, categorisite pe regiuni

Limbile suportate de modelele Qwen2, categorisite pe regiuni geografice

Prin extinderea repertoriului lingvistic, Qwen2 demonstrează o capacitate excepțională de a înțelege și genera conținut într-o gamă largă de limbi, făcându-l un instrument de neprețuit pentru aplicații globale și comunicare interculturală.

 

Specificatiile modelelor Qwen2, incluzând parametrii, GQA, încorporarea legăturilor și lungimea contextului

Specificațiile modelelor Qwen2, incluzând parametri, GQA și lungimea contextului.

Abordarea schimbării de cod: O provocare multilingvă

În contexte multilingve, fenomenul schimbării de cod – practica de a alterna între limbi diferite într-o singură conversație sau enunț – este o apariție comună. Qwen2 a fost antrenat cu atenție pentru a gestiona scenariile de schimbare a codului, reducând semnificativ problemele asociate și asigurând tranziții fluente între limbi.

Evaluările utilizând prompturi care induc în mod normal schimbarea de cod au confirmat îmbunătățirea substanțială a lui Qwen2 în acest domeniu, un testament al angajamentului lui Alibaba de a livra un model de limbaj cu adevărat multilingv.

Excelând în programare și matematică

Qwen2 are capacități remarcabile în domeniile programării și matematicii, domenii care au reprezentat provocări tradiționale pentru modelele de limbaj. Prin exploatarea unor seturi de date extinse de înaltă calitate și a unor metode de antrenament optimizate, Qwen2-72B-Instruct, varianta instruită a modelului emblematic, prezintă o performanță remarcabilă în rezolvarea problemelor matematice și a sarcinilor de programare în diverse limbi de programare.

Extinderea înțelegerii contextului

Una dintre cele mai impresionante caracteristici ale lui Qwen2 este capacitatea sa de a înțelege și procesa secvențe de context extinse. În timp ce majoritatea modelelor de limbaj se luptă cu textul de lungă durată, modelele Qwen2-7B-Instruct și Qwen2-72B-Instruct au fost proiectate pentru a gestiona lungimi de context de până la 128K de tokeni.

Această capacitate remarcabilă este un joc schimbător pentru aplicații care necesită o înțelegere profundă a documentelor lungi, cum ar fi contracte juridice, articole de cercetare sau materiale tehnice dense. Prin procesarea eficientă a contextelor extinse, Qwen2 poate oferi răspunsuri mai precise și mai cuprinzătoare, deblocând noi frontiere în procesarea limbajului natural.

Graficul care arată acuratețea de recuperare a faptelor a modelelor Qwen2 la diferite lungimi de context și adâncimi de document

Acuratețea modelelor Qwen2 în recuperarea faptelor din documente de diverse lungimi de context și adâncimi.

Acest grafic arată capacitatea modelelor Qwen2 de a recupera fapte din documente de diverse lungimi de context și adâncimi.

Inovații arhitecturale: Attenția grupului de întrebări și încorporările optimizate

Sub capotă, Qwen2 încorporează mai multe inovații arhitecturale care contribuie la performanța sa excepțională. O astfel de inovație este adoptarea Attenției grupului de întrebări (GQA) în toate dimensiunile de modele. GQA oferă viteze de inferență mai rapide și o utilizare redusă a memoriei, făcând din Qwen2 un model mai eficient și mai accesibil pentru o gamă mai largă de configurații hardware.

În plus, Alibaba a optimizat încorporările pentru modelele mai mici din seria Qwen2. Prin legarea încorporărilor, echipa a reușit să reducă amprenta de memorie a acestor modele, permițându-le să fie desfășurate pe hardware mai puțin puternic, menținând în același timp o performanță de înaltă calitate.

Testarea Qwen2: Depășirea modelelor de stat-of-the-art

Qwen2 are o performanță remarcabilă într-o gamă diversă de benchmark-uri. Evaluările comparative arată că Qwen2-72B, cel mai mare model din serie, depășește concurenții de top, cum ar fi Llama-3-70B, în domenii cheie, incluzând înțelegerea limbajului natural, achiziția de cunoștințe, proficiența în programare, abilitățile matematice și capacitățile multilingve.

Grafice care compară Qwen2-72B-Instruct și Llama3-70B-Instruct în programare și matematică

Qwen2-72B-Instruct versus Llama3-70B-Instruct în programare și matematică

În ciuda faptului că are mai puțini parametri decât predecesorul său, Qwen1.5-110B, Qwen2-72B prezintă o performanță superioară, un testament al eficacității seturilor de date atent curate și a metodelor de antrenament optimizate de către Alibaba.

Siguranță și responsabilitate: Alinierea cu valorile umane

Qwen2-72B-Instruct a fost evaluat riguros pentru capacitatea sa de a gestiona întrebări potențial dăunătoare legate de activități ilegale, fraudă, pornografie și încălcări ale confidențialității. Rezultatele sunt încurajatoare: Qwen2-72B-Instruct prezintă o performanță comparabilă cu modelul GPT-4, în ceea ce privește siguranța, prezentând proporții semnificativ mai mici de răspunsuri dăunătoare în comparație cu alte modele mari, cum ar fi Mistral-8x22B.

Acest realizare subliniază angajamentul lui Alibaba de a dezvolta sisteme AI care se aliniază cu valorile umane, asigurând că Qwen2 nu numai că este puternic, dar și de încredere și responsabil.

Licențiere și angajament deschis

Într-o mișcare care amplifică și mai mult impactul lui Qwen2, Alibaba a adoptat o abordare deschisă pentru licențiere. În timp ce Qwen2-72B și variantele sale instruite păstrează licența Qianwen originală, modelele rămase – Qwen2-0.5B, Qwen2-1.5B, Qwen2-7B și Qwen2-57B-A14B – au fost licențiate sub licența permissivă Apache 2.0.

Această deschidere sporită este așteptată să accelereze utilizarea și comercializarea modelelor Qwen2 la nivel global, promovând colaborarea și inovarea în cadrul comunității globale de inteligență artificială.

Utilizare și implementare

Utilizarea modelelor Qwen2 este simplă, datorită integrării lor cu cadre populare precum Hugging Face. Iată un exemplu de utilizare a lui Qwen2-7B-Chat-beta pentru inferență:

from transformers import AutoModelForCausalLM, AutoTokenizer

<p>dispozitiv = &quot;cuda&quot; # dispozitivul pe care se încarcă modelul</p>

<p>model = AutoModelForCausalLM.from_pretrained(&quot;Qwen/Qwen1.5-7B-Chat&quot;, device_map=&quot;auto&quot;)
tokenizer = AutoTokenizer.from_pretrained(&quot;Qwen/Qwen1.5-7B-Chat&quot;)</p>

<p>prompt = &quot;Oferiți-mi o introducere scurtă în modelele de limbaj mari.&quot;</p>

<p>mesaje = [{&quot;rol&quot;: &quot;utilizator&quot;, &quot;conținut&quot;: prompt}]</p>

<p>text = tokenizer.apply_chat_template(mesaje, tokenize=False, add_generation_prompt=True)</p>

<p>intrări_model = tokenizer([text], return_tensors=&quot;pt&quot;).to(dispozitiv)</p>

<p>id-uri_generate = model.generate(intrări_model.input_ids, max_new_tokens=512, do_sample=True)</p>

<p>id-uri_generate = [output_ids[len(input_ids):] for input_ids, output_ids in zip(intrări_model.input_ids, id-uri_generate)]</p>

<p>răspuns = tokenizer.batch_decode(id-uri_generate, skip_special_tokens=True)[0]
print(răspuns)</p>

Acest fragment de cod demonstrează cum se poate configura și genera text utilizând modelul Qwen2-7B-Chat. Integrarea cu Hugging Face face ca acest lucru să fie accesibil și ușor de experimentat.

Qwen2 vs. Llama 3: O analiză comparativă

În timp ce Qwen2 și Llama 3 al Meta sunt ambele modele de limbaj formidabile, ele prezintă puncte forte și compromisuri distincte.

Grafic de comparație a performanței Qwen2-72B, Llama3-70B, Mixtral-8x22B și Qwen1.5-110B în diverse benchmark-uri

Un grafic comparativ al performanței Qwen2-72B, Llama3-70B, Mixtral-8x22B și Qwen1.5-110B în diverse benchmark-uri, incluzând MMLU, MMLU-Pro, GPQA și altele.

Iată o analiză comparativă pentru a înțelege principalele lor diferențe:

Capacități multilingve: Qwen2 deține un avantaj clar în ceea ce privește suportul multilingv. Antrenamentul său pe date care acoperă 27 de limbi suplimentare, în afara englezei și chinezei, permite lui Qwen2 să exceleze în comunicarea interculturală și în scenarii multilingve. În contrast, capacitățile multilingve ale Llama 3 sunt mai puțin pronunțate, ceea ce ar putea limita eficacitatea sa în contexte lingvistice diverse.

Proficiență în programare și matematică: Atât Qwen2, cât și Llama 3 demonstrează capacități impresionante în programare și matematică. Cu toate acestea, Qwen2-72B-Instruct pare să aibă o ușoară superioritate, datorită antrenamentului riguros pe seturi de date extinse de înaltă calitate în aceste domenii. Accentul lui Alibaba pe îmbunătățirea capacităților lui Qwen2 în aceste domenii ar putea să-i ofere un avantaj pentru aplicații specializate care implică programare sau rezolvarea de probleme matematice.

Înțelegerea contextului lung: Modelele Qwen2-7B-Instruct și Qwen2-72B-Instruct se mândresc cu o capacitate impresionantă de a gestiona lungimi de context de până la 128K de tokeni. Această caracteristică este deosebit de valoroasă pentru aplicații care necesită o înțelegere profundă a documentelor lungi, cum ar fi contracte juridice, articole de cercetare sau materiale tehnice dense. Llama 3, deși capabil să proceseze secvențe lungi, nu ar putea să egaleze performanța lui Qwen2 în acest domeniu specific.

Deși atât Qwen2, cât și Llama 3 prezintă performanțe de ultimă oră, gama diversă de modele Qwen2, de la 0,5B la 72B de parametri, oferă o flexibilitate și o scalabilitate mai mari. Această versatilitate permite utilizatorilor să aleagă dimensiunea modelului care se potrivește cel mai bine resurselor lor computaționale și cerințelor de performanță. În plus, eforturile continue ale lui Alibaba de a scala Qwen2 la modele mai mari ar putea să-i sporească și mai mult capacitățile, depășind potențial Llama 3 în viitor.

Implementare și integrare: Facilitarea adoptării Qwen2

Pentru a facilita adoptarea și integrarea pe scară largă a lui Qwen2, Alibaba a întreprins măsuri proactive pentru a asigura o implementare fără probleme pe diverse platforme și cadre. Echipa Qwen a colaborat strâns cu numeroase proiecte și organizații terțe, permițând lui Qwen2 să fie utilizat în conjuncție cu o gamă largă de unelte și cadre.

Reglare fină și cuantificare: Proiecte terțe, cum ar fi Axolotl, Llama-Factory, Firefly, Swift și XTuner, au fost optimizate pentru a sprijini reglarea fină a modelelor Qwen2, permițând utilizatorilor să adapteze modelele la sarcinile și seturile de date specifice. În plus, unelte de cuantificare, cum ar fi AutoGPTQ, AutoAWQ și Neural Compressor, au fost adaptate pentru a lucra cu Qwen2, facilitând implementarea eficientă pe dispozitive cu resurse limitate.

Implementare și inferență: Modelele Qwen2 pot fi implementate și servite utilizând diverse cadre, incluzând vLLM, SGL, SkyPilot, TensorRT-LLM, OpenVino și TGI. Aceste cadre oferă conducte de inferență optimizate, permițând o implementare eficientă și scalabilă a lui Qwen2 în medii de producție.

Platforme API și execuție locală: Pentru dezvoltatorii care doresc să integreze Qwen2 în aplicațiile lor, platformele API, cum ar fi Together, Fireworks și OpenRouter, oferă acces convenabil la capacitățile modelului. Alternativ, execuția locală este susținută prin cadre precum MLX, Llama.cpp, Ollama și LM Studio, permițând utilizatorilor să ruleze Qwen2 pe mașinile lor locale, menținând controlul asupra confidențialității și securității datelor.

Cadre de agenți și RAG: Sprijinul lui Qwen2 pentru utilizarea uneltelor și capacitățile de agent sunt consolidate de cadre precum LlamaIndex, CrewAI și OpenDevin. Aceste cadre permit crearea de agenți AI specializați și integrarea lui Qwen2 în conducte de generare augmentată de recuperare (RAG), extinzând gama de aplicații și cazuri de utilizare.

Privind spre viitor: Dezvoltări și oportunități viitoare

Viziunea lui Alibaba pentru Qwen2 se extinde mult dincolo de lansarea actuală. Echipa lucrează activ la antrenarea de modele mai mari pentru a explora frontierele scalării modelului, completate de eforturi continue de scalare a datelor. Mai mult, există planuri de a extinde Qwen2 în domeniul inteligenței artificiale multimodale, permițând integrarea capacităților de înțelegere a viziunii și a sunetului.

Pe măsură ce ecosistemul deschis de inteligență artificială continuă să prospere, Qwen2 va juca un rol crucial, servind ca o resursă puternică pentru cercetători, dezvoltatori și organizații care își propun să avanseze stadiul actual în procesarea limbajului natural și inteligența artificială.

Am petrecut ultimii cinci ani scufundându-mă în lumea fascinantă a Machine Learning și Deep Learning. Pasinea și expertiza mea m-au condus să contribui la peste 50 de proiecte diverse de inginerie software, cu un focus deosebit pe AI/ML. Curiozitatea mea în continuare m-a atras și spre Natural Language Processing, un domeniu pe care sunt dornic să îl explorez mai departe.