Modele și platforme AI

Inteligența Artificială Allen AI, Tülu 3, a devenit un rival neașteptat pentru DeepSeek

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Știrile continuă să apară. Modelele DeepSeek au fost provocate de benchmark-uri, au stabilit noi standarde și au făcut mult zgomot. Dar ceva interesant a apărut recent în scena cercetării inteligenței artificiale și merită atenția dvs.

Allen AI a lansat în mod discret noua sa familie de modele Tülu 3, iar versiunea cu 405B de parametri nu numai că concurează cu DeepSeek, dar o și depășește sau o egalizează pe anumite benchmark-uri.

Să punem lucrurile în perspectivă.

Modelul Tülu 3 cu 405B de parametri se confruntă cu performerii de top, cum ar fi DeepSeek V3, într-o gamă largă de sarcini. Vedem performanțe comparabile sau superioare în domenii precum probleme matematice, provocări de codare și urmarea instrucțiunilor precise. Și fac toate acestea cu o abordare complet deschisă.

Ei au lansat pipeline-ul complet de antrenare, codul și chiar metoda lor inovatoare de învățare prin întărire, numită Reinforcement Learning with Verifiable Rewards (RLVR), care a făcut posibilă toate acestea.

Asemenea dezvoltări din ultimele săptămâni schimbă cu adevărat modul în care are loc dezvoltarea inteligenței artificiale de top. Când un model cu sursă deschisă poate egala cele mai bune modele închise, deschide posibilități care erau anterior blocate în spatele zidurilor corporațiilor private.

Despre lupta tehnică

Ce a făcut Tülu 3 să iasă în evidență? Acest lucru se datorează unui proces de antrenare în patru etape, care depășește abordările tradiționale.

Să examinăm cum a construit Allen AI acest model:

Etapa 1: Selectarea strategică a datelor

Echipa a știut că calitatea modelului începe cu calitatea datelor. Ei au combinat seturi de date stabilite, cum ar fi WildChat și Open Assistant, cu conținut generat în mod special. Dar aici este insight-ul cheie: nu au doar agregat date, ci au creat seturi de date țintite pentru abilități specifice, cum ar fi raționamentul matematic și competența în codare.

Etapa 2: Construirea unor răspunsuri mai bune

În a doua etapă, Allen AI s-a concentrat pe predarea unor abilități specifice modelului. Ei au creat seturi diferite de date de antrenare – unele pentru matematică, altele pentru codare și mai multe pentru sarcini generale. Testând aceste combinații în mod repetat, au putut vedea exact unde modelul a excelat și unde a avut nevoie de îmbunătățiri. Acest proces iterativ a revelat adevăratul potențial al ceea ce Tülu 3 ar putea realiza în fiecare domeniu.

Etapa 3: Învățarea din comparații

Aici, Allen AI a devenit creativ. Ei au construit un sistem care putea compara instantaneu răspunsurile Tülu 3 cu cele ale altor modele de top. Dar au rezolvat, de asemenea, o problemă persistentă în inteligența artificială – tendința modelelor de a scrie răspunsuri lungi doar pentru a fi lungi. Abordarea lor, utilizând Optimizarea directă a preferințelor (DPO) normalizată pe lungime, a însemnat că modelul a învățat să valorizeze calitatea în detrimentul cantității. Rezultatul? Răspunsuri care sunt atât precise, cât și cu scop.

Când modelele de inteligență artificială învață din preferințe (care răspuns este mai bun, A sau B?), ele tind să dezvolte un bias frustrant: încep să creadă că răspunsurile lungi sunt întotdeauna mai bune. Este ca și cum ar încerca să câștige spunând mai mult, în loc de a spune lucruri bine.

Optimizarea directă a preferințelor normalizată pe lungime corectează acest lucru, ajustând modul în care modelul învață din preferințe. În loc de a se uita doar la care răspuns a fost preferat, ia în considerare lungimea fiecărui răspuns. Gândiți-vă la acesta ca la judecarea răspunsurilor după calitatea pe cuvânt, nu doar după impactul total.

De ce contează acest lucru? Pentru că ajută Tülu 3 să învețe să fie precis și eficient. În loc de a umple răspunsurile cu cuvinte suplimentare pentru a părea mai cuprinzătoare, învață să ofere valoare în orice lungime este cu adevărat necesară.

Acest lucru poate părea un detaliu mic, dar este crucial pentru construirea inteligenței artificiale care comunică în mod natural. Cei mai buni experți umani știu când să fie conciși și când să se lărgească – și exact asta învață să facă optimizarea directă a preferințelor normalizată pe lungime.

Etapa 4: Inovația RLVR

Acesta este progresul tehnic care merită atenție. RLVR înlocuiește modelele de recompensă subiective cu verificări concrete.

Majoritatea modelelor de inteligență artificială învață prin intermediul unui sistem complex de modele de recompensă – esențialmente, presupuneri educate despre ceea ce face un răspuns bun. Dar Allen AI a urmat o cale diferită cu RLVR.

Gândiți-vă la modul în care antrenăm în prezent modelele de inteligență artificială. De obicei, avem nevoie de alte modele de inteligență artificială (numite modele de recompensă) pentru a judeca dacă un răspuns este bun sau nu. Este subiectiv, complex și adesea inconsistent. Unele răspunsuri pot părea bune, dar pot conține erori subtile care scape.

RLVR inversează această abordare. În loc de a se baza pe judecăți subiective, utilizează rezultate verificabile. Când modelul încearcă o problemă matematică, nu există nicio zonă gri – răspunsul este fie corect, fie incorect. Când scrie cod, acel cod fie rulează corect, fie nu.

Iată unde devine interesant:

  • Modelul primește feedback imediat, binar: 10 puncte pentru răspunsuri corecte, 0 pentru cele incorecte
  • Nu există spațiu pentru credit parțial sau evaluare fuzzy
  • Învățarea devine concentrată și precisă
  • Modelul învață să prioritizeze acuratețea în detrimentul răspunsurilor plauzibile, dar incorecte

RLVR Training (Allen AI)

Rezultatele? Tülu 3 a arătat îmbunătățiri semnificative în sarcinile în care corectitudinea contează cel mai mult. Performanța sa la raționament matematic (benchmark-ul GSM8K) și la provocări de codare a sărit în mod semnificativ. Chiar și urmarea instrucțiunilor sale a devenit mai precisă, deoarece modelul a învățat să valorizeze acuratețea concretă în detrimentul răspunsurilor aproximative.

Ce face acest lucru deosebit de interesant este modul în care schimbă jocul pentru inteligența artificială cu sursă deschisă. Abordările anterioare au luptat adesea pentru a egala precizia modelelor închise la sarcini tehnice. RLVR arată că, cu abordarea potrivită de antrenare, modelele cu sursă deschisă pot atinge același nivel de fiabilitate.

O privire asupra numărului

Versiunea Tülu 3 cu 405B de parametri concurează direct cu modelele de top din domeniu. Să examinăm unde excelă și ce înseamnă acest lucru pentru inteligența artificială cu sursă deschisă.

Matematică

Tülu 3 excelează la raționament matematic complex. Pe benchmark-uri precum GSM8K și MATH, egalizează performanța DeepSeek. Modelul gestionează probleme în mai multe etape și arată abilități puternice de raționament matematic.

Codare

Rezultatele la codare sunt la fel de impresionante. Datorită antrenamentului RLVR, Tülu 3 scrie cod care rezolvă eficient probleme. Punctul său forte stă în înțelegerea instrucțiunilor de codare și producerea de soluții funcționale.

Urmarea precisă a instrucțiunilor

Capacitatea modelului de a urma instrucțiuni se remarcă ca o forță principală. În timp ce multe modele aproximează sau generalizează instrucțiunile, Tülu 3 demonstrează o precizie remarcabilă în executarea exact a ceea ce i se cere.

Deschiderea cutiei negre a dezvoltării inteligenței artificiale

Allen AI a lansat atât un model puternic, cât și întregul proces de dezvoltare.

Fiecare aspect al procesului de antrenare este documentat și accesibil. De la abordarea în patru etape până la metodele de pregătire a datelor și implementarea RLVR – întregul proces este deschis pentru studiu și replicare. Această transparență stabilește un nou standard în dezvoltarea inteligenței artificiale de înaltă performanță.

Dezvoltatorii primesc resurse cuprinzătoare:

  • Pipeline-uri complete de antrenare
  • Unelte de prelucrare a datelor
  • Cadre de evaluare
  • Specificății de implementare

Acest lucru le permite echipelor:

  • Să modifice procesele de antrenare
  • Să adapteze metodele pentru nevoi specifice
  • Să construiască pe abordări dovedite
  • Să creeze implementări specializate

Această abordare deschisă accelerează inovația în întreg domeniul. Cercetătorii pot construi pe metode verificate, în timp ce dezvoltatorii se pot concentra pe îmbunătățiri, în loc de a începe de la zero.

Ascensiunea excelenței cu sursă deschisă

Succesul Tülu 3 este un moment mare pentru dezvoltarea inteligenței artificiale cu sursă deschisă. Când modelele cu sursă deschisă egalează sau depășesc alternativele private, acest lucru schimbă fundamental industria. Echipele de cercetare din întreaga lume au acces la metode dovedite, accelerându-și astfel munca și dând naștere unor inovații noi. Laboratoarele private de inteligență artificială vor trebui să se adapteze – fie prin creșterea transparenței, fie prin împingerea limitelor tehnice și mai departe.

Privind spre viitor, inovațiile Tülu 3 în recompense verificabile și antrenament în mai multe etape sugerează ceea ce urmează. Echipele pot construi pe aceste fundații, potențial împingând performanța și mai sus. Codul există, metodele sunt documentate, și o nouă undă de dezvoltare a inteligenței artificiale a început. Pentru dezvoltatori și cercetători, oportunitatea de a experimenta și de a îmbunătăți aceste metode marchează începutul unui capitol excitant în dezvoltarea inteligenței artificiale.

Întrebări frecvente (FAQ) despre Tülu 3

Ce este Tülu 3 și care sunt caracteristicile sale cheie?

Tülu 3 este o familie de modele de inteligență artificială cu sursă deschisă, dezvoltate de Allen AI, construite pe arhitectura Llama 3.1. Acesta vine în diverse dimensiuni (8B, 70B și 405B de parametri). Tülu 3 este proiectat pentru performanță îmbunătățită în diverse sarcini, incluzând cunoașterea, raționamentul, matematica, codarea, urmarea instrucțiunilor și siguranța.

Care este procesul de antrenare pentru Tülu 3 și ce date sunt utilizate?

Antrenarea Tülu 3 implică mai multe etape cheie. În primul rând, echipa curatează un set divers de prompturi din seturi de date publice și din date sintetice țintite spre abilități specifice, asigurându-se că datele sunt decontaminate împotriva benchmark-urilor. În al doilea rând, se efectuează un antrenament fin de supraveghere (SFT) pe un amestec de date de urmarea instrucțiunilor, matematică și codare. Următorul, se utilizează optimizarea directă a preferințelor (DPO) cu date de preferință generate prin feedback uman și al modelului de inteligență artificială. În final, se utilizează învățarea prin întărire cu recompense verificabile (RLVR) pentru sarcini cu corectitudine măsurabilă. Tülu 3 utilizează seturi de date curate pentru fiecare etapă, incluzând instrucțiuni conduse de persona, matematică și date de codare.

Cum abordează Tülu 3 siguranța și care sunt metricile utilizate pentru evaluarea acesteia?

Siguranța este o componentă centrală a dezvoltării Tülu 3, abordată pe parcursul întregului proces de antrenare. Un set de date specific pentru siguranță este utilizat în timpul SFT, care se dovedește a fi în mare măsură ortogonal cu alte date orientate spre sarcini.

Ce este RLVR?

RLVR este o tehnică în care modelul este antrenat să optimizeze o recompensă verificabilă, cum ar fi corectitudinea unui răspuns. Acest lucru diferă de metoda tradițională de învățare prin întărire cu ajutorul unui model de recompensă.

Alex conduce operațiunile de știri alimentate de AI ale Unite.AI, combinând jurnalismul, cercetarea și automatizarea pentru a susține o acoperire rapidă și scalabilă a inteligenței artificiale. Munca sa contribuie la asigurarea că evoluțiile emergente în domeniul AI sunt evidențiate eficient, menținând în același timp standardele editoriale ale publicației.