Modele și platforme AI

Cum Phi-4-Reasoning Redefines Inteligența Artificială prin Provocarea Mitului “Mai Mare este Mai Bine”

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Lansarea recentă de către Microsoft (MSFT ) a Phi-4-reasoning provoacă o presupunere cheie în construirea sistemelor de inteligență artificială capabile de raționament. De la introducerea raționamentului în lanț în 2022, cercetătorii au crezut că raționamentul avansat necesită modele de limbaj foarte mari cu sute de miliarde de parametri. Cu toate acestea, noul model de 14 miliarde de parametri al Microsoft, Phi-4-reasoning, pune la îndoială această credință. Utilizând o abordare centrată pe date, mai degrabă decât să se bazeze pe puterea de calcul pură, modelul realizează o performanță comparabilă cu sistemele mult mai mari. Această descoperire demonstrează că o abordare centrată pe date poate fi la fel de eficientă pentru antrenarea modelelor de raționament ca și pentru antrenarea convențională a inteligenței artificiale. Deschide posibilitatea ca modelele de inteligență artificială mai mici să realizeze un raționament avansat, schimbând modul în care dezvoltatorii de inteligență artificială antrenează modelele de raționament, de la “mai mare este mai bine” la “date mai bune sunt mai bune.”

Paradigma Raționamentului Tradițional

Raționamentul în lanț a devenit un standard pentru rezolvarea problemelor complexe în inteligența artificială. Această tehnică conduce modelele de limbaj prin raționament pas cu pas, descompunând problemele dificile în pași mai mici și mai ușor de gestionat. Acesta imită gândirea umană, făcând ca modelele să “gândească cu voce tare” în limbaj natural înainte de a oferi un răspuns.

Cu toate acestea, această abilitate a venit cu o limitare importantă. Cercetătorii au constatat în mod constant declanșarea raționamentului în lanț a funcționat bine doar atunci când modelele de limbaj erau foarte mari. Capacitatea de raționament părea direct legată de mărimea modelului, cu modele mai mari care realizează o performanță mai bună la sarcinile de raționament complex. Această constatare a dus la o competiție în construirea unor modele de raționament mari, unde companiile s-au concentrat pe transformarea modelelor lor de limbaj mari în motoare de raționament puternice.

Ideea de a încorpora capacități de raționament în modelele de inteligență artificială a provenit în principal din observația că modelele de limbaj mari pot realiza învățarea în context. Cercetătorii au observat că atunci când modelele sunt arătate exemple de moduri de a rezolva probleme pas cu pas, ele învață să urmeze acest model pentru probleme noi. Acest lucru a condus la credința că modelele mai mari, antrenate pe cantități mari de date, dezvoltă în mod natural un raționament mai avansat. Legătura puternică dintre mărimea modelului și performanța raționamentului a devenit o înțelepciune acceptată. Echipele au investit resurse uriașe în scalarea capacităților de raționament utilizând învățarea prin întărire, crezând că puterea de calcul este cheia raționamentului avansat.

Înțelegerea Abordării Centrate pe Date

Apărarea inteligenței artificiale centrate pe date provoacă mentalitatea “mai mare este mai bine”. Această abordare schimbă accentul de la arhitectura modelului la ingineria atentă a datelor utilizate pentru antrenarea sistemelor de inteligență artificială. În loc de a trata datele ca intrare fixă, metodologia centrată pe date consideră datele ca material care poate fi îmbunătățit și optimizat pentru a îmbunătăți performanța inteligenței artificiale.

Andrew Ng, un lider în acest domeniu, promovează construirea unor practici de inginerie sistematică pentru a îmbunătăți calitatea datelor, mai degrabă decât ajustarea codului sau scalarea modelului. Această filozofie recunoaște că calitatea și curățenia datelor adesea contează mai mult decât mărimea modelului. Companiile care adoptă această abordare demonstrează că modelele mai mici, bine antrenate, pot depăși modelele mai mari, dacă sunt antrenate pe seturi de date de înaltă calitate și atent pregătite.

Abordarea centrată pe date pune o întrebare diferită: “Cum putem îmbunătăți datele noastre?” mai degrabă decât “Cum putem face modelul mai mare?” Acest lucru înseamnă crearea unor seturi de date de antrenare mai bune, îmbunătățirea calității datelor și dezvoltarea unei inginerii de date sistematice. În inteligența artificială centrată pe date, accentul se pune pe înțelegerea a ceea ce face datele eficiente pentru sarcini specifice, nu doar pe colectarea mai multor date.

Această abordare a demonstrat un mare potențial în antrenarea unor modele de inteligență artificială mici, dar puternice, utilizând seturi de date mici și mult mai puțină putere de calcul. Modelele Phi ale Microsoft sunt un exemplu bun de antrenare a unor modele de limbaj mici utilizând abordarea centrată pe date. Aceste modele sunt antrenate utilizând învățarea pe curriculum, care este inspirată în principal de modul în care copiii învață prin exemple din ce în ce mai dificile. Inițial, modelele sunt antrenate pe exemple ușoare, care sunt apoi înlocuite treptat cu exemple mai grele. Microsoft a construit un set de date din manuale, așa cum se explică în lucrarea lor ” Manualele sunt tot ce aveți nevoie.” Acest lucru a ajutat Phi-3 să depășească modele precum Gemma și GPT 3.5 în sarcini precum înțelegerea limbajului, cunoștințe generale, probleme de matematică de nivel școlar și răspunsuri la întrebări medicale.

În ciuda succesului abordării centrate pe date, raționamentul a rămas în general o caracteristică a modelelor de inteligență artificială mari. Acest lucru se datorează faptului că raționamentul necesită modele și cunoștințe complexe pe care modelele mari le capturează mai ușor. Cu toate acestea, această credință a fost recent contestată de dezvoltarea modelului Phi-4-reasoning.

Strategia Inovatoare a Phi-4-Reasoning

Phi-4-reasoning arată cum abordarea centrată pe date poate fi utilizată pentru a antrena modele de raționament mici. Modelul a fost construit prin antrenarea supravegheată a modelului de bază Phi-4 pe declanșatoare și exemple de raționament atent selectate, generate cu o3-mini de la OpenAI. Accentul s-a pus pe calitate și specificitate, mai degrabă decât pe mărimea setului de date. Modelul este antrenat utilizând aproximativ 1,4 milioane de declanșatoare de înaltă calitate, în loc de miliarde de declanșatoare generice. Cercetătorii au filtrat exemplele pentru a acoperi diferite niveluri de dificultate și tipuri de raționament, asigurându-se de diversitate. Această curățenie atentă a făcut ca fiecare exemplu de antrenare să fie util, predând modelului tipare de raționament specifice, mai degrabă decât doar creșterea volumului de date.

În antrenarea supravegheată, modelul este antrenat cu demonstrații complete de raționament care implică procesul de gândire complet. Aceste lanțuri de raționament pas cu pas au ajutat modelul să învețe cum să construiască argumente logice și să rezolve probleme în mod sistematic. Pentru a îmbunătăți în continuare capacitățile de raționament ale modelului, acesta este rafinat prin învățarea prin întărire pe aproximativ 6.000 de probleme de matematică de înaltă calitate cu soluții verificate. Acest lucru demonstrează că chiar și cantități mici de învățare prin întărire focalizată pot îmbunătăți semnificativ raționamentul atunci când se aplică datelor bine curate.

Performanță Dincolo de Așteptări

Rezultatele demonstrează că această abordare centrată pe date funcționează. Phi-4-reasoning depășește modele mult mai mari, cum ar fi DeepSeek-R1-Distill-Llama-70B și aproape se egalizează cu modelul complet DeepSeek-R1, în ciuda faptului că este mult mai mic. La testul AIME 2025 (un calificativ pentru Olimpiada de Matematică din SUA), Phi-4-reasoning depășește DeepSeek-R1, care are 671 de miliarde de parametri.

Îmbunătățirile se extind dincolo de matematică la rezolvarea problemelor științifice, codificare, algoritmi, planificare și sarcini spațiale. Îmbunătățirile datorate curățeniei atente a datelor se transferă bine la benchmark-urile generale, sugerând că această metodă construiește abilități de raționament fundamentale, mai degrabă decât trucuri specifice sarcinii.

Phi-4-reasoning contestă ideea că raționamentul avansat necesită o putere de calcul masivă. Un model cu 14 miliarde de parametri poate egala performanța modelelor de zeci de ori mai mari atunci când este antrenat pe date atent curate. Această eficiență are consecințe importante pentru implementarea inteligenței artificiale cu raționament în situații în care resursele sunt limitate.

Implicații pentru Dezvoltarea Inteligenței Artificiale

Succesul lui Phi-4-reasoning semnalează o schimbare în modul în care ar trebui să fie construite modelele de raționament ale inteligenței artificiale. În loc de a se concentra în principal pe creșterea mărimii modelului, echipele pot obține rezultate mai bune prin investiții în calitatea și curățenia datelor. Acest lucru face ca raționamentul avansat să fie mai accesibil organizațiilor fără bugete de calcul uriașe.

Metoda centrată pe date deschide, de asemenea, noi direcții de cercetare. Lucrările viitoare pot se concentra pe găsirea unor declanșatoare de antrenare mai bune, crearea unor demonstrații de raționament mai bogate și înțelegerea tipurilor de date care ajută cel mai mult la raționament. Aceste direcții ar putea fi mai productive decât simpla construire a unor modele mai mari.

Mai larg, acest lucru poate ajuta la democratizarea inteligenței artificiale. Dacă modelele mai mici, antrenate pe date curate, pot egala modelele mari, inteligența artificială avansată devine disponibilă pentru mai mulți dezvoltatori și organizații. Acest lucru poate, de asemenea, accelera adoptarea și inovarea în inteligența artificială în domenii în care modelele foarte mari nu sunt practice.

Viitorul Modelelor de Raționament

Phi-4-reasoning stabilește un nou standard pentru dezvoltarea modelelor de raționament. Sistemele de inteligență artificială viitoare vor echilibra, probabil, curățenia atentă a datelor cu îmbunătățirile arhitecturale. Această abordare recunoaște că atât calitatea datelor, cât și proiectarea modelului sunt importante, dar îmbunătățirea datelor poate oferi câștiguri mai rapide și mai rentabile.

Acest lucru permite, de asemenea, crearea unor modele de raționament specializate, antrenate pe date specifice domeniului. În loc de modele generale uriașe, echipele pot construi modele focalizate care excelează în domenii particulare prin curățenia atentă a datelor. Acest lucru va crea inteligență artificială mai eficientă pentru utilizări specifice.

Pe măsură ce inteligența artificială evoluează, lecțiile din Phi-4-reasoning vor influența nu numai antrenarea modelelor de raționament, ci și dezvoltarea inteligenței artificiale în general. Succesul curățeniei datelor în depășirea limitelor de mărime sugerează că progresul viitor se află în combinarea inovației în modele cu ingineria inteligentă a datelor, mai degrabă decât doar construirea unor arhitecturi mai mari.

Concluzia

Phi-4-reasoning de la Microsoft schimbă credința comună că inteligența artificială avansată necesită modele foarte mari. În loc de a se baza pe mărime, acest model utilizează o abordare centrată pe date, cu date de antrenare de înaltă calitate și atent selectate. Phi-4-reasoning are doar 14 miliarde de parametri, dar realizează o performanță la fel de bună ca și modelele mult mai mari la sarcini de raționament dificile. Acest lucru demonstrează că focalizarea pe date mai bune este mai importantă decât creșterea mărimii modelului.

Această nouă modalitate de antrenare face inteligența artificială avansată mai eficientă și mai accesibilă organizațiilor care nu au resurse de calcul mari. Succesul lui Phi-4-reasoning indică o nouă direcție în dezvoltarea inteligenței artificiale. Se concentrează pe îmbunătățirea calității datelor, antrenarea inteligentă și ingineria atentă, mai degrabă decât doar creșterea mărimii modelului.

Această abordare poate ajuta la progresul mai rapid al inteligenței artificiale, la reducerea costurilor și la permisia mai multor persoane și companii de a utiliza instrumente puternice de inteligență artificială. În viitor, inteligența artificială va crește, probabil, prin combinarea unor modele mai bune cu date mai bune, făcând inteligența artificială avansată utilă în multe domenii specializate.

Dr. Tehseen Zia este un profesor asociat titular la Universitatea COMSATS Islamabad, deținând un doctorat în IA de la Universitatea Tehnică din Viena, Austria. Specializându-se în Inteligență Artificială, Învățare Automată, Știință a Datelor și Viziune Computațională, el a făcut contribuții semnificative cu publicații în reviste științifice reputate. Dr. Tehseen a condus, de asemenea, diverse proiecte industriale ca Investigator Principal și a servit ca Consultant IA.