Lideri de opinie
Eșecul modelelor LLM în matematică și cum să rezolvi problema
Matematica a reprezentat întotdeauna o provocare semnificativă pentru modelele de inteligență artificială. A stăpâni matematica necesită abilități complexe de raționament, iar pentru inteligența artificială, această sarcină nu este deloc simplă. Acest lucru creează o problemă uriașă, având în vedere importanța competenței matematice pentru succesul profesional, personal și academic.
În ciuda capacităților lor remarcabile, modelele de limbaj mare (LLM) adesea luptă cu sarcinile matematice complexe, cum ar fi geometria, care necesită abilități avansate de raționament. Acest lucru ne aduce la întrebarea critică: cât de mult din capacitatea matematică a unui model de inteligență artificială provine dintr-un adevărat raționament versus simpla reamintire a datelor de antrenament?
Descoperirile recente de la Apple arată că, chiar și atunci când se concentrează pe problemele de matematică de la școala primară, cele mai sofisticate modele nu sunt complet conduse de „raționament”.
Ducând acest lucru mai departe, echipa de cercetare și dezvoltare de la MathGPT.ai a adus noi lumină asupra domeniilor de algebră până la nivelul de calcul care necesită cea mai mare îmbunătățire.
Aceste date au explorat modul în care variațiile de context și limbaj afectează performanța modelului în diferite LLM, incluzând cele mai recente modele o1-preview și o1-mini de la OpenAI. Rezultatele au arătat o tendință îngrijorătoare: acuratețea a scăzut constant pe măsură ce problemele s-au abătut de la întrebările originale disponibile în datele de antrenament ale LLM, cu o performanță care a scăzut puternic pe benchmark-urile matematice mai complexe deasupra nivelului de matematică de școală primară.
Dilema Rechemare vs. Raționament
Investigația s-a concentrat pe trei factori cheie:
- Utilizarea unor benchmark-uri matematice mai complexe decât matematica de școală primară
- Explorarea unui „prompt de 1 împușcătură” cu o apropiere extremă de problema de test
- Implementarea unei strategii „cea mai bună dintre n” pentru n încercări la aceeași problemă – efectiv, un vot majoritar pentru a elimina anomaliile statistice, la momentul inferenței.
Rezultatele au fost atât intrigante, cât și îngrijorătoare. S-au pus la încercare limitele variației problemelor, ceea ce a arătat o scădere constantă a performanței modelului de inteligență artificială pe măsură ce ecuațiile matematice au devenit mai complexe.
Provocarea Setului de Date MATH
Setul de date MATH a fost utilizat, cunoscut pentru problemele sale complexe de nivel liceal, în contrast cu setul de date Grade School Math 8K, care conține 8.500 de probleme elementare diverse din punct de vedere lingvistic. Setul de date MATH prezintă întrebări de nivel liceal mai complexe pentru a examina performanța modelului la niveluri variate de dificultate, de la pre-algebră la teoria numerelor. Acestă alegere a permis MathGPT.ai să examineze mai bine performanța modelului la niveluri variate de dificultate.
La testare, în timp ce valorile numerice și răspunsurile finale au rămas neschimbate, am variat limbajul, variabilele și contextul problemelor. De exemplu, un scenariu „câine care merge” ar putea fi transformat într-o problemă „mașină de spălat vase”. Această metodă a ajutat la mitigarea complexității crescute a setului de date MATH, în timp ce a continuat să provoace capacitățile de raționament ale modelelor.
Rezultate Revelatoare
Rezultatele au fost izbitoare. Chiar și cele mai avansate modele au luptat atunci când s-au confruntat cu variații ale problemelor pe care le-au întâlnit probabil în datele lor de antrenament. De exemplu, acuratețea modelului o1-mini a scăzut de la 93,66% la întrebările originale la 88,54% la cea mai complexă variație. Modelul o1-preview a experimentat o scădere similară, scăzând de la 91,22% la 82,93% – o scădere suficient de bruscă pentru a sublinia lacunele critice în robustețea lor.
Aceste descoperiri se aliniază și se bazează pe cercetarea anterioară a Apple, demonstrând că limitările raționamentului matematic al inteligenței artificiale devin mai evidente pe măsură ce problemele devin mai complexe și necesită o înțelegere mai profundă, mai degrabă decât recunoașterea modelelor.
Calea Înainte
Pe măsură ce continuăm să împingem limitele raționamentului LLM, este crucial să recunoaștem atât potențialul incredibil, cât și limitările actuale. Noi cercetări subliniază nevoia de inovație continuă în dezvoltarea modelelor de inteligență artificială capabile să depășească recunoașterea modelelor pentru a atinge abilități de rezolvare a problemelor mai robuste și mai generalizabile.
Acest lucru vine la un moment critic, în special în învățământul superior, unde inteligența artificială este utilizată din ce în ce mai mult ca ajutor pentru instructori în sala de clasă, în timp ce școlile continuă să înregistreze rate ridicate de eșec printre studenții la matematică care nu sunt pregătiți pentru cursuri.
Atingerea capacităților cognitive umane sau a inteligenței generale în inteligența artificială necesită nu numai progrese tehnologice, ci și o înțelegere nuanțată a modului de a acoperi golul dintre reamintire și adevăratul raționament.
Dacă suntem de succes pe acest drum, sunt convins că putem schimba viețile a milioane de studenți și chiar profesioniști, punându-le viețile pe o traiectorie complet nouă.












