Tankeledare

Misslyckandet med LLM i matematik och hur man löser det

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Matematik har alltid utgjort en betydande utmaning för AI-modeller. Att behärska matematik kräver komplexa resonemangsförmågor, och för AI är denna uppgift långt ifrån enkel. Detta skapar ett enormt problem med tanke på den matematiska kompetensens betydelse för professionell, personlig och akademisk framgång.

Trots sina anmärkningsvärda förmågor kämpar stora språkmodeller (LLM) ofta med komplexa matematiska uppgifter, som kräver avancerade resonemangsförmågor. Detta leder oss till den kritiska frågan: hur mycket av en AI-modells matematiska förmåga härrör från äkta resonemang kontra enkel återgivning av träningsdata?

Nya fynd från Apple visar att även när de fokuserar på grundskolematten, är inte ens de mest avancerade modellerna helt driven av “resonemang”.

Om vi tar detta ett steg längre, kastar R&D-teamet på MathGPT.ai nytt ljus över områden inom algebran till kalkylens nivå som kräver mest förbättring.

Dessa data undersökte hur variationer i problemkontext och språk påverkar modellprestanda över olika LLM, inklusive OpenAI:s senaste o1-preview och o1-mini-modeller. Resultaten avslöjade en oroande trend: noggrannheten minskade konsekvent när problem avvek från de ursprungliga frågorna som fanns i LLM:s träningsdata, med en prestanda som föll brant på mer utmanande matematiska benchmark än grundskolenivån.

Minnet vs. resonemangsdilemmat

Undersökningen fokuserade på tre nyckelfaktorer:

  1. Användning av mer utmanande matematiska benchmark än grundskolematten
  2. Utforskning av en “1-skottsprompt” med extrem närahet till testproblemet
  3. Implementering av en “bäst av n”-strategi för n försök på samma problem – effektivt en majoritetsröstning för att eliminera statistiska anomalier, vid inferenstid.

Resultaten var både fascinerande och oroande. Gränserna för problemvariationer pressades, vilket visade en konsekvent minskning av AI-modellens prestanda när de matematiska ekvationerna blev mer komplexa.

MATH Dataset-utmaningen

MATH-databasen MATH dataset användes, känd för sina utmanande högskolenivåproblem, till skillnad från grundskolematten 8K-databasen, som innehåller 8 500 språkligt varierade elementära nivåproblem. MATH-databasen presenterar mer utmanande högskolenivåfrågor för att undersöka modellprestanda över varierande svårighetsnivåer, från pre-algebra till talteori. Detta val möjliggjorde för MathGPT.ai att bättre undersöka modellprestanda över varierande svårighetsnivåer.

Under testningen, medan numeriska värden och slutliga svar förblev oförändrade, varierade vi språket, variablerna och kontexten för problemen. Till exempel kunde en “hundpromenad”-scenario förvandlas till ett “diskmaskins”-problem. Denna metod hjälpte till att mildra den ökade komplexiteten i MATH-databasen samtidigt som modellernas resonemangsförmågor utmanades.

Avslöjande resultat

Resultaten var slående. Även de mest avancerade modellerna kämpade när de ställdes inför variationer av problem som de troligen hade mött under sin träningsperiod. Till exempel minskade o1-mini-modellens noggrannhet från 93,66% på ursprungliga frågor till 88,54% på den mest utmanande variationen. o1-preview-modellen upplevde en liknande minskning, från 91,22% till 82,93% – en tillräckligt skarp minskning för att belysa kritiska luckor i deras robusthet.

Dessa fynd stämmer överens med och bygger på Apples tidigare forskning, vilket visar att begränsningarna i AI:s matematiska resonemang blir mer uppenbara när problemen blir mer komplexa och kräver djupare förståelse snarare än mönsterigenkänning.

Vägen framåt

Medan vi fortsätter att pressa gränserna för LLM-resonemang, är det avgörande att erkänna både dess otroliga potential och nuvarande begränsningar. Ny forskning understryker behovet av fortsatt innovation i utvecklingen av AI-modeller som kan gå bortom mönsterigenkänning för att uppnå mer robusta och generaliserbara problemlösningsförmågor.

Detta sker vid en kritisk tidpunkt, särskilt inom högre utbildning, där AI används allt mer som ett hjälpmedel för lärare i klassrummet, samtidigt som skolor fortsätter att se höga misslyckandefrekvenser bland matematikstudenter som inte är förberedda för kurserna.

Att uppnå mänskliknande kognitiva förmågor eller allmän intelligens i AI kräver inte bara teknologiska framsteg utan också en nyanserad förståelse för hur man brottar gapet mellan minne och äkta resonemang.

Om vi är framgångsrika på denna väg är jag övertygad om att vi kan förändra livet för miljontals studenter och till och med yrkesverksamma för att sätta deras liv på en helt ny bana.

Peter är styrelseordförande för MathGPT.ai, han är också en erfaren teknisk entreprenör och mentor, dedikerad till att utveckla lösningar som förbättrar liv. Efter att ha avslutat en masterexamen från Stanford 1992 tillbringade han 30 år med att grunda och stödja företag inom spel, IoT, programvara, AI och klimatinnovation.

Som grundare av YouWeb Incubator har han väglett startups med finansiering och hands-on mentorering, med framstående framgång. Peter sitter också i styrelsen för The Tech, GotIt! och GotIt! AI, rådgiver UCLA:s Institute of Carbon Management och leder Dharma Karma Foundation.