Tankeledere

Sviktet til LLM i matematikk og hvordan løse det

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Matematikk har alltid vært en betydelig utfordring for AI-modeller. Mesteri i matematikk krever komplekse resonneringsferdigheter, og for AI er denne oppgaven langt ifra enkel. Dette skaper et enormt problem, gitt viktigheten av matematisk kompetanse for profesjonell, personlig og akademisk suksess.

Til tross for deres bemerkelsesverdige evner, har store språkmodeller (LLM) ofte problemer med komplekse matematiske oppgaver, som geometri, som krever avanserte resonneringsferdigheter. Dette fører oss til det kritiske spørsmålet: hvor mye av en AI-modells matematiske evne stammer fra ekte resonnering vs. bare gjentakelse av treningsdata?

Nylige funn fra Apple viser at selv når de fokuserer på grunnskolematematikk, er ikke selv de mest avanserte modellene fullstendig drevet av “resonnering”.

Ved å gå et skritt videre, kastet R&D-teamet til MathGPT.ai nytt lys over områder av algebra til kalkulusnivå matematikk som krever mest forbedring.

Denne dataen utforsket hvordan variasjoner i problemkontekst og språk påvirkte modellens ytelse over forskjellige LLM, inkludert OpenAI’s nyeste o1-preview og o1-mini-modeller. Funna viser en bekymringsverdig trend: nøyaktigheten falt jevnt som problemene avvik fra de opprinnelige spørsmålene i treningsdataene til LLM, med en ytelse som falt brått på mer utfordrende matematiske mål over grunnskolenivået.

Gjentakelse vs. Resonnering-dilemmaet

Undersøkelsen fokuserte på tre nøkelfaktorer:

  1. Bruke mer utfordrende matematiske mål enn grunnskolematematikk
  2. Utforske en “1-skudds prompt” med ekstrem nærhet til testproblemet
  3. Implementere en “beste av n” strategi for n forsøk på samme problem – effektivt en flertallsavstemming for å eliminere statistiske anomalier, på inferenstid.

Resultatene var både intrigerende og bekymringsverdige. Grensene for problemvariasjon ble presset, som viste en jevn nedgang i AI-modellens ytelse når matematiske ligninger ble mer komplekse.

MATH Dataset-utfordringen

MATH-datasettet ble deployert, kjent for sine utfordrende high school-nivåproblemer, i motsetning til Grade School Math 8K-datasettet, som inneholder 8 500 språklig diverse grunnskoleproblemer. MATH-datasettet presenterer mer utfordrende high school-nivåspørsmål for å undersøke modellens ytelse over forskjellige vanskelighetsnivåer, fra pre-algebra til tallteori. Dette valget tillot MathGPT.ai å bedre undersøke modellens ytelse over forskjellige vanskelighetsnivåer.

Under testingen, mens numeriske verdier og endelige svar forble uendret, varierte vi språket, variablene og konteksten av problemene. For eksempel kunne en “hund som går” scenario bli transformert til et “vaskemaskin” problem. Denne metoden hjalp til å mildne den økte kompleksiteten i MATH-datasettet samtidig som den fortsatt utfordret modellens resonneringsferdigheter.

Apenbare resultater

Resultatene var slående. Selv de mest avanserte modellene kjempet når de ble konfrontert med variasjoner av problemer de sannsynligvis hadde møtt i treningsdataene. For eksempel falt o1-mini-modellens nøyaktighet fra 93,66% på opprinnelige spørsmål til 88,54% på den mest utfordrende variasjonen. O1-preview-modellen opplevde en lignende nedgang, fra 91,22% til 82,93% – en skarp nok nedgang til å understreke kritiske hull i deres robusthet.

Disse funnene stemmer overens med og bygger på Apples tidligere forskning, som viser at begrensningene i AI sin matematiske resonnering blir mer åpenbare når problemene vokser mer komplekse og krever dypere forståelse enn mønstergjenkjenning.

Veien fremover

Etter hvert som vi fortsetter å presse grensene for LLM-resonnering, er det avgjørende å erkjenne både dens utrolige potensiale og nåværende begrensninger. Ny forskning understreker behovet for videre innovasjon i utvikling av AI-modeller som kan gå ut over mønstergjenkjenning for å oppnå mer robuste og generaliserbare problemløsningsevner.

Dette skjer på et kritisk tidspunkt, spesielt i høyere utdanning, hvor AI brukes mer og mer som en lærerhjelp i klasserommet, samtidig som skolene fortsatt ser høye feilrater blant matematikkelevene som ikke er forberedt på kursene.

Å oppnå menneske-lignende kognitive evner eller generell intelligens i AI krever ikke bare teknologiske fremskritt, men også en nuansert forståelse av hvordan man kan brygge gapet mellom gjentakelse og ekte resonnering.

Hvis vi er suksessfulle på denne veien, er jeg sikker på at vi kan endre livene til millioner av studenter og selv profesjonelle for å sette deres liv på en helt ny trajektorie.

Peter er styreleder i MathGPT.ai, og han er også en erfaren teknologi-entrepreneur og mentor, dedikert til å utvikle løsninger som forbedrer liv. Etter å ha tatt en mastergrad fra Stanford i 1992, tilbrakte han 30 år med å grunnlegge og støtte bedrifter innen spill, IoT, programvare, AI og klima-innovasjon.

Som grunnlegger av YouWeb Incubator, har han veiledet startups med finansiering og hånd-til-hånd mentorering, og oppnådd betydelig suksess. Peter sitter også i styret for The Tech, GotIt! og GotIt! AI, og rådgir UCLA's Institute of Carbon Management, og leder Dharma Karma Foundation.