Ajatusjohtajat
LLM:n epäonnistuminen matematiikassa ja ratkaisu siihen
Matematiikka on aina ollut merkittävä haaste tekoälymallien kehittämisessä. Matematiikan hallitseminen vaatii monimutkaisia päättelytaitoja, ja tekoälylle tämä tehtävä ei ole lainkaan suoraviivainen. Tämä luo suuren ongelman, kun otetaan huomioon matemaattisen pätevyyden merkitys ammatillisessa, henkilökohtaisessa ja akateemisessa menestyksessä.
Huolimatta merkittävistä kyvyistään, suuret kielen mallit (LLM) usein kamppailevat monimutkaisten matemaattisten tehtävien kanssa, kuten geometria, jotka vaativat edistyneitä päättelytaitoja. Tämä johtaa meidät kriittiseen kysymykseen: kuinka paljon tekoälymallin matemaattisesta kyvystä johtuu aitojen päättelytaidoista verrattuna pelkästään koulutusaineiston muistiinpanoon?
Applelta saadut viimeaikaiset tulokset osoittavat, että jopa kun keskitytään perusopetuksen matematiikan sanallisiin tehtäviin, edistyneimmätkin mallit eivät ole täysin “päättelyyn” perustuvia.
Menemällä tästä eteenpäin, MathGPT.ai:n tutkimus- ja kehitysryhmä antoi uutta valaistusta algebrasta kalkyyliin ulottuvien matemaattisten aiheiden osalta, joissa on eniten parantamisen varaa.
Tämä data käsitteli, miten ongelman kontekstin ja kielen vaihtelut vaikuttavat mallin suorituskykyyn eri LLM-malleissa, mukaan lukien OpenAI:n uusimmat o1-esikatselu- ja o1-mini-mallit. Tulokset paljastivat huolestuttavan suuntauksen: tarkin tarkkuus laski jatkuvasti, kun ongelmat poikkesivat alkuperäisistä koulutusaineistossa olevista kysymyksistä, ja suorituskyky laski jyrkästi haasteellisemmissa matemaattisissa vertailuissa perusopetuksen matematiikan tasoa korkeammalla.
Muistiinpano ja päättely -dilemma
Tutkimus keskittyi kolmeen tärkeään tekijään:
- Käyttäminen haasteellisempia matemaattisia vertailuksi perusopetuksen matematiikkaa
- Tutkiminen “1-shot-prompt” -menetelmää, jossa on äärimmäinen läheisyys testiongelmaan
- Toteuttaminen “parhaan n” -strategiaa, jossa on n yritystä saman ongelman ratkaisemiseksi – tehokkaasti enemmistöäänestystä tilastollisten poikkeamien poistamiseksi johtopäätöksessä.
Tulokset olivat sekä mielenkiintoisia että huolestuttavia. Ongelman muunnelmien rajoja venytettiin, mikä osoitti jatkuvan laskun tekoälymallin suorituskyvyssä, kun matemaattiset yhtälöt tulivat monimutkaisemmiksi.
MATH-aineiston haaste
MATH-aineisto MATH-aineisto otettiin käyttöön, joka on tunnettu haasteellisista lukiotasoisista tehtävistä, toisin kuin perusopetuksen matematiikan 8K -aineisto, joka sisältää 8 500 kielellisesti monimuotoista perusopetuksen tason ongelmaa. MATH-aineisto esittää haasteellisempia lukiotasoisia kysymyksiä mallin suorituskyvyn tutkimiseksi vaihtelevien vaikeustasojen yli, algebrasta lukuteoriaan. Tämä valinta mahdollisti MathGPT.ai:lle paremman mallin suorituskyvyn tutkimisen vaihtelevien vaikeustasojen yli.
Testauksessa, vaikka numeeriset arvot ja lopputulokset säilyivät muuttumattomina, muutimme ongelman kieltä, muuttujia ja kontekstia. Esimerkiksi “koiran kävely” -skenaario voitiin muuttaa “astianpesukone” -ongelmaksi. Tämä menetelmä auttoi lieventämään MATH-aineiston lisääntynyttä monimutkaisuutta samalla haastamalla mallin päättelykykyjä.
Tulokset paljastuvat
Tulokset olivat hämmästyttäviä. Jopa edistyneimmät mallit kamppailivat, kun ne kohtasivat ongelman muunnelmia, joita ne olivat todennäköisesti kohdanneet koulutusaineistossaan. Esimerkiksi sen o1-mini-mallin tarkin tarkkuus laski 93,66 %:sta alkuperäisissä kysymyksissä 88,54 %:iin haasteellisimman muunnelman kohdalla. O1-esikatselu-malli koki samanlaisen laskun, laskien 91,22 %:sta 82,93 %:iin – tarpeeksi jyrkkä lasku korostamaan kriittisiä aukkoja niiden luotettavuudessa.
Nämä tulokset ovat linjassa ja laajentavat Apple:n aikaisempaa tutkimusta, osoittaen, että tekoälymallien matemaattisen päättelyn rajoitukset tulevat selvemmiksi, kun ongelmat kasvavat monimutkaisemmiksi ja vaativat syvempää ymmärrystä kuin mallintunnistusta.
Tie eteenpäin
Kun jatkamme tekoälymallien päättelykykyjen kehittämistä, on tärkeää tunnustaa sekä niiden uskomattomat mahdollisuudet että nykyiset rajoitukset. Uusi tutkimus korostaa jatkuvan innovaation tarvetta kehittää tekoälymalleja, jotka pystyvät siirtymään mallintunnistuksen lisäksi robustimpiin ja yleispätevämmpiin ongelmanratkaisukykyihin.
Tämä on kriittinen aika, erityisesti korkeakoulutuksessa, jossa tekoälyä käytetään yhä enemmän opettajien avuksi luokassa, samalla kun koulut ovat edelleen todistaneet korkeita epäonnistumisprosentteja matematiikassa, jossa opiskelijat eivät ole valmistautuneet kursseille.
Saavuttaminen inhimillisen kognitiivisen kyvyn tai yleisen älymystön tekoälyssä vaatii ei vain teknologisia edistysaskeleita, vaan myös hienostunutta ymmärrystä siitä, miten siltaa voidaan rakentaa muistiinpanon ja aidon päättelyn väliin.
Jos olemme menestyksekkäitä tässä pyrkimyksessä, olen varma, että voimme muuttaa miljoonien opiskelijoiden ja jopa ammattilaisten elämän kokonaan uuteen suuntaan.












