Myslitelé
Selhání velkých jazykových modelů v matematice a jak to vyřešit
Matematika vždy představovala velkou výzvu pro modely umělé inteligence. Ovládnutí matematiky vyžaduje komplexní rozumové dovednosti, a pro umělou inteligenci je tato úloha všechno jiné než přímočará. To vytváří obrovský problém vzhledem k důležitosti matematické zdatnosti pro profesní, osobní a akademický úspěch.
Navzdory jejich pozoruhodným schopnostem často velké jazykové modely (LLM) struggují s komplexními matematickými úkoly, jako je geometrie, které vyžadují pokročilé rozumové dovednosti. To nás přivádí k kritické otázce: kolik z matematických schopností modelu umělé inteligence pochází z skutečného rozumového procesu a kolik z něj pochází pouze z paměti trénovacích dat?
Recentní zjištění od Apple ukazují, že i když se zaměřují na matematické úkoly na úrovni základní školy, ani ty nejsofistikovanější modely nejsou zcela řízeny „rozumovým procesem“.
Tým pro výzkum a vývoj v MathGPT.ai přinesl nové poznatky o oblastech algebry až po úroveň kalkulu, které vyžadují největší zlepšení.
Tato data zkoumala, jak variace v kontextu problému a jazyka ovlivňují výkon modelu napříč různými LLM, včetně nejnovějších modelů OpenAI o1-preview a o1-mini. Zjištění odhalila znepokojivý trend: přesnost konzistentně klesala, jak problémy odchýlily od původních otázek dostupných v trénovacích datech LLM, s výkonem, který prudce klesal u více náročných matematických testů nad úrovní základní školy.
Dilema mezi pamětí a rozumovým procesem
Šetření se zaměřilo na tři klíčové faktory:
- Použití náročnějších matematických testů než ty na úrovni základní školy
- Prozkoumání „1-shot promptu“ s extrémní blízkostí k testovacímu problému
- Implementace „best of n“ strategie pro n pokusů o stejný problém – efektivní většinové hlasování pro eliminaci statistických anomálií, při inferenci.
Výsledky byly både fascinující a znepokojivé. Hranice variace problému byly posunuty, což ukázalo konzistentní pokles výkonu modelu umělé inteligence, jak matematické rovnice стали komplexnější.
Výzva MATH Dataset
Dataset MATH byl nasazen, známý pro své náročné úkoly na úrovni střední školy, na rozdíl od datasetu Grade School Math 8K, který obsahuje 8 500 lingvisticky rozmanitých úkolů na úrovni základní školy. Dataset MATH představuje více náročné úkoly na úrovni střední školy pro zkoumání výkonu modelu napříč různými úrovněmi obtížnosti, od předalgebry po teorii čísel. Tento výběr umožnil MathGPT.ai lépe prozkoumat výkon modelu napříč různými úrovněmi obtížnosti.
Během testování, zatímco numerické hodnoty a konečné odpovědi zůstaly nezměněné, variace jazyka, proměnných a kontextu problémů. Například scénář „pes chodící“ by mohl být transformován do problému „myčka nádobí“. Tato metoda pomohla zmírnit zvýšenou složitost datasetu MATH, zatímco stále vyzývala rozumové schopnosti modelu.
Odhalující výsledky
Výsledky byly úderné. I ty nejsofistikovanější modely bojovaly, když čelily variacím problémů, se kterými se pravděpodobně setkaly ve svých trénovacích datech. Například model o1-mini měl přesnost, která klesla z 93,66 % na původních otázkách na 88,54 % na nejnáročnější variaci. Model o1-preview zažil podobný pokles, pokles z 91,22 % na 82,93 % – dostatečně prudký pokles, aby ukázal kritické mezery v jejich odolnosti.
Tato zjištění se shodují a staví na dřívějších výzkumech Apple, které ukazují, že omezení matematického rozumového procesu umělé inteligence se stávají více zřejmými, jak problémy rostou komplexnější a vyžadují hlubší pochopení spíše než rozpoznávání vzorců.
Cesta vpřed
Jak pokračujeme v rozšiřování hranic rozumového procesu LLM, je zásadní uznat jak jeho úžasné potenciál, tak i současné omezení. Nová výzkumná zjištění zdůrazňují potřebu pokračující inovace ve vývoji modelů umělé inteligence, které jsou schopné překročit rozpoznávání vzorců a dosáhnout více robustních a obecně použitelných problémových dovedností.
To přichází v kritické době, zejména ve vyšších ústavech vzdělávání, kde je umělá inteligence používána stále více jako pomocník instruktora v učebně, zatímco školy pokračují v pozorování vysokých selhání mezi studenty matematiky, kteří nejsou připraveni na kurzy.
Dosažení lidských kognitivních schopností nebo obecné inteligence v umělých inteligencích vyžaduje nejen technologický pokrok, ale také jemné pochopení, jak překlenout propast mezi pamětí a skutečným rozumovým procesem.
Pokud budeme úspěšní na této cestě, jsem přesvědčen, že můžeme změnit životy milionů studentů a dokonce i profesionálů, aby umístili své životy na zcela novou trajektorii.












