Liderzy opinii

Niepowodzenie modeli LLM w matematyce i jak je rozwiązać

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Matematyka zawsze stanowiła znaczące wyzwanie dla modeli AI. Opanowanie matematyki wymaga złożonych umiejętności rozumowania, a dla AI jest to zadanie wszystko tylko nie proste. To tworzy ogromny problem, biorąc pod uwagę wagę biegłości matematycznej w sukcesie zawodowym, osobistym i akademickim.

Pomimo ich niezwykłych zdolności, duże modele językowe (LLM) często mają trudności z złożonymi zadaniami matematycznymi, takimi jak geometria, które wymagają zaawansowanych umiejętności rozumowania. To prowadzi nas do krytycznego pytania: ile zdolności matematycznych modelu AI wynika z prawdziwego rozumowania, a ile z samych danych szkoleniowych?

Najnowsze ustalenia Apple pokazują, że nawet gdy koncentrują się na zadaniach matematycznych na poziomie szkoły podstawowej, najbardziej zaawansowane modele nie są w pełni napędzane przez „rozumowanie”.

Idąc o krok dalej, zespół R&D w MathGPT.ai rzucił nowe światło na obszary algebry i rachunku różniczkowego, które wymagają największych udoskonaleń.

Dane te badały, w jaki sposób zmiany kontekstu i języka wpływają na wyniki modelu w różnych LLM, w tym w najnowszych modelach o1-preview i o1-mini OpenAI. Wyniki ujawniły niepokojący trend: dokładność spadała systematycznie, gdy problemy odbiegały od oryginalnych pytań dostępnych w danych szkoleniowych LLM, a ich wyniki spadały gwałtownie w przypadku bardziej wymagających zadań matematycznych powyżej poziomu szkoły podstawowej.

Dylemat Pamięci i Rozumowania

Śledztwo koncentrowało się na trzech kluczowych czynnikach:

  1. Użycie bardziej wymagających zadań matematycznych niż te na poziomie szkoły podstawowej
  2. Eksploracja „jednorazowego podpowiedzi” z ekstremalną bliskością do testowego problemu
  3. Wdrożenie strategii „najlepszych z n” dla n prób rozwiązania tego samego problemu – efektywnie głosowanie większościowe w celu wyeliminowania anomalii statystycznych podczas wnioskowania.

Wyniki były zarówno interesujące, jak i niepokojące. Granice zmiany problemu zostały przesunięte, co pokazało systematyczny spadek wyników modelu AI wraz ze zwiększaniem się złożoności równań matematycznych.

Wyzwanie Zestawu Danych MATH

Zestaw danych MATH został wdrożony, znany ze swoich wymagających zadań na poziomie szkoły średniej, w przeciwieństwie do zestawu danych Grade School Math 8K, który zawiera 8 500 językowo zróżnicowanych zadań na poziomie podstawowym. Zestaw danych MATH przedstawia bardziej wymagające zadania na poziomie szkoły średniej, aby zbadać wyniki modelu na różnych poziomach trudności, od pre-algebry do teorii liczb. Ten wybór pozwolił MathGPT.ai lepiej zbadać wyniki modelu na różnych poziomach trudności.

Podczas testów, podczas gdy wartości numeryczne i ostateczne odpowiedzi pozostały niezmienne, zmienialiśmy język, zmienne i kontekst problemów. Na przykład, „scenariusz spaceru z psem” mógł zostać przekształcony w problem „zmywarki”. Ta metoda pomogła złagodzić zwiększoną złożoność zestawu danych MATH, nadal wyzwając umiejętności rozumowania modelu.

Ujawniające Wyniki

Wyniki były uderzające. Nawet najbardziej zaawansowane modele miały trudności, gdy spotkały się z wariacjami problemów, które prawdopodobnie spotkały w danych szkoleniowych. Na przykład, dokładność modelu o1-mini spadła z 93,66% w przypadku oryginalnych pytań do 88,54% w przypadku najbardziej wymagającej wariacji. Model o1-preview doświadczył podobnego spadku, spadając z 91,22% do 82,93% – wystarczająco wyraźny spadek, aby podkreślić krytyczne luki w ich wytrzymałości.

Te wyniki są zgodne z wcześniejszymi badaniami Apple, pokazując, że ograniczenia w matematycznym rozumowaniu AI stają się bardziej widoczne, gdy problemy stają się bardziej złożone i wymagają głębszego zrozumienia, a nie tylko rozpoznawania wzorców.

Ścieżka Do Przodu

Podczas gdy kontynuujemy poszerzanie granic rozumowania LLM, jest kluczowe, aby rozpoznać zarówno jego niesamowity potencjał, jak i obecne ograniczenia. Nowe badania podkreślają potrzebę dalszej innowacji w rozwijaniu modeli AI, które mogą wyjść poza rozpoznawanie wzorców i osiągnąć bardziej solidne i ogólniejsze umiejętności rozwiązywania problemów.

To ma miejsce w krytycznym momencie, zwłaszcza w edukacji wyższej, gdzie AI jest używany coraz częściej jako pomoc instruktora w klasie, podczas gdy szkoły nadal doświadczają wysokich wskaźników niepowodzeń wśród studentów matematyki, którzy nie są przygotowani do kursów.

Osiągnięcie ludzkich zdolności kognitywnych lub ogólnej inteligencji w AI wymaga nie tylko postępu technologicznego, ale także nuansowanego zrozumienia, jak przezwyciężyć lukę między pamięcią a prawdziwym rozumowaniem.

Jeśli będziemy szczęśliwi na tej ścieżce, jestem przekonany, że możemy zmienić życie milionów studentów i nawet profesjonalistów, aby postawić ich życie na całkowicie nowej trajektorii.

Peter jest Przewodniczącym MathGPT.ai, jest również doświadczonym przedsiębiorcą technologicznym i mentorem, poświęconym tworzeniu rozwiązań o dużym wpływie, które poprawiają życie. Po ukończeniu studiów podyplomowych na Uniwersytecie Stanforda w 1992 roku, spędził 30 lat zakładając i wspierając przedsięwzięcia w branży gier, IoT, oprogramowania, AI i innowacji klimatycznych.

Jako założyciel YouWeb Incubator, prowadził startupy z finansowaniem i mentoringiem, osiągając znaczące sukcesy. Peter zasiada również w radach nadzorczych The Tech, GotIt! i GotIt! AI, doradza Instytutowi Zarządzania Węglem UCLA i kieruje Fundacją Dharma Karma.