Лідери думок

Недолік великих мовних моделей у математиці та шлях до його вирішення

mm
Додайте Unite.AI до бажаних джерел у Google

Математика завжди становила значну проблему для моделей штучного інтелекту. Оволодіння математикою вимагає складних розумових здібностей, і для штучного інтелекту це завдання далеко не просте. Це створює величезну проблему, враховуючи важливість математичної грамотності для професійного, особистого та академічного успіху.

Незважаючи на свої видатні здібності, великі мовні моделі (LLM) часто борються з складними математичними завданнями, такими як геометрія, які вимагають високих розумових здібностей. Це приводить нас до критичного питання: скільки математичної здатності штучного інтелекту походить від справжнього розуміння, а не просто від спогаду тренувальних даних?

Нещодавні дослідження компанії Apple показують, що навіть коли мова йде про математичні завдання рівня початкової школи, найрозвітліші моделі не керуються повністю «розумінням».

Йдучи далі, команда дослідників MathGPT.ai пролила нове світло на області алгебри та калькуляусу, які потребують найбільшого покращення.

Ці дані досліджували, як варіації контексту та мови впливають на результати моделей різних LLM, включаючи останні моделі o1-preview та o1-mini від OpenAI. Результати показали турбуючу тенденцію: точність постійно знижувалася, коли завдання відхилялися від оригінальних питань, наявних у тренувальних даних LLM, а результати падали різко на більш складних математичних завданнях вище рівня початкової школи.

Ділема спогаду та розуміння

Дослідження зосередилися на трьох ключових факторах:

  1. Використання більш складних математичних завдань, ніж завдання рівня початкової школи
  2. Дослідження «одного промпта» з екстремальною близькістю до тестового завдання
  3. Реалізація стратегії «найкраще з n» для n спроб одного завдання – фактично голосування більшості для усунення статистичних аномалій під час висновку.

Результати були одночасно цікавими та турбуючими. Границі варіації завдань були розширені, що показало постійне зниження результатів моделей штучного інтелекту, коли математичні рівняння ставали більш складними.

Виклик набору даних MATH

Набір даних MATH був розгорнутий, відомий своїми складними завданнями рівня середньої школи, на відміну від набору даних Grade School Math 8K, який містить 8 500 лінгвістично різноманітних завдань рівня початкової школи. Набір даних MATH пропонує більш складні завдання рівня середньої школи для вивчення результатів моделей на різних рівнях складності, від пре-алгебри до теорії чисел. Це дозволило команді MathGPT.ai краще вивчити результати моделей на різних рівнях складності.

Під час тестування, хоча числові значення та остаточні відповіді залишилися незмінними, ми змінювали мову, змінні та контекст завдань. Наприклад, сценарій «пес, який йде» міг бути перетворений на завдання «посудомийна машина». Цей метод допоміг пом’якшити підвищену складність набору даних MATH, одночасно викликуючи розумові здібності моделей.

Відкриття результатів

Результати були вражаючими. Навіть найрозвітліші моделі боролися, коли їм були представлені варіації завдань, з якими вони, ймовірно, зустрічалися під час тренування. Наприклад, точність моделі o1-mini впала з 93,66% на оригінальних питаннях до 88,54% на найбільш складній варіації. Модель o1-preview також пережила подібний спад, впавши з 91,22% до 82,93% – досить різкий спад, щоб підкреслити критичні прогалини в їхній стійкості.

Ці результати підтверджують та доповнюють попередні дослідження компанії Apple, демонструючи, що обмеження математичного розуміння штучного інтелекту стають більш очевидними, коли завдання стають більш складними та вимагають глибшого розуміння, а не просто розпізнавання закономірностей.

Шлях вперед

Під час того, як ми продовжимо розширювати межі розуміння LLM, важливо визнати як їхній неймовірний потенціал, так і поточні обмеження. Нові дослідження підкреслюють необхідність подальших інновацій у розвитку моделей штучного інтелекту, здатних рухатися за межі розпізнавання закономірностей для досягнення більш надійних та універсальних навичок розв’язування проблем.

Це відбувається в критичний момент, особливо у вищій освіті, де штучний інтелект все частіше використовується як допоміжний інструмент для викладачів у класі, одночасно школи продовжують реєструвати високі показники невдач серед учнів математики, які не підготовлені до курсів.

Досягнення когнітивних можливостей людини або загальної інтелігентності в штучному інтелекті вимагає не тільки технологічних досягнень, але й тонкого розуміння того, як звести розрив між спогадом та справжнім розумінням.

Якщо ми успішні на цьому шляху, я впевнений, що ми можемо змінити життя мільйонів учнів та навіть професій, поставивши їхнє життя на зовсім новий шлях.

Петер є Головою MathGPT.ai, він також є досвідченим технологічним підприємцем і наставником, присвяченим розробці ефективних рішень, які покращують життя. Після закінчення аспірантури Стенфордського університету в 1992 році він провів 30 років, засновуючи та підтримуючи підприємства в галузі ігор, IoT, програмного забезпечення, штучного інтелекту та інновацій у сфері клімату.

Як засновник YouWeb Incubator, він керував стартапами, забезпечуючи їх фінансуванням та практичним наставництвом, досягнувши помітного успіху. Петер також є членом рад The Tech, GotIt! та GotIt! AI, радником Інституту управління вуглецем UCLA та керівником фундації Dharma Karma.