Лидеры мнений
Неудача Больших Языковых Моделей в Математике и Как Её Решить
Математика всегда представляла значительную проблему для моделей искусственного интеллекта. Освоение математики требует сложных навыков рассуждения, и для ИИ эта задача далека от простоты. Это создает огромную проблему, учитывая важность математической грамотности для профессионального, личного и академического успеха.
Несмотря на их замечательные способности, большие языковые модели (БЯМ) часто борются с сложными математическими задачами, такими как геометрия, которые требуют продвинутых навыков рассуждения. Это приводит нас к критическому вопросу: сколько математических способностей модели ИИ обусловлено真正щим рассуждением, а не просто воспоминанием тренировочных данных?
Недавние исследования Apple показывают, что даже когда внимание сосредоточено на математических задачах начальной школы, наиболее совершенные модели не полностью управляются «рассуждением».
Идущий дальше, команда исследований и разработки MathGPT.ai пролила новый свет на области алгебры до уровня исчисления, которые требуют наибольшего улучшения.
Эти данные исследовали, как вариации контекста проблемы и языка влияют на производительность модели по разным БЯМ, включая последние модели o1-preview и o1-mini от OpenAI. Результаты показали тревожную тенденцию: точность последовательно снижалась, когда проблемы отклонялись от оригинальных вопросов, доступных в тренировочных данных БЯМ, а производительность резко снижалась на более сложных математических эталонах выше уровня математики начальной школы.
Дилемма Воспоминания и Рассуждения
Расследование сосредоточилось на трёх ключевых факторах:
- Использование более сложных математических эталонов, чем математика начальной школы
- Изучение «однострочной подсказки» с крайней близостью к тестовой проблеме
- Реализация стратегии «лучшего из n» для n попыток решить одну и ту же проблему – по сути, большинством голосов для исключения статистических аномалий в момент вывода.
Результаты были как интригующими, так и тревожными. Границы вариации проблемы были расширены, что показало последовательное снижение производительности модели ИИ, когда математические уравнения становились более сложными.
Вызов Набора Данных MATH
Набор данных MATH был развернут, известный своими сложными задачами уровня средней школы, в отличие от набора данных Grade School Math 8K, который содержит 8 500 лингвистически разнообразных задач начального уровня. Набор данных MATH представляет более сложные задачи уровня средней школы для изучения производительности модели на различных уровнях сложности, от предалгебры до теории чисел. Этот выбор позволил MathGPT.ai лучше изучить производительность модели на различных уровнях сложности.
При тестировании, хотя числовые значения и окончательные ответы оставались неизменными, мы варьировали язык, переменные и контекст проблем. Например, сценарий «прогулка с собакой» мог быть преобразован в проблему «посудомоечная машина». Этот метод помог смягчить повышенную сложность набора данных MATH, сохраняя при этом сложность модели рассуждений.
Раскрытие Результатов
Результаты были поразительными. Даже наиболее совершенные модели боролись, когда сталкивались с вариациями проблем, которые они, вероятно, встретили в своих тренировочных данных. Например, точность модели o1-mini снизилась с 93,66% на оригинальных вопросах до 88,54% на наиболее сложной вариации. Модель o1-preview испытала аналогичное снижение, снизившись с 91,22% до 82,93% – достаточно резкое снижение, чтобы подчеркнуть критические пробелы в их прочности.
Эти результаты согласуются с и развивают более ранние исследования Apple, демонстрирующие, что ограничения математического рассуждения ИИ становятся более очевидными, когда проблемы становятся более сложными и требуют более глубокого понимания, а не распознавания образов.
Путь Вперед
Когда мы продолжаем расширять границы рассуждений БЯМ, важно признать как их невероятный потенциал, так и текущие ограничения. Новые исследования подчеркивают необходимость продолжения инноваций в разработке моделей ИИ, способных выйти за пределы распознавания образов и достичь более прочных и общих навыков решения проблем.
Это происходит в критический момент, особенно в высшем образовании, где ИИ все чаще используется в качестве помощи преподавателям в классе, а также школы продолжают сталкиваться с высокими уровнями неудач среди студентов по математике, которые не подготовлены к курсам.
Достижение человеческих когнитивных способностей или общего интеллекта в ИИ требует не только технологических достижений, но и тонкого понимания того, как мостить разрыв между воспоминанием и真正щим рассуждением.
Если мы добьемся успеха на этом пути, я уверен, что мы сможем изменить жизни миллионов студентов и даже профессионалов, поставив их жизни на совершенно новую траекторию.












