ソートリーダー

LLMの数学での失敗とその解決法

mm
Unite.AI を Google の優先ソースに追加

数学は常にAIモデルにとって大きな課題を提起してきた。数学をマスターするには複雑な推論スキルが必要であり、AIにとってこれは容易なタスクではない。

大規模言語モデル(LLM)は、幾何学のような複雑な数学タスクに苦戦することが多いことがわかっている。これにより、AIモデルの数学的能力は、真の推論によるものか、単にトレーニングデータの回顧によるものかという重要な質問が生じる。

Appleの最近の調査によると、最も洗練されたモデルでも、学童数学の単語問題に焦点を当てた場合、完全に「推論」によって動作しているわけではない。

さらに、MathGPT.aiの研究開発チームは、代数から微積分レベルの数学の改善が必要な領域について新たな知見を得た。

このデータでは、問題のコンテキストや言語の変化が、OpenAIの最新のo1-previewやo1-miniモデルを含むさまざまなLLMのパフォーマンスにどのように影響するかを調査した。調査結果は、トレーニングデータの元の質問から離れるにつれて、精度が一貫して低下するという懸念される傾向を示した。特に、学童数学レベルを超えるより複雑な数学的ベンチマークでは、パフォーマンスが大きく低下した。

回顧と推論のジレンマ

調査では、3つの重要な要素に焦点を当てた。

  1. 学童数学よりも複雑な数学的ベンチマークを使用すること
  2. テスト問題に極めて近い「1ショットプロンプト」を使用すること
  3. 「ベストオブN」戦略を実装すること。つまり、同じ問題に対するN回の試行のうち最も良かったものを選択すること。実質的には、推論時の統計的異常を除去するための多数決である。

結果は、面白くも懸念されるものだった。問題の変化の境界を押し広げたところ、数学的な方程式が複雑になるにつれて、AIモデルのパフォーマンスが一貫して低下することが示された。

MATHデータセットの課題

MATHデータセットは、8,500の言語的に多様な小学校レベルの問題を含むGrade School Math 8Kデータセットとは対照的に、より挑戦的な高校レベルの問題で構成されていることで知られている。MATHデータセットを使用することで、MathGPT.aiは、代数から数論までのさまざまな難易度レベルでのモデルのパフォーマンスをよりよく調査することができた。

テストでは、数値や最終的な答えは変更せずに、問題の言語、変数、コンテキストを変更した。たとえば、「犬の散歩」のシナリオを「食器洗浄機」の問題に変えるなど。これにより、MATHデータセットの複雑さが増す一方で、モデルの推論能力を挑戦することができた。

結果の明らかさ

結果は驚くべきものだった。最も高度なモデルでも、トレーニングデータで遭遇した問題の変化に直面したときに苦戦した。たとえば、o1-miniモデルの精度は、元の質問では93.66%だったものが、最も挑戦的な変化では88.54%に低下した。o1-previewモデルも同様の低下を示し、91.22%から82.93%まで低下した。これは、ロバスト性における重要なギャップを浮き彫りにした。

これらの調査結果は、Appleの以前の研究と一致し、AIの数学的推論の限界が、問題が複雑になり、より深い理解を必要とするときに明らかになることを示唆している。

前進する道

LLMの推論をさらに進化させるにつれて、その潜在能力と現在の限界を認識することが重要である。新しい研究は、パターン認識を超えて、より強固で汎用的な問題解決スキルを達成することができるAIモデルを開発するための継続的な革新の必要性を強調している。

これは、特に高等教育において重要である。AIは教室での教師の補助としてより広く使用されており、同時に数学の授業で苦労している学生の失敗率も高いままである。

AIで人間のような認知能力や汎用的な知能を達成するには、技術的な進歩だけでなく、回顧と真の推論の間のギャップを埋める方法を理解することが必要である。

この道を進むことができれば、数百万人の学生や専門家の生活を根本的に変えることができると確信している。

ピーターは、MathGPT.aiの会長です。彼は、生活を改善する影響力のあるソリューションを開発することに尽力している、経験豊富なテクノロジー企業家およびメンターです。1992年にスタンフォード大学で大学院を修了した後、30年にわたってゲーム、IoT、ソフトウェア、AI、気候イノベーション分野でのベンチャーを設立し、支援しました。

YouWeb Incubatorの創設者として、彼はスタートアップに資金とハンドソンメンターを提供し、著名な成功を収めてきました。ピーターは、The Tech、GotIt!、GotIt! AIの取締役を務め、UCLAのカーボン管理研究所にアドバイスを提供し、ダルマカルマ財団を率いています。