AIモデルとプラットフォーム

テスト時スケーリング:新しいPhDレベルの推論モデルを支える秘密のソース

mm
Unite.AI を Google の優先ソースに追加

人工知能の分野は、単にデータを追加したりモデルを大きくしたりするだけで知能を高めることができない段階に達しています。過去数年間、より大きなニューラルネットワークを構築し、インターネットのデータをより多く与えることで、モデルがより知能を高めることができるという考え方が主流でした。このアプローチは、モデルが詩を書いたり、言語を翻訳したり、法務試験に合格したりすることができるようにしました。しかし、これらのモデルは、深い論理、複雑な数学、多段階の科学的問題に対処することができませんでした。パターンマッチングには優れていますが、多段階の推論を必要とする問題ではしばしば失敗しました。

最近、人工知能の能力について考え方を変える新しいトレンドが登場しました。このトレンドは、テスト時スケーリングと呼ばれています。モデルが訓練段階で何を学ぶかではなく、実際に質問に答える際にモデルが「考え」ていることを研究者が注目しています。このシフトは、OpenAIのo1シリーズなどの最新の推論モデルを支える秘密のソースです。これらのモデルは、物理学、化学、生物学などの難しい科目でPhDレベルのパフォーマンスを発揮しています。

訓練スケーリングから推論スケーリングへのシフト

この変化が何を意味するのかを理解するには、人工知能が今までどのように構築されてきたかを見てみましょう。伝統的に、モデルの「知能」は、その訓練に基づいて決定されました。これには、数ヶ月間、数千のGPUで大量のデータを処理するために数百万ドルを費やすことが必要でした。訓練が完了すると、モデルは基本的に凍結されました。質問をすると、すでに学習したパターンに基づいて瞬時に回答を提供しました。これが推論またはテスト時と呼ばれるものです。

この伝統的なアプローチの問題は、モデルが正解を出すために1回しかチャンスがないことです。モデルは、質問を処理し、すでに学習したパターンに基づいてトークンを1つずつ生成しますが、「考え」または「論理を確認」する方法はありません。テスト時スケーリングは、このダイナミクスを変えます。モデルが推論段階でより多くの計算リソースを使用できるようにします。人間が単純な質問に答えるのに数秒かかる一方で、複雑な数学の問題を解くのに数分かかるのと同じように、AIモデルはタスクの難易度に応じて努力をスケーリングするように設計されています。

テスト時スケーリングの概念の定義

テスト時スケーリングとは、AIモデルがリクエストを処理する際に追加の計算リソースを使用できるようにするテクニックを指します。単純に言えば、モデルに「考え時間」を与えるということです。これは、モデルを大きくすることではなく、モデルをより慎重にすることです。テスト時スケーリングを使用するモデルは、最初に思いついた答えを生成するのではなく、さまざまなパスを探索し、自分の論理のエラーをチェックし、ユーザーが回答を見る前に回答を改良することができます。

この概念は、人間の脳の働き方とよく比較されます。心理学者は、「システム1」と「システム2」の思考について話します。システム1は、速く、直感的で、感情的です。顔認識や、馴染みのある道を運転するときに使用します。システム2は、遅く、より慎重で、論理的です。難しい数学の問題を解くときや、複雑なプロジェクトを計画するときに使用します。最近まで、LLMは主にシステム1の思考者でした。テスト時スケーリングは、システム2の思考を可能にする橋です。

推論プロセスのメカニズム

研究者がテスト時スケーリングを実現する方法は複数あります。最も一般的な方法の1つは、思考の連鎖(CoT)プロンプティングと呼ばれますが、新しいモデルでは、ユーザーが要求するのではなく、システム自体に組み込まれています。モデルは、問題を小さな論理的なステップに分解するように訓練されます。そうすることで、モデルは、次のステップに進む前に、解決策の各部分を検証できます。

別の重要なテクニックは、モンテカルロ木探索などの検索アルゴリズムを使用することです。モデルは、次に最も可能性の高い単語を予測するのではなく、回答の可能性のあるパスを複数生成します。モデルはこれらのパスを評価し、正しい解決策につながる可能性の高いパスを決定します。もしモデルが死胡同に陥ったり、前のステップが間違っていたことを認識したりすると、別のアプローチを試すことができます。この「先読み」機能は、チェスエンジンが最善の手を選択する前に数千の可能な手を評価するのと非常に似ています。推論段階で多くの可能性を検索することで、モデルは標準的なLLMで直接解決できるよりもはるかに複雑な問題を解決できます。

PhDレベルの推論にはメモリーよりも多くのことが必要

これが重要な理由は、科学や数学における高レベルの推論が単にメモリーで解決できないことです。PhDレベルの物理学の試験では、単に教科書で読んだ事実を繰り返すのではなく、複雑な原理を新しい状況に適用する必要があります。標準モデルは、これらのシナリオで妄想を生み出すことがあります。なぜなら、論理ではなく確率に基づいて次の単語を予測しようとしているからです。

テスト時スケーリングにより、モデルは研究者のように動作できます。モデルは内部的に仮説をテストできます。たとえば、モデルが複雑なコードを書くように求められると、モデルは「実行」ロジックを内部的にチェーンで考え、潜在的なバグを特定し、最終的なコードを提示する前にそれを修正できます。この自己修正の能力が、新しいモデルがアメリカ数学招待試験(AIME)やGPQA(専門家によって設計された難しい科学テスト)などのベンチマークで高いスコアを獲得できる理由です。モデルは単に推測しているのではなく、検証しています。

効率性のトレードオフと計算コスト

テスト時スケーリングは強力ですが、重大なコストが伴います。従来の方法では、AIの最も高価な部分は訓練でした。モデルが展開されると、実行することは比較的安価で迅速でした。テスト時スケーリングでは、コストはユーザーのリクエストに向きます。モデルがより多くの作業を行い、複数のパスを生成し、自身の作業を確認するため、応答時間が長くなり、ハードウェアリソースがより多く必要になります。

これにより、AIの新しい経済システムが生まれます。コストパーキュリーが大幅に変動する状況に向かっていきます。単純な天気の質問には数セントかかり、1秒で回答できます。一方、深い科学的調査には数ドルかかり、処理に1時間かかる可能性があります。このトレードオフは、高レベルの推論を達成するために必要ですが、開発者がこれらのモデルを効率化して、医療やエンジニアリングなどの業界で大規模に使用できるようにする必要性も生じます。

人工知能の将来への影響

テスト時スケーリングの台頭は、人工知能の開発が新しい時代に入っていることを示唆しています。数年前まで、人工知能のモデルは人間がすでに書いたものから学習するのみで、人間のデータが不足してしまう可能性がありました。ただし、テスト時スケーリングは、モデルがより多くのデータを読むのではなく、より深く考え、パフォーマンスを向上させることができることを示しています。

これにより、AIが独自の発見を行う可能性が開けられます。モデルが前に見たことがない問題を推論することができれば、新しい解決策を見つけることができます。材料科学、薬剤発見、再生可能エネルギーなどです。AIは、単にテキストを要約するヘルパーから、世界で最も難しい問題を解決するために協力できるデジタルパートナーへと移行しています。

まとめ

テスト時スケーリングは、先進的な人工知能を追求する上で欠けていた重要なピースを提供しています。モデルが推論段階でより多くの計算リソースを使用できるようにすることで、以前は数年先と考えられていたレベルのパフォーマンスが実現可能になりました。これらのモデルは、人間の知能に近い論理の一種を示し始めています。

今後、課題はこれらのテクニックを洗練することです。推論を高速化し、よりアクセスしやすくしながら、「速い」思考と「遅い」思考のバランスを取る必要があります。秘密のソースは、モデルが見たデータの量やサイズではなく、モデルが考えている時間です。AIの進歩を追っている人なら、焦点がシフトしたことは明らかです。競争は、誰が最大のモデルを持っているかではなく、誰が最も推論力のあるモデルを持っているかというものです。このシフトは、分野の次の10年のイノベーションを定義する可能性があります。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。