AIモデルとプラットフォーム

メタのCOCONUT:言語を使用しない思考方法

mm
Unite.AI を Google の優先ソースに追加

研究者が最初に、大規模言語モデル(LLM)が「思考」を段階的に行うことができることを発見したとき、それは画期的な瞬間でした。つまり、私たちはこれらのブラックボックスの推論プロセスを垣間見ることができるようになったのです。しかし、AIモデルが自然言語で思考することを強制することは、実際には彼らを妨げている可能性があると言われても驚きません。

これは、メタとカリフォルニア大学サンディエゴ校の研究者が発見した、新しいCOCONUT(連続思考の鎖)法の本質です。

複雑な数学の問題を解決しようとしているのに、毎回の手順を大声で説明することを想像してください。面倒くさいですよね?これで、言語モデルが直面している根本的な課題に近づいてきました。

私たちがAIモデルに自然言語で推論をさせる場合:

  • 生成されるトークンのほとんどは、単なる言語的な接着剤です。つまり、「したがって」、「次に」、「したがって」などの言葉は、推論の価値を追加しません
  • 重要な決定ポイントは、特定の言葉にコミットする必要性によってボトルネックに遭遇します
  • モデルは、実際の問題解決ではなく、文法的整合性を維持することに大量の計算資源を費やします

研究者は、神経イメージング研究で興味深いことが発見しました。人間が複雑な推論タスクに取り組むとき、脳の言語センターは驚くほど静かにしていることが多いです。しかしそれでも、私たちはAIシステムを、推論の毎ステップを言葉に翻訳するように構築してきました。

パズルを解くときに、どのように思考するかを考えてみてください。脳は同時に複数の可能性を探索し、曖昧な仮説を保持し、思考を言葉に結晶化するのは、解決策を共有するときだけです。しかし、従来の思考の鎖のアプローチは、AIモデルに中間ステップを言葉に表現することを強制し、「言語的ボトルネック」を作り出します。

この洞察は、魅力的な質問につながりました。もし、AIモデルが、言葉に翻訳するのではなく、隠れ状態の連続的な高次元空間で推論できるようにできたらどうなるでしょうか?

COCONUTの革新を理解する

自分の考えを大声で話すことと、実際の脳内プロセスとの違いを想像してください。メタの研究者がCOCONUTで利用したのは、まさにそのギャップです。

COCONUTの本質的なブレークスルーは、AIモデルが2つの異なる方法で思考できるようにすることです。複雑なパズルを解決しようとしているとき、毎回の手順を頭の中で説明することはしませんよね?その代わりに、

  1. 問題を吸収する:情報を取り込みます(パズルのルールを読むように)
  2. 静かに思考する:脳は言葉にしないで複数の可能性を探索します
  3. 解決策を共有する:その後で、考えを他の人に説明します

COCONUTは、AIモデルに同じ自然な柔軟性を与えます。従来の方法のように、毎回の思考を言葉に表現するのではなく、モデルはその自然なニューラル空間で思考できます。研究者はこれを「潜在空間」と呼びます。

モデルは2つのモードをスムーズに切り替えます:

  • 質問を理解したり回答したりするときは、通常の言語を使用します
  • しかし、実際の思考プロセスでは、言葉の制約から解放された純粋なニューラルパターンを使用します

Image: Meta

トレーニングの旅

COCONUTの最も魅力的な側面の1つは、そのトレーニングカリキュラムです。何が特別なのかというと、それは自然な学習の進行を反映していることです。複雑なスキルを教える方法を考えてみてください。誰かを一気に深いところに投げ込むのではなく、徐々に複雑さを増していきます。

研究者はCOCONUTに同じアプローチを取りました:

ステージ1:基礎

まず、モデルは従来の思考の鎖の推論を通じて学習します。これにより、モデルは堅実な基礎的な理解を身につけます。

ステージ2:移行

ここで興味深いことが起こります。徐々に、書き出された推論のステップは連続的な思考に置き換えられます。トレーニングホイールを少しずつ外すことを想像してください。モデルは内部的な思考パターンを発展させます。

ステージ3:バランス

最後に、モデルは潜在空間での深い思考と明確な言語での洞察の伝達を無尽に切り替えることを学習します。

トレーニング中に、モデルは誰もが明示的にプログラムしていない能力を身につけました。たとえば、同時に複数の推論パスを考慮することです。この出現する挙動は特に興味深いです。なぜなら、もっと自然なAIの推論に近づいている可能性があるからです。予想外の発展は、しばしば最大のブレークスルーにつながります。

先ほど言及した神経イメージング研究を覚えていますか?人間の脳は、言語センターを大幅に活用せずに複雑な推論タスクを処理することが多いことを示しました。COCONUTは同様のパターンを発展させているようです。潜在空間で深く思考し、必要な場合にのみ言語に変換しています。

数字が物語る

研究からいくつかの重要な発見が際立っています:

  • 数学のワードプロブレム(GSM8k):ここで、COCONUTは34.1%の精度を達成しました。従来の思考の鎖(42.9%)よりも低いですが、ベースラインアプローチよりも大幅に優れています。
  • 論理的推論(ProntoQA):COCONUTは99.8%の精度を達成し、従来の思考の鎖(98.8%)を僅かに上回りました。しかし、ここが重要な点です。COCONUTは、従来の思考の鎖が92.5トークンを使用したのに対し、9トークンしか使用しませんでした。
  • 複雑な計画(ProsQA):最も印象的な結果は、この高度な推論テストから得られました。COCONUTは97%の精度を達成しましたが、従来の方法は77.5%でした。また、効率も際立っています。COCONUTは14.2トークンを使用しましたが、従来の方法は49.4トークンを使用しました。

これらの結果が約束されているのは、単に数字だけではなく、それらがさまざまな思考タイプについて何を明らかにしているかということです。COCONUTは、数学的推論ではまだ足りないところがあるかもしれませんが、複雑な論理的計画と推論を必要とするタスクでは優れています。

COCONUTは、AIシステムが推論する方法について根本的に再考するものです。自然で効率的で強力なAIの形に近づいています。言語ベースの推論から連続的な思考への旅は、より優れたAIシステムに向けた一歩です。

AlexはUnite.AIのAI駆動型ニュースオペレーションを率いており、ジャーナリズム、リサーチ、そして自動化を組み合わせて、人工知能に関するタイムリーかつスケーラブルな報道を支援しています。彼の取り組みにより、新興のAI開発が効率的に取り上げられ、出版物の編集基準が維持されます。