AIモデルとプラットフォーム

チェーン・オブ・ソートの終焉?CoreThinkとカリフォルニア大学の研究者がAIの推論におけるパラダイムシフトを提案

mm
Unite.AI を Google の優先ソースに追加

これまで、人工知能の分野では、スケールが重要視されてきた。より大きなモデル、より多くのGPU、より長いプロンプト。OpenAI、Anthropic、Googleは、巨大な大規模言語モデル(LLM)、強化学習のファインチューニング、チェーン・オブ・ソートのプロンプティングなどの技術を開発してきた。これらの技術は、ステップバイステップの答えを示すことで推論をシミュレートすることを目的としている。

しかし、CoreThink: A Symbolic Reasoning Layer to reason over Long Horizon Tasks with LLMsという技術白書は、CoreThink AIとカリフォルニア大学の研究者によって発表された。この白書では、LLMは強力な統計的テキスト生成器であるが、推論エンジンではないと主張している。チェーン・オブ・ソートは、真の論理ではなく、むしろパフォーマンスのためのものであると述べられている。

これに対応するために、研究者たちはGeneral Symbolicsを導入した。これは、既存のモデルにプラグインできるニューロ・シンボリック推論層である。評価結果は、幅広い推論ベンチマークで大幅な改善を示した。さらに、再トレーニングや追加のGPUコストは必要なかった。如果、このアプローチが検証されれば、AIシステムの設計における論理と意思決定の方法に大きな転換点となる可能性がある。

チェーン・オブ・ソートとは何か — そしてなぜ重要か

チェーン・オブ・ソート(CoT)プロンプティングは、現代のAIで最も広く採用されている技術の一つである。モデルに推論ステップを書き出すように求めることで、研究者たちはベンチマークスコアを改善できることが多かった。数学、コーディング、計画などの分野でである。

しかし、報告書はこのアプローチの限界を強調している。CoTの説明は妥当に見えるが、研究によると、モデルが実際に計算した内容とは異なることが多い。事実上、出力の後に合理化するのではなく、真の論理を明らかにするのではない。現実世界ではリスクがある。医療では、妥当な物語が誤った相関関係に頼っていることを隠す可能性がある。法的な分野では、捏造された理由が真正の理由と間違われる可能性がある。

さらに、報告書は非効率性を強調している。CoTチェーンは、単純な問題では長くなりすぎることがあるが、複雑な問題では浅い推論になることがある。結果として、計算が無駄になり、多くの場合、精度が低下する。研究者たちは、チェーン・オブ・ソートは「パフォーマンス的であり、メカニズム的ではない」と結論付けた。つまり、解釈可能性のイリュージョンを生み出す表面的な表示である。

シンボリックAI:初期の夢から新しい復活へ

CoTの批判は、シンボリックAIの歴史を振り返る機会を与える。AI研究の初期の数十年間は、明示的な論理形式で知識を符号化したルールベースのシステムを中心に行われた。MYCINのようなエキスパートシステムは、手作業で作成されたルールを適用して疾患を診断しようとした。詐欺検知システムは、ロジックのセットを使用して異常を検知した。

シンボリックAIには明らかな強みがあった。推論のすべてのステップが透明で追跡可能だった。しかし、これらのシステムは脆弱だった。数千のルールを符号化するには膨大な労力が必要であり、新しい状況に直面したときに苦労した。批評家のHubert Dreyfusは、人間の知能は、ルールセットで捉えることができない、文脈依存のノウハウに依存していると主張した。1990年代には、シンボリックアプローチはデータ駆動型のニューラルネットワークに取って代わられた。

近年、両者の長所を組み合わせることで、ニューロ・シンボリックAIを開発しようとする取り組みが再び行われている。アイデアは単純である。ニューラルネットワークが、画像やテキストのような汚れた入力を扱い、シンボリックモジュールが構造化された推論と論理的な保証を提供する。しかし、これらのハイブリッドは統合に苦労している。シンボリックの背骨は刚性すぎたが、ニューラルモジュールは一貫性を損なった。結果として、複雑で重いシステムができあがり、約束された解釈可能性を提供できなかった。

General Symbolics:新しい推論層

CoreThinkのGeneral Symbolics Reasoner(GSR)は、異なるアプローチでこれらの限界を克服しようとしている。言語を刚性な形式構造や高次元の埋め込みに翻訳するのではなく、GSRは自然言語そのものの中で動作する。推論のすべてのステップが言葉で表現されるため、コンテキスト、ニュアンス、モダリティが保存される。これにより、「必須」と「べき」という違いが推論プロセスを通じて保持される。

フレームワークは、入力を言語で解析し、言語変換を通じて論理的制約を適用し、完全に人間が読める推論トレースを生成することで動作する。矛盾やエラーが発生すると、推論パスの中で直接表面化され、透明性とデバッグが可能になる。効率を維持するために、システムは不要なステップを削減し、GPUのスケーリングなしで安定した長期推論を可能にする。

ベースモデルを再トレーニングする必要がないため、GSRは既存のモデルに適用できる。評価では、推論タスクの精度を30〜60パーセント改善し、トレーニングコストを増やさなかった。

ベンチマーク結果

改善はベンチマークを通じて最もよく示される。LiveCodeBench v6では、コーディング問題を評価し、CoreThinkは66.6パーセントのパス率を達成し、同カテゴリの先行モデルを大幅に上回った。SWE-Bench Liteでは、GitHubリポジトリから抽出されたリアルワールドのバグ修正ベンチマークで、62.3パーセントの精度を達成し、現在報告されている最高の結果となった。ARC-AGI-2では、24.4パーセントのスコアを達成し、ClaudeやGeminiなどの先行モデルを大幅に上回った。

これらの数字は、単なる精度の改善を示すものではない。詳細なケーススタディでは、シンボリック層がモデルを異なる方法で動作させることができた。scikit-learnのColumnTransformerでは、ベースラインモデルは表面的なパッチを提案したが、CoreThinkを使用したシステムは根本的な同期問題を特定し、徹底的に修正した。難しいLeetCodeのチャレンジでは、ベースモデルは動的プログラミングを誤って適用し、完全に失敗したが、シンボリック推論層は不正な状態表現を修正し、動作するソリューションを生成した。

シンボリック復活へのフィット

General Symbolicsは、推論に構造を戻すための試みの成長する運動の一部である。クラシックなシンボリックAIは透明性の価値を示したが、新規性に適応できなかった。伝統的なニューロ・シンボリックハイブリッドはバランスを約束したが、多くの場合、扱いにくいものとなった。検索をLLMにボルティングしたプランナースタックは、タスクが拡大するにつれて崩壊した。

最近の進歩は、新しいハイブリッドの可能性を示唆している。DeepMindのAlphaGeometryは、シンボリック構造が純粋なニューラルモデルを超えることができることを示した。CoreThinkのアプローチはこの傾向を拡大している。ARC-AGIパイプラインでは、決定的なオブジェクト検出とシンボリックパターン抽出がニューラル実行と組み合わせられ、LLMのみのシステムを大幅に上回る結果が得られた。ツール使用では、シンボリック層がコンテキストを維持し、制約を強制するのに役立つため、より信頼性の高いマルチターン計画が可能になる。

重要な違いは、General Symbolicsが剛性のある論理や大量の再トレーニングに頼らないことである。言語自体の中で推論することで、柔軟性を維持しながら解釈可能性を保存する。以前のハイブリッドよりも軽量で、重要な点は、実用的で、エンタープライズアプリケーションへの統合が可能である。

なぜ重要か

チェーン・オブ・ソートが推論のイリュージョンである場合、AI業界は重大な課題に直面する。企業は、高いリスクの環境である医療、法律、金融などで、推論を装うだけのシステムに依存することはできない。論文は、真の進歩は、モデルをさらにスケールアップするのではなく、推論の基礎自体を再考することから来ることを示唆している。

General Symbolicsはそのような基礎の一つである。軽量で解釈可能な層を提供し、再トレーニング不要で既存のモデルを強化し、表面的な物語ではなく真正な推論の改善をもたらす。より広いAIコミュニティにとって、これはシンボリック推論の復活を示唆する。剛性のあるルールセットではなく、ニューラル学習の柔軟な伴侶としてのシンボリック推論の復活である。

著者たちはこう述べている:「より良い推論を得るために、さらに多くのパラメータを追加する必要はない。基礎を再考する必要がある」

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。