AIモデルとプラットフォーム
LLMが私たちに知能を再定義させる方法
古い諺があります:「それがアヒルのように見え、泳ぎ、音を立てるなら、それはおそらくアヒルです。」この単純な推論は、インディアナの詩人ジェームズ・ホイットコム・ライリーに由来することが多いです。これは、人工知能についての私たちの考え方を数十年間形作ってきました。行動が知能を特定するのに十分であるという考えは、アラン・チューリングの有名な「模倣ゲーム」、現在はチューリング・テストと呼ばれています。
チューリングは、人間が機械と他の人間との会話を区別できない場合、その機械は知能があると言えるということを示しました。アヒル・テストとチューリング・テストは、システムの中にあるものではなく、行動が重要であることを示唆しています。数十年間、このテストはAIの進歩を導いてきました。しかし、大規模言語モデル(LLM)の登場により、状況は変わりました。これらのシステムは、流暢なテキストを生成し、会話をし、人間のように感じるタスクを解決することができます。質問は、機械が人間の会話を模倣できるかどうかではなく、模倣が真の知能であるかどうかです。システムが私たちのように書き、推論し、創造することができたら、それを知能と呼ぶべきでしょうか。あるいは、行動だけでは知能を測るのに十分ではないのでしょうか。
機械知能の進化
大規模言語モデルは、AIについての私たちの考え方を変えてきました。これらのシステムは、もともと基本的なテキスト応答を生成することしかできませんでしたが、現在では論理的な問題を解決し、コンピューターコードを書き、物語を書き、創造的なタスクである脚本の作成を支援することもできます。これらの進歩における重要な開発の1つは、思考の連鎖と呼ばれる方法を使用して複雑な問題を解決する能力です。問題を小さな部分に分解することで、LLMは人間の問題解決に似た方法で複雑な数学の問題や論理的なパズルを解決できます。この機能により、MATHやGSM8Kなどの高度なベンチマークで人間のパフォーマンスに匹敵したり、それを超えたりすることができます。今日、LLMはマルチモーダル機能も持っています。画像を処理し、医療用スキャンを解釈し、視覚的なパズルを説明し、複雑な図を説明することができます。これらの進歩により、LLMが人間の行動を模倣できるかどうかという質問はもはや重要ではなく、模倣が真の理解を反映しているかどうかという質問が重要になりました。
人間のような思考の痕跡
LLMの成功は、知能を理解する私たちの方法を再定義しています。焦点は、チューリング・テストで示唆されたように、AIの行動を人間と一致させることから、LLMが情報を処理する方法で人間の思考をどの程度反映しているかを探ることに移りました。たとえば、最近の研究では、研究者はAIモデルと人間の脳活動の内部メカニズムを比較しました。研究では、70億パラメータを超えるLLMは、人間と同等の精度を達成し、人間の脳パターンと一致する方法で情報を内部的に組織化していることがわかりました。
人間とAIモデルがパターン認識タスクに取り組んだとき、脳スキャンは人間参加者とAIモデルの計算パターンに類似した活動パターンを示しました。モデルの内部レイヤーは、人間の脳波活動と直接一致する方法で抽象的な概念をクラスタリングしました。これは、人間とAIモデルの両方で、成功した推論には類似した組織構造が必要であることを示唆しています。
しかし、研究者はこの研究の限界を指摘しています。この研究には人間参加者が比較的少数で、人間と機械はタスクに異なる方法で取り組みました。人間は視覚的なパターンで作業し、AIモデルはテキストの説明を処理しました。人間とマシンの処理の相関は興味深いですが、機械が人間と同じ方法で概念を理解していることを証明するものではありません。
明らかな違いもあります。AIモデルのパフォーマンスは、人間と同等の精度に達したシンプルなパターンでは人間と同等ですが、最も複雑なタスクでは人間参加者よりも劇的にパフォーマンスが低下しました。これは、組織構造には類似性があるかもしれませんが、人間と機械が難しい抽象的な概念を処理する方法に根本的な違いがある可能性があることを示唆しています。
懐疑的な視点
これらの印象的な発見にもかかわらず、強い議論があるのは、LLMはただの熟練した模倣者にすぎないということです。この見解は、哲学者ジョン・シールの「中国語部屋」という思考実験から来ています。これは、行動が理解と等しくない理由を示しています。
シールは、英語しか話さない人物が部屋に閉じ込められ、中国語のシンボルを受け取り、英語のルールブックを使用してこれらのシンボルを操作して応答を生成することを想像します。部屋の外から見ると、彼の応答は中国語を母国語とする人物の応答と同じに見えます。しかし、シールは、この人物は中国語を理解していないと主張しています。彼は単に規則に従っているのです。
批評家は、この同じ論理をLLMに適用しています。彼らは、これらのシステムは「確率的パロット」であると主張しています。つまり、訓練データ内の統計的なパターンに基づいて応答を生成するのではなく、真の理解に基づいて応答を生成するのです。「確率的」という用語は、彼らの確率的な性質を指し、「パロット」という用語は、理解なしに模倣することを強調しています。
LLMのいくつかの技術的な限界もこの議論を裏付けています。LLMは頻繁に「幻覚」を生成します。つまり、ありそうだが完全に間違った、または意味のない応答です。これは、統計的にありそうだが、内部の知識ベースや真実と虚偽の理解を参照するのではなく、単に統計的にありそうである単語を選択するためです。これらのモデルはまた、人間のようなエラーと偏見を再現します。人間が簡単に無視できる無関係な情報によって混乱します。訓練データに含まれる偏見を含む人種や性別の固定観念を示します。もう1つの明らかな限界は「位置バイアス」です。ここでは、モデルは長いドキュメントの始まりや終わりにある情報を過度に強調し、ドキュメントの中央の内容を無視します。この「真ん中で失う」現象は、これらのシステムが情報を処理する方法が人間と大きく異なることを示唆しています。
これらの限界は、LLMが言語パターンを認識して再現することに優れていますが、真の意味や現実世界の文脈を理解しているわけではないことを強調しています。
知能とは何を意味するのか
最終的には、知能の定義が問題です。如果知能とは、連貫した言語を生成し、問題を解決し、新しい状況に適応する能力であるなら、LLMはすでにその基準を満たしています。しかし、知能が自己認識、真の理解、または主観的経験を必要とするなら、これらのシステムはまだ不足しています。
困難は、理解や意識のような特性を明確に客観的に測定する方法がないことです。人間と機械の両方で、これらの特性は行動から推測されます。アヒル・テストとチューリング・テストはかつては優れた答えを提供しましたが、LLMの時代にはもはや十分ではないかもしれません。これらの能力は私たちに、知能の定義を再考させるのです。伝統的な定義が技術の現実に追いついているのかどうかを問うのです。
結論
大規模言語モデルは、私たちがAIの知能を定義する方法に挑戦を与えています。彼らは推論を模倣し、アイデアを生成し、かつては人間独自のタスクを実行することができます。しかし、真の人間のような思考を形作る認識と根拠を欠いています。彼らの台頭は、私たちに、機械が知能的に行動するかどうかだけでなく、知能そのものが何を意味するかを問うことを強制しています。












