ソートリーダー
AIが人間のように考える時:LLMとエージェントの心を探る

現在、LLMとエージェントは、人間の心と区別がつかないほどの「思考」を行うことができる。彼らは、人間の認知プロセスを模倣したアプローチで構築されており、そのトレーニングのスケールは人間の経験を数十倍上回る。このことから、次のような疑問が生じる:私たちは、人間の能力を拡張するツールを作成しているのか、または予測不能な結果をもたらす新しいタイプの心を生み出しているのか。
モデルはどうやって考えるのか
LLMとエージェントの概念を区別することが重要である。コンピュータとのアナロジーを引くなら、LLMはプロセッサに相当し、エージェントはネットワークやグラフィックカードを接続したマザーボードに相当する。同様に、エージェントは複数のLLMを組み込んだ複雑なシステムであり、意思決定メカニズムや外部環境とのやり取りツールを備えている。
単一のLLMの動作を考えるなら、パターンマッチングにすべてが集約される。しかし、エージェントが複数のLLMを連結するとき、それは「思考」を行っていることになる。このプロセスはまだパターンに基づいているが、エージェントはモデルの間の論理的なやり取りを構築する:例えば、1つのLLMがタスクを分析し、エージェントは別のLLMがどのような行動をとるべきかを決定する。
人間の思考も同様のプロセスで行われる:私たちは蓄積された知識やパターンに頼り、それらを適切なタイミングで選択し、処理して結論を導き出す。このプロセスは推論と呼ばれる。
ChatGPTには、人間と同様に短期記憶と長期記憶の2種類の記憶がある。違いは、人間ではこれらの記憶レベルへのアクセスがより複雑で、常に線形ではないことにある。
短期記憶は、現在扱っている情報である。人間の場合、5分前に言ったことの内容が記憶に残っているかどうかはわからないが、GPTは常に「コンテキストウィンドウ」内のすべてのデータを考慮に入れる:これらのデータを省略したり無視したりすることはできない。
人間の長期記憶は、常に活性化しているわけではなく、特定のトリガーによってのみ呼び出される記憶から構成される:子供の頃の記憶、トラウマ、または心理学者のもとでのセッションでの経験など。GPTも同様のロジックで動作する:特に呼び出されない限り、情報を「思い出す」ことはない。例えば、「この質問は二度と聞かないでください」または「常にフォーマルな呼びかけで話しかけてください」という指示を保存することができるが、毎回のセッションでこれらの指示が適用されるわけではない。
長期記憶の別の例は、保存されたドキュメントである。GPTにマーケティング調査の手順をアップロードしたと仮定する。モデルはこれを記憶に保存できるが、それは毎回の質問でこのドキュメントを参照することを意味しない。質問がドキュメントのテキストと一致するキーワードを含む場合、モデルはそれを「思い出す」ことができる。
このメカニズムは、RAG(Retrieval-Augmented Generation)と呼ばれるアプローチで実現されており、モデルは関連するキューに基づいて保存された情報にアクセスすることができる。
したがって、モデルには実際に記憶があると言えるが、そのロジックは人間の記憶とは異なり、より形式化されたものである。
AIとの会話が時々セラピーよりも感じるのはなぜであり、時々はロボットのように感じるのか
現代の言語モデルは非常に大きく、膨大な量のデータ、知識、コンテキストを蓄積している。これらの情報は、テーマや意味のあるクラスターに組織化されている。モデルは、フィクション、科学記事、YouTubeのコメントなど、多様なソースでトレーニングされている。
AIと会話するとき、ユーザーのクエリ(プロンプト)は、モデルを特定のクラスターに誘導する。
例えば、「あなたはニューヨークの不動産弁護士で、20年の経験があり、マンションの購入を手伝ってください」というクエリを入力すると、モデルは同時に複数のクラスターを活性化する:弁護士 → ニューヨーク → 不動産。結果として、ユーザーは、実際に経験豊かな専門家に相談しているかのような、まとまりのある、関連性のある、現実的な回答を受け取ることになる。
もしクエリが自己開発や感情などのより個人的または哲学的なテーマに関するものであれば、モデルは「心理学」、「哲学」、「内面の仕事」などのクラスターに「シフト」し、その回答は驚くほど人間的で、時にはセラピーよりも感じられることがある。
しかし、クエリがあまりに一般的または漠然としすぎている場合、モデルはクラスター構造の中で「迷子になる」ことがあり、デフォルトの回答を返す:形式的で、距離を置いた、感情のないトーンで回答する。
AIの回答のスタイルや深さは、ユーザーがプロンプトでモデルをどのクラスターに誘導するかによって決まる。
モデルトレーニングとRLHFの哲学
人工知能には、学習アプローチが複数ある。哲学というよりも、戦略である。
クラシックな選択肢は、教師あり学習で、モデルに質問と正解を与える。モデルは、正しいとみなされるものを観察し、それに似た解決策を将来再現することで学習する。
別のアプローチは、RLHF(人間のフィードバックからの強化学習)である。これは、異なるスタイルで、モデルは何かを試み、成功した行動に対して「報酬」を受け取り、行動を調整する。徐々に、効果的な戦略を開発する。
RLHFは、生の材料から完成品を作るプロセスに例えられる。モデルを使いやすくするには、人間のフィードバックとの膨大な作業が必要である。
例えば、直接名前を付けずに物体を見せたとしよう:「それはシガーケース?カードホルダー?」とユーザーは迷う。ただ、「近い」、「遠い」、「60%はい」などのヒントを与える。数百回のこのような繰り返しで、ユーザーは「アハ、それは財布だ」と推測する。
LLMはこのようにトレーニングされる。人間、アンノテーター、専門家は評価し、スコアを割り当てる:この答えは良い、この答えは悪い。データの注釈や検証を専門とする会社であるKeymakrのような企業は、このプロセスで重要な役割を果たす。フィードバックは一般のユーザーからも来る:いいね、苦情、反応。モデルはこれらの信号を解釈し、行動パターンを形成する。
モデルトレーニングの実践
OpenAIの「Hide and Seek」というゲームでのエージェントのトレーニング実験は、強化学習の生きた例である。
2つのチームが参加した:「探索者」(赤)と「隠れ者」(青)。ルールは単純で、探索者が隠れ者を捕まえるとポイントを獲得し、捕まえられなければポイントを失う。初期段階では、エージェントには基本的な物理能力しかなく、戦略はプログラムされていなかった。
初期段階では、探索者は無秩序に動き、隠れ者を捕まえることは偶然だった。しかし数百万回のイテレーションの後、エージェントの行動は進化した。隠れ者は周囲の物体を利用してドアを塞ぎ、バリアを築くようになった。これらのスキルは、直接のプログラミングではなく、繰り返し試行と成功に対する報酬によって生まれた。
探索者は、当初無視されていたジャンプの能力を利用し始めた。失敗を重ねた後、ジャンプの戦術的価値が明らかになった。隠れ者はさらに防御を強化し、探索者の視界から物体を除去し、より信頼性の高いシェルターを築いた。
この実験は、試行と誤り、報酬と罰の数十億サイクルを経て、複雑な協調行動が形成されることを示した。さらに、エージェントは、コミュニケーションメカニズムがプログラムされていなかったにもかかわらず、協調して動作し始めた。単にチームワークがより効果的であることが明らかになったからである。
LLMも同様である。すべてのシナリオをスクリプト化することは不可能である:世界にはあまりにも多くの状況があり、変化は多岐にわたる。したがって、モデルに固定されたルールを教えるのではなく、学習方法を教えるのである。
これがRLHFの価値である。RLHFがなければ、LLMとエージェントはただのテキストライブラリに過ぎない。RLHFによって、会話パートナーとして適応し、自己修正し、進化する能力がもたらされる。
次に何が起こるのか
多くの人が、LLMやエージェントの開発が望ましくない、または危険な結果をもたらす可能性があることを心配している。
現在見られるものは、MVP(最小限の製品)でも何でもない。ただのプロトタイプに過ぎない。
本当の革命は、美しい手紙を書くことやそれをフランス語に翻訳することなどの小さなことではない。主要な方向性は、人間が行うマイクロタスクやルーチンタスクの自動化であり、人間に真正に創造的な知的タスクや休息の時間を残すことである。
真正の革新は、エージェント、つまり独立して考え、行動し、決定を下すシステムの周りを中心に行われている。OpenAI、Google 、Metaなどの企業が現在注力しているのは、ここにある。
LLMは基盤に過ぎない。真の未来は、ダイナミックな世界で生き、フィードバックを受け、変化に適応するエージェントのトレーニングにある。












