AIツール 101
チャットGPTを超えて:AIエージェント – 新しい働き方の世界

ディープラーニング、自然言語処理(NLP)、AIの進歩により、AIエージェントが世界の労働力の重要な部分を形成する時代に突入しました。これらのAIエージェントは、チャットボットや音声アシスタントを超えて、業界や私たちの日常生活に新しいパラダイムを形作っています。しかし、本当にこれらの「働く」AIエージェントが存在する世界で生活するということは何を意味するのでしょうか。この記事では、進化する風景を深く掘り下げ、先行する潜在性や課題を評価します。
AI労働者の進化:簡潔なまとめ
革命を理解する前に、既に起こったAI主導の進化を認識することが重要です。
- 伝統的なコンピューティングシステム:基本的なコンピューティングアルゴリズムから旅が始まりました。これらのシステムは、固定されたルールセットを使用して事前に定義されたタスクを解決することができました。
- チャットボットと初期の音声アシスタント:技術が進化すると、インターフェースも進化しました。Siri、Cortana、初期のチャットボットなどのツールは、ユーザーとAIの相互作用を簡素化しましたが、理解力と能力が限られていました。
- ニューラルネットワークとディープラーニング:ニューラルネットワークは、人間の脳の機能を模倣し、経験を通じて進化することを示しました。ディープラーニング技術により、画像と音声の認識が高度になりました。
- トランスフォーマーと先進的なNLPモデル:トランスフォーマーアーキテクチャの導入により、NLPの風景が変わりました。OpenAIのChatGPT、BERT、T5などのシステムは、人間とAIのコミュニケーションで突破を達成しました。これらのモデルは、言語とコンテキストを深く理解し、意味のある会話を持ち、コンテンツを作成し、複雑な質問に前例のない精度で答えることができます。
AIエージェントの登場:会話以上のもの
今日のAIの風景は、会話ツール以上のものを示唆しています。AIエージェントは、会話機能以上のタスクを実行し、環境から学び、決定を下し、甚至創造性を示すことができます。彼らは質問に答えるだけでなく、問題を解決しています。
伝統的なソフトウェアモデルは、明確なパスに基づいて機能しました。利害関係者はソフトウェアマネージャーに目標を表明し、設計者は特定の計画を設計しました。エンジニアはコードの行を通じて計画を実行しました。この「レガシーパラダイム」は、多数の人間の介入を伴う明確なソフトウェア機能でした。
AIエージェントは、異なる方法で動作します。エージェント:
- 達成しようとする目標を持っています。
- その環境と相互作用することができます。
- 目標を達成するために、観察に基づいて計画を立てます。
- 環境の状態の変化に応じて、必要な行動を取り、アプローチを調整します。
AIエージェントを従来のモデルと区別するのは、自律的に目標を達成するためのステップバイステップの計画を立てる能力です。つまり、以前はプログラマーが計画を提供していたのに対し、今日のAIエージェントは自分の道筋を切り開きます。
日常的な例を考えてみましょう。伝統的なソフトウェア設計では、プログラムは、事前に定義された条件に基づいて、期限切れのタスクについてユーザーに通知します。開発者は、プロダクトマネージャーによって提供された仕様に基づいてこれらの条件を設定します。
AIエージェントのパラダイムでは、エージェント自体がユーザーに通知するタイミングと方法を決定します。エージェントは環境(ユーザーの習慣、応用プログラムの状態)を測定し、最も適切な行動方針を決定します。プロセスはよりダイナミックになり、より即時のものになります。
ChatGPTは、プラグインの統合により、従来の使用法から逸脱しました。外部ツールを利用して複数のリクエストを実行することができます。ニューヨーク市の天気についてユーザーが尋ねた場合、ChatGPTはプラグインを利用して外部の天気APIとやり取りし、さらに応答に基づいてコースを修正することができます。
AIエージェント、Auto-GPT、AgentGPT、BabyAGIは、広大なAIの宇宙で新しい時代を迎えています。ChatGPTは、人間の入力を必要とするジェネレーティブAIを普及させましたが、AIエージェントの背後にあるビジョンは、AIが人間の介入なしに機能できるようにすることです。この変革的な潜在性は、Auto-GPTの急成長によって強調されています。GitHubでの6週間で107,000のスターを獲得し、確立されたプロジェクトよりも急速に成長しています。
AIエージェントとChatGPT
多くの先進的なAIエージェント、Auto-GPTやBabyAGIは、GPTアーキテクチャを利用しています。彼らの主な焦点は、AIタスクの完了に人間の介入を最小限に抑えることです。「GPT on a loop」という用語は、AgentGPTやBabyAGIのようなモデルの動作を特徴付けます。彼らは、ユーザーのリクエストをよりよく理解し、出力を改良するために、反復的なサイクルで動作します。一方、Auto-GPTは、インターネットアクセスやコード実行機能を組み込むことで、問題解決の範囲を大幅に拡大しています。
AIエージェントの革新
- 長期記憶:従来のLLMには、限られた記憶しかありません。最近のセグメントしか保持できません。包括的なタスクのために、全会話や以前の会話を思い出すことが重要になります。AIエージェントは、テキスト会話を数値配列に変換するワークフローを採用し、記憶の制約に対する解決策を提供しています。
- Webブラウジング機能:Auto-GPTは、Google Search APIを使用してWebブラウジング機能を実現しています。AIコミュニティでは、AIの知識の範囲について議論が行われています。
- コードの実行:Auto-GPTは、コードの生成だけでなく、シェルとPythonコードの実行も可能です。この機能により、他のソフトウェアとインターフェースし、動作領域を拡大することができます。
この図は、Large Language Modelとエージェントによって動作するAIシステムのアーキテクチャを示しています。
- 入力:システムは、ユーザーのコマンド、構造化されたデータベース、Webコンテンツ、リアルタイムの環境センサーからのデータを受け取ります。
- LLMとエージェント:コアでは、LLMがこれらの入力を処理し、Auto-GPT、AgentGPT、BabyAGI、HuggingGPTなどの専門エージェントと協力して、タスクを実行します。
- 出力:一度処理されると、情報はユーザーに適した形式に変換され、外部環境に影響を与えることができるデバイスに転送されます。
- メモリコンポーネント:システムは、短期的なキャッシュと長期的なデータベースを通じて、情報を一時的におよび恒久的に保持します。
- 環境:これは、外部の領域であり、センサーに影響を与え、システムの行動によって影響を受けます。
先進的なAIエージェント:Auto-GPT、BabyAGIなど
AutoGPTとAgentGPT
Auto-GPTは、2023年3月にGitHubでリリースされた、Pythonベースのアプリケーションです。OpenAIの変革的なジェネレーティブモデルであるGPTの力を利用しています。Auto-GPTを区別するのは、自律的にタスクを実行するように設計されており、ユーザーが目標を定義するだけで、必要なプロンプトを生成して目標を達成することができます。これは、真の人工一般知能(AGI)への革命的な飛躍です。
Auto-GPTは、インターネット接続、メモリ管理、GPT-3.5を使用したファイルストレージ機能など、幅広いタスクを処理することができます。従来のタスクから、人間の関与を必要とする複雑なタスクまで、多岐にわたるタスクを実行することができます。
一方、AgentGPTは、GPTフレームワーク上に構築された、ユーザー中心のインターフェースです。AgentGPTは、広範なコーディングの知識を必要とせずにセットアップして使用することができます。ユーザーはAIの目標を定義し、AgentGPTはそれを実行可能なタスクに分解します。
さらに、AgentGPTは、チャットボットの作成に限定されません。プラットフォームは、Discordボットの作成やAuto-GPTとのシームレスな統合など、多様なアプリケーションをサポートします。このアプローチにより、広範なコーディングの知識がなくても、完全に自律的なコーディング、テキスト生成、言語翻訳、問題解決などのタスクを実行することができます。
LangChainは、LLMとさまざまなツールをブリッジするフレームワークであり、エージェント(「ボット」とみなされる)を使用して、特定のタスクを決定して実行します。これらのエージェントは、外部リソースとシームレスに統合され、LangChainのベクターデータベースは、非構造化データを格納し、LLMのための情報の迅速な取得を容易にします。
BabyAGI
BabyAGIは、シンプルながら強力なエージェントです。BabyAGIの機能を理解するには、デジタルプロジェクトマネージャーを想像してください。オブジェクト指向でタスクを作成、組織化、実行します。多くのAIプラットフォームは、事前にトレーニングされた知識に制限されていますが、BabyAGIは、経験から学び、適応する能力に優れています。フィードバックを察知し、人間のように試行錯誤に基づいて決定を下すことができます。
特に、BabyAGIの強みは、コードの実行能力にあります。特定のオブジェクト指向でコードを実行することができ、複雑なドメイン、例えば暗号通貨取引、ロボティクス、自動運転などで、多様なアプリケーションで活用できます。

https://yoheinakajima.com/task-driven-autonomous-agent-utilizing-gpt-4-pinecone-and-langchain-for-diverse-applications/
プロセスは、3つのエージェントに分類できます:
- 実行エージェント:システムの核となり、OpenAIのAPIを利用してタスクを処理します。目標とタスクが与えられると、OpenAIのAPIにプロンプトを送信し、タスクの結果を取得します。
- タスク作成エージェント:前回の結果と現在の目標に基づいて、新しいタスクを作成します。プロンプトをOpenAIのAPIに送信し、辞書のリストとして潜在的なタスクを返します。
- タスク優先順位エージェント:最終段階では、タスクを優先順位に基づいてシーケンス化します。このエージェントは、OpenAIのAPIを利用してタスクを再順序化し、最も重要なタスクが最初に実行されるようにします。
BabyAGIは、OpenAIの言語モデルと協力して、Pineconeを利用してコンテキスト中心のタスク結果の保存と取得を実現します。
以下は、このリンクでBabyAGIを使用するデモです。
開始するには、有効なOpenAPIキーが必要です。UIには、OpenAPIキーを入力できる設定セクションがあります。コストを管理したい場合は、イテレーションの数に制限を設けることをお勧めします。
アプリケーションを設定した後、小さな実験を行いました。BabyAGIにプロンプトを送信しました:「個人の成長の旅について、里程標、課題、継続的な学習の変革的な力について、簡潔なツイートスレッドを作成してください。」
BabyAGIは、よく考えられた計画を返しました。一般的なテンプレートではなかったですが、根本的なAIがリクエストのニュアンスを理解していたことを示す包括的なロードマップでした。
Deepnote AI Copilot
Deepnote AI Copilotは、ノートブックでのデータ探索のダイナミクスを再定義しています。Deepnote AIは、データサイエンティストのワークフローを補完することを目的としています。基本的な指示を提供すると、AIは戦略を策定し、SQLクエリを実行し、Pythonを使用してデータを視覚化し、結果を明確な形で提示します。
Deepnote AIの強みは、ワークスペースの包括的な理解にあります。統合スキーマやファイルシステムを理解することで、実行計画を組織のコンテキストに完璧に合わせ、洞察が常に関連性のあるものとなるようにします。
AIのノートブックとの統合により、独自のフィードバックループが作成されます。コードの出力を積極的に評価し、結果が一貫性のあるものであることを保証します。
Deepnote AIは、プロセスを透明に保ち、行動の説明を提供します。コードと出力の統合により、行動が常に説明可能で再現可能であることを保証します。
CAMEL
CAMELは、AIエージェント間のコラボレーションを促進し、人間の介入を最小限に抑えたタスクの効率的な完了を目指すフレームワークです。
CAMELは、2つの主要なエージェントタイプに分かれています:
- AIユーザーエージェントは指示を提供します。
- AIアシスタントエージェントは、指示に基づいてタスクを実行します。
CAMELの目標の1つは、AIの思考プロセスの複雑さを解明し、複数のエージェント間のシナジーを最適化することです。ロールプレイやインセプションプロンプティングなどの機能により、AIタスクが人間の目標に一致するようにします。
Westworld Simulation:AIに生命を吹き込む
UnityソフトウェアにインスパイアされたWestworldシミュレーションは、Pythonで実装されています。これは、複数のAIエージェントが相互作用する環境をシミュレートし、最適化するための飛躍です。ほとんどデジタル社会のようなものです。
これらのエージェントは、デジタルエンティティに過ぎません。日常的なルーティンから複雑な社会的相互作用まで、人間らしい行動をシミュレートします。アーキテクチャは、大規模な言語モデルを拡張して経験を保存し、反省し、ダイナミックな行動計画のためにそれらを使用することができます。
Westworldのインタラクティブなサンドボックス環境は、The Simsに似ており、生成エージェントが住む町を実現します。ここで、ユーザーはエージェントとやり取りし、観察し、1日を通してエージェントを誘導することができます。複雑な社会的ダイナミクスや、現れる行動を観察することができます。
Westworldシミュレーションは、計算能力と人間らしい繊細さの調和のある融合を示しています。言語モデルとエージェントシミュレーションを組み合わせることで、現実とほとんど区別がつかないAI体験の創造に向けた道筋を示しています。
結論
AIエージェントは、非常に多才で、業界を形作り、ワークフローを変え、以前は不可能と思われた業績を達成することができます。しかし、すべての画期的な革新と同様に、完璧ではありません。
私たちのデジタル存在の基盤を変える力を持っていますが、人間的な課題、例えばニュアンスのあるシナリオでのコンテキストの理解や、トレーニングデータセットの外側にある問題に対処することに苦労しています。
次の記事では、Auto-GPTとGPTエンジニアについて深く掘り下げ、セットアップと使用方法を検討します。さらに、ループに陥るなどの理由で、これらのAIエージェントが時折失敗する理由を探ります。続きを読んでください。


















