AIモデルとプラットフォーム

意図から実行へ: マイクロソフトが大規模言語モデルをアクション指向AIに変革する方法

mm
Unite.AI を Google の優先ソースに追加

大規模言語モデル(LLM)は、自然言語処理の方法を変えました。質問に答える、コードを書く、会話をすることができます。しかし、実世界のタスクでは限界があります。例えば、LLMはジャケットの購入方法を説明できますが、注文を代行することはできません。このギャップは大きな制限です。人々は情報だけでなく、結果が必要です。

このギャップを埋めるために、マイクロソフトはLLMをアクション指向AIエージェントに変換しています。計画、タスクの分解、実世界の相互作用を可能にし、LLMが実用的タスクを効果的に管理できるようにします。この変化は、LLMが何ができるかを再定義する可能性があり、複雑なワークフローを自動化し、日常タスクを簡素化するツールに変えることができます。何が必要か、マイクロソフトがどのようにアプローチしているかを見てみましょう。

LLMがアクションを取るために必要なもの

LLMが実世界でタスクを実行するには、テキストを理解するだけでなく、デジタルおよび物理的な環境と相互作用し、変化する条件に適応する必要があります。以下は、必要な機能の一部です:

  1. ユーザーの意図を理解する

LLMが効果的にアクションを取るには、ユーザーのリクエストを理解する必要があります。テキストまたは音声コマンドなどの入力は、曖昧または不完全な場合があります。システムは、知識とリクエストのコンテキストを使用してギャップを埋める必要があります。マルチステップの会話により、これらの意図を絞り込むことができます。

  1. 意図をアクションに変換する

タスクを理解した後、LLMはそれを実行可能なステップに変換する必要があります。これには、ボタンをクリックしたり、APIを呼んだり、物理デバイスを制御したりすることが含まれる場合があります。LLMは、特定のタスクに合わせてアクションを変更し、環境に適応し、問題が発生したときにそれを解決する必要があります。

  1. 変更に適応する

実世界のタスクは、常に予定通り進行するとは限りません。LLMは、問題を予測し、ステップを調整し、問題が発生したときに代替案を見つける必要があります。例えば、必要なリソースが利用できない場合、システムはタスクを完了する別の方法を見つける必要があります。この柔軟性により、プロセスが変更されたときに停止しません。

  1. 特定のタスクに特化する

LLMは一般的な使用を目的として設計されていますが、特化により、より効率的に動作します。特定のタスクに焦点を当てると、システムはより優れた結果を、より少ないリソースで提供できます。これは、コンピューティング能力が制限されているデバイス、たとえばスマートフォンや組み込みシステムで特に重要です。 (MSFT )

これらのスキルを開発することで、LLMは情報処理だけでなく、有意義なアクションを実行することができます。毎日のワークフローにAIをシームレスに統合する道を開きます。

マイクロソフトがLLMを変革する方法

マイクロソフトのアクション指向AIの作成アプローチは、構造化されたプロセスに従います。主な目的は、LLMがコマンドを理解し、効果的に計画し、アクションを実行できるようにすることです。以下は、その方法です:

ステップ1: データの収集と準備

最初のステップでは、UFOエージェント(後述)などの特定のユースケースに関するデータを収集しました。データには、ユーザーのクエリ、環境の詳細、タスク固有のアクションが含まれます。このフェーズでは、2種類のデータが収集されます。まず、タスク計画データを収集し、LLMがタスクを完了するために必要なハイレベルなステップをアウトラインするのに役立ちます。例えば、「Wordでフォントサイズを変更する」には、テキストを選択し、ツールバーの設定を調整するステップが含まれます。次に、タスクアクションデータを収集し、LLMがこれらのステップを具体的な指示に変換できるようにします。たとえば、特定のボタンをクリックしたり、キーボードショートカットを使用したりします。

この組み合わせにより、モデルは大きな絵と詳細な指示の両方を持ち、タスクを効果的に実行することができます。

ステップ2: モデルのトレーニング

データを収集した後、LLMは複数のトレーニングセッションを経て洗練されます。最初のステップでは、LLMをタスク計画のためにトレーニングし、ユーザーのリクエストを実行可能なステップに分解する方法を教えます。専門家がラベル付けしたデータを使用して、LLMがこれらの計画を具体的なアクションに変換する方法を教えます。さらに、問題解決能力を強化するために、LLMは自己強化探索プロセスに従事し、未解決のタスクに取り組み、新しい例を生成して継続的な学習を可能にします。最後に、強化学習が適用され、成功と失敗からのフィードバックを使用して、意思決定をさらに改善します。

ステップ3: オフラインテスト

トレーニング後、モデルは制御された環境でテストされ、信頼性が確保されます。タスク成功率(TSR)やステップ成功率(SSR)などのメトリックが使用され、パフォーマンスを測定します。例えば、カレンダー管理エージェントをテストする場合、ミーティングのスケジュール設定や招待の送信におけるエラーのない能力を検証することが含まれます。

ステップ4: 実システムへの統合

検証後、モデルはエージェントフレームワークに統合され、実世界の環境と相互作用することができます。ツール seperti UI Automation APIは、システムがユーザーインターフェイス要素を動的に識別および操作できるように支援します。

例えば、Wordでテキストを強調表示するようにタスクが与えられた場合、エージェントは強調表示ボタンを識別し、テキストを選択し、フォーマットを適用します。メモリコンポーネントにより、LLMは過去のアクションを追跡し、新しいシナリオに適応できるようになります。

ステップ5: 実世界テスト

最終的なステップはオンライン評価です。ここで、システムは実世界のシナリオでテストされ、予期せぬ変更やエラーに対処できることが確認されます。例えば、カスタマーサポートボットがパスワードのリセットをユーザーに案内し、不正確な入力や情報の欠如に対応できることをテストする場合があります。このテストにより、AIが堅牢で、日常使用に適していることが保証されます。

実践的な例: UFOエージェント

アクション指向AIの動作を示すために、マイクロソフトはUFOエージェントを開発しました。このシステムは、Windows環境で実世界のタスクを実行し、ユーザーのリクエストを完了したアクションに変換します。

UFOエージェントの核心は、LLMを使用してリクエストを解釈し、アクションを計画することです。例えば、ユーザーが「このドキュメントで‘重要’という単語を強調表示してください」と言った場合、エージェントはWordと相互作用してタスクを完了します。UIコントロールの位置などのコンテキスト情報を収集し、それを使用してアクションを計画および実行します。

UFOエージェントは、Windows UI Automation(UIA)APIなどのツールに依存しています。このAPIは、アプリケーションをコントロール要素(ボタンやメニューなど)でスキャンし、エージェントがそれらを識別して必要なステップを実行できるようにします。たとえば、「ドキュメントをPDFとして保存する」というタスクの場合、エージェントはUIAを使用して「ファイル」ボタンを見つけ、「保存として」オプションを探し、必要なステップを実行します。データを一貫して構造化することで、システムはトレーニングから実世界の適用までのスムーズな操作を保証します。

課題の克服

これは興奮する開発ですが、アクション指向AIの作成には課題があります。スケーラビリティが大きな問題です。さまざまなタスクにわたるモデルをトレーニングおよびデプロイするには、多大なリソースが必要です。安全性と信頼性の確保も同様に重要です。モデルは、特に機密性の高い環境では、予期せぬ結果をもたらさずにタスクを実行する必要があります。また、これらのシステムがプライベートデータとやり取りするため、プライバシーとセキュリティに関する倫理基準を維持することも重要です。

マイクロソフトのロードマップは、効率性の向上、ユースケースの拡大、倫理基準の維持に焦点を当てています。これらの進歩により、LLMは、より実用的で適応性があり、アクション指向のAIとして、世界とのやり取りを再定義する可能性があります。

AIの未来

LLMをアクション指向エージェントに変換することは、画期的な変化となる可能性があります。これらのシステムはタスクを自動化し、ワークフローを簡素化し、テクノロジーをよりアクセスしやすくすることができます。マイクロソフトのアクション指向AIとUFOエージェントのようなツールの作業は、始まりにすぎません。AIが進化を続けるにつれて、より賢く、より能力のあるシステムが登場し、単に私たちとやり取りするだけでなく、仕事を完了することが期待できます。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。