AIモデルとプラットフォーム

モバイルエージェント:自律的なマルチモーダルモバイルデバイスエージェントによる視覚認識

mm
Unite.AI を Google の優先ソースに追加

マルチモーダルラージランゲージモデル(MLLM)の出現により、テキスト、画像、音声で世界と交信できる新しいタイプのモバイルデバイスエージェントが登場しました。これらのエージェントは、従来のAIよりも豊かで直感的な方法でユーザーがデバイスと交信できるように、従来のAIを大幅に上回るものです。MLLMを活用することで、これらのエージェントはさまざまなモーダリティからの膨大な情報を処理および合成し、従来考えられなかったユーザー支援とユーザーエクスペリエンスの向上を実現できます。

これらのエージェントは、最先端の機械学習技術と高度な自然言語処理能力によって動作し、人間のようなテキストを理解および生成し、視覚および音声データを驚くほどの精度で解釈できます。画像内のオブジェクトやシーンを認識することから、音声コマンドを理解し、テキストの感情を分析することまで、これらのマルチモーダルエージェントは幅広い入力に対応できます。 この技術の可能性は膨大で、より洗練されたコンテキストに応じたサービス、たとえば人間の感情に合わせた仮想アシスタントや、個々の学習スタイルに適応する教育ツールなどを提供します。また、言語や感覚の障壁を超えて技術をよりアクセスしやすくすることで、アクセシビリティの革命をもたらす可能性もあります。

この記事では、モバイルエージェントについて説明します。モバイルエージェントは、モバイルアプリケーションのフロントエンドインターフェイス内の視覚的およびテキスト要素を正確に識別および位置付ける視覚認識ツールを活用する、自律的なマルチモーダルデバイスエージェントです。この視覚コンテキストを考慮して、モバイルエージェントフレームワークは複雑な操作タスクを自律的に計画および分解し、ステップごとにモバイルアプリケーションをナビゲートします。モバイルエージェントフレームワークは、モバイルシステムのメタデータやモバイルアプリケーションのXMLファイルに依存しない点で、既存のソリューションと異なります。これにより、さまざまなモバイルオペレーティング環境で、視覚中心の処理に重点を置いた高度な適応性が可能になります。モバイルエージェントフレームワークで採用されているアプローチは、システム固有のカスタマイズの必要性を排除し、パフォーマンスの向上と計算要件の低減につながります。

モバイルエージェント:自律的なマルチモーダルモバイルデバイスエージェント

モバイル技術の急速に進化する世界では、特に目立つ概念が登場しています。マルチモーダルラージランゲージモデル(MLLM)が生成する幅広いテキスト、画像、動画、音声など、さまざまな言語を扱うことができます。MLLMフレームワークの急速な開発により、新しい強力なアプリケーションが生まれました。モバイルエージェントは、人間の直接の命令なしに、自律的に動作し、ネットワークやデバイスを移動してタスクを実行したり、情報を収集したり、問題を解決したりするソフトウェアエンティティです。

モバイルエージェントは、ユーザーの指示と画面の視覚的要素に基づいてユーザーのモバイルデバイスを操作するように設計されています。これは、エージェントが意味の理解と視覚認識の両方を備えている必要があるタスクです。しかし、既存のモバイルエージェントは、まだ完璧ではありません。なぜなら、多くの場合、マルチモーダルラージランゲージモデルに基づいており、現在の最先端のMLLMフレームワークであるGPT-4Vも、モバイルエージェントとして効率的に機能するために必要な視覚認識能力が欠けているからです。さらに、既存のフレームワークは効果的な操作を生成できますが、スクリーン上でのこれらの操作の位置を正確に特定するのに苦労しています。これにより、モバイルエージェントの適用とモバイルデバイスでの操作が制限されます。

この問題に対処するために、一部のフレームワークは、GPT-4Vまたは他のMLLMをローカライゼーション能力で支援するために、ユーザーインターフェイスのレイアウトファイルを利用することを選択しました。いくつかのフレームワークは、アプリケーションのXMLファイルにアクセスすることで、スクリーン上での操作の位置を特定することに成功しましたが、他のフレームワークは、ウェブアプリケーションのHTMLコードを使用することを選択しました。多くのフレームワークは、ローカライゼーション方法でローカルファイルにアクセスすることに依存していることがわかります。これは、フレームワークがこれらのファイルにアクセスできない場合、ほとんど効果がない方法です。この問題を解決し、ローカルエージェントがローカルファイルに依存するローカライゼーション方法を排除するために、開発者はモバイルエージェントを開発しました。モバイルエージェントフレームワークは、視覚認識モジュールを使用して、モバイルデバイスのスクリーンショットから操作を正確に位置付けることができます。視覚認識モジュールには、スクリーン内のテキストを識別するためのOCRモデルと、特定のモバイルスクリーン領域のコンテンツを説明するための検出モデルが含まれています。モバイルエージェントフレームワークは、ツールとエージェントの間の効率的な相互作用を促進するように、慎重に作成されたプロンプトを使用して、モバイルデバイス操作を自動化します。

さらに、モバイルエージェントフレームワークは、最先端のMLLMフレームワークのコンテキスト能力を活用して、タスクを操作履歴、ユーザー指示、スクリーンショットを総合的に考慮して計画する自己計画能力を実現することを目指しています。エージェントの不完全な指示や誤った操作を特定する能力をさらに強化するために、モバイルエージェントフレームワークでは自己反省方法が導入されています。慎重に作成されたプロンプトの指示の下で、エージェントは一貫して不正確または無効な操作について反省し、タスクまたは指示が完了すると操作を停止します。

全体として、モバイルエージェントフレームワークの貢献は以下のとおりです。

  1. モバイルエージェントは、視覚認識ツールを使用して操作のローカライゼーションを実行する、自律的なモバイルデバイスエージェントです。慎重に計画されたプロンプトを使用して、モバイルデバイスの操作を自動化します。特に、モバイルエージェントは、システムコードやXMLファイルを使用せずに、デバイスのスクリーンショットのみを使用します。これは、純粋に視覚技術に基づくソリューションを示しています。
  2. モバイルエージェントは、モバイルデバイスエージェントを評価するためのベンチマークであるモバイルエバルを導入します。このベンチマークには、10個の一般的に使用されるモバイルアプリケーションと、これらのアプリケーションのための知的指示が含まれています。これらの指示は、3つの難易度レベルに分類されています。

モバイルエージェント:アーキテクチャと方法論

モバイルエージェントフレームワークの核となる部分は、最先端のマルチモーダルラージランゲージモデルであるGPT-4Vと、テキストローカライゼーションタスク用のテキスト検出モジュールです。GPT-4Vとともに、モバイルエージェントはアイコンローカライゼーションのためのアイコン検出モジュールも使用します。

視覚認識

前述のように、GPT-4V MLLMは、指示とスクリーンショットに対しては満足のいく結果をもたらしますが、操作の位置を効果的に出力することはできません。この制限により、GPT-4Vモデルを実装するモバイルエージェントフレームワークは、操作ローカライゼーションを支援するために外部ツールに依存する必要があります。したがって、モバイルスクリーン上での操作出力を促進します。

テキストローカライゼーション

モバイルエージェントフレームワークでは、モバイルスクリーン上の特定のテキストをタップする必要があるときに、スクリーン上の対応するテキストの位置を検出するために、OCRツールを実装します。テキストローカライゼーションには、3つのユニークなシナリオがあります。

シナリオ1:特定のテキストが検出されない

問題:OCRが特定のテキストを検出できません。これは、複雑な画像やOCRの制限により発生する可能性があります。

対応:エージェントに、テキストの再選択を指示するか、または代替操作を選択するように指示します。たとえば、入力方法を変更するか、タスクに関連する別のアクションを実行します。

理由:この柔軟性は、GPT-4Vの潜在的な不正確さや幻覚を管理するために必要です。エージェントがまだ効果的に進むことができるようにします。

シナリオ2:特定のテキストが1つ検出される

操作:検出されたテキストボックスの中心座標をクリックするアクションを自動的に生成します。

理由:1つのインスタンスのみが検出された場合、正しい識別の可能性は高いため、直接アクションを実行することが効率的です。

シナリオ3:特定のテキストが複数検出される

評価:まず、検出されたインスタンスの数を評価します。

多くのインスタンス:スクリーンが同様のコンテンツで混雑していることを示し、選択プロセスを複雑にします。

アクション:エージェントにテキストの再選択を指示し、選択または検索パラメータを調整します。

少数のインスタンス:管理可能な数の検出により、より繊細なアプローチが可能になります。

アクション:これらのインスタンスの周囲の領域を切り取り、テキスト検出ボックスを外側に拡大して、追加のコンテキストを取得します。これにより、決定を支援するための情報が保存され、エージェントの操作が強化されます。

次のステップ:切り取られた画像に検出ボックスを描画し、エージェントに提示します。これにより、エージェントは、コンテキストのヒントやタスク要件に基づいて、どのインスタンスと相互作用するかを決定できます。

この構造化されたアプローチにより、OCR結果とエージェントの操作の間の相互作用が最適化され、システムの信頼性と適応性が向上します。全体的なプロセスは、以下の図に示すとおりです。

アイコンローカライゼーション

モバイルエージェントフレームワークでは、アイコン検出ツールを実装して、アイコンをクリックする必要があるときに、モバイルスクリーン上のアイコンの位置を特定します。具体的には、フレームワークは、エージェントに、画像の特定の属性(形状や色など)を提供するよう指示し、次に、Grounding DINO方法とプロンプトアイコンを使用して、スクリーンショット内のすべてのアイコンを特定します。最後に、モバイルエージェントは、CLIPフレームワークを使用して、クリック領域の説明と削除されたアイコンの類似性を計算し、類似性が最も高い領域をクリックします。

指示の実行

エージェントがスクリーン上でアクションを実行するために、モバイルエージェントフレームワークでは、8つの異なる操作を定義します。

  • アプリケーションの起動(アプリ名):指定されたアプリケーションをデスクトップインターフェイスから起動します。
  • テキストのタップ(テキストラベル):スクリーン上で「テキストラベル」と表示される部分と相互作用します。
  • アイコンの操作(アイコンの説明、位置):アイコンの属性(色や形など)を指定し、位置(上、下、左、右、または中心など)を選択して、アイコン領域をタップします。
  • テキストの入力(入力テキスト):指定された「入力テキスト」をアクティブなテキストフィールドに入力します。
  • スクロールアップ&ダウン:現在のページのコンテンツを上下にナビゲートします。
  • 戻る:以前のページに戻ります。
  • 閉じる:現在のスクリーンから直接デスクトップに戻ります。
  • 停止:タスクが完了すると操作を終了します。

自己計画

操作の各ステップは、フレームワークによって反復的に実行されます。各反復の開始前に、ユーザーは入力指示を提供し、モバイルエージェントモデルは指示を使用して、プロセス全体のシステムプロンプトを生成します。さらに、各反復の開始前に、フレームワークはスクリーンショットをキャプチャし、それをエージェントに提供します。エージェントは、スクリーンショット、操作履歴、システムプロンプトを観察して、次の操作ステップを出力します。

自己反省

エージェントは、操作中にエラーに遭遇し、コマンドを正常に実行できない場合があります。指示の完了率を高めるために、自己評価アプローチが実装されています。これは、2つの特定の状況下で活性化します。まず、エージェントが不完全または無効なアクションを実行して進捗が停止した場合(たとえば、スクリーンショットが操作後変更されていない場合や、不正なページが表示されている場合)、代替アクションを検討したり、既存の操作のパラメータを調整したりするよう指示されます。二次的に、エージェントは複雑な指示の要素を欠落させる可能性があります。エージェントが初期計画に基づいて一連のアクションを実行した後、エージェントはアクションシーケンス、最新のスクリーンショット、およびユーザーの指示をレビューして、タスクが完了したかどうかを評価するよう指示されます。差異が見つかると、エージェントは指示を満たすために新しいアクションを自律的に生成するよう指示されます。

モバイルエージェント:実験と結果

モバイルエージェントフレームワークの能力を包括的に評価するために、モバイルエバルと呼ばれるベンチマークが導入されました。これには、10個の一般的に使用されるモバイルアプリケーションと、それらのアプリケーション用の3つの指示が含まれています。最初の操作は基本的なアプリケーション操作をカバーし、2番目の操作は最初の操作よりも複雑で追加の要件があり、3番目の操作は最も複雑で、ユーザーが明示的にアプリケーションや操作を指定しない抽象的なユーザー指示を含みます。

さらに、モバイルエージェントフレームワークでは、パフォーマンスをさまざまな観点から評価するために、4つの異なるメトリックが設計および実装されています。

  • 成功(Su)または成功率:モバイルエージェントが指示を完了すると、成功とみなされます。
  • プロセススコア(PS):プロセススコアは、ユーザー指示の実行中の各ステップの精度を測定し、正しいステップの数を総ステップ数で割って計算されます。
  • 相対効率(RE):相対効率スコアは、人間が指示を手動で実行するために必要なステップ数と、エージェントが同じ指示を実行するために必要なステップ数の比率です。
  • 完了率(CR):完了率は、エージェントが人間の操作で成功的に完了したステップ数を、人間が指示を完了するために必要な総ステップ数で割った値です。CRの値は、エージェントが指示を正常に完了した場合に1になります。

結果は以下の図に示されています。

初期の結果では、モバイルエージェントは3つのタスクでそれぞれ91%、82%、82%の完了率を達成しました。すべてのタスクが完璧に実行されたわけではありませんが、各タスクカテゴリの達成率は90%を超えました。さらに、PSメトリックは、モバイルエージェントが3つのタスクすべてで高い精度で正しいアクションを実行する可能性があることを示しています。成功率は約80%でした。さらに、REメトリックによると、モバイルエージェントは人間の最適性に匹敵するレベルの80%の効率で操作を実行することが示されています。これらの結果は、モバイルエージェントのモバイルデバイスアシスタントとしての能力を強調しています。

以下の図は、モバイルエージェントがユーザーの指示を理解し、独立してアクションを計画する能力を示しています。ユーザー指示に明示的な操作の詳細が含まれていない場合でも、モバイルエージェントはユーザーのニーズを巧みに解釈し、それを実行可能なタスクに変換しました。理解に基づいて、エージェントは体系的な計画プロセスを通じて指示を実行しました。

最終的な考え

この記事では、モバイルエージェントについて説明しました。モバイルエージェントは、モバイルアプリケーションのインターフェイス内の視覚的およびテキスト要素を正確に検出および位置付ける視覚認識技術を最初に活用する、自律的なマルチモーダルデバイスエージェントです。この視覚コンテキストを考慮して、モバイルエージェントフレームワークは複雑な操作タスクを自律的に計画および分解し、ステップごとにモバイルアプリケーションをナビゲートします。このフレームワークは、モバイルシステムのメタデータやモバイルアプリケーションのXMLファイルに依存しない点で、既存のソリューションと異なります。これにより、さまざまなモバイルオペレーティング環境で、視覚中心の処理に重点を置いた高度な適応性が可能になります。モバイルエージェントフレームワークで採用されているアプローチは、システム固有のカスタマイズの必要性を排除し、パフォーマンスの向上と計算要件の低減につながります。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。