AIモデルとプラットフォーム

Vertex AIの紹介

mm
Unite.AI を Google の優先ソースに追加

人工知能の急速に進化する環境において、テクノロジー企業が直面する最大の課題の1つは、実験的なものから企業向けのものへの移行です。消費者向けのチャットボットやインタラクティブなプラットフォームは、公共のイメージに役立ちますが、企業はチャットインターフェイスだけでは成功できないため、競争が以前より激化している時代に、企業は堅牢でスケーラブルでセキュアなエコシステムが必要です。これは、GoogleがVertex AI、Google (GOOGL ) Cloudの統一された人工知能および機械学習プラットフォームで提供しようとしているものです。

Vertex AIは、モダンなクラウドインフラストラクチャとのジェネレーティブAI統合のためのバックボーンとしての地位を固めようとしています。生の基礎モデルとプロダクショングレードアプリケーションの間のギャップを埋めるための包括的な機能セットを提供しています。Vertex AIは、大規模な言語モデル(LLM)をラップするものではなく、ジェネレーティブAIをモダンなクラウドインフラストラクチャの第一級市民として扱う統一された機械学習および人工知能(ML/AI)エコシステムです。

Vertex AIの中心には、モデルガーデンがあります。これは、200以上のカーソルされた基礎モデルへのアクセスを提供する中央マーケットプレイスです。Gemini 2.5 Proを含み、2百万トークンのコンテキストウィンドウを特徴としています。この記事では、Vertex AIのアーキテクチャを分析し、モデルガーデンがインテリジェンスの「App Store」としてどのように機能するかを見て、次の世代のエンタープライズソフトウェアのバックボーンとなるこのプラットフォームの技術的柱を調べます。

コアアーキテクチャ:統一されたプラットフォーム

Vertex AIは、ツールの緩い結合ではなく、データとAIの統一されたエコシステムであり、機械学習が今までに抱えていたデータ、ツール、チームの断片化を橋渡しするように設計されています。従来、AIの開発は分離された環境で行われ、時にはデータが複数のリポジトリに分散され、トラップされます。たとえば、組織は顧客データをSQLウェアハウスに保存し、構造化されていないドキュメントをデータレイクにダンプする場合があります。データがシロ化されると、AIは「部分的な真実」しか見えず、エンタープライズの完全なコンテキストが欠如しているため、偏った結果や高いホールユーション率につながる可能性があります。

Vertex AIは、生データの取り込みからBigQueryとCloud Storageへのプロダクション監視まで、ライフサイクル全体を統合しようとしています。つまり、シロ間の「つなぎ目の組織」として機能します。Vertex AIは、Cloud StorageとBigQueryとネイティブに統合されており、AIモデルがExtraction、Transformation、Loadパイプラインを使用せずにデータを取得できるようにします。

基盤:GoogleのAIハイパーコンピューター

Vertex AIのGenAIレイヤーは、GoogleのAIハイパーコンピューター・アーキテクチャの上に構築されています。これは、

TPU v5p & v5e (Tensor Processing Units)

GoogleのTensor Processing Unitsは、ディープラーニングを定義する行列乗算用に特別に設計されたASIC(Application-Specific Integrated Circuit)です。

  • TPU v5p (パフォーマンス):これは、大規模なトレーニング用のフラグシップ・アクセラレータです。各TPU v5pポッドは、Googleの最高帯域幅のInter-Chip Interconnect(ICI)を使用して、8,960チップにスケールできます。テクニカルリーダーにとって、これは、前の世代よりもGPT-3サイズのモデル(175Bパラメータ)を2.8倍高速にトレーニングできることを意味し、市場投入までの時間を大幅に短縮します。
  • TPU v5e (効率):これは、中規模トレーニングと高スループットの推論用に設計されています。最大2.5倍の価格性能を提供し、24/7の推論を大きな予算なく実行する必要があるビジネスにとって、理想的な選択です。

NVIDIA H100/A100 GPUs for Flexibility

TPUは特化しているため、多くの開発チームはNVIDIA CUDAエコシステムに依存しています。Vertex AIは、NVIDIAの最新ハードウェアに対してファーストクラスのサポートを提供しています:

  • NVIDIA H100 (Hopper):最大のオープンソースモデル(Llama 3.1 405Bなど)をファインチューンするために必要な大量のメモリ帯域幅を提供します。
  • Jupiter Networking:Googleは、データセンターのネットワークファブリック「Jupiter」を使用して、「ネットワークボトルネック」を防ぎます。これにより、GPU間でデータがライトニングスピードで移動し、RDMA(Remote Direct Memory Access)をサポートしてCPUオーバーヘッドをバイパスし、分散ノード間で近くにあるようなパフォーマンスを提供します。

ダイナミックオーケストレーション

Vertex AIの最も重要な技術的変化は、ダイナミックオーケストレーションです。レガシーエNVIRONMENTでは、GPUノードが3週間のトレーニング中に故障すると、ジョブ全体がクラッシュする可能性があります。

  • 自動回復性:Vertex AI、Google Kubernetes Engine (GKE)を使用して、「自己回復」ノードを提供します。ハードウェアの故障が検出されると、プラットフォームは自動的にワークロードを正常なノードに移行します。
  • ダイナミックワークロードスケジューラ:このツールにより、チームは、緊急性に基づいて容量を要求できます。Flex Start(安価で、容量が利用可能なときに開始)またはミッションクリティカルなリリースのための保証容量を選択できます。
  • サーバーレストレーニング:インフラストラクチャの管理が不要なチームのために、Vertex AIサーバーレストレーニングにより、コードとデータを提出し、プラットフォームがクラスターを提供し、ジョブを実行し、クラスターを解体します。使用したコンピューティング秒数のみに基づいて請求されます。

3つのエントリーポイント:発見、実験、自動化

さまざまな技術的人物からアプリケーション開発者までを収容するために、Vertex AIは3つの主なエントリーポイントを提供します:

モデルガーデン:発見のためのマーケットプレイス

Google CloudのVertex AIモデルガーデンは、さまざまなビジネスニーズに対して、ファーストパーティ、オープンソース、サードパーティのAIモデルを発見、テスト、カスタマイズ、デプロイするための、Google Cloud内の中央プラットフォームです。これは、Vertex AIのツールとのシームレスな統合を提供する、包括的なライブラリとして機能し、開発者とビジネスが、テキスト生成、画像分析、コード補完などのタスクに適したモデル(大規模な基礎モデルから特殊なモデルまで)を選択し、それらをGoogle Cloud環境内で効率的にデプロイできるようにします。

モデルガーデンは、200以上のモデルを3つの異なる階層に分類し、アーキテクトがパフォーマンス、コスト、コントロールのバランスをとることができます:

  1. ファーストパーティ(Google)モデル:これらは、Vertex AI内で利用可能なフラグシップのマルチモーダルモデルです。Googleは、これらをさまざまなサイズで提供します。Proは複雑な推論を、Flashは低遅延と高ボリュームを提供します。開発者は、ユースケースに応じてモデルを最適化できます。
  2. サードパーティ(プロプライエタリ)モデル:戦略的なパートナーシップを通じて、Vertex AIは、Anthropic(Claude 3.5)やMistral AIなどの「モデルとしてのサービス」(MaaS)へのアクセスを提供します。5つの異なるAIプロバイダーの個別の請求およびセキュリティ資格情報を管理する代わりに、テクニカルチームはすべてを既存のGoogle Cloudプロジェクトを通じてアクセスできます。統一されたAPIフォーマットを使用します。
  3. オープンソース&オープンウェイトモデル:この階層には、MetaのLlama 3.2Mistral、およびGoogleのGemmaが含まれます。これらは、データの最大の分離を保証するために、独自のVPC(仮想プライベートクラウド)内でモデルを自己デプロイしたい組織に最適です。

統一されていない環境では、Llamaのようなオープンソースモデルをデプロイするには、PyTorch環境を設定し、CUDAドライバーを構成し、FlaskまたはFastAPIラッパーを管理する必要があります。

モデルガーデンは、統一されたマネージドエンドポイントを通じて、この「マングリング」段階を排除します:

  • ワンクリックデプロイ:多くのモデルでは、「デプロイ」をクリックすると、必要なTPU/GPUリソースが自動的にプロビジョニングされ、モデルはプロダクションレディなコンテナにラップされ、REST APIエンドポイントが提供されます。
  • Hugging Face統合:Vertex AIは、開発者がHugging Face Hubからモデルを直接Vertexエンドポイントにデプロイできるようにします。利用可能なインテリジェンスをほぼ無限に拡張します。
  • プライベートサービス接続(PSC):高度に規制された業界の場合、モデルはプライベートサービス接続を使用してデプロイできます。モデルエンドポイントは、公衆インターネットに公開されることはありません。データトラフィックは、企業ネットワーク内に厳密に保持されます。

Vertex AIスタジオ:実験のためのプレイグラウンド

モデルガーデンは選択についてですが、Vertex AIスタジオは精度についてです。Vertex AIスタジオは、伝統的なソフトウェアの世界で見られるコンパイラーやデバッガーに相当します。Vertex AIスタジオは、プロンプトエンジニアリング、多モーダルテスト、ハイパーパラメーターターニングの組み合わせを通じて、生のモデルを特定のビジネストゥールに塑成するためのワークスペースです。

多モーダルプロトタイピング:テキストを超えて

スタジオの特徴的な機能の1つは、多モーダリティへのネイティブサポートです。テキスト以外のデータを処理するために、他のプラットフォームでは複雑なコーディングが必要ですが、Vertex AIスタジオでは、インターフェイスにファイルを直接ドロップして、Gemini 2.5の推論能力をテストできます。

  • ビデオインテリジェンス:45分間の技術的なキーノートをアップロードし、モデルに「特定のAPIがいつ言及されるかを特定し、タイムスタンプ付きの要約を提供する」というタスクを依頼できます。
  • ドキュメント分析:テキストを読むだけでなく、モデルは1,000ページのPDFの視覚的なレイアウトを分析し、チャート、表、周囲の文章との関係を理解できます。
  • コード実行:スタジオは、プレイグラウンドでのコード実行をサポートします。モデルに複雑な数学的な問題を解くまたはCSVを分析するように求めると、モデルはセキュアなサンドボックス環境でPythonコードを書き、実行して、検証された答えを提供します。

高度なカスタマイズ:チューニングパス

プロンプトエンジニアリング(ゼロショットまたはファインショット)が天井に達したとき、Vertex AIスタジオは、モデルチューニングという強力なツールを提供します。

  1. 教師ありファインチューニング(SFT):開発者は「プロンプト/レスポンス」ペア(理想的には100以上)のデータセットを提供します。これにより、モデルは特定のブランドの声、出力形式(特殊なJSONなど)、またはドメイン固有のジャーゴンを採用することができます。
  2. コンテキストキャッシング:大規模で静的なデータセット(法的なライブラリやコードベースなど)を扱う企業の場合、スタジオでは、コンテキストキャッシングを使用できます。これにより、モデルに100万トークンのデータを事前にロードしておくことができ、後のクエリでは待ち時間とコストが大幅に削減されます。
  3. 蒸留(ティーチャー・スタディ):これは、高レベルのアーキテクチャーです。大きなモデル(Gemini 2.5 Pro)を使用して、小さいモデル(Gemini 2.0 Flash)を「教える」ことができます。結果として、小さいモデルは「Pro」のレベルでパフォーマンスを発揮しますが、「Flash」の速度とコストで実行されます。

Vertex AIエージェントビルダー:自動化のためのファクトリー

Vertex AIエージェントビルダーは、基礎モデルをエンタープライズデータと外部APIと組み合わせてエージェントを作成するための、高レベルのオーケストレーションフレームワークです。

「真実」のアーキテクチャ:グラウンドとRAG

エンタープライズAIの主な技術的障壁は、ホールユーションです。エージェントビルダーは、グラウンドエンジンを通じてこれを解決します。

  • Google検索によるグラウンド:リアルタイムの世界の知識が必要なクエリ(例:「ニューヨークの現在のモーゲージ金利は何ですか?」)の場合、エージェントはGoogle検索を実行し、事実を抽出し、出典を示します。
  • Vertex AI検索(RAG-as-a-Service):代わりに、開発者は、Vertex AI検索を使用して、独自のドキュメント(PDF、HTML、BigQuery)をインデックスできます。これにより、「チャンキング」、「埋め込み」、「取得」ステップが自動化され、エージェントはあなたの内部「真実の源」に基づいてのみ回答します。
  • Vertex AI RAGエンジン:大規模なカスタム実装の場合、このマネージドサービスは、ベクトルベースとキーワードベースの結果を組み合わせたハイブリッド検索を可能にし、標準的なLLM出力よりも精度を最大30%向上させます。

マルチエージェントオーケストレーション(A2Aプロトコル)

高度なエンタープライズワークフローでは、複数の特殊なエージェントが協力して作業する必要があります。Vertex AIは、エージェント間(A2A)プロトコルを導入します。これは、オープンスタンダードで、

  • 「旅行エージェント」が「財務エージェント」と話し合い、フライトの予約が企業の予算内にあることを確認できるようにします。
  • 相互運用性:オープンプロトコルを使用しているため、Vertex上で構築されたエージェントは、LangChainやCrewAIなどの他のフレームワークで構築されたエージェントと通信できます。

開発者スタック:ADKとエージェントエンジン

「テクノロジープラットフォーム」向けのオーディエンスの場合、エージェントビルダーは2つの異なるパスを提供します:

  1. ノーコードコンソール:ビジネスユーザーのための迅速なプロトタイピングと構成のためのビジュアルドラッグアンドドロップインターフェイス。
  2. エージェント開発キット(ADK):エンジニア向けのコードファーストPythonツールキット。プロンプトとしてコード、バージョン管理の統合、Vertex AIエージェントエンジンへのデプロイを可能にします。セッションの永続性、スケーリング、ステート管理を自動的に処理する、マネージドランタイムです。

結論:「もしも」から「次は何」へ

AIデモからプロダクションレディなエンタープライズアプリケーションへの移行は、デジタル変革プロジェクトの「谷」であり続けてきました。Vertex AIは、データ、インフラストラクチャ、モデルオーケストレーションの断片化されたシロを統一することで、このギャップを埋めるように設計されています。Google Cloudは、Large Language Modelsの生の力から、AIライフサイクルの運用的成熟度への会話を進めてきました。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。