AIモデルとプラットフォーム

ウーバーのファイバーは、新しい分散型AIモデルトレーニングフレームワークです

mm
Unite.AI を Google の優先ソースに追加

VentureBeatによると、ウーバーのAI研究者は最近、Arxivに論文を投稿し、分散型AIモデルを作成するための新しいプラットフォームを発表しました。このプラットフォームはファイバーと呼ばれ、強化学習タスクと集団ベースの学習の両方を駆動することができます。ファイバーは、大規模な並列計算を非専門家にもアクセス可能にすることで、分散型AIアルゴリズムとモデルの力を活用できるように設計されています。

ファイバーは最近、GitHubでオープンソース化され、Python 3.6以上、Linuxシステム上のKubernetes、クラウド環境で動作します。研究者チームによると、このプラットフォームは、数百または数千の個別のマシンに簡単にスケールアップすることができます。

ウーバーの研究者チームは、最近の最も重要なAIの進歩は、大規模なモデルと分散トレーニング技術を使用してトレーニングされたアルゴリズムによって推進されたと説明しています。しかし、集団ベースのモデルと強化学習モデルを作成することは、効率と柔軟性の問題があるため、分散トレーニング方式では依然として困難なタスクです。ファイバーは、クラスタ管理ソフトウェアと動的スケーリングを組み合わせて、分散システムをより信頼性と柔軟性の高いものにします。

ファイバーは、3つの異なるコンポーネントで構成されています。API、バックエンド、クラスターレイヤーです。APIレイヤーでは、ユーザーはキュー、マネージャー、プロセスを作成できます。ファイバーのバックエンドレイヤーでは、ユーザーは異なるクラスタによって管理されるジョブを作成および終了できます。クラスターレイヤーでは、個々のクラスタとそのリソースを管理し、ファイバーが追跡する必要がある項目の数を大幅に増やします。

ファイバーでは、ジョブをキューに登録してローカルマシンまたは複数のマシンでリモート実行できます。ジョブバックプロセスの概念を使用し、コンテナを使用して入力データと依存パッケージを自己完結型にします。ファイバーのフレームワークには、ワーカーがクラッシュした場合に迅速に復元できる組み込みのエラーハンドリングも含まれています。ファイバーはこれらすべてを実行しながら、クラスタマネージャーと相互作用し、ファイバーのアプリケーションがコンピュータークラスター上で通常のアプリケーションのように実行されるようにします。

実験結果は、ファイバーの平均レスポンスタイムが数ミリ秒で、2,048個のプロセッサコア/ワーカーで構築された場合、ベースラインのAI技術よりもスケールアップが良かったことを示しています。ジョブを完了するのに必要な時間は、ワーカーの数が増加するにつれて徐々に減少しました。IPyParallelは約1400秒で50回のトレーニングを完了しましたが、ファイバーは512個のワーカーで約50秒で同じ50回のトレーニングを完了しました。

ファイバーの論文の共同著者は、説明しています。ファイバーは、以下のような複数の目標を達成することができます。

「私たちの研究は、ファイバーが多くの目標を達成していることを示しています。異種の大量のコンピューティングハードウェアを効率的に活用し、アルゴリズムを動的にスケーリングしてリソースの使用効率を向上させ、強化学習と集団ベースのアルゴリズムをコンピュータークラスターで動作させるために必要なエンジニアリングの負担を減らし、さまざまなコンピューティング環境に迅速に適応して研究効率を向上させることです。私たちは、これが強化学習の問題を解決するための進歩をさらに促進し、強化学習アルゴリズムと集団ベースの方法を開発して必要なスケールでトレーニングすることを容易にすることで、真の力を発揮できることを期待しています。」

ブログ作家およびプログラマーで、 Machine Learning Deep Learning のトピックを専門としています。Danielは、AIの力を社会のために利用する手助けを他者に与えることを希望しています。