AIモデルとプラットフォーム

SEER: セルフスーパーバイズドコンピュータビジョンモデルのブレークスルー

mm
Unite.AI を Google の優先ソースに追加
SEER Framework for Self Supervised Learning

過去10年間、人工知能(AI)と機械学習(ML)は驚くほどの進歩を遂げてきました。今日、AIとMLは以前よりも正確で効率的で、高性能です。現代のAIとMLモデルは、画像や動画ファイル内のオブジェクトをシームレスに認識できます。また、人間の知能に匹敵するテキストと音声も生成できます。

現在のAIとMLモデルは、ラベル付けされたデータセットでトレーニングすることに大きく依存しています。これらのデータセットは、モデルにテキストブロックを解釈したり、画像や動画フレーム内のオブジェクトを識別したりする方法を教えます。

しかし、AIとMLモデルは完璧ではありません。研究者は、ラベル付けされたデータや注釈付けされたデータに頼るのではなく、与えられた情報から学習できるモデルを構築しようとしています。このアプローチは、セルフスーパーバイズドラーニングと呼ばれ、現在のAIモデルを超えた問題を解決できる「共通感覚」や「背景知識」を持つMLとAIモデルを構築するための最も効率的な方法の1つです。

セルフスーパーバイズドラーニングは、自然言語処理で既に成果を上げており、大規模なモデルを大量のデータでトレーニングすることができます。また、自然言語推論、機械翻訳、質問回答などの分野で多くのブレークスルーをもたらしています。

Facebook (META ) AIによるSEERモデルは、コンピュータビジョン分野でのセルフスーパーバイズドラーニングの能力を最大化することを目指しています。SEERまたはSElf SupERvisedは、100億を超えるパラメータを持つセルフスーパーバイズドコンピュータビジョンラーニングモデルで、適切な注釈やラベル付けなしにインターネット上のランダムな画像グループからパターンを学習できます。

コンピュータビジョンにおけるセルフスーパーバイズドラーニングの必要性

データ注釈またはデータラベル付けは、機械学習および人工知能モデルの開発における前処理ステージです。データ注釈プロセスでは、画像や動画フレームなどの生データを識別し、データのコンテキストをモデルに指定するためにデータにラベルを追加します。これらのラベルにより、モデルはデータで正確な予測を行うことができます。

開発者がコンピュータビジョンモデルで直面する最大の課題の1つは、高品質の注釈付きデータを入手することです。コンピュータビジョンモデルは、オブジェクトを画像で認識するためにこれらのラベル付きデータセットに依存しています。

データ注釈とコンピュータビジョンモデルでのその使用は、以下の課題を提起します:

一貫したデータセット品質の管理

開発者にとって最大の課題は、常に高品質のデータセットにアクセスすることです。高品質のデータセットと適切なラベル付けおよび明確な画像は、より良い学習と正確なモデルにつながります。ただし、高品質のデータセットに常にアクセスすることは独自の課題を伴います。

ワークフォースマネジメント

データラベル付けは、主に大量の非構造化およびラベル付けされていないデータを処理およびラベル付けするために多数の労働者を必要とするため、ワークフォースマネジメントの問題を引き起こします。したがって、開発者はデータラベル付けの際に品質と数量のバランスを取ることが重要です。

財務的制約

おそらく最大の課題は、データラベル付けプロセスを伴う財務的制約です。ほとんどの場合、データラベル付けのコストは、プロジェクト全体のコストの重要な割合を占めます。

データ注釈は、特に大量のトレーニングデータを扱う複雑なモデルを開発する場合、コンピュータビジョン業界の重要な障壁です。コンピュータビジョン業界が複雑で高度なコンピュータビジョンモデルを開発するためにセルフスーパーバイズドラーニングが必要な理由です。

一方、セルフスーパーバイズドラーニングモデルは、ImageNetデータセットで制御された環境で既に優れたパフォーマンスを発揮しています。ただし、これらのモデルは、コンピュータビジョンにおけるセルフスーパーバイズドラーニングの主な条件を満たしていません。任意の無制限データセットまたはランダムな画像から学習し、単に整理されたデータセットのみから学習するのではなく。

理想的に実装されたセルフスーパーバイズドラーニングは、コスト効率が高く実行可能な、より正確でより能力のあるコンピュータビジョンモデルを開発するのに役立ちます。

SEERまたはSElf-supERvisedモデル:紹介

最近のAIおよびML業界の傾向は、セミスーパーバイズド、弱い教師あり、セルフスーパーバイズドラーニングなどのモデルの事前トレーニングアプローチが、ほとんどのディープラーニングモデルのパフォーマンスを大幅に改善できることを示唆しています。

これらのディープラーニングモデルのパフォーマンスの向上に大きく貢献した2つの重要な要素があります。

大量データでの事前トレーニング

大量のデータで事前トレーニングを行うと、通常、より高い精度とパフォーマンスが得られます。大量のデータセットにより、モデルはデータ内のパターンをよりよく理解し、最終的にはモデルが実際のシナリオでよりよく動作するようになります。

GPT-3モデルやWav2vec 2.0モデルなどのトップパフォーマンスモデルの多くは、巨大なデータセットでトレーニングされています。GPT-3言語モデルは、30億以上の単語を持つ事前トレーニングデータセットを使用し、Wav2vec 2.0モデルは、53,000時間以上のオーディオデータを持つデータセットを使用します。

大量の容量を持つモデル

パラメーターの数が多いモデルは、通常、より正確な結果をもたらします。パラメーターの数が多いと、モデルはデータ内の不要なノイズや干渉ではなく、データ内の重要なオブジェクトのみに焦点を当てることができます。

過去に、開発者は、数百万の画像しか含まない小規模なデータセットでセルフスーパーバイズドラーニングモデルをトレーニングすることを試みました。しかし、未ラベル化され、キュレーションされていない大量のデータでトレーニングされたセルフスーパーバイズドラーニングモデルは、高い精度を達成できますか?これは、SEERモデルが答えを出そうとしている質問です。

SEERモデルは、ディープラーニングフレームワークであり、インターネット上の画像を、キュレーションされたデータセットに依存せずに登録することを目的としています。SEERフレームワークでは、開発者は、ランダムなデータで大規模で複雑なMLモデルをトレーニングできます。モデルは、追加の手動入力なしで、データを分析し、パターンまたは情報を独自に学習します。

SEERモデルの最終的な目標は、未キュレーションデータを使用して、転移学習で最先端のパフォーマンスを提供するための事前トレーニング戦略を開発することです。さらに、SEERモデルは、セルフスーパーバイズドな方法で、終わりのないデータストリームから継続的に学習できるシステムを作成することを目指しています。

SEERフレームワークは、インターネットから抽出されたランダムで制約のない画像を使用して、高容量モデルをトレーニングします。画像のメタデータや注釈を使用してモデルをトレーニングしたり、データをフィルタリングしたりすることはありません。最近、セルフスーパーバイズドラーニングは、未キュレーションデータでトレーニングされたモデルが、下流タスクで事前トレーニング済みの教師ありモデルよりも優れた結果をもたらす可能性があることを示しています。

SEERフレームワークとRegNet:つながり

SEERモデルを分析するには、SEERの目標である未キュレーションデータでのセルフスーパーバイズドラーニングの2つの主な理由で、RegNetアーキテクチャに焦点を当てています。

  1. パフォーマンスと効率のバランスを提供します。
  2. スケーラビリティが高く、パラメーターの数をスケールアップできます。

SEERフレームワーク:さまざまな分野からの以前の研究

SEERフレームワークは、未キュレーションまたはラベル付けされていない大規模データセットで大規模なモデルのアーキテクチャをトレーニングするセルフスーパーバイズドラーニングの限界を探ることを目的としています。このモデルは、分野の以前の研究からインスピレーションを得ています。

視覚特徴の無教師事前トレーニング

セルフスーパーバイズドラーニングは、オートエンコーダー、インスタンスレベルの区別、クラスタリングなどの方法を使用して、コンピュータビジョンで既に実装されています。最近、コントラストラーニングを使用する方法は、下流タスクで無教師事前トレーニングされたモデルが、教師ありアプローチよりも優れたパフォーマンスを発揮する可能性があることを示唆しています。

視覚特徴の無教師学習からの主な収穫は、フィルタリングされたデータでトレーニングしている限り、教師ありラベルは不要であるということです。SEERモデルは、大規模なモデルのアーキテクチャを未キュレーション、ラベル付けされていない、ランダムな画像の大量でトレーニングしたときに、正確な表現を学習できるかどうかを探ることを目指しています。

視覚特徴のスケーラブルな学習

以前のモデルは、数百万の画像で弱い教師あり学習、教師あり学習、半教師あり学習を使用した大規模なラベル付けされたデータセットでの事前トレーニングから利益を得ています。さらに、モデル分析は、数十億の画像でモデルを事前トレーニングすることが、スクラッチからトレーニングするよりも優れた精度をもたらすことを示しています。

さらに、モデルのトレーニングを大規模に行うには、ターゲット概念と一致するように画像をフィルタリングするステップが必要です。これらのフィルタリングステップは、事前トレーニング済みクラシファイヤーの予測を使用するか、ImageNetクラスのシノニムであるハッシュタグを使用します。SEERモデルは、事前トレーニングデータを事前にキュレーションして、事前に定義された特徴または概念に一致させることを目的としません。

画像認識のためのアーキテクチャのスケーリング

モデルは、より優れた視覚特徴でトレーニングされることで利益を得ることができます。大量のデータセットで事前トレーニングを行う場合は、特にコントラストラーニングと組み合わせて事前トレーニングを行う場合は、限られた容量のモデルはアンダーフィットしやすいため、アーキテクチャをスケールアップすることが不可欠です。

画像認識の場合、アーキテクチャのスケーリングには、モデルの深さと幅の変更だけでなく、多くの文献が必要です。SEERモデルは、大規模なセルフスーパーバイズドラーニングでRegNetsファミリのモデルを使用することの利点を示しています。

SEER:使用する方法とコンポーネント

SEERフレームワークは、視覚的な表現を学習するために、事前トレーニングのモデルにさまざまな方法とコンポーネントを使用します。SEERフレームワークで使用される主な方法とコンポーネントは、RegNetSwAVです。SEERフレームワークで使用される方法とコンポーネントについて簡単に説明します。

SwAVを使用したセルフスーパーバイズド事前トレーニング

SEERフレームワークは、SwAVと呼ばれるオンラインセルフスーパーバイズドラーニングアプローチで事前トレーニングされています。SwAVは、オンラインクラスタリング方法であり、注釈なしでコンバネットフレームワークをトレーニングするために使用されます。SwAVフレームワークは、同じ画像のさまざまなビュー間で一貫したクラスタ割当てを生成する埋め込みをトレーニングします。

実践では、SwAVフレームワークは、画像のさまざまなビューの機能を、それらの独立したクラスタ割当てを使用して比較します。割当てが同じまたは類似の機能を捉えている場合、1つの画像の割当てを使用して別のビューの機能を予測することができます。

SEERモデルは、Kクラスタのセットを考慮し、各クラスタは、d次元のベクトルvと関連付けられた学習可能なd次元のベクトルvを持ちます。バッチのB画像ごとに、各画像iは、xi1xi2という2つの異なるビューに変換されます。これらのビューは、コンバネットで特徴付けられ、2つの特徴セット(f11、…、fB2)(f12、…、fB2)が生成されます。各特徴セットは、Optimal Transportソルバーを使用して、独立してクラスタプロトタイプに割り当てられます。

Optimal Transportソルバーは、特徴がクラスタ間で均等に分割されることを保証し、すべての表現が単一のプロトタイプにマッピングされるような自明な解決策を回避するのに役立ちます。結果として得られる割当ては、2つのセットの間で交換されます。ビューxi1のクラスタ割当てyi1は、ビューxi2の特徴表現fi2を使用して予測する必要があります。

プロトタイプの重みとコンバネットは、すべての例の損失を最小化するようにトレーニングされます。クラスタ予測損失lは、fとクラスタ割当てのドット積のソフトマックスとの間のクロスエントロピーです。

RegNetY:スケーラブルなモデルファミリー

容量とデータをスケールアップするには、ランタイムとメモリの両方で効率的なアーキテクチャが必要です。RegNetファミリのアーキテクチャは、特にこの目的のために設計されています。

RegNetファミリのアーキテクチャは、各ステージに同一のブロックのシーケンスを含む4つのステージを持つコンバネットで定義され、ブロックの構造は主に残差ボトルネックブロックです。

SEERフレームワークは、RegNetYアーキテクチャに焦点を当てており、標準のRegNetsアーキテクチャにSqueeze-and-Excitationを追加してパフォーマンスを向上させています。さらに、RegNetYモデルには、固定数のFLOPSで適切なインスタンスを検索するのに役立つ5つのパラメーターがあります。SEERモデルは、RegNetYアーキテクチャを直接セルフスーパーバイズド事前トレーニングタスクに実装することで、結果を改善することを目指しています。

RegNetY 256GFアーキテクチャ

SEERモデルは、主にRegNetYファミリのRegNetY 256GFアーキテクチャに焦点を当てており、そのパラメーターはRegNetsアーキテクチャのスケーリングルールを使用します。パラメーターは以下のとおりです。

RegNetY 256GFアーキテクチャには、ステージ幅(528、1056、2904、7392)とステージ深度(2、7、17、1)が含まれており、合計で696百万を超えるパラメーターがあります。512個のV100 32GB NVIDIA GPUでトレーニングすると、バッチサイズが8,704の画像の場合、1イテレーションあたり約6,125ミリ秒かかります。512個のGPUで、バッチサイズ8,704の画像で、100億を超える画像のデータセットをトレーニングするには、114,890イテレーションが必要で、トレーニングには約8日かかります。

大規模な最適化とトレーニング

SEERモデルは、大規模なセルフスーパーバイズド方法を適用して適応させるためのいくつかの調整を提案します。これらの方法は以下のとおりです。

  1. 学習率スケジュール
  2. 1つのGPUあたりのメモリ消費量の削減
  3. トレーニング速度の最適化
  4. 大規模な事前トレーニングデータ

それらについて簡単に説明します。

学習率スケジュール

SEERモデルは、コサイン波の学習率スケジュール固定の学習率スケジュールの2つの学習率スケジュールの可能性を探索します。

コサイン波の学習率スケジュールは、更新数に適応するため、さまざまなモデルを公平に比較するために使用されます。ただし、大規模なトレーニングには適応できないため、トレーニング中の画像に異なる重みを付けて、完了した更新に基づいてスケジューリングを行います。

固定の学習率スケジューリングでは、学習率が固定のままになります。損失が非減少的になるまで、学習率が2で割られます。分析によると、固定の学習率スケジューリングが機能し、トレーニングをより柔軟にします。ただし、SEERモデルは、最大のモデルであるRegNet 256GFをトレーニングするために、コサイン波の学習率を使用します。

1つのGPUあたりのメモリ消費量の削減

モデルは、トレーニング期間中に必要なGPUの数を削減するために、混合精度とグラデーション チェックポイントを使用します。モデルは、NVIDIA Apex LibraryのO1最適化レベルを使用して、16ビット浮動小数点精度で、畳み込みやGEMMなどの演算を実行します。

さらに、モデルはPyTorchの勾配チェックポイントの実装を使用して、計算とメモリをトレードします。さらに、モデルは、フォワードパスの間に生成された中間的な活性化を破棄し、バックワードパスではこれらの活性化を再計算します。

トレーニング速度の最適化

混合精度を使用してメモリ使用量を最適化することは、メモリ帯域幅のボトルネックを改善することでトレーニング期間を高速化することにもなります。FP16のサイズがFP32よりも小さいため、アクセラレータはFP16のサイズの削減を活用して、FP32と比較してスループットを向上させます。

SEERモデルは、BatchNormレイヤーをGPU間で同期して、プロセス グループを作成し、グローバル同期に比べて時間がかかるため、プロセス グループのサイズが64の同期を使用します。最後に、SEERモデルは、PyTorchのデータ ローダーと比較して、より多くのトレーニング バッチを事前にフェッチするデータ ローダーを使用します。

大規模な事前トレーニングデータ

SEERモデルは、事前トレーニングに100億を超える画像を使用し、インターネットやInstagramからランダムに画像を直接サンプリングするデータ ローダーを考慮します。SEERモデルは、これらの画像をオンラインでトレーニングし、事前処理やデュプリケーション、ハッシュタグ フィルタリングなどのプロセスで画像をキュレーションしません。

データセットは静的ではなく、データセット内の画像は3か月ごとに更新されます。ただし、データセットを更新してもモデルのパフォーマンスに影響しません。

SEERモデルの実装

SEERモデルは、SwAVを使用して、6つの画像あたり6つのクロップを使用して、各画像の解像度が2×224 + 4×96であるRegNetY 256GFを事前トレーニングします。事前トレーニング中、モデルは、10444×8192、8192×8192、8192×256の次元の3層のMLPまたは多層パーセプトロンを使用します。

ヘッドにバッチ正規化レイヤーを使用するのではなく、SEERモデルは16,000のプロトタイプを使用し、温度tを0.1に設定します。Sinkhorn正則化パラメーターは0.05に設定され、アルゴリズムは10回のイテレーションを実行します。モデルはさらに、GPU間でバッチ正規化の統計を同期し、同期のためのプロセス グループのサイズが64である多数のプロセス グループを作成します。

さらに、モデルは、重み減算が10^(-5)であるLARSまたはレイヤーごとの適応型学習率スケーリング、活性化のチェックポイント、およびO1混合精度最適化を使用します。モデルは、バッチサイズが8,704のランダム画像を使用して、512個のNVIDIA GPUで確率的勾配降下法によってトレーニングされます。

学習率は、最初の8,000トレーニング更新で0.15から9.6まで線形に増加します。ウォームアップの後、モデルは、0.0096まで減少するコサイン学習率スケジュールに従います。全体として、SEERモデルは、100億を超える画像で、122,000イテレーションを経てトレーニングされます。

SEERフレームワーク:結果

セルフスーパーバイズド事前トレーニングアプローチによって生成された特徴の品質は、さまざまなベンチマークと下流タスクで調査および分析されます。モデルは、下流タスクの画像とそのラベルへのアクセスが制限されている低ショット設定も考慮します。

大規模事前トレーニング済みモデルのファインチューニング

SEERモデルは、ImageNetベンチマークを使用して、ランダムデータで事前トレーニングされたモデルの品質を測定します。結果は、以下のパラメータで決定されます。

実験設定

SEERモデルは、SwAVを使用して、100億以上のランダムでパブリックなInstagram画像で、6つの異なる容量のRegNetアーキテクチャ、RegNetY- {8、16、32、64、128、256}GFを事前トレーニングします。モデルの事前トレーニングは、1,280万以上の標準的なトレーニング画像と50,000以上の評価画像を使用して、ImageNetで行われます。

SEERモデルは、SwAVと同じデータ増強テクニックを適用し、35エポックでSGDオプティマイザまたは確率的勾配降下法を使用してファインチューニングし、バッチサイズ256、学習率0.0125(30エポック後に10で割り、モーメントム0.9、重み減算10^(-4))を使用します。SEERモデルは、224×224の中心のクロップを使用して、バリデーション データセットでトップ1の精度を報告します。

他のセルフスーパーバイズド事前トレーニングアプローチとの比較

以下の表では、RegNetY-256GFを使用したSEERモデルの最大事前トレーニング済みモデルが、セルフスーパーバイズド事前トレーニングを使用する既存の事前トレーニング済みモデルと比較されます。

SEERモデルは、ImageNetで84.2%のトップ1の精度を達成し、SimCLRv2を1%上回り、最も優れた既存の事前トレーニング済みモデルを上回ります。

さらに、以下の図では、SEERフレームワークが、RegNetフレームワークとSwAVを組み合わせたさまざまな容量のモデルと比較されます。RegNetフレームワークとSwAVを組み合わせたモデルは、容量に関係なく、事前トレーニングで優れた結果をもたらします。

SEERモデルは、ランダムな画像で事前トレーニングされ、RegNetアーキテクチャとSwAVのセルフスーパーバイズドラーニング方法を使用します。SEERモデルは、SimCLRv2とViTモデルと比較され、さまざまなネットワーク アーキテクチャを使用します。最後に、SEERモデルはImageNetデータセットでファインチューニングされ、トップ1の精度が報告されます。

モデルの容量の影響

モデルの容量は、事前トレーニングのパフォーマンスに大きな影響を与えます。以下の図は、事前トレーニングとスクラッチからのトレーニングの両方でモデルの容量の影響を比較しています。

事前トレーニング済みモデルのトップ1の精度スコアは、スクラッチからのトレーニングでトレーニングされたモデルよりも高いことがわかります。パラメーターの数が増えるにつれて、差はさらに大きくなります。パラメーターの数が増えることで、事前トレーニング済みモデルとスクラッチからのトレーニング モデルの両方が利益を得ますが、大規模なパラメーターの影響は事前トレーニング済みモデルに大きいです。

スクラッチからのトレーニングでオーバーフィットが発生する可能性のある理由は、ImageNetデータセットのサイズが小さいためです。

低ショット学習

低ショット学習とは、下流タスクで画像とそのラベルへのアクセスが制限されているシナリオでSEERモデルのパフォーマンスを評価することを指します。

実験設定

SEERフレームワークは、低ショット学習のために2つのデータセット、Places205ImageNetを使用します。さらに、SEERモデルは、下流タスクで画像とそのラベルへのアクセスが制限されていることを仮定します。この設定は、セルフスーパーバイズドラーニングの既定の設定と異なります。既定の設定では、モデルはデータセットへのアクセスは制限されませんが、画像のラベルへのアクセスのみが制限されます。

Places205データセットの結果

以下の図は、Places205データセットのさまざまな部分で事前トレーニングされたモデルのパフォーマンスを示しています。

SEERモデルは、同じRegNetY-128 GFアーキテクチャを使用して、Places205データセットで監督下で事前トレーニングされたモデルと比較されます。結果は驚くべきものです。Places205データセットでファインチューニングするために使用可能なトレーニング データの割合に関係なく、SEERモデルのトップ1の精度が約2.5%高くなっていることがわかります。

監督付き事前トレーニングとセルフスーパーバイズド事前トレーニングの間の差は、トレーニング データの性質の違いを考えると説明できます。セルフスーパーバイズドで事前トレーニングされたモデルから学習された特徴は、シーンを分類するのに適している可能性があります。さらに、Places205のような不均衡なデータセットで事前トレーニングすることは、基礎となる概念の非均衡な分布のため、利点となる可能性があります。

ImageNetの結果

上の表は、SEERモデルのアプローチと、ImageNetで事前トレーニングされたすべての1.2百万の画像で事前トレーニングされたセルフスーパーバイズド事前トレーニングアプローチ、および半教師ありアプローチと比較しています。SEERモデルのアプローチは、ImageNetデータセットの画像の1%から10%のみを表示します。

ネットワークが同じ分布からの画像をより多く見た場合、これらのアプローチは大幅に利益を得ます。ただし、SEERモデルはImageNetデータセットの1%から10%のみを表示するにもかかわらず、約80%のトップ1の精度を達成し、上記の表に示されているアプローチの精度に近づいています。

モデルの容量の影響

以下の図は、1%、10%、100%のImageNetデータセットで低ショット学習におけるモデルの容量の影響を示しています。

モデルの容量を増やすと、データセットとラベルの両方へのアクセスが制限されている場合に、精度が向上することがわかります。

他のベンチマークへの転送

SEERモデルのパフォーマンスをさらに評価するために、事前トレーニングされた特徴を他の下流タスクに転送します。

画像分類の線形評価

上の表は、SEERの事前トレーニング済みRegNetY-256GFとRegNetY128-GFの特徴を、ImageNetデータセットで事前トレーニングされた同じアーキテクチャと比較します。特徴の品質を評価するために、モデルは凍結され、下流タスクのトレーニングセットの上に線形分類器が使用されます。プロセスでは、以下のベンチマークが考慮されます。Open-ImagesiNaturalistPlaces205Pascal VOC

検出とセグメンテーション

以下の図は、検出とセグメンテーションでの事前トレーニング済み特徴の比較を示しています。

SEERフレームワークは、事前トレーニング済みのRegNetY-64GFとRegNetY-128GFをビルディング ブロックとして使用して、COCOベンチマークでMask-RCNNモデルをトレーニングします。アーキテクチャと下流タスクの両方で、SEERのセルフスーパーバイズド事前トレーニングアプローチは、教師ありトレーニングを1.5から2APポイント上回ります。

弱い教師あり事前トレーニングとの比較

インターネット上のほとんどの画像には、メタ データ、alt テキスト、説明、または地理座標などのテキスト メタ データが付随しています。これらのメタ データは、事前トレーニング中に利点をもたらす可能性があります。以前の研究は、キュレーションされたセットのハッシュ タグを予測することで、視覚的な特徴の品質を向上させることができることを示しています。ただし、このアプローチでは、画像をフィルタリングする必要があり、テキスト メタ データが存在する場合にのみ機能します。

以下の図は、ResNetXt101-32dx8dアーキテクチャを、ランダムな画像でトレーニングしたものと、ラベル付けされた画像でトレーニングしたもの(メタ データ付き)と比較しています。

SEERフレームワークは、事前トレーニング中にメタ データを使用しないにもかかわらず、メタ データを使用して事前トレーニングされたモデルと比較可能な精度を達成します。

削減研究

削減研究は、モデルの全体的なパフォーマンスに特定のコンポーネントが与える影響を分析するために実行されます。削減研究は、コンポーネントを完全に削除して、モデルのパフォーマンスを理解することで実行されます。これにより、開発者はコンポーネントがモデルのパフォーマンスに与える影響についての概要を得ることができます。

モデルのアーキテクチャの影響

モデルのアーキテクチャは、特にモデルのスケーリングや事前トレーニング データの仕様が変更されたときに、モデルのパフォーマンスに大きな影響を与えます。

以下の図は、モデルのアーキテクチャを変更したときの事前トレーニングされた特徴の品質の影響を、ImageNetデータセットの線形評価で示しています。評価は、モデルがスクラッチからImageNetデータセットでトレーニングされたときに高い精度を返すことに偏りがないことを確認するために直接行われます。

ResNeXtsとResNetアーキテクチャの場合、ペナルティティ レイヤーからの特徴が現在の設定で機能することがわかります。RegNetアーキテクチャは他のアーキテクチャを上回ります。

全体として、モデルの容量を増やすと、パフォーマンスが向上することがわかります。パフォーマンスの向上は、モデルのパフォーマンスに大きな影響を与えるため、対数的に得られます。

事前トレーニングデータのスケーリング

モデルのトレーニングに大規模なデータセットを使用することで、視覚的な特徴の品質を向上させる2つの主な理由があります。ユニークな画像とパラメーターの増加です。モデルのパフォーマンスにどのように影響するかを見てみましょう。

ユニークな画像の数の増加

上の図は、同じ数のパラメータを持つ2つの異なるアーキテクチャ、RegNet8とRegNet16を比較し、異なる数のユニークな画像でトレーニングされています。SEERフレームワークは、1エポック相当の更新に対して100億の画像、または32エポック相当の更新に対して32のユニークな画像でモデルをトレーニングし、1つの半波長のコサイン学習率を使用します。

モデルのパフォーマンスが良好であるためには、モデルの入力として使用されるユニークな画像の数が高いことが理想的です。この場合、モデルのパフォーマンスは、ImageNetデータセット内の画像よりも多くのユニークな画像でトレーニングされたときに良好です。

より多くのパラメータ

以下の図は、RegNet-128GFアーキテクチャを使用して100億の画像でトレーニングされたモデルのパフォーマンスを示しています。モデルのパフォーマンスは、パラメータの数が増えるにつれて着実に増加することがわかります。

現実世界でのセルフスーパーバイズドコンピュータビジョン

ここまで、コンピュータビジョンにおけるセルフスーパーバイズドラーニングとSEERモデルの理論的な側面について説明しました。ここで、現実世界のシナリオでセルフスーパーバイズドコンピュータビジョンがどのように機能するか、SEERモデルの将来性について見てみましょう。

SEERモデルは、自然言語処理業界で行われている仕事に匹敵するものです。ここでは、高度な最先端モデルは、事前トレーニングのために数十億のデータセットと数十億のパラメータを使用します。パフォーマンスは、モデルのトレーニングに使用される入力データの数が増えるにつれて、一般的に増加します。コンピュータビジョンタスクも同様です。

ただし、自然言語処理にセルフスーパーバイズドラーニングを使用することは、コンピュータビジョンにセルフスーパーバイズドラーニングを使用することとは異なります。テキストの場合、意味的な概念は通常、離散的な単語に分解されますが、画像の場合、モデルはどのピクセルがどの概念に属するかを決定する必要があります。

さらに、画像にはさまざまなビューがあり、複数の画像に同じオブジェクトが存在する場合でも、概念は大きく異なる可能性があります。たとえば、猫の画像のデータセットを考えてみましょう。主なオブジェクトである猫はすべての画像に共通ですが、概念は大きく異なる可能性があります。1つの画像では猫が静止しているかもしれませんが、別の画像ではボールで遊んでいるかもしれません。画像は概念が大きく異なることが多いため、モデルは同じ概念の違いを理解するために多くの画像を見なければなりません。

高次元で複雑な画像データでモデルをスケーリングするには、2つのコンポーネントが必要です。

  1. 視覚的な概念を大規模な画像データセットから学習できる十分な大きさのコンバニューショナル ニューラル ネットワーク (CNN) です。
  2. ラベル付け、注釈付け、またはメタデータなしで大量の画像からパターンを学習できるアルゴリズムです。

SEERモデルは、これらのコンポーネントをコンピュータビジョンの分野に適用することを目的としています。SEERモデルは、オンライン クラスタリングを使用して画像をペアまたはグループ化することで、視覚的な概念の類似性を活用してパターンをよりよく識別できる、SwAVというセルフスーパーバイズド ラーニング フレームワークの進歩を利用することを目指しています。

SwAVアーキテクチャを使用すると、SEERモデルは、コンピュータビジョンにおけるセルフスーパーバイズドラーニングをより効果的に使用でき、トレーニング時間を最大6倍短縮できます。

さらに、100億を超える画像でモデルをトレーニングするには、実行時間とメモリの両方で効率的なアーキテクチャが必要です。これが、RegNetモデルが重要となる理由です。RegNetモデルは、ConvNetsモデルであり、数兆のパラメータをスケールアップでき、メモリ制限と実行時間の規制に従って最適化できます。

結論:セルフスーパーバイズドな未来

セルフスーパーバイズドラーニングは、AIとML業界で話題となっている重要な概念です。セルフスーパーバイズドラーニングにより、AIモデルは、慎重にキュレーションおよびラベル付けされたデータセットに頼るのではなく、インターネット上でランダムに利用可能な大量のデータから直接情報を学習できます。

セルフスーパーバイズドラーニングは、AIとMLの将来にとって重要な概念です。セルフスーパーバイズドラーニングは、現実世界のシナリオに適応し、特定の目的ではなく、多くのユースケースを持つAIモデルを開発する可能性があります。SEERモデルは、コンピュータビジョン業界におけるセルフスーパーバイズドラーニングの実装における重要なマイルストーンです。

SEERモデルは、コンピュータビジョン業界の変革の第一歩を踏み出し、ラベル付けされたデータセットへの依存を減らすことを目指しています。SEERモデルは、データセットの注釈付けの必要性を排除することで、開発者が多様で大量のデータで作業できるようにすることを目指しています。SEERモデルの実装は、画像やメタデータが限られている医療業界のような分野で作業する開発者にとって特に役立ちます。

さらに、人間の注釈を排除することで、開発者はモデルをより迅速に開発および展開でき、急速に進化する状況に迅速かつ正確に応答できるようになります。

Kunal Kejriwal は、Python、PostgreSQL、Redis、そして GCP と AWS のクラウドインフラストラクチャを専門とするバックエンドエンジニアです。3 年間にわたり本番システムの構築とスケーリングを経験しており、AI インフラストラクチャ、分散システム、機械学習ワークロードのデプロイに関するアーキテクチャについて執筆しています。