AIモデルとプラットフォーム

視覚的自己回帰モデル:スケーラブルな画像生成を実現する次のスケール予測

mm
Unite.AI を Google の優先ソースに追加

GPTモデルやその他の大規模な自己回帰型言語モデル(AR)が登場し、機械学習と人工知能の分野に新たな時代をもたらした。GPTモデルや自己回帰モデルは、一般的な知能と汎用性を示し、一般的な人工知能(AGI)への重要なステップとみなされている。しかし、これらの大規模モデルには、自己教師あり学習戦略を使用してシーケンス内の次のトークンを予測するという、単純ながら有効な戦略がある。最近の研究では、これらの大規模な自己回帰モデルの成功が示され、汎用性とスケーラビリティが強調されている。スケーラビリティは、モデルのパフォーマンスを小さなモデルのパフォーマンスから予測することを可能にする既存のスケーリング法の典型的な例であり、リソースのより良い割り当てにつながる。一方、ゼロショット学習、ワンショット学習、ファーショット学習などの学習戦略によって汎用性が実証され、未学習モデルがさまざまなタスクに適応する能力が示されている。汎用性とスケーラビリティは、自己回帰モデルの大規模な未ラベル化データから学習する潜在能力を示唆している。

同様に、この記事では、Visual AutoRegressive(VAR)フレームワークについて説明する。このフレームワークは、画像の自己回帰学習を「次の解像度予測」または「次のスケール予測」という新しいパターンで再定義する。VARモデルのアプローチは、自己回帰トランスフォーマーが視覚的な分布をよりよく学習できるようにし、汎用性を向上させる。さらに、VARモデルの実験結果は、VARフレームワークが自己回帰ベースラインを大幅に改善し、Diffusion Transformer(DiT)フレームワークをデータ効率、画像品質、スケーラビリティ、推論速度などの多くの面で上回っていることを示している。また、VARモデルのスケーリングは、言語モデルの場合と同様のパワーローのスケーリング法則を示し、ダウンストリームタスク(編集、インペイント、オウトペイント)におけるゼロショットの汎用性を示している。

この記事では、VARフレームワークのメカニズム、方法論、建築について深く掘り下げ、最先端のフレームワークとの比較について説明する。また、VARフレームワークがLLMの2つの重要な特性、つまりスケーリング法則とゼロショット汎用性を示す方法についても説明する。

視覚的自己回帰モデル:スケーラブルな画像生成

最近の言語モデルの共通のパターンは、自己教師あり学習戦略の実装であり、シーケンス内の次のトークンを予測する単純ながら有効なアプローチである。これにより、自己回帰モデルと大規模な言語モデルは、スケーラビリティと汎用性を示し、未ラベル化データから学習する潜在能力を示唆している。さらに、コンピュータビジョンの分野の研究者は、自己回帰モデルやワールドモデルを開発して、スケーラビリティと汎用性を向上させている。DALL-EやVQGANなどのモデルは、画像生成の分野で自己回帰モデルの潜在能力を示している。これらのモデルは、視覚的なトークナイザーを使用して、連続的な画像を2Dトークンのグリッドに表現し、それを1Dシーケンスに平坦化して自己回帰学習を行う。

しかし、研究者はまだこれらのモデルのスケーリング法則を探索しており、さらに、これらのモデルのパフォーマンスは拡散モデルよりも大幅に低いことが示されている。次の画像に示すように、パフォーマンスのギャップは、自己回帰モデルの能力が言語モデルの場合と比較して未探索であることを示唆している。

一方で、従来の自己回帰モデルはデータの明確な順序を必要とするが、VARモデルは画像の順序を再考し、これがVARを既存の自己回帰法と区別する。人間は、グローバルな構造からローカルな詳細まで、階層的に画像を作成または認識するため、画像には自然な順序がある。さらに、多スケール設計からインスピレーションを得たVARフレームワークは、自己回帰学習を次のトークン予測ではなく次のスケール予測として定義する。VARフレームワークのアプローチは、画像を多スケールトークンマップにエンコードすることから始まる。次に、1×1トークンマップから解像度を進めて、各ステップで、トランスフォーマーはすべての前のトークンマップに条件付けて次の高解像度トークンマップを予測する。

VARフレームワークは、GPT-2のトランスフォーマーアーキテクチャを視覚的な自己回帰学習に活用し、ImageNetベンチマークでARベースラインを大幅に改善し、FID 1.80、インセプションスコア356を達成し、推論速度を20倍に向上させている。さらに、VARフレームワークは、FIDおよびISスコア、スケーラビリティ、推論速度、データ効率でDiTフレームワークを上回っている。また、VARモデルのスケーリングは、言語モデルの場合と同様のパワーローのスケーリング法則を示している。

VARフレームワークは、以下の点で貢献することを目指している。

  1. 多スケール自己回帰アプローチを使用する新しい視覚的な生成フレームワークを提案し、従来の次のトークン予測ではなく次のスケール予測を使用する。
  2. 自己回帰モデルとゼロショット汎用性のスケーリング法則を検証し、LLMの魅力的な特性を模倣する。
  3. 視覚的な自己回帰モデルを大幅に改善し、GPTスタイルの自己回帰フレームワークが初めて拡散モデルを上回る画像生成パフォーマンスを実現する。

さらに、既存のパワーローのスケーリング法則についても議論することが重要である。これらの法則は、データセットサイズ、モデルのパラメータ、パフォーマンスの改善、計算リソースの関係を数学的に記述する。まず、これらのスケーリング法則は、モデルのサイズ、計算コスト、データサイズをスケールアップすることで、より大きなモデルのパフォーマンスを予測することを可能にする。二つ目に、スケーリング法則は、パフォーマンスの改善が一貫して飽和しない増加を示している。言語モデルのスケーリング法則の原則に基づいて、LLMはモデルのスケールを増やすことでパフォーマンスの改善をもたらすことがわかっている。ゼロショット汎用性は、特にLLMが明示的にトレーニングされていないタスクを実行する能力を指す。コンピュータビジョンの分野では、ゼロショットおよびコンテキスト内学習の能力を持つ基礎モデルを構築することに興味がある。

言語モデルは、WordPieceアルゴリズムまたはバイトペアエンコーディングアプローチを使用してテキストをトークナイズする。視覚的な生成モデルも、2D画像を1Dトークンシーケンスにエンコードするために、同じアプローチを使用する。VQVAEなどの初期の研究は、画像を離散的なトークンに表現する能力を示した。VQVAEの後継であるVQGANフレームワークは、知覚的な損失と敵対的な損失を組み込んで画像の忠実度を向上させ、標準的なラスタースキャン自己回帰方式で画像トークンを生成するために、デコーダーのみのトランスフォーマーを使用した。拡散モデルは、長年にわたって視覚的な生成タスクで最も優れたものとみなされてきたが、サンプリング技術の改善、建築上の改善、高速化サンプリングに重点が置かれている。潜在的な拡散モデルは、潜在的な空間に拡散を適用して、トレーニング効率と推論を向上させる。拡散トランスフォーマーモデルは、従来のU-Netアーキテクチャをトランスフォーマーに置き換え、最近の画像またはビデオ生成モデルに使用されている。

視覚的自己回帰:方法論とアーキテクチャ

VARフレームワークの核となる部分は、2つの離れたトレーニングステージがある。最初のステージでは、多スケール量子化オートエンコーダー(VQVAE)が画像をトークンマップにエンコードし、複合的な再構成損失がトレーニングのために実装される。上の図では、埋め込みは、離散的なトークンを連続的な埋め込みベクトルに変換することを定義するために使用される用語である。2番目のステージでは、VARモデルのトランスフォーマーは、次のスケール予測アプローチを使用して、クロスエントロピー損失を最小化または尤度を最大化するためにトレーニングされる。トレーニングされたVQVAEは、VARフレームワークのトークンマップのグラウンドトゥルースを生成する。

次のトークン予測を使用した自己回帰モデル

与えられた離散的なトークンのシーケンスでは、各トークンはサイズVの語彙から得られる整数である。次のトークンの自己回帰モデルは、現在のトークンの確率はそのプレフィックスのみに依存することを示唆する。単方向のトークン依存性を仮定することで、VARフレームワークはシーケンスの確率を条件付き確率の積に分解できる。自己回帰モデルのトレーニングには、モデルをデータセット全体で最適化する必要があり、これは次のトークン予測と呼ばれるプロセスである。これにより、トレーニングされたモデルは新しいシーケンスを生成できる。さらに、画像は2Dの連続信号であるため、次のトークン予測の最適化プロセスを使用して画像に自己回帰モデリングを適用するには、いくつかの前提条件が必要である。まず、画像を離散的なトークンにトークナイズする必要がある。通常、画像の特徴マップを離散的なトークンに変換するために、量子化オートエンコーダーが使用される。二つ目に、自己回帰モデリングのためにトークンの1D順序を定義する必要がある。

離散的なトークンは2Dグリッドに配置され、自然言語の文が左から右に順序付けられているのと異なり、画像のトークンの順序は明示的に定義する必要がある。以前の自己回帰アプローチでは、2Dグリッドの離散的なトークンを1Dシーケンスに平坦化するために、行優先のラスタースキャン、Zカーブ、またはスパイラル順序などの方法を使用した。離散的なトークンが平坦化された後、ARモデルはデータセットからシーケンスのセットを抽出し、次のトークン予測を使用して、T個の条件付き確率の積としての尤度を最大化するために自己回帰モデルをトレーニングした。

次のスケール予測を使用した視覚的自己回帰モデル

VARフレームワークは、画像の自己回帰モデリングを次のトークン予測ではなく次のスケール予測アプローチで再定義する。モデルはまず、画像を多スケールトークンマップに量子化し、各マップの解像度は前のマップよりも高く、元の特徴マップの解像度に一致する。さらに、VARフレームワークは、VAR学習のために必要な多スケールトークンマップへの画像のエンコードのために、新しい多スケール量子化エンコーダーを開発する。VARフレームワークは、VQGANと同じアーキテクチャを使用するが、多スケール量子化層が変更されている。アルゴリズムは次の画像に示されている。

視覚的自己回帰:結果と実験

VARフレームワークは、vanilla VQVAEアーキテクチャを使用し、多スケール量子化スキームにK個の追加の畳み込みを使用し、すべてのスケールで共有コードブックを使用し、潜在的な次元を32に設定する。主な焦点は、VARアルゴリズムにあり、モデルアーキテクチャの設計はシンプルながら有効である。フレームワークは、GPT-2モデルに実装されている標準的なデコーダーのみのトランスフォーマーと同じアーキテクチャを採用し、唯一の変更は、従来の層の正規化を適応正規化(AdaLN)に置き換えることである。クラス条件付き合成の場合、VARフレームワークは、クラス埋め込みを開始トークンとして実装し、適応正規化層の条件としても使用する。

最先端の画像生成結果

VARフレームワークは、既存の生成フレームワーク(GAN、BERTスタイルのマスク予測モデル、拡散モデル、GPTスタイルの自己回帰モデル)と比較して、以下の表に示すように、有望な結果を示している。

VARフレームワークは、FIDとISスコアの両方で最高の結果を示しており、さらに、画像生成の速度も最先端のモデルと比較して優れている。また、VARフレームワークは、精度と再現率のスコアも満足のいく結果を示しており、セマンティック的一貫性を示している。しかし、驚くべきことは、VARフレームワークが伝統的なAR能力タスクで優れた結果を示し、初めて拡散トランスフォーマーモデルを上回ったことである。次の表に示すように。

ゼロショットタスク汎用性結果

インペイントとアウトペイントタスクの場合、VARフレームワークはマスク外のグラウンドトゥルーストークンを教師強制し、モデルはマスク内のトークンのみを生成し、クラスラベル情報はモデルに注入されない。結果は次の画像に示されており、VARモデルはダウンストリームタスクで十分な結果を達成し、パラメータを調整したりネットワークアーキテクチャを変更したりすることなく、VARフレームワークの汎用性を示している。

最終的な考え

この記事では、VARフレームワークについて説明し、従来の自己回帰モデルに存在する問題を解決し、GPTスタイルの自己回帰フレームワークが初めて拡散モデルを上回る画像生成パフォーマンスを実現することを目指している。VARフレームワークは、次のスケール予測アプローチを使用して、画像の自己回帰モデリングを再定義する。VARモデルのスケーリングは、言語モデルの場合と同様のパワーローのスケーリング法則を示し、ダウンストリームタスク(編集、インペイント、アウトペイント)でゼロショット汎用性を示している。これらのスケーリング法則とゼロショット汎用性の可能性は、LLMの特性であり、VARトランスフォーマーモデルで初めて検証された。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。