AIモデルとプラットフォーム
SHOW-O: 単一のトランスフォーマーによるマルチモーダル理解と生成の統合
大規模言語モデル(LLM)の著しい進歩は、マルチモーダル大規模言語モデル(MLLM)の開発を刺激しました。LLaVA、MiniGPT-4、InstructBLIPなどの初期のMLLMの努力は、視覚質問回答(VQA)などの視覚言語タスクで著しいマルチモーダル理解能力を示しています。LLMをマルチモーダルドメインに統合するために、これらの研究は、事前トレーニングされたモダリティ固有のエンコーダー(CLIPなど)から特徴をLLMの入力空間へ投影し、トランスフォーマーのバックボーン内でマルチモーダル理解と推論を可能にしました。MLLMには、ビジョンエンコーダー、特徴整列アダプター、データセットなどのさまざまな設計選択肢がありますが、ほとんどのモデルのトレーニングは、LLMでテキスト生成に効果的であることが証明された自己回帰生成パラダイムに従います。強力なマルチモーダル理解能力を持っているにもかかわらず、これらのモデルは主に視覚認識に焦点を当てており、テキスト以外のマルチモーダル出力を生成する能力がありません。
トランスフォーマーモデルは、自然言語処理における自己回帰モデリングで大きな成功を収めてきました。そうした進歩に触発された以前の研究は、画像とビデオ生成のために、画像ピクセルの依存性を学習するために、同じ自己回帰モデリングを直接適用しました。たとえば、VideoPoetは、デコーダー専用のトランスフォーマーアーキテクチャを使用して、マルチモーダル入力から高品質のビデオを合成します。最近では、LlamaGenは、大規模言語モデルアーキテクチャであるLlamaが自己回帰的に画像トークンをモデル化し、クラス条件付き画像生成で妥当な性能を達成できることを示しています。
この記事では、Show-Oについて議論します。Show-Oは、マルチモーダル理解と生成を統合する統一トランスフォーマーです。完全に自己回帰モデルのように、Show-Oは自己回帰と離散拡散モデリングを統合して、さまざまなモダリティの入力と出力を適応的に処理します。統一モデルの柔軟性により、視覚質問回答、テキストから画像生成、テキストガイドの塗りつぶし/外挿、混合モダリティ生成などの幅広い視覚言語タスクをサポートします。さまざまなベンチマークで、Show-Oは、同等またはより大きな数のパラメータを持つ既存の個別モデルと比較して、同等または優れた性能を示しています。これは、Show-Oが次世代の基礎モデルとしての潜在性を強調しています。
このフレームワークでは、モデルは連続ラテント表現に追加されたガウシアンノイズを予測するように設計されています。他のモデル(D3PM、Mask-predict、ARDM、MaskGITなど)とは異なり、ガウシアンノイズではなく離散ノイズを使用します。具体的には、画像は画像トークナイザーを使用して離散トークンのシーケンスとして表現され、各トークンはカテゴリラベルに関連付けられます。トークンごとの分布は、確率サンプリングプロセスを介して一様分布に変換されます。トレーニング中、トークンの一部はランダムにマスクされ、モデルはマスクされたトークンの元の値を予測するようにトレーニングされます。この作業では、Show-Oは視覚生成のために離散拡散モデリングを採用しています。
… (以下、同じ構造とルールに従って翻訳を続ける)












