AIモデルとプラットフォーム
Sapiens: ヒューマンビジョンモデルにおけるブレークスルー
大規模な事前学習とタスク固有のファインチューニングのアプローチは、言語モデリングにおいて標準的な実践として確立されています。同様に、コンピュータビジョンの方法も、事前学習のための大量のデータを使用することを進めています。LAION5B、Instagram-3.5B、JFT-300M、LVD142M、Visual Genome、YFCC100Mなどの大規模なデータセットの出現により、従来のベンチマークの範囲を超えたデータコーパスの探索が可能になりました。この分野における著名な研究には、DINOv2、MAWS、AIMがあります。DINOv2は、LDV-142Mデータセットでコントラストive iBot方法をスケーリングすることで、自己教師あり特徴を生成するための最先端のパフォーマンスを達成しています。MAWSは、100万枚の画像でマスク付きオートエンコーダー(MAE)をスケーリングすることを研究しています。AIMは、BERTと同様の視覚トランスフォーマーの自己教師あり事前学習のスケーラビリティを探究しています。これらの方法とは対照的に、Sapiensは、ヒューマンセントリックなアプローチを採用しています。Sapiensのモデルは、ヒューマン画像の膨大なコレクションを使用して事前学習を行い、後にヒューマン関連タスクのためのファインチューニングを行います。
コンピュータビジョンにおける3Dヒューマンディジタイゼーションの大規模な目標は、制御された環境やスタジオ環境においては大きな進歩を遂げてきましたが、未制約環境への拡張は依然として挑戦的な課題です。これらの課題に対処するために、キーポイント推定、ボディパーツセグメンテーション、深度推定、表面法線予測などの基本的なタスクを実行できる多機能モデルを開発することが重要です。Sapiensは、これらのヒューマンビジョンタスクのモデルを開発し、野外環境に一般化できることを目的としています。現在、最大の公開言語モデルには100Bパラメータ以上が含まれていますが、より一般的に使用される言語モデルには約7Bパラメータが含まれています。一方、Vision Transformers(ViT)は、同様のアーキテクチャを共有していますが、同様のスケールまで成功的に拡張されていません。
Sapiensは、ヒューマンセントリックなビジョンモデルを開発することを目的としています。これらのモデルは、一般化、広範な適用可能性、ハイフィデリティの3つの基準を満たす必要があります。一般化は、モデルがさまざまな環境で一貫してパフォーマンスを発揮することを保証します。広範な適用可能性は、モデルがさまざまなタスクに最小限の変更で適応できることを示します。ハイフィデリティは、モデルが高精度で高解像度の出力を生成できることを示します。この論文では、これらの属性を備えたモデルの開発について説明します。
Sapiensは、大規模なデータセットとスケーラブルなモデルアーキテクチャを利用して、一般化を実現します。より広範な適用可能性を実現するために、Sapiensは事前学習からファインチューニングへのアプローチを採用しています。このアプローチは、事前学習データの分布がダウンストリームタスクに与える影響について重要な質問を提起します。Sapiensは、300万枚のヒューマン画像を特集したHumans-300Mデータセットを収集します。これらのラベル付けされていない画像は、300Mから2Bまでのパラメータ数の範囲で、スクラッチから事前学習するためのビジョントランスフォーマーのファミリーを训練するために使用されます。
Sapiensは、自己教師あり事前学習のためのマスク付きオートエンコーダー(MAE)アプローチを採用しています。MAEは、コントラストiveまたはマルチ推論戦略と比較して、シンプルで効率的な事前学習手法です。Sapiensは、事前学習のネイティブ入力解像度を1024ピクセルに増やし、約4倍のFLOPSを実現します。各モデルは、1.2兆トークンで事前学習されます。ヒューマンセントリックタスクのファインチューニングのために、Sapiensは一貫したエンコーダーとデコーダーのアーキテクチャを使用します。

Sapiensは、2Dポーズ推定、ボディパーツセグメンテーション、深度推定、表面法線予測などのタスクにファインチューニングされ、評価されます。Sapiensは、既存のベースラインを超えるパフォーマンスを達成し、ヒューマンセントリックなベンチマークで重要な改善を実現します。
Sapiens: ヒューマンビジョンモデルにおけるブレークスルー
近年、2Dおよび3Dのフォトリアリスティックヒューマンの生成において大きな進歩が見られました。これらの方法の成功は、2Dキーポイント、ボディパーツセグメンテーション、深度、表面法線などのアセットのロバストな推定に大きく帰因しています。しかし、これらのアセットのロバストで正確な推定は、依然として活発な研究分野であり、個々のタスクのパフォーマンスを向上させるために複雑なシステムが必要です。さらに、野外環境での正確なグラウンドトゥルース注釈を取得することは、スケーラビリティの面で非常に難しいとされています。Sapiensの目標は、野外環境でこれらのアセットを推論するための統一されたフレームワークとモデルを提供することです。
Sapiensは、ヒューマンセントリックなモデルが3つの基準を満たすべきであると主張しています。一般化、広範な適用可能性、ハイフィデリティです。一般化は、モデルが未知の条件に対してロバストであることを保証します。広範な適用可能性は、モデルが最小限の変更でさまざまなタスクに適応できることを示します。ハイフィデリティは、モデルが高精度で高解像度の出力を生成できることを示します。
Sapiensは、大規模なデータセットとスケーラブルなモデルアーキテクチャを利用して、一般化を実現します。より広範な適用可能性を実現するために、Sapiensは事前学習からファインチューニングへのアプローチを採用しています。このアプローチは、事前学習データの分布がダウンストリームタスクに与える影響について重要な質問を提起します。Sapiensは、300万枚のヒューマン画像を特集したHumans-300Mデータセットを収集します。これらのラベル付けされていない画像は、300Mから2Bまでのパラメータ数の範囲で、スクラッチから事前学習するためのビジョントランスフォーマーのファミリーを训練するために使用されます。
Sapiens: 方法とアーキテクチャ
Sapiensは、マスク付きオートエンコーダー(MAE)アプローチを採用しています。モデルは、部分的な観察から元のヒューマン画像を再構築するように訓練されます。すべてのオートエンコーダーと同様に、Sapiensのモデルには、可視画像を潜在的な表現にマッピングするエンコーダーと、この潜在的な表現から元の画像を再構築するデコーダーがあります。事前学習データセットには、単一のヒューマン画像と複数のヒューマン画像の両方が含まれています。各画像は、固定サイズで固定のアスペクト比にリサイズされます。ViTと同様に、画像は、固定のパッチサイズを持つ正方形のパッチに分割されます。パッチのサブセットはランダムに選択され、マスクされ、残りは可視化されます。マスクされたパッチと可視化されたパッチの比率は、マスキング比と呼ばれ、訓練中は固定されます。
Sapiensのモデルは、画像の特徴、スケール、クロップ、被写体の年齢や民族、被写体の数など、さまざまな画像特性に対して一般化を示しています。各パッチトークンは、画像の面積の0.02%を占め、標準的なViTの0.4%と比較して16倍の低減率を実現し、モデルの間で微妙な推論を提供します。マスキング比が95%の場合でも、Sapiensのモデルは、保持されたサンプル上でヒューマンの解剖学の妥当な再構築を達成します。Sapiensの事前学習済みモデルの、未見のヒューマン画像上の再構築は、以下の画像に示されています。

さらに、Sapiensは、約10億枚のヒューマン画像を特集した大規模な独自データセットを事前学習に使用します。事前処理では、ウォーターマーク、テキスト、芸術的な表現、または非自然な要素を含む画像が破棄されます。Sapiensは、事前学習に使用するために、オフザシェルフの人物バウンディングボックス検出器を使用して、画像をフィルタリングし、検出スコアが0.9以上でバウンディングボックスの寸法が300ピクセルを超える画像のみを保持します。データセットの248百万枚の画像には複数の被写体が含まれています。
2Dポーズ推定
Sapiensフレームワークは、エンコーダーとデコーダーを、K = 17 [67]、K = 133 [55]、および新しい詳細なスケルトン、K = 308でファインチューニングします。以下の図に示すように、Sapiensのアノテーションは、顔、手、足、表面、顔の表現点を含む308個のキーポイントで構成されています。

Sapiensは、2Dポーズ推定、ボディパーツセグメンテーション、深度推定、表面法線予測などのタスクにファインチューニングされ、評価されます。Sapiensは、既存のベースラインを超えるパフォーマンスを達成し、ヒューマンセントリックなベンチマークで重要な改善を実現します。
Sapien: 実験と結果
Sapiens-2Bは、1024 A100 GPUで18日間、PyTorchを使用して事前学習されます。Sapiensは、すべての実験でAdamWオプティマイザを使用します。学習スケジュールには、短い線形ウォームアップの後、事前学習のためのコサインアニーリングとファインチューニングのための線形減衰が含まれます。すべてのモデルは、1024 × 1024の解像度でスクラッチから事前学習され、16のパッチサイズでファインチューニングされます。Sapiensは、標準的なオーグメンテーション、such as クロッピング、スケーリング、フリッピング、光学的歪みを適用します。セグメンテーション、深度、法線予測タスクのために、非ヒューマンのCOCO画像からランダムな背景が追加されます。重要な点は、Sapiensが、初期層の学習率を低くし、後の層の学習率を高くすることで、一般化を維持するために差別的な学習率を使用していることです。エンコーダーの層ごとの学習率減衰は0.85に設定され、重み減衰は0.1に設定されます。
Sapiensの設計仕様は、以下の表に示されています。Sapiensは、モデルを幅でスケーリングすることを優先します。特に、Sapiens-0.3Bモデルは、従来のViT-Largeとアーキテクチャが似ているものの、解像度が高いため、20倍以上のFLOPSを実現しています。

Sapiensは、顔、体、足、手(K = 308)のポーズ推定にファインチューニングされます。訓練には、100万枚の画像が使用され、評価には、Humans5Kと呼ばれる5,000枚の画像が使用されます。評価は、トップダウンアプローチで行われ、Sapiensはバウンディングボックスの検出にオフザシェルフの検出器を使用し、単一のヒューマンのポーズ推定を実行します。以下の表は、Sapiensモデルと既存の方法の比較を示しています。すべての方法は、Sapiensの308キーポイントのボキャブラリーとCOCO-WholeBodyの133キーポイントのボキャブラリーの間の114個の共通キーポイントで評価されます。Sapiens-0.6Bは、現在の最先端であるDWPose-lを+2.8 AP上回ります。
Sapiens-2Bは、新しい最先端の61.1 APを達成し、以前の最先端を+7.6 AP上回ります。Sapiensは、実験室スタジオのアノテーションでファインチューニングされたにもかかわらず、リアルワールドシナリオにロバストに一般化します。
結論
Sapiensは、ヒューマンセントリックなビジョンモデルをファウンデーションモデルへの重要なステップを表しています。Sapiensモデルは、さまざまなヒューマンセントリックなタスクに対して強力な一般化能力を示しています。最先端のパフォーマンスは、(i) ヒューマンを理解するための特化したカーソルデータセットでの大規模な事前学習、(ii) 高解像度と高容量のビジョントランスフォーマーバックボーンのスケーリング、(iii) オーグメンテーションスタジオと合成データの高品質のアノテーションに帰因します。Sapiensモデルは、下流タスクの多様なビルディングブロックとなり、より広いコミュニティに高品質のビジョンバックボーンへのアクセスを提供する可能性があります。












