AIモデルとプラットフォーム
DiffSeg : Stable Diffusionを用いた無監督ゼロショットセグメンテーション
コンピュータビジョンモデルにおける重要な課題の1つは、高品質のセグメンテーションマスクの生成です。最近の大規模な教師ありトレーニングの進歩により、さまざまな画像スタイルでのゼロショットセグメンテーションが可能になりました。さらに、教師なしトレーニングにより、広範な注釈の必要性なくセグメンテーションが簡素化されました。ただし、ゼロショット設定で何でもセグメンテーションできるコンピュータビジョンフレームワークを構築することは、まだ複雑なタスクです。コンピュータビジョンモデルにおける基本的な概念であるセマンティックセグメンテーションは、画像を統一的なセマンティクスを持つ小さな領域に分割することを含みます。この技術は、医療画像、画像編集、自動運転など、多くのダウンストリームタスクの基盤を提供します。
コンピュータビジョンモデルを発展させるために、画像セグメンテーションが固定されたデータセットに限定されていないことが重要です。代わりに、さまざまなアプリケーションのための汎用的な基礎タスクとして機能する必要があります。ただし、ピクセルごとのラベルを収集するコストは高く、ゼロショットと教師ありセグメンテーション方法の進歩を制限しています。この記事では、安定拡散モデルの自己注意層を使用して、適切な注釈なしでゼロショット設定で何でもセグメンテーションできるモデルの構築を可能にする方法について説明します。これらの自己注意層は、事前トレーニングされた安定拡散モデルによって学習されたオブジェクトの概念を固有に理解しています。
DiffSeg : 高度なゼロショットセグメンテーションアルゴリズム
セマンティックセグメンテーションは、画像をさまざまなセクションに分割するプロセスであり、各セクションは類似したセマンティクスを共有します。この技術は、多くのダウンストリームタスクの基盤を提供します。従来、ゼロショットコンピュータビジョンタスクは、教師ありセマンティックセグメンテーションに依存しており、大規模なデータセットと注釈付きのカテゴリを使用していました。ただし、ゼロショット設定で教師なしセマンティックセグメンテーションを実装することは、まだ課題です。伝統的な教師あり方法は有効ですが、ピクセルごとのラベル付けコストは souvent 制限的であり、より制限のないゼロショット設定で教師なしセグメンテーション方法を開発する必要性を強調しています。
この制限を解決するために、DiffSeg は、安定拡散フレームワークを使用して、ゼロショット転送が可能な汎用的なセグメンテーションモデルを構築するための新しいポストプロセッシング戦略を導入します。安定拡散フレームワークは、高解像度画像を生成する能力を証明しており、生成された画像に対して、対応するテキストプロンプトを使用してセグメンテーションマスクを生成できます。ただし、DiffSeg は、拡散モデルの自己注意層からの注意テンソルを使用してセグメンテーションマスクを生成する革新的なポストプロセッシング方法です。
DiffSeg アルゴリズムは、3 つの主要なコンポーネントで構成されています。注意テンソルを合計し、注意マップを反復的にマージし、非最大抑制を実行します。これらのコンポーネントは、以下の画像に示されています。

DiffSeg アルゴリズムは、注意テンソルを空間的一貫性を持つ 4 次元のテンソルとして扱い、さまざまな解像度の注意マップを反復的にマージします。アンカー ポイントをサンプリングしてマージ プロセスを開始し、同じオブジェクトのアンカーを最終的に吸収します。KL 分散法を使用して、注意マップ間の類似性を測定し、マージ プロセスを制御します。
クラスタリングベースの教師なしセグメンテーション方法と比較して、DiffSeg アルゴリズムでは、クラスタの数を事前に指定する必要はありません。また、追加のリソースを使用せずにセグメンテーションを生成できます。DiffSeg アルゴリズムは、「事前トレーニングされた安定拡散モデルを使用して、追加のリソースや事前の知識なしで画像をセグメンテーションできる、新しい教師なしゼロショットセグメンテーション方法です。」
DiffSeg : 基礎概念
DiffSeg は、拡散モデル、教師なしセグメンテーション、ゼロショットセグメンテーションの知識を基盤としています。
拡散モデル
DiffSeg アルゴリズムは、事前トレーニングされた拡散モデルからの知識を基盤としています。拡散モデルは、画像を生成するための最も人気のあるフレームワークの 1 つであり、画像を生成するために、ノイズの付加と除去のプロセスを学習します。安定拡散は、拡散モデルの最も人気のあるバリアントであり、教師ありセグメンテーション、ゼロショット分類、セマンティック対応付け、ラベル効率的なセグメンテーション、オープンボキャブラリー セグメンテーションなどのタスクを実行するために使用されます。ただし、拡散モデルには、高次元の視覚特徴に依存するという問題があり、追加のトレーニングが必要になることがあります。
教師なしセグメンテーション
DiffSeg アルゴリズムは、教師なしセグメンテーションと密接に関連しています。教師なしセグメンテーションは、注釈なしで密なセグメンテーション マスクを生成するための現代的な AI の実践です。ただし、良いパフォーマンスを発揮するには、ターゲット データセットに対する事前の教師なしトレーニングが必要です。教師なしセグメンテーション モデルは、事前トレーニングされたモデルを使用してセグメンテーション マスクを生成するものと、不変性に基づいてクラスタリングするものの 2 つのカテゴリに分類できます。
ゼロショットセグメンテーション
DiffSeg アルゴリズムは、ゼロショットセグメンテーション フレームワークと密接に関連しています。ゼロショットセグメンテーション モデルは、事前のトレーニングやデータの知識なしで何でもセグメンテーションできる能力を示しています。ゼロショットセグメンテーション モデルは、最近、ゼロショット転送能力を示していますが、テキスト入力とプロンプトが必要です。対照的に、DiffSeg アルゴリズムは、拡散モデルを使用して、画像の内容を知らずにセグメンテーションを生成します。
DiffSeg : 方法とアーキテクチャ
DiffSeg アルゴリズムは、事前トレーニングされた安定拡散モデルの自己注意層を使用して、高品質のセグメンテーション タスクを生成します。
安定拡散モデル
安定拡散は、DiffSeg フレームワークの基本的な概念の 1 つです。安定拡散は、生成的な AI フレームワークであり、最も人気のある拡散モデルの 1 つです。拡散モデルの主な特徴の 1 つは、前向きと後向きのパスです。前向きのパスでは、画像に少量のガウシアンノイズが加算され、画像が等方的なガウシアンノイズ画像になるまで、各時間ステップで反復的にノイズが加算されます。一方、後向きのパスでは、等方的なガウシアンノイズ画像からノイズが反復的に除去され、元の画像が回復します。
安定拡散フレームワークは、エンコーダーとデコーダーを使用し、U-Net デザインに注意層を使用します。エンコーダーは、画像を小さい空間次元の潜在的な空間に圧縮し、デコーダーは画像を圧縮して展開します。U-Net アーキテクチャは、モジュラー ブロックのスタックで構成されています。各ブロックは、トランスフォーマー層または ResNet 層のいずれかで構成されています。
コンポーネントとアーキテクチャ
拡散モデルの自己注意層は、固有のオブジェクトの情報を空間的な注意マップの形式でグループ化し、DiffSeg は、注意テンソルを有効なセグメンテーション マスクにマージするための新しいポストプロセッシング方法です。DiffSeg のパイプラインは、注意の集約、非最大抑制、反復的な注意のマージの 3 つの主なコンポーネントで構成されています。
注意の集約
入力画像が U-Net 層とエンコーダーを通過すると、安定拡散モデルは、5 つの次元ごとに 16 個の注意テンソルを生成します。16 個のテンソルを生成する主な目標は、さまざまな解像度の注意テンソルを可能な限り高解像度のテンソルに集約することです。これを実現するために、DiffSeg アルゴリズムは、4 次元のテンソルをそれぞれ別々に扱います。
4 次元のうち、最後の 2 次元は、2D 空間マップが DiffSeg フレームワークの空間的一貫性に対応するため、解像度は異なりますが、空間的一貫性があります。したがって、DiffSeg フレームワークは、すべての注意マップのこれら 2 次元を、64 x 64 の最高解像度にサンプリングします。一方、最初の 2 次元は、注意マップの位置参照を示します。

これらの次元は注意マップの位置を参照するため、注意マップはそれぞれ別々に集約する必要があります。また、集約された注意マップが有効な分布を持つように、集約後に分布を正規化します。各注意マップは、解像度に比例した重みが与えられます。
反復的な注意のマージ
注意の集約の主な目標は、注意テンソルを計算することですが、主な目標は、注意マップをスタックのオブジェクト プロポーザルにマージすることです。各プロポーザルには、 Stuff カテゴリーまたは単一のオブジェクトのアクティベーションが含まれます。K-平均アルゴリズムを有効な分布のテンソルに実装して、オブジェクトのクラスターを見つけることができます。ただし、K-平均は最適な解決策ではありません。K-平均クラスタリングでは、クラスターの数を事前に指定する必要があります。また、K-平均アルゴリズムの実装は、初期化に依存して同じ画像に対して異なる結果になる可能性があります。障害を克服するために、DiffSeg フレームワークは、プロポーザルを生成するためにサンプリング グリッドを生成することを提案します。
非最大抑制
反復的な注意のマージの前のステップは、オブジェクト プロポーザルのリストを生成します。各オブジェクト プロポーザルには、オブジェクトのアクティベーションが含まれます。DiffSeg フレームワークは、リストのオブジェクト プロポーザルを有効なセグメンテーション マスクに変換するために、非最大抑制を使用します。このプロセスは、各要素がすでに確率分布のマップであるため、有効なアプローチです。すべてのマップに対して、各空間位置で最大の確率のインデックスを取り、対応するマップのインデックスに基づいてメンバーシップを割り当てます。
DiffSeg : 実験と結果
教師なしセグメンテーションを扱うフレームワークは、Cityscapes と COCO-stuff-27 という 2 つのセグメンテーション ベンチマークを使用します。Cityscapes ベンチマークは、27 のミッドレベル カテゴリーを持つ自律走行データセットです。一方、COCO-stuff-27 ベンチマークは、80 の物体と 91 のカテゴリを 27 のカテゴリにまとめた、COCO-stuff データセットのカスタマイズされたバージョンです。また、DiffSeg フレームワークは、セグメンテーションのパフォーマンスを分析するために、平均交差係数 (mIoU) とピクセル精度 (ACC) を使用します。DiffSeg アルゴリズムは、セマンティック ラベルを提供できないため、ハンガリアン マッチング アルゴリズムを使用して、各予測マスクにグラウンド トゥルース マスクを割り当てます。予測マスクの数がグラウンド トゥルース マスクの数を超える場合、フレームワークは、一致しない予測タスクを偽陰性として考慮します。
さらに、DiffSeg フレームワークは、次の 3 つのワークを実行することを強調しています。言語依存 (LD)、教師なし適応 (UA)、および補助画像 (AX) です。言語依存とは、セグメンテーションを促進するために、画像の記述的なテキスト入力が必要であることを意味します。教師なし適応とは、ターゲット データセットで教師なしトレーニングを使用することを意味します。補助画像とは、画像をセグメンテーションするために、合成画像または参照画像のプールを使用することを意味します。
結果
COCO ベンチマークでは、DiffSeg フレームワークは、2 つの K-平均ベースライン、K-Means-S と K-Means-C を含みます。K-Means-C ベースラインは、評価される画像のオブジェクトの数の平均に基づいて 6 つのクラスターを計算します。一方、K-Means-S ベースラインは、各画像のグラウンド トゥルースのオブジェクトの数に基づいて、各画像に特定の数のクラスターを使用します。両方のベースラインの結果は、以下の画像に示されています。

結果から、K-平均ベースラインが既存の方法を上回っていることがわかります。これは、自己注意テンソルを使用することの利点を示しています。K-Means-S ベースラインが K-Means-C ベースラインを上回っていることは、クラスターの数が重要なハイパーパラメータであることを示しています。さらに、DiffSeg フレームワークは、K-平均ベースラインを上回り、より良いセグメンテーションを提供し、K-平均ベースラインの欠点を回避する能力を示しています。
Cityscapes データセットでは、DiffSeg フレームワークは、320 解像度の入力で、より高い 512 解像度の入力で実行されるフレームワークを上回り、精度と mIoU で結果を出しています。

DiffSeg フレームワークは、次の画像に示されているように、複数のハイパーパラメータを使用します。

注意の集約は、DiffSeg フレームワークで使用される基本的な概念の 1 つです。解像度が一定の場合、さまざまな集約重みを使用した場合の影響は、以下の画像に示されています。

結果から、高解像度マップ (64 x 64) が最も詳細なセグメンテーションを生成することがわかります。ただし、セグメンテーションには一部の可視的な亀裂があります。一方、低解像度マップ (32 x 32) は詳細を過剰にセグメンテーションする傾向がありますが、より一貫性のあるセグメンテーションを生成します。低解像度マップは、画像全体を単一のオブジェクトにマージするため、セグメンテーションを生成できません。最後に、比例集約戦略を使用すると (a)、詳細と一貫性のバランスが取れたセグメンテーションが生成されます。
最終的な考え
ゼロショット教師なしセグメンテーションは、コンピュータビジョンフレームワークにとって、依然として大きな課題です。既存のモデルは、非ゼロショット教師なし適応または外部リソースに依存しています。この課題を克服するために、安定拡散モデルの自己注意層を使用して、適切な注釈なしでゼロショット設定で何でもセグメンテーションできるモデルの構築を可能にする方法について説明しました。また、DiffSeg という新しいポストプロセッシング戦略についても説明しました。DiffSeg は、安定拡散フレームワークを使用して、ゼロショット転送が可能な汎用的なセグメンテーションモデルを構築することを目的としています。アルゴリズムは、注意マップを反復的にマージして有効なセグメンテーションマスクを生成するために、相互注意類似性と内部注意類似性を使用します。DiffSeg は、人気のあるベンチマークで最先端のパフォーマンスを達成します。












