AIモデルとプラットフォーム

TinySAM : セグメントアニーシングモデルの効率化

mm
Unite.AI を Google の優先ソースに追加

オブジェクトセグメンテーションは、現代のコンピュータビジョンにおいて基礎的な重要な分野であり、オブジェクトのローカリゼーションや識別などのアプリケーションで重要な役割を果たします。リアルタイムで高速に正確なセグメンテーションが求められます。この重要性により、オブジェクトセグメンテーションは研究のホットトピックとなり、インスタンスセグメンテーション、セマンティックセグメンテーション、パノプティックセグメンテーションなどの分野で重要な研究が行われています。

オブジェクトセグメンテーションの進化に伴い、セグメントアニーシングモデル(SAM)が優れたツールとして登場し、優れたセグメンテーション能力を示し、さまざまなコンピュータビジョンアプリケーションで採用されています。SAMアーキテクチャを使用したフレームワークは、ダウンストリームのビジョンタスクで優れたパフォーマンスを発揮しています。ただし、SAMの複雑で重いアーキテクチャは大量の計算リソースを必要とし、計算リソースが制限されたデバイスでの実装を妨げています。

SAMの計算上の課題に対処するために、研究者はTiny Segment Anything Model(TinySAM)を開発しました。これは、ゼロショット性能を維持しながらも軽量化されたモデルです。TinySAMは、オンラインハードプロンプトサンプリングを使用したフルステージの知識蒸留方法を使用して、より効率的な学生モデルを作成します。さらに、TinySAMは、プロンプタブルセグメンテーションタスクに適応したポストトレーニング量子化を使用して計算リソースを削減します。また、TinySAMの設計は、階層的なセグメンテーションを目的とし、パフォーマンスを損なうことなく推論速度をほぼ2倍にします。

この記事では、TinySAMフレームワークの基礎原理、構造、パフォーマンスについて、他の最先端のセグメンテーションフレームワークと比較しながら詳しく説明します。

TinySAM : 効率的なセグメントアニーシングモデル

セグメントアニーシングモデルの優れたセグメンテーション能力と、大規模なセグメンテーションデータセット(1100万枚以上の画像と10億以上の画像マスク)により、さまざまなコンピュータビジョンアプリケーションの進歩が促進されています。セグメントアニーシングモデルの優れたゼロショットセグメンテーション性能は、医療研究や医療画像処理などのデータが限られている業界にも利益をもたらしています。

セグメントアニーシングモデルの複雑で重いアーキテクチャは、高計算リソースと運用コストを必要とし、制限された計算リソースを持つデバイスでの実装を妨げています。MobileSAMやFastSAMなどの最近の研究では、SAMモデルの計算効率を向上させるために、軽量化されたモデルの開発を試みました。MobileSAMフレームワークでは、画像エンコーダーの重いコンポーネントをTinyViTアーキテクチャに置き換えました。FastSAMモデルでは、セグメンテーションタスクをインスタンスセグメンテーションタスクに変換し、YoloV8モデルを使用しました。ただし、これらの方法では、ゼロショットダウンストリームタスクのパフォーマンスが低下しました。

TinySAMは、SAMモデルの計算リソースを削減しながらも、ゼロショットダウンストリームタスクのパフォーマンスを維持することを目的とします。TinySAMフレームワークでは、フルステージの知識蒸留方法を使用して、コンパクトな学生ネットワークの能力を向上させます。さらに、オンラインハードプロンプトサンプリングを使用して、学生ネットワークにハードな知識を伝達します。ポストトレーニング量子化を使用して、計算リソースを削減します。

TinySAM : 構造と方法論

セグメントアニーシングモデルの構造と方法論について説明する前に、SAMフレームワークの前身であるSAMモデルの構造と方法論について説明します。SAMモデルのコアには、3つのサブネットワークがあります。プロンプトエンコーダー、画像エンコーダー、そしてマスクデコーダーです。画像エンコーダーは、ビジョントランスフォーマーに基づく重いネットワークであり、高計算リソースを必要とします。

知識蒸留

知識蒸留は、コンパクトなネットワークのパフォーマンスを向上させるための重要なアプローチです。知識蒸留方法では、教師ネットワークの出力を使用して、軽量な学生ネットワークのトレーニングを監督します。知識蒸留方法には、2つのサブカテゴリがあります。中間特徴の蒸留とネットワーク出力の蒸留です。大部分の研究では、画像分類タスクに焦点を当てています。

フルステージの知識蒸留

セグメントアニーシングモデルのコアには、3つのサブネットワークがあります。プロンプトエンコーダー、画像エンコーダー、そしてマスクデコーダーです。画像エンコーダーは、ビジョントランスフォーマーに基づく重いネットワークであり、高計算リソースを必要とします。TinySAMフレームワークでは、フルステージの知識蒸留方法を使用して、軽量な画像エンコーダーを学習します。

量子化

モデル量子化は、コンピュータビジョンフレームワークで使用される一般的なアプローチです。量子化では、重みや活性化関数をより低いビット幅に量子化することで、計算複雑性とストレージ要件を削減します。

階層的なセグメンテーション

セグメントアニーシングモデルの階層的なセグメンテーションアプローチでは、オートマチックマスクジェネレーターを使用して、グリッドプロンプトポイントからセグメンテーションを行います。ただし、密なポイントグリッドを使用すると、セグメンテーションの出力が細かすぎることがあり、計算リソースと運用コストが高くなることがあります。TinySAMフレームワークでは、階層的なマスク生成アプローチを使用して、計算リソースと運用コストを削減します。

TinySAM : 実験と結果

TinySAMフレームワークでは、教師ネットワークの画像埋め込みを事前に計算して保存することで、蒸留プロセスを加速します。ポストトレーニング量子化では、すべての行列乗算層、畳み込み層、逆畳み込み層、線形層を量子化します。ゼロショットダウンストリームタスクの評価では、TinySAMフレームワークは、既存の方法を超えるインスタンスセグメンテーションの精度とFLOPSスコアを達成します。

最終的な考え

この記事では、TinySAMフレームワークについて説明しました。TinySAMは、セグメントアニーシングモデルの効率化を目的とし、計算リソースを削減しながらも、ゼロショットダウンストリームタスクのパフォーマンスを維持することを目的とします。TinySAMフレームワークでは、フルステージの知識蒸留方法を使用して、軽量な学生モデルを作成します。さらに、ポストトレーニング量子化を使用して、計算リソースを削減します。階層的なセグメンテーションアプローチを使用して、推論速度を向上させます。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。