AIモデルとプラットフォーム

SAM 2を公開:Metaの新しいオープンソースの基礎モデルによる画像と動画のリアルタイムオブジェクトセグメンテーション

mm
Unite.AI を Google の優先ソースに追加

最近の数年間で、AIの世界はテキスト処理の基礎AIにおいて驚くべき進歩を遂げてきました。顧客サービスから法的分析まで、業界全体が変革されました。しかし、画像処理については、まだ表面を掘り返す程度です。視覚データの複雑さと、モデルを訓練して画像を正確に解釈し分析するという課題が、重大な障害をもたらしています。研究者が画像と動画の基礎AIを探求し続けるにつれて、画像処理の未来は、ヘルスケア、自動運転車、そしてそれ以外の分野での革新に満ちています。

オブジェクトセグメンテーションは、画像の中で関心のあるオブジェクトに対応する正確なピクセルを特定することを含み、コンピュータビジョンの重要なタスクです。従来、このタスクには、専門のAIモデルを作成する必要がありましたが、これには広範なインフラストラクチャと大量の注釈付きデータが必要でした。昨年、Metaは、セグメント・アニシング・モデル(SAM)を導入しました。SAMは、基礎AIモデルで、単純なプロンプトで画像をセグメント化できるようにすることで、このプロセスを簡素化します。この革新により、専門の知識と広範なコンピューティングリソースの必要性が減り、画像セグメンテーションがよりアクセスしやすくなりました。

Metaは、SAM 2でさらに一歩進んでいます。SAM 2は、SAMの既存の画像セグメンテーションの機能を強化し、さらに動画処理まで拡張しています。SAM 2は、画像と動画の両方で、以前見たことがないオブジェクトをセグメント化できます。この進歩は、コンピュータビジョンと画像処理の分野で大きな飛躍であり、視覚コンテンツを分析するためのより多機能で強力なツールを提供します。以下では、SAM 2の進歩と、コンピュータビジョンの分野を再定義する可能性について探求します。

SAM(セグメント・アニシング・モデル)を紹介

従来のセグメンテーション方法は、手動での精査(インタラクティブ・セグメンテーション)または、事前に定義されたカテゴリへの自動セグメンテーションのために大量の注釈付きデータを必要とします。SAMは、基礎AIモデルであり、クリック、ボックス、またはテキスト入力などの汎用的なプロンプトを使用したインタラクティブ・セグメンテーションをサポートします。また、最小限のデータとコンピューティング・リソースでファインチューニングすることもできます。10億を超える多様な画像注釈で訓練されたSAMは、カスタム・データの収集やファインチューニングを必要とせずに、新しいオブジェクトや画像を処理できます。SAMは、2つの主要なコンポーネントで構成されています。画像エンコーダーが画像を処理し、プロンプト・エンコーダーがクリックやテキストなどの入力を処理します。これらのコンポーネントは、軽量のデコーダーと組み合わせてセグメンテーション・マスクを予測します。画像が処理されると、SAMはウェブブラウザでわずか50ミリ秒でセグメントを作成できます。これにより、リアルタイムのインタラクティブ・タスクに強力なツールとなります。SAMを構築するために、研究者は3段階のデータ収集プロセスを開発しました。モデル支援注釈、自動注釈と支援注釈の組み合わせ、そして完全自動マスク作成です。このプロセスにより、SA-1Bデータセットが作成され、1100万枚のライセンス済みプライバシー保護画像に120億以上のマスクが含まれています。これは、既存のデータセットよりも400倍大きく、地理的な地域間でのより良い表現を可能にします。SAMの優れたパフォーマンスは、この広範で多様なデータセットに基づいています。

SAM 2:画像から動画へのセグメンテーションの飛躍

SAMの基礎を築くことで、SAM 2は画像と動画の両方でリアルタイムのプロンプト可能なオブジェクトセグメンテーションを実現するように設計されています。SAMとは異なり、SAM 2は動画を連続するフレームのシーケンスとして処理し、動的なシーンや変更されるコンテンツをより効果的に処理できます。画像セグメンテーションの場合、SAM 2はSAMの機能を強化し、さらにインタラクティブ・タスクで3倍速くなります。

SAM 2は、SAMと同じアーキテクチャを保持しながら、動画処理のためにメモリ・メカニズムを導入しました。この機能により、SAM 2は前のフレームからの情報を追跡し、動き、照明、またはオクルージョンの変化にかかわらず一貫したオブジェクトセグメンテーションを可能にします。過去のフレームを参照することで、SAM 2は動画全体でマスク予測を改良できます。

モデルは、新しく開発されたSA-Vデータセットで訓練されています。このデータセットには、47カ国の5万1000本の動画に60万以上のマスクレット注釈が含まれており、全体のオブジェクトとその部分をカバーすることで、SAM 2のリアルワールド動画セグメンテーションの精度を高めています。

SAM 2は、アパッチ2.0ライセンスの下でオープンソースモデルとして利用可能であり、さまざまな用途にアクセス可能です。Metaは、SAM 2で使用されたデータセットもCC BY 4.0ライセンスの下で共有しています。また、モデルを実際に試してみることができるウェブベースのデモもあります。

潜在的な用途

SAM 2の画像と動画のリアルタイム・プロンプト可能なオブジェクトセグメンテーションの機能により、さまざまな分野で数多くの革新的なアプリケーションが可能になりました。以下はその例です。

  • ヘルスケア診断: SAM 2は、手術室でのリアルタイム外科支援を、解剖学的構造をセグメント化し、外科手術中のライブ動画フィードで異常を特定することで、著しく改善できます。また、医療画像分析を、医療スキャンでの臓器または腫瘍の正確なセグメンテーションを提供することで、強化できます。
  • 自動運転車: SAM 2は、動画フレーム全体で歩行者、車両、道路標識を連続してセグメント化および追跡することで、自動運転車システムのオブジェクト検出精度を向上させることができます。動的なシーンを処理する能力も、環境の変化にリアルタイムで対応する適応型ナビゲーションと衝突回避システムをサポートします。
  • インタラクティブ・メディアとエンターテインメント: SAM 2は、オブジェクトをリアルタイムで正確にセグメント化することで、拡張現実(AR)アプリケーションを強化できます。これにより、仮想要素を現実世界と簡単に統合できます。また、動画編集でも、動画内のオブジェクトの自動セグメンテーションを簡素化することで、背景除去やオブジェクト置換などのプロセスを自動化できます。
  • 環境モニタリング: SAM 2は、動画内の動物をセグメント化および追跡することで、野生生物の追跡を支援し、種の研究と生息地研究を支援できます。災害対応では、動画フィードで影響を受けた地域とオブジェクトを正確にセグメント化することで、被害評価と対応努力を導くことができます。
  • 小売と電子商取引: SAM 2は、画像と動画内の製品をインタラクティブにセグメント化することで、電子商取引での製品視覚化を強化できます。顧客は、アイテムをさまざまな角度とコンテキストで表示できます。在庫管理では、リアルタイムで棚上の製品をセグメント化することで、小売業者が在庫を把握し、在庫管理を改善するのに役立ちます。

SAM 2の限界を克服する:実用的な解決策と将来の強化

SAM 2は画像と短い動画で優れたパフォーマンスを発揮しますが、実用的な使用にはいくつかの限界があります。特に、長い動画では、重大な視点の変更、長いオクルージョン、または混雑したシーンでオブジェクトを追跡するのに苦労する可能性があります。インタラクティブなクリックによる手動修正は、これらの問題に対処するのに役立ちます。

混雑した環境では、SAM 2は類似したオブジェクトを間違えて識別する可能性がありますが、後のフレームでの追加のプロンプトはこの問題を解決できます。SAM 2は複数のオブジェクトをセグメント化できますが、各オブジェクトを個別に処理するため、効率が低下します。将来の更新では、共有されたコンテキスト情報を統合することでパフォーマンスを向上させることができます。

SAM 2は、高速に移動するオブジェクトの詳細を欠いたり、フレーム間で予測が不安定になる可能性があります。しかし、追加の訓練でこの限界を解決できます。自動注釈の生成は改善されていますが、品質の確認とフレームの選択には人間の注釈者が依然として必要であり、さらに自動化することで効率を高めることができます。

結論

SAM 2は、画像と動画の両方でのリアルタイム・オブジェクト・セグメンテーションにおいて、重大な進歩を表しています。機能を強化し、動的な動画コンテンツへの機能を拡張することで、SAM 2はヘルスケア、自動運転車、インタラクティブ・メディア、そして小売など、さまざまな分野を変革する可能性を秘めています。課題は残りますが、特に複雑で混雑したシーンを処理する場合、SAM 2のオープンソース性は継続的な改善と適応を促進します。強力なパフォーマンスとアクセス性により、SAM 2はコンピュータビジョンとその先を駆動し、可能性を拡大するでしょう。

Dr. Tehseen ZiaはCOMSATS University Islamabadの正教授であり、オーストリアのVienna University of TechnologyでAIのPh.D.を取得しています。人工知能、機械学習、データサイエンス、コンピュータビジョンを専門とし、信頼性の高い科学雑誌に掲載された出版物で著しい貢献をしています。Dr. Tehseenは、主な調査員としてさまざまな産業プロジェクトを率い、AIコンサルタントとしても務めています。