AIモデルとプラットフォーム
インテル ラボ、コンピュータ ビジョン開発を促進する 2 つの新しい AI モデルを発表

VI-Depth 1.0 と MiDaS 3.1 のオープン ソース AI モデルは、コンピュータ ビジョンの深度推定を改善します。
深度推定は、ロボティクス、拡張現実 (AR) 、仮想現実 (VR) などの幅広いアプリケーションを作成するために必要な、困難なコンピュータ ビジョンのタスクです。既存のソリューションは、距離を正確に推定することが困難であり、これは視覚的なナビゲーションにおける動きの計画と障害物の回避に重要な側面です。インテル ラボの研究者は、モノキュラー深度推定の 2 つの AI モデル、視覚的慣性深度推定と堅牢な相対深度推定 (RDE) をリリースすることで、この問題に取り組んでいます。
最新の RDE モデルである MiDaS バージョン 3.1 は、単一の画像入力のみを使用して堅牢な相対深度を予測します。大規模で多様なデータセットでトレーニングされたため、幅広いタスクと環境で効率的に実行できます。MiDaS の最新バージョンは、大規模なトレーニングセットと更新されたエンコーダー バックボーンを使用して、RDE のモデル精度を約 30% 改善します。
MiDaS は、Stable Diffusion 2.0 を含む多くのプロジェクトに組み込まれています。ここで、MiDaS は、入力画像の深度を推定し、テキストと深度情報を使用して新しい画像を生成する、深度から画像への機能を可能にします。例えば、デジタルクリエイターの Scottie Fox は、Stable Diffusion と MiDaS の組み合わせを使用して、360 度の VR 環境を作成しました。このテクノロジーは、法廷での犯罪現場の再構築、ヘルスケアでの治療環境、没入型ゲーム体験などの新しい仮想アプリケーションにつながる可能性があります。
RDE は一般化性が高く、有用ですが、スケールの欠如により、測定深度が必要なマッピング、計画、ナビゲーション、オブジェクト認識、3D 再構築、画像編集などのダウンストリーム タスクの有用性が低下します。インテル ラボの研究者は、正確な深度推定を提供する別の AI モデルである VI-Depth をリリースすることで、この問題に取り組んでいます。
VI-Depth は、モノキュラー深度推定と視覚的慣性測定 (VIO) を統合して、メトリック スケールで密な深度推定を生成する、視覚的慣性深度推定パイプラインです。このアプローチにより、シーンの再構築、 マッピング、オブジェクト操作に役立つ、正確な深度推定が可能になります。
慣性データの組み込みにより、スケールの不確実性を解決できます。ほとんどのモバイル デバイスには、慣性測定ユニット (IMU) が含まれています。グローバルな整列により、適切なグローバル スケールが決定され、密なスケール整列 (SML) は、正しいメトリック深度に向けてローカルに動作し、領域を押したり引いたりします。SML ネットワークは、MiDaS をエンコーダー バックボーンとして利用します。モジュラー パイプラインでは、VI-Depth は、データ駆動型の深度推定と MiDaS 相対深度予測モデル、および IMU センサー測定ユニットを組み合わせます。データ ソースの組み合わせにより、VI-Depth は、画像の各ピクセルに対して、より信頼性の高い密なメトリック深度を生成できます。
MiDaS 3.1 と VI-Depth 1.0 は、GitHub でオープン ソースの MIT ライセンスの下で利用可能です。
詳細については、「Vision Transformers for Dense Prediction」および「Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer」を参照してください。












