Andersonの視点
合成データ:グランドセフトオートでオクルージョンギャップを埋める

イリノイ大学の研究者は、グランドセフトオートのゲームエンジンによって生成された合成画像を使用する新しいコンピュータビジョンデータセットを作成しました。これは、セマンティックセグメンテーションの最も困難な課題の1つである、部分的に可視なオブジェクトの認識を支援するために設計されています。
この目的のために、研究者は、論文で説明されているように、GTA-Vビデオゲームエンジンを使用して、オクルージョンインスタンスの記録的な数、完全なセマンティックセグメンテーションとラベル付け、そして時系列情報を考慮する合成データセットを生成しました。
完全なシーンの理解
以下のビデオは、研究の補足資料として公開され、完全な3Dシーンの理解の利点を示しています。隠されたオブジェクトは常に知られ、シーン内で公開されており、評価システムは部分的にオクルージョンされたビューを完全な(ラベル付けされた)オブジェクトと関連付けることを学習できます。
ソース:http://sailvos.web.illinois.edu/_site/index.html
結果として得られるデータセット、SAIL-VOS 3Dは、フレームごとのアノテーション、インスタンスレベルのセグメンテーション、シーンビューのグラウンドトゥルースディプス、2Dアノテーションをバウンディングボックスで囲んだ、最初の合成ビデオメッシュデータセットであると主張されています。

ソース (クリックして拡大)
SAIL-VOS 3Dのアノテーションには、ディプス、インスタンスレベルのモーダルとアモーダルセグメンテーション、セマンティックラベル、3Dメッシュが含まれます。データには、1280×800解像度の484のビデオ、合計237,611フレーム、ショートトランジションが含まれます。

上部、元のCGIフレーム;2行目、インスタンスレベルのセグメンテーション;3行目、アモーダルセグメンテーション、シーンの理解と透明性の深さを示しています。 ソース (クリックして拡大)
データセットは、6,807のクリップに分割され、平均34.6フレームです。データは、GTA-Vゲームエンジンの3,576のメッシュモデルから生成された3,460,213のオブジェクトインスタンスでアノテーションされています。これらは、178のセマンティックカテゴリに割り当てられます。
メッシュの再構築と自動ラベル付け
後のデータセットの研究は、現実世界の画像で行われる可能性が高いため、SAIL-VOS 3Dのメッシュは、GTA-Vエンジンから派生するのではなく、マシンラーニングフレームワークによって生成されます。

プログラムによるシーンの完全な理解と、基本的に「ホログラフィック」な理解により、SAIL-VOS 3Dの画像は、通常はオクルージョンによって隠されるオブジェクトの表現を合成できます。 (クリックして拡大) ソース:https://arxiv.org/pdf/2105.08612.pdf
GTA-Vの世界の各オブジェクトには、ユニークなIDが含まれているため、SAIL-VOSは、GTA-Vスクリプトフックライブラリを使用してレンダリングエンジンからこれらのIDを取得します。これにより、オブジェクトが一時的に視野から外れた場合でも、ラベル付けを再取得する問題が解決され、ラベル付けは永続的かつ信頼性が高いものになります。環境には162のオブジェクトがあり、研究者はこれらのオブジェクトを対応する数のクラスにマッピングしました。
シーンとオブジェクトの多様性
GTA-Vエンジンの多くのオブジェクトは、自然界に共通しているため、SAIL-VOSのインベントリには、Microsoftの2014年のMS-COCOデータセットに含まれるクラスの約60%が含まれています。
適用可能性
この分野の一般的な研究との互換性を確保し、合成アプローチが非合成プロジェクトにも利益をもたらすことを確認するために、研究者は、MS-COCOと2012年のPASCAL Visual Object Classes (VOC) Challengeで使用されるフレームベースの検出アプローチを使用してデータセットを評価しました。
研究者は、SAIL-VOSデータセットを事前トレーニングすることで、IoU(交差係数)が19%改善され、VideoMatchのパフォーマンスも55%から74%に改善されることを発見しました。
しかし、極端なオクルージョンの場合、従来の方法ではオブジェクトまたは人物を識別できない場合がありましたが、研究者は、これは将来的にアモーダルマスクの理由を調べることで解決できる可能性があると予測しています。














