Andersonの視点
コンピュータビジョンにおける「融合」された人間の分離

シンガポールのHyundai Motor Group Innovation Centerから発表された新しい論文では、コンピュータビジョンにおける「融合」された人間の分離方法を提案しています。オブジェクト認識フレームワークが、別の人間に近すぎるなどの理由で、2人の人間を1つの人物またはエンティティとして認識してしまう場合に発生する問題に対処するものです。

2人が1つになるのは、セマンティックセグメンテーションではよくないことです。ここでは、論文の新しいシステムが、複雑で挑戦的な画像での絡み合った人の個別化において、最先端の結果を達成していることを示しています。 ソース:https://arxiv.org/pdf/2210.03686.pdf
これは、最近の研究コミュニティで多くの注目を集めた注目すべき問題です。この問題を解決することで、Stable Diffusionなどのテキストから画像へのシステムの人間の個別化が改善される可能性があります。これらのシステムは、複数の人物を近接させたポーズを提示すると、人物を「融合」させてしまうことがよくあります。

恐ろしさを受け入れてください – DALL-E 2やStable Diffusionなどのテキストから画像へのモデルは、人物が非常に近い距離にいることを表現するのに苦労しています。
DALL-E 2やStable Diffusionなどの生成モデルは、現在、セマンティックセグメンテーションやオブジェクト認識を使用していないため、この問題を解決することはできません。ただし、最先端のオブジェクト認識ライブラリやリソースは、人を分離する能力があまり良くないため、これらのモデルを使用してこの問題を解決することはできません。
この問題に対処するために、新しい論文では、半合成データへの「切り取りと貼り付け」のアプローチを改良して、タスクで新しい最先端の結果を達成しています。

新しいOcclusion Copy & Pasteメソッドは、以前のフレームワークやアプローチよりも優れています。
切り取り
改良されたメソッド – Occlusion Copy & Paste – は、2021年のSimple Copy-Paste論文から派生しています。画像認識システムのインスタンス分離能力を向上させるために、画像間でオブジェクトや人物を重ねることができることを示しています。
新しいバージョンでは、画像の「バケット」に基づいて、切り取りと貼り付けのプロセスを制限およびパラメータ化しています。

OC&Pの概念的ワークフロー。
要素の制御
制限要因には、切り取りと貼り付けの確率、画像の数、範囲が含まれます。範囲は、画像に貼り付けられる画像の数を決定します。
また、OC&Pには、ターゲット貼り付けとインスタンス貼り付けの2つの新しいイノベーションがあります。
ターゲット貼り付けでは、画像内の既存のインスタンスに近い場所に画像が貼り付けられます。
インスタンス貼り付けでは、貼り付けられたインスタンスが「独特の見た目」を示さないようにします。

OC&Pを既存の認識フレームワークに追加することで、密接した人物の個別化が向上します。 ソース:https://arxiv.org/src/2210.03686v1/anc/OcclusionCopyPaste_Supplementary.pdf
さらに、OC&Pでは、貼り付けられたインスタンスの最小サイズを規定しています。
現実の厳しさ
OC&Pとその前身の研究では、画像の「リアリズム」や「写真のようなリアリティ」に低いプレミアムを置いています。画像の「リアリズム」は、画像認識システムの訓練に必ずしも重要ではないと考えられています。

新しい論文の補足資料から:ランダムブレンドを使用した画像の例。
データとテスト
テストのために、システムはMS COCOデータセットの「人物」クラスで訓練され、262,465人の画像が64,115枚の画像にわたって使用されました。
評価のために、OC&PはOCHumanベンチマークに対してテストされました。

2019年にリリースされたLVISは、Facebook Researchによる大規模なインスタンスセグメンテーションデータセットです。 ソース:https://arxiv.org/pdf/1908.03195.pdf
システムは、4つのNVIDIA V100 GPUで75エポック訓練され、Facebookの2021年リリースのDetectron 2の初期化パラメータに従って訓練されました。
結果
OC&Pは、MMDetectionとその3つの関連モデルに対するテストで、人間を識別する能力で明確なリードを示しました。

OC&Pは、PoSegとPose2Segを上回り、既存のフレームワークに汎用的に適用できることを示しました。
テキストから画像への合成の改善の可能性
リードオーサーであるEvan Lingは、OC&Pの主な利点は、元のマスクラベルを保持し、新しいコンテキストで新しい価値を得ることができることであると述べています。
Stable Diffusionなどのテキストから画像へのモデルは、人物の個別化に苦労していますが、OC&Pのようなアプローチを使用してこの問題を解決することができます。
ただし、Lingは、テキストから画像へのモデル訓練中に、OC&Pのような増強を使用する際の「リアリズム」の問題について懸念を表明しています。
CLIPは、セマンティックセグメンテーションに使用されており、OC&Pのようなシステムを使用して、テキストから画像へのモデルの出力をフィルタリングまたは分類することができます。

OpenAIのCLIPフレームワークを使用したセマンティックセグメンテーション。 ソース:https://openaccess.thecvf.com/content/CVPR2022/papers/Wang_CRIS_CLIP-Driven_Referring_Image_Segmentation_CVPR_2022_paper.pdf
「人間の融合」の問題は、テキストから画像へのモデルで発生する問題ですが、OC&Pのようなアプローチを使用してこの問題を解決することができます。
「人間の融合」が発生するかどうかは、テキストから画像へのモデルの訓練中に、インスタンスレベルのガイダンスを提供することで判断できるかもしれません。
「人間の融合」が問題となるのは、テキストから画像へのモデルの出力が現実的でない場合です。
「人間の融合」の問題は、テキストから画像へのモデルの訓練中に、OC&Pのような増強を使用することで解決できる可能性があります。














