Andersonの視点

DALL-E 2のような純粋な画像合成フレームワークの検出システム

mm
Unite.AI を Google の優先ソースに追加

カリフォルニア大学バークレー校からの新しい研究は、Open AIのDALL-E 2やGoogleのImagenPartiなどの新しい画像合成フレームワークからの出力が「非リアル」と検出できる方法を提供しています。これは、合成された画像に現れる幾何学、影、反射を調査することによって実現されます。

DALL-E 2でテキストプロンプトによって生成された画像を調査した研究者は、DALL-E 2のアーキテクチャが印象的なリアリズムを実現できるにもかかわらず、グローバルな視点のレンダリング、影の作成と配置、特に反射オブジェクトのレンダリングに関連する一貫性のない点がいくつか存在することを発見しました。

論文には以下のように記載されています:

‘[幾何学的]構造、投影された影、鏡面での反射は、自然なシーンの期待される視点幾何学と完全に一致していない。幾何学的構造と影は、一般的にローカル的に一致しているが、グローバル的に一致していない。 ‘

‘一方、反射は、訓練画像データセットに含まれる頻度が低いため、ありそうもない方法でレンダリングされることが多い。’

DALL-E 2画像の検出方法として、レンダリングされたオブジェクトとその反射の間の一貫した交差点の欠如が現在有効であるとされる。ソース: https://arxiv.org/pdf/2206.14617.pdf

DALL-E 2画像の検出方法として、レンダリングされたオブジェクトとその反射の間の一貫した交差点の欠如が現在有効であるとされる。ソース: https://arxiv.org/pdf/2206.14617.pdf

この論文は、画像合成検出というコンピュータビジョン研究コミュニティにおける将来の重要な分野への初めての挑戦を表しています。

2017年のディープフェイクの出現以来、ディープフェイク検出(主にオートエンコーダーの出力からのDeepFaceLabFaceSwapなどのパッケージ)が活発で競争的な学術的な分野となり、さまざまな論文や方法論が、合成された顔の進化する「特徴」を標的としています。

しかし、最近まで、テキストプロンプトシステム(例:CLIP)からの出力は、写真のリアリズムの現状に対して脅威ではありませんでした。論文の著者は、これが変化しつつあると考え、DALL-E 2の出力で発見された一貫性のない点は、画像の視聴者を欺く可能性に対して大きな違いをもたらさないと考えています。

著者は以下のように述べています:

‘[そのような]失敗は、幾何学的な判断における一貫性のない点、照明、影、反射、視点、視点歪みなどに対して、人間の視覚システムが驚くほど不器用であることが発見されているため、人間の視覚システムにとって大きな違いをもたらさないかもしれません。’

信頼性の消失

著者は、DALL-E 2の出力の最初の法医学的調査を、視点投影(近くのオブジェクトとテクスチャーの直線の辺の配置が「消失点」に一貫して解決する方法)に関連付けました。

左、同一平面上の平行線は共通の消失点に解決する;右、同一平面および平行平面上の複数の消失点は消失線(赤で示される)を定義する。

左、同一平面上の平行線は共通の消失点に解決する;右、同一平面および平行平面上の複数の消失点は消失線(赤で示される)を定義する。

この点をテストするために、著者はDALL-E 2を使用して、25枚の合成されたキッチン画像を生成しました。これは、通常、多くの可能な消失点を提供することができる、一般的な空間です。

プロンプト「タイル張りの床のあるキッチンの写真」を使用して生成された画像を調査した研究者は、各画像が一般的にリアルな表現を示していること(いくつかの小さなアーティファクトを除く)、しかし、オブジェクトが正しく収束していないことを発見しました。

著者は、タイルパターンの各平行線が一貫して交差し、一つの消失点(青)に収束することを観察しましたが、カウンタートップ(シアン)の消失点は、消失線(赤)やタイルからの消失点と一致しませんでした。

著者は、カウンタートップがタイルに平行でない場合でも、シアンの消失点はタイルからの消失線(赤)に解決するべきであると述べています。

論文には以下のように記載されています:

‘これらの画像の視点は、印象的にローカル的に一致していますが、グローバル的に一致していません。このパターンは、25枚の合成されたキッチン画像すべてで発見されました。’

影の法医学

影も、単一または複数の光源を示す消失点を持つ可能性があります。外部の影の場合、厳しい日光の場合、画像のすべての面の影が一貫して一つの光源(太陽)に解決することが期待されます。

前の実験と同様に、研究者は「日曜日の日中に撮影されたsidewalk上の3つのキューブ」のプロンプトで25枚のDALL-E 2画像を生成しました。また、「曇りの日中に撮影されたsidewalk上の3つのキューブ」のプロンプトでさらに25枚の画像を生成しました。

上段、研究者のプロンプト「曇りの日中に撮影されたsidewalk上の3つのキューブ」で生成された画像;下段、プロンプト「日曜日の日中に撮影されたsidewalk上の3つのキューブ」で生成された画像。

上段、研究者のプロンプト「曇りの日中に撮影されたsidewalk上の3つのキューブ」で生成された画像;下段、プロンプト「日曜日の日中に撮影されたsidewalk上の3つのキューブ」で生成された画像。

研究者は、曇りの条件を表現する場合、DALL-E 2は関連する影をリアルな方法でレンダリングできることを観察しました。ただし、日曜日の写真のいくつかは、単一の光源によって照らされたシーンと一致していませんでした。

上記の画像は、明度を調整して明確化するためにグレースケールに変換されています。各オブジェクトが独自の「太陽」を持っていることを示しています。

一部の生成された画像には、より明らかな「影の失敗」の例がありました:

DALL-E 2における反射

最も批判的な結果は、DALL-E 2の高反射表面の生成能力をテストしたときに得られました。これは、CGIレンダリングや従来のレンダリングアルゴリズムでも計算上の負担が大きい処理です。

この実験のために、著者は「バニティミラーに映ったおもちゃの恐竜の写真」のプロンプトで25枚のDALL-E 2画像を生成しました。

すべてのケースで、著者はレンダリングされたおもちゃの恐竜のミラーイメージが、実際の恐竜の姿や配置と一貫性のない方法でレンダリングされたことを報告しています。著者は、この問題はテキストプロンプトの変化に抵抗していることを述べています。システムの基本的な弱点のようです。

一部のエラーには論理的な説明があるようです。上段の最初と3番目の例は、恐竜が「複製」されているように見えますが、ミラーイメージではありません。

著者は以下のように述べています:

‘前のセクションでの投影された影や幾何学的構造とは異なり、DALL·E-2は、訓練画像データセットに含まれる頻度が低いため、ありそうもない反射を合成するのに苦労しているようです。’

これらのようなグリッチは、将来のテキストから画像へのモデルが、出力の全体的なセマンティックロジックをより効果的にレビューし、シーンに抽象的な物理的なルールを課すことができるようになれば、解消される可能性があります。

著者は、合成アーキテクチャがますます大規模化する傾向が強まっていることを考慮して、以下のように結論付けています:

‘[それは]、ペイントバイテキスト合成エンジンが完全な視点の一貫性を持った画像をレンダリングすることを学ぶまで時間の問題かもしれません。ただし、その間、幾何学的法医学的分析はこれらの画像を分析するのに役立つことがあります。’

* 著者によるインライン引用のハイパーリンクへの変換。

初版は2022年6月30日に公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai