Andersonの視点

人間の注意を利用することで、AIによって生成された画像を改善できる

mm
Unite.AI を Google の優先ソースに追加
An AI-generated image by ChatGPT. Prompt: ' a panoramic image representing salient object detection, featuring a person. The salient heat-map should be clear and obvious, and this illustration should be in the style of results from scientific papers about saliency maps'

中国からの新しい研究は、潜在的拡散モデル(LDM)であるStable Diffusionなどの画像を改善する方法を提案しています。

この方法は、画像の目立つ領域、つまり人間の注意を引き付ける可能性のある領域を最適化することに焦点を当てています。

新しい研究では、注目度マップ(左から4列目)をフィルターやマスクとして使用して、ノイズ除去プロセスにおける注目点を画像の人間が最も注意を払う領域に向けることができることがわかりました。ソース: https://arxiv.org/pdf/2410.10257

新しい研究では、注目度マップ(左から4列目)をフィルターやマスクとして使用して、ノイズ除去プロセスにおける注目点を画像の人間が最も注意を払う領域に向けることができることがわかりました。ソース: https://arxiv.org/pdf/2410.10257

従来の方法は、画像全体を均一に最適化しますが、新しいアプローチは、人間が重要と考える領域を優先するために、注目度検出器を使用します。

量的および質的テストでは、研究者の方法は、画像の品質とテキストプロンプトへの忠実性の両方で、以前の拡散ベースのモデルを上回ることができました。

新しいアプローチは、100人の参加者を含む人間の認識試験でも最高の結果を達成しました。

自然選択

注目度、つまり現実世界と画像で情報を優先する能力は、人間の視覚の重要な部分です。

例えば、クラシックアートでは、重要な領域、たとえば肖像画の顔や海を描いた絵の船のマストに、より詳細な注意が払われます。これらの例では、芸術家の注意は中心的な主題に集中し、背景や遠くの波などの広い詳細は、よりスケッチ的で、より広い表現になります。

人間の研究に基づいて、過去10年間に、人間の関心点を画像の中で再現または近似することができる機械学習方法が開発されてきました。

オブジェクトセグメンテーション(セマンティックセグメンテーション)は、画像の側面を個別化し、対応する注目度マップを開発するのに役立ちます。ソース: https://arxiv.org/pdf/1312.6034

オブジェクトセグメンテーション(セマンティックセグメンテーション)は、画像の側面を個別化し、対応する注目度マップを開発するのに役立ちます。ソース: https://arxiv.org/pdf/1312.6034

研究文献の流れの中で、過去5年間で最も人気のある注目度マップ検出器は、2016年のグラディエント重み付けクラスアクティベーションマッピング(Grad-CAM)イニシアチブでしたが、後にGrad-CAM++システムに進化しました。

Grad-CAMは、セマンティックトークン(たとえば「犬」または「猫」)のグラディエントアクティベーションを使用して、概念または注釈が画像の中で表現される可能性のある視覚的なマップを生成します。

オリジナルのGrad-CAMペーパーからの例。2列目では、ガイド付きのバックプロパゲーションがすべての寄与要素を個別化します。3列目では、2つの概念「犬」と「猫」のセマンティックマップが描かれます。4列目は、前の2つの推論の結合を表します。5列目は、推論に対応するオクルージョン(マスキング)マップを表します。最後に、6列目では、Grad-CAMがResNet-18レイヤーを視覚化します。ソース: https://arxiv.org/pdf/1610.02391

オリジナルのGrad-CAMペーパーからの例。2列目では、ガイド付きのバックプロパゲーションがすべての寄与要素を個別化します。3列目では、2つの概念「犬」と「猫」のセマンティックマップが描かれます。4列目は、前の2つの推論の結合を表します。5列目は、推論に対応するオクルージョン(マスキング)マップを表します。最後に、6列目では、Grad-CAMがResNet-18レイヤーを視覚化します。ソース: https://arxiv.org/pdf/1610.02391

人間の調査では、これらの方法によって得られた結果と人間の注意の間に関連性があることが明らかになりました。

SGOOL

新しい論文では、Stable DiffusionやFluxなどのテキストから画像(および、潜在的に、テキストからビデオ)へのシステムに注目度をもたらすことができることを検討しています。

ユーザーのテキストプロンプトを解釈する際、潜在的拡散モデルは、学習された視覚的な概念を探索します。これらの概念は、テキストプロンプトで使用される単語やフレーズと対応しています。次に、これらの概念をノイズ除去プロセスを通じて解釈します。ここで、ランダムなノイズは、ユーザーのテキストプロンプトの創造的な解釈に徐々に進化します。

しかし、この時点では、モデルは画像のすべての部分に均等な注意を払います。拡散モデルが2022年に普及し、OpenAIのDall-E画像ジェネレーターが利用可能になり、Stability.aiのStable Diffusionフレームワークがオープンソース化された後、ユーザーは「重要な」画像のセクションがしばしば不足していることに気づきました。

人間の描写では、人物の顔(最大の重要性)は、画像の10〜35%を占める可能性があります。この民主的な注意の分配方法は、人間の認識と芸術および写真の歴史に反します。

人物のジーンズのボタンが目に同じ計算量を与えられる場合、リソースの割り当ては最適化されていないと言えるでしょう。

したがって、著者によって提案された新しい方法、注目度ガイドによる拡散潜在変数の最適化(SGOOL)は、画像の無視された領域に注目度を高めるために、注目度マッパーを使用します。

方法

SGOOLパイプラインには、画像生成、注目度マッピング、最適化が含まれ、全体の画像と注目度を改良した画像が共同で処理されます。

SGOOLの概念スキーマ

SGOOLの概念スキーマ

拡散モデルの潜在的な埋め込みは、ファインチューニングによって直接最適化され、特定のモデルをトレーニングする必要性がなくなります。スタンフォード大学のノイズ除去拡散暗黙モデル(DDIM)サンプリング方法は、Stable Diffusionのユーザーにとってよく知られているものですが、注目度マップによって提供される二次的な情報を組み込むために適応されています。

論文では、次のように述べられています:

「私たちはまず、人間の視覚注意システムを模倣するために注目度検出器を使用し、注目度のある領域をマークします。追加のモデルを再トレーニングすることを避けるために、私たちの方法は直接拡散潜在変数を最適化します。

「さらに、SGOOLは可逆的な拡散プロセスを使用し、それに定数メモリ実装の利点を与えます。したがって、私たちの方法はパラメータ効率が良く、プラグアンドプレイのファインチューニング方法になります。広範な実験は複数のメトリックと人間の評価で行われました。」

この方法では、ノイズ除去プロセスを複数回繰り返す必要があるため、著者は拡散潜在変数の直接最適化(DOODL)フレームワークを採用しました。これは、可逆的な拡散プロセスを提供しますが、まだ画像全体に注目度を与えます。

注目度のある領域を定義するために、研究者は、2022年のTransalNetフレームワークを使用しました。

2022年のTransalNetプロジェクトからの注目度検出の例。ソース: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf

2022年のTransalNetプロジェクトからの注目度検出の例。ソース: https://discovery.dundee.ac.uk/ws/portalfiles/portal/89737376/1_s2.0_S0925231222004714_main.pdf

TransalNetによって処理された注目度のある領域は、人間にとって最も興味深い結論的な注目度セクションを生成するために切り出されました。

ユーザーのテキストと画像の違いを考慮する必要があります。つまり、プロセスが機能しているかどうかを判断することができる損失関数を定義する必要があります。そのためには、OpenAIのCLIPのバージョンが使用され、テキストプロンプトと画像の出力の間の意味的距離の見積もりも考慮されました。

著者は次のように述べています:

「最終的な損失関数は、注目度のある部分と画像全体の関係を同時に考慮し、生成プロセスでローカル詳細とグローバル一貫性のバランスを取るのに役立ちます。

「この注目度を意識した損失は、画像潜在変数を最適化するために使用されます。勾配はノイズ(潜在変数)で計算され、入力プロンプトの影響を、生成された画像の両方の注目度のある側面とグローバルな側面に強化するために使用されます。」

データとテスト

SGOOLをテストするために、著者は、Stable Diffusion V1.4の「バニラ」配布(テスト結果では「SD」と表記)とCLIPガイダンスを使用したStable Diffusion(結果では「ベースライン」と表記)を使用しました。

システムは、3つのパブリックデータセットに対して評価されました:CommonSyntacticProcesses(CSP)、DrawBench、およびDailyDallE*。

後者には、OpenAIのブログ投稿で紹介されたアーティストによる99の詳細なプロンプトが含まれています。DrawBenchには、11のカテゴリにわたる200のプロンプトがあります。CSPは、8つの多様な文法のケースに基づく52のプロンプトで構成されています。

SD、ベースライン、SGOOLのテストでは、CLIPモデルはViT/B-32よりも画像とテキストの埋め込みを生成するために使用されました。同じプロンプトとランダムシードが使用されました。出力サイズは256×256で、TransalNetのデフォルトの重みと設定が使用されました。

CLIPスコアメトリックに加えて、人間の好みスコア(HPS)が使用され、100人の参加者を含む実世界の研究も行われました。

SGOOLと以前の構成の比較による量的結果

SGOOLと以前の構成の比較による量的結果

量的結果について、論文では次のように述べています:

「私たちのモデルは、CLIPスコアとHPSの両方のメトリックで、すべてのデータセットでSDとベースラインを大幅に上回ります。私たちのモデルのCLIPスコアとHPSの平均は、2位のそれぞれ3.05と0.0029高くなります。」

著者は、以前のアプローチに対するHPSとCLIPスコアのボックスプロットも推定しました。

テストで得られたHPSとCLIPスコアのボックスプロット

テストで得られたHPSとCLIPスコアのボックスプロット

彼らは次のように述べています:

「私たちのモデルは他のモデルを上回り、画像を生成する能力が高いことを示しています。

「しかし、ボックスプロットでは、評価メトリックのサイズが[0, 1]であるため、ボックスプロットから比較を視覚化することは容易ではありません。したがって、対応する棒プロットをプロットします。

「SGOOLは、CLIPスコアとHPSの両方のメトリックで、すべてのデータセットでSDとベースラインを上回ります。量的結果は、画像を生成する能力が高いことを示しています。」

研究者は、ベースラインモデルは画像の品質を改善できるものの、画像の注目度のある領域を考慮していないと述べています。SGOOLは、グローバル画像評価と注目度のある画像評価の妥協点に到達することで、より優れた画像を取得することができると主張しています。

自動比較では、SGOOLとDOODLの両方で、最適化の数は50に設定されました。

テストの結果。ソースペーパーを参照してください。

テストの結果。ソースペーパーを参照してください。

テストの結果。ソースペーパーを参照してください。

ここで、著者は次のように述べています:

「最初の行では、プロンプトの主題は「猫が歌っている」と「理髪店の四重奏」です。SDによって生成された画像には4匹の猫がいて、画像の内容はプロンプトと悪く一致しています。

「ベースラインによって生成された画像では、猫が無視されており、顔や画像の詳細が欠けています。DOODLは、プロンプトと一致する画像を生成しようとします。

「しかし、DOODLは画像全体を直接最適化するため、画像の中の人物は猫に向けて最適化されます。」

彼らはさらに、SGOOLは、元のプロンプトとより一致する画像を生成することを指摘しています。

人間の認識テストでは、100人のボランティアが、テスト画像の品質と意味の整合性(テキストプロンプトへの忠実性)を評価しました。参加者は選択に無制限の時間を与えられました。

人間の認識テストの結果

人間の認識テストの結果

論文では、著者の方法は以前のアプローチよりも著しく優れていると指摘しています。

結論

Stable Diffusionの局所的なインストールでこの論文で扱われている欠点が明らかになった直後、After Detailerなどのカスタム方法が、システムが人間の関心のある領域に追加の注意を適用するように強制するために登場しました。

しかし、このようなアプローチでは、拡散システムが正常にプロセスを通じて画像のすべての部分に均等な注意を適用する必要があり、増加した作業は追加のステージとして行われます。

SGOOLからの証拠は、画像のセクションの優先順位に基本的な人間の心理学を適用することで、初期の推論を大幅に改善できることを示唆しています。ポストプロセッシングステップは不要です。

 

* 論文では、CommonSyntacticProcessesと同じリンクが提供されます。

2024年10月17日(水曜日)に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai