Andersonの視点

DALL-E 2はただの「ものを貼り合わせる」だけで、関係性を理解していないのか?

mm
Unite.AI を Google の優先ソースに追加

ハーバード大学の新しい研究論文によると、OpenAIの注目すべきテキストから画像へのフレームワークDALL-E 2は、合成された写真に組み込まれた要素間の関係を再現することに著しい困難を抱えていることがわかった。にもかかわらず、その出力の多くは驚くほど洗練されている。

研究者は、169人のクラウドソーシング参加者を募集し、最も基本的な人間の関係セマンティクス原則に基づいてDALL-E 2の画像とテキストプロンプトを提示した。参加者は、画像とプロンプトが関係しているかどうかを判断するように求められ、22%以下の画像がプロンプトに関連していることがわかった。

新しい論文の実験のスクリーンショット。参加者は、プロンプトに一致する画像をすべて選択するように求められた。インターフェイスの下部にある免責事項にもかかわらず、すべての画像は、参加者に知らされていないプロンプトから生成されたものであった。ソース:https://arxiv.org/pdf/2208.00005.pdf

新しい論文の実験のスクリーンショット。参加者は、プロンプトに一致する画像をすべて選択するように求められた。インターフェイスの下部にある免責事項にもかかわらず、すべての画像は、参加者に知らされていないプロンプトから生成されたものであった。 ソース:https://arxiv.org/pdf/2208.00005.pdf

結果はまた、DALL-Eの離散要素を結合する能力が、要素が現実世界のトレーニングデータセットで発生する可能性が低いほど低下することを示唆している。

例えば、「子供がボウルに触れる」というプロンプトの画像は87%の同意率(参加者がプロンプトに関連する画像をクリック)を得たが、同様の写実的な「猿がイグアナに触れる」というレンダリングは11%の同意率しか得られなかった。

DALL-Eは、イグアナに触れる猿というありそうもないイベントを描写するのに苦労している。トレーニングセットにこのイベントが存在しない可能性が高いからである。

DALL-Eは、イグアナに触れる猿というありそうもないイベントを描写するのに苦労している。トレーニングセットにこのイベントが存在しない可能性が高いからである。

2番目の例では、DALL-E 2は頻繁にスケールや種を間違えている。現実世界の画像にこのイベントが描かれていないためである。

DALL-Eの、激しく対比的な画像要素を並べる能力の難しさは、システムが要素を単純に組み合わせただけで、関係性を理解していないことを示唆している。

DALL-E 2の公式例から、カットアンドペーストのシンセシス。ソース:https://openai.com/dall-e-2/

DALL-E 2の公式例から、カットアンドペーストのシンセシス。 ソース:https://openai.com/dall-e-2/

新しい論文は*次のように述べている。

‘関係性の理解は、人間の知能の基本的な要素であり、発達の初期に現れ、認識において迅速に自動的に計算される。 ‘

‘DALL-E 2の基本的な空間関係(例:in、on、under)に対する困難は、システムが人間のように世界を柔軟に構造化することを可能にする表現を学習していないことを示唆している。 ‘

‘関係性の理解の直接的な解釈は、DALL-E 2のようなシステムが関係性の構成性を持っていないことを示唆している。 ‘

著者は、ロボティクスで使用されるアルゴリズムを活用することで、テキストガイド画像生成システムの関係性の理解を向上させることができると示唆している。

そのようなアプローチの1つは、CLIPメカニズムを使用するCLIPortである。

CLIPortは、ワシントン大学とNVIDIAの2021年の共同研究であり、CLIPを使用する。ソース:https://arxiv.org/pdf/2109.12098.pdf

CLIPortは、ワシントン大学とNVIDIAの2021年の共同研究であり、CLIPを使用する。 ソース:https://arxiv.org/pdf/2109.12098.pdf

著者はさらに、関係性の計算を生物システムの情報処理能力に基づいて行うことができることを示唆している。

新しい論文は、Testing Relational Understanding in Text-Guided Image Generationと題され、ハーバード大学の心理学部のColin ConwellとTomer D. Ullmanによって執筆された。

早期の批判を超えて

著者は、DALL-E 2の出力のリアリズムと完全性の背後にある「手品」をコメントしながら、以前の研究がDALL-Eスタイルの生成画像システムの欠点を発見したことを指摘している。

6月に、カリフォルニア大学バークレー校は、DALL-Eが反射と影を扱うのに苦労していることを示した。同月、韓国の研究は、DALL-E 2スタイルの出力の「独自性」と「独創性」を批判的に調査した。ニューヨーク大学とテキサス大学の初期分析は、DALL-E 2の画像の構成性とその他の重要な要素に関する問題を発見した。イリノイ大学とMITの共同研究は、システムの構成性に関するアーキテクチャの改善を提案した。

研究者はさらに、DALL-Eの著名人であるAditya Rameshが、バインディング、相対的なサイズ、テキストなどの課題に対するシステムの問題を認めていることを指摘している。

GoogleのイメージシンセシスシステムImagenの開発者は、DrawBenchと呼ばれる新しい比較システムを提案している。

代わりに、新しい論文の著者は、人間の推定を使用することで、画像の精度を評価し、システムの弱点を特定することができると示唆している。

研究

この目的のために、新しいプロジェクトは心理学的原則に基づいてアプローチをとり、現在のDALL-E 2の限界を克服するために必要な「ワークアラウンド」に対する関心の高まりから離れて、関係性の理解の限界を調査し、潜在的に克服することを目指している。

論文は次のように述べている。

‘現在の研究は、認知、発達、または言語文学で以前記述、調査、または提案された15の基本的な関係に焦点を当てている。セットには、接地された空間関係(例:X on Y)と、より抽象的なエージェント関係(例:XがYを助ける)が含まれる。 ‘

‘プロンプトは意図的にシンプルに設計されており、属性の複雑さや詳細は含まれていない。つまり、「ドーナツとオクトパスがゲームをしている。ドーナツはロープの1端を持っており、オクトパスはもう1端を持っている。ドーナツはロープを口に持っている。猫はロープを飛び越えている」というプロンプトではなく、「箱がナイフの上にある」というプロンプトを使用する。 ‘

‘このシンプルさは、人間の心理学のさまざまなサブドメインから広い範囲の関係を捉え、潜在的なモデル故障をより印象的で具体的にする。 ‘

研究者は、Prolificから169人の参加者を募集し、平均年齢は33歳で、59%が女性であった。

参加者は、プロンプトが上部に表示され、下部に免責事項が表示された18の画像を3×6のグリッドに配置されたものが提示された。参加者は、プロンプトに関連する画像を選択するように求められた。

参加者に提示された画像は、言語、発達、認知文学に基づいて作成され、8つの物理関係と7つの「エージェント関係」で構成されていた。

物理関係
in、on、under、covering、near、occluded by、hanging over、tied to

エージェント関係
pushing、pulling、touching、hitting、kicking、helping

これらの関係はすべて、以前述べた非CS分野の研究から導き出されたものである。

12のエンティティが、プロンプトに使用するために導き出された。6つのオブジェクトと6つのエージェントが含まれる。

オブジェクト
箱、シリンダー、ブランケット、ボウル、ティーカップ、ナイフ

エージェント
男、女、子供、ロボット、猿、イグアナ

(研究者は、イグアナを含めることは「ご褒美」であったと認めている)

各関係について、2つのエンティティを5回ランダムにサンプリングして5つの異なるプロンプトを作成し、合計75のプロンプトを作成した。各プロンプトはDALL-E 2に提出され、初期の18の画像が使用された。バリエーションや2回目のチャンスは許可されなかった。

結果

論文は次のように述べている。

‘参加者は平均して、DALL-E 2の画像とプロンプトの間で低い同意率を報告した。75の異なるプロンプト全体で、平均22.2%[18.3、26.6]。 ‘

‘エージェントプロンプトは、35のプロンプト全体で平均28.4%[22.8、34.2]の同意率を示し、物理プロンプトよりも高い同意率を示した。物理プロンプトは、40のプロンプト全体で平均16.9%[11.9、23.0]の同意率を示した。 ‘

研究の結果。黒い点はすべてのプロンプトを表し、各点は個々のプロンプトである。色は、プロンプトの主題がエージェントまたは物理的であるかどうか(例:オブジェクト)によって分けられる。

研究の結果。黒い点はすべてのプロンプトを表し、各点は個々のプロンプトである。色は、プロンプトの主題がエージェントまたは物理的であるかどうか(例:オブジェクト)によって分けられる。

人間の認識とアルゴリズムの認識を比較するために、研究者は画像をOpenAIのオープンソースのViT-L/14 CLIPベースのフレームワークを使用して実行した。結果は、2つの結果セット間に中程度の関係があることを示した。

CLIP(ViT-L/14)との比較の結果。

CLIP(ViT-L/14)との比較の結果。

研究者は、システムのアーキテクチャ内にある他のメカニズムや、トレーニングセット内のデータの偶発的な過剰または欠如が、CLIPがDALL-Eの限界を認識できるものの、常に問題を解決できない理由を説明する可能性があると示唆している。

著者は、DALL-E 2は、関係性の理解を再現する能力を持っていないと結論付けている。

‘DALL-E 2のようなシステムが関係性の構成性を持っていないことは、誰もがDALL-E 2のプロンプトに対する驚くほど合理的な応答を見たことがある人にとっては驚くことである。ただし、構成性は、ものを新しい組み合わせで一緒に貼り合わせる能力だけではない。構成性は、ものを結びつける規則の理解を必要とする。関係性は、そのような規則である。 ‘

男がT-Rexを咬む

意見 OpenAIがDALL-E 2のベータ版をより多くのユーザーに公開し、ほとんどの生成には теперь費用がかかるようになったため、DALL-E 2の関係性の理解の限界は、各「失敗」が財政的な重みを持つため、より明らかになる可能性がある。

私たちがシステムを遊びやすくしていた頃、システムの「関係性のグリッチ」を観察することができた。

例えば、ジュラシックパークのファンにとって、DALL-E 2で恐竜が人を追いかけることは非常に難しい。コンセプトの「追いかける」はDALL-E 2の検閲システムには含まれておらず、恐竜映画の長い歴史(少なくともトレーラーと宣伝写真の形で)から、このありそうもない遭遇のための豊富なトレーニング例が提供されるはずである。

DALL-E 2のプロンプト「A color photo of a T-Rex chasing a man down a road」の典型的な応答。ソース:DALL-E 2

DALL-E 2のプロンプト「A color photo of a T-Rex chasing a man down a road」の典型的な応答。 ソース:DALL-E 2

私は、上記の画像が「[恐竜]が[人]を追いかける」というプロンプトのバリエーションに典型的な応答であることを発見した。プロンプトを詳細に説明しても、T-Rexを追いかけることはできない。

恐竜映画の宣伝写真から「男が恐竜と戦う」というトレーニングデータしか利用できない可能性があり、ジェフ・ゴールドブラムの有名な逃走シーンは、その小さなデータセットの中でのアウトライアーである可能性がある。

 

* 著者のインライン引用をハイパーリンクに変換したもの。

初めて公開されたのは2022年8月4日。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai