Andersonの視点

ユニチューン:Googleの代替ニューラルイメージ編集技術

mm
Unite.AI を Google の優先ソースに追加

Google Researchは、テキストベースのイメージ編集に対して、多角的なアプローチを取っているようです。先週のImagic論文の発表に続き、Googleは、別の潜在的な方法を提案しました。UniTuneと呼ばれるこの新しい方法は、画像を編集するために、テキストコマンドを使用します。

プロジェクトの論文に示されている例から、UniTuneは、セマンティックポーズとアイデアを実際の画像コンテンツから分離することに、驚くほどの程度の成功を収めています。

ユニチューンのセマンティック構成のコマンドは、優れています。上段の画像の右側の画像を見てください。2人の人の顔は、他の部分の変換によって歪んでいません。

ユニチューンのセマンティック構成のコマンドは、優れています。上段の画像の右側の画像を見てください。2人の人の顔は、他の部分の変換によって歪んでいません。

Stable Diffusionのファンは、画像の部分的なセクションに編集を適用することは、時々不可能な操作であることを学んできました。人気のある配布版であるAUTOMATIC1111は、ローカル編集と制限された編集のマスクを作成できますが、このプロセスは難しく、予測不可能です。

明らかな答えは、コンピュータビジョンの専門家にとって、セマンティックセグメンテーションの層を挿入することです。これは、画像内のオブジェクトをユーザーの介入なしに認識して分離することができます。実際、最近、この考え方に基づく新しい取り組みがいくつかありました。

別の可能性は、OpenAIの影響力のあるContrastive Language-Image Pre-training(CLIP)モジュールを利用することです。これは、DALL-E 2やStable Diffusionなどの潜在的な拡散モデルの中核です。このコンテキストでは、CLIPは、テキストから画像へのモデルがユーザーにレンダリングを送信するポイントでフィルタおよび品質管理モジュールとして機能する必要があります。このアプローチは、Stability.aiのDreamStudio API駆動のポータルで採用されることになります。

しかし、CLIPは、ある意味で、問題と解決策の両方です。なぜなら、CLIPは、画像が進化する方法も教えたからです。さらに、ハードウェアの要件は、エンドユーザーがローカルで利用できるものを超える可能性があります。このアプローチは、理想的ではないかもしれません。

圧縮言語

提案されたユニチューンは、既存の拡散モデル(この場合は、GoogleのImagen)を「ファインチューン」します。ユニークなトークンがモデルに挿入され、テキストプロンプトに含めることで呼び出されます。

表面的な見方では、これはGoogleのDreamBoothのように見えます。DreamBoothは、既存のチェックポイントに新しいキャラクターやオブジェクトを挿入できます。ただし、研究者は、ユニチューンはこれらのアプローチを拒否したと主張しています。Textual Inversionは重要な詳細を省略し、DreamBoothは「悪くて、時間がかかった」ということです。

ユニチューンは、DreamBoothと同様のカプセル化されたセマンティック「メタプロンプト」アプローチを使用します。トレーナーによって選択されたユニークな単語で、トレーニングされた変更が呼び出されます。これらの単語は、すでにパブリックリリースモデルのトレーニングに使用されている用語と衝突しないように選択されます。

‘編集操作を実行するには、ファインチューンされたモデルをプロンプト「[rare_tokens] edit_prompt」でサンプリングします(例:「beikkpic 2匹の犬がレストランにいる」または「beikkpic ミニオン」)。’

プロセス

ユニチューンとImagicの間には、明らかな違いがあります。Imagicは「非圧縮」自然言語プロンプトを使用して画像編集操作を誘導しますが、ユニチューンは、DreamBoothスタイルのユニークなトークンをトレーニングします。

したがって、Imagicで編集を行う場合、次のように入力します…

ユニチューン論文から - ユニチューンは、Googleのライバルニューラル編集フレームワークであるSDEditと比較しています。ユニチューンの結果は、右側に表示されています。推定マスクは、2番目から左の画像に表示されています。

ユニチューン論文から – ユニチューンは、Googleのライバルニューラル編集フレームワークであるSDEditと比較しています。ユニチューンの結果は、右側に表示されています。推定マスクは、2番目から左の画像に表示されています。

.. ただし、ユニチューンのコマンドは、‘Guy at the back as [x]’ となります。ここで、x は、ファインチューンされた概念に結び付けられた、奇妙でユニークな単語です。

ユニチューンとImagicは、シングルイメージをシステムにフィードします。つまり、オリジナルの、純粋なイメージです。

これは、過去数年のGANベースの編集ツールが動作した方法と似ています。つまり、入力画像をGANの潜在的な空間に変換し、変更のために他の部分の潜在的な空間に送信します。

しかし、結果は、拡散モデルとこの方法によって、比較すると驚くほど正確です。

ファインチューニングプロセス

ユニチューン方法は、元の画像を、変更方法に関する一連の指示とともに、拡散モデルを介して送信します。実質的に、現在、Stable Diffusionのimg2img機能を使用してこれを行うことができますが、好ましい画像の部分を歪めることなく。

ユニチューンプロセス中、システムは「ファインチューン」されます。つまり、ユニチューンは、モデルを再トレーニングさせ、ほとんどのレイヤーを解凍します。通常、ファインチューニングは、高性能モデル全体の一般的な損失値を、新しく作成したい何らかの側面に代入します。

しかし、ユニチューンでは、モデルコピーは、使用後すぐに破棄される「使い捨て」の「殻」として扱われます。ファインチューニングプロセス中、モデルは、オリジナルの画像に基づいてバイアスされ、複数の画像/テキストのペアがシステムにフィードされます。

Imagicと同様に、主なチューニングは、Imagenの下位2つのレイヤー(64px、64px>256px、256px>1024px)で行われます。ただし、研究者は、最後のスーパーリゾリューションレイヤー(1024px)も最適化する潜在的な価値を見出しています。

64pxレイヤーでは、モデルはトレーニング中にベース画像にバイアスされ、128回のイテレーションでバッチサイズ4の複数の画像/テキストペアがシステムにフィードされます。Adafactorは、0.0001の学習率でロス関数として使用されます。

上記の操作は、同じノイズ増幅手順を使用して、64>256pxレイヤーに繰り返されます。

サンプリング

変更を、ファインチューンされたモデルから引き出すことができる、多くのサンプリング方法があります。Classifier Free Guidance(CFG)が含まれています。CFGは、基本的に、モデルが「想像力」を追求する自由度と、入力ソースデータに従う必要性のバランスを定義します。

Textual Inversionのように、ユニチューンは、元の画像に独自のグラフィックスタイルを適用することに適しています。

Textual Inversionのように、ユニチューンは、元の画像に独自のグラフィックスタイルを適用することに適しています。

研究者は、SDEditの「遅い開始」テクニックも実験しました。ここでは、システムは、元の詳細を保存するために、最初から部分的に「ノイズ」でなければなりませんが、基本的な特性を維持します。

研究者は、プロンプトツープロンプトも、テキストベースのテクニックとして使用しました。

‘「プロンプトツープロンプト」設定では、プロンプトガイダンスと呼ばれるテクニックが特に役立ちます。’

‘プロンプトガイダンスは、クラスフリーガイダンスと似ていますが、ベースラインは、無条件のモデルではなく、別のプロンプトです。 ‘

ユニチューンのプロンプトツープロンプト。実質的に、変更する領域を分離します。

ユニチューンのプロンプトツープロンプト。実質的に、変更する領域を分離します。

しかし、プロンプトガイダンスは、CFGが望ましい結果を得られなかった場合にのみ、時々必要でした。

開発中に遭遇したもう1つの新しいサンプリングアプローチは、補間 でした。ここでは、画像の領域は、元の画像と変更された画像が構成上非常に似ているため、より「無邪気な」補間を使用できます。

補間は、変換される領域が離れており、十分にマージンがある場合、ユニチューンのより大きな努力を不要にします。

補間は、変換される領域が離れており、十分にマージンがある場合、ユニチューンのより大きな努力を不要にします。

著者は、補間が、多くのターゲット画像の場合、デフォルト設定として使用できる可能性があると示唆しています。また、複雑なオクルージョンを交渉する必要がない場合、補間は、驚くほどの変換をもたらす可能性があると述べています。

ユニチューンは、編集マスクの有無に関係なく、ローカル編集を実行できます。また、独自に編集を配置することもできます。解釈力と、ソース入力データの本質的な要素の強固な固有化の、不思議な組み合わせを持ちます。

待機時間

最初のイテレーションは、常に遅いものになります。また、コミュニティの関与や企業のコミットメントによって、最終的にはリソースハングリーなルーチンを最適化してスピードアップする可能性があります。ただし、ユニチューンとImagicは、驚くほど素晴らしい編集を作成するために、かなり大きな機械学習マニューバを実行しています。したがって、どの程度このプロセスを、家庭用にスケールダウンできるかは疑問です。

現在、入力から結果までのラウンドトリップには約3分かかります。T4 GPUで、推論には約30秒追加されます(あらゆる推論ルーチンのように)。著者は、これが高待機時間であり、「インタラクティブ」とはほとんど称えられないと認めています。しかし、モデルは、初期にチューンされた後、ユーザーがプロセスを終了するまで、さらに編集を行うために利用可能なままであるため、編集ごとの時間が短縮されます。

 

2022年10月21日初出。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai