Andersonの視点
GoogleのImagicとRunwayの’Erase and Replace’を使用したAIアシストオブジェクト編集

今週、2つの新しいAI駆動のグラフィックスアルゴリズムが、ユーザーが写真内のオブジェクトに細かい変更を加えるための新しい方法を提供しています。
最初のものは、Imagicで、Google Researchとイスラエルの工科大学およびワイツマン科学研究所が共同で開発しました。Imagicは、拡散モデルを微調整することで、テキスト条件付きのオブジェクト編集を提供します。

変更したい部分だけを変更し、残りはそのままにしたい – Imagicは、変更したい部分だけを編集することを約束しています。ソース:https://arxiv.org/pdf/2210.09276.pdf
誰でもStable Diffusionの再レンダリングを変更しようとしたことがある人なら、1つの変更に成功するごとに、5つの変更が好みではないものになることを知っているでしょう。これは、現在、最も才能のあるSDエンスージャストがStable DiffusionとPhotoshopの間を頻繁に移動する理由です。Imagicの成果は、単にこの点から見ても注目に値するものです。
現在、Imagicにはまだプロモーションビデオがないため、Googleの慎重な態度を考えると、システムをテストする機会が得られるかどうかは不明です。
2番目の提供は、Runway MLのよりアクセスしやすいErase and Replace機能です。これは、オンライン上の機械学習ベースの視覚効果ユーティリティの「AI Magic Tools」セクションに新しく追加された機能です。

Runway MLのErase and Replace機能は、テキストからビデオへの編集システムのプレビューで既に確認できます。ソース:https://www.youtube.com/watch?v=41Qb58ZPO60
RunwayのErase and Replace機能を見てみましょう。
Erase and Replace
Imagicと同様に、Erase and Replaceは静止画像のみを扱いますが、Runwayはプレビューで、まだリリースされていないテキストからビデオへの編集ソリューションで同様の機能を示しています。

誰でも画像でのErase and Replaceをテストできますが、ビデオ版はまだ公開されていません。ソース:https://twitter.com/runwayml/status/1568220303808991232
Runway MLは、Erase and Replaceの背後にある技術の詳細を公開していないため、Stable Diffusionのような拡散モデル(または、はるかに可能性が低いDALL-E 2)が、Erase and Replaceで選択したオブジェクトを再構築するエンジンであると推測されます。

家具をロナルド・リーガンの胸像に置き換えることは、高速ではありませんが、かなり速いです。ソース:https://app.runwayml.com/
システムには、DALL-E 2タイプの制限があります。画像やテキストがErase and Replaceのフィルタをトリガーする場合は、さらに違反があればアカウントが停止される可能性があるという警告が表示されます。これは、OpenAIのDALL-E 2のポリシーとほぼ同じです。
多くの結果は、Stable Diffusionの典型的な粗いエッジが見られません。Runway MLは、SDの投資家および研究パートナーであり、独自のモデルを訓練している可能性があります。これは、現在一般の人々が扱っているオープンソースの1.4チェックポイント重みよりも優れています。

Runway MLのErase and Replaceで、テーブルを「氷のテーブル」に置き換えます。
Imagicと同様に、Erase and Replaceは「オブジェクト指向」です。つまり、空の画像部分を消去してテキストプロンプトの結果でペイントすることはできません。代わりに、システムはマスクの視線に沿った最も近いオブジェクト(壁やテレビなど)をトレースし、そこに変換を適用します。
コピーライト画像の使用について、Erase and Replaceが回避しているか、または使用しているモデルが最適化されていないかは判断が難しいです。

ニコール・キッドマンの「壁画」は、DALL-E 2の以前の実装とは異なり、現実的な顔や性的コンテンツを拒否しないことを示しています。コピーライト作品の試みの結果は、曖昧(「ゼノモルフ」)から馬鹿げている(「鉄の玉座」)まで幅があります。右下のインセットは、ソース画像です。
オブジェクトを置き換えることができるErase and Replaceが使用している方法について知ることは興味深いことです。画像がCLIPの派生物を介してオブジェクト認識とセマンティックセグメンテーションによって個別化されることが推測されます。これらの操作は、一般的なStable Diffusionのインストールではほとんど機能しません。
しかし、完璧なものはありません。システムは、根本的なレンダリングメカニズムがテキストプロンプトを理解している場合でも、置き換えずに消去するだけの場合があります。ここでは、コーヒーテーブルをゼノモルフに変換することができません。代わりに、テーブルは消えます。

「ウォーリーを探せ」のより怖いバージョン – Erase and Replaceは、エイリアンを生成できません。
Erase and Replaceは、優れたオブジェクト置き換えシステムであり、インペイントも優れています。ただし、既存の認識されたオブジェクトを編集することはできません。置き換えるだけです。実際に既存の画像コンテンツを変更することなく、周囲の素材を損なわないことは、コンピュータビジョン研究の分野が潜在的な空間のさまざまなフレームワークで解離を目指して努力していることと関連しています。
Imagic
これは、Imagicが解決しようとしている課題です。新しい論文には、個々の写真のファセットを変更しながら、画像の残りの部分を変更せずに編集する多くの例が示されています。

Imagicでは、編集された画像は、ディープフェイクのパペット操作で利用される単一画像から得られる限られた先行情報によって特徴付けられる、引き伸ばし、歪み、オクルージョンの推測という特徴的な特性がないです。
システムでは、3段階のプロセスが使用されます。テキスト埋め込みの最適化、モデル微調整、そして最終的に編集された画像の生成です。

Imagicは、ターゲットテキストプロンプトをエンコードして初期のテキスト埋め込みを取得し、次に結果を最適化して入力画像を取得します。その後、生成モデルをソース画像に微調整し、パラメータの範囲を追加して、リクエストされた補間を実行します。
フレームワークは、GoogleのImagenテキストからビデオのアーキテクチャに基づいていますが、研究者は、システムの原則は、潜在的な拡散モデルに広く適用可能であると述べています。
Imagenは、会社の最近のテキストからビデオへのイテレーションで使用される7層のアレイではなく、3層のアーキテクチャを使用します。3つの異なるモジュールは、64x64pxの解像度で動作する生成的な拡散モデル、出力を256x256pxにアップスケールするスーパーリゾリューションモデル、そして出力を1024×1024の解像度までアップスケールする追加のスーパーリゾリューションモデルで構成されます。
Imagicは、このプロセスの最初の段階で介入し、64px段階でアダム最適化器を使用して、静的な学習率0.0001で要求されたテキスト埋め込みを最適化します。

これは、解離のマスタークラスです。拡散、GAN、またはNeRFモデルでレンダリングされたオブジェクトの色を変更しようとしたことがある人は、Imagicがそのような変換を、画像の残りの部分の整合性を「引き裂かず」に実行することの重要性を理解するでしょう。
微調整は、Imagenの基本モデルで、入力画像ごとに1500ステップで、修正された埋め込みに条件付けられて行われます。同時に、2次的な64px>256pxレイヤーが、条件付き画像で並列に最適化されます。研究者は、最終的な256px>1024pxレイヤーに対する同様の最適化は、結果にほとんど影響がないため、実装していないと述べています。
論文によると、最適化プロセスは、双子のTPUV4チップで約8分かかります。最終的なレンダリングは、コアImagenのDDIMサンプリングスキームで行われます。
GoogleのDreamBoothの微調整プロセスと同様に、結果として得られる埋め込みは、スタイリゼーションに加えて、基礎となるデータベースから得られた情報を含む写実的な編集にも使用できます(最初の列に示されているように、ソース画像にはこれらの変換を実行するために必要なコンテンツがないためです)。

Imagicを使用すると、写実的な動きと編集が可能になります。また、得られたコードは、スタイリッシュな出力にも使用できます。
研究者は、Imagicを、2021年のスタンフォード大学とカーネギーメロン大学の共同研究である、GANベースのアプローチであるSDEdit、および2022年4月のワイズマン科学研究所とNVIDIAの共同研究であるText2Liveと比較しました。

Imagic、SDEdit、Text2Liveの比較。
これら以前のアプローチは苦労していることは明らかですが、下の行では、ソース素材の大きなポーズの変更を挿入することが含まれており、他のアプローチは完全に失敗していますが、Imagicは注目に値する成功を収めています。
Imagicのリソース要件と画像ごとの訓練時間は、他のものと比較して短いものの、ローカル画像編集アプリケーションへの組み込みには適していません。微調整プロセスを消費者レベルに下げることができるかどうかは不明です。
現在、Imagicは、APIに適した印象的な提供であり、Google Researchは、ディープフェイクを促進することに対する批判に敏感であるため、むしろこの環境で最も快適に感じるかもしれません。
その程度です。
2022年10月18日に初めて公開されました。













