Andersonの視点
ステーブル拡散が主流の消費者向け製品として発展する可能性

皮肉にも、世界を席巻している新しいAI画像合成フレームワークであるステーブル拡散は、まだ「安定した」わけでも「拡散した」わけでもない。少なくとも今のところは。
ステーブル拡散の機能は、数多くの開発者がDiscordの様々なコミュニティで最新の情報や理論を交換しているため、様々な形で提供されています。また、インストール手順も「プラグアンドプレイ」ではなく、コマンドラインやBATファイルを使用したインストールが必要です。
これらのソフトウェアパッケージは、一般の消費者にとっては珍しいものであり、そのインストールは souvent アンチウイルスやマルウェア対策ソフトによって検知されます。

ステーブル拡散の標準インストール手順のうちの一部。多くの配布版では、特定のPythonバージョンが必要であり、これは既存のバージョンと衝突する可能性があります。ただし、DockerベースのインストールやConda環境の使用によって回避できます。
ステーブル拡散コミュニティのスレッドは、Pythonスクリプトのハッキングや標準インストールの改善に関するヒントやテクニックで溢れています。
これにより、素晴らしい画像を作成したい一般の消費者は、ほとんどの場合、無料画像生成の回数が制限されているAPIウェブインターフェースに頼らざるを得ません。これらのウェブベースのサービスは、ほとんどがNSFWコンテンツ(多くは一般的な関心事である「戦争」などの非ポルノグラフィックなテーマに関するもの)を出力しないことで、ステーブル拡散をOpenAIのDALL-E 2と区別しています。
ステーブル拡散のための「Photoshop」
世界は、Twitterの#stablediffusionハッシュタグに毎日登場する、素晴らしい画像、セクシーな画像、またはその他の世界の画像に魅了されています。待ち望まれているのは、「ステーブル拡散のためのPhotoshop」です。つまり、Stability.aiのアーキテクチャーと、ステーブル拡散開発コミュニティの様々な革新的なアイデアを組み込んだ、クロスプラットフォームでインストール可能なアプリケーションです。
現在、ほとんどの機能的なインストールでは、ウェブページがコマンドラインウィンドウに乗っかっており、localhostのポートでアクセスできます。

CLI駆動の合成アプリであるFaceSwapやBAT中心のDeepFaceLabと同様に、ステーブル拡散の「prepack」インストールは、localhostポート(画像の上部参照)経由でアクセスされるコマンドラインベースのインターフェースを示しています。
間違いなく、より洗練されたアプリケーションが登場するでしょう。すでに、Patreonベースの統合アプリケーションがダウンロード可能です。例えば、GRiskやNMKD(以下の画像参照)があります。しかし、これらのアプリケーションはまだ、ステーブル拡散の高度な実装で提供できる機能のすべてを統合していません。

ステーブル拡散のPatreonベースのパッケージ。NMKDは、CLI出力をGUIに直接統合した最初のアプリケーションです。
ステーブル拡散が主流の消費者向け製品として発展する可能性について考えてみましょう。どのような機能が含まれる可能性がありますか。
完全に資金提供された商用ステーブル拡散アプリケーションの法的考慮
NSFW要因
ステーブル拡散のソースコードは、商用の再実装や派生作品を禁止しない非常に寛容なライセンスで公開されています。
既存のPatreonベースのステーブル拡散ビルドや、Figma、Krita、Photoshop、GIMP、Blender(以下参照)向けに開発されている多数のアプリケーションプラグインに加えて、十分に資金提供されたソフトウェア開発会社が、より洗練されたステーブル拡散アプリケーションを開発することは、市場の観点から見ても妥当です。
ここで、すぐに問題が生じます。多くのWeb APIと同様に、ステーブル拡散のネイティブNSFWフィルタ(コードの断片)をオフにするかどうかです。
NSFWスイッチの「隠蔽」
Stability.aiのステーブル拡散のオープンソースライセンスには、使用が禁止されていると解釈できるアプリケーションのリストが含まれています(おそらくポルノグラフィックコンテンツやディープフェイクが含まれる)。
しかしながら、ベンダーがNSFWフィルタをPythonファイルではなく、オペコード化された実行可能ファイルにコンパイルするか、PythonファイルまたはDLLにチェックサム比較を実施することで、NSFWフィルタを有効にすることができます。
これにより、アプリケーションは、DALL-E 2と同様に「無力化」され、商業的魅力が低下します。さらに、コンパイルされたコンポーネント(元のPythonランタイム要素またはコンパイルされたDLLファイル)の改変バージョンが、制限を回避するためにトレント/ハッキングコミュニティで出現する可能性があります。
ベンダーは、Stability.aiの警告を繰り返すことで、NSFWコンテンツの使用を禁止することができます。
しかし、小規模なオープンソース開発者がこのような免責事項を使用しているのとは対照的に、大規模なソフトウェア会社は、ステーブル拡散を機能的で使いやすいものにするために多大な時間と金額を投資しているため、より深い検討が必要です。
ディープフェイクの責任
最近、LAION-aestheticsデータベース(ステーブル拡散のモデルが訓練された4.2億枚の画像の1つ)には、有名人の画像が多数含まれており、ユーザーが有名人のディープフェイクを作成できるようになりました。

最近の記事から、ステーブル拡散によって推測されたジェニファー・コネリーの4つのステージ。
これは、抽象的なポルノ(通常、実在の人物を描写しない)を生成することとは別の問題です。
多くの米国州や国がディープフェイクポルノに対する法律を制定または施行しているため、ステーブル拡散が有名人のディープフェイクを作成できる場合、商用アプリケーションがNSFWコンテンツを生成できる場合、有名人の顔のフィルタリング機能が必要になる可能性があります。
1つの方法は、有名人名や関連する架空のキャラクターとの関連付けを含む、ユーザープロンプトに受け入れられない用語の「ブラックリスト」を提供することです。
別のアプローチは、Clarifaiが開発した有名人認識システムを統合することです。
これらの方法は、有名人の顔が生成されないことを保証するものではありませんが、ソフトウェア製作者は、こうした機能を最初はオフにした状態で提供することで、単独のステーブル拡散アプリケーションが有名人の顔を作成しないようにすることができます。
含まれる可能性のある機能
ステーブル拡散のコア機能は、テキストプロンプトから適切な画像を生成する機能(テキストから画像)、スケッチや他の画像を新しい画像のガイドラインとして使用する機能(画像から画像)、システムの「想像力」を調整する機能、レンダリング時間と品質のトレードオフの機能などです。
これらは「バニラ」インストールです。開発中または拡張中の、より高度な機能について見てみましょう。
確率的凍結
Stable Diffusionは、EbSynthを使用して、リアルなビデオに変換するときに、特に問題を引き起こします。
これは、シードを再利用するだけでは、プロンプトやソース画像のいずれかが変更された場合に、Stable Diffusionが正確に変換を繰り返すことが非常に難しいためです。

EbSynthは、Stable Diffusionの変換をリアルなビデオに変換するための効果的な手段となります。ただし、動きが制限されている場合にのみ機能します。
これは、Stable Diffusionが、同じシードとプロンプトを使用していても、わずかな変更があるだけで、キーフレーム間で一貫性を維持するのに苦労することを示しています。

同じプロンプトとシードを使用していても、わずかな変更があるだけで、Stable Diffusionは、一貫性を維持するのに苦労します。
これは、Stable Diffusionが、特に複雑なシーンや動きのあるオブジェクトを扱うときに、特に問題を引き起こします。
この問題を解決する1つの方法は、各フレームの確率的エンコードを「凍結」する機能を提供することです。
クラウドベースのテキストインバージョン
一貫性のあるキャラクターとオブジェクトを生成するためのより良い解決策は、テキストインバージョンを「焼き込む」ことです。
これは、5KBのファイルで、5つの画像から数時間で訓練できます。特殊な「*」プロンプトで呼び出され、物語の中で一貫した外観の新しいキャラクターを生成できます。

テキストインバージョンを使用して、画像を離散的なエンティティに変換し、特殊なトークンで呼び出します。
テキストインバージョンは、Stable Diffusionが使用する大規模で完全に訓練されたモデルへの付加ファイルであり、プロンプトプロセスに「スリップストリーム」され、モデルから得られたシーンに参加し、オブジェクト、スタイル、環境、相互作用に関するモデルが持つ膨大な知識を活用できます。
しかし、テキストインバージョンを訓練するには、多大なVRAMが必要です。現在のチュートリアルによると、12GB、20GB、または40GBのVRAMが必要です。
多くのユーザーがそのようなGPUの力を持っていないため、クラウドサービスがこの作業を処理するために登場しています。Hugging Faceもこのサービスを提供しています。
プロンプトの重み付け
現在、プロンプトの重み付けを付ける方法は、実装によって異なります。
例えば、AUTOMATIC1111のStable Diffusionフォークでは、プロンプトの単語を角括弧で囲むと、重みを付けることができます。

角括弧と/または丸括弧を使用して、プロンプトの重みを調整します。
他の実装では、感嘆符を使用して重みを付けることができます。
アウトペインティング
OpenAIは、アウトペインティングを発表しました。これにより、ユーザーは画像をその境界を超えて拡張できます。
これは、Stable Diffusionでも実装されており、Kritaでも使用できます。

タイルベースの拡張により、標準の512×512レンダリングをほぼ無限に拡張できます。
Stable Diffusionは、512x512pxの画像で訓練されているため、人間の被写体の頭や他の重要な身体部位を切り取ることがよくあります。

典型的なStable Diffusionの「首切り」例。アウトペインティングにより、ジョージ・クルーニーを画像に戻すことができます。
コンテキストを理解したマスキング
Stable Diffusionのマスキングは、実装によって異なります。
マスキングが可能な場合でも、指定された領域が、画像の他の部分を考慮せずにペイントされることがあります。
セマンティック編集は、画像を構築したノイズを特定することで、画像の特定の構造要素を編集できます。

画像の特定の部分を編集するために、画像を構築したノイズを特定します。
生理学的ミスのセマンティックフィルタ
Stable Diffusionは、データの問題や画像に付随する注釈の欠陥により、四肢を追加または削除することがあります。
これらのエラーを修正することは非常に難しいため、ステーブル拡散アプリケーションに、画像の解剖学的欠陥を検出して新しいレンダリングを生成する機能があれば便利です。
LAIONベースの自動顔強化
GFPGANの「改善」は、個人のアイデンティティを損なうことが多く、画像の他の部分と同等の処理時間しか与えられていないため、効果的ではありません。
したがって、プロフェッショナルなステーブル拡散プログラムは、軽量なライブラリ(例:YOLO)を使用して顔を認識し、GPUの力を使用して顔を再レンダリングし、元の画像にブレンドするか、別々に保存する必要があります。
アプリ内LAION検索
LAIONデータベースを検索することで、ステーブル拡散の潜在的な出力を理解し、特定の概念やオブジェクトがトレーニングデータに含まれているかどうかを確認できます。
これらのWebベースのデータベースは、画像に付随するタグを表示しますが、モデル訓練中に発生する一般化プロセスにより、特定のタグを使用して画像を呼び出すことはできません。
さらに、ストップワードの削除やステミング、lemmatizationなどの自然言語処理の手法により、多くのフレーズが訓練データから除去または分割されています。
これらのインターフェースでエンティティが結びつく方法は、ステーブル拡散の「個性」について多くを語り、画像生成を改善するのに役立ちます。
結論
ステーブル拡散の完全なデスクトップ実装には、多くの機能が必要です。
ネイティブのCLIPベースの画像分析、タイルベースのスケーリング、Photoshopとのシームレスな連携などが含まれます。
また、ステーブル拡散のビデオ機能はまだ非常に初期段階であり、現在の限界により、人間のアニメーションは非常に制限されています。
しかし、ステーブル拡散は、エブシンスやランウェイなどのテキストからビデオへの変換などのプロジェクトによって、ディープフェイクの分野で大きな潜在性を持っています。
アドビは、ステーブル拡散の力を活用するのに最も適した企業ですが、コンテンツの信憑性イニシアチブに強くコミットしているため、ステーブル拡散の機能を制限することを選択する可能性があります。
これは、ステーブル拡散の潜在的な力を制限することになりますが、コンテンツの信憑性を維持するために必要なステップであると考えられます。













