AIモデルとプラットフォーム

EasyPhoto:あなたのパーソナルAI写真ジェネレーター

mm
Unite.AI を Google の優先ソースに追加
EasyPhoto : Your Personal AI Portrait Generator

Stable Diffusion Webユーザーインターフェイス、またはSD-WebUIは、Stable Diffusionモデルを利用するための包括的なプロジェクトであり、Gradioライブラリを使用してブラウザインターフェイスを提供します。今日、私たちは、AIポートレートや画像を生成できるWebUIプラグインであるEasyPhotoについて話します。EasyPhoto WebUIプラグインは、さまざまなテンプレートを使用してAIポートレートを生成し、さまざまな写真スタイルや複数の修正をサポートしています。また、EasyPhotoの機能をさらに強化するために、ユーザーはSDXLモデルを使用して、より満足のいく、正確で、多様な結果を生成できます。では、始めましょう。

EasyPhotoとStable Diffusionの紹介

Stable Diffusionフレームワークは、入力テキストの説明に基づいてリアルな画像を生成するために開発者が使用する人気のある拡散ベースの生成フレームワークです。その機能により、Stable Diffusionフレームワークは、画像のアウトペインティング、画像のインペインティング、画像から画像への翻訳などの幅広いアプリケーションを備えています。Stable Diffusion Web UI、またはSD-WebUIは、このフレームワークの最も人気のあるアプリケーションの1つであり、Gradioライブラリを使用して構築されたブラウザインターフェイスを特徴としています。さらに、SD-WebUIは、画像生成の制御と使いやすさを高めるために、多数のStable Diffusionアプリケーションを統合しています。

SD-WebUIフレームワークの利便性により、EasyPhotoフレームワークの開発者は、フルアプリケーションではなく、WebプラグインとしてEasyPhotoを作成することを決定しました。既存の方法がしばしばアイデンティティの喪失や画像に非現実的な特徴を導入するのに対し、EasyPhotoフレームワークは、Stable Diffusionモデルの画像から画像への機能を利用して、正確でリアルな画像を生成します。ユーザーは、WebUI内でEasyPhotoフレームワークを簡単にインストールでき、より幅広いユーザーに使いやすさとアクセシビリティを高めています。EasyPhotoフレームワークにより、ユーザーは、入力アイデンティティに近い、アイデンティティに導かれた、高品質でリアルなAIポートレートを生成できます。

まず、EasyPhotoフレームワークは、ユーザーにデジタル・ドッペルゲンガーを作成するように求め、オンラインでLoRAまたはLow-Rank Adaptationモデルをトレーニングするために、いくつかの画像をアップロードします。LoRAフレームワークは、低ランク適応技術を使用して、拡散モデルを迅速にファインチューニングします。このプロセスにより、ベースモデルは、特定のユーザーのID情報を理解できるようになります。トレーニングされたモデルは、基準のStable Diffusionモデルに統合されて、干渉に使用されます。さらに、干渉プロセス中、モデルは、Stable Diffusionモデルを使用して、干渉テンプレートの顔の領域を再描画しようとします。入力画像と出力画像の類似性は、さまざまなControlNetユニットを使用して検証されます。

EasyPhotoフレームワークは、境界のアーティファクトやアイデンティティの喪失などの潜在的な問題に対処するために、2段階の拡散プロセスを採用しています。さらに、干渉パイプラインは、ポートレートの生成のみに限定されず、ユーザーのIDに関連するものを生成するために使用できます。これは、LoRAモデルを特定のIDにトレーニングした後、幅広いAI画像を生成でき、バーチャル・トライオンなどの幅広いアプリケーションが可能になります。

まとめると、EasyPhotoフレームワーク

  1. LoRAモデルをトレーニングするための新しいアプローチを提案し、複数のLoRAモデルを組み込んで、生成された画像の顔の忠実性を維持します。
  2. さまざまな強化学習方法を使用して、LoRAモデルを最適化し、顔のアイデンティティの報酬を直接最適化します。
  3. 2段階のインペインティングベースの拡散プロセスを提案し、高美的価値と類似性のあるAI写真を生成します。

EasyPhoto:アーキテクチャとトレーニング

以下の図は、EasyPhoto AIフレームワークのトレーニングプロセスを示しています。

図からわかるように、フレームワークはまず、ユーザーにトレーニング画像を入力するように求め、次に、顔の位置を検出します。顔が検出されると、フレームワークは、顔の領域のみに焦点を当てた特定の比率で入力画像をトリミングします。次に、フレームワークは、スキン・ビューティフィケーションとサリエンシ検出モデルを使用して、クリーンで明確な顔のトレーニング画像を取得します。これらのモデルは、顔の視覚的な品質を高め、背景情報が除去され、トレーニング画像が主に顔で構成されることを保証する上で重要な役割を果たします。最後に、フレームワークは、これらの処理された画像と入力プロンプトを使用してLoRAモデルをトレーニングし、ユーザー固有の顔の特徴をより効果的に理解できるようにします。

さらに、トレーニング段階では、フレームワークは、重要な検証ステップを含みます。このステップでは、フレームワークは、ユーザー入力画像と、トレーニングされたLoRAモデルによって生成された検証画像の間の顔IDギャップを計算します。検証ステップは、LoRAモデルの融合を達成する上で重要な役割を果たすプロセスであり、最終的に、トレーニングされたLoRAフレームワークがユーザーのデジタル・ドッペルゲンガー、またはユーザーの正確なデジタル表現に変換されることを保証します。また、最適な顔IDスコアを持つ検証画像が、顔ID画像として選択され、この顔ID画像は、干渉生成のアイデンティティの類似性を高めるために使用されます。

続けて、アンサンブルプロセスに基づいて、フレームワークは、LoRAモデルのトレーニングを実行します。ここでの主な目的は、尤度推定であり、下流の目的は、顔のアイデンティティの類似性を維持することです。この問題に対処するために、EasyPhotoフレームワークは、下流の目的を直接最適化するために、強化学習技術を使用します。結果として、LoRAモデルによって学習された顔の特徴は、改善され、テンプレート生成結果と類似性が高まり、テンプレート間の汎化が実現します。

干渉プロセス

以下の図は、EasyPhotoフレームワークのユーザーIDの干渉プロセスを示しています。これは、3つのパートに分かれています

  • Face Preprocess:ControlNetリファレンスと、前処理された入力画像を取得するために使用されます。
  • First Diffusion:ユーザー入力に似た粗い結果を生成するために使用されます。
  • Second Diffusion:境界のアーティファクトを修正し、画像をより正確でリアルなものにします。

入力として、フレームワークは、トレーニングの検証で最適な顔IDスコアを使用して生成された顔ID画像と、干渉テンプレートを受け取ります。出力は、ユーザーのアイデンティティとユニークな外見に近い、高度な詳細と正確性を持つリアルなポートレートです。では、これらのプロセスを詳しく見てみましょう。

Face Preprocess

干渉テンプレートに基づいてAIポートレートを生成する方法の1つは、SDモデルを使用して干渉テンプレートの顔の領域をインペイントすることです。また、ControlNetフレームワークをプロセスに追加することで、ユーザーのアイデンティティの保存が強化され、生成された画像の類似性も高まります。しかし、ControlNetを直接使用すると、次のような潜在的な問題が発生する可能性があります。

  • 入力と生成画像の不一致:テンプレート画像のキーポイントと顔ID画像のキーポイントが互換性がないため、ControlNetを顔ID画像をリファレンスとして使用すると、出力に不一致が生じる可能性があります。
  • インペイント領域の欠陥:領域をマスクして新しい顔でインペイントすると、インペイントの境界に目立つ欠陥が生じる可能性があります。これは、生成された画像の信憑性とリアリズムに悪影響を及ぼす可能性があります。
  • ControlNetによるアイデンティティの喪失:トレーニングプロセスでControlNetを使用していないため、干渉プロセスでControlNetを使用すると、トレーニングされたLoRAモデルのアイデンティティを保存する能力に影響を及ぼす可能性があります。

上記の問題に対処するために、EasyPhotoフレームワークは、3つの手順を提案します。

  • アラインとペースト:顔ペーストアルゴリズムを使用して、テンプレートと顔ID画像の顔のランドマークの不一致を解決します。まず、モデルは、顔IDとテンプレート画像の顔のランドマークを計算し、次に、テンプレート画像の顔のランドマークを顔ID画像のランドマークに合わせるためのアフィン変換行列を決定します。結果として得られる画像は、顔ID画像のランドマークを保持し、テンプレート画像と一致しています。
  • Face Fuse:Face Fuseは、マスクインペイントによって生じる境界のアーティファクトを修正するための新しいアプローチであり、ControlNetフレームワークを使用します。この方法により、EasyPhotoフレームワークは、調和的なエッジを保存し、画像生成プロセスを導くことができます。Face Fusionアルゴリズムはさらに、(グランドトゥルースユーザー画像)とテンプレートを融合し、結果として得られる融合画像は、エッジ境界の安定性が向上し、最初の拡散段階での出力が向上します。
  • ControlNetガイド付き検証:LoRAモデルはControlNetを使用してトレーニングされていないため、干渉プロセスでControlNetを使用すると、LoRAモデルのアイデンティティを保存する能力に影響を及ぼす可能性があります。EasyPhotoフレームワークの汎化能力を高めるために、フレームワークは、ControlNetの影響を考慮し、さまざまな段階からのLoRAモデルを組み込みます。

First Diffusion

最初の拡散段階では、テンプレート画像を使用して、ユーザーの入力IDに似たユニークなIDを持つ画像を生成します。入力画像は、ユーザーの入力画像とテンプレート画像の融合であり、調整された顔マスクは入力マスクです。画像生成の制御をさらに高めるために、EasyPhotoフレームワークは、3つのControlNetユニットを統合しています。最初のControlNetユニットは、融合された画像の制御に焦点を当て、2番目のControlNetユニットは、融合された画像の色の制御に焦点を当て、最後のControlNetユニットは、置き換えられた画像のオープンポーズ(リアルタイムのマルチパーソンヒューマンポーズ制御)であり、テンプレート画像の顔の構造とユーザーの顔のアイデンティティの両方を含みます。

Second Diffusion

2番目の拡散段階では、顔の境界付近のアーティファクトを修正し、特定の領域をマスクして、生成の有効性を高めることができます。この段階では、フレームワークは、最初の拡散段階からの出力画像を、ユーザーの画像(ループ画像)または結果と融合して、2番目の拡散段階の入力画像を生成します。全体として、2番目の拡散段階は、生成された画像の品質と詳細を高める上で重要な役割を果たします。

Multi User IDs

EasyPhotoの特徴の1つは、複数のユーザーIDを生成する機能です。以下の図は、EasyPhotoフレームワークの複数ユーザーIDの干渉プロセスのパイプラインを示しています。

複数のユーザーIDを生成するために、EasyPhotoフレームワークはまず、干渉テンプレートで顔検出を実行します。これらの干渉テンプレートは、各マスクに1つの顔だけが含まれるように、複数のマスクに分割され、残りの画像は白でマスクされます。結果として、複数のユーザーIDの生成は、個々のユーザーIDの生成に簡素化されます。フレームワークがユーザーID画像を生成した後、これらの画像は、テンプレート画像とシームレスに統合され、高品質の画像が生成されます。

実験と結果

EasyPhotoフレームワークのパフォーマンスを探るために、実験を実施しました。

上の画像は、EasyPhotoプラグインによって生成され、画像生成にスタイルベースのSDモデルを使用しています。画像はリアルで正確に生成されています。

上の画像は、EasyPhotoフレームワークによって生成され、コミックスタイルベースのSDモデルを使用しています。画像はリアルで、ユーザーの入力に近い、コミック写真やリアルな写真が生成されています。

以下の画像は、EasyPhotoフレームワークによって生成され、マルチパーソンテンプレートを使用しています。画像はクリアで正確に生成されており、オリジナルの画像に近いものが生成されています。

EasyPhotoを使用すると、ユーザーは、幅広いAIポートレートを生成したり、保存されたテンプレートを使用して複数のユーザーIDを生成したり、SDモデルを使用して干渉テンプレートを生成したりできます。上の画像は、EasyPhotoフレームワークの多様性と高品質のAI画像生成能力を示しています。

結論

本稿では、ユーザーがAIポートレートや画像を生成できるWebUIプラグインであるEasyPhotoについて説明しました。EasyPhoto WebUIプラグインは、任意のテンプレートを使用してAIポートレートを生成し、さまざまな写真スタイルや複数の修正をサポートしています。また、EasyPhotoの機能をさらに強化するために、ユーザーはSDXLモデルを使用して、より満足のいく、正確で、多様な結果を生成できます。EasyPhotoフレームワークは、安定した拡散ベースモデルと事前トレーニング済みのLoRAモデルを使用して、高品質の画像出力を生成します。

画像ジェネレーターに興味がある場合は、ベストAIヘッドショットジェネレーターベストAI画像ジェネレーターのリストも提供しています。これらは、簡単に使用でき、技術的な専門知識は必要ありません。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。