AIモデルとプラットフォーム
Stability AI、テキストから画像を生成するDeepFloyd IFモデルをリリース

Stability AIとそのマルチモーダルAI研究ラボ、DeepFloydは、テキストから画像を生成するカスケードピクセル拡散モデルであるDeepFloyd IFの研究リリースを発表しました。モデルは当初、非商用、研究許可ライセンスでリリースされますが、将来的にはオープンソースリリースを計画しています。
DeepFloyd IFは、以下のような特徴を持っています:
- 深いテキストプロンプト理解: モデルはT5-XXL-1.1をテキストエンコーダーとして使用し、テキストと画像のクロスアテンション層を多数持つことで、プロンプトと画像の間のアラインメントを向上させます。
- 生成された画像とともに一貫性と明確性: DeepFloyd IFは、さまざまな特性と空間関係を持つオブジェクトを含む画像を生成できます。
- 高品質の写実性: モデルはCOCOデータセットで6.66のゼロショットFIDスコアを達成しました。
- アスペクト比のシフト: モデルは、標準の正方形のアスペクト比以外に、縦、横、などの非標準なアスペクト比の画像を生成できます。
- ゼロショット画像から画像への翻訳: モデルは、画像のスタイル、パターン、詳細を変更しながら、基本的な形状を保持できます。
以下は、DeepFloyd IFによって生成された例です:




DeepFloyd IFのモジュラー、カスケード、ピクセル拡散設計は、複数のニューラルモジュールが相互に作用することで構成されています。モデルはピクセル空間で動作し、高解像度のデータをカスケード方式で処理します。個別にトレーニングされたモデルを使用して、低解像度のサンプルを生成し、続いて高解像度の画像を生成します。
モデルは、1億個の(画像、テキスト)ペアを含むLAION-Aデータセットでトレーニングされました。これは、LAION-5Bデータセットの英語部分のサブセットです。DeepFloydのカスタムフィルタを使用して、ウォーターマーク、NSFW、その他の不適切なコンテンツを除去しました。

DeepFloyd IFのプロセス
当初、DeepFloyd IFは研究ライセンスでリリースされます。研究者は、芸術、デザイン、物語、仮想現実、 Barrier-freeなどの分野で新しいアプリケーションの開発を促進したいと考えています。潜在的な研究を刺激するために、技術的な、学術的な、倫理的な研究質問をいくつか提案しています。
技術的な研究質問には以下が含まれます:
- IFモデルのパフォーマンス、スケーラビリティ、効率性を向上させるための最適化。
- サンプリング、ガイディング、またはモデルのファインチューニングを改善して、出力品質を向上させる。
- Stable Diffusion出力の変更に使用されるテクニックをDeepFloyd IFに適用する。
学術的な研究質問には以下が含まれます:
- 転移学習のための事前トレーニングの役割を探る。
- 画像生成のコントロールを強化する。
- テキストから画像への合成以外の多様なモダリティを統合して、モデルの能力を拡大する。
- 生成された画像の視覚的な特徴を理解するために、モデルの解釈可能性を評価する。
倫理的な研究質問には以下が含まれます:
- DeepFloyd IF内の偏見を特定し、軽減する。
- モデルのソーシャルメディアやコンテンツ生成への影響を評価する。
- モデルの活用による有効な偽画像検出器を開発する。
モデルの重みにアクセスするには、DeepFloydのHugging Faceスペースでライセンスを承認する必要があります。詳細については、モデルのウェブサイト、Gradioデモ、またはDeepFloydのLinktreeを訪問してください。












