KI-Modelle und Plattformen
Stability AI veröffentlicht Text-zu-Bild-Modell DeepFloyd IF

Stability AI und sein multimodales AI-Forschungslabor, DeepFloyd, haben die Forschungsveröffentlichung von DeepFloyd IF, einem bahnbrechenden Text-zu-Bild-Kaskaden-Pixel-Diffusionsmodell, bekannt gegeben. Das Modell wird zunächst unter einer nicht-kommerziellen, forschungsgenehmigten Lizenz veröffentlicht, aber eine Open-Source-Veröffentlichung ist für die Zukunft geplant.
DeepFloyd IF bietet mehrere bemerkenswerte Funktionen, darunter:
- Tiefes Text-Prompt-Verständnis: Das Modell verwendet T5-XXL-1.1 als Text-Encoder, mit zahlreichen Text-Bild-Cross-Attention-Layern, um eine bessere Ausrichtung zwischen Prompts und Bildern zu gewährleisten.
- Kohärenter und klarer Text neben generierten Bildern: DeepFloyd IF kann Bilder generieren, die Objekte mit verschiedenen Eigenschaften und räumlichen Beziehungen enthalten.
- Hohes Maß an Photorealismus: Das Modell hat einen beeindruckenden Zero-Shot-FID-Score von 6,66 auf dem COCO-Datensatz erreicht.
- Seitenverhältnis-Wechsel: Das Modell kann Bilder mit nicht-standardmäßigen Seitenverhältnissen generieren, einschließlich vertikaler, horizontaler und standardmäßiger quadratischer Seitenverhältnisse.
- Zero-Shot-Bild-zu-Bild-Übersetzungen: Das Modell kann den Stil, Muster und Details eines Bildes ändern, während es seine grundlegende Form beibehält.
Unten sind einige der von DeepFloyd IF erstellten Beispielkonzepte:




DeepFloyd IFs modulares, kaskadiertes, pixelbasiertes Diffusionsdesign besteht aus mehreren neuralen Modulen, die synergistisch interagieren. Das Modell arbeitet im Pixel-Raum und verarbeitet hochauflösende Daten in einer kaskadierten Weise mithilfe individuell trainierter Modelle in verschiedenen Auflösungen. Dies umfasst ein Basis-Modell, das niedrigauflösende Proben generiert, und nachfolgende Super-Auflösungs-Modelle, die hochauflösende Bilder produzieren.
Das Modell wurde auf einem benutzerdefinierten, hochwertigen LAION-A-Datensatz mit 1 Milliarde (Bild, Text)-Paaren trainiert, einer Teilmenge des englischen Teils des LAION-5B-Datensatzes. DeepFloyds benutzerdefinierte Filter wurden verwendet, um urheberrechtlich geschützte, NSFW- und andere unangemessene Inhalte zu entfernen.

DeepFloyd IFs Prozess
DeepFloyd IF wird zunächst unter einer Forschungslizenz veröffentlicht. Die Forscher zielen darauf ab, die Entwicklung neuer Anwendungen in Bereichen wie Kunst, Design, Erzählung, virtuelle Realität und Barrierefreiheit zu fördern. Um potenzielle Forschung zu inspirieren, haben sie mehrere technische, akademische und ethische Forschungsfragen vorgeschlagen.
Technische Forschungsfragen umfassen:
- Optimierung des IF-Modells, um die Leistung, Skalierbarkeit und Effizienz zu verbessern.
- Verbesserung der Ausgabequalität durch Verfeinerung der Abstimmung, Lenkung oder Feinabstimmung des Modells.
- Anwendung von Techniken, die zur Modifizierung von Stable Diffusion-Ausgaben verwendet werden, auf DeepFloyd IF.
Akademische Forschungsfragen umfassen:
- Untersuchung der Rolle des Pre-Trainings für Transfer-Learning.
- Verbesserung der Kontrolle des Modells über die Bildgenerierung.
- Erweiterung der Fähigkeiten des Modells über die Text-zu-Bild-Synthese hinaus durch die Integration mehrerer Modalitäten.
- Bewertung der Interpretierbarkeit des Modells, um das Verständnis der generierten Bildmerkmale zu verbessern.
Ethische Forschungsfragen umfassen:
- Identifizierung und Minderung von Vorurteilen in DeepFloyd IF.
- Bewertung der Auswirkungen des Modells auf soziale Medien und Inhaltsgenerierung.
- Entwicklung eines effektiven Falschbild-Detektors, der das Modell nutzt.
Um auf die Modellgewichte zuzugreifen, müssen Benutzer die Lizenz auf DeepFloyds Hugging Face-Space akzeptieren. Für weitere Informationen können Sie die Website des Modells, das GitHub-Repository, die Gradio-Demo besuchen oder sich an öffentlichen Diskussionen über DeepFloyds Linktree beteiligen.












