Modely a platformy AI

Stability AI vydává text-to-image model DeepFloyd IF

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Stability AI a její multimodální laboratoř pro výzkum umělé inteligence DeepFloyd oznámily výzkumné vydání modelu DeepFloyd IF, který je špičkovým text-to-image kaskádovým modelem difuze pixelů. Model je inicialně vydán pod nekomerční, výzkumnou licencí, ale je plánováno i otevřené vydání v budoucnu.

Model DeepFloyd IF nabízí několik pozoruhodných funkcí, včetně:

  1. Hluboké porozumění textovým promptům: Model používá T5-XXL-1.1 jako textový encoder, s mnoha vrstvami křížové pozornosti mezi textem a obrazem, což zajišťuje lepší zarovnání mezi prompty a obrázky.
  2. Koherentní a jasný text spolu s generovanými obrázky: DeepFloyd IF může generovat obrázky obsahující objekty s různými vlastnostmi a prostorovými vztahy.
  3. Vysoký stupeň fotorealističnosti: Model dosáhl působivého skóre FID 6,66 na datasetu COCO.
  4. Změna poměru stran: Model může generovat obrázky s nestandardními poměry stran, včetně vertikálních, horizontálních a standardních čtvercových poměrů.
  5. Bezpečnostní překlad obrázků: Model může měnit styl, vzory a detaily obrázku, zatímco zachovává jeho základní formu.

Níže jsou einige ukázkové koncepty vytvořené modelem DeepFloyd IF:

Modulární, kaskádový, difuzní design modelu DeepFloyd IF se skládá z několika neuronových modulů, které interagují synergicky. Model pracuje v pixelovém prostoru, zpracovává vysokorozlišovací data kaskádovitým způsobem pomocí samostatně trénovaných modelů na různých rozlišeních. To zahrnuje základní model, který generuje nízko-rozlišovací vzorky, a následné super-rozlišovací modely, které produkují vysokorozlišovací obrázky.

Model byl trénován na vlastním vysoce kvalitním datasetu LAION-A, který obsahuje 1 miliardu párů (obrázek, text), což je podmnožina anglické části datasetu LAION-5B. Byly použity filtry DeepFloyd k odstranění vodotisků, NSFW a jiných nevhodných obsahů.

Proces DeepFloyd IF

Počátečně je model DeepFloyd IF vydán pod výzkumnou licencí. Výzkumníci cílem je povzbudit vývoj nových aplikací napříč doménami, jako je umění, design, vyprávění příběhů, virtuální realita a přístupnost. K inspiraci potenciálního výzkumu navrhli několik technických, akademických a etických výzkumných otázek.

Technické výzkumné otázky zahrnují:

  • Optimalizace modelu IF pro zlepšení výkonu, škálovatelnosti a efektivity.
  • Zlepšení kvality výstupu pomocí rafinování vzorkování, směrování nebo jemného ladění modelu.
  • Použití technik používaných k modifikaci výstupu Stable Diffusion na model DeepFloyd IF.

Akademické výzkumné otázky zahrnují:

  • Prozkoumání role předtrénování pro přenosové učení.
  • Zlepšení kontroly modelu nad generováním obrázků.
  • Rozšíření schopností modelu beyond text-to-image syntézy integrovaním více modalit.
  • Posouzení interpretability modelu pro zlepšení porozumění vizuálním funkcím generovaných obrázků.

Etické výzkumné otázky zahrnují:

  • Identifikace a zmírnění biasů v modelu DeepFloyd IF.
  • Posouzení dopadu modelu na sociální média a generování obsahu.
  • Vyvinutí efektivní detekce falešných obrázků, která využívá model.

Pro přístup k váhám modelu musí uživatelé přijmout licenci na prostoru DeepFloyd’s Hugging Face. Pro více informací můžete navštívit webové stránky modelu, GitHub repozitář, Gradio demo, nebo se připojit k veřejným diskuzím prostřednictvím Linktree.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.