Modele și platforme AI
Stability AI lansează modelul text-la-imagine DeepFloyd IF

Stability AI și laboratorul său de cercetare multimodală AI, DeepFloyd, au anunțat lansarea cercetării modelului DeepFloyd IF, un model de difuzie pixel cascaded text-la-imagine de ultimă generație. Modelul este lansat inițial sub o licență non-comercială, permisivă pentru cercetare, dar o lansare open-source este planificată pentru viitor.
DeepFloyd IF are câteva caracteristici remarcabile, inclusiv:
- Înțelegerea profundă a textului prompt: Modelul utilizează T5-XXL-1.1 ca encoder de text, cu numeroase straturi de atenție cross-text-imagine, asigurând o mai bună aliniere între prompturi și imagini.
- Text coerent și clar alături de imagini generate: DeepFloyd IF poate genera imagini care conțin obiecte cu proprietăți și relații spațiale variate.
- Grad ridicat de fotorealism: Modelul a obținut un scor FID zero-shot impresionant de 6,66 pe setul de date COCO.
- Schimbarea raportului de aspect: Modelul poate genera imagini cu rapoarte de aspect ne-standard, inclusiv verticale, orizontale și pătrate standard.
- Traduceri imagine-la-imagine fără antrenament: Modelul poate modifica stilul, modelele și detaliile unei imagini, păstrând forma sa de bază.
Mai jos sunt câteva exemple de concepte create de DeepFloyd IF:




Proiectarea modulară, cascaded, a difuziei pixel a lui DeepFloyd IF constă în mai multe module neurale care interacționează sinergic. Modelul funcționează în spațiul pixel, procesând date de înaltă rezoluție în mod cascaded, utilizând modele individuale antrenate la diferite rezoluții. Acesta implică un model de bază care generează mostre de joasă rezoluție și modele de supra-rezoluție care produc imagini de înaltă rezoluție.
Modelul a fost antrenat pe un set de date LAION-A personalizat, conținând 1 miliard de perechi (imagine, text), un subset al părții engleze a setului de date LAION-5B. Filtrele personalizate DeepFloyd au fost utilizate pentru a înlătura conținutul cu filigran, NSFW și alte conținuturi inadecvate.

Procesul DeepFloyd IF
Inițial, DeepFloyd IF este lansat sub o licență de cercetare. Cercetătorii își propun să încurajeze dezvoltarea de aplicații noi în domenii precum arta, designul, povestirile, realitatea virtuală și accesibilitatea. Pentru a inspira cercetarea potențială, ei au propus câteva întrebări tehnice, academice și etice de cercetare.
Întrebări tehnice de cercetare includ:
- Optimizarea modelului IF pentru a îmbunătăți performanța, scalabilitatea și eficiența.
- Îmbunătățirea calității ieșirii prin rafinarea eşantionării, ghidarea sau finisarea modelului.
- A aplică tehnici utilizate pentru a modifica ieșirea Stable Diffusion la DeepFloyd IF.
Întrebări academice de cercetare includ:
- Explorarea rolului pre-antrenării pentru învățarea transferului.
- Îmbunătățirea controlului modelului asupra generării de imagini.
- Extinderea capacităților modelului dincolo de sinteza text-la-imagine prin integrarea mai multor modalități.
- Evaluarea interpretabilității modelului pentru a îmbunătăți înțelegerea caracteristicilor vizuale ale imaginilor generate.
Întrebări etice de cercetare includ:
- Identificarea și mitigarea prejudecăților în DeepFloyd IF.
- Evaluarea impactului modelului asupra rețelelor sociale și generării de conținut.
- Dezvoltarea unui detector eficient de imagini false care utilizează modelul.
Pentru a accesa greutățile modelului, utilizatorii trebuie să accepte licența pe spațiul Hugging Face al lui DeepFloyd. Pentru mai multe informații, puteți vizita site-ul web al modelului, depozitul GitHub, demonstrația Gradio sau vă alăturați discuțiilor publice prin Linktree al lui DeepFloyd.












