AI-modeller og plattformer
Stabilitet AI lanserer tekst-til-bilde-modell DeepFloyd IF

Stabilitet AI og deres multimodale AI-forskningslab, DeepFloyd, har annonsert forskningslanseringen av DeepFloyd IF, en banebrytende tekst-til-bilde-kaskadisk piksel-diffusjonsmodell. Modellen er initialt lansert under en ikke-kommersiell, forsknings-tillatt lisens, men en åpen kildekode-lansering er planlagt for fremtiden.
DeepFloyd IF har flere bemerkelsesverdige funksjoner, inkludert:
- Dyp tekst-prompt-forståelse: Modellen bruker T5-XXL-1.1 som tekst-encoder, med mange tekst-bilde-kors-oppmerksomhetslag, som sikrer bedre sammenstilling mellom promter og bilder.
- Kohesive og klare tekst sammen med genererte bilder: DeepFloyd IF kan generere bilder som inneholder objekter med varierende egenskaper og romlige relasjoner.
- Høy grad av fotorealistisk: Modellen har oppnådd en imponerende null-skudd FID-poeng på 6,66 på COCO-datasettet.
- Aspektforholdsskift: Modellen kan generere bilder med ikke-standard aspektforhold, inkludert vertikale, horisontale og standard kvadratisk aspektforhold.
- Null-skudd bilde-til-bilde-oversettelser: Modellen kan modifisere en bildes stil, mønster og detaljer samtidig som den beholder sin grunnleggende form.
Under er noen eksempelkonsepter skapt av DeepFloyd IF:




DeepFloyd IFs modulære, kaskadiske, piksel-diffusjonsdesign består av flere neurale moduler som samarbeider synergisk. Modellen fungerer i piksel-rom, og prosesserer høyoppløselig data på en kaskadisk måte ved hjelp av individuelt trente modeller på forskjellige oppløsninger. Dette inkluderer en basismodell som genererer lavoppløselige prøver og påfølgende superoppløselige modeller som produserer høyoppløselige bilder.
Modellen ble trent på et eget høykvalitets LAION-A-datasett som inneholder 1 milliard (bilde, tekst)-par, en undergruppe av den engelske delen av LAION-5B-datasettet. DeepFloyds egne filtre ble brukt til å fjerne vannmerkede, NSFW og andre upassende innhold.

DeepFloyd IFs prosess
Initialt er DeepFloyd IF lansert under en forskningslisens. Forskerne har som mål å oppmuntre til utvikling av nye anvendelser over domener som kunst, design, fortelling, virtuell virkelighet og tilgjengelighet. For å inspirere potensiell forskning, har de foreslått flere tekniske, akademiske og etiske forskningsspørsmål.
Tekniske forskningsspørsmål inkluderer:
- Optimere IF-modellen for å forbedre ytelse, skalerbarhet og effektivitet.
- Forbedre utgangskvaliteten ved å finjustere prøving, guiding eller finjustere modellen.
- Bruke teknikker som brukes til å modifisere Stable Diffusion-utgang til DeepFloyd IF.
Akademiske forskningsspørsmål inkluderer:
- Undersøke rollen til pre-trening for overføringslæring.
- Forbedre modellens kontroll over bilde-generering.
- Utvide modellens evner beyond tekst-til-bilde-syntese ved å integrere flere modaliteter.
- Vurdere modellens tolkbarhet for å forbedre forståelsen av genererte bilders visuelle egenskaper.
Etiske forskningsspørsmål inkluderer:
- Identifisere og mitigere bias i DeepFloyd IF.
- Vurdere modellens innvirkning på sosiale medier og innholdsgenerering.
- Utvikle en effektiv feil-bilde-detektor som utnytter modellen.
For å få tilgang til modellens vekt, må brukerne godta lisensen på DeepFloyds Hugging Face-rom. For mer informasjon, kan du besøke modellens nettsted, GitHub-repositoriet, Gradio-demonstrasjonen, eller delta i offentlige diskusjoner gjennom DeepFloyds Linktree.












