AI-modeller och plattformar
Stability AI släpper text-till-bild-modellen DeepFloyd IF

Stability AI och dess multimodala AI-forskningslaboratorium, DeepFloyd, har tillkännagett forskningsutgåvan av DeepFloyd IF, en banbrytande text-till-bild-kaskadpixel-diffusionsmodell. Modellen släpps initialt under en icke-kommersiell, forskningstillåten licens, men en öppen källkodsutgåva planeras för framtiden.
DeepFloyd IF har flera anmärkningsvärda funktioner, inklusive:
- Djup textpromptförståelse: Modellen använder T5-XXL-1.1 som textkodare, med många text-bild-kors-attention-lager, vilket säkerställer bättre samstämmighet mellan prompter och bilder.
- Sammanhängande och tydlig text tillsammans med genererade bilder: DeepFloyd IF kan generera bilder som innehåller objekt med varierande egenskaper och spatiala relationer.
- Hög grad av fotorealism: Modellen har uppnått en imponerande noll-skott FID-poäng på 6,66 på COCO-databasen.
- Aspect-ratio-skift: Modellen kan generera bilder med icke-standard-aspect-ratio, inklusive vertikal, horisontell och standardkvadrat-aspect.
- Noll-skott-bild-till-bild-översättningar: Modellen kan modifiera en bilds stil, mönster och detaljer samtidigt som den bevarar dess grundläggande form.
Här är några exempelkoncept skapade av DeepFloyd IF:




DeepFloyd IF:s modulära, kaskadiska, pixel-diffusionsdesign består av flera neurala moduler som interagerar synergistiskt. Modellen fungerar i pixel-rymden, bearbetar högupplösta data på ett kaskadiskt sätt med hjälp av individuellt tränade modeller i olika upplösningar. Detta innefattar en basmodell som genererar lågupplösta prover och efterföljande super-upplösningsmodeller som producerar högupplösta bilder.
Modellen tränades på en anpassad högkvalitativ LAION-A-databas som innehåller 1 miljard (bild, text)-par, en undermängd av den engelska delen av LAION-5B-databasen. DeepFloyds anpassade filter användes för att ta bort vattenmärkta, NSFW och andra olämpliga innehåll.

DeepFloyd IF:s process
Initialt släpps DeepFloyd IF under en forskningslicens. Forskarna syftar till att uppmuntra utvecklingen av nya tillämpningar inom områden som konst, design, berättande, virtuell verklighet och tillgänglighet. För att inspirera potentiell forskning har de föreslagit flera tekniska, akademiska och etiska forskningsfrågor.
Tekniska forskningsfrågor inkluderar:
- Optimera IF-modellen för att förbättra prestanda, skalbarhet och effektivitet.
- Förbättra utmatningskvaliteten genom att finslipa sampling, guida eller finjustera modellen.
- Tillämpa tekniker som används för att modifiera Stable Diffusion-utmatning på DeepFloyd IF.
Akademiska forskningsfrågor inkluderar:
- Utforska rollen för förträning för överföringsinlärning.
- Förbättra modellens kontroll över bildgenerering.
- Utöka modellens förmågor bortom text-till-bild-syntes genom att integrera flera modaliteter.
- Bedöma modellens tolkbarhet för att förbättra förståelsen av genererade bilders visuella funktioner.
Etiska forskningsfrågor inkluderar:
- Identifiera och mildra bias i DeepFloyd IF.
- Bedöma modellens påverkan på sociala medier och innehållsgenerering.
- Utveckla en effektiv fake-bild-detektor som använder modellen.
För att komma åt modellens vikt måste användare acceptera licensen på DeepFloyds Hugging Face-utrymme. För mer information kan du besöka modellens webbplats, GitHub-repo, Gradio-demo, eller ansluta till offentliga diskussioner genom DeepFloyds Linktree.












