AI-modeller og platforme
Stability AI udgiver tekst-til-billede-model DeepFloyd IF

Stability AI og deres multimodale AI-forskningslaboratorium, DeepFloyd, har annonceret forskningsudgivelsen af DeepFloyd IF, en avanceret tekst-til-billede-kaskadisk pixel-diffusionsmodel. Modellen udgives initialt under en ikke-kommerciel, forsknings-tilladt licens, men en open-source-udgivelse er planlagt til fremtiden.
DeepFloyd IF har flere bemærkelsesværdige funktioner, herunder:
- Dybt tekstpromptforståelse: Modellen bruger T5-XXL-1.1 som tekst-encoder, med talrige tekst-billede-kryds-attention-lag, hvilket sikrer bedre alignment mellem prompts og billeder.
- Kohærent og klart tekst sammen med genererede billeder: DeepFloyd IF kan generere billeder, der indeholder objekter med varierende egenskaber og rumlige relationer.
- Høj grad af fotorealisme: Modellen har opnået en imponerende zero-shot FID-score på 6,66 på COCO-datasættet.
- Aspektforholdsskift: Modellen kan generere billeder med ikke-standard aspektforhold, herunder vertikale, horisontale og standard kvadrat-aspektforhold.
- Zero-shot billed-til-billed-oversættelser: Modellen kan ændre en billeds stil, mønster og detaljer, samtidig med at den bevarede dens grundlæggende form.
Herunder er nogle af de eksempelkoncepter, der er skabt af DeepFloyd IF:




DeepFloyd IF’s modulære, kaskadiske, pixel-diffusionsdesign består af flere neurale moduler, der interagerer synergistisk. Modellen fungerer i pixel-rum, hvor den behandler højopløsningsdata på en kaskadisk måde ved hjælp af individuelt trænede modeller i forskellige opløsninger. Dette indebærer en basis-model, der genererer lavopløsningsprøver, og efterfølgende superopløsningsmodeller, der producerer højopløsningsbilleder.
Modellen blev trænet på en brugerdefineret højkvalitets-LAION-A-datasæt, der indeholder 1 milliard (billede, tekst)-par, en undermængde af den engelske del af LAION-5B-datasættet. DeepFloyds brugerdefinerede filtre blev brugt til at fjerne vandmærkede, NSFW og andre upassende indhold.

DeepFloyd IF’s proces
Initialt udgives DeepFloyd IF under en forskningslicens. Forskerne sigter mod at opmuntre udviklingen af nye anvendelser på tværs af domæner som kunst, design, fortælling, virtuel virkelighed og tilgængelighed. For at inspirere potentiel forskning har de foreslået flere tekniske, akademiske og etiske forskningsspørgsmål.
Tekniske forskningsspørgsmål inkluderer:
- Optimering af IF-modellen for at forbedre ydeevne, skalerbarhed og effektivitet.
- Forbedring af outputkvaliteten ved at raffinere sampling, vejledning eller finjustering af modellen.
- Anvendelse af teknikker, der bruges til at ændre Stable Diffusion-udgang, på DeepFloyd IF.
Akademiske forskningsspørgsmål inkluderer:
- Udforskning af rollen af præ-træning for overføring af læring.
- Forbedring af modellens kontrol over billedgenerering.
- Udvidelse af modellens kapaciteter ud over tekst-til-billed-syntese ved at integrere multiple modaliteter.
- Vurdering af modellens fortolkelighed for at forbedre forståelsen af de genererede billeders visuelle funktioner.
Etiske forskningsspørgsmål inkluderer:
- Identifikation og afværning af fordomme i DeepFloyd IF.
- Vurdering af modellens indvirkning på sociale medier og indholdsgenerering.
- Udvikling af en effektiv fake-billed-detektor, der anvender modellen.
For at få adgang til modellens vægte skal brugerne acceptere licensen på DeepFloyds Hugging Face-rum. For mere information kan du besøge modellens website, GitHub-repository, Gradio-demo eller deltage i offentlige diskussioner gennem DeepFloyds Linktree.












