AI-mallit ja alustat
Stability AI julkaisee teksti-kuvaksi-malli DeepFloyd IF

Stability AI ja sen multimodaalinen AI-tutkimuslaboratorio DeepFloyd ovat ilmoittaneet tutkimusjulkaisun DeepFloyd IF:stä, joka on uraauurtava teksti-kuvaksi-kaskadinen pikselien diffuusiomalli. Malli on aluksi julkaistu ei-kaupalliseen, tutkimuslupaan, mutta avoimen lähdekoodin julkaisu on suunnitteilla tulevaisuudessa.
DeepFloyd IF:llä on useita merkittäviä ominaisuuksia, mukaan lukien:
- Syvä tekstipromptin ymmärtäminen: Malli käyttää T5-XXL-1.1:ää tekstienkooderina, jossa on useita teksti-kuvan ristivirto-kerroksia, jolloin teksti ja kuvat ovat paremmin linjassa.
- Johdonmukainen ja selkeä teksti yhdessä generoiden kuvien kanssa: DeepFloyd IF voi generoida kuvia, joissa on objekteja, joilla on erilaisia ominaisuuksia ja spatiaalisia suhteita.
- Korkea aste valokuvamaisuutta: Malli on saavuttanut vaikuttavan nollapiste-FID-lukeman 6,66 COCO-tietokannassa.
- Aspektisuhteen muutos: Malli voi generoida kuvia, joilla on epästandardit aspektisuhteet, mukaan lukien pysty-, vaaka- ja standardisuorakulmainen aspekti.
- Nollapiste-kuvien välinen käännös: Malli voi muuttaa kuvan tyyliä, kuviota ja yksityiskohtia säilyttäen sen perusrakenteen.
Tässä ovat joitakin esimerkkiideoita, jotka on luotu DeepFloyd IF:llä:




DeepFloyd IF:n modulaarinen, kaskadinen, pikselien diffuusiomalli koostuu useista neuronaalisista moduuleista, jotka toimivat synergistisesti. Malli toimii pikselien avaruudessa, prosessoiden korkean resoluution dataa kaskadin tavalla käyttäen eri resoluutioille koulutettuja malleja. Tämä käsittää perusmallin, joka generoi matalan resoluution näytteitä, ja peräkkäisiä super-resoluution malleja, jotka tuottavat korkean resoluution kuvia.
Malli on koulutettu omalla korkealaatuisella LAION-A-tietokannalla, joka sisältää 1 miljardi (kuva, teksti) -paria, osan englanninkielisestä LAION-5B-tietokannasta. DeepFloydin omat suodattimet on käytetty poistamaan vesileimalliset, NSFW- ja muut sopimattomat sisällöt.

DeepFloyd IF:n prosessi
Aluksi DeepFloyd IF on julkaistu tutkimuslisenssillä. Tutkijat pyrkivät kannustamaan uusien sovellusten kehittämistä eri aloilla, kuten taiteessa, suunnittelussa, tarinankerronnassa, virtuaalitodellisuudessa ja saavutettavuudessa. Innostamaan mahdollista tutkimusta he ovat ehdottaneet useita teknisiä, akateemisia ja eettisiä tutkimuskysymyksiä.
Teknisiä tutkimuskysymyksiä ovat:
- IF-mallin optimointi suorituskyvyn, skaalautuvuuden ja tehokkuuden parantamiseksi.
- Näytteen laadun parantaminen mallin hienosäätöä, ohjausta tai mallin viimeistelyä kehittämällä.
- Stable Diffusion -mallin tulosten muokkaamistekniikoiden soveltaminen DeepFloyd IF:ään.
Akateemisia tutkimuskysymyksiä ovat:
- Pre-trainingin roolin tutkiminen siirtymisen oppimisessa.
- Mallin kontrollin parantaminen kuvien generoimisessa.
- Mallin kykyjen laajentaminen teksti-kuvan synteesin ulkopuolelle useiden modaalien integroimalla.
- Mallin tulkitsevuuden arviointi generoituja kuvien visuaalisten ominaisuuksien ymmärtämiseksi.
Eettisiä tutkimuskysymyksiä ovat:
- DeepFloyd IF:n harhauttavien tekijöiden tunnistaminen ja vähentäminen.
- Mallin vaikutuksen arviointi sosiaalisen median ja sisällön generoimiseen.
- Tehtävän viittauksen kehittäminen, joka hyödyntää mallia.
Mallin painojen käyttämiseksi käyttäjien on hyväksyttävä lisenssi DeepFloydin Hugging Face -tilassa. Lisätietoja varten voit vierailla mallin GitHub-arkistossa, Gradio-demossa tai liittyä julkisiin keskusteluihin DeepFloydin Linktree-kautta.












