Modele i platformy AI

Stability AI Udostępnia Model Tekst-do-Obrazu DeepFloyd IF

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Stability AI i jego multimodalne laboratorium badawcze AI, DeepFloyd, ogłosiły wydanie badawcze modelu DeepFloyd IF, który jest najnowocześniejszym modelem dyfuzji pikseli w architekturze kaskadowej. Model jest początkowo wydany na licencji niekomercyjnej, dopuszczalnej do badań, ale planowane jest wydanie open-source w przyszłości.

DeepFloyd IF posiada kilka niezwykłych cech, w tym:

  1. Głębokie zrozumienie tekstu wejściowego: Model wykorzystuje T5-XXL-1.1 jako encoder tekstu, z licznymi warstwami uwagi krzyżowej między tekstem a obrazem, co zapewnia lepsze dopasowanie między podpowiedziami a obrazami.
  2. Spójny i wyraźny tekst wraz z wygenerowanymi obrazami: DeepFloyd IF może generować obrazy zawierające obiekty o różnych właściwościach i relacjach przestrzennych.
  3. Wysoki stopień fotorealizmu: Model osiągnął imponujący wynik FID 6,66 w bazie danych COCO.
  4. Zmiana proporcji: Model może generować obrazy o nietypowych proporcjach, w tym pionowych, poziomych i standardowych kwadratowych.
  5. Tłumaczenia obrazu na obraz bez przykładu: Model może modyfikować styl, wzory i szczegóły obrazu, zachowując jego podstawową formę.

Poniżej znajdują się przykładowe pojęcia stworzone przez DeepFloyd IF:

Modularna, kaskadowa architektura dyfuzji pikseli DeepFloyd IF składa się z kilku modułów neuronowych, które współpracują synergistycznie. Model działa w przestrzeni pikseli, przetwarzając dane o wysokiej rozdzielczości w sposób kaskadowy, wykorzystując oddzielnie wytrenowane modele na różnych rozdzielczościach. Obejmuje to model bazowy, który generuje próbki o niskiej rozdzielczości, oraz kolejne modele super-rozdzielczości, które produkują obrazy o wysokiej rozdzielczości.

Model został wytrenowany na niestandardowej, wysokiej jakości bazie danych LAION-A, zawierającej 1 miliard par (obraz, tekst), która jest podzbiorem angielskiej części bazy danych LAION-5B. Filtry niestandardowe DeepFloyd zostały wykorzystane do usunięcia znaków wodnych, treści nieodpowiednich i innych nieodpowiednich treści.

Proces DeepFloyd IF

Początkowo DeepFloyd IF jest wydany na licencji badawczej. Celem badaczy jest zachęcenie do rozwoju nowych zastosowań w różnych dziedzinach, takich jak sztuka, projektowanie, opowiadanie, rzeczywistość wirtualna i dostępność. Aby zainspirować potencjalne badania, zaproponowali kilka pytań badawczych o charakterze technicznym, akademickim i etycznym.

Pytania badawcze o charakterze technicznym obejmują:

  • Optymalizację modelu IF w celu poprawy wydajności, skalowalności i efektywności.
  • Poprawę jakości wyjściowej poprzez ulepszanie próbkowania, kierowania lub dokształcania modelu.
  • Zastosowanie technik wykorzystywanych do modyfikacji wyjścia Stable Diffusion do DeepFloyd IF.

Pytania badawcze o charakterze akademickim obejmują:

  • Badanie roli pre-trenowania w transferze uczenia.
  • Poprawę kontroli modelu nad generowaniem obrazu.
  • Rozszerzenie możliwości modelu poza syntezę tekst-obraz poprzez integrację wielu modalności.
  • Ocena interpretowalności modelu w celu lepszego zrozumienia cech wizualnych generowanych obrazów.

Pytania badawcze o charakterze etycznym obejmują:

  • Identyfikację i łagodzenie stronniczości w DeepFloyd IF.
  • Ocena wpływu modelu na media społecznościowe i generowanie treści.
  • Stworzenie skutecznego detektora fałszywych obrazów, wykorzystującego model.

Aby uzyskać dostęp do wag modelu, użytkownicy muszą zaakceptować licencję na stronie DeepFloyd’s Hugging Face space. Więcej informacji można znaleźć na stronie internetowej modelu, repozytorium GitHub, demonstracji Gradio lub dołączyć do publicznych dyskusji za pośrednictwem Linktree DeepFloyd.

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.