Моделі та платформи ШІ

Stability AI випускає текстово-образовий модель DeepFloyd IF

mm
Додайте Unite.AI до бажаних джерел у Google

Stability AI та її багатопрофільна лабораторія штучного інтелекту DeepFloyd оголосили про дослідницький реліз DeepFloyd IF, революційної текстово-образової каскадної дифузійної моделі. Спочатку модель випускається під некомерційною ліцензією, проте планується відкритий реліз у майбутньому.

DeepFloyd IF володіє декількома видатними особливостями, серед яких:

  1. Глибоке розуміння текстових підказок: Модель використовує T5-XXL-1.1 як текстовий кодувальник, з численними текстово-образовими шарами уваги, що забезпечує кращу відповідність між підказками та зображеннями.
  2. Співрозуміння та чіткість тексту поряд з згенерованими зображеннями: DeepFloyd IF може генерувати зображення, що містять об’єкти з різними властивостями та просторовими відносинами.
  3. Високий рівень фотorealізму: Модель досягла вражаючого результату з нульовим зсувом FID-оцінки 6.66 на наборі даних COCO.
  4. Зміна співвідношення сторін: Модель може генерувати зображення з нестандартними співвідношеннями сторін, включаючи вертикальні, горизонтальні та стандартні квадратні співвідношення.
  5. Переклад зображень без попереднього навчання: Модель може змінювати стиль, узори та деталі зображення, зберігаючи при цьому його основну форму.

Нижче наведено деякі приклади концепцій, створених DeepFloyd IF:

Модульний, каскадний дизайн піксельної дифузії DeepFloyd IF складається з декількох нейронних модулів, що взаємодіють синергетично. Модель працює в просторі пікселів, обробляючи високорозірненість даних каскадним чином за допомогою окремо навчених моделей на різних роздільностях. Це включає базову модель, яка генерує зразки низької роздільності, та наступні моделі супер-роздільності, які створюють зображення високої роздільності.

Модель була навчена на спеціальному високоякісному наборі даних LAION-A, що містить 1 мільярд пар (зображення, текст), підмножину англійської частини набору даних LAION-5B. Для видалення позначених, NSFW та інших непридатних контентів були використані спеціальні фільтри DeepFloyd.

Процес DeepFloyd IF

Спочатку DeepFloyd IF випускається під дослідницькою ліцензією. Дослідники спрямовані на заохочення розробки нових застосунків у таких галузях, як мистецтво, дизайн, розповіді, віртуальна реальність та доступність. Для стимуляції потенційних досліджень вони запропонували декілька технічних, академічних та етичних дослідницьких питань.

Технічні дослідницькі питання включають:

  • Оптимізацію моделі IF для покращення продуктивності, масштабованості та ефективності.
  • Покращення якості виходу шляхом уточнення вибірки, керування або тонкої настройки моделі.
  • Застосування технік, використаних для модифікації виходу Stable Diffusion, до DeepFloyd IF.

Академічні дослідницькі питання включають:

  • Дослідження ролі попереднього навчання для переносного навчання.
  • Покращення контролю моделі над генерацією зображень.
  • Розширення можливостей моделі за межі текстово-образової синтезу шляхом інтеграції декількох модальностей.
  • Оцінка інтерпретації моделі для покращення розуміння візуальних особливостей згенерованих зображень.

Етичні дослідницькі питання включають:

  • Визначення та пом’якшення упереджень у DeepFloyd IF.
  • Оцінка впливу моделі на соціальні медіа та генерацію контенту.
  • Розробка ефективного детектора фальшивих зображень, що використовує модель.

Для доступу до ваг моделі користувачі повинні прийняти ліцензію на сайті DeepFloyd у Hugging Face space. Для отримання більшої інформації ви можете відвідати веб-сайт моделі, GitHub-репозиторій, Gradio-демонстрацію або приєднатися до публічних обговорень через Linktree DeepFloyd.

Alex очолює новинний підрозділ Unite.AI, що працює на базі ШІ, поєднуючи журналістику, дослідження та автоматизацію для підтримки своєчасного та масштабованого висвітлення штучного інтелекту. Його робота допомагає забезпечити ефективне виявлення нових розробок ШІ, зберігаючи редакційні стандарти видання.