Моделі та платформи ШІ

Stability AI випускає текстово-образовий модель DeepFloyd IF

mm
Додайте Unite.AI до бажаних джерел у Google

Stability AI та її багатопрофільна лабораторія штучного інтелекту DeepFloyd оголосили про дослідницький реліз DeepFloyd IF, революційної текстово-образової каскадної дифузійної моделі. Спочатку модель випускається під некомерційною ліцензією, проте планується відкритий реліз у майбутньому.

DeepFloyd IF володіє декількома видатними особливостями, серед яких:

  1. Глибоке розуміння текстових підказок: Модель використовує T5-XXL-1.1 як текстовий кодувальник, з численними текстово-образовими шарами уваги, що забезпечує кращу відповідність між підказками та зображеннями.
  2. Співрозуміння та чіткість тексту поряд з згенерованими зображеннями: DeepFloyd IF може генерувати зображення, що містять об’єкти з різними властивостями та просторовими відносинами.
  3. Високий рівень фотorealізму: Модель досягла вражаючого результату з нульовим зсувом FID-оцінки 6.66 на наборі даних COCO.
  4. Зміна співвідношення сторін: Модель може генерувати зображення з нестандартними співвідношеннями сторін, включаючи вертикальні, горизонтальні та стандартні квадратні співвідношення.
  5. Переклад зображень без попереднього навчання: Модель може змінювати стиль, узори та деталі зображення, зберігаючи при цьому його основну форму.

Нижче наведено деякі приклади концепцій, створених DeepFloyd IF:

Модульний, каскадний дизайн піксельної дифузії DeepFloyd IF складається з декількох нейронних модулів, що взаємодіють синергетично. Модель працює в просторі пікселів, обробляючи високорозірненість даних каскадним чином за допомогою окремо навчених моделей на різних роздільностях. Це включає базову модель, яка генерує зразки низької роздільності, та наступні моделі супер-роздільності, які створюють зображення високої роздільності.

Модель була навчена на спеціальному високоякісному наборі даних LAION-A, що містить 1 мільярд пар (зображення, текст), підмножину англійської частини набору даних LAION-5B. Для видалення позначених, NSFW та інших непридатних контентів були використані спеціальні фільтри DeepFloyd.

Процес DeepFloyd IF

Спочатку DeepFloyd IF випускається під дослідницькою ліцензією. Дослідники спрямовані на заохочення розробки нових застосунків у таких галузях, як мистецтво, дизайн, розповіді, віртуальна реальність та доступність. Для стимуляції потенційних досліджень вони запропонували декілька технічних, академічних та етичних дослідницьких питань.

Технічні дослідницькі питання включають:

  • Оптимізацію моделі IF для покращення продуктивності, масштабованості та ефективності.
  • Покращення якості виходу шляхом уточнення вибірки, керування або тонкої настройки моделі.
  • Застосування технік, використаних для модифікації виходу Stable Diffusion, до DeepFloyd IF.

Академічні дослідницькі питання включають:

  • Дослідження ролі попереднього навчання для переносного навчання.
  • Покращення контролю моделі над генерацією зображень.
  • Розширення можливостей моделі за межі текстово-образової синтезу шляхом інтеграції декількох модальностей.
  • Оцінка інтерпретації моделі для покращення розуміння візуальних особливостей згенерованих зображень.

Етичні дослідницькі питання включають:

  • Визначення та пом’якшення упереджень у DeepFloyd IF.
  • Оцінка впливу моделі на соціальні медіа та генерацію контенту.
  • Розробка ефективного детектора фальшивих зображень, що використовує модель.

Для доступу до ваг моделі користувачі повинні прийняти ліцензію на сайті DeepFloyd у Hugging Face space. Для отримання більшої інформації ви можете відвідати веб-сайт моделі, GitHub-репозиторій, Gradio-демонстрацію або приєднатися до публічних обговорень через Linktree DeepFloyd.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.