Моделі та платформи ШІ
Stability AI випускає текстово-образовий модель DeepFloyd IF

Stability AI та її багатопрофільна лабораторія штучного інтелекту DeepFloyd оголосили про дослідницький реліз DeepFloyd IF, революційної текстово-образової каскадної дифузійної моделі. Спочатку модель випускається під некомерційною ліцензією, проте планується відкритий реліз у майбутньому.
DeepFloyd IF володіє декількома видатними особливостями, серед яких:
- Глибоке розуміння текстових підказок: Модель використовує T5-XXL-1.1 як текстовий кодувальник, з численними текстово-образовими шарами уваги, що забезпечує кращу відповідність між підказками та зображеннями.
- Співрозуміння та чіткість тексту поряд з згенерованими зображеннями: DeepFloyd IF може генерувати зображення, що містять об’єкти з різними властивостями та просторовими відносинами.
- Високий рівень фотorealізму: Модель досягла вражаючого результату з нульовим зсувом FID-оцінки 6.66 на наборі даних COCO.
- Зміна співвідношення сторін: Модель може генерувати зображення з нестандартними співвідношеннями сторін, включаючи вертикальні, горизонтальні та стандартні квадратні співвідношення.
- Переклад зображень без попереднього навчання: Модель може змінювати стиль, узори та деталі зображення, зберігаючи при цьому його основну форму.
Нижче наведено деякі приклади концепцій, створених DeepFloyd IF:




Модульний, каскадний дизайн піксельної дифузії DeepFloyd IF складається з декількох нейронних модулів, що взаємодіють синергетично. Модель працює в просторі пікселів, обробляючи високорозірненість даних каскадним чином за допомогою окремо навчених моделей на різних роздільностях. Це включає базову модель, яка генерує зразки низької роздільності, та наступні моделі супер-роздільності, які створюють зображення високої роздільності.
Модель була навчена на спеціальному високоякісному наборі даних LAION-A, що містить 1 мільярд пар (зображення, текст), підмножину англійської частини набору даних LAION-5B. Для видалення позначених, NSFW та інших непридатних контентів були використані спеціальні фільтри DeepFloyd.

Процес DeepFloyd IF
Спочатку DeepFloyd IF випускається під дослідницькою ліцензією. Дослідники спрямовані на заохочення розробки нових застосунків у таких галузях, як мистецтво, дизайн, розповіді, віртуальна реальність та доступність. Для стимуляції потенційних досліджень вони запропонували декілька технічних, академічних та етичних дослідницьких питань.
Технічні дослідницькі питання включають:
- Оптимізацію моделі IF для покращення продуктивності, масштабованості та ефективності.
- Покращення якості виходу шляхом уточнення вибірки, керування або тонкої настройки моделі.
- Застосування технік, використаних для модифікації виходу Stable Diffusion, до DeepFloyd IF.
Академічні дослідницькі питання включають:
- Дослідження ролі попереднього навчання для переносного навчання.
- Покращення контролю моделі над генерацією зображень.
- Розширення можливостей моделі за межі текстово-образової синтезу шляхом інтеграції декількох модальностей.
- Оцінка інтерпретації моделі для покращення розуміння візуальних особливостей згенерованих зображень.
Етичні дослідницькі питання включають:
- Визначення та пом’якшення упереджень у DeepFloyd IF.
- Оцінка впливу моделі на соціальні медіа та генерацію контенту.
- Розробка ефективного детектора фальшивих зображень, що використовує модель.
Для доступу до ваг моделі користувачі повинні прийняти ліцензію на сайті DeepFloyd у Hugging Face space. Для отримання більшої інформації ви можете відвідати веб-сайт моделі, GitHub-репозиторій, Gradio-демонстрацію або приєднатися до публічних обговорень через Linktree DeepFloyd.












