Промпт-інжиніринг

Ближчий погляд на DALL-E 3 від OpenAI

mm
Додайте Unite.AI до бажаних джерел у Google
DALL·E 3

У світі генеративного ІІ, підтримання актуальності – це ім’я гри. І коли мова йде про генерацію зображень, Stable Diffusion та Midjourney були платформами, про які всі говорили – аж до появи DALL-E 3.

OpenAI, підтримувана технологічним гігантом Microsoft (MSFT ), представила DALL·E 3 20 вересня 2023 року.

DALL-E 3 – це не тільки створення зображень, а й оживлення ваших ідей саме так, як ви їх уявили. І найкраще в цьому – швидкість. У вас є ідея, ви вводите її в DALL-E 3, і готово – ваше зображення готове.

Отож, у цій статті ми глибоко зануримося у те, чим є DALL-E 3. Ми поговоримо про те, як воно працює, що відрізняє його від інших, і чому воно може стати саме тим інструментом, якого ви не знали, що вам потрібно. Чи ви дизайнер, художник, чи просто людина з великою кількістю крутих ідей – ви захочете залишитися з нами. Почнімо.

Що нового в DALL·E 3 – це те, що воно набагато краще розуміє контекст, ніж DALL·E 2. Раніші версії могли пропустити деякі деталі або проігнорувати деякі подробиці, але DALL·E 3 все робить правильно. Воно точно сприймає деталі того, про що ви просите, і дає вам зображення, яке близьке до того, що ви уявили.

Круто в цьому – те, що DALL·E 3 тепер інтегрований з ChatGPT. Вони працюють разом, щоб допомогти вам вдосконалити ваші ідеї. Ви вводите концепцію, ChatGPT допомагає вам доопрацювати промпт, а DALL·E 3 оживляє вашу ідею. Якщо вам не сподобалося зображення, ви можете попросити ChatGPT доопрацювати промпт і знову звернутися до DALL·E 3. За щомісячну плату в 20 доларів ви отримуєте доступ до GPT-4, DALL·E 3 та багатьох інших крутих функцій.

Bing Chat від Microsoft вже отримала доступ до DALL·E 3, навіть раніше, ніж ChatGPT від OpenAI, і тепер не тільки великі підприємства, а й кожен може безкоштовно експериментувати з ним. Інтеграція з Bing Chat та Bing Image Creator робить його ще легшим у використанні для всіх.

Зростання дифузійних моделей

За останні три роки світ бачив зростання дифузійних моделей, які зробили суттєвий стрибок вперед, особливо у генерації зображень. До появи дифузійних моделей генеративні адверсарні мережі (GAN) були основною технологією для генерації реалістичних зображень.

GANs

GANs

Однак, вони мали свої власні проблеми, включаючи необхідність великої кількості даних і обчислювальної потужності, що часто робило їх складними для використання.

І тоді з’явилися дифузійні моделі. Вони з’явилися як більш стабільна і ефективна альтернатива GAN. На відміну від GAN, дифузійні моделі працюють шляхом додавання шуму до даних, маскуючи їх, поки не залишається тільки випадковість. Потім вони працюють у зворотному напрямку, щоб повернути цей процес, реконструюючи значимі дані з шуму. Цей процес виявився ефективним і менш ресурсоємним, що зробило дифузійні моделі гарячою темою в спільноті ІІ.

Справжній переломний момент стався близько 2020 року, з появою серії інноваційних робіт і введенням технології CLIP від OpenAI, що суттєво просунуло можливості дифузійних моделей. Це зробило дифузійні моделі винятково хорошими у синтезі тексту в зображення, дозволяючи їм генерувати реалістичні зображення з текстових описів. Ці прориви не були тільки у генерації зображень, а й у галузях, таких як композиція музики і біомедичні дослідження.

Сьогодні дифузійні моделі не тільки тема академічного інтересу, а й застосовуються у практичних, реальних сценаріях.

Генеративне моделювання та шари самоуваги: DALL-E 3

Одним з критичних досягнень у цій галузі стало вдосконалення генеративного моделювання, з підходами, заснованими на вибірці, такими як автoregresивне генеративне моделювання та дифузійні процеси, які ведуть шлях. Вони перетворили моделі тексту в зображення, призводячи до суттєвих поліпшень продуктивності. Розбиваючи генерацію зображень на окремі кроки, ці моделі стали більш прийнятними і легшими для вивчення нейронними мережами.

Паралельно, використання шарів самоуваги відіграло важливу роль. Ці шари, укладені один на одного, допомогли у генерації зображень без потреби у неявних просторових упередженнях, типовій проблемі для конволюцій. Це дозволило моделям тексту в зображення масштабуватися і поліпшуватися надійно, завдяки добре зрозумілим властивостям масштабування трансформерів.

Виклики та рішення у генерації зображень

Незважаючи на ці досягнення, контрольованість у генерації зображень залишається викликом. Проблеми, такі як дотримання промпту, де модель може не слідувати точно текстовому вводу, залишаються поширеними. Для вирішення цих проблем були запропоновані нові підходи, такі як покращення підписів, спрямовані на поліпшення якості текстово-зображень пар у наборах даних для навчання.

Покращення підписів: новий підхід

Покращення підписів включає генерацію високоякісних підписів для зображень, що, в свою чергу, допомагає у навчанні більш точних моделей тексту в зображення. Це досягається за допомогою потужного інструменту підписів зображень, який створює детальні та точні описи зображень. Навчаючись на цих покращених підписах, DALL-E 3 змогли досягти вражаючих результатів, дуже близьких до фотографій і художніх творів, створених людьми.

Навчання на синтетичних даних

Концепція навчання на синтетичних даних не нова. Однак, унікальний внесок тут полягає у створенні нового, описового системи підписів зображень. Вплив використання синтетичних підписів для навчання генеративних моделей був суттєвим, призводячи до поліпшення здатності моделі точно слідувати промптам.

Оцінка DALL-E 3

Через численні оцінки та порівняння з попередніми моделями, такими як DALL-E 2 і Stable Diffusion XL, DALL-E 3 продемонстрував вищу продуктивність, особливо у завданнях, пов’язаних з дотриманням промпту.

Порівняння моделей тексту в зображення на різних оцінках

Порівняння моделей тексту в зображення на різних оцінках

Використання автоматизованих оцінок і бенчмарків надало чіткі докази його можливостей, закріпивши його позицію як моделі тексту в зображення найвищого рівня.

Промпти та можливості DALL-E 3

DALL-E 3 пропонує більш логічний і вдосконалений підхід до створення візуальних елементів. Коли ви прокрутуєте, ви помітите, як DALL-E створює кожне зображення, поєднуючи точність і уяву, що резонує з заданим промптом.

На відміну від свого попередника, ця вдосконалена версія excels у розміщенні об’єктів природно всередині сцени та зображенні людських рис точно, аж до правильної кількості пальців на руці. Покращення розширюються до тонких деталей і тепер доступні у вищій роздільній здатності, забезпечуючи більш реалістичний і професійний результат.

Можливості текстової візуалізації також суттєво покращилися. Якщо попередні версії DALL-E генерували безглузді тексти, DALL-E 3 тепер може генерувати читабельні та професійно стилізовані тексти (іноді), і навіть чисті логотипи час від часу.

Розуміння моделі складних і нюансових запитів на зображення суттєво покращилося. DALL-E 3 тепер може точно слідувати детальним описам, навіть у сценаріях з多oma елементами та конкретними інструкціями, демонструючи свою здатність створювати узгоджене і добре складене зображення. Давайте розглянемо деякі промпти та відповідні результати, які ми отримали:

Розробіть упаковку для лінії органічних чаїв. Включіть місце для назви продукту та опису.

Зображення DALL-E 3, створені на основі текстових промптів

Зображення DALL-E 3, створені на основі текстових промптів (Примітка: лівий плакат має неправильне написання)

Створіть веб-баннер, який рекламує літню розпродаж меблі для відкритого простору. Зображення повинно містити пляжну обстановку з різними предметами меблі для відкритого простору та текстом, який оголошує 'Великі літні заощадження!'

Зображення DALL-E 3, створені на основі текстових промптів

Зображення DALL-E 3, створені на основі текстових промптів

Створіть винтажний плакат про подорожі до Парижа з жирним і стилізованим текстом, який говорить 'Відвідайте Париж' внизу.

Зображення DALL-E 3, створені на основі текстових промптів

Зображення DALL-E 3, створені на основі текстових промптів (Примітка: обидва плакати мають неправильне написання)

Створіть зображення заповненого сцени фестивалю Дівалі в Індії, з сім'ями, які запалюють лампи, феєрверки в небі, і традиційні солодощі та прикраси.
Зображення DALL-E 3, створені на основі текстових промптів

Зображення DALL-E 3, створені на основі текстових промптів

Створіть зображення ринкової сцени в стародавньому Римі, з людьми в одязі відповідного періоду, різними товарами на продаж та архітектурою того часу.
Зображення DALL-E 3, створені на основі текстових промптів

Зображення DALL-E 3, створені на основі текстових промптів

Створіть зображення відомої історичної постаті, наприклад Клеопатри або Леонардо да Вінчі, розміщеної в сучасному середовищі, використовуючи сучасні технології, такі як смартфони чи ноутбуки.
Зображення DALL-E 3, створені на основі текстових промптів

Зображення DALL-E 3, створені на основі текстових промптів

Обмеження та ризики DALL-E 3

OpenAI зробила суттєві кроки для фільтрації явного контенту з навчальних даних DALL-E 3, спрямовані на зменшення упереджень і поліпшення виходу моделі. Це включає застосування конкретних фільтрів для чутливих категорій контенту та перегляд порогових значень для ширших фільтрів. Стек мінімізації також включає кілька шарів захисту, таких як механізми відмови в ChatGPT для чутливих тем, класифікатори промптів для запобігання порушень політики, чорні списки для конкретних категорій контенту та перетворення для забезпечення відповідності промптів керівним принципам.

Незважаючи на свої досягнення, DALL-E 3 має обмеження у розумінні просторових відносин, відтворенні довгих текстів точно та генерації конкретних зображень. OpenAI визнає ці виклики і працює над поліпшеннями для майбутніх версій.

Компанія також працює над способами відрізнити зображення, створені ІІ, від тих, які створені людьми, відображаючи свою приверженість прозорості та відповідальному використанню ІІ.

DALL·E

DALL·E 3

DALL-E 3, остання версія, буде доступна поетапно, починаючи з конкретних груп клієнтів, а згодом розширюватиметься на дослідницькі лабораторії та сервіси API. Однак дата вільного публічного випуску ще не підтверджена.

OpenAI справді встановлює новий стандарт у сфері ІІ з DALL-E 3, безшовно поєднуючи складні технічні можливості та дружній інтерфейс. Інтеграція DALL-E 3 у широко використовувані платформи, такі як Bing, відображає зсув від спеціалізованих застосунків до більш загальних, доступних форм розваг та корисності.

Справжнім проривом у майбутніх роках, ймовірно, стане баланс між інноваціями та емпаверментом користувачів. Компанії, які успішно пройдуть цей шлях, будуть не тільки ті, які розширять межі того, що може зробити ІІ, а й ті, які нададуть користувачам автономію та контроль, якого вони бажають. OpenAI, з її приверженістю етичному ІІ, рухається цим шляхом обережно. Мета ясна: створити інструменти ІІ, які будуть не тільки потужними, а й надійними та інклюзивними, забезпечуючи, щоб переваги ІІ були доступні всім.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.