Промпт-инжиниринг

Более близкий взгляд на DALL-E 3 от OpenAI

mm
Добавьте Unite.AI в избранные источники в Google
DALL·E 3

В мире Генеративного ИИ поддержание актуальности является ключом к успеху. И когда речь идет о генерации изображений, Stable Diffusion и Midjourney были платформами, о которых все говорили – пока не появился DALL-E 3.

OpenAI, поддерживаемая технологическим гигантом Microsoft (MSFT ), представила DALL·E 3 20 сентября 2023 года.

DALL-E 3 – это не просто создание изображений; это оживление ваших идей, именно так, как вы их представляли. И лучшее? Это быстро, очень быстро. У вас есть идея, вы ее передаете DALL-E 3, и готово – ваше изображение готово.

Итак, в этой статье мы глубоко погрузимся в то, что такое DALL-E 3. Мы поговорим о том, как он работает, что отличает его от других и почему он может быть именно тем инструментом, который вам нужен. Будь вы дизайнером, художником или просто человеком с множеством интересных идей, вы захотите остаться с нами. Давайте начнем.

Что нового в DALL·E 3 – это то, что он лучше понимает контекст, чем DALL·E 2. Ранние версии могли пропустить некоторые детали или проигнорировать некоторые подробности, но DALL·E 3 точен. Он улавливает точные детали того, о чем вы просите, давая вам изображение, которое ближе к тому, что вы представляли.

Круто? DALL·E 3 и ChatGPT теперь интегрированы вместе. Они работают вместе, чтобы помочь усовершенствовать ваши идеи. Вы даете концепцию, ChatGPT помогает в уточнении запроса, и DALL·E 3 оживляет ее. Если вам не нравится изображение, вы можете попросить ChatGPT скорректировать запрос и попросить DALL·E 3 попробовать еще раз. За ежемесячную плату в 20 долларов вы получаете доступ к GPT-4, DALL·E 3 и многим другим интересным функциям.

Бинг-чат от Microsoft получил доступ к DALL·E 3 даже раньше, чем ChatGPT от OpenAI, и теперь это не только крупные корпорации, но и все, кто может поиграть с ним бесплатно. Интеграция в Бинг-чат и Бинг-изображение делает его намного проще использовать для всех.

Восхождение диффузионных моделей

За последние три года в области ИИ произошел значительный скачок в развитии диффузионных моделей, особенно в генерации изображений. До диффузионных моделей Генеративные противостоящие сети (GANs) были основной технологией для создания реалистичных изображений.

GANs

GANs

Однако у них были свои проблемы, включая необходимость огромных объемов данных и вычислительной мощности, что часто делало их трудными в использовании.

Вот где появляются диффузионные модели. Они появились как более стабильная и эффективная альтернатива GANs. В отличие от GANs, диффузионные модели работают путем добавления шума к данным, скрывая их до тех пор, пока не остается только случайность. Затем они работают в обратном направлении, восстанавливая осмысленные данные из шума. Этот процесс оказался эффективным и менее требовательным к ресурсам, что сделало диффузионные модели горячей темой в сообществе ИИ.

Настоящий поворотный момент произошел около 2020 года, с серией инновационных работ и введением технологии CLIP от OpenAI, которая значительно расширила возможности диффузионных моделей. Это сделало диффузионные модели исключительно хорошими в синтезе текста и изображений, позволяя им создавать реалистичные изображения из текстовых описаний. Эти прорывы не были только в генерации изображений, но и в таких областях, как композиция музыки и биомедицинские исследования.

Сегодня диффузионные модели не только тема академического интереса, но и используются в практических, реальных сценариях.

Генеративное моделирование и слои самоповторения: DALL-E 3

Одним из критических достижений в этой области стало развитие генеративного моделирования, с подходами, основанными на выборке, такими как автoregressive генеративное моделирование и диффузионные процессы, которые ведут путь. Они преобразовали модели текст-изображение, приведя к значительному улучшению производительности. Разбивая генерацию изображений на дискретные шаги, эти модели стали более доступными и легче для обучения нейронных сетей.

В параллели использование слоев самоповторения сыграло решающую роль. Эти слои, сложенные вместе, помогли в генерации изображений без необходимости неявных пространственных предубеждений, распространенной проблемы с свертками. Этот сдвиг позволил моделям текст-изображение масштабироваться и улучшаться надежно, благодаря хорошо понимаемым свойствам масштабирования трансформеров.

Проблемы и решения в генерации изображений

Несмотря на эти достижения, контролируемость в генерации изображений остается проблемой. Проблемы, такие как следование запросу, когда модель может не следовать тесно за входным текстом, были распространенными. Чтобы решить эту проблему, были предложены новые подходы, такие как улучшение подписей, направленные на улучшение качества текстовых и изображений пар в наборах данных для обучения.

Улучшение подписей: Новый подход

Улучшение подписей включает в себя создание более качественных подписей для изображений, что, в свою очередь, помогает в обучении более точных моделей текст-изображение. Это достигается с помощью прочного подписчика изображений, который производит подробные и точные описания изображений. Обучаясь на этих улучшенных подписях, DALL-E 3 смог достичь замечательных результатов, близких к фотографиям и произведениям искусства, созданным человеком.

Обучение на синтетических данных

Концепция обучения на синтетических данных не нова. Однако, уникальный вклад здесь заключается в создании новой, описательной системы подписывания изображений. Влияние использования синтетических подписей для обучения генеративных моделей было значительным, что привело к улучшению способности модели точно следовать запросам.

Оценка DALL-E 3

Через множественные оценки и сравнения с предыдущими моделями, такими как DALL-E 2 и Stable Diffusion XL, DALL-E 3 продемонстрировал превосходную производительность, особенно в задачах, связанных с следованием запросу.

Сравнение моделей текст-изображение на различных оценках

Сравнение моделей текст-изображение на различных оценках

Использование автоматических оценок и тестов предоставило четкие доказательства его возможностей, укрепив его позицию как модели текст-изображение мирового класса.

DALL-E 3: Запросы и способности

DALL-E 3 предлагает более логичный и усовершенствованный подход к созданию визуальных эффектов. Когда вы прокручиваете, вы заметите, как DALL-E создает каждое изображение, сочетая точность и воображение, которые резонируют с данным запросом.

В отличие от своего предшественника, эта обновленная версия отличается в расположении объектов естественным образом внутри сцены и изображении человеческих черт точно, вплоть до правильного количества пальцев на руке. Улучшения распространяются на более мелкие детали и теперь доступны в более высоком разрешении, обеспечивая более реалистичный и профессиональный вывод.

Возможности текстового рендеринга также значительно улучшились. В то время как предыдущие версии DALL-E производили бессмыслицу, DALL-E 3 может теперь генерировать читаемый и профессионально оформленный текст (иногда), и даже чистые логотипы время от времени.

Понимание модели сложных и нюансовых запросов на изображения было значительно улучшено. DALL-E 3 может теперь точно следовать подробным описаниям, даже в сценариях с несколькими элементами и конкретными инструкциями, демонстрируя свою способность производить связные и хорошо составленные изображения. Давайте рассмотрим некоторые запросы и соответствующие результаты:

Дизайн упаковки для линии органических чаев. Включите место для названия продукта и описания.

DALL-E 3 изображения на основе текстовых запросов

DALL-E 3 изображения на основе текстовых запросов (Обратите внимание, что на левой обложке есть неправильное написание)

Создайте веб-баннер, рекламирующий летнюю распродажу на уличную мебель. Изображение должно содержать пляжную обстановку с различными предметами уличной мебели и текстом, объявляющим 'Огромные летние сбережения!'

DALL-E 3 изображения на основе текстовых запросов

DALL-E 3 изображения на основе текстовых запросов

Винтажный плакат о путешествии в Париж с смелым и стилизованным текстом, говорящим 'Посетите Париж' внизу.

DALL-E 3 изображения на основе текстовых запросов

DALL-E 3 изображения на основе текстовых запросов (Обратите внимание, что оба плаката имеют неправильное написание)

Оживленная сцена фестиваля Дивали в Индии, с семьями, зажигающими лампы, фейерверками в небе и традиционными сладостями и украшениями.
DALL-E 3 изображения на основе текстовых запросов

DALL-E 3 изображения на основе текстовых запросов

Подробный рынок в древнем Риме, с людьми в одежде соответствующего периода, различными товарами на продажу и архитектурой того времени.
DALL-E 3 изображения на основе текстовых запросов

DALL-E 3 изображения на основе текстовых запросов

Сгенерируйте изображение знаменитой исторической фигуры, такой как Клеопатра или Леонардо да Винчи, помещенной в современную обстановку, используя современные технологии, такие как смартфоны или ноутбуки.
DALL-E 3 изображения на основе текстовых запросов

DALL-E 3 изображения на основе текстовых запросов

Ограничения и риски DALL-E 3

OpenAI предприняла значительные шаги, чтобы отфильтровать явный контент из обучающих данных DALL-E 3, стремясь уменьшить предубеждения и улучшить выходные данные модели. Это включает в себя применение конкретных фильтров для чувствительных категорий контента и пересмотр порогов для более широких фильтров. Стек смягчения также включает в себя несколько слоев защитных мер, таких как механизмы отказа в ChatGPT для чувствительных тем, классификаторы входных запросов для предотвращения нарушений политики, черные списки для конкретных категорий контента и преобразования для обеспечения соответствия запросов руководящим принципам.

Несмотря на свои достижения, DALL-E 3 имеет ограничения в понимании пространственных отношений, рендеринге длинного текста точно и генерации конкретных изображений. OpenAI признает эти проблемы и работает над улучшениями для будущих версий.

Компания также работает над способами различать изображения, сгенерированные ИИ, от тех, которые сделаны людьми, отражая свою приверженность прозрачности и ответственной практике ИИ.

DALL·E

DALL·E 3

DALL-E 3, последняя версия, будет доступна поэтапно, начиная с конкретных групп клиентов и позже расширяясь до исследовательских лабораторий и API-сервисов. Однако дата бесплатного публичного выпуска еще не подтверждена.

OpenAI действительно устанавливает новый стандарт в области ИИ с DALL-E 3, безшовно сочетая сложные технические возможности и удобные интерфейсы. Интеграция DALL-E 3 в широко используемые платформы, такие как Бинг, отражает сдвиг от специализированных приложений к более широким, доступным формам развлечения и полезности.

Настоящий игрок в ближайшие годы, скорее всего, будет баланс между инновациями и эмансипацией пользователей. Компании, которые преуспеют, будут те, которые не только расширяют границы того, что может сделать ИИ, но также предоставляют пользователям автономию и контроль, которых они желают. OpenAI, с ее приверженностью этическому ИИ, осторожно проходит по этому пути. Цель ясна: создать инструменты ИИ, которые не только мощны, но и заслуживают доверия и доступны всем, обеспечивая, чтобы преимущества ИИ были доступны всем.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.