Промпт-инжиниринг

Освоение искусства ИИ: краткое руководство по Midjourney и инженерии запросов

mm
Добавьте Unite.AI в избранные источники в Google
Midjourney Generated UNITE AI LOGO

Введение в искусство MidJourney, сгенерированное ИИ

ИИ быстро преодолевает барьеры невозможного и недавно вторгся в область искусства, полностью преобразив ее. Теперь вам не нужно быть мастером или экспертом в Photoshop, чтобы оживить фрагменты вашего воображения. Просто хорошо сформулированный запрос – все, что вам нужно, благодаря Midjourney.

Все началось с введения революционных технологий, таких как DALL-E, Midjourney и StableDiffusion, в 2022 году. Хотя каждое из этих инноваций привнесло свой уникальный штрих в область генеративного ИИ, Midjourney, в частности, продолжает свое увлекательное путешествие, делая заметные шаги.

Midjourney в настоящее время является ведущим высокоразрешающим генератором изображений на основе текста на рынке и выделяется своей уникальной смесью генерации изображений на основе текста, редактирования и масштабирования медиа, а также доступа к активному художественному сообществу, все начиная с 10 долларов в месяц. Этот комплексный набор функций представляет собой увлекательную площадку для художников, энтузиастов технологий и профессионалов ИИ, создавая среду для творчества и инноваций.

Мир искусства, безусловно, обращает на это внимание, поскольку генеративный ИИ на рынке искусства, как ожидается, будет расти с темпом 40,5% в год. Midjourney не имеет равных в создании наиболее реалистичных и высококачественных визуальных эффектов с помощью ИИ.

Эффективная инженерия запросов выходит за рамки простого создания; она включает в себя лучшие практики. Запросы должны быть ясными, краткими, но в то же время предоставлять ИИ достаточное руководство без чрезмерного предписания. Кроме того, целевая аудитория должна быть учтена при проектировании, учитывая такие переменные, как возраст, пол и культурный фон, среди прочего.

Как работает MidJourney?

Mid-Journey использует две новые технологии машинного обучения – большие языковые и диффузионные модели. Языковая модель, аналогичная чат-ботам ИИ, таких как ChatGPT, помогает Mid-Journey интерпретировать смысл ваших запросов и преобразовывать их в векторы. Этот вектор затем руководит процессом диффузии.

Внутренние механизмы Midjourney в основном не разглашаются. Тем не менее, очевидно, что он использует генерацию изображений на основе текста из двух относительно новых технологий машинного обучения: больших языковых моделей и диффузионных моделей. Первая, возможно, знакома пользователям платформ ИИ, таких как ChatGPT, а вторая – это перспективное дополнение к сектору генерации изображений на основе ИИ. Всю систему поддерживает набор данных CLIP для обучения, который можно найти на странице исследований OpenAI.

Несмотря на ограниченную информацию, можно составить общую картину модели диффузии Midjourney, названной ‘Стабильная диффузия’. По сути, Стабильная диффузия – это открытая модель, которая умело преобразует текстовые запросы в изображения различных стилей и содержания. Этот сложный процесс достигается с помощью модели диффузии, генеративной модели, которая связывает зависимости между текстовыми входами и выходами изображений.

Модели диффузии построены на основе метода денойзинга диффузии, подхода, под влиянием термодинамики неравновесных систем. Этот метод систематически разрушает структуру данных, а затем восстанавливает ее. Этот подход был адаптирован для генерации изображений Хо и др. в 2020 году, что привело к созданию моделей диффузии, которые мы видим сегодня.

Обучение моделей диффузии включает в себя два основных этапа. Первоначально процесс диффузии или прямой процесс включает в себя постепенное добавление случайного шума к входному изображению до тех пор, пока оно не превратится полностью в шум. Этот процесс управляется фиксированной цепью Маркова, которая последовательно добавляет гауссовский шум на нескольких последовательных шагах.

Демонстрация работы Midjourney

Затем, на этапе обратного или восстановления, модель восстанавливает исходные данные из состояния, доминируемого шумом, достигнутого в процессе диффузии. Этот процесс управляется цепью Маркова с обученными гауссовскими переходами, что означает, что предсказание плотности вероятности в любой момент времени зависит только от состояния, достигнутого на предыдущем шаге. Поскольку скрытые ‘x1, …, xT’ имеют ту же размерность, что и данные, модели диффузии классифицируются как модели скрытых переменных.

Стоимость и подписка Mid-Journey

Хотя многие чат-боты, такие как ChatGPT и Bing Chat, предлагают почти неограниченное использование бесплатно, ситуация отличается для генераторов изображений, таких как Mid-Journey. Из-за значительной вычислительной мощности, необходимой, особенно от графических процессоров (GPU) и использования видеопамяти для процесса денойзинга, услуги Mid-Journey имеют цену.

Базовый план начинается с 10 долларов в месяц, предоставляя около 3,3 часа времени GPU, что достаточно для примерно 200 генераций изображений. Однако есть более высокие планы, предлагающие неограниченное количество изображений в режиме Relaxed, хотя и с более длительным временем ожидания.

Настройка MidJourney

  1. Начало работы с MidJourney включает регистрацию на их официальном сайте, подписку на план и последующее перенаправление на Discord.
  2. Как только вы найдете канал Mid-Journey на Discord, перейдите к группам Newcomer на левой стороне. Оттуда вы можете наблюдать, как другие пользователи создают запросы, учиться механизмам Mid-Journey и взаимодействовать в оживленной среде.
  3. После ознакомления с окружением пригласите бота в ваш приватный сервер, чтобы создавать изображения без помех. Бот генерирует четыре предварительных изображения на основе вашего запроса, позволяя вам выбрать наиболее близкий вариант к вашей исходной идее и дальнейшее усовершенствование изображения.

Структура запроса для Midjourney

  1. Команда /imagine в канале Discord внутри канала Midjourney генерирует уникальное изображение из краткого текстового описания (запроса).
  2. Чтобы воссоздать определенный стиль на различных изображениях, просто введите URL-адрес изображения вместе с вашим текстовым запросом. Ваши новые, последовательные выходные данные будут объединять элементы как из вашего выбранного изображения, так и из текста.
    /imagine http://link-to-your-image –parameter1 –parameter2
    Вы можете сгенерировать ссылку на ваше изображение, загрузив его в канал Discord. Как только оно загружено, щелкните правой кнопкой мыши по изображению и выберите ‘Копировать ссылку’.
    Здесь http://link-to-your-image и параметры являются необязательными.
  3. После этого бот начинает работать над вашим изображением, тратя примерно минуту на предложение четырех альтернатив. Этот процесс включает в себя использование мощных графических процессоров (GPU) для обработки и интерпретации каждого запроса.
  4. Отслеживайте использование GPU с помощью команды /info. Она позволяет проверить оставшееся ‘Быстрое время’ и контролировать время GPU вашей подписки.

Пример запроса /info Midjourney

Масштабирование и изменение изображений

Для более точного изображения используйте кнопки ‘U’ под изображениями, чтобы масштабировать ваш предпочитаемый вариант. Вы также можете использовать кнопки ‘V’, чтобы внести изменения в определенные изображения. Для дальнейших изменений масштабированного изображения используйте варианты ‘Создать вариации’, ‘Пересоздать масштабирование’ и ‘Пересоздать бета-масштабирование’. Кнопка ‘Веб’ позволяет просмотреть изображение в более крупном размере в отдельном окне.

Midjourney позволяет масштабировать изображения до разрешения 2048×2048 (квадрат) и 2720×1530 (широкоэкран) с помощью функции бета-масштабирования, с размером сетки генерации по умолчанию 1024×1024 (квадрат) и 1456×816 (широкоэкран). Каждое изображение можно дополнительно улучшить с помощью опций масштабирования ‘U’, которые улучшают определенные части изображения.

Взгляните на этот запрос, который производит фантастическое произведение искусства с помощью версии 5.2 Midjourney.

/imagine Произведение искусства изображает одинокое дерево под звездным небом, с ребенком, читающим под ним, в оттенках спокойного синего и теплого оранжевого, вдохновленного мазками французского импрессионизма, персидскими миниатюрами, простотой Баухауса, напоминающим классические иллюстрации детских сказок, достигая асимметричной гармонии, выраженной в очаровательной, фольклорной/наивной манере: –ar 15:19 –upbeta –q 2

Пример запроса Midjourney

Создание вашего первого произведения искусства Midjourney

  1. Создание базового плана: представьте себя художником. Начните с простого, яркого описания изображения, которое вы хотите оживить. Определите основную тему, атмосферу или даже мелкие детали, которые вы хотите включить. Используйте пунктуацию, такую как запятые, скобки и дефисы, чтобы структурировать свои мысли. Для лучших результатов будьте явными о контексте и деталях вашего дизайна. Элементы, такие как тема (например, дракон, винтажная машина, Авраам Линкольн), среда (например, цифровое искусство, карандашный эскиз), окружение (например, космическое пространство, под водой, оживленный город), освещение (например, мягкое, неоновое, подсвеченное), цвет (например, земные тона, яркие, приглушенные), настроение (например, меланхолическое, причудливое, мирное) и композиция (например, пейзаж, крупный план, широкий угол) могут быть важными. Примеры:
    • Идиллический лес, купающийся в солнечном свете, с тропинкой, извивающейся вдали
    • Город, который никогда не спит, с неоновыми огнями, отражающимися от тротуаров, и разнообразной толпой, снующей вокруг
  2. Внедрение стиля и ключевых слов: ИИ Midjourney способен создавать изображения в различных стилях, таких как абстрактный, сюрреалистический или реалистичный. Включая стиль или связанные ключевые слова, вы можете направить ИИ на создание изображения, отражающего ваше видение. Экспериментируйте с различными стилями и ключевыми словами, чтобы найти идеальную смесь. Примеры:
    • Пейзаж, изображающий пустыню на рассвете, отражающий стиль Джорджии О’Киф, с пастельной цветовой гаммой и органическими формами.
    • Абстрактное изображение мирного леса, с геометрическими узорами, образующими деревья и листву, вдохновленное композициями Пита Мондриана.
  3. Использование расширенных настроек: Рассмотрите Midjourney как ваш творческий инструментарий, наполненный расширенными настройками, которые позволяют вам тонко настроить сгенерированные изображения. Это как владение магической палочкой, позволяющей вам вызвать идеальный баланс случайности, стилизации и вариаций изображения. Раскройте свой творческий потенциал, экспериментируя с этими настройками, пока не найдете идеальную смесь, которая резонирует с вашим видением. Примеры:
    • Спокойный японский сад с прудом, отражающим вишневые деревья –seed 22 –s 150 –c 40
    • Дистопический киберпанковский город, освещенный неоновыми огнями –seed 88 –s 600 –c 60
  4. Подчеркивание элементов с весами: Представьте свое изображение как симфонию, где каждый элемент вносит свой вклад в общую картину. Используя обозначение “::”, вы можете диктовать важность различных элементов в вашем изображении, позволяя вам контролировать фокус. Примеры:
    • [Элегантный павлин]::3, сидящий на [вишневом дереве]::1, цветущем яркими цветами
    • [Величественный слон]::2, купающийся в свете [закатного солнца]::1 в саванне
  5. Midjourney – это процесс проб и ошибок: экспериментирование с различными элементами и функциями необходимо. Каждая итерация приведет вас ближе к изображению, которое вы представляли.

Параметры Mid-Journey

Модель Midjourney работает с настраиваемыми параметрами, которые контролируют результат процесса генерации изображений. Эти параметры позволяют пользователям настраивать и совершенствовать сгенерированное искусство, тонко настраивая модель для создания выходных данных, идеально подходящих для их цели.

Ниже приведены основные и расширенные параметры, их функции и то, как использовать их, чтобы полностью раскрыть возможности Midjourney:

  • Отношение сторон (–aspect или –ar): Этот параметр контролирует соотношение между шириной и высотой сгенерированного изображения. Например, соотношение 16:9 идеально подходит для миниатюр YouTube, в то время как 1:1 производит квадратное изображение, идеальное для Instagram.
  • Хаос (–chaos): Этот параметр регулирует разнообразие начальной сетки изображения и варьируется от 0 до 100. Более высокие значения хаоса дадут вам непредсказуемые и уникальные результаты, в то время как более низкие значения обеспечат более последовательные результаты.
  • Нет (–no): Этот параметр помогает исключить определенные элементы или характеристики из сгенерированного изображения. Например, если вы хотите изображение без красного, вы можете использовать “–no red”.
  • Качество (–quality или –q): Этот параметр регулирует время, необходимое для генерации изображения. Более высокое качество требует больше времени обработки, но дает более детальные детали. Этот параметр может принимать значения .25, .5, 1 или 2.
  • Семя (–seed): Этот параметр определяет начальную визуальную шум, служащую основой для сгенерированного изображения. Использование одного и того же номера семени с одним и тем же запросом даст подобные результаты. Он принимает целые значения от 0 до 4294967295.
  • Остановка (–stop): С помощью этого параметра вы можете преждевременно завершить задание, в результате чего получите менее детальные, но потенциально интересные результаты. Диапазон – 10-100. Например, если вы укажете ‘–stop 50’, процесс генерации изображения будет остановлен на 50% завершения, в результате чего получится менее детальное, возможно, абстрактное изображение.
  • Стилизация (–stylize или –s): Этот параметр контролирует уровень художественной обработки сгенерированного изображения. Более низкие значения стилизации дают результаты, более близкие к исходному запросу, в то время как более высокие значения приводят к более абстрактным и художественным интерпретациям. В версии 5 значение по умолчанию равно 100, но вы можете установить его в диапазоне от 0 до 1000.
  • Версия модели: Вы можете выбрать из различных версий модели Midjourney, используя параметр –version или –v.
  • Niji: Модель, специализирующаяся на изображениях в стиле аниме. Она может быть доступна с помощью параметра –niji.
  • Высокое разрешение: Для абстрактных и пейзажных изображений параметр –hd активирует раннюю версию модели, которая дает более крупные, но менее последовательные изображения.
  • Тестовые модели: Midjourney предлагает специальные модели для конкретных случаев использования. Параметры –test и –testp активируют стандартную и фотографическую тестовую модель соответственно.
  • Масштабирование: Алгоритм Midjourney начинается с низкоразрешающей сетки изображения. Он предлагает несколько моделей масштабирования для улучшения размера и детализации изображения.
    • Uplight: Альтернативный световой масштабировщик (–uplight) дает масштабированные изображения, которые менее детализированы, но более гладкие.
    • Upbeta: Параметр –upbeta приводит к изображениям с значительно меньшим количеством дополнительных деталей, оставаясь ближе к исходному изображению сетки.
    • Upanime: Масштабировщик –upanime предназначен специально для работы с моделью Midjourney –niji.
  • Вес изображения: Используйте –iw, чтобы регулировать вес запроса изображения относительно веса текста. Значение по умолчанию равно 0,25.
  • Одинаковые семена: Параметр –sameseed гарантирует, что все изображения в начальной сетке используют одно и то же начальное шум, создавая очень похожие сгенерированные изображения.
  • Видео: Midjourney может сохранить видео прогресса процесса генерации начальной сетки изображения, используя параметр –video.
  • Креативность: С параметром –creative модели test и testp дают более разнообразные и творческие изображения.

Midjourney постоянно выпускает обновления, чтобы улучшить пользовательский опыт, с последним обновлением до версии 5.2 в июне 2023 года. Добавив –v 5.2 к вашему запросу или выбрав его через команду /settings, пользователи могут получить доступ к этой расширенной модели. Версия 5.2 предлагает лучшую детализацию изображений и более интуитивное понимание запросов, принося более яркие цвета и улучшенные композиции.

Понимание авторских прав для произведений искусства, сгенерированных ИИ

Изображение Midjourney, сочетающее ИИ и авторские права

В марте 2023 года Управление по авторским правам США уточнило свою позицию по вопросу авторских прав на произведения, содержащие материал, сгенерированный ИИ. Политика гласит, что хотя человеческие элементы в творениях ИИ (например, написания или уникальные дизайны) могут быть защищены, изображения, сгенерированные ИИ, не имеют права на авторское право, следуя глобальным нормам, согласно которым только человеческие творения имеют право на авторское право.

В контексте искусства ИИ авторское право не является простым. Хотя цифровое искусство имеет человеческий вклад, искусство, сгенерированное ИИ, создается без прямого человеческого вмешательства, что усложняет вопрос авторства и владения. Согласно Управлению по авторским правам США, первоначальное владение предоставляется автору работы – человеческому создателю. Однако, поскольку ИИ не может быть рассмотрен как автор, искусство, сгенерированное ИИ, не имеет четкого владения.

Последние рекомендации Управления по авторским правам США разрешают авторское право на искусство ИИ только тогда, когда оно содержит достаточное человеческое авторство. Уровень ‘достаточного человеческого авторства’ остается неопределенным и зависит от степени человеческого участия в создании произведения искусства ИИ.

Интересно, что Midjourney, платформа ИИ для создания изображений, установила свои собственные политики использования. Пользователи бесплатной пробной версии могут использовать изображения для некоммерческих целей в соответствии с лицензией Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0), с надлежащим указанием источника Midjourney. Однако платящие подписчики могут использовать изображения для любых целей, включая коммерческие, в соответствии с общими коммерческими условиями. Это развитие в области авторских прав представляет собой интересную динамику между ИИ и человеческой креативностью.

Использование Midjourney для динамических дизайнов UI и создания логотипов

От проектирования интуитивно понятных интерфейсов для веб-сайтов или мобильных приложений до создания уникальных логотипов и баннеров Midjourney наделяет создателей контента возможностью генерировать ряд альтернатив дизайна в течение нескольких секунд.

Вот как это работает. Каждый дизайн начинается с запроса, который служит планом для ИИ. Предположим, вы проектируете интерфейс для онлайн-платформы обучения. Типичный запрос может быть: “/imagine Интерфейс онлайн-платформы обучения, Dribbble, высокое разрешение, 4K, как Khan Academy”.

Первоначальные результаты могут не идеально попасть в цель. Например, добавление “Adobe XD” в смесь может помочь Midjourney адаптировать свои дизайны, чтобы они были более совместимы с Adobe XD. Оптимизированный запрос будет:

/imagine Интерфейс онлайн-платформы обучения, Adobe XD, Dribbble, высокое разрешение, 4K, минималистичный дизайн

Изображение Midjourney дизайна интерфейса приложения для настольных компьютеров

Логотипы и баннеры, вдохновленные текстом, с помощью Midjourney

Давайте исследуем, как создать баннер с логотипом для UNITE AI.

Сначала вам нужно иметь простое изображение текста, который вы хотите отобразить. Вы можете создать это, используя любой графический редактор или текстовый редактор, и загрузить его в ваш канал Discord.

Пример текста для логотипа UNITE
Простое изображение текста, используемое для создания логотипа UNITE

Запрос для создания баннера:

/imagine Буквы: UNITE в футуристическом, вдохновленном ИИ логотипе с буквами UNITE –v 5 –ar 16:9

Руководство по запросам Midjourney

Взгляните на эти примеры запросов для получения дополнительных идей:

/imagine Одинокий музыкант, исполняющий спокойную мелодию на плавающем мотоцикле в сумерках, в стиле арт-нуво

Руководство по запросам Midjourney: изображение индийского искусства

/imagine Изображение человека, работающего на футуристическом столе, окруженного голографическими экранами и передовой технологией. Человек носит стильный, серебряный комбинезон и имеет очки виртуальной реальности. Окружение наполнено неоновыми огнями и плавающими голографиями. Атмосфера футуристическая и высокотехнологичная, с чувством волнения и инноваций. Камера – высокоразрешающая цифровая, захватывающая каждую деталь с точностью. Художественный стиль представляет собой смесь киберпанка и минимализма, с акцентом на чистых линиях и смелых цветах. Режиссеры, операторы, фотографы, дизайнеры, карикатуристы и художники, сотрудничающие в этом уникальном сочетании, – Кристофер Нолан, Роджер Дикинс, Энни Лейбовиц, Вирджил Абло, Хаяо Миядзаки и КAWS.

Запрос Midjourney для человека, работающего в будущем

/imagine Кукла Барби в стиле 1940-х годов как медсестра во время войны, в винтажной армейской больнице, ухаживающая за ранеными солдатами, в стиле классических иллюстраций Mattel, с атмосферой сепиатонированной фотографии Второй мировой войны 8k –v 5 –ar 16:9

Руководство по запросам Midjourney: изображение Барби в уникальных условиях

/imagine Кадр женщины, опирающейся на киберпанковский, летающий мотоцикл, японский аниме, разрастающиеся городские пейзажи, 32k, сложный космодром, мимолетные, панорамы небоскребов, гладкий

Изображение Midjourney в стиле киберпанк

Заключительные мысли: навигация в мире искусства ИИ с Midjourney

Помните, “Картинка стоит тысячи слов”. Подробное, яркое описание может творить чудеса. Да, Midjourney не бесплатен. Однако он революционизирует мир искусства и расширяет наши творческие возможности с помощью передовой технологии текст-изображение ИИ. С возможностью преобразовать простой текстовый запрос в высокоразрешающее изображение, это инструмент, который обещает безграничные возможности, не только для художников, но и для дизайнеров UI/UX, энтузиастов технологий и профессионалов ИИ.

Вот некоторые важные выводы, которые следует помнить, когда вы начинаете свое приключение с Midjourney:

  • Изучите основы запроса Midjourney: используйте четкие, краткие и полные описания, которые воплощают ваше видение, чтобы эффективно направлять ИИ. Помните, чтобы учитывать вашу аудиторию, и не бойтесь экспериментировать с различными стилями, настроениями и контекстами.
  • Используйте параметры: улучшите свой творческий опыт, используя множество расширенных настроек, которые предлагает Midjourney. От контроля соотношения сторон до регулирования параметра хаоса для уникальных результатов, каждый деталь можно настроить по вашему вкусу.
  • Принимайте итеративный процесс: ваше первое произведение искусства, сгенерированное ИИ, может быть не идеальным. Примите этот итеративный процесс и научитесь совершенствовать и оптимизировать свои запросы для лучших результатов.
  • Поймите последствия авторских прав: хотя сами произведения искусства, сгенерированные ИИ, не имеют права на авторское право, человеческие элементы внутри них могут быть защищены.

В сущности, интеграция ИИ в искусство демократизировала творчество и стерла границы между человеческими и машинными шедеврами. Поскольку мы продолжаем наблюдать замечательный рост генеративного ИИ на рынке искусства, неоспоримо, что революция искусства ИИ, возглавляемая платформами, такими как Midjourney, только начинается.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.