Промпт-інжиніринг

Освоєння штучного інтелекту в мистецтві: Конденсований посібник з Midjourney та інженерії промпта

mm
Додайте Unite.AI до бажаних джерел у Google
Midjourney Generated UNITE AI LOGO

Введення в генерацію мистецтва за допомогою MidJourney AI

Штучний інтелект швидко подолає бар’єри неможливості та最近侵入 у царину мистецтва, перетворивши його повністю. Тепер вам не потрібно бути майстром мистецтва чи експертом з Photoshop, щоб оживити фрагменти вашої уяви. Просто добре сформульований промпт – це все, що вам потрібно, завдяки Midjourney.

Все почалося з введенням революційних технологій, таких як DALL-E, Midjourney та StableDiffusion у 2022 році. Хоча кожна з цих інновацій принесла свій особливий штрих до канви генерації штучного інтелекту, Midjourney, зокрема, продовжує свою цікаву подорож, роблячи помітні кроки.

Midjourney зараз є провідним високороздільним текст-у-образ генератором на ринку та виділяється своєю унікальною сумішшю генерації тексту в образ, редагування медіа та збільшення, а також активного доступу до мистецької спільноти, починаючи з $10 на місяць. Цей комплексний набір функцій представляє собою цікаву палітру для художників, технічних ентузіастів та фахівців штучного інтелекту, створюючи середовище для творчості та інновацій.

Світ мистецтва, безумовно, звертає увагу, оскільки генерація штучного інтелекту на ринку мистецтва очікується зростати на 40,5% у рік. Midjourney виділяється у створенні найреалістичних та високоякісних візуальних зображень за допомогою штучного інтелекту.

Ефективна інженерія промпта виходить за межі простої творчості; вона охоплює найкращі практики. Промпти повинні надавати ясність, бути лаконічними, але водночас забезпечувати штучному інтелекту достатньо керівництва без надмірної вказівки. Крім того, під час дизайну потрібно враховувати цільову аудиторію, беручи до уваги такі фактори, як вік, стать та культурний фон, серед інших.

Як працює MidJourney?

Mid-Journey використовує дві нові технології машинного навчання – великі мовні моделі та моделі дифузії. Мовна модель, подібна до чат-ботів штучного інтелекту, таких як ChatGPT, допомагає Mid-Journey інтерпретувати значення ваших промптів та перетворювати їх у вектори. Цей вектор потім керує процесом дифузії.

Внутрішня робота Midjourney значною мірою не розкривається. Тим не менш, очевидно, що вона використовує генерацію тексту в образ за допомогою двох відносно нових технологій машинного навчання: великих мовних моделей та моделей дифузії. Перша, можливо, знайома користувачам платформ штучного інтелекту, таких як ChatGPT, а друга – це перспективне доповнення до сектору генерації штучного інтелекту. Ціла система спирається на набір даних CLIP для навчання, який можна знайти на сторінці досліджень OpenAI.

Незважаючи на обмежену інформацію, можна намітити загальну картину моделі дифузії Midjourney, яку названо ‘Стабільна дифузія’. По суті, Стабільна дифузія – це відкрита модель, яка майстерно перетворює текстові промпти у зображення різноманітних стилів та змісту. Цей складний процес досягається за допомогою моделі дифузії, генеративної моделі, яка зв’язує залежності між текстовими входами та виходами зображення.

Моделі дифузії побудовані на основі методу денойзингу дифузії, підходу, який впливає на термодинаміку нерівноваги. Цей метод систематично розбирає структуру даних та пізніше відновлює її. Цей підхід був адаптований для генерації зображень Хо та ін. у 2020 році, що призвело до створення моделей дифузії, які ми бачимо сьогодні.

Навчання моделей дифузії включає два основні етапи. Спочатку процес дифузії або прямого процесу включає поступове додавання випадкового шуму до вхідного зображення, поки воно повністю не перетвориться на шум. Цей процес керується фіксованою ланцюговою марковською ланцюгом, який постійно додає гауссовський шум протягом кількох послідовних кроків.

Демонстрація роботи Midjourney

Пізніше, у зворотному або відновному етапі, модель відновлює оригінальні дані з шумоподібного стану, досягнутого під час процесу дифузії. Цей процес керується марковською ланцюгом з навченими гауссовськими переходами, що означає, що передбачення густини ймовірності в будь-який момент часу залежить лише від стану, досягнутого на попередньому етапі. Оскільки латентні ‘x1, …, xT’ мають相同ну розмірність, що й дані, моделі дифузії класифікуються як моделі латентних змінних.

Вартість та підписка Mid-Journey

Хоча багато чат-ботів, таких як ChatGPT та Bing Chat, пропонують майже необмежене використання безкоштовно, ситуація відрізняється для генераторів зображень, таких як Mid-Journey. Через суттєву обчислювальну потужність, необхідну, особливо від графічних процесорів (GPU) та використання відеопам’яті для процесу денойзингу, послуги Mid-Journey супроводжуються ціновим ярликом.

Базовий план починається з $10 на місяць, надаючи близько 3,3 години часу GPU, достатньо для приблизно 200 генерацій зображень. Однак існують плани вищого рівня, які пропонують необмежену кількість зображень у режимі Relaxed, хоча з тривалішим часом очікування.

Налаштування MidJourney

  1. Початок роботи з MidJourney включає реєстрацію на офіційному сайті, підписку на план та подальше перенаправлення на Discord.
  2. Як тільки ви знайдете канал Mid-Journey на Discord, перейдіть до групи Newcomer Groups зліва. Там ви можете спостерігати, як інші користувачі створюють промпти, вивчати механіку Mid-Journey та взаємодіяти в живому середовищі.
  3. Після ознайомлення з середовищем запрошуйте бота до вашого приватного сервера, щоб створювати зображення без перешкод. Бот генерує чотири попередні зображення на основі вашого промпту, що дозволяє вам вибрати найближчий варіант до вашої оригінальної ідеї та подальше уточнення зображення.

Структура промпта для Midjourney

  1. Команда /imagine у каналі Discord всередині каналу Midjourney генерує унікальне зображення з короткого текстового опису (промпту).
  2. Щоб відтворити конкретний стиль у різних зображеннях, просто введіть URL зображення поряд з вашим текстовим промптом. Ваші нові виводи будуть поєднувати елементи з обраного зображення та тексту.
    /imagine http://link-to-your-image –parameter1 –parameter2
    Ви можете створити посилання на зображення, завантаживши його до каналу Discord. Як тільки завантажите, клацніть правою кнопкою миші на зображенні та виберіть ‘Копіювати посилання’.
    Тут http://link-to-your-image та параметри є необов’язковими.
  3. Після цього бот починає працювати над вашим зображенням, витрачаючи приблизно одну хвилину на створення чотирьох альтернатив. Цей процес включає використання потужних графічних процесорів (GPU) для обробки та інтерпретації кожного промпту.
  4. Відстежуйте використання часу GPU за допомогою команди /info. Вона дозволяє вам перевірити залишковий час швидкого виконання та контролювати час GPU вашої підписки.

/info промпт Midjourney

Масштабування та зміни зображення

Для більш розвиненого зображення використовуйте кнопки ‘U’ під зображеннями, щоб збільшити ваш вибраний варіант. Ви також можете використовувати кнопки ‘V’, щоб зробити корективи до конкретних зображень. Для подальших змін до збільшеного зображення використовуйте варіанти ‘Створити варіації’, ‘Передбачене збільшення’ та ‘Бета-зміна збільшення’. Кнопка ‘Веб’ дозволяє переглянути зображення у більших розмірах у окремому вікні.

Midjourney дозволяє збільшувати зображення до роздільної здатності 2048×2048 (квадрат) та 2720×1530 (широкоекран) за допомогою функції бета-зміни збільшення, з розміром генерації за замовчуванням 1024×1024 (квадрат) та 1456×816 (широкоекран). Кожне зображення можна додатково покращити за допомогою опцій збільшення “U”, які покращують окремі частини зображення.

Подивіться на цей промпт, який створює фантастичне мистецтво за допомогою версії 5.2 Midjourney.

/imagine Мистецтво зображує самотній дерево під зоряним небом, з дитиною, яка читає під ним, у кольорах спокійного синього та теплого оранжевого, натхненного мазками французького імпресіонізму, перськими мініатюрами, простотою Баухауса, нагадуючи класичні дитячі казкові ілюстрації, досягаючи асиметричної гармонії, вираженої у чарівному, народному/наївному стилі: –ar 15:19 –upbeta –q 2

Посібник з промпта Midjourney

Створення першого мистецтва Midjourney AI

  1. Створення базової схеми: Подумайте про себе як про художника. Почніть з простого, яскравого опису зображення, яке ви хочете оживити. Накресліть основний предмет, атмосферу чи навіть дрібні деталі, які ви хочете включити. Використовуйте пунктуацію, таку як кому, дужки та тире, щоб структурувати свої думки. Для кращих результатів будьте явними щодо контексту та деталей вашого дизайну. Елементи, такі як предмет (наприклад, дракон, старовинна машина, Авраам Лінкольн), середовище (наприклад, космос, під водою, завантажений місто), освітлення (наприклад, м’яке, неонове, проти світла), колір (наприклад, земні тони, яскраві, приглушені), настрій (наприклад, меланхолійний, фантастичний, мирний) та композиція (наприклад, пейзаж, крупний план, широкий кут), можуть бути критичними. Приклади:
    • Ідилічний ліс, залитий сонячним світлом, стежка, що тягнеться у відстань
    • Місто, яке ніколи не спить, з неоновими вогнями, що відбиваються від тротуарів, та різноманітною юрбою, що рухається
  2. Надання стилю та ключових слів: штучний інтелект Midjourney здатний створювати зображення у багатьох стилях, таких як абстрактний, сюрреалістичний чи реалістичний. Інтегруючи стиль чи пов’язані ключові слова, ви можете спрямувати штучний інтелект на створення зображення, яке відображає вашу бачення. Експериментуйте з різними стилями та ключовими словами, щоб знайти ідеальну суміш. Приклади:
    • Пейзаж, що зображує пустелю на світанку, у стилі Джорджії О’Кіф, з пастельною палітрою та органічними формами.
    • Абстрактне зображення мирного лісу, з геометричними узорами, що утворюють дерева та листя, натхненне композиціями Піта Мондріяна.
  3. Використання розширених налаштувань: Розгляньте Midjourney як вашу творчу скриньку, наповнену розширеними налаштуваннями, які дозволяють вам налаштувати згенеровані зображення. Це як володіння магічною паличкою, що дозволяє вам створити ідеальний баланс випадковості, стилізації та варіації зображення. Розкрийте свій творчий потенціал, експериментуючи з цими налаштуваннями, поки не знайдете ідеальну суміш, яка резонує з вашим баченням. Приклади:
    • Спокійний японський сад з прудом, що відбиває вишневі дерева –seed 22 –s 150 –c 40
    • Дистопічний кіберпанковий місто, освітлене неоновими вогнями –seed 88 –s 600 –c 60
  4. Акцентування елементів за допомогою ваг: Подумайте про своє зображення як про симфонію, де кожен елемент сприяє великому ансамблю. Використовуючи позначення “::”, ви можете вказати важливість різних елементів у своєму зображенні, що дозволяє вам контролювати фокус. Приклади:
    • [Елегантний павич]::3, що сидить на [горошковому дереві]::1, що цвіте яскравими квітами
    • [Могутній слон]::2, що купається у світлі [західного сонця]::1 на савані
  5. Midjourney – це процес проб та помилок: Експериментування з різними елементами та функціями є необхідним. Кожна ітерація приведе вас ближче до зображення, яке ви уявляєте.

Параметри Mid-Journey

Модель Midjourney працює за допомогою налаштовуваних параметрів, які контролюють результат процесу генерації зображення. Ці параметри дозволяють користувачам налаштувати та адаптувати згенеровані твори, досягаючи ідеальних результатів.

Нижче наведені базові та розширені параметри, їх функції та спосіб використання для повного розкриття можливостей Midjourney:

  • Відношення сторін (–aspect або –ar): Цей параметр контролює відношення ширини до висоти згенерованого зображення. Наприклад, відношення 16:9 ідеально підходить для мініатюр YouTube, тоді як 1:1 створює квадратне зображення, яке підходить для Instagram.
  • Хаос (–chaos): Цей параметр регулює різноманітність початкової сітки зображення та варіюється від 0 до 100. Вищі значення хаосу дають непередбачувані та унікальні результати, тоді як нижчі значення забезпечують більш послідовні результати.
  • Відмова (–no): Цей параметр допомагає видалити конкретні елементи або характеристики з згенерованого зображення. Наприклад, якщо ви хочете зображення без червоного кольору, ви можете використовувати “–no red”.
  • Якість (–quality або –q): Цей параметр регулює час, необхідний для генерації зображення. Вища якість вимагає більше часу обробки, але забезпечує детальні деталі. Цей параметр може приймати значення 0,25, 0,5, 1 або 2.
  • Насіння (–seed): Цей параметр визначає початковий візуальний шум, який слугує основою для згенерованого зображення. Використання одного й того ж номера насіння з одним й тим же промптом дасть схожі результати. Він приймає цілі значення від 0 до 4294967295.
  • Зупинка (–stop): За допомогою цього параметру ви можете передчасно зупинити роботу, отримуючи менш деталізовані, але потенційно цікаві результати. Діапазон становить від 10 до 100. Наприклад, якщо ви вказали ‘–stop 50’, процес генерації зображення зупиниться на 50% завершення, що призведе до менш деталізованого, можливо, абстрактного зображення.
  • Стилізація (–stylize або –s): Цей параметр контролює рівень художньої обробки згенерованого зображення. Нижчі значення стилізації дають результати, ближчі до початкового промпту, тоді як вищі значення призводять до більш абстрактних та художніх інтерпретацій. У версії 5 значення за замовчуванням становить 100, але ви можете встановити його в діапазоні від 0 до 1000.
  • Версія моделі: Ви можете вибрати між різними версіями моделі Midjourney, використовуючи параметр –version або –v.
  • Niji: Модель, спеціалізована на аніме-стилі зображень. Її можна активувати за допомогою параметру –niji.
  • Високодеталізоване зображення: Для абстрактних та пейзажних зображень параметр –hd активує раннішу версію моделі, яка дає більші, менш послідовні зображення.
  • Тестові моделі: Midjourney пропонує спеціальні моделі для конкретних випадків використання. Параметри –test і –testp активують стандартну та фотографічну тестову модель відповідно.
  • Збільшувач зображення: Алгоритм Midjourney починається з низькороздільного зображення. Він пропонує кілька моделей збільшення для покращення розміру та деталізації зображення.
    • Uplight: Альтернативний освітлений збільшувач (–uplight) дає збільшені зображення, які менш деталізовані, але гладші.
    • Upbeta: Параметр –upbeta призводить до зображень з значно меншою кількістю додаткових деталей, залишаючись ближчим до оригінальної сітки зображення.
    • Upanime: Збільшувач –upanime призначений спеціально для роботи з моделлю Niji Midjourney.
  • Вага зображення: Використовуйте –iw, щоб調увати вагу промпту зображення відносно ваги тексту. Значення за замовчуванням становить 0,25.
  • Одне насіння: Параметр –sameseed забезпечує, щоб усі зображення в початковій сітці використовували одне й те ж початкове шум, створюючи дуже схожі згенеровані зображення.
  • Відео: Midjourney може зберегти відео процесу генерації початкової сітки зображення за допомогою параметру –video.
  • Креативність: Параметр –creative робить, щоб тестові та тестові моделі видали більш різноманітні та творчі зображення.

Midjourney постійно оновлює свої можливості, щоб покращити досвід користувача, останнє оновлення – версія 5.2, випущена у червні 2023 року. Додавши –v 5.2 до вашого промпту або вибравши його через команду /settings, користувачі можуть отримати доступ до цієї розширеної моделі. Версія 5.2 пропонує кращу деталізацію зображень та краще розуміння промптів, забезпечуючи яскравіші кольори та покращені композиції.

Поняття авторських прав для штучно згенерованого мистецтва

Зображення Midjourney, що зображує суміш штучного інтелекту та авторських прав

У березні 2023 року Офіс з питань авторських прав США уточнив свою позицію щодо реєстрації авторських прав для штучно згенерованих робіт. Політика вказує, що хоча людські елементи у створенні штучного інтелекту (наприклад, написи чи унікальні дизайни) можуть бути захищені, зображення, згенеровані штучним інтелектом, не кваліфікуються для авторських прав, дотримуючись глобальних норм, які передбачають захист лише людських творінь.

У контексті штучного інтелекту авторські права не є простими. Хоча цифрове мистецтво має в собі людський внесок, штучно згенероване мистецтво створюється без прямої людської участі, що ускладнює питання авторства та власності. За словами Офісу з питань авторських прав США, початкова власність надається автору роботи – людині-творцю. Однак, оскільки штучний інтелект не може бути автором, штучно згенероване мистецтво не має чіткої власності.

Остання інструкція Офісу з питань авторських прав США дозволяє реєстрацію авторських прав для штучно згенерованого мистецтва лише у разі, якщо воно містить достатній людський внесок. Рівень “достатнього людського внеску” залишається невизначеним та залежить від рівня людської участі у створенні штучного інтелекту.

Цікаво, що Midjourney, платформа штучного інтелекту для створення зображень, встановила自己的 політику щодо прав використання. Користувачі безкоштовної пробної версії можуть використовувати зображення для некомерційних цілей згідно з ліцензією Creative Commons Attribution-NonCommercial 4.0 International (CC BY-NC 4.0), з належним посиланням на Midjourney. Однак платні підписники можуть використовувати зображення для будь-якої мети, включаючи комерційну, згідно з Загальними комерційними умовами. Цей розвиток у сфері авторських прав представляє цікаву динаміку між штучним інтелектом та людською творчістю.

Використання Midjourney для динамічних дизайнів інтерфейсу користувача та творчої генерації логотипів

Від дизайну інтуїтивних інтерфейсів для веб-сайтів чи мобільних додатків до створення унікальних логотипів та банерів, Midjourney надає можливість створювати різноманітні дизайнерські варіанти протягом секунд.

От як це працює. Кожен дизайн починається з промпту, який слугує планом для штучного інтелекту. Наприклад, якщо ви проектуєте інтерфейс для онлайн-платформи навчання. Типовий промпт міг би бути: “/imagine Онлайн-платформа навчання, інтерфейс користувача, Dribbble, високої роздільної здатності, 4K, як у Khan Academy”.

Перші результати можуть не бути ідеальними. Наприклад, додавання “Adobe XD” до промпту може допомогти Midjourney адаптувати свої дизайни до сумісності з Adobe XD. Оптимізований промпт буде:

/imagine Онлайн-платформа навчання, інтерфейс користувача, Adobe XD, Dribbble, високої роздільної здатності, 4K, мінімалістичний дизайн

Зображення Midjourney десктоп-додатків UI/UX

 

Текстово-інспіровані логотипи чи банери за допомогою Midjourney

Давайте розглянемо, як створити банер з логотипом для UNITE AI.

Спочатку вам потрібно мати просте зображення тексту, який ви хочете відображати. Ви можете створити це за допомогою будь-якого графічного інструменту або редактора тексту та завантажити його до каналу Discord.

Зразок тексту для логотипу UNITE
Просте зображення тексту, використане для створення логотипу UNITE

Промпт для створення банера буде:

/imagine Літери: UNITE у футуристичному, штучно-інтелектному типі логотипу з літерами UNITE –v 5 –ar 16:9

Посібник з промпта Midjourney

Подивіться на ці приклади промптів для більшої кількості ідей:

/imagine Самотній музикант, який виконує серену мелодію на плаваючому місті у сутінках, у стилі арт-нуво

Посібник з промпта Midjourney: Зображення індійського мистецтва

 

/imagine Зображення людини, яка працює на футуристичному столі, оточеному голограмними екранами та передовими технологіями. Людина носить стрімкий срібний костюм та має окуляри віртуальної реальності. Середовище наповнене неоновими вогнями та плаваючими голограмами. Атмосфера футуристична та високотехнологічна, з відчуттям збудження та інновацій. Камера – це високодеталізована цифрова камера, яка захоплює кожну деталь з точністю. Художній стиль – це суміш кіберпанку та мінімалізму, з акцентом на чистих лініях та яскравих кольорах. Режисери, оператори, фотографи, дизайнери моди, карикатуристи та художники, які співпрацюють у цьому унікальному поєднанні, – це Крістофер Нолан, Роджер Дікінс, Енні Лейбовіц, Вірджил Абло, Хаяо Міядзакі та Кавс.

Промпт Midjourney для людини, яка працює в майбутньому

/imagine Барбі у стилі 1940-х років як медсестра під час війни, у старовинній лікарні, яка доглядає за пораненими солдатами, у стилі класичних ілюстрацій Mattel, з атмосферою сепійних фотографій часів Другої світової війни 8k –v 5 –ar 16:9

Посібник з промпта Midjourney: Зображення Барбі у унікальних умовах

/imagine Кадр жінки, яка спирається на кіберпанковий ховербайк, японський аніме, панорами міста, 32k, інтригуючий космодром, мимолетний, панорами небоскрорів, стрімкий

Зображення Midjourney у кіберпанковому стилі

 

Заключні думки: Навігація у світі штучного інтелекту з Midjourney

Пам’ятайте, “Картинка коштує тисяч слів”. Детальний, яскравий опис може працювати чудеса. Так, Midjourney не є безкоштовним у використанні. Однак він революціонізує світ мистецтва та розширює наші творчі можливості за допомогою передової текст-у-образ штучного інтелекту. З можливістю перетворити простий текстовий промпт у високодеталізоване зображення, це інструмент, який обіцяє безмежні можливості, не лише для художників, але й для дизайнерів інтерфейсу користувача, технічних ентузіастів та фахівців штучного інтелекту.

Ось кілька основних висновків, які потрібно пам’ятати під час вашої пригоди з Midjourney:

  • Навчіться основ промпта Midjourney: Використовуйте чіткі, лаконічні та повні описи, які охоплюють ваше бачення, щоб ефективно спрямувати штучний інтелект. Пам’ятайте про свою аудиторію та не бояться експериментувати з різними стилями, настроями та контекстами.
  • Використовуйте параметри: Покращуйте свій творчий досвід, використовуючи численні розширені налаштування, які пропонує Midjourney. Від контролю аспектного співвідношення до регулювання параметра хаосу для унікальних результатів, кожна деталь може бути адаптована до вашого смaku.
  • Прийміть ітеративний процес: Ваше перше штучно згенероване мистецтво може не бути ідеальним. Прийміть цей ітеративний процес та навчитеся уточнювати та оптимізувати свої промпти для кращих результатів.
  • Порозумійтесь з авторськими правами: Хоча самі штучно згенеровані твори не кваліфікуються для авторських прав, людські компоненти всередині них можуть бути захищені.

По суті, інтеграція штучного інтелекту у мистецтво демократизувала творчість та розмитила межі між людьми та машинами, створеними шедеврами. Коли ми продовжимо свідчити видатний рост генерації штучного інтелекту на ринку мистецтва, не можна заперечувати, що революція штучного інтелекту в мистецтві, очолювана платформами, такими як Midjourney, тільки починається.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.