Інтерв’ю
Ернест П’ятрович, Продукт-менеджер у ARTA – Серія інтерв’ю

Ернест П’ятрович – Продукт-менеджер у AIBY Group, який очолює один з топових застосунків компанії, що працюють за допомогою штучного інтелекту, ARTA – генератор зображень штучного інтелекту для iPhone та Android. Його стратегічне бачення та творче мислення призвели до того, що застосунок зайняв друге місце у рейтингу американського App Store невдовзі після його випуску, перетнув межу у 15 мільйонів завантажень у світі та пропонує найкращі аватари штучного інтелекту на основі унікальної внутрішньої технології, серед інших успіхів.
Ви були відповідальними за керування ARTA – генератором штучного інтелекту з моменту його створення. Чи можете поділитися деякими ідеями про ці перші дні?
Так! Ті були динамічні часи. Нам вдалося випустити добре зроблений застосунок всього за тиждень, ставши одним з перших творців споживчих застосунків, які пропонували функціональність генерації зображень за допомогою тексту на мобільних пристроях. Наша мета полягала у створенні масового продукту, який би надав людям “художника” у кишені. Отже, починаючи з концептуалізації та ранніх стадій розробки, ми зосередилися на зручності використання та масштабованості. Але попри те, що ми вступили на ринок у дуже вчасно, було досить складно збільшити об’єм наших завантажень до достатнього рівня, навіть з нашою чудовою командою медіакупівлі. Значний імпульс стався через три місяці після випуску застосунку, коли наша функція аватарів стала популярною. Об’єм швидко став помірно високим для нашої ніші, і з того часу нашою задачею було підтримувати та збільшувати його.
Який був первинний технологічний стек, на якому ви запустили застосунок, та які були деякі з проблем генерації мистецтва під час цього періоду?
Ми запустили застосунок на основі Stable Diffusion 1.3, використовуючи офіційний API від Stability.ai. Я повинен сказати, що ситуація з якістю генерацій на той час і зараз є як день і ніч. Коли ми тільки почали, наші менеджери з якості часто повідомляли про проблеми, пов’язані з естетичною цінністю зображень або неточностями у відображенні певних концепцій та ознак. Однак це було стандартом для Stable Diffusion на той час. Тепер генерація видається значно краще у всіх аспектах, включаючи стилістичну репродукцію, композиційну узгодженість, візуальну вірогідність, рівень деталізації та інше.
Невдовзі після випуску застосунку ми почали орендувати сервери на Amazon (AMZN ), і підтримка їх виявилася досить складною. Навіть з достатнім фінансуванням може не бути вільних серверів A100, коли вам це потрібно, і вам доведеться чекати пару днів. Отже, нам довелося обходитися без автомасштабування, перенаправляючи весь надлишковий трафік на API наших партнерів.
Підтримка всього цього залишається досить складною і до цього дня, з незначними проблемами, які виникають на одному чи іншому кінці кожний місяць чи близько того. Наприклад, ми іноді зустрічаємо тимчасові проблеми з якістю генерацій, коли постачальник оновлює сервер, тестиє ваги або впроваджує інші зміни, які впливають на генерацію. Такі помилки можуть тривати від години до півдня і є непередбачуваними та складними для відстеження. Зазвичай, до того часу, як наш відділ підтримки отримує повідомлення про розмиті зображення чи інші проблеми, постачальник API вже вирішив проблему. Однак це серйозна проблема для наших користувачів. Отже, зараз ми будуємо систему, яка поєднує кілька постачальників та наші власні сервери для спеціальних генерацій, що дозволить нам мати більше контролю над процесом.
Як продукт-менеджер, які стратегічні рішення були вирішальними для керівництва ARTA до його топ-рейтингової позиції невдовзі після випуску?
Ранні успіхи ARTA (на той час називається Aiby) були результатом своєчасного рішення про впровадження функції аватарів, коли вона тільки почала набирати популярність у соціальних мережах. Ми швидко визнали зростаючий інтерес до цієї функціональності. Наша整个 команда, включаючи продукт, маркетинг та розробку, була на одному хвилі та мала спільне бачення щодо її успіху. Ми також визнали, що короткий час до виходу на ринок був критично важливим. Отже, з першого дня ми присвятили всі свої ресурси реалізації цієї функції, ставлячи її вище інших завдань.
Оскільки наш термін був “якнайшвидше”, щоб не пропустити момент, коли аватари штучного інтелекту досягнуть піку популярності, ми вирішили використовувати рішення третього боку та адаптувати його для нашого застосунку. Хоча аватари тільки починали набирати популярність на мобільних пристроях, технологія вже була доступна у мережі протягом деякого часу, навіть з API. Дякуючи зосередженим зусиллям команди, наш перший робочий варіант з’явився в App Store всього за п’ять днів, пропонуючи дуже конкурентоспроможний аватар. Це допомогло нам зайняти друге місце у рейтингу американських топ-чартів та залишитися другим найбільш завантажуваним застосунком у США протягом тижня.
Чи можуть користувачі впливати на художній процес у ARTA? Якщо так, які інструменти та опції доступні для користувачів, щоб налаштувати згенеровані штучним інтелектом твори?
Ми обробляємо всі складні аспекти, пов’язані з генерацією, спрямовані на надання нашим користувачам простого художнього досвіду без зайвого технічного навантаження. Отже, основним способом, яким користувачі впливають на результат, є підказки. Ми робимо цей процес прозорим, показуючи точну слово-подказку, яка буде надіслана моделі для генерації, і пропонуємо допомогу у складанні ефективних підказок, якщо це потрібно.
Ми вибираємо найкращі значення за замовчуванням для кожної інтегрованої моделі, щоб користувачам не доводилося турбуватися про це. Зазвичай, немає потреби змінювати їх, щоб максимізувати результати, оскільки вони вже видають оптимальний результат генерації. Однак, якщо користувач хоче експериментувати, режим для досвідчених користувачів знаходиться всього в одному кліку, а деякі глибші параметри знаходяться у розділі налаштувань.
Невдовзі ми додамо параметр Seed, який дозволить користувачам мати повний контроль над генерацією, коли їм потрібно відтворити ідентичне зображення з нуля. Крім того, ми плануємо розширити список пропорцій. Ми також думаємо про додавання декількох контрольних мереж до регулярних генерацій. Вони вже підтримуються на серверній стороні, оскільки ми використовуємо їх для генерації фільтрів штучного інтелекту та ескізів, але вони ще не доступні кінцевим користувачам.
Як ви сприймаєте вплив штучного інтелекту, подібного до ARTA, на традиційний ринок мистецтва? Чи бачите ви генерацію штучного інтелекту як порушення чи вдосконалення індустрії мистецтва?
Я бачу це як вдосконалення. Генеративний штучний інтелект ввів нові та цінні можливості для вдосконалення художнього процесу, значно скоротивши час виконання. Він допомагає цифровим художникам, дизайнерам, ілюстраторам та іншим творчим людям з різними завданнями, від дослідження ідей та розробки концепцій до генерації ескізів та готових зображень. В кінцевому підсумку, наша здатність використовувати його досягнення обмежена лише нашою уявою.
Наприклад, у мене є хобі – створення ігор для ПК, і нещодавно я використав ARTA для генерації набору іконок для навичок та предметів. Я міг би самостійно розробити їх, використовуючи Adobe Illustrator, але з генератором зображень я отримав те, що мені потрібно майже одразу. Моя дружина, у свою чергу, є ретушером-фотографом. Дякуючи Генеративному заповненню у Photoshop, вона працює значно швидше та має більше вільного часу (або більше доходу, якщо вона вирішить приймати більше замовлень на ретуш).
Коли це зроблено добре, зображення, згенеровані штучним інтелектом, можуть бути майже непізнавані від професійних творів мистецтва. Однак, на мою думку, штучний інтелект ніколи не замінить справжнього професіонала. Навіть якщо нейронні мережі стануть дуже складними, вони все одно будуть навчені на даних, створених людьми, тобто все, що вони генерують, вже існує десь. Як і раніше,真正і інноваційні ідеї можуть бути створені лише людьми. Хоча традиційне значення мистецтва залишається пов’язаним з творами, створеними людьми, генерація штучного інтелекту є очікуваним спін-офом, який запрошує всіх, незалежно від художнього досвіду, спробувати щось нове та цікаве.
Подивлячись далі за поліпшення якості зображень, куди, на вашу думку, рухається майбутнє генерації зображень штучним інтелектом?
Разом із поліпшенням якості зображень швидкість генерації також збільшиться, що автоматично призведе до більш економічних результатів.
Я думаю, що не мине багато часу, поки не з’явиться простий спосіб генерації одних і тих самих персонажів у різних середовищах та позиціях, так що ми побачимо зростання популярності штучного інтелекту у коміксах, дитячих книгах, графіці та інше. Дизайн інтер’єру та виробництво рекламних творів вже активно використовують генерацію штучного інтелекту, але попереду нас чекають ще більше інновації, оскільки технологія продовжує розвиватися.
Якщо враховувати, що всі генерації вимагають потужних GPU, ці технології будуть розвиватися разом із штучним інтелектом протягом довгого часу. Ми тільки на початку цього шляху. Можливо, новий Apple (AAPL ) нашого часу буде Nvidia (NVDA ), з усіма, або хоча б тими, хто працює в галузі IT, очікуючи нових випусків відеокарт, як ми всі очікували нових iPhone.
Генератори зображень штучного інтелекту продовжуватимуть надавати розважальні та цікаві досвіди, чи то введенням нових концепцій, що з’являються у поп-культурі, чи оживленням старих ідей з кращою технологією. Наприклад, інтерес до генерації дитини штучним інтелектом зараз зростає. Одна з недавніх технологій, заснованих на Stable Diffusion, продемонструвала вражаючі результати генерації зображень дитини потенційного дитини двох людей. Результати значно перевершують те, що було доступно на сайтах гороскопів кілька років тому, і люди з нетерпінням чекають, щоб спробувати ще раз.
Які ваші передбачення щодо того, чого ми повинні очікувати далі від генерації штучного інтелекту?
Хвиля популярності генерації відео знаходиться на горизонті. З появою технологій, що досягли достатнього рівня, будуть спроби тренувати нейронні мережі за допомогою виразів обличчя та жестів людей, щоб створити відео-аватари, потенційно навіть з унікальними голосами користувачів.
Штучний інтелект у аудіо – це ще один значний прорив, який розпочинає нову еру для індустрії музичної продукції. Ця технологія вже представила чудові можливості для створення пісень тільки на основі текстового вводу, роблячи її чудовим інструментом для створення нестандартних саундтреків для різних типів відеоконтенту. Загалом, це дуже весело слухати щось таке буденне, як Умови використання, співаючи чи читаємо з романтичним тоном.
Дякую за чудовий інтерв’ю, читачам, які бажають дізнатися більше або згенерувати деякі зображення, слід відвідати ARTA.












