Моделі та платформи ШІ
Дослідники розробили новий метод контролю генерації зображень штучним інтелектом
Дослідники з Університету штату Північна Кароліна розробили новий метод контролю генерації зображень штучним інтелектом, який можна використовувати в галузях, таких як автономні транспортні засоби.
Умовна генерація зображень та інші техніки
Умовна генерація зображень – це завдання штучного інтелекту, яке полягає у створенні зображень на основі певного набору умов, який користувач може вказати. Новіші техніки пішли ще далі і включили умови для макету зображення, що дозволяє користувачам вказувати типи об’єктів, які вони хочуть бачити в конкретних місцях на екрані.
Новий метод, розроблений дослідниками університету, будується на всіх цих техніках і дозволяє користувачам мати більший контроль над зображеннями, зберігаючи при цьому певні характеристики протягом серії зображень.
Тяньфу У – співавтор статті та помічник професора комп’ютерної інженерії в Університеті штату Північна Кароліна.
“Наш підхід дуже гнучкий”, – говорить У. “Як і попередні підходи, наш дозволяє користувачам генерувати зображення на основі певного набору умов. Але наш також дозволяє зберегти це зображення і додати до нього. Наприклад, користувачі можуть змусити штучний інтелект створити гірський пейзаж. Потім користувачі можуть змусити систему додати лижників до цього пейзажу”.
Маніпуляція елементами
З новим методом користувачі також можуть дозволити штучному інтелекту маніпулювати елементами так, щоб вони були ідентифікабельні, залишаючись при цьому однаковими, але рухаючись або змінюючись якимось чином. Одним із таких прикладів було б створення серії зображень, на яких лижники повертаються до глядача, рухаючись по ландшафту.
“Одним із застосунків цього методу може бути допомога автономним роботам “уявити”, яким може бути кінцевий результат перед початком виконання певного завдання”, – говорить У. “Ви також можете використовувати цю систему для генерації зображень для навчання штучного інтелекту. Замість збору зображень з зовнішніх джерел ви можете використовувати цю систему для створення зображень для навчання інших систем штучного інтелекту”.
Новий підхід був протестований з використанням набору даних COCO-Stuff і набору даних Visual Genome, і на основі стандартів якості зображень він перевершує попередні методи.
“Наш наступний крок – побачити, чи можемо ми розширити цю роботу на відео та тривимірні зображення”, – говорить У.
Для навчання нового підходу дослідникам довелося використовувати робочу станцію з 4 графічними процесорами через велику обчислювальну потужність, необхідну для цього. Тим не менш, розгортання системи все ще менш обчислювально дороге.
“Ми виявили, що один графічний процесор дає майже реальний час обробки”, – говорить У.
“Крім нашої статті, ми зробили свій вихідний код для цього підходу доступним на GitHub. Тоді ми завжди відкриті для співробітництва з промисловими партнерами”.












