Моделі та платформи ШІ
Модель штучного інтелекту може підвищити роздільну здатність розмитих зображень у 60 разів
Дослідники з Університету Дюка розробили модель штучного інтелекту, здатну обробляти дуже розмиті, піксельовані зображення та надавати їм високої деталізації. За даними TechXplore, модель може обробляти відносно небагато пікселів та масштабувати зображення для створення реалістичних зображень облич, які приблизно у 64 рази мають вищу роздільну здатність, ніж оригінальне зображення. Модель “галлюцинує” або уявляє особливості, які знаходяться між лініями оригінального зображення.
Ця робота є прикладом супер-роздільної здатності. Як пояснила Синтія Рудін з команди комп’ютерних наук Університету Дюка в інтерв’ю TechXplore, цей дослідницький проєкт встановлює рекорд супер-роздільної здатності, оскільки раніше ніколи не створювалися зображення з такою деталізацією з такого малого зразка початкових пікселів. Дослідники підкреслили, що модель не відновлює обличчя людини з оригінального низькоякісного зображення. Замість цього вона генерує нові обличчя, заповнюючи деталі, яких раніше не було. Через це модель не може бути використана для системи безпеки, оскільки вона не зможе перетворити розмиті зображення на зображення реальної людини.
Традиційні методи супер-роздільної здатності працюють шляхом здогадок про те, які пікселі необхідні для перетворення зображення у високоякісне зображення, засновані на зображеннях, які модель вивчила раніше. Через те, що додані пікселі є результатом здогадок, а не всіх пікселів будуть відповідати сусіднім пікселям, а певні регіони зображення можуть виглядати розмитими або спотвореними. Дослідники з Університету Дюка використали інший метод навчання своєї моделі штучного інтелекту. Модель, створена дослідниками Дюка, працює шляхом обробки низькоякісних зображень та додавання деталей до зображення з плином часу, посилаючись на високоякісні штучно створені обличчя як приклади. Модель посилається на штучно створені обличчя та намагається знайти ті, які схожі на цільові зображення, коли генеровані обличчя масштабуються до розміру цільового зображення.
Дослідницька команда створила модель Генеративної Адверсарної Мережі для обробки створення нових зображень. Генеративні Адверсарні Мережі насправді складаються з двох нейронних мереж, які тренуються на одному й тому ж наборі даних та протиставляються одна одній. Одна мережа відповідає за генерацію фальшивих зображень, які імітують реальні зображення у тренувальному наборі даних, тоді як друга мережа відповідає за виявлення фальшивих зображень серед справжніх. Перша мережа повідомляється, коли її зображення визнані фальшивими, та покращується, доки фальшиві зображення не стануть практично нерозрізними від справжніх.
Дослідники назвали свою модель супер-роздільної здатності PULSE, та модель постійно створює високоякісні зображення, навіть якщо їй надаються зображення, настільки розмиті, що інші методи супер-роздільної здатності не можуть створити високоякісні зображення з них. Модель навіть здатна створювати реалістичні обличчя з зображень, на яких особливості обличчя майже нерозрізні. Наприклад, коли їй надається зображення обличчя з роздільною здатністю 16×16, вона може створити зображення 1024 x 1024. Більше мільйона пікселів додаються під час цього процесу, заповнюючи деталі, такі як волосся, зморшки та навіть освітлення. Коли дослідники просили людей оцінити 1440 зображень, згенерованих моделлю PULSE, проти зображень, згенерованих іншими методами супер-роздільної здатності, зображення, згенеровані моделлю PULSE, постійно мали найвищі оцінки.
Хоча дослідники використовували свою модель для обробки зображень облич людей, ті самі методи, які вони використовують, можуть бути застосовані майже до будь-якого об’єкта. Низькоякісні зображення різних об’єктів можуть бути використані для створення високоякісних зображень цього набору об’єктів, відкриваючи можливості для різноманітних галузей та сфер, таких як мікроскопія, супутникові зображення, освіта, виробництво та медицина.












