Погляд Anderson

Як визначити, чи системи синтезу зображень створюють справжньо «оригінальний» матеріал

mm
Додайте Unite.AI до бажаних джерел у Google
'Teddy bears working on new AI research underwater with 1990s technology' – Source: https://www.creativeboom.com/features/meet-dall-e/

Нове дослідження з Південної Кореї запропонувало метод визначення того, чи системи синтезу зображень створюють справжньо нові зображення, або лише «дрібні» варіанти навчальних даних, потенційно перемагаючи мету таких архітектур (як виробництво нових та оригінальних зображень).

Більшість часу, як стверджує стаття, останнє є правдою, оскільки існуючі метрики, які такі системи використовують для поліпшення своїх генеративних можливостей під час навчання, змушені віддавати перевагу зображенням, які відносно близькі до (не фальшивих) джерельних зображень у наборі даних.

Якщо згенероване зображення «візуально близьке» до джерельних даних, воно, безумовно, отримає вищу оцінку за «автентичність», ніж за «оригінальність», оскільки воно «відрізняється» – якщо не надихає.

У галузі, яка ще занадто молода і не випробувана, щоб її юридичні наслідки були ще відомі, це може виявитися важливим юридичним питанням, якщо виявиться, що комерціалізовані синтетичні зображення не відрізняються достатньо від (часто) авторських джерельних матеріалів, які зараз допускаються у дослідницькій сфері у вигляді популярних веб-скрейпінгових наборів даних (потенціал майбутніх претензій щодо порушення прав цього типу востаннє став відомим щодо Microsoft’s GitHub Co-Pilot AI).

Відносно все більш зрозумілих і семантично сильних результатів з систем, таких як OpenAI’s DALL-E 2, Google’s Imagen, і China’s CogView релізів (а також нижчою специфікацією DALL-E mini), існує дуже мало пост-факто способів надійно перевірити оригінальність згенерованого зображення.

Дійсно, пошук деяких з найбільш популярних нових зображень DALL-E 2 часто веде лише до подальших екземплярів тих самих зображень, залежно від пошукової системи.

Uploading a complete 9-image DALL-E 2 output group only leads to more DALL-E 2 output groups. Separating and uploading the first image (from this Twitter post of 8th червень 2022, from the 'Weird Dall-E Generations' account) causes Google to fixate on the basketball in the picture, taking the image-based search down a semantic blind alley. For the same image-based search, Yandex seems at least to be doing some actual pixel-based deconstruction and feature-matching.

Uploading a complete 9-image DALL-E 2 output group only leads to more DALL-E 2 output groups, because the grid structure is the strongest feature. Separating and uploading the first image (from this Twitter post of 8th червень 2022, from the ‘Weird Dall-E Generations’ account) causes Google to fixate on the basketball in the picture, taking the image-based search down a semantic blind alley. For the same image-based search, Yandex seems at least to be doing some actual pixel-based deconstruction and feature-matching.

Хоча Yandex більш схильний використовувати фактичні функції (тобто виведені/обчислені функції зображення, не обов’язково обличчя людей) і візуальні (а не семантичні) характеристики наданного зображення для пошуку подібних зображень, усі пошукові системи зображень мають якийсь порядок денний або практику, яка може ускладнити ідентифікацію випадків джерело>генерований плагіату через веб-пошук.

Крім того, навчальні дані для генеративної моделі можуть не бути публічно доступними в повному обсязі, що ще більше ускладнює судову експертизу оригінальності згенерованих зображень.

Цікаво, що виконання зображення-орієнтованого веб-пошуку на одному з синтетичних зображень, представлених Google на сайті Imagen, нічого порівнянного з предметом зображення не знаходить, щодо фактичного огляду зображення та безстороннього пошуку подібних зображень. Навпаки, семантично фіксований, як завжди, результати пошуку Google зображень для цього зображення Imagen не дозволять здійснити чистий зображення-орієнтований веб-пошук зображення без додавання пошукових термінів «imagen google» як додаткового (і обмежувального) параметра:

Yandex, навпаки, знаходить багато подібних (або хоча б візуально пов’язаних) реальних зображень з аматорської художньої спільноти:

Загалом, було б краще, якщо новизна або оригінальність виводу систем синтезу зображень можна було якимось чином виміряти, без необхідності витягувати функції з кожного можливого веб-зображення в інтернеті на момент навчання моделі або в не публічних наборах даних, які можуть використовувати авторські матеріали.

Пов’язано з цією проблемою, дослідники з Kim Jaechul Graduate School of AI в Korea Advanced Institute of Science and Technology (KAIST AI) співпрацювали з глобальною ІКТ-компанією NAVER Corp для розробки Баллу Рідкості, який може допомогти ідентифікувати більш оригінальні творіння систем синтезу зображень.

Images here are generated via StyleGAN-FFHQ. From left to right, the columns indicate worst to best results. We can see that the 'Truncation trick' metric (see below) and the Realism metric have their own agendas, whilst the new 'Rarity' score (top row) is seeking out cohesive but original imagery (rather than just cohesive imagery). Source: https://arxiv.org/pdf/2206.08549.pdf

Images here are generated via StyleGAN-FFHQ. From left to right, the columns indicate worst to best results. We can see that the ‘Truncation trick’ metric (see below) and the Realism metric have their own agendas, whilst the new ‘Rarity’ score (top row) is seeking out cohesive but original imagery (rather than just cohesive imagery).  Since there are image-size limits in this article, please see the source paper for better detail and resolution. Source: https://arxiv.org/pdf/2206.08549.pdf

Нова стаття називається Бал Рідкості: Нова Метрика для Оцінки Незвичності Синтезованих Зображень, і походять від трьох дослідників з KAIST та трьох з NAVER Corp.

Поза «дешевим трюком»

Серед попередніх метрик, на які нова стаття намагається покращити, є «трюк обрізання» пропонований у 2019 році у співпраці між університетом Heriot-Watt у Великій Британії та Google’s DeepMind.

Трюк обрізання фактично використовує інший.latентний розподіл для вибірки, ніж той, який використовувався для навчання генеративної моделі.

Дослідники, які розробили цей метод, були здивовані, що він працює, але визнають у початковій статті, що він зменшує різноманітність згенерованих результатів. Тим не менш, трюк обрізання став ефективним і популярним у контексті того, що можна назвати «дешевим трюком» для отримання автентичних результатів, які не зовсім засвоюють усі можливості, закладені в даних, і можуть нагадувати джерельні дані більше, ніж бажано.

Відносно трюку обрізання автори нової статті відзначають:

‘[Він] не призначений для генерації рідкісних зразків під час навчання, а радше для синтезу типових зображень більш стабільно. Ми припускаємо, що існуючі генеративні моделі будуть能够 виробляти зразки, багатші на реальному розподілі даних, якщо генератор можна змусити ефективно виробляти рідкісні зразки.’

Відносно загальної тенденції до традиційних метрик, таких як Frechet Inception Distance (FID, який піддався інтенсивній критиці у грудні 2021 року), inception score (IS) і Kernel Inception Distance (KID) як «покажчиків прогресу» під час навчання генеративної моделі, автори далі коментують*:

‘Ця схема навчання веде генератор не до синтезу багатьох рідкісних зразків, які унікальні та мають сильні характеристики, які не становлять велику частку реального розподілу зображень. Приклади рідкісних зразків з публічних наборів даних включають людей з різними аксесуарами в FFHQ, білих тварин в AFHQ, і рідкісні статуї в Metfaces.

‘Здатність генерувати рідкісні зразки важлива не тільки тому, що вона пов’язана з краєм можливостей генеративних моделей, але також тому, що унікальність відіграє важливу роль у творчих застосуваннях, таких як віртуальні люди.

‘Однак, якісні результати кількох останніх досліджень рідко містять ці рідкісні приклади. Ми припускаємо, що природа схеми суперницького навчання змушує розподіл згенерованих зображень бути схожим на той, який використовувався для навчання моделі. Отже, зображення з чіткою індивідуальністю або рідкістю займають лише невелику частку зображень, згенерованих моделями.’

Техніка

Дослідники запропонували новий бал рідкості, який адаптує ідею, представлену в раніших працях – використання K-Nearest Neighbors (KNNs) для представлення масивів справжніх (навчальних) і синтетичних (вивідних) даних у системі синтезу зображень.

Відносно цього нового методу аналізу автори стверджують:

‘Ми припускаємо, що звичайні зразки будуть ближче один до одного, тоді як унікальні та рідкісні зразки будуть розріджені у просторі функцій.’

Результати зображення вище показують найменші найближчі відстані сусідів (NNDs) до найбільших, у архітектурі StyleGAN, навченій на FFHQ.

‘Для всіх наборів даних зразки з найменшими NNDs показують типові зображення. Навпаки, зразки з найбільшими NNDs мають сильну індивідуальність і суттєво відрізняються від типових зображень з найменшими NNDs.’

У теорії, використовуючи цю нову метрику як дискримінатор, або хоча б включивши її в більш складну архітектуру дискримінатора, генеративна система могла б бути спрямована від чистої імітації до більш винахідливого алгоритму, зберігаючи при цьому суттєву узгодженість концепцій, які можуть бути критичними для автентичного виробництва зображень (тобто «людина», «жінка», «автомобіль», «церква» тощо).

Порівняння та Експерименти

У тестах дослідники провели порівняння продуктивності балу рідкості з трюком обрізання та балом реалізму NVIDIA 2019 року, і виявили, що в різних рамках і наборах даних підхід здатний індивідуалізувати «унікальні» результати.

Хоча результати, представлені в статті, надто обширні, щоб включити їх тут, дослідники здаються здатними продемонструвати можливість нового методу ідентифікувати рідкість як у джерельних (реальних), так і в згенерованих (фальшивих) зображеннях у генеративній процедурі:

Select examples from the extensive visual results reproduced in the paper (see source URL above for more details). On the left, genuine examples from FFHQ that have very few near neighbors (i.e. are novel and unusual) in the original dataset; on the right, fake images generated by StyleGAN, which the new metric has identified as truly novel.

Select examples from the extensive visual results reproduced in the paper (see source URL above for more details). On the left, genuine examples from FFHQ that have very few near neighbors (i.e. are novel and unusual) in the original dataset; on the right, fake images generated by StyleGAN, which the new metric has identified as truly novel. Since there are image-size limits in this article, please see the source paper for better detail and resolution.

Новий бал рідкості не тільки дозволяє ідентифікувати «нові» генеративні результати в одній архітектурі, але також, стверджують дослідники, дозволяє порівнювати між генеративними моделями різних архітектур (тобто автоенкодер, VAE, GAN тощо).

Стаття відзначає, що бал рідкості відрізняється від попередніх метрик, зосереджуючись на здатності генеративної структури створювати унікальні та рідкісні зображення, на відміну від «традиційних» метрик, які вивчають (більш міопічно) різноманітність між генераціями під час навчання моделі.

Поза обмеженими завданнями

Хоча дослідники провели тести на обмежених завданнях (наприклад, генератор/набір даних, призначені для створення зображень людей або котів), бал рідкості потенційно можна застосувати до будь-якої довільної процедури синтезу зображень, де потрібно ідентифікувати згенеровані приклади, які використовують розподіли, виведені з навчених даних, а не збільшувати автентичність (і зменшувати різноманітність) шляхом інтерполяції іноземних.latентних розподілів або використання інших «шорткатів», які компрометують новизну на користь автентичності.

У практиці, і в відсутності чіткого розуміння ступеня, у якому система справді засвоює візуальні та семантичні концепції (часто перешкоджає обмежена інформація про навчальні дані), це може бути життєздатним методом ідентифікації справжньої «хвилини натхнення» в генеративній системі – моменту, у якому достатня кількість вхідних концепцій і даних призвела до чогось справді винахідливого, а не чогось надміру похідного або близького до джерельних даних.

 

* Мої конверсії вбудованих цитат авторів у гіперпосилання.

Перше видання 20 червня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai