Погляд Anderson

Глибокі моделі навчання можуть мати труднощі з розпізнаванням зображень, згенерованих штучним інтелектом

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідження нової статті свідчать про те, що сучасні моделі штучного інтелекту значно гірше розпізнають і інтерпретують зображення, згенеровані штучним інтелектом, ніж люди, що може бути проблематичним у майбутньому, коли моделі машинного навчання все частіше тренуються на синтетичних даних, і не завжди буде відомо, чи дані є “реальними” чи ні.

Тут ми бачимо модель передбачення resnext101_32x8d_wsl, яка має труднощі у категорії «бейгл». У тестах вважалося, що відбулася помилка розпізнавання, якщо основне цільове слово (у цьому випадку «бейгл») не було у числі п'яти передбачених результатів. Джерело: https://arxiv.org/pdf/2208.10760.pdf

Тут ми бачимо модель передбачення resnext101_32x8d_wsl, яка має труднощі у категорії «бейгл». У тестах вважалося, що відбулася помилка розпізнавання, якщо основне цільове слово (у цьому випадку «бейгл») не було у числі п’яти передбачених результатів. Джерело: https://arxiv.org/pdf/2208.10760.pdf

Нове дослідження перевірilo дві категорії комп’ютерних моделей розпізнавання зображень: розпізнавання об’єктів і візуальне питання-відповідь (VQA).

Зліва - успіхи та невдачі системи розпізнавання об'єктів; справа - завдання VQA, призначені для дослідження розуміння штучним інтелектом сцен і зображень більш глибоким і значимим чином. Джерела: https://arxiv.org/pdf/2105.05312.pdf і https://arxiv.org/pdf/1505.00468.pdf

Зліва – успіхи та невдачі системи розпізнавання об’єктів; справа – завдання VQA, призначені для дослідження розуміння штучним інтелектом сцен і зображень більш глибоким і значимим чином. Джерела: https://arxiv.org/pdf/2105.05312.pdf і https://arxiv.org/pdf/1505.00468.pdf

З десяти сучасних моделей, які були протестовані на наборах даних, згенерованих фреймворками зображень DALL-E 2 і Midjourney, найкраща модель змогла досягти лише 60% і 80% точності у п’яти найкращих результатах для двох типів тестів, тоді як ImageNet, навчена на реальних, не синтетичних даних, може досягти 91% і 99% у тих самих категоріях, тоді як людська точність зазвичай значно вища.

Розглядаючи питання щодо зміни розподілу (також відомої як «зміна моделі», коли моделі передбачення втрачають свою передбачувальну здатність при переході від тренувальних даних до «реальних» даних), у статті зазначається:

‘Люди можуть легко розпізнавати згенеровані зображення та відповідати на питання про них. Ми робимо висновок, що а) глибокі моделі мають труднощі з розумінням згенерованого вмісту і можуть покращити свою роботу після доопрацювання, і б) існує велика зміна розподілу між згенерованими зображеннями та реальними фотографіями. Зміна розподілу здається залежною від категорії.’

Ураховуючи обсяг синтетичних зображень, які вже зараз заповнюють інтернет після відкриття джерельного коду потужної моделі Stable Diffusion, природно виникає питання про те, чи можуть «фальшиві» зображення потрапляти до промислових наборів даних, таких як Common Crawl, і чи можуть варіації точності протягом років бути суттєво вплинуті «нереальними» зображеннями.

Хоча синтетичні дані були оголошені як потенційний рятівник для галузі комп’ютерного бачення, яка часто не має ресурсів і бюджетів для великомасштабної кураторії, нова хвиля зображень, згенерованих Stable Diffusion (разом із загальним зростанням синтетичних зображень після появи і комерціалізації DALL-E 2), навряд чи будуть супроводжуватися повними мітками, анотаціями та хештегами, які б відрізняли їх як «фальшиві» на момент захоплення ними систем машинного бачення.

Швидкість розвитку відкритих фреймворків синтезу зображень значно випередила нашу здатність категоризувати зображення з цих систем, що призвело до зростання інтересу до систем виявлення «фальшивих» зображень, подібних до систем виявлення глибоких фейків, але призначених для оцінки цілих зображень, а не лише частин облич.

Нова стаття під назвою Як добре глибокі моделі розуміють згенеровані зображення? була написана Алі Борджі з сан-франциської компанії Quintic AI.

Дані

Дослідження передувало виходу Stable Diffusion, а експерименти використовували дані, згенеровані DALL-E 2 і Midjourney, у 17 категоріях, включаючи слона, гриб, піцу, претцель, трактор і кролика.

Приклади зображень, з яких системи розпізнавання та VQA мали ідентифікувати найважливішу ключову концепцію.

Приклади зображень, з яких системи розпізнавання та VQA мали ідентифікувати найважливішу ключову концепцію.

Зображення були отримані через веб-пошук і Twitter, і, згідно з політикою DALL-E 2 (щонайменше, на той час), не включали жодних зображень з людськими обличчями. Були обрані лише добрі зображення, які люди могли легко розпізнати.

Було створено два набори зображень, один для розпізнавання об’єктів, а інший для завдань VQA.

Кількість зображень у кожній категорії для розпізнавання об'єктів.

Кількість зображень у кожній категорії для розпізнавання об’єктів.

Тестування розпізнавання об’єктів

Для тестів розпізнавання об’єктів було протестовано десять моделей, всі треновані на ImageNet: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit, і ResNext_WSL.

Деякі класи у тестованих системах були більш детальними, ніж інші, що вимагало застосування середніх підходів. Наприклад, ImageNet містить три класи, пов’язані з «годинниками», і було необхідно визначити деякий вид довільної метрики, де включення будь-якого «годинника» будь-якого типу до п’яти найкращих передбачених міток для будь-якого зображення вважалося успіхом у цьому випадку.

Результати моделей у 17 категоріях.

Результати моделей у 17 категоріях.

Найкращою моделлю у цьому раунді була resnext101_32x8d_ws, яка досягла майже 60% для першого місця (тобто, коли її перша передбачена мітка була правильною концепцією, закладеною у зображенні), і 80% для п’яти найкращих результатів (тобто, коли бажана концепція була хоча б у числі п’яти передбачених результатів).

Автор вважає, що така хороша робота цієї моделі пояснюється тим, що вона була тренована для слабо наглядованої передбачення хештегів у соціальних мережах. Однак ці лідерські результати, зауважує автор, суттєво нижчі за те, що може досягти ImageNet на реальних даних, тобто 91% і 99%. Він вважає, що це пояснюється великою різницею між розподілом зображень ImageNet (які також збираються з вебу) і згенерованими зображеннями.

П’ять найважчих категорій для системи, у порядку складності, були корито, черепаха, білка, сонцезахисні окуляри і шолом. У статті зазначається, що клас корито часто плутається з балоном, парашутом і парасолькою, хоча ці розрізненні легко відрізняються людьми.

Деякі категорії, включаючи корито і черепаху, викликали універсальну невдачу у всіх моделях, тоді як інші (зокрема претцель і трактор) призвели до майже універсального успіху у тестованих моделях.

Поляризовані категорії: деякі з вибраних категорій або повністю плутали всі моделі, або були досить легко ідентифіковані всіма моделями.

Поляризовані категорії: деякі з вибраних категорій або повністю плутали всі моделі, або були досить легко ідентифіковані всіма моделями.

Автори припускають, що ці результати свідчать про те, що всі моделі розпізнавання об’єктів можуть мати схожі сильні та слабкі сторони.

Тестування візуального питання-відповіді

Далі автор протестував моделі VQA на відкритих і вільних завданнях VQA з двійковими питаннями (тобто питаннями, на які можна відповісти лише «так» або «ні»). У статті зазначається, що сучасні моделі VQA можуть досягти 95% точності на наборі даних VQA-v2.

Для цього етапу тестування автор створив 50 зображень і сформулював 241 питання про них, 132 з яких мали позитивні відповіді, а 109 негативні. Середня довжина питання становила 5,12 слова.

У цьому раунді було використано модель OFA, яка є задачево-агностичною і модально-агностичною рамкою для тестування повноти завдань, і нещодавно зайняла перше місце у наборі даних VQA-v2 test-std. Модель OFA досягла 77,27% точності на згенерованих зображеннях, порівняно з її власним результатом 94,7% у наборі даних VQA-v2 test-std.

Приклади питань і результатів з секції VQA тестів. 'GT' означає 'Ground Truth', тобто правильна відповідь.

Приклади питань і результатів з секції VQA тестів. ‘GT” означає ‘Ground Truth’, тобто правильна відповідь.

Автор вважає, що частина причини цього може полягати в тому, що згенеровані зображення містять семантичні концепції, відсутні у наборі даних VQA-v2, і що питання, написані для тестів VQA, можуть бути складнішими, ніж загальний стандарт питань VQA-v2, хоча він вважає, що перша причина більш імовірна.

LSD у потоці даних?

Опінія

Нова поява штучно згенерованих зображень, які можуть представляти миттєві поєднання і абстракції основних концепцій, яких не існує в природі, і які були б надзвичайно трудомісткими для створення традиційними методами, може створити особливу проблему для слабо наглядованих систем збору даних, які можуть не бути здатними працювати правильно у разі великої кількості незначених синтетичних даних – в основному тому, що вони не були розроблені для обробки великої кількості синтетичних даних.

У таких випадках може існувати ризик того, що ці системи будуть корелювати певний відсоток «дивних» синтетичних зображень у неправильні категорії просто тому, що ці зображення містять відмінні об’єкти, які насправді не належать разом.

«Астронавт, який їде на коні» став, можливо, найбільш емблематичним візуальним представленням нового покоління систем синтезу зображень - але такі «нереальні» відносини можуть потрапити до реальних систем розпізнавання, якщо не буде вжито належних заходів. Джерело: https://twitter.com/openai/status/1511714545529614338?lang=en

«Астронавт, який їде на коні» став, можливо, найбільш емблематичним візуальним представленням нового покоління систем синтезу зображень – але такі «нереальні» відносини можуть потрапити до реальних систем розпізнавання, якщо не буде вжито належних заходів. Джерело: https://twitter.com/openai/status/1511714545529614338?lang=en

Якщо це не можна запобігти на етапі попередньої обробки перед тренуванням, такі автоматизовані пайплайни можуть привести до появи неправдоподібних або навіть гротескних асоціацій, закладених у моделі машинного навчання, що погіршить їхню ефективність, і ризикує передати високоуровневі асоціації до наступних систем і підкатегорій.

Альтернативно, розрізнені синтетичні зображення можуть мати «охолоджувальний» ефект на точність пізніших систем, якщо нові або змінені архітектури з’являться, які намагатимуться врахувати «ад-хок» синтетичні зображення, і будуть ловити занадто широке коло.

У будь-якому випадку синтетичні зображення у післястабільному віці Stable Diffusion можуть стати головним болем для галузі комп’ютерного бачення, чиї зусилля зробили ці дивні створіння та можливості можливими – не в останню чергу тому, що це загрожує надії цієї галузі, що збирання та кураторство даних можуть бути значно автоматизовані, ніж це є зараз, і значно менше витратні та часозатратні.

 

Вперше опубліковано 1 вересня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai