Погляд Anderson

Чи просто “склеює речі разом” DALL-E 2, не розуміючи їхніх відносин?

mm
Додайте Unite.AI до бажаних джерел у Google

Нова дослідницька робота Гарвардського університету свідчить, що текстово-образова система DALL-E 2 від OpenAI має помітні труднощі у відтворенні навіть дитячого рівня відносин між елементами, які вона складає в синтезованих фотографіях, незважаючи на вражаючу складність багатьох своїх виходів.

Дослідники провели дослідження з участю 169 учасників, які були представлені зображеннями DALL-E 2 на основі найосновніших людських принципів семантики відносин, разом з текстовими промптами, які створили їх. Коли їх запитали, чи промпти та зображення пов’язані, менше 22% зображень були визнані такими, що відповідають їхнім асоційованим промптам, щодо дуже простих відносин, які DALL-E 2 була запитана візуалізувати.

Знімок екрана з проведених досліджень для нової статті. Учасники мали вибрати всі зображення, які відповідали промпту. Незважаючи на застереження внизу інтерфейсу, у всіх випадках зображення, невідомо учасникам, були фактично згенеровані з відображеного асоційованого промпту. Джерело: https://arxiv.org/pdf/2208.00005.pdf

Знімок екрана з проведених досліджень для нової статті. Учасники мали вибрати всі зображення, які відповідали промпту. Джерело: https://arxiv.org/pdf/2208.00005.pdf

Результати також свідчать, що видимість DALL-E у поєднанні різних елементів може зменшуватися, коли ці елементи стають менш імовірними для появи в реальному тренувальному наборі даних, який живить систему.

Наприклад, зображення для промпту “дитина торкається миски” отримали 87% рівень згоди (тобто учасники клали на більшість зображень як відповідних промпту), тоді як подібні фотореалістичні рендеринги “мавпи, яка торкається ігуани” досягли лише 11% рівня згоди:

DALL-E 2 має труднощі з зображенням малоймовірного події «мавпа торкається ігуани», ймовірно, через відсутність реальних зображень цієї події в тренувальному наборі.

DALL-E 2 має труднощі з зображенням малоймовірної події «мавпа торкається ігуани».

У другому прикладі DALL-E 2 часто помиляється у масштабі та навіть виді, ймовірно, через нестачу реальних зображень цієї події. Натомість можна очікувати великої кількості тренувальних фотографій, пов’язаних з дітьми та їжею, і що ця піддомен/клас добре розвинений.

Труднощі DALL-E у поєднанні різко контрастних елементів зображення свідчать, що публіка зараз так вражена фотореалістичними та інтерпретативними можливостями системи, що не розвинула критичного ока для випадків, коли система фактично просто «склеює» один елемент різко на інший, як у цих прикладах з офіційного сайту DALL-E 2:

Синтез «вирізання та склеювання», з офіційних прикладів для DALL-E 2. Джерело: https://openai.com/dall-e-2/

Синтез «вирізання та склеювання», з офіційних прикладів для DALL-E 2. Джерело: https://openai.com/dall-e-2/

The нова стаття свідчить*:

‘Поняття відносин є фундаментальним компонентом людського інтелекту, який проявляється рано у розвитку, і обчислюється швидко та автоматично у сприйнятті.

‘Труднощі DALL-E 2 з навіть базовими просторовими відносинами (наприклад, у, на, під) свідчать, що система ще не навчилися тих представлень, які дозволяють людям так гнучко та надійно структурувати світ.

‘Пряме тлумачення цієї трудності полягає в тому, що системи типу DALL-E 2 ще не мають відносинної композиційності.’

Автори пропонують, що системи текстово-образової генерації, такі як DALL-E, могли б виграти від використання алгоритмів, спільних для робототехніки, які одночасно моделюють ідентичності та відносини, через потребу агента фактично взаємодіяти з середовищем, а не просто фабрикувати суміш різних елементів.

Одним з таких підходів є CLIPort, який використовує той самий механізм CLIP, що служить елементом оцінки якості в DALL-E 2:

CLIPort, спільна робота Університету Вашингтону та NVIDIA у 2021 році, використовує CLIP у контексті, настільки практичному, що системи, треновані на ньому, повинні обов'язково розвинути розуміння фізичних відносин, мотиватор, який відсутній у DALL-E 2 та подібних «фантастичних» систем генерації зображень. Джерело: https://arxiv.org/pdf/2109.12098.pdf

CLIPort, спільна робота Університету Вашингтону та NVIDIA у 2021 році, використовує CLIP у контексті, настільки практичному, що системи, треновані на ньому, повинні обов’язково розвинути розуміння фізичних відносин. Джерело: https://arxiv.org/pdf/2109.12098.pdf

Автори далі пропонують, що інший можливий вдосконалення міг би полягати у тому, щоб архітектура систем генерації зображень, таких як DALL-E, включала множинні ефекти в одному шарі обчислень, дозволяючи розрахувати відносини у спосіб, натхненний інформаційними можливостями біологічних систем.

Нова стаття називається Тестування відносинного розуміння у текстово-образовій генерації і походить від Коліна Конвелла та Томера Д. Уллмана з Гарвардського університету.

Поза ранньою критикою

Коментуючи «фокус» за реалізмом та цілісністю виходу DALL-E 2, автори відзначають попередні роботи, які знайшли недоліки у системах генерації зображень типу DALL-E.

У червні цього року Університет Каліфорнії, Берклі, відзначив труднощі DALL-E у обробці відбитків та тіней; того ж місяця дослідження з Кореї досліджувало «унікальність» та оригінальність виходу DALL-E 2 з критичним оком; попередній аналіз зображень DALL-E 2, незабаром після запуску, від Нью-Йоркського університету та Університету Техасу, виявив різні проблеми з композиційністю та іншими важливими факторами у зображеннях DALL-E 2; і минулого місяця спільна робота між Університетом Іллінойсу та Массачусетським технологічним інститутом пропонувала вдосконалення архітектури таких систем щодо композиційності.

Дослідники далі відзначають, що відомі особи DALL-E, такі як Адитья Рамеш, визнали труднощі системи з прив’язуванням, відносним розміром, текстом та іншими викликами.

Розробники системи генерації зображень Imagen від Google також пропонують DrawBench, нову систему порівняння, яка оцінює точність зображень у різних метриках.

Натомість автори нової статті пропонують, що кращий результат міг би бути отриманий шляхом протиставлення людської оцінки — а не внутрішньоалгоритмічних метрик — отриманим зображенням, щоб встановити, де лежать слабкості, і що можна зробити, щоб пом’якшити їх.

Дослідження

Для цього новий проєкт базується на психологічних принципах і намагається відійти від поточного сплеску інтересу до «інженерії промптів» (що є, по суті, визнанням недоліків DALL-E 2 або будь-якої порівнюваної системи), щоб дослідити та потенційно вирішити обмеження, які роблять такі «обхідні шляхи» необхідними.

Стаття свідчить:

‘Поточна робота фокусується на наборі з 15 базових відносин, раніше описаних, досліджених чи запропонованих у когнітивній, розвитку або лінгвістичній літературі. Набір містить як засновані просторові відносини (наприклад, «Х на Y»), так і більш абстрактні агентні відносини (наприклад, «Х допомагає Y»).

‘Промпти навмисно прості, без атрибутної складності чи розширення. Тобто, замість промпту типу «осел і восьминіг грають у гру. Осел тримає мотузку в одному кінці, восьминіг тримає за інший. Осел тримає мотузку в роті. Кіт стрибає через мотузку», ми використовуємо «коробка на ножі».

‘Простота все ще захоплює широкий діапазон відносин з різних піддоменів людської психології, і робить потенційні моделі невдач більш виразними та конкретними.’

Для свого дослідження автори залучили 169 учасників з Prolific, усіх розташованих у США, з середнім віком 33 роки та 59% жінок.

Учасники бачили 18 зображень, організованих у 3х6 сітку з промптом зверху та застереженням внизу, яке вказувало, що всі, деякі чи жодні зображень можуть бути згенеровані з відображеного промпту, і потім були запитані, щоб вибрати зображення, які вони вважали пов’язаними таким чином.

Зображення, представлені людям, були засновані на лінгвістичній, розвитку та когнітивній літературі, і складалися з набору восьми фізичних та семи «агентних» відносин (це стане зрозуміло зараз).

Фізичні відносини
в, на, під, покриваючи, біля, закритий, звисаючий над, і зв’язаний з.

Агентні відносини
штовхає, тягне, торкається, б’є, б’є, допомагає, і запобігає.

Всі ці відносини були взяті з попередньо згаданих некомп’ютерних галузей вивчення.

Дванадцять сутностей були таким чином отримані для використання у промптах, з шістьма об’єктами та шістьма агентами:

Об’єкти
коробка, циліндр, ковдра, миска, чашка, і ніж.

Агенти
людина, жінка, дитина, робот, мавпа, і ігуана.

(Дослідники визнають, що включення ігуани, не основної складової сухої соціологічної чи психологічної досліджень, було «третом»)

Для кожної відносини було створено п’ять різних промптів шляхом випадкового вибірку двох сутностей п’ять разів, що призвело до 75 загальних промптів, кожен з яких був представлений DALL-E 2, і для кожного з яких були використані початкові 18 наданих зображень, без варіацій чи другого шансу.

Результати

Стаття свідчить*:

‘Учасники в середньому повідомили про низький рівень згоди між зображеннями DALL-E 2 та промптами, використаними для їх генерації, з середнім значенням 22,2% [18,3, 26,6] по 75 різним промптам.

‘Агентні промпти, з середнім значенням 28,4% [22,8, 34,2] по 35 промптам, згенерували більшу згоду, ніж фізичні промпти, з середнім значенням 16,9% [11,9, 23,0] по 40 промптам.’

Результати дослідження. Точки в чорному позначають усі промпти, з кожною точкою як окремим промптом, і кольором розбивається залежно від того, чи був промпт агентним чи фізичним (тобто об'єктом).

Результати дослідження. Точки в чорному позначають усі промпти.

Для порівняння різниці між людським і алгоритмічним сприйняттям зображень дослідники пропустили свої рендеринги через відкритий джерельний код OpenAI ViT-L/14 CLIP-основану структуру. В середньому оцінки вони виявили «помірну залежність» між двома наборами результатів, що, можливо, дивно, враховуючи ступінь, у якій CLIP сам допомагає генерувати зображення.

Результати порівняння CLIP (ViT-L/14) з людськими відповідями.

Результати порівняння CLIP (ViT-L/14) з людськими відповідями.

Дослідники пропонують, що інші механізми всередині архітектури, можливо, у поєднанні з випадковим переважанням (або відсутністю) даних у тренувальному наборі, можуть пояснити те, як CLIP може визнавати обмеження DALL-E, не будучи здатним у всіх випадках зробити щось суттєве щодо проблеми.

Автори висновують, що DALL-E 2 має лише номінальну можливість відтворювати зображення, які включають відносинне розуміння, фундаментальний аспект людського інтелекту, який розвивається у нас дуже рано.

‘Те, що системи типу DALL-E 2 не мають композиційності, може бути сюрпризом для тих, хто бачив DALL-E 2, які генерують розумні апроксимації композиційних концепцій, з усіма частинами промптів присутніми та присутніми в правильних місцях.

‘Композиційність, однак, не лише здатність «склеювати речі разом» — навіть речі, які ви ніколи не бачили разом раніше. Композиційність вимагає розуміння правил, які зв’язують речі разом. Відносини — це такі правила.’

Людина кусає Т-Рекса

Відгук Коли OpenAI розширює кількість користувачів після недавньої бета-монітизації DALL-E 2, і тепер потрібно платити за більшість генерацій, обмеження DALL-E 2 у відносинному розумінні можуть стати більш очевидними, оскільки кожна «невдала» спроба має фінансовий вагу, і повернення коштів не доступні.

Ті, хто отримав запрошення трохи раніше, мали час (і, до недавнього часу, більшу можливість грати з системою) спостерігати деякі «відносинні глюки», які DALL-E 2 може випускати.

Наприклад, для шанувальника «Парку Юрського періоду» дуже складно змусити динозавра переслідувати людину в DALL-E 2, хоча концепція «переслідування» не здається частиною системи цензурування DALL-E 2, і хоча довга історія фільмів про динозаврів повинна забезпечити достатньо тренувальних прикладів (хоча б у вигляді трейлерів та промо-зображень) для цього іншому разі неможливого зустрічі видів.

Типовий відповідь DALL-E 2 на промпт «Фотографія кольору Т-Рекса, який переслідує людину по дорозі».

Типовий відповідь DALL-E 2 на промпт «Фотографія кольору Т-Рекса, який переслідує людину по дорозі». Source: DALL-E 2

Я виявив, що зображення вище є типовими для варіантів промпту «[динозавр] переслідує [людину]», і що жодне розширення промпту не може змусити Т-Рекса фактично виконувати це. У першому та другому фото людина (більш-менш) переслідує Т-Рекса; у третьому підходить до нього з небайдужим ставленням до безпеки; і в останньому зображенні, очевидно, біжить паралельно до великого звіра. У близько 10-15 спробах цієї теми я виявив, що динозавр подібно «розгублений».

Це може бути тому, що єдиними тренувальними даними, які DALL-E 2 могла отримати, були зображення типу «людина б’ється з динозавром», з промо-знімків старих фільмів, таких як «Одного мільйона років до нашої ери» (1966), і що знаменитий втечу Джеффа Голдблюма від короля хижаків є просто аутлієром у цьому невеликому наборі даних.

 

* Моє перетворення внутрішніх цитат авторів у гіперпосилання.

Перша публікація 4 серпня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai