Погляд Anderson

Унікальне рішення DALL-E 2 для подвійних значень

mm
Додайте Unite.AI до бажаних джерел у Google

Хтось, хто вивчив італійську мову, вчиться рано звертати увагу на контекст при описі міта, оскільки італійське слово для цього буденного домашнього предмета має дуже нецільове друге значення як дієслово*. Хоча ми вчимося рано розрізняти семантичне відображення та застосування слів з кількома значеннями, це не є навиком, який легко передати гіпермасштабним системам синтезу зображень, таким як DALL-E 2 та Stable Diffusion, оскільки вони покладаються на модуль контрастного мовно-образового попереднього навчання OpenAI (CLIP), який сприймає об’єкти та їх властивості досить вільно (хоча він здобуває дедалі більше території у сфері синтезу зображень та відео з використанням.latent дифузії).

Досліджуючи цю недолік, нове дослідження від Університету Бар-Ілана та Інституту штучного інтелекту Аллена пропонує широке дослідження ступеня, у якому DALL-E 2 схильний до таких семантичних помилок:

Подвійні значення розділені на кілька об'єктів у DALL-E 2 – хоча будь-яка система дифузії може створювати такі приклади. У верхньому правому зображенні видалення 'золотого' з запиту змінює вид риби, тоді як у випадку 'зебрового переходу' необхідно явно вказати поверхню дороги, щоб видалити дублювання асоціації. Джерело: https://export.arxiv.org/pdf/2210.10606

Подвійні значення розділені на кілька інтерпретацій у DALL-E 2 – хоча будь-яка система дифузії може створювати такі приклади. У верхньому правому зображенні видалення ‘золотого’ з запиту змінює вид риби, тоді як у випадку ‘зебрового переходу’ необхідно явно вказати поверхню дороги, щоб видалити дублювання асоціації. Джерело: https://export.arxiv.org/pdf/2210.10606

Автори виявили, що ця схильність до подвійної інтерпретації слів і фраз здається не тільки спільною для всіх моделей дифузії, керованих CLIP, але й погіршується при навчанні моделей на все більших обсягах даних. У статті зазначається, що ‘зменшені’ версії моделей текст-образ, включаючи DALL-E Mini (тепер Craiyon), видають такі помилки значно рідше, і що Stable Diffusion також помиляється менше – хоча лише тому, що часто вона зовсім не слідує запиту, що є іншим видом помилки.

Простий запит 'дата' змушує DALL-E 2 викликати два з кількох значень слова, тоді як слово 'вентилятор' також розділяється на два своїх семантичних відображення, а в третьому зображенні фраза 'конус' надійно перетворює невизначену їжу в запиту на морозиво, яке асоціюється з 'конусом'.

Простий запит ‘дата’ змушує DALL-E 2 викликати два з кількох значень слова, тоді як слово ‘вентилятор’ також розділяється на два своїх семантичних відображення, а в третьому зображенні фраза ‘конус’ надійно перетворює невизначену їжу в запиту на морозиво, яке асоціюється з ‘конусом’.

Роз’яснюючи, як ми здійснюємо ефективне лексичне розділення, у статті зазначається:

‘Хоча символи – а також структури речень – можуть бути двозначними, після того, як інтерпретація створена, ця двозначність вже вирішена. Наприклад, символ “бейсбольна бита” у літаючій біті може бути інтерпретований як дерев’яна палиця або тварина, наші можливі інтерпретації речення – або літаюча дерев’яна палиця, або літаюча тварина, але ніколи не обидва одночасно. Як тільки слово “бита” використовується в інтерпретації для позначення об’єкта (наприклад, дерев’яної палиці), воно не може бути повторно використане для позначення іншого об’єкта (тварини) в тій же інтерпретації.’

DALL-E 2, як зазначається в статті, не обмежений цим чином:

'Літаюча бита над стадіоном бейсболу' – перше зображення з статті, інші три отримані просто введенням того ж запиту в DALL-E 2.

‘Літаюча бита над стадіоном бейсболу’ – перше зображення з статті, інші три отримані просто введенням того ж запиту в DALL-E 2.

Ця властивість була названа чутливістю до ресурсів.

У статті ідентифікуються три аномальні поведінки, властиві DALL-E 2: те, що слово або фраза можуть бути інтерпретовані та ефективно розділені на два різних об’єкти, що відображають об’єкт або концепцію для кожного в тій же сцені; те, що слово може бути інтерпретовано як модифікатор двох різних об’єктів (див. приклади ‘золотої риби’ та інші вище); і те, що слово може бути інтерпретовано одночасно як модифікатор і альтернативний об’єкт – як у запиту ‘тюлен відкриває лист’:

'Тюлен відкриває лист' – перше ілюстраційне зображення з статті, наступні три – ідентичні репродукції з DALL-E 2. Фотореалістичні приклади нижче мали додатковий текст 'фото, Canon50, 85mm, F5.6, нагороджене фото'.

‘Тюлен відкриває лист’ – перше ілюстраційне зображення з статті, наступні три – ідентичні репродукції з DALL-E 2. Фотореалістичні приклади нижче мали додатковий текст ‘фото, Canon50, 85mm, F5.6, нагороджене фото’.

Автори ідентифікують два режими відмови для моделей дифузії в цьому відношенні: те, що результати запитів користувачів із двозначними словами часто демонструють конкретизовані слова разом із деякою маніфестацією концепції; і витік концепції, де властивості одного об’єкта ‘витікають’ в інший відтворений об’єкт.

‘Взяті разом, явища, які ми досліджуємо, надають докази обмежень лінгвістичної здатності DALLE-2 і відкривають шляхи для майбутніх досліджень, які б виявили, чи походять ці обмеження від проблем з текстовим кодуванням, генеративною моделлю або обома. Більш загально, запропонований підхід можна розширити на інші сценарії, де процес декодування використовується для розкриття індуктивного упередження та недоліків моделей текст-образ.’

Використовуючи 17 слів, які змусять DALL-E 2 розділити вхідні дані на кілька виходів, автори спостерігали, що дублікування омонімів відбулося в понад 80% з 216 відтворених зображень.

Дослідники використовували контрольні пари стимулів, щоб дослідити ступінь, у якому конкретна та, можливо, надмірно специфікована мова необхідна для припинення цих дублікацій. Для тестів сутність-властивість було створено 10 таких пар, і автори зазначають, що стимульні запити викликають спільну властивість у 92,5% випадків, тоді як контрольний запит викликає її лише у 6,6% випадків.

‘[Щоб] продемонструвати, розгляньте зебру та вулицю, тут зебра – це сутність, але вона модифікує вулицю, і DALLE-2 постійно генерує переходи, можливо, через схожість смуг зебри з переходом. І у відповідності з нашим припущенням, контроль зебри та гравійної вулиці вказує на тип вулиці, який зазвичай не має переходів, і дійсно, всі наші контрольні зразки для цього запиту не містять переходу.’

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai