Погляд Anderson
Унікальне рішення DALL-E 2 для подвійних значень

Хтось, хто вивчив італійську мову, вчиться рано звертати увагу на контекст при описі міта, оскільки італійське слово для цього буденного домашнього предмета має дуже нецільове друге значення як дієслово*. Хоча ми вчимося рано розрізняти семантичне відображення та застосування слів з кількома значеннями, це не є навиком, який легко передати гіпермасштабним системам синтезу зображень, таким як DALL-E 2 та Stable Diffusion, оскільки вони покладаються на модуль контрастного мовно-образового попереднього навчання OpenAI (CLIP), який сприймає об’єкти та їх властивості досить вільно (хоча він здобуває дедалі більше території у сфері синтезу зображень та відео з використанням.latent дифузії).
Досліджуючи цю недолік, нове дослідження від Університету Бар-Ілана та Інституту штучного інтелекту Аллена пропонує широке дослідження ступеня, у якому DALL-E 2 схильний до таких семантичних помилок:

Подвійні значення розділені на кілька інтерпретацій у DALL-E 2 – хоча будь-яка система дифузії може створювати такі приклади. У верхньому правому зображенні видалення ‘золотого’ з запиту змінює вид риби, тоді як у випадку ‘зебрового переходу’ необхідно явно вказати поверхню дороги, щоб видалити дублювання асоціації. Джерело: https://export.arxiv.org/pdf/2210.10606
Автори виявили, що ця схильність до подвійної інтерпретації слів і фраз здається не тільки спільною для всіх моделей дифузії, керованих CLIP, але й погіршується при навчанні моделей на все більших обсягах даних. У статті зазначається, що ‘зменшені’ версії моделей текст-образ, включаючи DALL-E Mini (тепер Craiyon), видають такі помилки значно рідше, і що Stable Diffusion також помиляється менше – хоча лише тому, що часто вона зовсім не слідує запиту, що є іншим видом помилки.

Простий запит ‘дата’ змушує DALL-E 2 викликати два з кількох значень слова, тоді як слово ‘вентилятор’ також розділяється на два своїх семантичних відображення, а в третьому зображенні фраза ‘конус’ надійно перетворює невизначену їжу в запиту на морозиво, яке асоціюється з ‘конусом’.
Роз’яснюючи, як ми здійснюємо ефективне лексичне розділення, у статті зазначається:
‘Хоча символи – а також структури речень – можуть бути двозначними, після того, як інтерпретація створена, ця двозначність вже вирішена. Наприклад, символ “бейсбольна бита” у літаючій біті може бути інтерпретований як дерев’яна палиця або тварина, наші можливі інтерпретації речення – або літаюча дерев’яна палиця, або літаюча тварина, але ніколи не обидва одночасно. Як тільки слово “бита” використовується в інтерпретації для позначення об’єкта (наприклад, дерев’яної палиці), воно не може бути повторно використане для позначення іншого об’єкта (тварини) в тій же інтерпретації.’
DALL-E 2, як зазначається в статті, не обмежений цим чином:

‘Літаюча бита над стадіоном бейсболу’ – перше зображення з статті, інші три отримані просто введенням того ж запиту в DALL-E 2.
Ця властивість була названа чутливістю до ресурсів.
У статті ідентифікуються три аномальні поведінки, властиві DALL-E 2: те, що слово або фраза можуть бути інтерпретовані та ефективно розділені на два різних об’єкти, що відображають об’єкт або концепцію для кожного в тій же сцені; те, що слово може бути інтерпретовано як модифікатор двох різних об’єктів (див. приклади ‘золотої риби’ та інші вище); і те, що слово може бути інтерпретовано одночасно як модифікатор і альтернативний об’єкт – як у запиту ‘тюлен відкриває лист’:

‘Тюлен відкриває лист’ – перше ілюстраційне зображення з статті, наступні три – ідентичні репродукції з DALL-E 2. Фотореалістичні приклади нижче мали додатковий текст ‘фото, Canon50, 85mm, F5.6, нагороджене фото’.
Автори ідентифікують два режими відмови для моделей дифузії в цьому відношенні: те, що результати запитів користувачів із двозначними словами часто демонструють конкретизовані слова разом із деякою маніфестацією концепції; і витік концепції, де властивості одного об’єкта ‘витікають’ в інший відтворений об’єкт.
‘Взяті разом, явища, які ми досліджуємо, надають докази обмежень лінгвістичної здатності DALLE-2 і відкривають шляхи для майбутніх досліджень, які б виявили, чи походять ці обмеження від проблем з текстовим кодуванням, генеративною моделлю або обома. Більш загально, запропонований підхід можна розширити на інші сценарії, де процес декодування використовується для розкриття індуктивного упередження та недоліків моделей текст-образ.’
Використовуючи 17 слів, які змусять DALL-E 2 розділити вхідні дані на кілька виходів, автори спостерігали, що дублікування омонімів відбулося в понад 80% з 216 відтворених зображень.
Дослідники використовували контрольні пари стимулів, щоб дослідити ступінь, у якому конкретна та, можливо, надмірно специфікована мова необхідна для припинення цих дублікацій. Для тестів сутність-властивість було створено 10 таких пар, і автори зазначають, що стимульні запити викликають спільну властивість у 92,5% випадків, тоді як контрольний запит викликає її лише у 6,6% випадків.
‘[Щоб] продемонструвати, розгляньте зебру та вулицю, тут зебра – це сутність, але вона модифікує вулицю, і DALLE-2 постійно генерує переходи, можливо, через схожість смуг зебри з переходом. І у відповідності з нашим припущенням, контроль зебри та гравійної вулиці вказує на тип вулиці, який зазвичай не має переходів, і дійсно, всі наші контрольні зразки для цього запиту не містять переходу.’













