Andersonův úhel
Unikátní řešení DALL-E 2 pro dvojí významy

Kdokoli, kdo se učí italsky, se brzy naučí věnovat pozornost kontextu, když popisuje metlu, protože italské slovo pro tento všední domácí předmět má extrémně neslušivé druhý význam jako sloveso*. Ačkoli se brzy naučíme rozplést semantické mapování a (příslušné) použitelnost slov s více významy, tato dovednost není snadná přenést na hyperscale image synthesis systémy, jako jsou DALL-E 2 a Stable Diffusion, protože spoléhají na OpenAI’s Contrastive Language–Image Pre-training (CLIP) modul, který zachází s objekty a jejich vlastnostmi poněkud volněji (ale který získává stále více prostoru v latentním difuzním obrazovém a videovém syntetickém prostoru.
Studium tohoto nedostatku, nová výzkumná spolupráce z Bar-Ilan University a Allen Institute for Artificial Intelligence nabízí rozsáhlou studii o rozsahu, v jakém je DALL-E 2 náchylný k takovým semantickým chybám:

Dvojí významy rozdělené do více interpretací v DALL-E 2 – i když jakýkoli latentní difuzní systém může produkovat takové příklady. V pravém horním obrázku, odstranění ‘zlatého’ z podnětu změní druh ryby, zatímco v případě ‘zebrovského přechodu’ je nutné explicitně uvést povrch vozovky, aby se odstranila duplicitní asociace. Zdroj: https://export.arxiv.org/pdf/2210.10606
Autorům se podařilo zjistit, že tato tendence k dvojí interpretaci slov a frází se zdá být společná pro všechny CLIP-řízené difuzní modely, a že se zhoršuje, jak jsou modely trénovány na stále více dat. Článek uvádí, že ‘redukované’ verze text-to-image modelů, včetně DALL-E Mini (nyní Craiyon), produkují tyto kinds chyby mnohem méně často, a že Stable Diffusion také chybuje méně – ale pouze proto, že velmi často nepostupuje podle podnětu, což je jiný druh chyby.

Jednoduchý podnět ‘datum’ nutí DALL-E 2 vyvolat dvě z více významů slova, zatímco slovo ‘fan’ se také rozděluje do dvou svých semantických mapování, a ve třetím obrázku, fráze ‘kužel’ spolehlivě mění ne.specifikované jídlo v podnětu na zmrzlinu, která je spojena s ‘kuželem’.
Vysvětlují, jak provádíme efektivní lexikální separace, článek uvádí:
‘Zatímco symboly – stejně jako struktury vět – mohou být víceznačné, po konstrukci interpretace je tato víceznačnost již vyřešena. Například, zatímco symbol ‘netopýr’ v létajícím netopýru může být interpretován jako buď dřevěná tyč, nebo zvíře, naše možné interpretace věty jsou buď létající dřevěná tyč, nebo létající zvíře, ale nikdy obojí současně. Jakmile je slovo ‘netopýr’ použito v interpretaci k označení objektu (například dřevěné tyče), nemůže být znovu použito k označení jiného objektu (zvířete) ve stejné interpretaci.’
DALL-E 2, článek pozoruje, není omezen tímto způsobem:

‘Netopýr létá nad baseballovým stadionem’ – první obrázek je z článku, další tři získané z jednoduchého vložení stejného podnětu do DALL-E 2.
Tato vlastnost byla nazvána citlivost na zdroj.
Článek identifikuje tři abnormální chování DALL-E 2: že slovo nebo fráze může být interpretováno a efektivně rozděleno do dvou různých entit, vykreslující objekt nebo koncept pro každou v stejné scéně; že slovo může být interpretováno jako modifikátor dvou různých entit (viz ‘zlatou rybku’ a další příklady výše); a že slovo může být interpretováno současně jako modifikátor a alternativní entita – ilustrované podnětem ‘tuleň otevírá dopis’:

‘Tuleň otevírá dopis’ – první ilustrace je z článku, následující tři, identické reprodukce z DALL-E 2. Fotorealistické příklady níže měly dodatečný text ‘foto, Canon50, 85mm, F5.6, oceněná fotografie’.
Autorům se podařilo identifikovat dva typy selhání difuzních modelů v tomto ohledu: že výsledky uživatelských podnětů se smyslem víceznačných slov budou často vykazovat konkrétní slovo spolu s nějakou manifestací konceptu; a únik konceptu, kde vlastnosti jednoho objektu ‘unikají’ do jiného vykresleného objektu.
‘Vzato dohromady, jevy, které zkoumáme, poskytují důkazy o omezeních lingvistické schopnosti DALLE-2 a otevírají cesty pro budoucí výzkum, který by odhalil, zda tyto omezení vyplývají z problémů s textovým kódováním, generativním modelem nebo obojím. Obecněji, navrhovaný přístup lze rozšířit na další scénáře, kde se dekódovací proces používá k odhalení induktivní předpojatosti a nedostatků text-to-image modelů.’
Používajíce 17 slov, která způsobí, že DALL-E 2 rozdělí vstup na více výstupů, autoři pozorovali, že homonymní duplikace nastala ve více než 80 % z 216 vykreslených obrázků.
Výzkumníci použili stimulační-kontrolní páry k prozkoumání rozsahu, v jakém je specifická a zřejmě nadměrně specifikovaná jazyková forma nutná k zastavení těchto duplikací. Pro entity-to-vlastnostní testy, 10 takových párů bylo vytvořeno, a autoři uvádějí, že stimulační podněty vyvolávají sdílenou vlastnost v 92,5 % případů, zatímco kontrolní podnět vyvolává ji pouze v 6,6 % případů.
‘[Chcete-li] prokázat, zvažte zebry a ulici, zde zebra je entitou, ale modifikuje ulici, a DALLE-2 konstantně generuje přechody, možná kvůli podobnosti zebrových pruhů s přechodem. A v souladu s naší hypotézou, kontrolní zebra a štěrková ulice specifikuje typ ulice, která obvykle nemá přechody, a skutečně, všechny naše kontrolní vzorky pro tento podnět neobsahují přechod.’













