Kąt Andersona

Czy DALL-E 2 to tylko “klejenie rzeczy” bez zrozumienia ich relacji?

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowszy artykuł badawczy z Uniwersytetu Harvarda sugeruje, że framework generowania obrazów na podstawie tekstu DALL-E 2 ma znaczne trudności w odtwarzaniu nawet podstawowych relacji między elementami, które komponuje w syntetyzowanych zdjęciach, pomimo olśniewającej złożoności większości jego wyników.

Badacze przeprowadzili badanie z udziałem 169 uczestników, którzy zostali zaprezentowani obrazami DALL-E 2 na podstawie najbardziej podstawowych zasad semantyki relacji, wraz z tekstowymi podpowiedziami, które je stworzyły. Zapytani, czy podpowiedzi i obrazy są ze sobą powiązane, mniej niż 22% obrazów zostało uznanych za istotne w stosunku do podpowiedzi, jeśli chodzi o bardzo proste relacje, które DALL-E 2 miał zamiar uwidocznić.

Zrzut ekranu z przeprowadzonych badań. Uczestnicy zostali poproszeni o wybranie wszystkich obrazów, które odpowiadają podpowiedzi. Pomimo ostrzeżenia na dole interfejsu, we wszystkich przypadkach obrazy, nieznane uczestnikom, zostały wygenerowane z wyświetlonej podpowiedzi.

Zrzut ekranu z przeprowadzonych badań. Uczestnicy zostali poproszeni o wybranie wszystkich obrazów, które odpowiadają podpowiedzi. Source: https://arxiv.org/pdf/2208.00005.pdf

Wyniki sugerują również, że zdolność DALL-E do łączenia różnych elementów może się zmniejszyć, gdy te elementy stają się mniej prawdopodobne w danych szkoleniowych, które napędzają system.

Na przykład, obrazy dla podpowiedzi “dziecko dotyka miski” uzyskały 87% współczynnika zgodności (tj. uczestnicy kliknęli na większość obrazów jako istotnych w stosunku do podpowiedzi), podczas gdy podobnie fotorealistyczne obrazy “małpy dotykającej iguany” osiągnęły tylko 11% współczynnika zgodności:

DALL-E ma trudności z przedstawieniem nieprawdopodobnego zdarzenia 'małpa dotyka iguany', prawdopodobnie dlatego, że jest to rzadkie, a nawet nieistniejące w zbiorze danych szkoleniowych.

DALL-E ma trudności z przedstawieniem nieprawdopodobnego zdarzenia ‘małpa dotyka iguany’, prawdopodobnie dlatego, że jest to rzadkie, a nawet nieistniejące w zbiorze danych szkoleniowych.

W drugim przykładzie DALL-E 2 często myli skalę i nawet gatunek, prawdopodobnie z powodu braku rzeczywistych obrazów, które przedstawiają to zdarzenie. W przeciwieństwie do tego, można się spodziewać, że będzie wiele obrazów szkoleniowych związanych z dziećmi i jedzeniem, i że ta poddomena/klasa jest dobrze rozwinięta.

Trudności DALL-E w łączeniu wyraźnie kontrastowych elementów obrazu sugerują, że publiczność jest obecnie tak oczarowana fotorealistycznymi i szeroko interpretatywnymi możliwościami systemu, że nie rozwinęła jeszcze krytycznego oka dla przypadków, w których system skutecznie “przykleja” jeden element na inny, jak w tych przykładach z oficjalnej strony DALL-E 2:

Synteza cut-and-paste, z oficjalnych przykładów DALL-E 2. Source: https://openai.com/dall-e-2/

Synteza cut-and-paste, z oficjalnych przykładów DALL-E 2. Source: https://openai.com/dall-e-2/

Nowy artykuł stwierdza*:

‘Zrozumienie relacji jest podstawowym składnikiem ludzkiej inteligencji, który manifestuje się wcześnie w rozwoju, i jest obliczany szybko i automatycznie w percepcji.

‘Trudności DALL-E 2 z nawet podstawowymi relacjami przestrzennymi (takimi jak in, on, under) sugerują, że nie nauczył się jeszcze tego rodzaju reprezentacji, które pozwalają ludziom na tak elastyczne i solidne strukturyzowanie świata.

‘Bezpośrednia interpretacja tej trudności jest taka, że systemy takie jak DALL-E 2 nie mają jeszcze składni relacyjnej.’

Autorzy sugerują, że systemy generowania obrazów na podstawie tekstu, takie jak seria DALL-E, mogą skorzystać z algorytmów powszechnych w robotyce, które modelują tożsamości i relacje jednocześnie, ze względu na potrzebę interakcji agenta z środowiskiem, a nie tylko tworzenia mieszanki różnych elementów.

Jeden z takich podejść, zatytułowany CLIPort, wykorzystuje ten sam mechanizm CLIP, który służy jako element oceny jakości w DALL-E 2:

CLIPort, współpraca z 2021 roku między Uniwersytetem Waszyngtonu a NVIDIA, wykorzystuje CLIP w kontekście tak praktycznym, że systemy szkolone na nim muszą koniecznie rozwinąć zrozumienie relacji fizycznych, co jest motywatorem, który jest nieobecny w DALL-E 2 i podobnych ramach syntetyzowania obrazów 'fantastycznych'.

CLIPort, współpraca z 2021 roku między Uniwersytetem Waszyngtonu a NVIDIA, wykorzystuje CLIP w kontekście tak praktycznym, że systemy szkolone na nim muszą koniecznie rozwinąć zrozumienie relacji fizycznych, co jest motywatorem, który jest nieobecny w DALL-E 2 i podobnych ramach syntetyzowania obrazów ‘fantastycznych’. Source: https://arxiv.org/pdf/2109.12098.pdf

Autorzy sugerują również, że “inna prawdopodobna poprawa” mogłaby polegać na tym, aby architektura systemów generowania obrazów, takich jak DALL-E, uwzględniała efekty mnożenia w jednej warstwie obliczeń, co pozwoliłoby na obliczanie relacji w sposób inspirowany zdolnościami przetwarzania informacji biologicznymi systemami.

Nowy artykuł jest zatytułowany Testowanie zrozumienia relacji w generowaniu obrazów na podstawie tekstu i pochodzi od Colina Conwella i Tomera D. Ullmana z Wydziału Psychologii Uniwersytetu Harvarda.

Poza wczesną krytyką

Komentując “sztuczkę” za realizmem i integralnością wyników DALL-E 2, autorzy zwracają uwagę na wcześniejsze prace, które wykazały braki w systemach generowania obrazów w stylu DALL-E.

We wrześniu tego roku Uniwersytet Kalifornijski w Berkeley zauważył, że DALL-E ma trudności z obsługą odbić i cieni; w tym samym miesiącu studium z Korei badało “unikalność” i oryginalność wyników DALL-E 2 z krytycznym okiem; wstępna analiza obrazów DALL-E 2 krótko po uruchomieniu, z NYU i Uniwersytetu Teksasu, wykazała różne problemy z kompozycją i innymi istotnymi czynnikami w obrazach DALL-E 2; i w zeszłym miesiącu wspólna praca między Uniwersytetem Illinois i MIT zaproponowała sugestie dotyczące poprawy architektury takich systemów w zakresie kompozycji.

Badacze zwracają również uwagę, że luminarze DALL-E, tacy jak Aditya Ramesh, przyznali problemy systemu z wiązaniem, względną wielkością, tekstem i innymi wyzwaniami.

Twórcy systemu Imagen, rywala DALL-E, zaproponowali DrawBench, nowy system porównawczy, który mierzy dokładność obrazów w różnych ramach z różnymi metrykami.

Zamiast tego autorzy nowego artykułu sugerują, że lepszy wynik można osiągnąć, stawiając ludzkie szacunki – a nie wewnętrzne, algorytmiczne metryki – przeciwko wynikowym obrazom, aby ustalić, gdzie leżą słabości i co można zrobić, aby je złagodzić.

Badanie

W tym celu nowy projekt opiera się na zasadach psychologicznych i stara się wycofać z obecnej fali zainteresowania inżynierią podpowiedzi (która jest w istocie ustępstwem wobec ograniczeń DALL-E 2 lub podobnych systemów), aby zbadać i ewentualnie rozwiązać ograniczenia, które sprawiają, że takie “rozwiązania” są konieczne.

Artykuł stwierdza:

‘Praca ta koncentruje się na zestawie 15 podstawowych relacji wcześniej opisanych, zbadanych lub zaproponowanych w literaturze kognitywnej, rozwojowej lub lingwistycznej. Zestaw zawiera zarówno ugruntowane relacje przestrzenne (np. ’X na Y’), jak i bardziej abstrakcyjne relacje agenty (np. ’X pomaga Y’).

‘Podpowiedzi są zamierzone proste, bez złożoności atrybutów lub elaboracji. To znaczy, zamiast podpowiedzi takiej jak „osioł i ośmiornica grają w grę. Osioł trzyma lasso na jednym końcu, ośmiornica trzyma drugi koniec. Osioł trzyma lasso w pysku. Kot skacze przez lasso”, używamy „pudełko na nożu”.

‘Prostota wciąż ujmuje szeroki zakres relacji z różnych subdоменów psychologii ludzkiej i sprawia, że potencjalne awarie modelu są bardziej wyraźne i szczegółowe.’

Do swojego badania autorzy zrekrutowali 169 uczestników z Prolific, wszystkich z USA, ze średnim wiekiem 33 lat, i 59% kobiet.

Uczestnicy zostali zaprezentowani 18 obrazami zorganizowanymi w siatkę 3×6 z podpowiedzią na górze i ostrzeżeniem na dole, które stwierdzało, że wszystkie, niektóre lub żadne z obrazów mogły być wygenerowane z wyświetlonej podpowiedzi, i zostali poproszeni o wybranie obrazów, które uważali za powiązane w ten sposób.

Obrazy przedstawione osobom były oparte na literaturze lingwistycznej, rozwojowej i kognitywnej, składającej się z zestawu ośmiu relacji fizycznych i siedmiu relacji “agenty” (co zostanie wyjaśnione za chwilę).

Relacje fizyczne
w, na, pod, nakrywający, w pobliżu, zakrywany przez, wiszący nad, oraz przywiązany do.

Relacje agenty
popychanie, ciągnięcie, dotykanie, uderzanie, kopanie, pomaganie, i hamowanie.

Wszystkie te relacje zostały pobrane z wcześniej wymienionych dziedzin nauki spoza informatyki.

Wyprowadzono w ten sposób dwanaście jednostek do użycia w podpowiedziach, z sześcioma obiektami i sześcioma agentami:

Obiekty
pudełko, cylinder, koc, miska, filiżanka, oraz noż.

Agenci
mężczyzna, kobieta, dziecko, robot, małpa, oraz iguana.

(Badacze przyznają, że włączenie iguany, nie jest głównym przedmiotem suchych badań socjologicznych lub psychologicznych, było “przezornością”)

Dla każdej relacji utworzono pięć różnych podpowiedzi, losowo wybierając dwie jednostki pięć razy, co dało w sumie 75 podpowiedzi, z których każda została poddana DALL-E 2, a dla każdej z nich pierwotne 18 dostarczonych obrazów zostało użytych, bez zmian lub ponownych prób.

Wyniki

Artykuł stwierdza*:

‘Uczestnicy średnio zgłaszali niski poziom zgodności między obrazami DALL-E 2 a podpowiedziami, które je wygenerowały, ze średnią 22,2% [18,3, 26,6] w 75 różnych podpowiedziach.

‘Podpowiedzi agenty, ze średnią 28,4% [22,8, 34,2] w 35 podpowiedziach, wygenerowały wyższy poziom zgodności niż podpowiedzi fizyczne, ze średnią 16,9% [11,9, 23,0] w 40 podpowiedziach.’

Wyniki badania. Punkty w kolorze czarnym oznaczają wszystkie podpowiedzi, z każdym punktem reprezentującym pojedynczą podpowiedź, a kolor rozdziela podpowiedzi agenty i fizyczne (tj. obiekt).

Wyniki badania. Punkty w kolorze czarnym oznaczają wszystkie podpowiedzi, z każdym punktem reprezentującym pojedynczą podpowiedź, a kolor rozdziela podpowiedzi agenty i fizyczne (tj. obiekt).

Aby porównać różnicę między ludzką a algorytmiczną percepcją obrazów, badacze przepuścili swoje obrazy przez otwarty framework CLIP ViT-L/14 OpenAI. Średnia wyników wykazała “umiarkowaną zależność” między dwoma zestawami wyników, co jest może zaskakujące, biorąc pod uwagę, jak bardzo CLIP pomaga w generowaniu obrazów.

Wyniki porównania CLIP (ViT-L/14) z odpowiedziami ludzkimi.

Wyniki porównania CLIP (ViT-L/14) z odpowiedziami ludzkimi.

Badacze sugerują, że inne mechanizmy w architekturze, być może w połączeniu z przypadkową dominacją (lub brakiem) danych w zbiorze szkoleniowym, mogą odpowiadać za sposób, w jaki CLIP może rozpoznać ograniczenia DALL-E, bez możliwości zrobienia wiele w tej sprawie.

Autorzy kończą, że DALL-E 2 ma tylko nominalną zdolność do odtwarzania obrazów, które zawierają zrozumienie relacji, podstawowy aspekt ludzkiej inteligencji, który rozwija się u nas bardzo wcześnie.

‘Pomysł, że systemy takie jak DALL-E 2 nie mają składni, może być zaskakujący dla kogoś, kto widział zdumiewająco rozsądne odpowiedzi DALL-E 2 na podpowiedzi takie jak „kreskówka niemowlęcia daikonu w spódnicy idącego poodle”. Podpowiedzi takie często generują rozsądną aproksymację pojęcia kompozycyjnego, z wszystkimi częściami podpowiedzi obecnymi i w odpowiednich miejscach.

‘Składnia jednak nie jest tylko umiejętnością “klejenia” rzeczy – nawet tych, które nie zostały wcześniej obserwowane razem. Składnia wymaga zrozumienia reguł, które łączą rzeczy. Relacje są takimi regułami.’

Człowiek kąsa T-Rexa

Opinia Jak OpenAI otwiera się na większą liczbę użytkowników po niedawnym uruchomieniu beta wersji DALL-E 2, i od teraz trzeba płacić za większość generacji, ograniczenia DALL-E 2 w zrozumieniu relacji mogą stać się bardziej widoczne, ponieważ każda “nieudana” próba ma wagę finansową, a zwroty są niedostępne.

Ci, którzy otrzymali zaproszenie nieco wcześniej, mieli czas (i, do niedawna, więcej swobody, aby bawić się systemem), aby zaobserwować niektóre z “błędów relacyjnych”, które DALL-E 2 może wygenerować.

Na przykład, dla fanów Parku Jurajskiego, jest bardzo trudno uzyskać, aby dinozaur gonił osobę w DALL-E 2, nawet jeśli pojęcie “pościgu” nie wydaje się być w systemie cenzury DALL-E 2, i nawet jeśli długa historia filmów z dinozaurami powinna dostarczyć wystarczających przykładów szkoleniowych (przynajmniej w postaci zwiastunów i zdjęć promocyjnych) dla tego niemożliwego spotkania gatunków.

Typowa odpowiedź DALL-E 2 na podpowiedź 'Kolorowe zdjęcie T-Rexa goniącego mężczyznę po drodze'.

Typowa odpowiedź DALL-E 2 na podpowiedź ‘Kolorowe zdjęcie T-Rexa goniącego mężczyznę po drodze’. Source: DALL-E 2

Stwierdziłem, że obrazy powyżej są typowe dla wariacji na temat projektu podpowiedzi ‘[dinozaur] goni [osobę] ‘, i że żadne rozszerzenie podpowiedzi nie może sprawić, aby T-Rex faktycznie zastosował się do polecenia. W pierwszym i drugim zdjęciu mężczyzna (mniej więcej) goni T-Rexa; w trzecim, podchodzi do niego z lekceważeniem bezpieczeństwa; i w ostatnim obrazie wydaje się biegać równolegle do wielkiego zwierzęcia. Przez około 10-15 prób tego motywu stwierdziłem, że dinozaur jest podobnie “rozpraszony”.

Może to być tak, że jedynymi danymi szkoleniowymi, do których miał dostęp DALL-E 2, były te w rodzaju ‘człowiek walczy z dinozaurem’, z zdjęć promocyjnych starszych filmów, takich jak Jeden milion lat przed naszą erą (1966), i że słynny lot Jeffa Goldbluma przed królem drapieżników jest po prostu wyjątkiem w tym małym fragmencie danych.

 

* Moja konwersja cytatów autorów do linków.

Pierwotnie opublikowano 4 sierpnia 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai