Kąt Andersona

Głębokie modele uczące mogą mieć trudności z rozpoznawaniem obrazów wygenerowanych przez AI

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Odkrycia z nowego artykułu wskazują, że najnowocześniejsza sztuczna inteligencja jest znacznie mniej zdolna do rozpoznawania i interpretowania obrazów wygenerowanych przez AI niż ludzie, co może być powodem do niepokoju w nadchodzącym klimacie, w którym modele uczenia maszynowego są coraz częściej szkolone na danych syntetycznych, a nie będzie wiadomo, czy dane są “rzeczywiste” czy nie.

Widzimy tu model predykcyjny resnext101_32x8d_wsl, który ma trudności w kategorii 'bagel'. W testach uznano, że wystąpił błąd rozpoznawania, jeśli słowo kluczowe (w tym przypadku 'bagel') nie było wśród pięciu najlepszych wyników predykcyjnych.

Widzimy tu model predykcyjny resnext101_32x8d_wsl, który ma trudności w kategorii ‘bagel’. W testach uznano, że wystąpił błąd rozpoznawania, jeśli słowo kluczowe (w tym przypadku ‘bagel’) nie było wśród pięciu najlepszych wyników predykcyjnych. Źródło: https://arxiv.org/pdf/2208.10760.pdf

Nowe badania przetestowały dwa rodzaje ram rozpoznawania wizualnego: rozpoznawanie obiektów i odpowiedzi na pytania wizualne (VQA).

Po lewej stronie widzimy sukcesy i porażki systemu rozpoznawania obiektów; po prawej stronie widzimy zadania VQA, które są zaprojektowane do badania zrozumienia AI scen i obrazów w bardziej eksploracyjny i znaczący sposób.

Po lewej stronie widzimy sukcesy i porażki systemu rozpoznawania obiektów; po prawej stronie widzimy zadania VQA, które są zaprojektowane do badania zrozumienia AI scen i obrazów w bardziej eksploracyjny i znaczący sposób. Źródła: https://arxiv.org/pdf/2105.05312.pdf i https://arxiv.org/pdf/1505.00468.pdf

Z dziesięciu modeli, które zostały przetestowane na danych wygenerowanych przez ramy syntezowania obrazów DALL-E 2 i Midjourney, najlepszy model osiągnął tylko 60% i 80% dokładności wśród pięciu najlepszych wyników predykcyjnych, podczas gdy ImageNet, który został wyszkolony na danych nie-syntetycznych, może osiągnąć odpowiednio 91% i 99% w tych samych kategoriach, a wyniki ludzi są zwykle znacznie wyższe.

Adresując problemy związane z przesunięciem dystrybucji (znany również jako “dryf modelu”, gdzie modele predykcyjne doświadczają zmniejszonej zdolności predykcyjnej, gdy są przenoszone z danych szkoleniowych do “rzeczywistych” danych), artykuł stwierdza:

Ludzie są w stanie rozpoznać obrazy wygenerowane i odpowiedzieć na pytania o nie łatwo. Uznajemy, że a) głębokie modele mają trudności z zrozumieniem zawartości wygenerowanej, i mogą być lepsze po dalszym szkoleniu, i b) istnieje duże przesunięcie dystrybucji między obrazami wygenerowanymi a rzeczywistymi fotografiami. Przesunięcie dystrybucji wydaje się być zależne od kategorii.

Biorąc pod uwagę objętość syntetycznych obrazów, które już zalewają internet po ubiegłotygodniowym otwarciu potężnego modelu syntezowania dyfuzyjnego, pojawia się możliwość, że gdy “fałszywe” obrazy zaczną napływać do standardowych zbiorów danych, takich jak Common Crawl, różnice w dokładności mogą być znacznie wpływane przez “nierzeczywiste” obrazy.

Chociaż dane syntetyczne zostały ogłoszone jako potencjalny zbawca sektora badań wizualnych opartych na komputerze, który często cierpi na brak zasobów i budżetów na kurację danych, nowy napływ obrazów Stable Diffusion (wraz z ogólnym wzrostem syntetycznych obrazów od czasu pojawienia się i komercjalizacji DALL-E 2) jest mało prawdopodobne, aby wszystkie obrazy zostały wyposażone w etykiety, adnotacje i hashtagi, które je odróżniają jako “fałszywe” w momencie, gdy systemy wizualne pobiorą je z internetu.

Szybkość rozwoju w ramach syntezowania obrazów otwartego źródła znacznie wyprzedziła naszą zdolność do klasyfikacji obrazów z tych systemów, prowadząc do roszącego zainteresowania systemami wykrywania “fałszywych” obrazów, podobnymi do systemów wykrywania deepfake’ów, ale zadanymi z ocenianiem całych obrazów, a nie części twarzy.

Artykuł nowy nosi tytuł Jak dobrze są głębokie modele w zrozumieniu obrazów wygenerowanych?, i pochodzi od Ali Borji z sanfranciskiej firmy machine learningowej Quintic AI.

Dane

Badanie poprzedza wydanie Stable Diffusion, a eksperymenty wykorzystują dane wygenerowane przez DALL-E 2 i Midjourney w 17 kategoriach, w tym słoń, grzyb, pizza, pretzel, ciągnik i królik.

Przykłady obrazów, z których testowane systemy rozpoznawania i VQA były wyzwane do identyfikacji najważniejszego pojęcia kluczowego.

Przykłady obrazów, z których testowane systemy rozpoznawania i VQA były wyzwane do identyfikacji najważniejszego pojęcia kluczowego.

Obrazy zostały uzyskane za pomocą wyszukiwania w sieci i przez Twitter, i, zgodnie z polityką DALL-E 2 (przynajmniej w tym czasie), nie zawierały żadnych obrazów z ludzkimi twarzami. Wybrane zostały tylko obrazy o dobrej jakości, rozpoznawalne przez ludzi.

Dwa zestawy obrazów zostały wybrane, jeden dla rozpoznawania obiektów i jeden dla zadań VQA.

Liczba obrazów w każdej kategorii testowej dla rozpoznawania obiektów.

Liczba obrazów w każdej kategorii testowej dla rozpoznawania obiektów.

Testowanie rozpoznawania obiektów

Dla testów rozpoznawania obiektów, dziesięć modeli, wszystkie wyszkolone na ImageNet, zostało przetestowanych: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit, i ResNext_WSL.

Niektóre klasy w testowanych systemach były bardziej szczegółowe niż inne, co wymagało zastosowania średnich podejść. Na przykład, ImageNet zawiera trzy klasy związane z “zegarami”, i było konieczne określenie pewnego rodzaju arbitralnej metryki, gdzie uwzględnienie dowolnego “zegara” w pięciu najlepszych wynikach predykcyjnych dla dowolnego obrazu zostało uznane za sukces w tym przypadku.

Wyniki modelu na 17 kategoriach.

Wyniki modelu na 17 kategoriach.

Najlepszy model w tej rundzie był resnext101_32x8d_ws, osiągając prawie 60% dla top-1 (tj. razy, kiedy jego preferowana predykcja z pięciu possibility była poprawnym pojęciem ucieleśnionym w obrazie), i 80% dla top-five (tj. pożądane pojęcie było przynajmniej wymienione gdzieś w pięciu possibility modelu o obrazie).

Autor sugeruje, że dobre wyniki tego modelu są wynikiem faktu, że został on wyszkolony do słabo nadzorowanej predykcji hashtagów na platformach mediów społecznościowych. Jednak te wiodące wyniki, autor zauważa, są znacznie poniżej tego, co ImageNet jest w stanie osiągnąć na danych rzeczywistych, tj. 91% i 99%. Sugeruje, że jest to wynik dużej dysproporcji między dystrybucją obrazów ImageNet (które również są pobierane z sieci) a obrazami wygenerowanymi.

Pięć najtrudniejszych kategorii dla systemu, w kolejności trudności, to latawiec, żółw, wiewiórka, okulary przeciwsłoneczne i kask. Artykuł zauważa, że kategoria latawiec jest często mylona z balonem, spadochronem i parasolem, chociaż te rozróżnienia są trywialnie łatwe do odróżnienia przez ludzi.

Pewne kategorie, w tym latawiec i żółw, spowodowały powszechną porażkę we wszystkich modelach, podczas gdy inne (np. pretzel i ciągnik) dały prawie powszechny sukces we wszystkich testowanych modelach.

Kategorie polaryzujące: niektóre z wybranych kategorii celowych albo całkowicie zmyliły wszystkie modele, albo były dość łatwe do identyfikacji dla wszystkich modeli.

Kategorie polaryzujące: niektóre z wybranych kategorii celowych albo całkowicie zmyliły wszystkie modele, albo były dość łatwe do identyfikacji dla wszystkich modeli.

Autorzy postulują, że te wyniki wskazują, że wszystkie modele rozpoznawania obiektów mogą mieć podobne słabości i siły.

Testowanie odpowiedzi na pytania wizualne

Następnie autor przetestował modele VQA na otwartych i swobodnych pytaniach VQA, z binarnymi pytaniami (tj. pytaniami, na które odpowiedź może być tylko “tak” lub “nie”). Artykuł zauważa, że ostatnie modele VQA są w stanie osiągnąć 95% dokładności na zbiorze danych VQA-v2.

Dla tego etapu testowania, autor wybrał 50 obrazów i sformułował 241 pytań wokół nich, 132 z nich miało pozytywne odpowiedzi, a 109 negatywne. Średnia długość pytania wynosiła 5,12 słowa.

W tej rundzie użyto modelu OFA, ramy agnostycznej i modalnej do testowania kompleksowości zadań, i był to ostatni lider w zbiorze danych VQA-v2 test-std. Model OFA osiągnął 77,27% dokładności na obrazach wygenerowanych, w porównaniu z własnym wynikiem 94,7% w zbiorze danych VQA-v2 test-std.

Przykładowe pytania i wyniki z sekcji VQA testów. 'GT' to 'Prawdziwa odpowiedź', tj. poprawna odpowiedź.

Przykładowe pytania i wyniki z sekcji VQA testów. ‘GT” to ‘Prawdziwa odpowiedź’, tj. poprawna odpowiedź.

Autor artykułu sugeruje, że część powodu może być taka, że obrazy wygenerowane zawierają pojęcia semantyczne, których brakuje w zbiorze danych VQA-v2, i że pytania napisane dla testów VQA mogą być trudniejsze niż standardowe pytania VQA-v2, chociaż uważa, że pierwszy powód jest bardziej prawdopodobny.

LSD w strumieniu danych?

Opinia

Nowa proliferacja obrazów wygenerowanych przez AI, które mogą przedstawiać natychmiastowe połączenia i abstrakcje podstawowych pojęć, które nie istnieją w naturze, i które byłyby zbyt czasochłonne do wytworzenia za pomocą konwencjonalnych metod, może stanowić szczególny problem dla słabo nadzorowanych systemów gromadzenia danych, które mogą nie być w stanie awaryjnie – głównie dlatego, że nie zostały one zaprojektowane do obsługi dużej ilości nienadzorowanych danych syntetycznych.

W takich przypadkach może istnieć ryzyko, że te systemy będą kierować pewnym procentem “dziwnych” syntetycznych obrazów do niewłaściwych kategorii, ponieważ obrazy te zawierają wyraźne obiekty, które nie naprawdę należą razem.

'Astronauta jeżdżący na koniu' stał się być może najbardziej emblematicznym wizualnym dla nowej generacji systemów syntezowania obrazów - ale te 'nierzeczywiste' relacje mogą wejść do systemów wykrywania, chyba że zostaną podjęte środki ostrożności.

‘Astronauta jeżdżący na koniu’ stał się być może najbardziej emblematicznym wizualnym dla nowej generacji systemów syntezowania obrazów – ale te ‘nierzeczywiste’ relacje mogą wejść do systemów wykrywania, chyba że zostaną podjęte środki ostrożności. Źródło: https://twitter.com/openai/status/1511714545529614338?lang=en

Chyba że można to zapobiec na etapie wstępnym przed szkoleniem, takie automatyczne potoki mogą prowadzić do nieprawdopodobnych lub nawet groteskowych skojarzeń, które są szkolone w systemach uczenia maszynowego, co może pogorszyć ich skuteczność i ryzykować przeniesienie skojarzeń na niższy poziom systemów i podkategorii.

Alternatywnie, rozłączne obrazy syntetyczne mogą mieć “chłodzący” wpływ na dokładność późniejszych systemów, w przypadku gdy nowe lub zmodyfikowane architektury pojawią się, które będą próbowały uwzględnić ad hoc syntetyczne obrazy, i które będą rzucać zbyt szeroką sieć.

W każdym przypadku, obrazy syntetyczne w erze Stable Diffusion mogą okazać się problemem dla sektora badań wizualnych, których wysiłki umożliwiły te dziwne twory i możliwości – nie tylko dlatego, że zagrażają nadziei, że gromadzenie i kuracja danych może być ostatecznie bardziej zautomatyzowane, niż jest to obecnie, i mniej czasochłonne.

 

Pierwotnie opublikowane 1 września 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai