Kąt Andersona

Jak wiedzieć, czy systemy syntezy obrazu produkują naprawdę oryginalny materiał

mm
Dodaj Unite.AI do preferowanych źródeł w Google
'Teddy bears working on new AI research underwater with 1990s technology' – Source: https://www.creativeboom.com/features/meet-dall-e/

Nowe badanie z Korei Południowej zaproponowało metodę określenia, czy systemy syntezy obrazu produkują naprawdę nowe obrazy, czy tylko “mniejsze” warianty danych szkoleniowych, co mogłoby pokonać cel takich architektur (jak produkcja nowych i oryginalnych obrazów).

Często, jak sugeruje artykuł, jest to prawda, ponieważ istniejące metryki, których używają te systemy do poprawy ich zdolności generatywnych w trakcie szkolenia, są zmuszone do faworyzowania obrazów, które są stosunkowo bliskie danych źródłowych w zbiorze danych.

Jeśli wygenerowany obraz jest “wizualnie bliski” danym źródłowym, jest nieuchronnie bardziej prawdopodobne, że uzyska lepszy wynik dla “autentyczności” niż “oryginalności”, ponieważ jest “wierny” – choć niewiele inspirujący.

W sektorze, który jest zbyt młody i niesprawdzony, aby jego konsekwencje prawne były jeszcze znane, może to okazać się ważną kwestią prawną, jeśli okaże się, że komercyjne syntetyczne treści obrazu nie różnią się wystarczająco od danych źródłowych (często objętych prawem autorskim), które obecnie są dozwolone do przeniknięcia sektora badawczego w postaci popularnych zbiorów danych pobranych z sieci (potencjał przyszłych roszczeń o naruszenie praw autorskich tego rodzaju został niedawno podkreślony w odniesieniu do GitHub Co-Pilot AI firmy Microsoft ).

Jeśli chodzi o coraz bardziej spójne i semantycznie zwarte dane wyjściowe z systemów takich jak OpenAI’s DALL-E 2, Google’s Imagen i chińskie CogView (oraz mniej zaawansowane DALL-E mini), jest bardzo niewiele post facto sposobów, aby niezawodnie przetestować oryginalność wygenerowanego obrazu.

W istocie, wyszukiwanie niektórych z najpopularniejszych nowych obrazów DALL-E 2 często prowadzi tylko do dalszych przypadków tych samych obrazów, w zależności od silnika wyszukiwania.

Przesłanie kompletnego 9-obrazowego wyjścia DALL-E 2 prowadzi tylko do dalszych grup wyjścia DALL-E 2. Rozdzielenie i przesłanie pierwszego obrazu (z tego posta na Twitterze z 8 czerwca 2022 r., z konta 'Weird Dall-E Generations') powoduje, że Google koncentruje się na piłce do koszykówki na zdjęciu, prowadząc wyszukiwanie oparte na obrazie w ślepą uliczkę semantyczną. Dla tego samego wyszukiwania opartego na obrazie Yandex wydaje się przynajmniej wykonywać pewną rzeczywistą dekonstrukcję opartą na pikselach i dopasowywanie cech.

Przesłanie kompletnego 9-obrazowego wyjścia DALL-E 2 prowadzi tylko do dalszych grup wyjścia DALL-E 2, ponieważ struktura siatki jest najsilniejszą cechą. Rozdzielenie i przesłanie pierwszego obrazu (z tego posta na Twitterze z 8 czerwca 2022 r., z konta ‘Weird Dall-E Generations’) powoduje, że Google koncentruje się na piłce do koszykówki na zdjęciu, prowadząc wyszukiwanie oparte na obrazie w ślepą uliczkę semantyczną. Dla tego samego wyszukiwania opartego na obrazie Yandex wydaje się przynajmniej wykonywać pewną rzeczywistą dekonstrukcję opartą na pikselach i dopasowywanie cech.

Chociaż Yandex jest bardziej prawdopodobne niż Google Search, aby użyć rzeczywistych cech (tj. pochodnych/obliczonych cech, a nie koniecznie cech twarzy ludzi) i wizualnych (zamiast semantycznych) charakterystyk przesłanego obrazu, aby znaleźć podobne obrazy, wszystkie wyszukiwarki oparte na obrazie mają jakiś rodzaj programu lub praktyki, który może utrudnić identyfikację przypadków plagiatu źródło>wygenerowany za pomocą wyszukiwań internetowych.

Ponadto dane szkoleniowe dla modelu generatywnego mogą nie być dostępne publicznie w całości, co jeszcze bardziej utrudnia badanie oryginalności wygenerowanych obrazów.

Co ciekawe, wykonanie wyszukiwania opartego na obrazie na jednym z syntetycznych obrazów przedstawionych przez Google na stronie poświęconej Imagen nie daje niczego porównywalnego do tematu obrazu, jeśli chodzi o rzeczywiste spojrzenie na obraz i bezstronne wyszukiwanie podobnych obrazów. Zamiast tego, zafiksowane semantycznie, wyniki wyszukiwania obrazu Google dla tego obrazu Imagen nie pozwalają na czyste wyszukiwanie oparte na obrazie bez dodania słów “imagen google” jako dodatkowego (i ograniczającego) parametru:

Yandex, z drugiej strony, znajduje wiele podobnych (lub przynajmniej wizualnie powiązanych) rzeczywistych obrazów z amatorskiej społeczności artystycznej:

W ogóle byłoby lepiej, gdyby nowość lub oryginalność wyjścia systemów syntezy obrazu mogła być w jakiś sposób mierzona, bez konieczności wyodrębniania cech z każdego możliwego obrazu internetowego w czasie, gdy model był szkolony, lub w niepublicznych zbiorach danych, które mogą korzystać z objętych prawem autorskim materiałów.

W związku z tym problemem, badacze z Kim Jaechul Graduate School of AI w Korea Advanced Institute of Science and Technology (KAIST AI) współpracowali z globalną firmą ICT i wyszukiwarką NAVER Corp, aby opracować Wynik Rzadkości, który może pomóc w identyfikacji bardziej oryginalnych tworów systemów syntezy obrazu.

Obrazy tutaj są generowane za pomocą StyleGAN-FFHQ. Od lewej do prawej, kolumny wskazują od najgorszych do najlepszych wyników. Widzimy, że metryka 'Truncation trick' (patrz poniżej) i metryka Realizmu mają swoje własne cele, podczas gdy nowy 'Wynik Rzadkości' (górny rząd) szuka spójnych, ale oryginalnych obrazów (zamiast tylko spójnych). Źródło: https://arxiv.org/pdf/2206.08549.pdf

Obrazy tutaj są generowane za pomocą StyleGAN-FFHQ. Od lewej do prawej, kolumny wskazują od najgorszych do najlepszych wyników. Widzimy, że metryka ‘Truncation trick’ (patrz poniżej) i metryka Realizmu mają swoje własne cele, podczas gdy nowy ‘Wynik Rzadkości’ (górny rząd) szuka spójnych, ale oryginalnych obrazów (zamiast tylko spójnych). Ponieważ w tym artykule są ograniczenia rozmiaru obrazu, proszę zobaczyć źródłowy artykuł, aby uzyskać lepsze szczegóły i rozdzielczość. Źródło: https://arxiv.org/pdf/2206.08549.pdf

The new artykuł jest zatytułowany Wynik Rzadkości: Nowa Metryka do Oceny Niezwykłości Syntetyzowanych Obrazów i pochodzi od trzech badaczy z KAIST, oraz trzech z NAVER Corp.

Poza “tanią sztuczką”

Wśród wcześniejszych metryk, które nowy artykuł stara się poprawić, jest “sztuczka truncacji” zaproponowana w 2019 roku we współpracy między brytyjskim Heriot-Watt University a Google’s DeepMind.

“Sztuczka truncacji” polega na użyciu innego rozkładu latentnego do próbkowania niż ten, który był używany do szkolenia modelu generatywnego.

Badacze, którzy opracowali tę metodę, byli zaskoczeni, że działa, ale przyznają w oryginalnym artykule, że redukuje różnorodność wygenerowanego wyjścia. Niemniej, “sztuczka truncacji” stała się skuteczna i popularna w kontekście tego, co można by nazwać “tanią sztuczką” do uzyskania autentycznie wyglądających wyników, które nie naprawdę asymilują wszystkie możliwości tkwiące w danych i mogą bardziej przypominać dane źródłowe niż jest to pożądane.

W odniesieniu do “sztuczki truncacji”, autorzy nowego artykułu zauważają:

‘[To] nie jest przeznaczone do generowania rzadkich próbek w zbiorach danych szkoleniowych, ale raczej do syntezy typowych obrazów w sposób bardziej stabilny. Przypuszczamy, że istniejące modele generatywne będą mogły produkować próbki bogatsze w rozkładzie danych rzeczywistych, jeśli generator może być skłoniony do skutecznego produowania rzadkich próbek.’

O ogólnej tendencji do polegania na tradycyjnych metrykach, takich jak Frechet Inception Distance (FID, które zostało poddane intensywnej krytyce w grudniu 2021 roku), inception score (IS) i Kernel Inception Distance (KID) jako “wskaźniki postępu” podczas szkolenia modelu generatywnego, autorzy dodatkowo komentują*:

‘Ten schemat uczenia prowadzi generator do niegenerowania zbyt wielu rzadkich próbek, które są unikalne i mają silne cechy, które nie stanowią dużego udziału w rozkładzie obrazu rzeczywistego. Przykłady rzadkich próbek z publicznych zbiorów danych obejmują ludzi z różnymi akcesoriami w FFHQ, białe zwierzęta w AFHQ i rzadkie posągi w Metfaces.

‘Możliwość generowania rzadkich próbek jest ważna nie tylko dlatego, że jest związana z możliwościami krawędzi modeli generatywnych, ale także dlatego, że unikalność odgrywa ważną rolę w aplikacjach kreatywnych, takich jak wirtualni ludzie.

‘Jednakże, wyniki jakościowe kilku ostatnich badań rzadko zawierają te rzadkie przykłady. Przypuszczamy, że natura schematu uczenia się przeciwnego powoduje, że rozkład generowanych obrazów jest podobny do rozkładu danych szkoleniowych. Tak więc, obrazy z wyraźną indywidualnością lub rzadkością zajmują tylko niewielką część obrazów syntetyzowanych przez modele.’

Technika

Badacze nowy Wynik Rzadkości adaptuje pomysł przedstawiony w wcześniejszych pracach – użycie K-Nearest Neighbors (KNN) do reprezentowania tablic danych rzeczywistych (szkoleniowych) i syntetycznych (wyjściowych) w systemie syntezy obrazu.

W odniesieniu do tej nowej metody analizy, autorzy twierdzą:

‘Przypuszczamy, że zwykłe próbki będą bliżej siebie, podczas gdy unikalne i rzadkie próbki będą rzadko rozmieszczone w przestrzeni cech.’

Wynik obrazu powyżej pokazuje najmniejsze odległości najbliższych sąsiadów (NND) od najmniejszych do największych, w architekturze StyleGAN szkolonej na FFHQ.

‘Dla wszystkich zbiorów danych, próbki z najmniejszymi NND wykazują reprezentatywne i typowe obrazy. Z drugiej strony, próbki z największymi NND mają silną indywidualność i są znacznie różne od typowych obrazów z najmniejszymi NND.’

W teorii, używając tej nowej metryki jako dyskryminatora, lub przynajmniej włączając ją w bardziej złożoną architekturę dyskryminatora, system generatywny mógłby być skierowany z czystej imitacji w kierunku bardziej wynalazczego algorytmu, zachowując przy tym istotną spójność pojęć, które mogą być kluczowe dla autentycznej produkcji obrazu (tj. ‘człowiek’, ‘kobieta’, ‘samochód’, ‘kościół’ itp.).

Porównania i eksperymenty

W testach, badacze przeprowadzili porównanie wyników Wyniku Rzadkości z “sztuczką truncacji” i Wynikiem Realizmu NVIDIA z 2019 roku, i stwierdzili, że w różnych ramach i zbiorach danych, podejście jest w stanie indywidualizować “unikalne” wyniki.

Chociaż wyniki przedstawione w artykule są zbyt obszerne, aby je tutaj umieścić, badacze wydają się demonstrować możliwość nowej metody identyfikacji rzadkości w obu źródłowych (rzeczywistych) i wygenerowanych (sztucznych) obrazach w procedurze generatywnej:

Wybrane przykłady z obszernych wyników wizualnych odtworzonych w artykule (zobacz powyższy adres URL, aby uzyskać więcej szczegółów). Po lewej stronie, rzeczywiste przykłady z FFHQ, które mają bardzo niewiele sąsiadów w oryginalnym zbiorze danych (tj. są nowe i nietypowe); po prawej stronie, sztuczne obrazy wygenerowane przez StyleGAN, które nowa metryka zidentyfikowała jako prawdziwie nowe.

Wybrane przykłady z obszernych wyników wizualnych odtworzonych w artykule (zobacz powyższy adres URL, aby uzyskać więcej szczegółów). Po lewej stronie, rzeczywiste przykłady z FFHQ, które mają bardzo niewiele sąsiadów w oryginalnym zbiorze danych (tj. są nowe i nietypowe); po prawej stronie, sztuczne obrazy wygenerowane przez StyleGAN, które nowa metryka zidentyfikowała jako prawdziwie nowe. Ponieważ w tym artykule są ograniczenia rozmiaru obrazu, proszę zobaczyć źródłowy artykuł, aby uzyskać lepsze szczegóły i rozdzielczość.

Nowy Wynik Rzadkości pozwala nie tylko na możliwość identyfikacji “nowych” generowanych danych wyjściowych w pojedynczej architekturze, ale także, jak twierdzą badacze, pozwala na porównania między modelami generatywnymi o różnych architekturach (tj. autoencoder, VAE, GAN itp.).

Artykuł zauważa, że Wynik Rzadkości różni się od poprzednich metryk, koncentrując się na możliwości generatywnego ramienia tworzenia unikalnych i rzadkich obrazów, w przeciwieństwie do “tradycyjnych” metryk, które badają (bardziej jednostronnie) różnorodność między generacjami w trakcie szkolenia modelu.

Poza ograniczonymi zadaniami

Chociaż nowy artykuł badaczy został przeprowadzony na ograniczonych zbiorach danych (takich jak kombinacje generatora i zbioru danych zaprojektowane specjalnie do produkcji obrazów ludzi lub kotów), Wynik Rzadkości może potencjalnie być zastosowany do dowolnego arbitralnego procesu syntezy obrazu, w którym jest pożądane identyfikowanie wygenerowanych przykładów, które używają rozkładów pochodzących z danych szkoleniowych, zamiast zwiększania autentyczności (i redukowania różnorodności) przez interpozycję obcych rozkładów latentnych lub poleganie na innych “sztucznych” rozwiązaniach, które kompromitują nowość na rzecz autentyczności.

W praktyce, a w braku wyraźnego zrozumienia stopnia, w jakim system naprawdę zaabsorbował pojęcia wizualne i semantyczne (często utrudnione przez ograniczoną wiedzę o danych szkoleniowych), może to być skuteczny sposób identyfikacji prawdziwego “momentu inspiracji” w systemie generatywnym – punktu, w którym odpowiednia liczba pojęć wejściowych i danych doprowadziła do czegoś naprawdę wynalazczego, zamiast czegoś zbyt pochodnego lub bliskiego danym źródłowym.

 

* Moje konwersje cytatów wewnętrznych autorów na łącza.

Pierwotnie opublikowane 20 czerwca 2022 r.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai