Kąt Andersona

JPEG AI Zacierający Granicę Między Rzeczywistymi a Syntetycznymi

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Created with ChatGPT-4o and Adobe Firefly

W lutym tego roku opublikowano międzynarodowy standard JPEG AI, po kilku latach badań mających na celu wykorzystanie technik uczenia maszynowego do wytworzenia mniejszego i łatwiejszego do transmisji i przechowywania kodeka obrazu, bez utraty jakości percepcyjnej.

Z oficjalnego strumienia publikacji dla JPEG AI, porównanie między Peak Signal-to-Noise Ratio (PSNR) a podejściem ML-wzmocnionym JPEG AI. Źródło: https://jpeg.org/jpegai/documentation.html

Z oficjalnego strumienia publikacji dla JPEG AI, porównanie między Peak Signal-to-Noise Ratio (PSNR) a podejściem ML-wzmocnionym JPEG AI. Źródło: https://jpeg.org/jpegai/documentation.html

Jednym z powodów, dla którego ten debiut mógł przyciągnąć niewielką uwagę, jest to, że podstawowe pliki PDF dla tego ogłoszenia nie były dostępne za pośrednictwem bezpłatnych portali, takich jak Arxiv. Niemniej jednak, Arxiv już wcześniej przedstawił szereg badań badających znaczenie JPEG AI w różnych aspektach, w tym jego niezwykłe artefakty kompresji oraz znaczenie dla kryminalistyki.

Jedno z badań porównało artefakty kompresji, w tym wcześniejszy projekt JPEG AI, stwierdzając, że nowa metoda ma tendencję do rozmycia tekstu – co nie jest bagatelą w przypadkach, gdy kodek mógłby przyczynić się do łańcucha dowodów. Źródło: https://arxiv.org/pdf/2411.06810

Jedno z badań porównało artefakty kompresji, w tym wcześniejszy projekt JPEG AI, stwierdzając, że nowa metoda ma tendencję do rozmycia tekstu – co nie jest bagatelą w przypadkach, gdy kodek mógłby przyczynić się do łańcucha dowodów. Źródło: https://arxiv.org/pdf/2411.06810

Ponieważ JPEG AI modyfikuje obrazy w sposób, który naśladuje artefakty generatorów obrazów syntetycznych, istniejące narzędzia kryminalistyczne mają trudności z rozróżnieniem prawdziwych i fałszywych obrazów:

Po kompresji JPEG AI, najnowocześniejsze algorytmy nie mogą już niezawodnie oddzielić autentycznych treści od modyfikowanych regionów w mapach lokalizacji, zgodnie z niedawnym artykułem (marzec 2025). Przykłady źródłowe widoczne po lewej stronie to modyfikowane/ fałszywe obrazy, gdzie zmodyfikowane regiony są wyraźnie wyodrębnione przy użyciu standardowych technik kryminalistycznych (obraz środkowy). Jednak kompresja JPEG AI nadaje fałszywym obrazom warstwę wiarygodności (obraz z daleka po prawej). Źródło: https://arxiv.org/pdf/2412.03261

Po kompresji JPEG AI, najnowocześniejsze algorytmy nie mogą już niezawodnie oddzielić autentycznych treści od modyfikowanych regionów w mapach lokalizacji, zgodnie z niedawnym artykułem (marzec 2025). Przykłady źródłowe widoczne po lewej stronie to modyfikowane/ fałszywe obrazy, gdzie zmodyfikowane regiony są wyraźnie wyodrębnione przy użyciu standardowych technik kryminalistycznych (obraz środkowy). Jednak kompresja JPEG AI nadaje fałszywym obrazom warstwę wiarygodności (obraz z daleka po prawej). Źródło: https://arxiv.org/pdf/2412.03261

Jednym z powodów jest to, że JPEG AI jest szkolony przy użyciu architektury modelu podobnej do tych używanych przez generatywne systemy, które narzędzia kryminalistyczne starają się wykryć:

Nowy artykuł ilustruje podobieństwo między metodami kompresji obrazu z użyciem AI a rzeczywistymi obrazami generowanymi przez AI. Źródło: https://arxiv.org/pdf/2504.03191

Nowy artykuł ilustruje podobieństwo między metodami kompresji obrazu z użyciem AI a rzeczywistymi obrazami generowanymi przez AI. Źródło: https://arxiv.org/pdf/2504.03191

W związku z tym oba modele mogą wytworzyć pewne podobne cechy wizualne z punktu widzenia kryminalistyki.

Kwantyzacja

Ten przełom następuje z powodu kwantyzacji, wspólnej dla obu architektur, i która jest używana w uczeniu maszynowym jako metoda konwersji danych ciągłych na punkty danych dyskretnych, oraz jako technika optymalizacji która może znacznie zmniejszyć rozmiar pliku szkolonego modelu (hobbystom syntezowania obrazów znany będzie czas oczekiwania między oficjalnym wydaniem modelu a wersją zoptymalizowaną przez społeczność, która może działać na lokalnym sprzęcie).

W tym kontekście kwantyzacja odnosi się do procesu konwersji wartości ciągłych w latentnej reprezentacji obrazu na stałe, dyskretne kroki. JPEG AI używa tego procesu do zmniejszenia ilości danych potrzebnych do przechowywania lub transmisji obrazu, poprzez uproszczenie wewnętrznej reprezentacji numerycznej.

Chociaż kwantyzacja sprawia, że kodowanie jest bardziej wydajne, również narzuca regularności strukturalne, które mogą przypominać artefakty pozostawione przez generatywne modele – zbyt subtelne, aby być postrzeganymi, ale zakłócające narzędzia kryminalistyczne.

W odpowiedzi, autorzy nowej pracy zatytułowanej Trzy wskazówki kryminalistyczne dla obrazów JPEG AI proponują interpretowalne, nie-neuronowe techniki, które wykrywają kompresję JPEG AI; określają, czy obraz został ponownie skompresowany; i rozróżniają skompresowane obrazy rzeczywiste od tych wygenerowanych w całości przez AI.

Metoda

Korelacje kolorów

Artykuł proponuje trzy ‘wskazówki kryminalistyczne’ dostosowane do obrazów JPEG AI: korelacje kanałów kolorowych, wprowadzane podczas wstępnych kroków przetwarzania JPEG AI; mierne zniekształcenia jakości obrazu w trakcie powtarzanych kompresji, które ujawniają zdarzenia rekompresji; i wzorce kwantyzacji przestrzeni latentnej, które pomagają rozróżnić obrazy skompresowane przez JPEG AI od tych wygenerowanych przez modele AI.

Co się tyczy podejścia opartego na korelacjach kolorów, pipeline przetwarzania JPEG AI wprowadza zależności statystyczne między kanałami kolorów obrazu, tworząc sygnaturę, która może służyć jako wskazówka kryminalistyczna.

JPEG AI konwertuje obrazy RGB na przestrzeń kolorów YUV i wykonuje 4:2:0 podpróbkowanie chrominancji, co obejmuje pomniejszanie kanałów chrominancji przed kompresją. Ten proces prowadzi do subtelnych korelacji między wysokoczęstotliwościowymi resztkami kanałów czerwonego, zielonego i niebieskiego – korelacjami, które nie są obecne w niekompresowanych obrazach i które różnią się siłą od tych wytwarzanych przez tradycyjną kompresję JPEG lub generatory obrazów syntetycznych.

Porównanie, w jaki sposób kompresja JPEG AI zmienia korelacje kolorów w obrazach, używając kanału czerwonego jako przykładu. Panel (a) porównuje niekompresowane obrazy z tymi skompresowanymi przez JPEG AI, pokazując, że kompresja znacznie zwiększa międzykanałową korelację. Panel (b) izoluje efekt wstępnego przetwarzania JPEG AI – tylko konwersja kolorów i podpróbkowanie – demonstrując, że nawet ten krok zwiększa korelację w sposób zauważalny. Panel (c) pokazuje, że tradycyjna kompresja JPEG również zwiększa korelację nieco, ale nie w tym samym stopniu. Panel (d) baduje obrazy syntetyczne, z Midjourney-V5 i Adobe Firefly wykazującymi umiarkowane zwiększenie korelacji, podczas gdy inne pozostają bliżej poziomów niekompresowanych.

Porównanie, w jaki sposób kompresja JPEG AI zmienia korelacje kolorów w obrazach..

Powyżej widzimy porównanie z artykułu, ilustrujące, w jaki sposób kompresja JPEG AI zmienia korelacje kolorów w obrazach, używając kanału czerwonego jako przykładu.

Panel A porównuje niekompresowane obrazy z tymi skompresowanymi przez JPEG AI, pokazując, że kompresja znacznie zwiększa międzykanałową korelację; panel B izoluje efekt wstępnego przetwarzania JPEG AI – tylko konwersja kolorów i podpróbkowanie – demonstrując, że nawet ten krok zwiększa korelację w sposób zauważalny; panel C pokazuje, że tradycyjna kompresja JPEG również zwiększa korelację nieco, ale nie w tym samym stopniu; i Panel D baduje obrazy syntetyczne, z Midjourney-V5 i Adobe Firefly wykazującymi umiarkowane zwiększenie korelacji, podczas gdy inne pozostają bliżej poziomów niekompresowanych.

Stosunek szybkości do zniekształcenia

Wskazówka stosunku szybkości do zniekształcenia identyfikuje rekompresję JPEG AI, śledząc, w jaki sposób jakość obrazu, mierzona przez Peak Signal-to-Noise Ratio (PSNR), maleje w przewidywalnym wzorcu w trakcie wielokrotnych kompresji.

Badanie utrzymuje, że wielokrotne kompresowanie obrazu z użyciem JPEG AI prowadzi do stopniowego, lecz nadal mierzonego, spadku jakości obrazu, mierzonego przez PSNR, i że ten stopniowy spadek tworzy podstawę wskazówki kryminalistycznej do wykrycia, czy obraz został ponownie skompresowany.

W przeciwieństwie do tradycyjnego JPEG, gdzie wcześniejsze metody śledziły zmiany w określonych blokach obrazu, JPEG AI wymaga innego podejścia, ze względu na jego architekturę kompresji neuronowej; dlatego autorzy proponują monitorowanie, w jaki sposób zarówno bitrate, jak i PSNR ewoluują w trakcie kolejnych kompresji. Każda runda kompresji modyfikuje obraz mniej niż poprzednia, i ten malejący efekt (wykreślony przeciwko bitrate) może ujawnić, czy obraz przeszedł przez wiele etapów kompresji:

Ilustracja, w jaki sposób powtarzana kompresja wpływa na jakość obrazu w różnych kodekach, przedstawiająca wyniki z JPEG AI i kodekiem neuronowym opracowanym w https://arxiv.org/pdf/1802.01436; oba wykazują stopniowy spadek PSNR przy każdej dodatkowej kompresji – nawet przy niższych bitrate'ach. W przeciwieństwie do tego, tradycyjna kompresja JPEG utrzymuje stabilną jakość w trakcie wielokrotnych kompresji, chyba że bitrate jest wysoki. Ten wzorzec służy jako przykład, w jaki sposób rekompresja pozostawia mierne ślady w kodekach opartych na AI, oferując potencjalny sygnał kryminalistyczny.

Ilustracja, w jaki sposób powtarzana kompresja wpływa na jakość obrazu w różnych kodekach, przedstawiająca wyniki z JPEG AI i kodekiem neuronowym opracowanym w https://arxiv.org/pdf/1802.01436; oba wykazują stopniowy spadek PSNR przy każdej dodatkowej kompresji, nawet przy niższych bitrate’ach. W przeciwieństwie do tego, tradycyjna kompresja JPEG utrzymuje stabilną jakość w trakcie wielokrotnych kompresji, chyba że bitrate jest wysoki.

Na powyższym obrazie widzimy wykreślone krzywe szybkości do zniekształcenia dla JPEG AI; drugiego kodeku opartego na AI; i tradycyjnego JPEG, stwierdzając, że JPEG AI i kodek neuronowy wykazują spadek PSNR w trakcie wszystkich bitrate’ów, podczas gdy tradycyjne JPEG wykazuje tylko nieznaczne pogorszenie przy znacznie wyższych bitrate’ach. To zachowanie dostarcza mierne świadectwo, które może być użyte do identyfikacji obrazów JPEG AI, które przeszły rekompresję.

Poprzez wyodrębnienie, w jaki sposób bitrate i jakość obrazu ewoluują w trakcie wielokrotnych rund kompresji, autorzy podobnie zbudowali sygnaturę, która pomaga wskazać, czy obraz przeszedł rekompresję, oferując potencjalnie praktyczną wskazówkę kryminalistyczną w kontekście JPEG AI.

Kwantyzacja

Jak widzieliśmy wcześniej, jednym z bardziej wyzwań kryminalistycznych, jakie stwarza JPEG AI, jest jego wizualna podobieństwo do syntetycznych obrazów generowanych przez modele dyfuzyjne. Obie te technologie używają architektur kodera-dekodera, które przetwarzają obrazy w skompresowanej przestrzeni latentnej i często pozostawiają subtelne artefakty upsamplowania.

Te wspólne cechy mogą mylić detektory – nawet te przeszkolone na obrazach JPEG AI. Jednak kluczowa różnica strukturalna pozostaje: JPEG AI stosuje kwantyzację, krok, który zaokrągla wartości latentne do dyskretnych poziomów w celu efektywnej kompresji, podczas gdy generatywne modele zwykle nie stosują tej techniki.

Nowy artykuł wykorzystuje tę różnicę do zaprojektowania wskazówki kryminalistycznej, która pośrednio testuje obecność kwantyzacji. Metoda analizuje, w jaki sposób latentna reprezentacja obrazu reaguje na zaokrąglanie, przy założeniu, że jeśli obraz został już skwantyzowany, jego struktura latentna wykazuje mierne wzorce wyrównania z zaokrąglonymi wartościami.

Te wzorce, choć niewidoczne dla oka, produkują statystyczne różnice, które mogą pomóc rozróżnić skompresowane obrazy rzeczywiste od w pełni syntetycznych.

Przykład średnich widm Fouriera ujawnia, że obrazy skompresowane przez JPEG AI oraz te wygenerowane przez modele dyfuzyjne, takie jak Midjourney-V5 i Stable Diffusion XL, wykazują regularne, siatkopodobne wzorce w dziedzinie częstotliwości – artefakty zwykle związane z upsamplowaniem. W przeciwieństwie do tego, obrazy rzeczywiste nie wykazują tych wzorców. To nachodzenie się struktury widmowej pomaga wyjaśnić, dlaczego narzędzia kryminalistyczne często mylą skompresowane obrazy rzeczywiste z syntetycznymi.

Przykład średnich widm Fouriera ujawnia, że obrazy skompresowane przez JPEG AI oraz te wygenerowane przez modele dyfuzyjne, takie jak Midjourney-V5 i Stable Diffusion XL, wykazują regularne, siatkopodobne wzorce w dziedzinie częstotliwości – artefakty zwykle związane z upsamplowaniem. W przeciwieństwie do tego, obrazy rzeczywiste nie wykazują tych wzorców. To nachodzenie się struktury widmowej pomaga wyjaśnić, dlaczego narzędzia kryminalistyczne często mylą skompresowane obrazy rzeczywiste z syntetycznymi.

Co ważne, autorzy dowodzą, że ta wskazówka działa w przypadku różnych modeli generatywnych i pozostaje skuteczna nawet wtedy, gdy kompresja jest wystarczająco silna, aby zredukować całe sekcje przestrzeni latentnej do zera. W przeciwieństwie do tego, obrazy syntetyczne wykazują znacznie słabsze reakcje na ten test zaokrąglania, oferując praktyczny sposób rozróżnienia między nimi.

Wynik ten ma na celu stworzenie lekkiego i interpretowalnego narzędzia ukierunkowanego na podstawową różnicę między kompresją a generacją, zamiast polegania na kruchych artefaktach powierzchniowych.

Dane i testy

Kompresja

Aby ocenić, czy ich wskazówka korelacji kolorów może niezawodnie wykryć kompresję JPEG AI (tj. pierwszą rundę z niekompresowanego źródła), autorzy przetestowali ją na wysokiej jakości niekompresowanych obrazach z bazy danych RAISE, kompresując je na różnych poziomach bitrate, używając implementacji referencyjnej JPEG AI.

Przeszkolili prosty las losowy na wzorcach statystycznych korelacji kanałów kolorowych (szczególnie w jaki sposób szum resztkowy w każdym kanale wyrównywał się z innymi) i porównali go z ResNet50 siecią neuronową przeszkoloną bezpośrednio na pikselach obrazu.

Dokładność wykrywania kompresji JPEG AI przy użyciu cech korelacji kolorów, porównywanych na różnych poziomach bitrate. Metoda jest najbardziej skuteczna na niższych bitrate'ach, gdzie artefakty kompresji są silniejsze, i wykazuje lepszą generalizację do nieznanego poziomu kompresji niż model ResNet50.

Dokładność wykrywania kompresji JPEG AI przy użyciu cech korelacji kolorów, porównywanych na różnych poziomach bitrate. Metoda jest najbardziej skuteczna na niższych bitrate’ach, gdzie artefakty kompresji są silniejsze, i wykazuje lepszą generalizację do nieznanego poziomu kompresji niż model ResNet50.

Pomimo że ResNet50 osiągnął wyższą dokładność, gdy dane testowe ściśle odpowiadały warunkom jego treningu, miał trudności z generalizacją na różne poziomy kompresji. Podejście oparte na korelacjach, chociaż znacznie prostsze, okazało się bardziej spójne na różnych bitrate’ach, szczególnie na niższych poziomach kompresji, gdzie wstępne przetwarzanie JPEG AI ma silniejszy efekt.

Te wyniki sugerują, że nawet bez głębokiego uczenia, jest możliwe wykrycie kompresji JPEG AI przy użyciu wskazówek statystycznych, które pozostają interpretowalne i odporne.

Rekompresja

Aby ocenić, czy rekompresja JPEG AI może być niezawodnie wykryta, badacze przetestowali wskazówkę szybkości do zniekształcenia na zestawie obrazów skompresowanych na różnych poziomach bitrate – niektóre tylko raz, a inne ponownie przy użyciu JPEG AI.

Metoda ta polegała na wyodrębnieniu 17-wymiarowego wektora cech, aby śledzić, w jaki sposób bitrate i PSNR obrazu ewoluowały w trakcie trzech rund kompresji. Ten zestaw cech ujmował, ile jakości zostało utraconej na każdym etapie, i w jaki sposób stawki latentne i hiperpriorowe zachowywały się – miary, których tradycyjne metody oparte na pikselach nie mogą łatwo dostarczyć.

Badacze przeszkolili las losowy na tych cechach i porównali jego wyniki z ResNet50 przeszkoloną na fragmentach obrazu:

Wyniki klasyfikacji dokładności lasu losowego przeszkolonego na cechach szybkości do zniekształcenia w celu wykrycia, czy obraz JPEG AI został ponownie skompresowany. Metoda najlepiej działa, gdy pierwsza kompresja jest silna (tj. na niższych bitrate'ach), i następnie konsekwentnie przewyższa ResNet50 – szczególnie w przypadkach, gdy druga kompresja jest łagodniejsza niż pierwsza.

Wyniki klasyfikacji dokładności lasu losowego przeszkolonego na cechach szybkości do zniekształcenia w celu wykrycia, czy obraz JPEG AI został ponownie skompresowany. Metoda najlepiej działa, gdy pierwsza kompresja jest silna (tj. na niższych bitrate’ach), i następnie konsekwentnie przewyższa ResNet50 – szczególnie w przypadkach, gdy druga kompresja jest łagodniejsza niż pierwsza.

Las losowy okazał się szczególnie skuteczny, gdy pierwsza kompresja była silna (tj. na niższych bitrate’ach), ujawniając wyraźne różnice między obrazami skompresowanymi jeden i dwa razy. Podobnie jak w przypadku poprzedniej wskazówki, ResNet50 miał trudności z generalizacją, szczególnie gdy testowany był na poziomach kompresji, których nie widział podczas treningu.

Cechy szybkości do zniekształcenia, w przeciwieństwie do tego, pozostały stabilne na szerokim zakresie scenariuszy. Godne uwagi jest to, że wskazówka działała nawet w przypadku innego kodeku opartego na AI, co sugeruje, że podejście generalizuje się poza JPEG AI.

JPEG AI i obrazy syntetyczne

W trzeciej rundzie testów autorzy sprawdzili, czy ich cechy kwantyzacji mogą rozróżnić obrazy skompresowane przez JPEG AI od w pełni syntetycznych, wygenerowanych przez modele takie jak Midjourney, Stable Diffusion, DALL-E 2, Glide, i Adobe Firefly.

Dla tego celu badacze wykorzystali podzbiór bazy danych Synthbuster, łącząc rzeczywiste zdjęcia z bazy danych RAISE z obrazami wygenerowanymi przez różne modele dyfuzyjne i oparte na GAN.

Przykłady syntetycznych obrazów w Synthbuster, wygenerowanych przy użyciu podpowiedzi tekstowych inspirowanych naturalnymi fotografiami z bazy danych RAISE-1k. Obrazy zostały wytworzone przy użyciu różnych modeli dyfuzyjnych, z podpowiedziami zaprojektowanymi do produkcji fotorealistycznych treści i tekstur, a nie stylizowanych lub artystycznych przedstawień, odzwierciedlając focus bazy danych na testowanie metod rozróżniania rzeczywistych i wygenerowanych obrazów.

Przykłady syntetycznych obrazów w Synthbuster, wygenerowanych przy użyciu podpowiedzi tekstowych inspirowanych naturalnymi fotografiami z bazy danych RAISE-1k. Obrazy zostały wytworzone przy użyciu różnych modeli dyfuzyjnych, z podpowiedziami zaprojektowanymi do produkcji fotorealistycznych treści i tekstur, a nie stylizowanych lub artystycznych przedstawień. Źródło: https://ieeexplore.ieee.org/document/10334046

Rzeczywiste obrazy zostały skompresowane przy użyciu JPEG AI na różnych poziomach bitrate, a klasyfikacja została sformułowana jako zadanie dwuklasowe: albo JPEG AI versus konkretny generator, albo konkretny bitrate versus Stable Diffusion XL.

Cechy kwantyzacji (korelacje wyodrębnione z reprezentacji latentnej) zostały obliczone z ustalonego regionu 256×256 i podane do klasyfikatora lasu losowego. Jako punkt odniesienia, ResNet50 został przeszkolony na fragmentach pikseli z tych samych danych.

Dokładność klasyfikacji lasu losowego przy użyciu cech kwantyzacji do rozróżniania obrazów skompresowanych przez JPEG AI od syntetycznych.

Dokładność klasyfikacji lasu losowego przy użyciu cech kwantyzacji do rozróżniania obrazów skompresowanych przez JPEG AI od syntetycznych.

Na większości warunków podejście oparte na kwantyzacji przewyższało ResNet50, szczególnie na niższych bitrate’ach, gdzie artefakty kompresji były silniejsze.

Autorzy stwierdzają:

‘Model ResNet50 osiąga najlepsze wyniki dla obrazów Glide, z dokładnością 66,1%, ale w innych przypadkach generalizuje gorzej niż cechy kwantyzacji. Cechy kwantyzacji wykazują dobrą generalizację na różne poziomy kompresji i typy generatorów.

‘Ważność współczynników, które są kwantyzowane do zera, jest pokazana w bardzo dobrych wynikach skróconych [cech], które w wielu przypadkach osiągają wyniki porównywalne do klasyfikatora ResNet50.

‘Jednak cechy kwantyzacji, które wykorzystują pełny, nieprzycięty wektor liczb całkowitych, nadal osiągają znacznie lepsze wyniki. Te wyniki potwierdzają, że ilość zer po kwantyzacji jest ważną wskazówką do rozróżniania obrazów skompresowanych przez AI i wygenerowanych przez AI.

‘Jednakże, również pokazują, że inne czynniki przyczyniają się. Dokładność pełnego wektora do wykrywania JPEG AI jest dla wszystkich bitrate’ów powyżej 91,0%, a silniejsza kompresja prowadzi do wyższych dokładności.’

Projekcja przestrzeni cech przy użyciu UMAP pokazała wyraźne rozdzielenie między obrazami JPEG AI a syntetycznymi, z niższymi bitrate’ami zwiększającymi odległość między klasami. Jednym z wyjątków były obrazy Glide, które klastryzowały się inaczej i miały najniższą dokładność wykrywania spośród wszystkich testowanych generatorów.

Widok dwuwymiarowy UMAP obrazów skompresowanych przez JPEG AI i syntetycznych, oparty na cechach kwantyzacji. Lewy wykres pokazuje, że niższe bitrate JPEG AI tworzą większe rozdzielenie od syntetycznych obrazów; prawy wykres, w jaki sposób obrazy z różnych generatorów klastryzują się w przestrzeni cech.

Widok dwuwymiarowy UMAP obrazów skompresowanych przez JPEG AI i syntetycznych, oparty na cechach kwantyzacji. Lewy wykres pokazuje, że niższe bitrate JPEG AI tworzą większe rozdzielenie od syntetycznych obrazów; prawy wykres, w jaki sposób obrazy z różnych generatorów klastryzują się w przestrzeni cech.

Na koniec autorzy ocenili, w jaki sposób cechy kwantyzacji radzą sobie z typowym przetwarzaniem następcowym, takim jak rekompresja JPEG lub zmiana rozmiaru obrazu. Chociaż wydajność spadała wraz ze wzrostem stopnia przetwarzania, spadek ten był stopniowy, sugerując, że podejście zachowuje pewną odporność nawet w warunkach degradacji.

Ocena odporności cech kwantyzacji na przetwarzanie następcowe, w tym rekompresję JPEG i zmianę rozmiaru obrazu.

Ocena odporności cech kwantyzacji na przetwarzanie następcowe, w tym rekompresję JPEG i zmianę rozmiaru obrazu.

Wnioski

Nie jest pewne, czy JPEG AI zyska szerokie przyjęcie. Po jednej stronie, istnieje wystarczająco dużo infrastrukturalnego długu, aby nałożyć opór na każdy nowy kodek; nawet ‘konwencjonalny’ kodek o dobrych referencjach i szerokiej zgodzie co do jego wartości, taki jak AV1, ma trudności z wyprzedzeniem ugruntowanych metod.

Co się tyczy potencjalnego konfliktu z generatorami AI, charakterystyczne artefakty kwantyzacji, które pomagają w obecnej generacji detektorów AI, mogą być zmniejszone lub ostatecznie zastąpione przez ślady innego rodzaju, w późniejszych systemach (zakładając, że generatory AI zawsze pozostawiają ślady kryminalistyczne, co nie jest pewne).

To oznacza, że własne cechy kwantyzacji JPEG AI, być może wraz z innymi wskazówkami zidentyfikowanymi przez nowy artykuł, mogą nie kolidować z śladem kryminalistycznym najbardziej skutecznych nowych systemów generatywnych AI.

Jednak jeśli JPEG AI będzie działać jako de facto ‘pranie AI’, znacznie zacierając różnicę między rzeczywistymi a wygenerowanymi obrazami, będzie trudno uzasadnić jego przyjęcie.

 

Pierwotnie opublikowane we wtorek, 8 kwietnia 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai