Kąt Andersona

Przywracanie tego, co twoja kamera uchwyciła, zanim AI to zmieniła

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated image (GPT-2). A photographer examines an open DSLR as a stream of colorful fantasy creatures and glowing imagery bursts out, while he reacts with focused, subdued surprise in a studio setting.

Jak można chronić nienaruszalność surowej fotografii przed ingerencją AI, gdy już została automatycznie przetworzona przez AI wewnątrz kamery? Nowe badania mają na celu przywrócić “prawdziwe” dane sensoryczne – również przy użyciu AI!

 

Wzrost autentyczności obrazów AI w ciągu ostatniego roku lub dwóch spowodował, że wiele grup i osób zaczęło protestować przeciwko wynikającej z tego erozji zaufania do fotografii.

W tym samym okresie, Koalicja na rzecz Pochodzenia i Autentyczności Treści (C2PA) próbowała wprowadzić pół-kryptograficzny standard, który dołącza metadane oparte na pochodzeniu informacji do obrazu, od samego momentu, gdy jest on uchwycany przez obsługiwaną kamerę lub urządzenie, w nadziei na ujawnienie wszelkich późniejszych użycia generatywnego AI na tych “oryginalnych” zdjęciach:

Schemat pochodzenia w systemie C2PA, gdzie metadane zapisywane w momencie uchwycenia mogą być dodawane jak dziennik, umożliwiając zwyczajowe dostosowania, takie jak jasność i kontrast, ale rejestrując główne dostosowania, tak aby obraz znacznie zmodyfikowany przez AI wyświetlał się jako taki w mediach, które obsługują ten system. Źródło  - https://spec.c2pa.org/specifications/specifications/1.2/specs/

Schemat pochodzenia w systemie C2PA, gdzie metadane zapisywane w momencie uchwycenia mogą być dodawane jak dziennik, umożliwiając zwyczajowe dostosowania, takie jak jasność i kontrast, ale rejestrując główne dostosowania, tak aby obraz znacznie zmodyfikowany przez AI wyświetlał się jako taki w mediach, które obsługują ten system. Źródło

Przyjęcie tego standardu nie było tak powszechne, jak koalicja tego oczekiwała, a obecnie tylko 14 kamer obsługuje zapisywanie informacji o autentyczności wewnątrz kamery.

To, co jest interesujące w pomysłach C2PA na nadanie zdjęciu “pasy” zaraz po jego powstaniu, to fakt, że może to być już za późno – ponieważ producenci kamer teraz rutynowo wbudowują przetwarzanie AI w sam proces tworzenia obrazu:

Z artykułu z 2024 roku 'Advocating Pixel-Level Authentication of Camera-Captured Images': ilustracja tego, jak nowoczesne potoki kamer wprowadzają treści halucynacyjne w momencie uchwycenia i jak metadane autentyczności na poziomie pikseli ujawniają je. W (A), obraz z czujnika smartfona jest przetwarzany przez ISP, gdzie moduły AI mogą wymyślać szczegóły podczas cyfrowego zoomu lub korekcji ekspozycji, wytwarzając realistyczne obrazy z błędami, takimi jak niepoprawnie odczytane cyfry tablicy rejestracyjnej. W (B), maska autentyczności jest osadzona jako metadane i później nałożona, aby ujawnić nieautentyczne obszary, umożliwiając użytkownikom odróżnienie oryginalnych danych od pikseli zmodyfikowanych przez AI. Źródło – https://ieeexplore.ieee.org/ielx7/6287639/10380310/10478521.pdf?tp=&arnumber=10478521&isnumber=10380310&ref=aHR0cHM6Ly9zY2hvbGFyLmdvb2dsZS5jb20ucHkv

Z artykułu z 2024 roku ‘Advocating Pixel-Level Authentication of Camera-Captured Images’: ilustracja tego, jak nowoczesne potoki kamer wprowadzają treści halucynacyjne w momencie uchwycenia i jak metadane autentyczności na poziomie pikseli ujawniają je. W (A), obraz z czujnika smartfona jest przetwarzany przez ISP, gdzie moduły AI mogą wymyślać szczegóły podczas cyfrowego zoomu lub korekcji ekspozycji, wytwarzając realistyczne obrazy z błędami, takimi jak niepoprawnie odczytane cyfry tablicy rejestracyjnej. W (B), maska autentyczności jest osadzona jako metadane i później nałożona, aby ujawnić nieautentyczne obszary, umożliwiając użytkownikom odróżnienie oryginalnych danych od pikseli zmodyfikowanych przez AI. Źródło

W rzeczywistości, ta interferencja AI w uchwyceniu surowych danych z czujnika kamery może ostatecznie nawet stać się procesem zarządzającym.

Ten rodzaj przetwarzania nie jest taki sam, jak obecna tendencja do modyfikowania zdjęć w kamerze, gdzie aplikacja na telefonie lub aplikacja kamerowa pozwala użytkownikowi przemyśleć zdjęcie w spokoju, zanim zostanie nawet pobrane z urządzenia.

Raczej, przetwarzanie odbywa się w “czarnej skrzynce” rutynie w procesorze sygnału obrazu (ISP) kamery, zwykle w czasie wykonywania, który nie ujawnia ani nie udostępnia surowych danych czujnika (i uwzględnij, że rzekomo “czysty” format RAW nie jest tak “surowy”).

Dlatego, gdy tylko możesz zobaczyć zdjęcie, może ono zostać poddane AI-ułatwionym ulepszeniom, takim jak poprawa jakości w niskim świetle, skalowanie lub nawet zastąpienie księżyca.

W wielu przypadkach może to prowadzić do nieprawidłowych rekonstrukcji, na przykład tekstu, które mogą unieważnić użycie takiego obrazu jako dowodu, ponieważ prawdziwe “surowe” zdjęcie nie byłoby dostępne:

<img class=" wp-image-413558" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-1-5.jpg" alt="Z nowego artykułu – surowe zdjęcie z czujnika jest przetwarzane przez ISP z obsługą GenAI, wytwarzając ostateczny wyjście sRGB, które wygląda wyraźniej, ale może zawierać halucynacyjne szczegóły, jak pokazano w przykładzie tablicy rejestracyjnej, gdzie znaki są niepoprawnie wnioskowane podczas cyfrowego zoomu. Prawdziwa scena, która nie jest dostępna w praktyce, różni się od obu wyjść AI i pośredniego autentycznego obrazu przed halucynacją. Proponowane podejście umożliwia odzyskanie tego obrazu przed halucynacją, przywracając to, co kamera uchwyciła przed modyfikacją treści przez AI. Źródło

Przykłady powyżej pochodzą z nowego artykułu badawczego, który oferuje rozwiązanie problemu “rodzimych zdjęć AI”, używając alternatywnych procesów AI do odtworzenia oszacowanego surowego i nieskażonego obrazu z przetworzonego obrazu.

Autorzy stwierdzają:

‘Gdy modele AI szkolone z generatywnymi lub percepcyjnymi stratami są używane w ISP, są one skłonne do halucynacji treści, potencjalnie zmieniając znaczenie obrazu. Implikacja jest taka, że obrazy bezpośrednio wyjściowe z kamery mogą teraz zawierać “fałszywą” treść, zwłaszcza w kamerach smartfonów, gdzie moduły AI-ISP są coraz częściej stosowane.

‘Użycie GenAI w sprzęcie kamer oznacza zmianę paradygmatu w sposobie, w jaki postrzegamy obrazy kamer i wyzwania tradycyjnego poglądu na obrazy uchwycane przez kamerę jako niezawodne.’

Nowa praca używa bardzo lekkiego kodera i MLP dekodera, który może być zawarty wewnątrz obrazu przy karze wagi tylko 180kb. Celem jest rozwój systemów kodowania wystarczająco szybkich, aby ponownie wyodrębnić oryginalny obraz w czasie rzeczywistym.

Z nowego artykułu: super-rozrost oparty na GenAI wewnątrz ISP kamery może delikatnie zmieniać cechy twarzy, zmieniając wygląd lub postrzeganą tożsamość przez zmiany w kształcie oczu i ust. Poprawa jakości w niskim świetle może podobnie modyfikować treść obrazu, wpływając na interpretację, pomimo poprawy jakości wizualnej. W przykładzie kodu QR, poprawa sprawia, że obraz jest bardziej atrakcyjny, ale czyni kod nieczytelny. Metoda umożliwia odzyskanie autentycznego obrazu przed halucynacjami, przywracając oryginalne cechy twarzy i czytelny kod QR.

Z nowego artykułu: super-rozrost oparty na GenAI wewnątrz ISP kamery może delikatnie zmieniać cechy twarzy, zmieniając wygląd lub postrzeganą tożsamość przez zmiany w kształcie oczu i ust. Poprawa jakości w niskim świetle może podobnie modyfikować treść obrazu, wpływając na interpretację, pomimo poprawy jakości wizualnej. W przykładzie kodu QR, poprawa sprawia, że obraz jest bardziej atrakcyjny, ale czyni kod nieczytelny. Metoda umożliwia odzyskanie autentycznego obrazu przed halucynacjami, przywracając oryginalne cechy twarzy i czytelny kod QR.

Alternatywnie, producenci kamer mogliby dać użytkownikom dostęp do prawdziwie nieskażonych zrzutów czujnika; jednak wydaje się, że może to pozostać ograniczone do bardzo wysokiej klasy sprzętu. W przestrzeni mobilnej i konsumenckiej, niestety, dostęp do nieprzetworzonych zdjęć może być uważany za “niszowy” lub marginalny.

Ponieważ kamery konsumenckie zawsze stosowały pewien poziom przetwarzania, przed pojawieniem się edge AI, algorytmy używane były minimalnie “interpretatywne” i nieprawdopodobne, aby zmienić treść zdjęcia w taki sam sposób, w jaki mogą to zrobić obecne metody AI.

Interesujące jest to, że biorąc pod uwagę, jak bardzo polityka “zastąpienia księżyca” Samsunga była krytykowana kilka lat temu, centrum AI Samsunga w Toronto jest jednym z uczestników nowej pracy, która nosi tytuł Addressing Image Authenticity When Cameras Use Generative AI, i jest prowadzona przez pięciu badaczy z Uniwersytetu w Toronto.

Metoda

Autorzy wykorzystują jedyny inny projekt, który wydaje się bezpośrednio zajmować problemem perturbacji według projektu: artykuł z 2024 roku paper Advocating Pixel-Level Authentication of Camera-Captured Images, który zaproponował “binarną maskę autentyczności” wyznaczającą obszary zmienione przez procesy AI w kamerze:

Z prawej strony, maska autentyczności z artykułu z 2024 roku ujawnia obszary nieba dotknięte procesami “wygładzania” AI w kamerze.

Jednak system nie oferował żadnej metody, aby “prawdziwy” obraz mógł być odzyskany, co nowa praca rozwiązuje, przyznając się do długu wobec wcześniejszego artykułu.

Celem nowej pracy jest umożliwienie użytkownikom odzyskania obrazu, który jest jak najbliższy temu, co rzeczywiście uderzyło w czujnik, zanim przetwarzanie miało miejsce:

Przegląd proponowanej metody. W (A), w momencie uchwycenia, obraz wyjściowy ISP zawierający halucynacje jest przekazywany przez zamrożony wstępnie wyszkolony koder, a jego cechy latentne są połączone z współrzędnymi przestrzennymi i wprowadzane do MLP, które działa na poziomie pikseli, aby przewidzieć niehalucynowany obraz, z szkoleniem kierowanym przez stratę wobec autentycznego obrazu. Wagi kodera i MLP są następnie zapisywane jako metadane obok obrazu. W (B), w czasie inferencji, te wagi są pobierane z metadanych i używane z koderem i MLP, aby odtworzyć niehalucynowany obraz.

Przegląd proponowanej metody. W (A), w momencie uchwycenia, obraz wyjściowy ISP zawierający halucynacje jest przekazywany przez zamrożony wstępnie wyszkolony koder, a jego cechy latentne są połączone z współrzędnymi przestrzennymi i wprowadzane do MLP, które działa na poziomie pikseli, aby przewidzieć niehalucynowany obraz, z szkoleniem kierowanym przez stratę wobec autentycznego obrazu. Wagi kodera i MLP są następnie zapisywane jako metadane obok obrazu. W (B), w czasie inferencji, te wagi są pobierane z metadanych i używane z koderem i MLP, aby odtworzyć niehalucynowany obraz.

W momencie uchwycenia, w nowej metodzie, przetworzony obraz jest przekazywany przez zamrożony koder, który konwertuje go w kompaktne latentne przedstawienie. Następnie, odpowiednie współrzędne przestrzenne są połączone z tymi cechami i wprowadzane do lekkiego MLP, które działa na poziomie pikseli, aby przewidzieć oryginalną treść obrazu – ucząc się, skutecznie, aby odjąć halucynowane elementy przez rekonstrukcyjną stratę, wobec autentycznych celów.

Koder i dekoder są wstępnie szkolone na połączonych autentycznych i halucynowanych obrazach, a następnie szybko dostosowane do każdego uchwycenia obrazu, z ich wagami zapisanymi jako metadane obok samego obrazu, dodając tylko niewielką karę rozmiaru.

W czasie wyświetlania, te zapisane wagi są wyodrębnione i ponownie użyte, aby uruchomić ten sam koder i MLP, umożliwiając odzyskanie obrazu, który jest jak najbliższy temu, co kamera sensor uchwyciła, bez wprowadzania nowej syntetycznej treści.

Dane i testy

Autorzy przetestowali nową metodę, używając dwóch najczęściej wdrażanych zadań przetwarzania ISP: super-rozrostu (w tym dla obszarów powiększonych) oraz fotografii w niskim świetle.

Dla sekcji testowej super-rozrostu (“naturalny obraz”), wiele przykładów tekstu zostało uwzględnionych w danych, ponieważ rutyny super-rozrostu ISP są znane z modyfikowania tekstu (na przykład numerów tablic rejestracyjnych, ale zobacz przykłady wcześniej w artykule). Ponieważ zniekształcenie tekstu jest oddzielnym problemem, zostało ono potraktowane jako podzbiór testów super-rozrostu, z dedykowanymi danymi.

Wspomniany koder został wyszkolony dla każdej z dwóch modalności testowych, a każdy został wybrany na podstawie tego, który moduł AI ISP był najprawdopodobniej zaangażowany w czasie uchwycenia (tj. moduł “niskiego światła” w ciemnych warunkach).

Autorzy użyli zestawu danych DIV2K do szkolenia super-rozrostu, zasilanego przez popularną sieć RealESRGAN. W zgodzie z wcześniej wspomnianą pracą z 2024 roku na temat interferencji ISP, badacze wygenerowali połączone dane zawierające niezmienioną i halucynowaną treść.

Dla sekcji testowej super-rozrostu tekstu, autorzy użyli modelu MARCONet z 2023 roku:

Z artykułu z 2023 roku MARCONet, przykłady rzeczywistych niskiej rozdzielczości i odpowiednich powiększonych tekstów. Źródło - https://arxiv.org/pdf/2303.14726

Z artykułu z 2023 roku MARCONet, przykłady rzeczywistych niskiej rozdzielczości i odpowiednich powiększonych tekstów. Źródło

Aby utworzyć połączone dane w tym przypadku, badacze przeprowadzili niehalucynowane obrazy przez MARCONet. Dwa tysiące obrazów zostało wygenerowanych z oryginalnego kodu, z 200 odłożonymi do walidacji, wraz z kolejnymi 200 do testowania.

Dla testów niskiego światła, zestaw danych LOw-Light (LOL) z chińskiego artykułu z 2018 roku został przyjęty:

Z chińskiego zestawu danych LOL z 2018 roku, przykłady tych samych obrazów przy różnych ekspozycjach i poziomach ciemności i degradacji. Źródło - https://arxiv.org/pdf/1808.04560

Z chińskiego zestawu danych LOL z 2018 roku, przykłady tych samych obrazów przy różnych ekspozycjach i poziomach ciemności i degradacji. Źródło

Rywalizujące ramy

Aby ocenić metodę, przeprowadzono porównania z trzema konkretnymi liniami bazowymi szkolonymi w warunkach dopasowanych. Po pierwsze, SIREN i NeRF zostały wstępnie wyszkolone na połączonych autentycznych i halucynowanych obrazach, a następnie dostosowane w czasie uchwycenia przez ten sam czas, co proponowane podejście, oferując bezpośrednie porównanie do NeRF.

Drugie, MLP z nauczonym kodowaniem opartym na metodzie hashgrid z Instant-NGP zostało użyte, z wpisami tabeli hash i MLP wspólnie zoptymalizowanymi.

Rozmiar osadzania i pojemność sieci zostały dopasowane do docelowego kodera i MLP, z eksperymentami obejmującymi optymalizację na poziomie obrazu z szkoleniem od podstaw i dostosowaniem po wstępnym szkoleniu.

Trzecie, zaimplementowano linię bazową tłumaczenia obrazu na obraz bez dostępu do metadanych, używając modelu NAFNet o rozmiarze 64MB, szkolonego jako system regresji piksel-na-piksel bez dostępu do metadanych.

Podczas szkolenia, optymalizator Adam został użyty w PyTorch, zarówno do wstępnego szkolenia, jak i dostosowania. Koder i MLP zostały wyszkolone przez 50 000 epok przy rozmiarze partii 32, z modalitycznymi koderami szkolonymi dla każdego zadania (tj. SR, text-SR, niskie światło).

Dostosowanie odbywało się przez około trzy sekundy na karcie graficznej NVIDIA V100 z 32GB pamięci VRAM. Autorzy zauważają, że chociaż optymalizacja na urządzeniu jest celem środowiska i scenariusza, nie było to realistyczne do wdrożenia dla wszystkich ram, i dlatego wszystkie testy zostały przeprowadzone w środowisku biurkowym:

Porównanie wyników z linią bazową MLP z metadanymi, w tym SIREN, NeRF i metodą hash-grid, oraz odzyskiwaniem bez metadanych przy użyciu NAFNet. Wyniki są raportowane jako PSNR w decybelach przez trzy zadania: super-rozrost naturalnych obrazów na DIV2K; super-rozrost tekstu na MARCONet; i poprawa jakości w niskim świetle na LOL, z proponowaną metodą osiągającą najwyższe wyniki w każdym przypadku.

Porównanie wyników z linią bazową MLP z metadanymi, w tym SIREN, NeRF i metodą hash-grid, oraz odzyskiwaniem bez metadanych przy użyciu NAFNet. Wyniki są raportowane jako PSNR w decybelach przez trzy zadania: super-rozrost naturalnych obrazów na DIV2K; super-rozrost tekstu na MARCONet; i poprawa jakości w niskim świetle na LOL, z metodą autorów osiągającą najwyższe wyniki w każdym przypadku.

Dla podejść opartych na MLP, wyniki zależały silnie od reprezentacji wejściowej, gdzie modele szkolone przy użyciu tylko współrzędnych przestrzennych miały trudności w czasie wstępnego szkolenia i nie były w stanie poprawić wyników w ograniczonym etapie dostosowania. Dodanie informacji kolorystycznych doprowadziło do lepszych wyników.

Odzyskiwanie bez metadanych przy użyciu NAFNet działało dobrze na DIV2K, gdzie mapa z degradowanego do czystego obrazu była względnie stabilna, ale zawiodło na MARCONet i LOL, gdzie istniało wiele prawdopodobnych rekonstrukcji i model nie miał wystarczającej informacji, aby rozwiązać tę niejednoznaczność.

Ten efekt był najbardziej widoczny w poprawie jakości w niskim świetle, gdzie oryginalna jasność sceny nie mogła być wiarygodnie wywnioskowana z samego przetworzonego obrazu.

Autorzy stwierdzają:

‘W syntetycznych danych MARCONet, obrazy z różną siłą rozmycia mapują się na ten sam halucynowany obraz. Można zobaczyć z wyników, że nasze proponowane podejście przewyższa konkurentów we wszystkich zestawach danych.’

W powyższym porównaniu można zobaczyć, jak dobrze różne metody działają w zależności od czasu, jaki mają do dyspozycji w momencie uchwycenia zdjęcia. Szkolenie modelu od podstaw dla każdego obrazu może dać dobre wyniki, jak widać w przypadku SIREN, NeRF i hash-grid – ale to zajmuje zbyt dużo czasu, aby było praktyczne wewnątrz kamery.

Zamiast tego, metoda autorów wykonuje większość pracy z wyprzedzeniem, z szybkim dostosowaniem w czasie uchwycenia, co pozwala na lepsze wyniki w ramach ograniczeń czasowych (3, 5 lub dziesięć sekund).

Porównanie wyników z linią bazową MLP z metadanymi, w tym SIREN, NeRF i metodą hash-grid, oraz odzyskiwaniem bez metadanych przy użyciu NAFNet. Wyniki są raportowane jako PSNR w decybelach przez trzy zadania: super-rozrost naturalnych obrazów na DIV2K; super-rozrost tekstu na MARCONet; i poprawa jakości w niskim świetle na LOL, z proponowaną metodą osiągającą najwyższe wyniki w każdym przypadku.

Porównanie wyników z linią bazową MLP z metadanymi, w tym SIREN, NeRF i metodą hash-grid, oraz odzyskiwaniem bez metadanych przy użyciu NAFNet. Proszę odnosić się do oryginalnego artykułu dla (nieznacznie) lepszej rozdzielczości.

Powyżej przedstawiono wyniki jakościowe na DIV2K, gdzie metody poprawy wprowadziły widoczne halucynacje. Model super-rozrostu oparty na GAN zmienił kolor oczu, a odzyskiwanie bez metadanych miało trudności z odtworzeniem oryginalnego obrazu. NeRF i hash-grid wyprodukowały artefakty w strukturalnych obszarach, takich jak okna i tekst, podczas gdy proponowana metoda bardziej dokładnie dopasowała się do autentycznego obrazu.

Na koniec, na powyższym rysunku widać wyniki na zestawie danych LOL, z jasnością skalowaną do wizualizacji.

Odzyskiwanie bez metadanych nie mogło rozwiązać nieznanej skali jasności, podczas gdy proponowana metoda lepiej odtworzyła tekstury i przywróciła zmienione znaki, takie jak poprawienie “1” na “i”, bez dodawania artefaktów.

Wnioski

Prawdopodobnie nie można twierdzić, że “kamera nigdy nie kłamie”. Każda decyzja o tym, co sfotografować i kiedy to zrobić, oraz jak to przedstawić i umieścić w kontekście, jest w istocie decyzją polityczną lub społeczną.

Nawet najstarsze metody przetwarzania, takie jak dodging i burning (przeniesione do narzędzi Photoshop), są wysoko subiektywnymi aktami decyzji artystycznej i preferencji.

Jednak nie ma powodu, aby zrezygnować z celu “obiektywnych” uchwycień obrazu; i wydaje się rozsądne, aby przeciętny konsument mógł, nawet z pewnymi trudnościami, uzyskać dostęp do “niezmasygowanych” surowych zrzutów czujnika ze zdjęć, które robi; lub przynajmniej, aby mógł ograniczyć przetwarzanie ISP do nie-AI algorytmów, jeśli takie preferuje.

 

Pierwotnie opublikowane w piątek, 24 kwietnia 2026

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai