KÄ t Andersona
Przywracanie tego, co twoja kamera uchwyciÅa, zanim AI to zmieniÅa

Jak moÅžna chroniÄ nienaruszalnoÅÄ surowej fotografii przed ingerencjÄ AI, gdy juÅž zostaÅa automatycznie przetworzona przez AI wewnÄ trz kamery? Nowe badania majÄ na celu przywrÃģciÄ âprawdziweâ dane sensoryczne â rÃģwnieÅž przy uÅžyciu AI!
Â
Wzrost autentycznoÅci obrazÃģw AI w ciÄ gu ostatniego roku lub dwÃģch spowodowaÅ, Åže wiele grup i osÃģb zaczÄÅo protestowaÄ przeciwko wynikajÄ cej z tego erozji zaufania do fotografii.
W tym samym okresie, Koalicja na rzecz Pochodzenia i AutentycznoÅci TreÅci (C2PA) prÃģbowaÅa wprowadziÄ pÃģÅ-kryptograficzny standard, ktÃģry doÅÄ cza metadane oparte na pochodzeniu informacji do obrazu, od samego momentu, gdy jest on uchwycany przez obsÅugiwanÄ kamerÄ lub urzÄ dzenie, w nadziei na ujawnienie wszelkich pÃģÅšniejszych uÅžycia generatywnego AI na tych âoryginalnychâ zdjÄciach:

Schemat pochodzenia w systemie C2PA, gdzie metadane zapisywane w momencie uchwycenia mogÄ byÄ dodawane jak dziennik, umoÅžliwiajÄ c zwyczajowe dostosowania, takie jak jasnoÅÄ i kontrast, ale rejestrujÄ c gÅÃģwne dostosowania, tak aby obraz znacznie zmodyfikowany przez AI wyÅwietlaÅ siÄ jako taki w mediach, ktÃģre obsÅugujÄ ten system. ÅđrÃģdÅo
PrzyjÄcie tego standardu nie byÅo tak powszechne, jak koalicja tego oczekiwaÅa, a obecnie tylko 14 kamer obsÅuguje zapisywanie informacji o autentycznoÅci wewnÄ trz kamery.
To, co jest interesujÄ ce w pomysÅach C2PA na nadanie zdjÄciu âpasyâ zaraz po jego powstaniu, to fakt, Åže moÅže to byÄ juÅž za pÃģÅšno â poniewaÅž producenci kamer teraz rutynowo wbudowujÄ przetwarzanie AI w sam proces tworzenia obrazu:

Z artykuÅu z 2024 roku âAdvocating Pixel-Level Authentication of Camera-Captured Imagesâ: ilustracja tego, jak nowoczesne potoki kamer wprowadzajÄ treÅci halucynacyjne w momencie uchwycenia i jak metadane autentycznoÅci na poziomie pikseli ujawniajÄ je. W (A), obraz z czujnika smartfona jest przetwarzany przez ISP, gdzie moduÅy AI mogÄ wymyÅlaÄ szczegÃģÅy podczas cyfrowego zoomu lub korekcji ekspozycji, wytwarzajÄ c realistyczne obrazy z bÅÄdami, takimi jak niepoprawnie odczytane cyfry tablicy rejestracyjnej. W (B), maska autentycznoÅci jest osadzona jako metadane i pÃģÅšniej naÅoÅžona, aby ujawniÄ nieautentyczne obszary, umoÅžliwiajÄ c uÅžytkownikom odrÃģÅžnienie oryginalnych danych od pikseli zmodyfikowanych przez AI. ÅđrÃģdÅo
W rzeczywistoÅci, ta interferencja AI w uchwyceniu surowych danych z czujnika kamery moÅže ostatecznie nawet staÄ siÄ procesem zarzÄ dzajÄ cym.
Ten rodzaj przetwarzania nie jest taki sam, jak obecna tendencja do modyfikowania zdjÄÄ w kamerze, gdzie aplikacja na telefonie lub aplikacja kamerowa pozwala uÅžytkownikowi przemyÅleÄ zdjÄcie w spokoju, zanim zostanie nawet pobrane z urzÄ dzenia.
Raczej, przetwarzanie odbywa siÄ w âczarnej skrzynceâ rutynie w procesorze sygnaÅu obrazu (ISP) kamery, zwykle w czasie wykonywania, ktÃģry nie ujawnia ani nie udostÄpnia surowych danych czujnika (i uwzglÄdnij, Åže rzekomo âczystyâ format RAW nie jest tak âsurowyâ).
Dlatego, gdy tylko moÅžesz zobaczyÄ zdjÄcie, moÅže ono zostaÄ poddane AI-uÅatwionym ulepszeniom, takim jak poprawa jakoÅci w niskim Åwietle, skalowanie lub nawet zastÄ pienie ksiÄÅžyca.
W wielu przypadkach moÅže to prowadziÄ do nieprawidÅowych rekonstrukcji, na przykÅad tekstu, ktÃģre mogÄ uniewaÅžniÄ uÅžycie takiego obrazu jako dowodu, poniewaÅž prawdziwe âsuroweâ zdjÄcie nie byÅoby dostÄpne:
<img class=" wp-image-413558" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-1-5.jpg" alt="Z nowego artykuÅu â surowe zdjÄcie z czujnika jest przetwarzane przez ISP z obsÅugÄ GenAI, wytwarzajÄ c ostateczny wyjÅcie sRGB, ktÃģre wyglÄ da wyraÅšniej, ale moÅže zawieraÄ halucynacyjne szczegÃģÅy, jak pokazano w przykÅadzie tablicy rejestracyjnej, gdzie znaki sÄ niepoprawnie wnioskowane podczas cyfrowego zoomu. Prawdziwa scena, ktÃģra nie jest dostÄpna w praktyce, rÃģÅžni siÄ od obu wyjÅÄ AI i poÅredniego autentycznego obrazu przed halucynacjÄ . Proponowane podejÅcie umoÅžliwia odzyskanie tego obrazu przed halucynacjÄ , przywracajÄ c to, co kamera uchwyciÅa przed modyfikacjÄ treÅci przez AI. ÅđrÃģdÅo
PrzykÅady powyÅžej pochodzÄ z nowego artykuÅu badawczego, ktÃģry oferuje rozwiÄ zanie problemu ârodzimych zdjÄÄ AIâ, uÅžywajÄ c alternatywnych procesÃģw AI do odtworzenia oszacowanego surowego i nieskaÅžonego obrazu z przetworzonego obrazu.
Autorzy stwierdzajÄ :
âGdy modele AI szkolone z generatywnymi lub percepcyjnymi stratami sÄ uÅžywane w ISP, sÄ one skÅonne do halucynacji treÅci, potencjalnie zmieniajÄ c znaczenie obrazu. Implikacja jest taka, Åže obrazy bezpoÅrednio wyjÅciowe z kamery mogÄ teraz zawieraÄ âfaÅszywÄ â treÅÄ, zwÅaszcza w kamerach smartfonÃģw, gdzie moduÅy AI-ISP sÄ coraz czÄÅciej stosowane.
âUÅžycie GenAI w sprzÄcie kamer oznacza zmianÄ paradygmatu w sposobie, w jaki postrzegamy obrazy kamer i wyzwania tradycyjnego poglÄ du na obrazy uchwycane przez kamerÄ jako niezawodne.â
Nowa praca uÅžywa bardzo lekkiego kodera i MLP dekodera, ktÃģry moÅže byÄ zawarty wewnÄ trz obrazu przy karze wagi tylko 180kb. Celem jest rozwÃģj systemÃģw kodowania wystarczajÄ co szybkich, aby ponownie wyodrÄbniÄ oryginalny obraz w czasie rzeczywistym.

Z nowego artykuÅu: super-rozrost oparty na GenAI wewnÄ trz ISP kamery moÅže delikatnie zmieniaÄ cechy twarzy, zmieniajÄ c wyglÄ d lub postrzeganÄ toÅžsamoÅÄ przez zmiany w ksztaÅcie oczu i ust. Poprawa jakoÅci w niskim Åwietle moÅže podobnie modyfikowaÄ treÅÄ obrazu, wpÅywajÄ c na interpretacjÄ, pomimo poprawy jakoÅci wizualnej. W przykÅadzie kodu QR, poprawa sprawia, Åže obraz jest bardziej atrakcyjny, ale czyni kod nieczytelny. Metoda umoÅžliwia odzyskanie autentycznego obrazu przed halucynacjami, przywracajÄ c oryginalne cechy twarzy i czytelny kod QR.
Alternatywnie, producenci kamer mogliby daÄ uÅžytkownikom dostÄp do prawdziwie nieskaÅžonych zrzutÃģw czujnika; jednak wydaje siÄ, Åže moÅže to pozostaÄ ograniczone do bardzo wysokiej klasy sprzÄtu. W przestrzeni mobilnej i konsumenckiej, niestety, dostÄp do nieprzetworzonych zdjÄÄ moÅže byÄ uwaÅžany za âniszowyâ lub marginalny.
PoniewaÅž kamery konsumenckie zawsze stosowaÅy pewien poziom przetwarzania, przed pojawieniem siÄ edge AI, algorytmy uÅžywane byÅy minimalnie âinterpretatywneâ i nieprawdopodobne, aby zmieniÄ treÅÄ zdjÄcia w taki sam sposÃģb, w jaki mogÄ to zrobiÄ obecne metody AI.
InteresujÄ ce jest to, Åže biorÄ c pod uwagÄ, jak bardzo polityka âzastÄ pienia ksiÄÅžycaâ Samsunga byÅa krytykowana kilka lat temu, centrum AI Samsunga w Toronto jest jednym z uczestnikÃģw nowej pracy, ktÃģra nosi tytuÅ Addressing Image Authenticity When Cameras Use Generative AI, i jest prowadzona przez piÄciu badaczy z Uniwersytetu w Toronto.
Metoda
Autorzy wykorzystujÄ jedyny inny projekt, ktÃģry wydaje siÄ bezpoÅrednio zajmowaÄ problemem perturbacji wedÅug projektu: artykuÅ z 2024 roku paper Advocating Pixel-Level Authentication of Camera-Captured Images, ktÃģry zaproponowaÅ âbinarnÄ maskÄ autentycznoÅciâ wyznaczajÄ cÄ obszary zmienione przez procesy AI w kamerze:

Z prawej strony, maska autentycznoÅci z artykuÅu z 2024 roku ujawnia obszary nieba dotkniÄte procesami âwygÅadzaniaâ AI w kamerze.
Jednak system nie oferowaÅ Åžadnej metody, aby âprawdziwyâ obraz mÃģgÅ byÄ odzyskany, co nowa praca rozwiÄ zuje, przyznajÄ c siÄ do dÅugu wobec wczeÅniejszego artykuÅu.
Celem nowej pracy jest umoÅžliwienie uÅžytkownikom odzyskania obrazu, ktÃģry jest jak najbliÅžszy temu, co rzeczywiÅcie uderzyÅo w czujnik, zanim przetwarzanie miaÅo miejsce:

PrzeglÄ d proponowanej metody. W (A), w momencie uchwycenia, obraz wyjÅciowy ISP zawierajÄ cy halucynacje jest przekazywany przez zamroÅžony wstÄpnie wyszkolony koder, a jego cechy latentne sÄ poÅÄ czone z wspÃģÅrzÄdnymi przestrzennymi i wprowadzane do MLP, ktÃģre dziaÅa na poziomie pikseli, aby przewidzieÄ niehalucynowany obraz, z szkoleniem kierowanym przez stratÄ wobec autentycznego obrazu. Wagi kodera i MLP sÄ nastÄpnie zapisywane jako metadane obok obrazu. W (B), w czasie inferencji, te wagi sÄ pobierane z metadanych i uÅžywane z koderem i MLP, aby odtworzyÄ niehalucynowany obraz.
W momencie uchwycenia, w nowej metodzie, przetworzony obraz jest przekazywany przez zamroÅžony koder, ktÃģry konwertuje go w kompaktne latentne przedstawienie. NastÄpnie, odpowiednie wspÃģÅrzÄdne przestrzenne sÄ poÅÄ czone z tymi cechami i wprowadzane do lekkiego MLP, ktÃģre dziaÅa na poziomie pikseli, aby przewidzieÄ oryginalnÄ treÅÄ obrazu â uczÄ c siÄ, skutecznie, aby odjÄ Ä halucynowane elementy przez rekonstrukcyjnÄ stratÄ, wobec autentycznych celÃģw.
Koder i dekoder sÄ wstÄpnie szkolone na poÅÄ czonych autentycznych i halucynowanych obrazach, a nastÄpnie szybko dostosowane do kaÅždego uchwycenia obrazu, z ich wagami zapisanymi jako metadane obok samego obrazu, dodajÄ c tylko niewielkÄ karÄ rozmiaru.
W czasie wyÅwietlania, te zapisane wagi sÄ wyodrÄbnione i ponownie uÅžyte, aby uruchomiÄ ten sam koder i MLP, umoÅžliwiajÄ c odzyskanie obrazu, ktÃģry jest jak najbliÅžszy temu, co kamera sensor uchwyciÅa, bez wprowadzania nowej syntetycznej treÅci.
Dane i testy
Autorzy przetestowali nowÄ metodÄ, uÅžywajÄ c dwÃģch najczÄÅciej wdraÅžanych zadaÅ przetwarzania ISP: super-rozrostu (w tym dla obszarÃģw powiÄkszonych) oraz fotografii w niskim Åwietle.
Dla sekcji testowej super-rozrostu (ânaturalny obrazâ), wiele przykÅadÃģw tekstu zostaÅo uwzglÄdnionych w danych, poniewaÅž rutyny super-rozrostu ISP sÄ znane z modyfikowania tekstu (na przykÅad numerÃģw tablic rejestracyjnych, ale zobacz przykÅady wczeÅniej w artykule). PoniewaÅž znieksztaÅcenie tekstu jest oddzielnym problemem, zostaÅo ono potraktowane jako podzbiÃģr testÃģw super-rozrostu, z dedykowanymi danymi.
Wspomniany koder zostaÅ wyszkolony dla kaÅždej z dwÃģch modalnoÅci testowych, a kaÅždy zostaÅ wybrany na podstawie tego, ktÃģry moduÅ AI ISP byÅ najprawdopodobniej zaangaÅžowany w czasie uchwycenia (tj. moduÅ âniskiego ÅwiatÅaâ w ciemnych warunkach).
Autorzy uÅžyli zestawu danych DIV2K do szkolenia super-rozrostu, zasilanego przez popularnÄ sieÄ RealESRGAN. W zgodzie z wczeÅniej wspomnianÄ pracÄ z 2024 roku na temat interferencji ISP, badacze wygenerowali poÅÄ czone dane zawierajÄ ce niezmienionÄ i halucynowanÄ treÅÄ.
Dla sekcji testowej super-rozrostu tekstu, autorzy uÅžyli modelu MARCONet z 2023 roku:

Z artykuÅu z 2023 roku MARCONet, przykÅady rzeczywistych niskiej rozdzielczoÅci i odpowiednich powiÄkszonych tekstÃģw. ÅđrÃģdÅo
Aby utworzyÄ poÅÄ czone dane w tym przypadku, badacze przeprowadzili niehalucynowane obrazy przez MARCONet. Dwa tysiÄ ce obrazÃģw zostaÅo wygenerowanych z oryginalnego kodu, z 200 odÅoÅžonymi do walidacji, wraz z kolejnymi 200 do testowania.
Dla testÃģw niskiego ÅwiatÅa, zestaw danych LOw-Light (LOL) z chiÅskiego artykuÅu z 2018 roku zostaÅ przyjÄty:

Z chiÅskiego zestawu danych LOL z 2018 roku, przykÅady tych samych obrazÃģw przy rÃģÅžnych ekspozycjach i poziomach ciemnoÅci i degradacji. ÅđrÃģdÅo
RywalizujÄ ce ramy
Aby oceniÄ metodÄ, przeprowadzono porÃģwnania z trzema konkretnymi liniami bazowymi szkolonymi w warunkach dopasowanych. Po pierwsze, SIREN i NeRF zostaÅy wstÄpnie wyszkolone na poÅÄ czonych autentycznych i halucynowanych obrazach, a nastÄpnie dostosowane w czasie uchwycenia przez ten sam czas, co proponowane podejÅcie, oferujÄ c bezpoÅrednie porÃģwnanie do NeRF.
Drugie, MLP z nauczonym kodowaniem opartym na metodzie hashgrid z Instant-NGP zostaÅo uÅžyte, z wpisami tabeli hash i MLP wspÃģlnie zoptymalizowanymi.
Rozmiar osadzania i pojemnoÅÄ sieci zostaÅy dopasowane do docelowego kodera i MLP, z eksperymentami obejmujÄ cymi optymalizacjÄ na poziomie obrazu z szkoleniem od podstaw i dostosowaniem po wstÄpnym szkoleniu.
Trzecie, zaimplementowano liniÄ bazowÄ tÅumaczenia obrazu na obraz bez dostÄpu do metadanych, uÅžywajÄ c modelu NAFNet o rozmiarze 64MB, szkolonego jako system regresji piksel-na-piksel bez dostÄpu do metadanych.
Podczas szkolenia, optymalizator Adam zostaÅ uÅžyty w PyTorch, zarÃģwno do wstÄpnego szkolenia, jak i dostosowania. Koder i MLP zostaÅy wyszkolone przez 50 000 epok przy rozmiarze partii 32, z modalitycznymi koderami szkolonymi dla kaÅždego zadania (tj. SR, text-SR, niskie ÅwiatÅo).
Dostosowanie odbywaÅo siÄ przez okoÅo trzy sekundy na karcie graficznej NVIDIA V100 z 32GB pamiÄci VRAM. Autorzy zauwaÅžajÄ , Åže chociaÅž optymalizacja na urzÄ dzeniu jest celem Årodowiska i scenariusza, nie byÅo to realistyczne do wdroÅženia dla wszystkich ram, i dlatego wszystkie testy zostaÅy przeprowadzone w Årodowisku biurkowym:

PorÃģwnanie wynikÃģw z liniÄ bazowÄ MLP z metadanymi, w tym SIREN, NeRF i metodÄ hash-grid, oraz odzyskiwaniem bez metadanych przy uÅžyciu NAFNet. Wyniki sÄ raportowane jako PSNR w decybelach przez trzy zadania: super-rozrost naturalnych obrazÃģw na DIV2K; super-rozrost tekstu na MARCONet; i poprawa jakoÅci w niskim Åwietle na LOL, z metodÄ autorÃģw osiÄ gajÄ cÄ najwyÅžsze wyniki w kaÅždym przypadku.
Dla podejÅÄ opartych na MLP, wyniki zaleÅžaÅy silnie od reprezentacji wejÅciowej, gdzie modele szkolone przy uÅžyciu tylko wspÃģÅrzÄdnych przestrzennych miaÅy trudnoÅci w czasie wstÄpnego szkolenia i nie byÅy w stanie poprawiÄ wynikÃģw w ograniczonym etapie dostosowania. Dodanie informacji kolorystycznych doprowadziÅo do lepszych wynikÃģw.
Odzyskiwanie bez metadanych przy uÅžyciu NAFNet dziaÅaÅo dobrze na DIV2K, gdzie mapa z degradowanego do czystego obrazu byÅa wzglÄdnie stabilna, ale zawiodÅo na MARCONet i LOL, gdzie istniaÅo wiele prawdopodobnych rekonstrukcji i model nie miaÅ wystarczajÄ cej informacji, aby rozwiÄ zaÄ tÄ niejednoznacznoÅÄ.
Ten efekt byÅ najbardziej widoczny w poprawie jakoÅci w niskim Åwietle, gdzie oryginalna jasnoÅÄ sceny nie mogÅa byÄ wiarygodnie wywnioskowana z samego przetworzonego obrazu.
Autorzy stwierdzajÄ :
âW syntetycznych danych MARCONet, obrazy z rÃģÅžnÄ siÅÄ rozmycia mapujÄ siÄ na ten sam halucynowany obraz. MoÅžna zobaczyÄ z wynikÃģw, Åže nasze proponowane podejÅcie przewyÅžsza konkurentÃģw we wszystkich zestawach danych.â

W powyÅžszym porÃģwnaniu moÅžna zobaczyÄ, jak dobrze rÃģÅžne metody dziaÅajÄ w zaleÅžnoÅci od czasu, jaki majÄ do dyspozycji w momencie uchwycenia zdjÄcia. Szkolenie modelu od podstaw dla kaÅždego obrazu moÅže daÄ dobre wyniki, jak widaÄ w przypadku SIREN, NeRF i hash-grid â ale to zajmuje zbyt duÅžo czasu, aby byÅo praktyczne wewnÄ trz kamery.
Zamiast tego, metoda autorÃģw wykonuje wiÄkszoÅÄ pracy z wyprzedzeniem, z szybkim dostosowaniem w czasie uchwycenia, co pozwala na lepsze wyniki w ramach ograniczeÅ czasowych (3, 5 lub dziesiÄÄ sekund).

PorÃģwnanie wynikÃģw z liniÄ bazowÄ MLP z metadanymi, w tym SIREN, NeRF i metodÄ hash-grid, oraz odzyskiwaniem bez metadanych przy uÅžyciu NAFNet. Wyniki sÄ raportowane jako PSNR w decybelach przez trzy zadania: super-rozrost naturalnych obrazÃģw na DIV2K; super-rozrost tekstu na MARCONet; i poprawa jakoÅci w niskim Åwietle na LOL, z metodÄ autorÃģw osiÄ gajÄ cÄ najwyÅžsze wyniki w kaÅždym przypadku. ProszÄ odnosiÄ siÄ do oryginalnego artykuÅu dla (nieznacznie) lepszej rozdzielczoÅci.
PowyÅžej przedstawiono wyniki jakoÅciowe na DIV2K, gdzie metody poprawy wprowadziÅy widoczne halucynacje. Model super-rozrostu oparty na GAN zmieniÅ kolor oczu, a odzyskiwanie bez metadanych miaÅo trudnoÅci z odtworzeniem oryginalnego obrazu. NeRF i hash-grid wyprodukowaÅy artefakty w strukturalnych obszarach, takich jak okna i tekst, podczas gdy proponowana metoda bardziej dokÅadnie dopasowaÅa siÄ do autentycznego obrazu.

Na koniec, na powyÅžszym rysunku widaÄ wyniki na zestawie danych LOL, z jasnoÅciÄ skalowanÄ do wizualizacji.
Odzyskiwanie bez metadanych nie mogÅo rozwiÄ zaÄ nieznanej skali jasnoÅci, podczas gdy proponowana metoda lepiej odtworzyÅa tekstury i przywrÃģciÅa zmienione znaki, takie jak poprawienie â1â na âiâ, bez dodawania artefaktÃģw.
Wnioski
Prawdopodobnie nie moÅžna twierdziÄ, Åže âkamera nigdy nie kÅamieâ. KaÅžda decyzja o tym, co sfotografowaÄ i kiedy to zrobiÄ, oraz jak to przedstawiÄ i umieÅciÄ w kontekÅcie, jest w istocie decyzjÄ politycznÄ lub spoÅecznÄ .
Nawet najstarsze metody przetwarzania, takie jak dodging i burning (przeniesione do narzÄdzi Photoshop), sÄ wysoko subiektywnymi aktami decyzji artystycznej i preferencji.
Jednak nie ma powodu, aby zrezygnowaÄ z celu âobiektywnychâ uchwycieÅ obrazu; i wydaje siÄ rozsÄ dne, aby przeciÄtny konsument mÃģgÅ, nawet z pewnymi trudnoÅciami, uzyskaÄ dostÄp do âniezmasygowanychâ surowych zrzutÃģw czujnika ze zdjÄÄ, ktÃģre robi; lub przynajmniej, aby mÃģgÅ ograniczyÄ przetwarzanie ISP do nie-AI algorytmÃģw, jeÅli takie preferuje.
Â
Pierwotnie opublikowane w piÄ tek, 24 kwietnia 2026












