Andersonův úhel

Obnovení toho, co vaše kamera zachytila, než ji AI změnila

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image (GPT-2). A photographer examines an open DSLR as a stream of colorful fantasy creatures and glowing imagery bursts out, while he reacts with focused, subdued surprise in a studio setting.

Jak můžete ochránit svatost surové fotografie před zásahem AI, když už byla automaticky prošla AI uvnitř kamery? Nová studie se snaží obnovit ‘pravé’ surové údaje – opět pomocí AI!

 

Zvýšení autenticity AI obrázků za poslední rok nebo tak způsobilo, že mnoho skupin a jednotlivců vzalo stanovisko proti následující erozi důvěry ve fotografii.

V stejné době se koalice pro Provenance a Autenticitu Obsahu (C2PA) pokusila zavést polo-kryptografický standard, který připojuje metadata-based informaci o původu k obrázku, od okamžiku, kdy je zachycen podporovanou kamerou nebo zařízením, s cílem odhalit následné použití generativní AI na těchto ‘originálních’ obrazech:

Schéma původu v systému C2PA, kde metadata zapsaná v okamžiku zachycení mohou být přidána jako deník, umožňující běžné úpravy, jako je jasu a kontrast, ale zaznamenávající významné úpravy, aby se obraz s velkými AI úpravy objevil v médiích, která podporují tento systém. Zdroj - https://spec.c2pa.org/specifications/specifications/1.2/specs/

Schéma původu v systému C2PA, kde metadata zapsaná v okamžiku zachycení mohou být přidána jako deník, umožňující běžné úpravy, jako je jasu a kontrast, ale zaznamenávající významné úpravy, aby se obraz s velkými AI úpravy objevil v médiích, která podporují tento systém. Zdroj

Přijetí tohoto standardu nebylo tak široké, jak koalice doufala, a v současné době pouze 14 kamer podporuje zapsání autentizačních informací přímo do kamery.

Co je zajímavé na myšlence C2PA dát fotografii ‘pas’ hned, jakmile vznikne, je to, že v té době může být už příliš pozdě – protože výrobci kamer nyní rutinně zapojují AI zpracování do samotného vzniku obrazu:

Z paperu z roku 2024 'Advocating Pixel-Level Authentication of Camera-Captured Images': ilustrace toho, jak moderní kamery zavádějí halucinované obsahy v okamžiku zachycení a jak pixel-level autentizační metadata odhalují to. V (A), obraz ze smartphonu je zpracován ISP, kde AI moduly mohou vynalézat detaily během digitálního zoomu nebo korekce expozice, vytvářející realistické obrazy s chybami, jako jsou špatně přečtená čísla na SPZ. V (B), autentizační maska je vložena jako metadata a později překryta, aby odhalila neautentické oblasti, umožňující uživatelům rozlišit původní data od AI-upravených pixelů. Zdroj – https://ieeexplore.ieee.org/ielx7/6287639/10380310/10478521.pdf?tp=&arnumber=10478521&isnumber=10380310&ref=aHR0cHM6Ly9zY2hvbGFyLmdvb2dsZS5jb20ucHkv

Z paperu z roku 2024 ‘Advocating Pixel-Level Authentication of Camera-Captured Images’: ilustrace toho, jak moderní kamery zavádějí halucinované obsahy v okamžiku zachycení a jak pixel-level autentizační metadata odhalují to. V (A), obraz ze smartphonu je zpracován ISP, kde AI moduly mohou vynalézat detaily během digitálního zoomu nebo korekce expozice, vytvářející realistické obrazy s chybami, jako jsou špatně přečtená čísla na SPZ. V (B), autentizační maska je vložena jako metadata a později překryta, aby odhalila neautentické oblasti, umožňující uživatelům rozlišit původní data od AI-upravených pixelů. Zdroj

Skutečnost, že AI ‘zásah’ do surových dat z kamery může nakonec dokonce řídit proces.

Tento typ post-processing není stejný jako současný trend úpravy fotografií v kameře, kdy aplikace nebo kamerová aplikace umožňuje uživateli přehodnotit fotografii v klidu, než je stažena z zařízení.

Rather, zpracování probíhá v ‘černé skříni’ rutině v kamerovém Image Signal Processor (ISP), obvykle v proprietárním runtime, který nezveřejňuje nebo nezveřejňuje surová data ze senzoru (a vezměte v úvahu, že údajně ‘čisté’ formát kamerového RAW není tak ‘čistý’).

Protože, když už můžete vidět fotografii, mohla být již podrobena AI-pomoceným vylepšením, jako je vylepšení při nízkém světle, upscale nebo dokonce nahrazení měsíce.

V mnoha případech může to vést k nepřesným rekonstrukcím, například textu, které by mohly zneplatnit použití takové fotografie jako důkaz, protože ‘pravá’ surová fotografie by nebyla dostupná:

Z nové studie - surová obrazová data jsou zpracována GenAI-pomoceným ISP, aby produkovala finální sRGB výstup, který vypadá jasněji, ale může obsahovat halucinované detaily, jako je ukázka SPZ, kde jsou znaky nesprávně odhadnuty během digitálního zoomu. Skutečná scéna, která není dostupná v praxi, se liší od obou AI-vylepšeného výstupu a mezilehlého autentického obrazu před halucinací. Navržený přístup umožňuje obnovit tento pre-halucinační obraz, obnovující to, co kamerová optika původně zachytila, než AI-založená vylepšení modifikovala obsah. Zdroj - https://arxiv.org/pdf/2604.21879

Z nové studie – surová obrazová data jsou zpracována GenAI-pomoceným ISP, aby produkovala finální sRGB výstup, který vypadá jasněji, ale může obsahovat halucinované detaily, jako je ukázka SPZ, kde jsou znaky nesprávně odhadnuty během digitálního zoomu. Skutečná scéna, která není dostupná v praxi, se liší od obou AI-vylepšeného výstupu a mezilehlého autentického obrazu před halucinací. Navržený přístup umožňuje obnovit tento pre-halucinační obraz, obnovující to, co kamerová optika původně zachytila, než AI-založená vylepšení modifikovala obsah. Zdroj

Uvedené příklady pocházejí z nové výzkumné studie, která nabízí řešení pro ‘nativní AI fotografie’, pomocí alternativních AI procesů k rekonstrukci odhadovaného surového a neupraveného obrazu z procesovaného obrazu.

Autoři uvádějí:

‘Když se AI modely trénované s generativními nebo percepčními ztrátami používají v ISP, jsou náchylné k halucinacím, potenciálně měnící obraz [význam]. Implikace je, že obrazy přímo vygenerované kamerou mohou nyní obsahovat “falešný” obsah, zejména ve smartphonech, kde AI-ISP moduly vidí rostoucí přijetí.

‘Použití GenAI v kamerovém hardwaru označuje změnu paradigmatu v tom, jak vidíme kamerové obrazy a vyzývá tradiční forenzní pohled na kamerové zachycení jako inherentně důvěryhodné.’

Nová práce používá velmi lehký encoder a MLP dekodér, který lze vložit do obrazu s hmotnostním penaltím pouze 180kb. Cílem je vývoj kódovacích systémů, které jsou dostatečně rychlé, aby extrahovaly původní obraz v reálném čase.

Z nové studie: GenAI-založené super-resolution uvnitř kamerového ISP může jemně měnit obličejové rysy, měnící vzhled nebo vnímanou identitu prostřednictvím změn v pohledu a tvaru úst. Vylepšení při nízkém světle může podobně měnit obrazový obsah, ovlivňující interpretaci, přestože zlepšuje vizuální kvalitu. V příkladu QR kódu, vylepšení dělá obraz více atraktivním, ale činí kód nečitelným. Metoda umožňuje obnovit autentický obraz před těmito halucinacemi, obnovující původní obličejové detaily a čitelný QR kód.

Z nové studie: GenAI-založené super-resolution uvnitř kamerového ISP může jemně měnit obličejové rysy, měnící vzhled nebo vnímanou identitu prostřednictvím změn v pohledu a tvaru úst. Vylepšení při nízkém světle může podobně měnit obrazový obsah, ovlivňující interpretaci, přestože zlepšuje vizuální kvalitu. V příkladu QR kódu, vylepšení dělá obraz více atraktivním, ale činí kód nečitelným. Metoda umožňuje obnovit autentický obraz před těmito halucinacemi, obnovující původní obličejové detaily a čitelný QR kód.

Alternativně by výrobci kamer mohli uživatelům poskytnout přístup k skutečně neupraveným surovým datům; nicméně, toto se zdá být omezeno na velmi vysoký koncový vybavení. V mobilním a spotřebitelském prostoru, bohužel, přístup k neupraveným fotografiím může být považován za ‘niche’ nebo okrajový zájem.

Zatímco spotřebitelské kamery vždy aplikovaly určitou úroveň post-processing, před vznikem edge AI, algoritmy používané byly minimálně ‘interpretativní’ a nebyly pravděpodobně měnit obsah fotografie stejným významným způsobem, jakým mohou současné AI metody.

Zajímavé je, že s ohledem na rozsah, v jakém byla Samsungova ‘nahrazení měsíce’ kritizována před několika lety, Samsungův AI Centrum v Torontu je jedním z účastníků nové práce, která se nazývá Addressing Image Authenticity When Cameras Use Generative AI, a je vedena příspěvky od pěti výzkumníků z University of Toronto.

Metoda

Autoři používají jedinou jinou projekt, který se zdá přímo řešit problém perturbace-navrhovaného:
2024 paper Advocating Pixel-Level Authentication of Camera-Captured Images, který navrhl ‘binární autentizační masku’ vymezující oblasti změněné v kameře AI procesy:

Vpravo, 'autentizační maska' z paperu z roku 2024 odhaluje oblasti oblohy ovlivněné AI 'vyhlazováním' v kameře.

Vpravo, ‘autentizační maska’ z paperu z roku 2024 odhaluje oblasti oblohy ovlivněné AI ‘vyhlazováním’ v kameře.

Avšak, systém nenabídl žádnou metodu, jak by ‘pravý’ obraz mohl být obnoven, což nová práce řeší, zatímco uznává dluh vůči předchozímu.

Cílem nové práce je umožnit uživatelům obnovit obraz, který je co nejblíže tomu, co skutečně zasáhlo senzor, než zpracování proběhlo:

Přehled navržené metody. V (A), v okamžiku zachycení, výstupní obraz ISP obsahující halucinace je předán přes zmrazený předtrénovaný encoder, a jeho latentní funkce jsou kombinovány se prostorovými souřadnicemi a krmeny do MLP, které operuje na pixelové úrovni, aby predikovalo nehalucinovaný obraz, s tréninkem vedeným ztrátou proti autentickému obrazu. Váhový a MLP jsou pak uloženy jako metadata vedle obrazu. V (B), v době inference, tyto váhy jsou načteny z metadata a použity s encodérem a MLP, aby rekonstruovaly nehalucinovaný obraz.

Přehled navržené metody. V (A), v okamžiku zachycení, výstupní obraz ISP obsahující halucinace je předán přes zmrazený předtrénovaný encoder, a jeho latentní funkce jsou kombinovány se prostorovými souřadnicemi a krmeny do MLP, které operuje na pixelové úrovni, aby predikovalo nehalucinovaný obraz, s tréninkem vedeným ztrátou proti autentickému obrazu. Váhový a MLP jsou pak uloženy jako metadata vedle obrazu. V (B), v době inference, tyto váhy jsou načteny z metadata a použity s encodérem a MLP, aby rekonstruovaly nehalucinovaný obraz.

V okamžiku zachycení, v nové metodě, zpracovaný obraz je předán přes zmrazený encoder, který ho převádí do kompaktní latentní reprezentace. Poté jsou relevantní prostorové souřadnice kombinovány s těmito funkcemi a krmeny do lehkého MLP, které operuje na pixelové úrovni, aby predikovalo původní obrazový obsah – učí se, efektivní, odečítat halucinované prvky prostřednictvím rekonstrukční ztráty, proti autentickým cílům.

Encoder a dekodér jsou předtrénováni na spárovaných autentických a halucinovaných obrazech, poté rychle fine-tuned pro každou zachycenou fotografii, s jejich váhami uloženými jako metadata vedle fotografie, přidávající pouze malou velikostní režii.

V době prohlížení, tyto uložené váhy jsou načteny a znovu použity pro spuštění stejného encodéru a MLP, umožňující obnovit obraz, který se blíží tomu, co kamerový senzor původně zachytil, bez zavedení nových syntetických obsahů.

Data a testy

Autoři otestovali novou metodu pomocí dvou nejčastěji implementovaných úkolů post-processing ISP: super-resolution (SR, včetně pro zvětšené oblasti); a fotografie při nízkém světle.

Pro obecnou (‘přirozenou’) sekci SR testů, mnoho příkladů textu bylo zahrnuto do dat, protože ISP SR rutiny jsou známy tím, že mění text (například čísla na SPZ, ale viz předchozí příklady v článku). Protože textová deformace je samostatný problém, byl tento problém léčen jako podmnožina SR testů, s vyhrazenými daty.

Uvedený encoder byl trénován pro každou z dvou modalit, které byly testovány, a každá byla vybrána na základě toho, který AI ISP modul byl pravděpodobně aktivován během zachycení (tj. ‘nízké světlo’ modul, ve tmavých podmínkách).

Autoři použili DIV2K dataset pro trénink super-resolution, poháněný populární RealESRGAN sítí. V souladu s výše zmíněnou prací z roku 2024 o ISP interference, výzkumníci vygenerovali spárovaná data s neovlivněným a halucinovaným obsahem.

Pro sekci SR textu, autoři použili 2023 MARCONet model SR textu:

Z paperu MARCONet z roku 2023, příklady reálných nízkorozlišených a ekvivalentních upscaled textů. Zdroj - https://arxiv.org/pdf/2303.14726

Z paperu MARCONet z roku 2023, příklady reálných nízkorozlišených a ekvivalentních upscaled textů. Zdroj

Pro vytvoření spárovaných dat v tomto případě, výzkumníci spustili nehalucinované obrazy přes MARCONet. Dvě tisíce obrazů byly vygenerovány z původního kódu, s 200 vyhrazeno pro validaci, spolu s dalšími 200 pro testování.

Pro testy při nízkém světle, LOw-Light dataset (LOL) dataset z čínského paperu z roku 2018 byl přijat:

Z čínského LOL datasetu z roku 2018, příklady stejných obrazů při různých expozicích a úrovních tmavosti a degradace. Zdroj - https://arxiv.org/pdf/1808.04560

Z čínského LOL datasetu z roku 2018, příklady stejných obrazů při různých expozicích a úrovních tmavosti a degradace. Zdroj

Soupeřící rámce

Pro vyhodnocení metody, byly provedeny srovnávací testy se třemi specifickými základními metrikami, trénovanými za shodných podmínek. První, SIREN a NeRF byly předtrénovány na spárovaných autentických a halucinovaných obrazech a poté fine-tuned v době zachycení po stejnou dobu jako navržený přístup, nabízející přímé srovnání s NeRF.

Druhý, MLP s naučeným kódováním založeným na hashgrid metodě z Instant-NGP byl použit, s hash tabulkovými položkami a MLP společně optimalizovanými.

Třetí, byl implementován baseline pro blind image-to-image translation pomocí 64MB NAFNet modelu, trénovaného jako pixel-to-pixel regrese systém bez přístupu k metadata.

V tréninku, Adam optimalizátor byl použit přes PyTorch, pro předtrénování a fine-tuning. Encoder a MLP byly trénovány po 50 000 epoch s velikostí batchu 32, s modality-specifickými encodéry trénovanými pro každou úlohu (tj. SR, text-SR, nízké světlo).

Fine-tuning proběhlo přibližně za tři sekundy na NVIDIA V100 GPU s 32GB VRAM. Autoři poznamenávají, že zatímco on-device optimalizace je cílovým prostředím a scénářem, nebylo realistické implementovat to pro všechny rámce, a proto všechny testy byly provedeny v desktopovém prostředí:

Srovnávací test proti metadata-pomoceným MLP-založeným základním metrikám, včetně SIREN, NeRF a hash-grid metody, spolu s blind recovery pomocí NAFNet. Výsledky jsou hlášeny jako PSNR v decibelech přes tři úkoly: přírodní obraz super-resolution na DIV2K; text super-resolution na MARCONet; a nízké světlo vylepšení na LOL, s navrženou metodou dosahující nejvyšších skórů v každém případě.

Srovnávací test proti metadata-pomoceným MLP-založeným základním metrikám, včetně SIREN, NeRF a hash-grid metody, spolu s blind recovery pomocí NAFNet. Výsledky jsou hlášeny jako PSNR v decibelech přes tři úkoly: přírodní obraz super-resolution na DIV2K; text super-resolution na MARCONet; a nízké světlo vylepšení na LOL, s autoři metodou dosahující nejvyšších skórů v každém případě.

Pro MLP-založené přístupy, výkon závisel silně na vstupní reprezentaci, kde modely trénované pouze se prostorovými souřadnicemi bojovaly během předtrénování a nezlepšovaly se během omezené fáze fine-tuning. Přidání barevné informace vedlo k silnějším výsledkům.

Blind recovery pomocí NAFNet fungovala dobře na DIV2K, kde mapa z degradovaných na čisté obrazy byla relativně stabilní, ale selhala na MARCONet a LOL, kde existovaly multiple možné rekonstrukce a model postrádal informace potřebné k vyřešení této nejednoznačnosti.

Tento efekt byl nejvíce patrný v nízkém světle vylepšení, kde původní jasu scény nemohla být spolehlivě odhadnuta z procesovaného obrazu samotného.

Autoři uvádějí:

‘[V] syntetických MARCONet datech, obrazy s různými silami rozostření mapují na stejný halucinovaný obraz. Můžete vidět z výsledků, že naše navržená metoda překonává konkurenty napříč všemi datovými sadami.’

V srovnávacím testu výše, můžeme vidět, jak dobře různé metody fungují v závislosti na tom, kolik času mají k dispozici pro běh v okamžiku pořízení fotografie. Trénování modelu od začátku pro každou fotografii může produkovat silné výsledky, jako je vidět u SIREN, NeRF a hash-grid – ale to trvá příliš dlouho, aby bylo praktické uvnitř kamery.

Místo toho, autoři metoda dělá většinu práce dopředu, s rychlou úpravou v době zachycení, umožňující dosáhnout lepších výsledků v rámci úzkých časových limitů (3, 5 nebo deset sekund).

Srovnávací test proti metadata-pomoceným MLP-založeným základním metrikám, včetně SIREN, NeRF a hash-grid metody, spolu s blind recovery pomocí NAFNet. Výsledky jsou hlášeny jako PSNR v decibelech přes tři úkoly: přírodní obraz super-resolution na DIV2K; text super-resolution na MARCONet; a nízké světlo vylepšení na LOL, s autoři metodou dosahující nejvyšších skórů v každém případě.

Srovnávací test proti metadata-pomoceným MLP-založeným základním metrikám, včetně SIREN, NeRF a hash-grid metody, spolu s blind recovery pomocí NAFNet. Prosím, odkážete se na zdroj paperu pro (slightly) lepší rozlišení.

Nahoře jsou ukázány kvalitativní výsledky na DIV2K, kde vylepšení metody zavedly viditelné halucinace. GAN-založený super-resolution model změnil barvu očí, a blind recovery bojovala s rekonstrukcí původního obrazu. NeRF a hash-grid produkovaly artefakty ve strukturovaných oblastech, jako jsou okna a text, zatímco navržená metoda se blížila autentickému obrazu.

Nakonec, v obrázku výše, vidíme výsledky na LOL datasetu, s jasně vyšším kontrastem pro vizualizaci.

Blind recovery nemohla vyřešit neznámou jasu scény, zatímco navržená metoda lépe rekonstruovala textury a obnovila změněné znaky, jako je korekce ‘1’ zpět na ‘i’, bez přidání artefaktů.

Závěr

Je pravděpodobně nesporné, ani nebylo nikdy sporné, že ‘kamera nikdy nelže’. Každé rozhodnutí o tom, co fotografovat a kdy fotografovat, spolu s tím, jak prezentovat a kontextualizovat to, je ve skutečnosti politické nebo sociální rozhodnutí.

I nejstarší metody následného zpracování, například dodging and burning (již dávno převedené do nástrojů Photoshopu) jsou vysoce subjektivními akty uměleckého rozhodování a preference.

To však není důvod vzdát se alespoň cíle ‚objektivních‘ snímků. Je rozumné, aby běžný uživatel mohl, byť s určitými obtížemi, získat neupravená surová data ze snímače svých fotografií; nebo aby alespoň mohl omezit následné zpracování ISP na algoritmy bez AI, pokud tomu dává přednost.

 

Poprvé publikováno v pátek 24. dubna 2026

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai