Unghiul lui Anderson

Restabilirea a ceea ce a capturat camera înainte de a fi modificat de AI

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image (GPT-2). A photographer examines an open DSLR as a stream of colorful fantasy creatures and glowing imagery bursts out, while he reacts with focused, subdued surprise in a studio setting.

Cum puteți proteja sfințenia unei fotografii brute de interferența AI atunci când aceasta a fost deja procesată automat prin AI în interiorul camerei? O nouă cercetare își propune să restaureze datele “adevărate” ale senzorului – și cu ajutorul AI!

 

Crescăndă autenticitatea imaginilor AI în ultimul an sau doi a determinat multe grupuri și indivizi să se revolte împotriva erodării încrederii în fotografie.

În aceeași perioadă, Coaliția pentru Proveniență și Autenticitate a Conținutului (C2PA) a încercat să difuzeze un standard semi-criptografic care atașează informații de proveniență bazate pe metadate unei imagini, de la momentul capturării acesteia de către o cameră sau dispozitiv suportat, în speranța de a demasca orice utilizare ulterioară a inteligenței artificiale generative pe aceste “imagini originale”:

Schema provenienței în sistemul C2PA, unde metadatele scrise la momentul capturării pot fi adăugate ca un jurnal, permițând ajustări obișnuite, cum ar fi luminozitatea și contrastul, dar înregistrând ajustări majore, astfel încât o imagine puternic modificată de AI va apărea ca atare în canalele media care susțin acest sistem. Sursă - https://spec.c2pa.org/specifications/specifications/1.2/specs/

Schema provenienței în sistemul C2PA, unde metadatele scrise la momentul capturării pot fi adăugate ca un jurnal, permițând ajustări obișnuite, cum ar fi luminozitatea și contrastul, dar înregistrând ajustări majore, astfel încât o imagine puternic modificată de AI va apărea ca atare în canalele media care susțin acest sistem. Sursă

Adoptarea standardului nu a fost la fel de largă pe cât și-ar fi dorit coaliția, și în prezent doar 14 camere suportă imprimarea informațiilor de autenticitate în cameră.

Ceea ce este interesant despre ideea C2PA de a oferi unei fotografii un “pașaport” de îndată ce vine pe lume, este că, până la acel moment, poate fi deja prea târziu – pentru că producătorii de camere încorporează acum în mod obișnuit procesarea AI în crearea imaginii:

Din lucrarea din 2024 'Advocating Pixel-Level Authentication of Camera-Captured Images': o ilustrare a modului în care pipeline-urile moderne de cameră introduc conținut halucinat la momentul capturării și modul în care metadatele de autentificare la nivel de pixel le expun. În (A), o imagine a senzorului smartphone este procesată de ISP, unde modulele AI pot inventa detalii în timpul zoom-ului digital sau corecției expunerii, producând imagini realiste cu erori, cum ar fi cifre de numere de înmatriculare citite greșit. În (B), o mască de autentificare este încorporată ca metadate și ulterior suprapusă pentru a revela regiunile neautentice, permițând utilizatorilor să distingă datele originale de pixelii modificați de AI. Sursă – https://ieeexplore.ieee.org/ielx7/6287639/10380310/10478521.pdf?tp=&arnumber=10478521&isnumber=10380310&ref=aHR0cHM6Ly9zY2hvbGFyLmdvb2dsZS5jb20ucHkv

Din lucrarea din 2024 ‘Advocating Pixel-Level Authentication of Camera-Captured Images’: o ilustrare a modului în care pipeline-urile moderne de cameră introduc conținut halucinat la momentul capturării și modul în care metadatele de autentificare la nivel de pixel le expun. În (A), o imagine a senzorului smartphone este procesată de ISP, unde modulele AI pot inventa detalii în timpul zoom-ului digital sau corecției expunerii, producând imagini realiste cu erori, cum ar fi cifre de numere de înmatriculare citite greșit. În (B), o mască de autentificare este încorporată ca metadate și ulterior suprapusă pentru a revela regiunile neautentice, permițând utilizatorilor să distingă datele originale de pixelii modificați de AI. Sursă

De fapt, această interferență AI în capturarea datelor brute de la senzorul camerei ar putea deveni în cele din urmă chiar procesul guvernant.

Acest tip de post-procesare nu este același cu tendința actuală de modificare a fotografiilor în cameră, în care o aplicație de telefon sau o aplicație de cameră permite utilizatorului să reevalueze o fotografie la îndemână înainte de a fi descărcată de pe dispozitiv.

În schimb, procesarea are loc într-o rutină “cutie neagră” din procesorul de semnal al imaginii (ISP) al camerei, de obicei într-un mediu de rulare proprietar care nu expune sau nu pune la dispoziție datele brute ale senzorului (și luați în considerare că formatul “pur” camera RAW nu este atât de “raw”).

Prin urmare, până când puteți vedea fotografia deloc, aceasta poate fi supusă unor îmbunătățiri asistate de AI, cum ar fi îmbunătățirea în condiții de lumină scăzută, upscaling sau chiar înlocuirea lunii.

În multe cazuri, acest lucru poate duce la reconstrucții inexacte, de exemplu, de text, care ar putea invalida utilizarea unei astfel de imagini ca probă, deoarece o imagine “brută” adevărată nu ar fi disponibilă:

Din noua lucrare - o imagine RAW a senzorului este procesată de un ISP GenAI pentru a produce o ieșire finală sRGB care pare mai clară, dar poate conține detalii halucinate, așa cum se arată în exemplul numărului de înmatriculare, unde caracterele sunt inferate incorect în timpul zoom-ului digital. Scena reală, care nu este accesibilă în practică, diferă atât de ieșirea îmbunătățită de AI, cât și de imaginea autentică intermediară, înainte de halucinație. Abordarea propusă permite recuperarea acestei imagini pre-halucinație, restabilind ceea ce a capturat inițial optica camerei, înainte ca îmbunătățirile bazate pe AI să modifice conținutul. Sursă - https://arxiv.org/pdf/2604.21879

Din noua lucrare – o imagine RAW a senzorului este procesată de un ISP GenAI pentru a produce o ieșire finală sRGB care pare mai clară, dar poate conține detalii halucinate, așa cum se arată în exemplul numărului de înmatriculare, unde caracterele sunt inferate incorect în timpul zoom-ului digital. Scena reală, care nu este accesibilă în practică, diferă atât de ieșirea îmbunătățită de AI, cât și de imaginea autentică intermediară, înainte de halucinație. Abordarea propusă permite recuperarea acestei imagini pre-halucinație, restabilind ceea ce a capturat inițial optica camerei, înainte ca îmbunătățirile bazate pe AI să modifice conținutul. Sursă

Exemplele de mai sus provin dintr-o nouă lucrare de cercetare care oferă un remediu pentru “fotografiile native AI”, folosind procese alternative de AI pentru a reconstrui imaginea brută și nealterată, estimată din imaginea procesată.

Autorii afirmă:

‘Atunci când modelele de AI antrenate cu pierderi generative sau perceptive sunt utilizate în ISP, acestea sunt predispuse să halucineze conținut, modificând potențial înțelesul imaginii. Implicația este că imaginile direct ieșite din cameră pot conține acum “conținut fals”. ‘

‘Utilizarea GenAI în hardware-ul camerei marchează o schimbare de paradigmă în modul în care privim imaginile capturate de cameră și pune sub semnul întrebării viziunea tradițională asupra imaginilor capturate de cameră ca fiind în mod inerent de încredere.’

Noua lucrare utilizează un encoder foarte ușor și un MLP decoder, care poate fi inclus în imagine la o penalizare de greutate de doar 180kb. Obiectivul este dezvoltarea unor sisteme de codificare suficient de rapide pentru a re-extrage imaginea originală în timp real.

Din noua lucrare: super-rezoluția bazată pe GenAI în ISP-ul camerei poate modifica subtil trăsăturile faciale, schimbând aparența sau identitatea percepută prin schimbări ale privirii și formei gurii. Îmbunătățirea în condiții de lumină scăzută poate modifica, de asemenea, conținutul imaginii, afectând interpretarea, în ciuda îmbunătățirii calității vizuale. În exemplul codului QR, îmbunătățirea face imaginea mai atractivă, dar o face necitibilă. Metoda permite recuperarea imaginii autentice, înainte de aceste halucinații, restabilind detalii faciale originale și un cod QR citibil.

Din noua lucrare: super-rezoluția bazată pe GenAI în ISP-ul camerei poate modifica subtil trăsăturile faciale, schimbând aparența sau identitatea percepută prin schimbări ale privirii și formei gurii. Îmbunătățirea în condiții de lumină scăzută poate modifica, de asemenea, conținutul imaginii, afectând interpretarea, în ciuda îmbunătățirii calității vizuale. În exemplul codului QR, îmbunătățirea face imaginea mai atractivă, dar o face necitibilă. Metoda permite recuperarea imaginii autentice, înainte de aceste halucinații, restabilind detalii faciale originale și un cod QR citibil.

Alternativ, producătorii de camere ar putea oferi utilizatorilor acces la dump-urile de senzor nemodificate; cu toate acestea, acest lucru pare probabil să rămână limitat la echipamente de înaltă calitate. În spațiul mobil și de consumator, din nefericire, accesul la fotografii neprocesate poate fi considerat o “nișă” sau o urmărire marginală.

În timp ce camerele de fotografiat au aplicat întotdeauna un anumit nivel de post-procesare, înainte de apariția inteligenței artificiale de margine, algoritmii utilizați erau minim “interpretativi” și nu erau probabil să modifice conținutul unei fotografii în același mod semnificativ în care metodele actuale de AI pot face.

Interesant, luând în considerare amploarea criticilor publice la adresa “politicii de înlocuire a lunii” a Samsung, de acum câțiva ani, Centrul de Cercetare AI al Samsung de la Toronto este unul dintre participanții la noua lucrare, intitulată Abordarea autenticității imaginilor atunci când camerele utilizează Inteligență Artificială Generativă, și este condusă de contribuțiile a cinci cercetători de la Universitatea din Toronto.

Metodă

Autorii utilizează singura altă lucrare care pare să fi abordat direct problema perturbării prin proiectare: lucrarea din 2024 lucrarea Advocating Pixel-Level Authentication of Camera-Captured Images, care a propus o “mască de autentificare binară” care delimitează zonele modificate de procesele AI din cameră:

La dreapta, “masca de autentificare” a lucrării din 2024 revelează zone ale cerului afectate de procesele AI de “netezire” într-o cameră.

În schimb, sistemul nu a oferit nicio metodă prin care o imagine “adevărată” ar putea fi recuperată, pe care noua lucrare o abordează, recunoscând o datorie față de ieșirea anterioară.

Obiectivul noii lucrări este de a permite utilizatorilor să recupereze o imagine cât mai aproape de ceea ce a capturat senzorul înainte de a avea loc procesarea:

Prezentare generală a metodei propuse. În (A), la momentul capturării, imaginea de ieșire a ISP care conține halucinații este trecută printr-un encoder preantrenat înghețat, iar caracteristicile sale latente sunt combinate cu coordonate spațiale și introduse într-un MLP care operează la nivel de pixel pentru a prezice imaginea nehalucinată, cu antrenarea ghidată de o pierdere împotriva imaginii autentice. Greutățile encoderului și MLP sunt apoi salvate ca metadate lângă imagine. În (B), la inferență, aceste greutăți sunt recuperate din metadate și utilizate împreună cu encoderul și MLP pentru a reconstrui imaginea nehalucinată.

Prezentare generală a metodei propuse. În (A), la momentul capturării, imaginea de ieșire a ISP care conține halucinații este trecută printr-un encoder preantrenat înghețat, iar caracteristicile sale latente sunt combinate cu coordonate spațiale și introduse într-un MLP care operează la nivel de pixel pentru a prezice imaginea nehalucinată, cu antrenarea ghidată de o pierdere împotriva imaginii autentice. Greutățile encoderului și MLP sunt apoi salvate ca metadate lângă imagine. În (B), la inferență, aceste greutăți sunt recuperate din metadate și utilizate împreună cu encoderul și MLP pentru a reconstrui imaginea nehalucinată.

La momentul capturării, în noua metodă, imaginea procesată este trecută printr-un encoder înghețat care o convertește într-o reprezentare latentă compactă. Ulterior, coordonatele spațiale relevante sunt combinate cu aceste caracteristici și introduse într-un MLP ușor care operează la nivel de pixel, pentru a prezice conținutul imaginii originale – învățând, în esență, să scoată elementele halucinate prin intermediul unei pierderi de reconstrucție, împotriva țintelor autentice.

Encoderul și decoderul sunt preantrenați pe perechi de imagini autentice și halucinate, apoi rapid finetune pentru fiecare imagine capturată, cu greutățile lor salvate ca metadate lângă imaginea în sine, adăugând doar o suprasarcină mică de dimensiune.

La momentul vizualizării, aceste greutăți stocate sunt extrase și reutilizate pentru a rula același encoder și MLP, permițând recuperarea unei imagini care se apropie cât mai mult de ceea ce a capturat inițial senzorul camerei, fără a introduce conținut sintetic nou.

Date și teste

Autorii au testat noua metodă utilizând două dintre cele mai frecvent implementate sarcini de post-procesare ISP: super-rezoluție (SR, inclusiv pentru zone zoomate); și fotografiere în condiții de lumină scăzută.

Pentru secțiunea de super-rezoluție “naturală” a testelor, au fost incluse multe exemple de text, deoarece rutinele de super-rezoluție ISP sunt cunoscute pentru alterarea textului (de exemplu, numere de înmatriculare a vehiculelor, dar a se vedea exemplele de mai devreme în articol). Deoarece distorsionarea textului este o problemă discretă în sine, aceasta a fost tratată ca un subset al testelor de super-rezoluție, cu date dedicate.

Encoderul menționat anterior a fost antrenat pentru fiecare dintre cele două modalități testate, și fiecare a fost selectat pe baza modulului AI ISP care era probabil să fie implicat în timpul capturării (de exemplu, un modul “lumină scăzută”, în condiții de întuneric).

Autorii au utilizat setul de date DIV2K pentru antrenarea super-rezoluției, alimentat de rețeaua populară RealESRGAN. În conformitate cu lucrarea menționată anterior din 2024 privind interferența ISP, cercetătorii au generat perechi de date care conțin conținut neafectat și halucinat.

Pentru secțiunea de super-rezoluție a textului, autorii au utilizat modelul de super-rezoluție a textului MARCONet din 2023:

Din lucrarea MARCONet din 2023, exemple de texte cu rezoluție scăzută și texte echivalente mărite. Sursă - https://arxiv.org/pdf/2303.14726

Din lucrarea MARCONet din 2023, exemple de texte cu rezoluție scăzută și texte echivalente mărite. Sursă

Pentru a crea perechi de date în acest caz, cercetătorii au rulat imagini nehalucinate prin MARCONet. Două mii de imagini au fost generate din codul original al proiectului, cu 200 puse deoparte pentru validare, împreună cu alte 200 pentru testare.

Pentru testele de lumină scăzută, a fost adoptat setul de date LOL (LOL) dintr-o lucrare chineză din 2018:

Din setul de date LOL din 2018, exemple încadrate ale acelorași fotografii la diferite expuneri și niveluri de întunecare și degradare. Sursă - https://arxiv.org/pdf/1808.04560

Din setul de date LOL din 2018, exemple încadrate ale acelorași fotografii la diferite expuneri și niveluri de întunecare și degradare. Sursă

Framework-uri rivale

Pentru a evalua metoda, au fost efectuate comparații cu trei linii de bază specifice antrenate în condiții identice. În primul rând, SIREN și NeRF au fost preantrenate pe perechi de imagini autentice și halucinate și apoi finetune pentru aceeași durată ca abordarea propusă, oferind o comparație directă cu NeRF.

În al doilea rând, un MLP cu o codificare învățată pe baza metodei hashgrid din Instant-NGP a fost utilizat, cu intrările tabelului hash și MLP optimizate împreună.

Dimensiunea încorporării și capacitatea rețelei au fost potrivite cu encoderul și MLP țintă, cu experimente care acoperă atât optimizarea per imagine de la zero, cât și preantrenarea urmată de finetunare.

În al treilea rând, a fost implementată o linie de bază de traducere de imagine la imagine fără supraveghere, utilizând un model NAFNet de 64MB, antrenat ca un sistem de regresie pixel-la-pixel fără acces la metadate.

În antrenare, a fost utilizat optimizerul Adam peste PyTorch, atât pentru preantrenare, cât și pentru finetunare. Encoderul și MLP au fost antrenați pentru 50.000 de epoci la o dimensiune a lotului de 32, cu encodere modality-specifice antrenate pentru fiecare sarcină (de exemplu, SR, text-SR, lumină scăzută).

Finetunarea a avut loc timp de aproximativ trei secunde pe un GPU NVIDIA V100 cu 32GB de VRAM. Autorii menționează că, deși optimizarea pe dispozitiv este mediul țintă și scenariu, nu a fost realist să o implementeze pentru toate framework-urile, și, prin urmare, toate testele au fost efectuate într-un mediu de birou:

Comparație de performanță cu linii de bază MLP bazate pe metadate, incluzând SIREN, NeRF și metoda hash-grid, alături de recuperare oarbă utilizând NAFNet. Rezultatele sunt raportate ca PSNR în decibeli pentru trei sarcini: super-rezoluție de imagine naturală pe DIV2K; super-rezoluție de text pe MARCONet; și îmbunătățire în condiții de lumină scăzută pe LOL, cu metoda propusă atingând cele mai mari punctaje în fiecare caz.

Comparație de performanță cu linii de bază MLP bazate pe metadate, incluzând SIREN, NeRF și metoda hash-grid, alături de recuperare oarbă utilizând NAFNet. Rezultatele sunt raportate ca PSNR în decibeli pentru trei sarcini: super-rezoluție de imagine naturală pe DIV2K; super-rezoluție de text pe MARCONet; și îmbunătățire în condiții de lumină scăzută pe LOL, cu metoda autorilor atingând cele mai mari punctaje în fiecare caz.

Pentru abordările bazate pe MLP, performanța a depins puternic de reprezentarea de intrare, unde modelele antrenate utilizând doar coordonate spațiale au luptat în timpul preantrenării și nu au reușit să se îmbunătățească în timpul etapei limitate de finetunare. Adăugarea de informații de culoare a condus la rezultate mai puternice.

Recuperarea oarbă utilizând NAFNet a performant bine pe DIV2K, unde mappingul de la imagini degradate la imagini curate a fost relativ stabil, dar a eșuat pe MARCONet și LOL, unde au existat reconstrucții plauzibile multiple și modelul a lipsit de informațiile necesare pentru a rezolva această ambiguitate.

Acest efect a fost cel mai pronunțat în îmbunătățirea în condiții de lumină scăzută, unde luminozitatea inițială a scenei nu a putut fi inferată în mod fiabil din imaginea procesată singură.

Autorii afirmă:

‘În datele sintetice MARCONet, imagini cu diferite puteri de blur se mapăază la aceeași imagine halucinată. Se poate vedea din rezultate că abordarea noastră propusă depășește concurenții pe toate seturile de date.’

În comparația de mai sus, se poate vedea cât de bine diferitele metode performează în funcție de timpul pe care îl primesc pentru a rula la momentul capturării unei fotografii. Antrenarea unui model de la zero pentru fiecare imagine poate produce rezultate puternice, așa cum se vede cu SIREN, NeRF și hash-grid – dar acest lucru durează prea mult pentru a fi practic în interiorul unei camere.

În schimb, metoda autorilor face cea mai mare parte a muncii în avans, cu o ajustare rapidă la momentul capturării, permițându-i să ofere rezultate mai bune în limitele de timp stricte (3, 5 sau zece secunde).

Comparație de performanță cu linii de bază MLP bazate pe metadate, incluzând SIREN, NeRF și metoda hash-grid, alături de recuperare oarbă utilizând NAFNet. Rezultatele sunt raportate ca PSNR în decibeli pentru trei sarcini: super-rezoluție de imagine naturală pe DIV2K; super-rezoluție de text pe MARCONet; și îmbunătățire în condiții de lumină scăzută pe LOL, cu metoda propusă atingând cele mai mari punctaje în fiecare caz.

Comparație de performanță cu linii de bază MLP bazate pe metadate, incluzând SIREN, NeRF și metoda hash-grid, alături de recuperare oarbă utilizând NAFNet. Rezultatele sunt raportate ca PSNR în decibeli pentru trei sarcini: super-rezoluție de imagine naturală pe DIV2K; super-rezoluție de text pe MARCONet; și îmbunătățire în condiții de lumină scăzută pe LOL, cu metoda propusă atingând cele mai mari punctaje în fiecare caz. Vă rugăm să consultați lucrarea sursă pentru o rezoluție puțin mai bună.

Rezultate calitative pe DIV2K, unde metodele de îmbunătățire au introdus halucinații vizibile. Un model de super-rezoluție bazat pe GAN a alterat culoarea ochilor, iar recuperarea oarbă a luptat pentru a reconstrui imaginea originală. NeRF și hash-grid au produs artefacte în regiuni structurate, cum ar fi ferestre și texte, în timp ce metoda propusă s-a potrivit mai bine cu imaginea autentică.

În cele din urmă, în figura de mai sus, se pot vedea rezultate pe setul de date LOL, cu luminozitatea scalată pentru vizualizare.

Recuperarea oarbă nu a putut rezolva scala de luminozitate necunoscută, în timp ce metoda propusă a reconstruit mai bine texturile și a restabilit caractere modificate, cum ar fi corectarea unui “1” înapoi la “i”, fără a adăuga artefacte.

Concluzie

Probabil că nu este argumentabil, nici nu a fost vreodată, că “camera nu minte niciodată”. Fiecare decizie cu privire la ceea ce să fotografiați și când să o fotografiați, împreună cu modul în care să o prezentați și să o contextualizați, este, în esență, o decizie politică sau socială.

Chiar și cele mai vechi metode de post-procesare, cum ar fi dodge și burn (de mult transferate în instrumente de Photoshop) sunt acte extrem de subiective de decizie artistică și preferință.

Cu toate acestea, nu este niciun motiv să renunțați la obiectivul de a avea capturi de imagini “obiective”; și pare rezonabil că consumatorul mediu ar trebui să aibă acces, chiar și cu unele dificultăți, la dump-urile brute de senzor nemodificate ale fotografiilor pe care le fac, dacă doresc; sau, cel puțin, că ar trebui să li se permită să restricționeze post-procesarea ISP la algoritmi non-AI, așa cum ar prefera.

 

Publicat pentru prima dată vineri, 24 aprilie 2026

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai