Andersons vinkel

Återställa vad din kamera fångade innan AI ändrade det

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated image (GPT-2). A photographer examines an open DSLR as a stream of colorful fantasy creatures and glowing imagery bursts out, while he reacts with focused, subdued surprise in a studio setting.

Hur kan man skydda en rå fotos äkthet från AI-störning när den redan har behandlats automatiskt med AI i kameran? Ny forskning syftar till att återställa “sanna” sensordata – också med AI!

 

Ökningen av autenticiteten hos AI-bilder under det senaste året eller så har fått många grupper och individer att protestera mot den efterföljande erosionen av förtroende för fotografi.

Under samma period har Coalition for Content Provenance and Authenticity (C2PA) försökt att införa en semi-kryptografisk standard som bifogar metadata-baserad proveniensinformation till en bild, från och med det ögonblick den tas av en kompatibel kamera eller enhet, i hopp om att avslöja eventuell efterföljande användning av generativ AI på dessa “ursprungliga” bilder:

Schema för proveniens i C2PA-systemet, där metadata som skrivs vid tidpunkten för infångning kan läggas till som en dagbok, vilket tillåter vanliga justeringar som ljusstyrka och kontrast, men registrerar större justeringar så att en kraftigt AI-ändrad bild kommer att visas som sådan i mediekanaler som stöder detta system. Källa  - https://spec.c2pa.org/specifications/specifications/1.2/specs/

Schema för proveniens i C2PA-systemet, där metadata som skrivs vid tidpunkten för infångning kan läggas till som en dagbok, vilket tillåter vanliga justeringar som ljusstyrka och kontrast, men registrerar större justeringar, så att en kraftigt AI-ändrad bild kommer att visas som sådan i mediekanaler som stöder detta system. Källa

Antagandet av standarden har inte varit så utbrett som koalitionen hade hoppats, och för närvarande endast 14 kameror stöder inbyggt införande av autenticitetsinformation.

Vad som är intressant med C2PA:s idé om att ge en bild ett “pass” så fort den kommer till är att det kan vara för sent – eftersom kameratillverkare nu rutinmässigt bakar in AI-behandling i själva bildskapandet:

Från 2024-papperet 'Advocating Pixel-Level Authentication of Camera-Captured Images': en illustration av hur moderna kamerapipeliner introducerar hallucinerat innehåll vid infångningstid och hur pixelnivåautentiseringsmetadata avslöjar det. I (A), en smartphone-sensorbild bearbetas av ISP, där AI-moduler kan uppfinna detaljer under digital zoom eller exponeringskorrektion, vilket producerar realistiska bilder med fel som exempelvis felaktigt lästa registreringsskyltar. I (B), en autentiseringsmask är inbäddad som metadata och senare överlagrad för att avslöja icke-autentiska områden, vilket tillåter användare att skilja originaldata från AI-ändrade pixlar. Källa – https://ieeexplore.ieee.org/ielx7/6287639/10380310/10478521.pdf?tp=&arnumber=10478521&isnumber=10380310&ref=aHR0cHM6Ly9zY2hvbGFyLmdvb2dsZS5jb20ucHkv

Från 2024-papperet ‘Advocating Pixel-Level Authentication of Camera-Captured Images’: en illustration av hur moderna kamerapipeliner introducerar hallucinerat innehåll vid infångningstid och hur pixelnivåautentiseringsmetadata avslöjar det. I (A), en smartphone-sensorbild bearbetas av ISP, där AI-moduler kan uppfinna detaljer under digital zoom eller exponeringskorrektion, vilket producerar realistiska bilder med fel som exempelvis felaktigt lästa registreringsskyltar. I (B), en autentiseringsmask är inbäddad som metadata och senare överlagrad för att avslöja icke-autentiska områden, vilket tillåter användare att skilja originaldata från AI-ändrade pixlar. Källa

I själva verket kan denna AI-“störning” i infångningen av rådata från kamerans sensor till och med bli den styrande processen.

Denna typ av efterbearbetning är inte samma sak som den nuvarande trenden att ändra foton i kameran, där en telefonapp eller en kameraapp tillåter användaren att ompröva en bild i lugn och ro innan den ens har laddats ner från enheten.

Istället sker bearbetningen i en “svart låda”-rutin i kamerans Image Signal Processor (ISP), vanligtvis i en proprietär körning som inte exponerar eller gör råsensordata tillgänglig (och överväg att det så kallade “rena” kameraraw-formatet inte är så “rent”).

Därför, när du kan se bilden överhuvudtaget, kan den ha utsatts för AI-baserade förbättringar som låg-ljusförbättring, uppskalning eller till och med månförändring.

I många fall kan detta leda till felaktiga rekonstruktioner, till exempel av text, som kan ogiltigförklara användningen av en sådan bild som bevis, eftersom en sann “rå” bild inte skulle vara tillgänglig:

Från det nya papperet - en rå sensorbild bearbetas av en GenAI-aktiverad ISP för att producera en slutlig sRGB-utdata som verkar tydligare men kan innehålla hallucinerade detaljer, som visas i exempel med registreringsskyltar där tecken är felaktigt infererade under digital zoom. Den verkliga scenen, som inte är tillgänglig i praktiken, skiljer sig från både AI-förbättrad utdata och den mellanliggande autentiska bilden före hallucinationen. Den föreslagna metoden möjliggör återvinning av denna pre-hallucinationsbild, vilket återställer vad kamerans optik ursprungligen fångade innan AI-baserade förbättringar modifierade innehållet. Källa - https://arxiv.org/pdf/2604.21879

Från det nya papperet – en rå sensorbild bearbetas av en GenAI-aktiverad ISP för att producera en slutlig sRGB-utdata som verkar tydligare men kan innehålla hallucinerade detaljer, som visas i exempel med registreringsskyltar där tecken är felaktigt infererade under digital zoom. Den verkliga scenen, som inte är tillgänglig i praktiken, skiljer sig från både AI-förbättrad utdata och den mellanliggande autentiska bilden före hallucinationen. Den föreslagna metoden möjliggör återvinning av denna pre-hallucinationsbild, vilket återställer vad kamerans optik ursprungligen fångade innan AI-baserade förbättringar modifierade innehållet. Källa

Exemplen ovan kommer från ett nytt forskningspapper som erbjuder en lösning på “inbyggda AI-foton”, med hjälp av alternativa AI-processer för att rekonstruera den uppskattade råa och ofördärvade bilden från den bearbetade bilden.

Författarna skriver:

‘När AI-modeller som tränats med generativa eller perceptuella förluster används i ISPs, är de benägna att hallucinera innehåll, vilket potentiellt kan ändra bild[mening]. Implikationen är att bilder som direkt kommer från kameran kan innehålla “falskt” innehåll, särskilt i smartphone-kameror där AI-ISP-moduler blir allt vanligare.

‘Användningen av GenAI i kamerahårdvara markerar en paradigmförändring i hur vi ser på kamerabilder och utmanar den traditionella forensiska synen på kamerakapade bilder som inneboende pålitliga.’

Det nya arbetet använder en mycket lätt encoder och MLP-decoder, som kan ingå i bilden med en viktstraff på endast 180kb. Målet är att utveckla kodningssystem som är tillräckligt snabba för att återvinna den ursprungliga bilden i realtid.

Från det nya papperet: GenAI-baserad superupplösning inom kamerans ISP kan subtilt ändra ansiktsdrag, skifta utseende eller uppfattad identitet genom förändringar i blick och munform. Låg-ljusförbättring kan likaså modifiera bildinnehåll, vilket påverkar tolkningen trots att den förbättrar visuell kvalitet. I QR-kodexemplet gör förbättringen bilden mer tilltalande men gör koden oläslig. Metoden möjliggör återvinning av den autentiska bilden före dessa hallucinationer, vilket återställer ursprungliga ansiktsdetaljer och en skannbar QR-kod.

Från det nya papperet: GenAI-baserad superupplösning inom kamerans ISP kan subtilt ändra ansiktsdrag, skifta utseende eller uppfattad identitet genom förändringar i blick och munform. Låg-ljusförbättring kan likaså modifiera bildinnehåll, vilket påverkar tolkningen trots att den förbättrar visuell kvalitet. I QR-kodexemplet gör förbättringen bilden mer tilltalande men gör koden oläslig. Metoden möjliggör återvinning av den autentiska bilden före dessa hallucinationer, vilket återställer ursprungliga ansiktsdetaljer och en skannbar QR-kod.

Alternativt kunde kameratillverkare ge användarna tillgång till de verkligt ofördärvade sensor-dumparna; dock verkar detta troligt att förbli begränsat till mycket högkvalitetsutrustning. I den mobila och populära konsumentrymden är det tyvärr troligt att tillgång till obearbetade foton kommer att betraktas som en “nisch” eller marginal strävan.

Medan konsumentkameror alltid har tillämpat någon form av efterbearbetning, före tillkomsten av edge AI, var de algoritmer som användes minimalt “tolkande” och inte sannolikt att ändra bildinnehållet på samma meningsfulla sätt som nuvarande AI-metoder kan.

Intressant nog, med tanke på den omfattning till vilken Samsungs “månförändringspolicy” var föremål för allmän kritik för några år sedan, är Samsungs AI-center i Toronto en av deltagarna i det nya arbetet, som har titeln Addressing Image Authenticity When Cameras Use Generative AI och leds av bidrag från fem forskare vid University of Toronto.

Metod

Författarna använder den enda andra projektet som verkar ha direkt behandlat problemet med störning vid design: 2024-papperet Advocating Pixel-Level Authentication of Camera-Captured Images, som föreslog en “binär autentiseringsmask” som avgränsar områden som ändrats av inbyggda AI-processer:

Högermost, 2024-papperets ‘autentiseringsmask’ avslöjar områden i himlen som påverkats av AI-“smoothing”-processer i en kamera.

Det system som presenterades erbjöd dock ingen metod för att “återställa” en “sann” bild, vilket det nya arbetet behandlar, samtidigt som det erkänner en skuld till det tidigare företaget.

Målet med det nya arbetet är att möjliggöra för användare att återvinna en bild som är så nära som möjligt vad kamerans sensor ursprungligen fångade, utan att införa nytt syntetiskt innehåll:

Översikt av den föreslagna metoden. I (A), vid infångningstid, skickas ISP-utdata-bilden som innehåller hallucinationer genom en frusen förtränad encoder, och dess latenta funktioner kombineras med spatiala koordinater och matas in i en MLP som opererar per pixel för att förutsäga den icke-hallucinerade bilden, med träning guidad av en förlust mot den autentiska bilden. Encoder- och MLP-vikterna sparas sedan som metadata tillsammans med bilden. I (B), vid inferens, hämtas dessa vikter från metadatan och används med encoder och MLP för att rekonstruera den icke-hallucinerade bilden.

Översikt av den föreslagna metoden. I (A), vid infångningstid, skickas ISP-utdata-bilden som innehåller hallucinationer genom en frusen förtränad encoder, och dess latenta funktioner kombineras med spatiala koordinater och matas in i en MLP som opererar per pixel för att förutsäga den icke-hallucinerade bilden, med träning guidad av en förlust mot den autentiska bilden. Encoder- och MLP-vikterna sparas sedan som metadata tillsammans med bilden. I (B), vid inferens, hämtas dessa vikter från metadatan och används med encoder och MLP för att rekonstruera den icke-hallucinerade bilden.

Vid infångningstid, i den nya metoden, skickas den bearbetade bilden genom en frusen encoder som omvandlar den till en komprimerad latent representation. Därefter kombineras de relevanta spatiala koordinaterna med dessa funktioner och matas in i en lätt MLP som opererar på en per-pixel-basis, för att förutsäga den ursprungliga bildinnehållet – i princip, att lära sig att subtrahera de hallucinerade elementen genom en rekonstruktionsförlust, mot autentiska mål.

Encoder och decoder förtränas på parade autentiska och hallucinerade bilder, sedan snabbt finjusterade för varje infångad bild, med deras vikter lagrade som metadata tillsammans med själva bilden, vilket endast tillför en liten storleksbegränsning.

Vid visningstid, extraheras och återanvänds dessa lagrade vikter för att köra samma encoder och MLP, vilket möjliggör återvinning av en bild som nära som möjligt approximerar vad kamerans sensor ursprungligen fångade, utan att införa nytt syntetiskt innehåll.

Data och tester

Författarna testade den nya metoden med hjälp av två av de vanligast implementerade ISP-efterbearbetningsuppgifterna: superupplösning (SR, inklusive för zoomade områden); och låg-ljusfotografering.

För den allmänna (“naturliga bild”) SR-delen av testerna, ingick många exempel på text i datat, eftersom ISP SR-rutiner är kända för att ha ändrat text (till exempel av bilregistreringsskyltar, men se exempel tidigare i artikeln). Eftersom textdistorsion är ett eget problem, behandlades detta som en undergrupp till SR-testerna, med dedikerad data.

Den ovannämnda encodern tränades för var och en av de två modaliteterna som testades, och var och en valdes baserat på vilken AI-ISP-modul som sannolikt skulle engageras under infångning (t.ex. en “låg-ljus”-modul, i mörka förhållanden).

Författarna använde DIV2K-datasetet för superupplösningsträning, driven av det populära RealESRGAN-nätverket. I linje med det ovannämnda 2024-arbetet om ISP-störning, genererade forskarna parade data med opåverkat och hallucinerat innehåll.

För text-SR-delen använde författarna 2023-MARCONet-text-SR-modellen:

Från 2023 MARCONet-papperet, exempel på verkliga lågupplösta och motsvarande uppskalade texter. Källa - https://arxiv.org/pdf/2303.14726

Från 2023 MARCONet-papperet, exempel på verkliga lågupplösta och motsvarande uppskalade texter. Källa

För att skapa parade data i detta fall, körde forskarna icke-hallucinerade bilder genom MARCONet. 2000 bilder genererades från projektets ursprungliga kod, med 200 avsatta för validering, tillsammans med ytterligare 200 för testning.

För låg-ljus-testerna antogs LOw-Light dataset (LOL) dataset från ett 2018 kinesiskt papper:

Från 2018 års kinesiska LOL-dataset, bracket-exempel på samma bilder vid olika exponeringar och nivåer av mörker och försämring. Källa - https://arxiv.org/pdf/1808.04560

Från 2018 års kinesiska LOL-dataset, bracket-exempel på samma bilder vid olika exponeringar och nivåer av mörker och försämring. Källa

Rivalramverk

För att utvärdera metoden, gjordes jämförelser med tre specifika baslinjer som tränades under matchade förhållanden. Först, SIREN och NeRF förtränades på parade autentiska och hallucinerade bilder och sedan finjusterades vid infångningstid för samma varaktighet som den föreslagna metoden, vilket erbjuder en direkt jämförelse med NeRF.

Andra, en MLP med en inlärningsbaserad kodning baserad på hashgrid-metoden från Instant-NGP användes, med hash-tabellposter och MLP samoptimerade.

Inbäddningens storlek och nätverkskapacitet matchades till mål-encodern och MLP, med experiment som omfattade både per-bildoptimering från scratch och förträning följt av finjustering.

Tredje, en blind bild-till-bild-översättningsbaslinje implementerades med hjälp av en 64MB NAFNet-modell, tränad som en pixel-till-pixel regression-system utan tillgång till metadata.

Under träning användes Adam-optimeraren över PyTorch, både för förträning och finjustering. Encodern och MLP tränades i 50 000 epoch med en batchstorlek på 32, med modalitetsspecifika encoders tränade för varje uppgift (t.ex. SR, text-SR, låg-ljus).

Finjustering skedde under cirka tre sekunder på en NVIDIA V100 GPU med 32GB VRAM. Författarna noterar att medan on-device-optimering är det mål-miljö och scenario, var det inte realistiskt att implementera detta för alla ramverk, och därför genomfördes alla tester i en skrivbordsmiljö:

Prestandajämförelse mot metadata-assisterade MLP-baserade baslinjer, inklusive SIREN, NeRF och hash-grid-metoden, samt blind återvinning med hjälp av NAFNet. Resultaten rapporteras som PSNR i decibel över tre uppgifter: naturlig bildsuperupplösning på DIV2K; textsuperupplösning på MARCONet; och låg-ljusförbättring på LOL, med den föreslagna metoden som uppnår de högsta poängen i varje fall.

Prestandajämförelse mot metadata-assisterade MLP-baserade baslinjer, inklusive SIREN, NeRF och hash-grid-metoden, samt blind återvinning med hjälp av NAFNet. Resultaten rapporteras som PSNR i decibel över tre uppgifter: naturlig bildsuperupplösning på DIV2K; textsuperupplösning på MARCONet; och låg-ljusförbättring på LOL, med författarnas metod som uppnår de högsta poängen i varje fall.

För MLP-baserade tillvägagångssätt, berodde prestanda tungt på indata-representationen, där modeller som tränats med endast spatiala koordinater kämpade under förträning och misslyckades med att förbättra under den begränsade finjusteringsfasen. Tillägg av färginformation ledde till starkare resultat.

Blind återvinning med hjälp av NAFNet fungerade bra på DIV2K, där mappningen från degraderad till ren bild var relativt stabil, men bröt samman på MARCONet och LOL, där flera troliga rekonstruktioner fanns och modellen saknade den information som behövdes för att lösa denna tvetydighet.

Denna effekt var mest uttalad i låg-ljusförbättring, där den ursprungliga ljusstyrkan i scenen inte kunde tillförlitligt fastställas från den bearbetade bilden ensam.

Författarna skriver:

‘[I] de syntetiska MARCONet-data, bilder med olika blur-styrkor mappar till samma hallucinerade bild. Det kan ses från resultaten att vår föreslagna metod överträffar konkurrenterna över alla dataset.’

I jämförelsen ovan kan vi se hur väl olika metoder presterar beroende på hur lång tid de får för att köra vid tidpunkten för en fotografering. Att träna en modell från scratch för varje bild kan producera starka resultat, som ses med SIREN, NeRF och hash-grid – men detta tar för lång tid för att vara praktiskt inuti en kamera.

Istället gör författarnas metod det mesta av arbetet i förväg, med en snabb justering vid infångningstid, vilket möjliggör att leverera bättre resultat inom tighta tidsbegränsningar (3, 5 eller tio sekunder).

Prestandajämförelse mot metadata-assisterade MLP-baserade baslinjer, inklusive SIREN, NeRF och hash-grid-metoden, samt blind återvinning med hjälp av NAFNet. Resultaten rapporteras som PSNR i decibel över tre uppgifter: naturlig bildsuperupplösning på DIV2K; textsuperupplösning på MARCONet; och låg-ljusförbättring på LOL, med den föreslagna metoden som uppnår de högsta poängen i varje fall.

Prestandajämförelse mot metadata-assisterade MLP-baserade baslinjer, inklusive SIREN, NeRF och hash-grid-metoden, samt blind återvinning med hjälp av NAFNet. Resultaten rapporteras som PSNR i decibel över tre uppgifter: naturlig bildsuperupplösning på DIV2K; textsuperupplösning på MARCONet; och låg-ljusförbättring på LOL, med den föreslagna metoden som uppnår de högsta poängen i varje fall. Se källpapperet för (något) bättre upplösning.

Ovan visas kvalitativa resultat på DIV2K, där förbättringsmetoder introducerade synliga hallucinationer. En GAN-baserad superupplösningmodell ändrade ögonfärg, och blind återvinning kämpade för att rekonstruera den ursprungliga bilden. NeRF och hash-grid producerade artefakter i strukturerade områden som fönster och text, medan den föreslagna metoden matchade den autentiska bilden mer exakt.

Slutligen, i figuren ovan, ser vi resultat på LOL-datasetet, med ljusstyrka skalad för visualisering.

Blind återvinning kunde inte lösa den okända ljusstyrkan, medan den föreslagna metoden bättre rekonstruerade texturer och återställde ändrade tecken, som att korrigera en ‘1’ tillbaka till ‘i’, utan att lägga till artefakter.

Slutsats

Det är troligen inte argumenterbart, eller har aldrig varit argumenterbart, att “kameran ljuger aldrig”. Varje beslut om vad som ska fotograferas och när det ska fotograferas, tillsammans med hur det ska presenteras och sammanhang, är i själva verket ett politiskt eller socialt beslut.

Även de äldsta metoderna för efterbearbetning, som dodging och burning (länge sedan överförda till Photoshop-verktyg), är högt subjektiva handlingar av konstnärlig beslutsamhet och preferens.

Men det är ingen anledning att ge upp på målet att “objektiva” bildinfångningar; och det verkar rimligt att den genomsnittlige konsumenten ska tillåtas, även med viss svårighet, att komma åt de “omassade” råa sensor-dumparna av de foton de tar, om de vill; eller åtminstone att de ska tillåtas att begränsa ISP-efterbearbetning till icke-AI-algoritmer, som de kan föredra.

 

Publicerad första gången fredag, 24 april 2026

Författare på maskinlärning, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]