Andersons vinkel

Selvautentificerende billeder gennem simpel JPEG-kompression

mm
Føj Unite.AI til dine foretrukne kilder på Google
Source: https://www.pexels.com/photo/woman-in-gray-tank-top-showing-distress-3812745/

Bekymringer om risikoen for manipulerede billeder har været et tilbagevendende tema i forskningen de seneste par år, især i lyset af en ny bølge af AI-baserede billede-redigeringsrammer i stand til at ændre eksisterende billeder, snarere end at skabe dem fra bunden.

De fleste af de foreslåede detectionsystemer, der omhandler denne type indhold, falder i en af to kategorier: den første er vandmærkning – en reserve-tilgang bygget ind i billedsandheden rammen, der nu fremmes af Coalition for Content Provenance and Authenticity (C2PA).

C2PA-vandmærkningsproceduren er en reserve, hvis billedindholdet bliver adskilt fra sin oprindelige og løbende manifest. Kilde: https://www.imatag.com/blog/enhancing-content-integrity-c2pa-invisible-watermarking

C2PA-vandmærkningsproceduren er en reserve, hvis billedindholdet bliver adskilt fra sin oprindelige og løbende proveniens ‘manifest’. Kilde: https://www.imatag.com/blog/enhancing-content-integrity-c2pa-invisible-watermarking

Disse ‘hemmelige signaler’ skal herefter være robuste over for de automatiske genkodnings/optimeringsprocedurer, der ofte opstår, når et billede passerer gennem sociale netværk og på tværs af portalen og platforme – men de er ofte ikke resistent over for den type tabsgivende genkodning, der anvendes gennem JPEG-kompression (og på trods af konkurrence fra prætendenter som webp, er JPEG-formatet stadig brugt til anslået 74,5% af alle website-billeder).

Den anden tilgang er at gøre billeder tydeligt ændrede, som oprindeligt forslagt i 2013-papiret Billedintegritetsauthentificeringsskema baseret på fast punkt-teori. I stedet for at afhænge af vandmærker eller digitale signaturer, anvendte denne metode en matematisk transformation kaldet Gausisk konvolution og dekonvolution (GCD) for at skubbe billederne mod en stabil tilstand, der ville bryde, hvis den blev ændret.

Resultater for lokalisation af manipulation med en fast punkt-billede med en PSNR på 59,7802 dB. Hvide rektangler indikerer områder, der er udsat for angreb. Panel A (venstre) viser de anvendte ændringer, herunder lokal støj, filtering og kopieringsbaserede angreb. Panel B (højre) viser den tilsvarende detectionsudgang, der fremhæver de manipulerede områder, der er identificeret af autentificeringsprocessen. Kilde: https://arxiv.org/pdf/1308.0679

Fra papiret ‘Billedintegritetsauthentificeringsskema baseret på fast punkt-teori’: resultater for lokalisation af manipulation med en fast punkt-billede med en Peak Signal-to-Noise (PSNR) på 59,7802 dB. Hvide rektangler indikerer områder, der er udsat for angreb. Panel A (venstre) viser de anvendte ændringer, herunder lokal støj, filtering og kopieringsbaserede angreb. Panel B (højre) viser den tilsvarende detectionsudgang, der fremhæver de manipulerede områder, der er identificeret af autentificeringsprocessen. Kilde: https://arxiv.org/pdf/1308.0679

Begrebet er måske bedst forstået i sammenhæng med reparation af en delikat lace-stof: uanset hvor fint håndværket er i at lave laksestykker, vil den repareret del altid være genkendelig.

Denne type transformation, når den anvendes gentagne gange på et gråtonebillede, skubber langsomt billedet mod en tilstand, hvor anvendelsen af transformationen igen producerer ingen yderligere ændring.

Denne stabile version af billedet kaldes en fast punkt. Fast punkter er sjældne og meget følsomme over for ændringer – enhver lille ændring af et fast punkt-billede vil næsten med sikkerhed bryde dets fast status, hvilket gør det let at opdage manipulation.

Som normalt med sådanne tilgange, kan artefakterne fra JPEG-kompression true billedets integritet:

Til venstre ser vi et vandmærke anvendt på ansigtet af det ikoniske 'Lenna' (Lena)-billede, som er tydeligt under normal kompression. Til højre, med 90% JPEG-kompression, kan vi se, at forskellen mellem det opfattede vandmærke og væksten af JPEG-støj er mindsket. Efter flere genoplagninger eller ved de højeste kompressionsindstillinger, har de fleste vandmærkningsskemaer problemer med JPEG-kompressionsartefakter. Kilde: https://arxiv.org/pdf/2106.14150

Til venstre ser vi et vandmærke anvendt på ansigtet af det ikoniske ‘Lenna’ (Lena)-billede, som er tydeligt under normal kompression. Til højre, med 90% JPEG-kompression, kan vi se, at forskellen mellem det opfattede vandmærke og væksten af JPEG-støj er mindsket. Efter flere genoplagninger eller ved de højeste kompressionsindstillinger, har de fleste vandmærkningsskemaer problemer med JPEG-kompressionsartefakter. Kilde: https://arxiv.org/pdf/2106.14150

Hvad hvis, i stedet, JPEG-kompressionsartefakter kunne anvendes som den centrale måde at opnå en fast punkt på? I så fald ville der ikke være behov for eksterne systemer, da den samme mekanisme, der normalt forårsager problemer for vandmærkning og manipulation, ville danne grundlaget for manipulationssystemet i sig selv.

JPEG-kompression som en sikkerhedsgrundlinje

Et sådant system er foreslået i en ny artikel af to forskere fra University of Buffalo ved State University of New York. Titlen Manipulationsevident billede ved hjælp af JPEG-fast punkter, bygger på 2013-arbejdet og relaterede arbejder, ved officielt at formulere dets centrale principper for første gang, samt ved at anvende JPEG-kompression selv som en metode til potentielt at producere et ‘selvautentificerende’ billede.

Forfatterne udvider:

‘Studiet viser, at et billede forbliver uændret efter at have undergået flere omgange af den samme JPEG-kompressions- og dekompressionsproces.

‘Med andre ord, hvis en enkelt cyklus af JPEG-kompression og dekompression betragtes som en transformation af billedet, kaldet en JPEG-transformation, så viser denne transformation egenskaben at have faste punkter, dvs. billeder, der forbliver uændrede, når JPEG-transformationen anvendes.’

Fra den nye artikel, en illustration af JPEG-fast punkt-konvergens. I den øverste række ser vi et eksempel på et billede, der undergår gentagen JPEG-kompression, med hver iteration, der viser antallet og placeringen af ændrede pixel; i den nederste række er pixel-vis L2-afstand mellem pågældende iterationer plotteret over forskellige kompressionskvalitetsindstillinger. Ironisk nok er der ingen bedre opløsning af dette billede tilgængelig. Kilde: https://arxiv.org/pdf/2504.17594

Fra den nye artikel, en illustration af JPEG-fast punkt-konvergens. I den øverste række ser vi et eksempel på et billede, der undergår gentagen JPEG-kompression, med hver iteration, der viser antallet og placeringen af ændrede pixel; i den nederste række er pixel-vis L2-afstand mellem pågældende iterationer plotteret over forskellige kompressionskvalitetsindstillinger. Kilde: https://arxiv.org/pdf/2504.17594

I stedet for at introducere eksterne transformationer eller vandmærker, definerer den nye artikel JPEG-processen selv som et dynamisk system. I denne model flytter hver kompressions- og dekompressionscyklus billedet mod en fast punkt. Forfatterne beviser, at efter en endelig antal iterationer, når et billede enten når eller approksimerer en tilstand, hvor yderligere kompression vil producere ingen ændring.

Forskerne fastslår*:

‘Enhver ændring af billedet vil forårsage afvigelser fra JPEG-fast punkterne, som kan detekteres som ændringer i JPEG-blokken efter en enkelt runde af JPEG-kompression og dekompression…

‘De foreslåede manipulationsevidente billeder baseret på JPEG-fast punkter har to fordele. Først eliminerer manipulationsevidente billeder behovet for ekstern lagring af verificerbare funktioner, som kræves af billedfingeraftryk [skemaer], eller indlejring af skjulte spor, som i billedvandmærkningsmetoder. Billedet selv fungerer som sin egen bevis for ægthed, hvilket gør skemaet inherent selv-evident.

‘For det andet, da JPEG er et bredt anvendt format og ofte den sidste skridt i billedbehandlingspipeline, er den foreslåede metode robust over for JPEG-operationer. Dette modsætter sig den oprindelige [tilgang], der kan miste integritetsspor på grund af JPEG.’

Artiklens centrale indsigt er, at JPEG-konvergens ikke blot er et biprodukt af dets design, men en matematisk uundgåelig konsekvens af dets operationer. Den diskrete cosinustransformation, kvantificering, afrundning og truncering danner sammen en transformation, der (under de rette betingelser) fører til en forudsigelig samling af faste punkter.

Schema for JPEG-kompressions- og dekompressionsprocessen formuleret for det nye arbejde.

Schema for JPEG-kompressions- og dekompressionsprocessen formuleret for det nye arbejde.

I modsætning til vandmærkning kræver denne metode ingen indlejret signal. Den eneste reference er billedets egen konsistens under yderligere kompression. Hvis genkompression producerer ingen ændring, antages billedet at være ægte. Hvis det gør, indikeres manipulation ved afvigelserne.

Tests

Forfatterne validerede dette adfærd ved at anvende en million tilfældigt genererede otte-til-otte-patches af otte-bit-gråtonebilleddata. Ved at anvende gentagen JPEG-kompression og dekompression på disse syntetiske patches, observerede de, at konvergens til en fast punkt opstår inden for en endelig antal skridt. Denne proces blev overvåget ved at måle pixel-vis L2-afstand mellem pågældende iterationer, med forskellene mindskedes, indtil patches stabiliseredes.

L2-forskel mellem pågældende iterationer for en million 8×8-patches, målt under varierende JPEG-kompressionskvaliteter. Hver proces begynder med et enkelt JPEG-komprimeret patch og sporer reduktionen i forskellen over gentagne kompressioner.

L2-forskel mellem pågældende iterationer for en million 8×8-patches, målt under varierende JPEG-kompressionskvaliteter. Hver proces begynder med et enkelt JPEG-komprimeret patch og sporer reduktionen i forskellen over gentagne kompressioner.

For at evaluere manipulationsskanning konstruerede forfatterne manipulationsevidente JPEG-billeder og anvendte fire typer angreb: salt og peber-støj; kopier-og-flyt-operationer; indsætning fra eksterne kilder; og dobbelt JPEG-kompression ved hjælp af en anden kvantificeringstabel.

Eksempel på fast punkt-RGB-billeder med detektion og lokalisation af manipulation, herunder de fire forstyrrelsesmetoder, der anvendes af forfatterne. I den nederste række kan vi se, at hver forstyrrelsesstype forråder sig selv i forhold til det genererede fast punkt-billede.

Eksempel på fast punkt-RGB-billeder med detektion og lokalisation af manipulation, herunder de fire forstyrrelsesmetoder, der anvendes af forfatterne. I den nederste række kan vi se, at hver forstyrrelsesstype forråder sig selv i forhold til det genererede fast punkt-billede.

Efter manipulation blev billederne genkomprimeret ved hjælp af den oprindelige kvantificering-matrix. Afvigelser fra fast punkt blev detekteret ved at identificere billedblokke, der viste ikke-nul-forskelle efter genkompression, hvilket muliggjorde både detektion og lokalisation af manipulerede områder.

Da metoden er baseret helt på standard JPEG-operationer, fungerer fast punkt-billeder fint med almindelige JPEG-visere og redigering; men forfatterne bemærker, at hvis billedet genkomprimeres i en anden kvalitetsniveau, kan det miste sin fast punkt-status, hvilket kan bryde autentificeringen og kræver omhyggelig håndtering i virkeligheden.

mens dette ikke blot er et værktøj til analyse af JPEG-udgang, tilføjer det heller ikke meget kompleksitet. I princippet kunne det indsættes i eksisterende arbejdsgange med minimal omkostning eller forstyrrelse.

Artiklen erkender, at en sofistikeret modstander måske kan forsøge at skabe modstridende ændringer, der bevare fast punkt-status; men forskerne fastslår, at sådanne bestræbelser sandsynligvis ville introducere synlige artefakter, der undergraver angrebet.

Selv om forfatterne ikke hævder, at fast punkt-JPEG’er kunne erstatte bredere provenienssystemer som C2PA, foreslår de, at fast punkt-metoder kunne supplere eksterne metadata-rammer ved at tilbyde et ekstra lag af manipulationsevidens, der består, selv når metadata fjernes eller gå tabt.

Konklusion

JPEG-fast punkt-tilgangen tilbyder en enkel og selvindholdende alternativ til konventionelle autentificeringssystemer, der kræver ingen indlejret metadata, vandmærker eller eksterne referencefiler, og i stedet udleder ægthed direkte fra den forudsigelige adfærd af kompressionsprocessen.

På denne måde genopretter metoden JPEG-kompression – en hyppig kilde til data-degradering – som en mekanisme for integritetsverificering. I denne henseende er den nye artikel en af de mest innovative og opfindsomme tilgange til problemet, som jeg har stødt på i de seneste par år.

Det nye arbejde peger på en skiftning væk fra lagdelte tilføjelser til sikkerhed og mod tilgange, der bygger på de indbyggede egenskaber af mediet selv. Da manipulationsteknikker bliver mere sofistikerede, kan teknikker, der tester billedets egen interne struktur, begynde at betyde mere.

Desuden introducerer mange alternative systemer, der er foreslået for at løse dette problem, betydelig friction ved at kræve ændringer af langt etablerede billedbehandlingsarbejdsgange – nogle af disse har fungeret pålideligt i år eller endda årtier, og som ville kræve en langt stærkere begrundelse for omkonfiguration.

 

* Min konvertering af forfatternes inline-citationer til hyperlinks.

Først udgivet fredag, 25. april 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]