Andersons vinkel

Självautentiserande bilder genom enkel JPEG-komprimering

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Source: https://www.pexels.com/photo/woman-in-gray-tank-top-showing-distress-3812745/

Frågor om riskerna med manipulerade bilder har dykt upp regelbundet i forskningen under de senaste åren, särskilt i ljuset av den nya vågen av AI-baserade bildredigeringsramverk som kan ändra befintliga bilder, snarare än att skapa dem från scratch.

De flesta av de föreslagna upptäcktsystemen för att hantera detta innehåll faller in i en av två kategorier: den första är vattenmärkning – en fallback-metod som byggts in i bildveracity-ramverket som nu främjas av Coalition for Content Provenance and Authenticity (C2PA).

The C2PA watermarking procedure är en fallback, om bildinnehållet blir separerat från dess ursprungliga och pågående manifest. Source: https://www.imatag.com/blog/enhancing-content-integrity-c2pa-invisible-watermarking

The C2PA watermarking procedure är en fallback, om bildinnehållet blir separerat från dess ursprungliga och pågående proveniens ‘manifest’. Source: https://www.imatag.com/blog/enhancing-content-integrity-c2pa-invisible-watermarking

Dessa ‘hemliga signaler’ måste sedan vara robusta mot de automatiska omkodnings/optimeringsförfaranden som ofta sker när en bild överförs genom sociala nätverk och över portaler och plattformar – men de är ofta inte resistenta mot den typ av förlustbringande omkodning som tillämpas genom JPEG-komprimering (och trots konkurrens från pretenders som webp, är JPEG-formatet fortfarande används för uppskattningsvis 74,5% av alla webbplatser).

Den andra metoden är att göra bilder tamper-evident, som ursprungligen föreslogs i 2013 års artikel Image Integrity Authentication Scheme Based On Fixed Point Theory. Istället för att förlita sig på vattenmärken eller digitala signaturer, använde denna metod en matematisk transformation som kallas Gaussian Convolution and Deconvolution (GCD) för att driva bilderna mot en stabil tillstånd som skulle brytas om de ändrades.

Tampering localization results using a fixed point image with a PSNR of 59.7802 dB. White rectangles indicate the regions subjected to attacks. Panel A (left) displays the applied modifications, including localized noise, filtering, and copy-based attacks. Panel B (right) shows the corresponding detection output, highlighting the tampered areas identified by the authentication process. Source: https://arxiv.org/pdf/1308.0679

Från artikeln ‘Image Integrity Authentication Scheme Based On Fixed Point Theory’: tampering localization results using a fixed point image with a Peak Signal-to-Noise (PSNR) of 59.7802 dB. White rectangles indicate the regions subjected to attacks. Panel A (left) displays the applied modifications, including localized noise, filtering, and copy-based attacks. Panel B (right) shows the corresponding detection output, highlighting the tampered areas identified by the authentication process. Source: https://arxiv.org/pdf/1308.0679

Begreppet är kanske enklast att förstå i sammanhanget att reparera en ömtålig spetsduk: oavsett hur fint hantverket används för att laga dukens filigran, kommer den reparerade delen oundvikligen att vara synlig.

Denna typ av transformation, när den tillämpas upprepat på en gråskalebild, driver långsamt bilden mot en tillstånd där tillämpningen av transformationen igen producerar ingen ytterligare förändring.

Denna stabila version av bilden kallas en fixpunkt. Fixpunkter är sällsynta och känsliga för förändringar – varje liten modifiering av en fixpunktsbild kommer nästan säkert att bryta dess fixerade status, vilket gör det lätt att upptäcka manipulation.

Som vanligt med sådana metoder, kan artefakterna från JPEG-komprimering hota schemats integritet:

On the left, we see a watermark applied to the face of the iconic 'Lenna' (Lena) image, which is clear under normal compression. On the right, with 90% JPEG compression, we can see that the distinction between the perceived watermark and the growth of JPEG noise is lowering. After multiple resaves, or at the highest compression settings, the majority of watermarking schemes face issues with JPEG compression artefacts. Source: https://arxiv.org/pdf/2106.14150

On the left, we see a watermark applied to the face of the iconic ‘Lenna’ (Lena) image, which is clear under normal compression. On the right, with 90% JPEG compression, we can see that the distinction between the perceived watermark and the growth of JPEG noise is lowering. After multiple resaves, or at the highest compression settings, the majority of watermarking schemes face issues with JPEG compression artefacts. Source: https://arxiv.org/pdf/2106.14150

Vad om, istället, JPEG-komprimeringsartefakter kunde användas som den centrala metoden för att erhålla en fixpunkt? I ett sådant fall skulle det inte finnas något behov av extra system, eftersom samma mekanism som vanligtvis orsakar problem för vattenmärkning och manipulationsskydd skulle istället bilda grunden för manipulationsskyddsramverket i sig.

JPEG-komprimering som en säkerhetsbas

Ett sådant system föreslås i en ny artikel från två forskare vid University of Buffalo vid State University of New York. Artikeln, som heter Tamper-Evident Image Using JPEG Fixed Points, bygger på 2013 års arbete och relaterade arbeten, och formulerar officiellt dess centrala principer för första gången, samt använder JPEG-komprimering som en metod för att potentiellt producera en ‘självautentiserande’ bild.

Författarna utvecklar:

‘Studien visar att en bild blir oförändrad efter att ha genomgått flera omgångar av samma JPEG-komprimerings- och dekomprimeringsprocess.

‘Med andra ord, om en enskild cykel av JPEG-komprimering och dekomprimering betraktas som en transformation av bilden, kallad en JPEG-transformation, då utvisar denna transformation egenskapen att ha fixpunkter, d.v.s. bilder som förblir oförändrade när JPEG-transformationen appliceras.’

Från den nya artikeln, en illustration av JPEG-fixpunktskonvergens. I den övre raden ser vi en exempelbild som genomgår upprepad JPEG-komprimering, med varje iteration som visar antalet och placeringen av ändrade pixlar; i den nedre raden är pixelvis L2-avstånd mellan på varandra följande iterationer plottade över olika komprimeringskvalitetsinställningar. Ironiskt nog finns det ingen bättre upplösning av denna bild tillgänglig. Source: https://arxiv.org/pdf/2504.17594

Från den nya artikeln, en illustration av JPEG-fixpunktskonvergens. I den övre raden ser vi en exempelbild som genomgår upprepad JPEG-komprimering, med varje iteration som visar antalet och placeringen av ändrade pixlar; i den nedre raden är pixelvis L2-avstånd mellan på varandra följande iterationer plottade över olika komprimeringskvalitetsinställningar. Ironiskt nog finns det ingen bättre upplösning av denna bild tillgänglig. Source: https://arxiv.org/pdf/2504.17594

Istället för att införa externa transformationer eller vattenmärken, definierar den nya artikeln JPEG-processen som en dynamisk system. I detta modell flyttar varje komprimerings- och dekomprimeringscykel bilden mot en fixpunkt. Författarna bevisar att, efter en ändlig mängd iterationer, antingen når eller approximerar varje bild en tillstånd där ytterligare komprimering inte kommer att producera någon förändring.

Forskarna påstår*:

‘Varje ändring av bilden kommer att orsaka avvikelser från JPEG-fixpunkterna, som kan upptäckas som förändringar i JPEG-blocken efter en enda omgång av JPEG-komprimering och dekomprimering…

‘De föreslagna tamper-evident-bilderna baserade på JPEG-fixpunkter har två fördelar. Först eliminerar tamper-evident-bilder behovet av extern lagring av verifierbara funktioner, som krävs av bildfingeravtryck [scheman], eller inbäddning av dolda spår, som i bildvattenmärkningsmetoder. Bilden i sig fungerar som dess eget bevis på äkthet, vilket gör schemat inneboende självbevisande.

‘För det andra, eftersom JPEG är ett allmänt använt format och ofta den sista steget i bildbehandlingspipelinen, är den föreslagna metoden robust mot JPEG-åtgärder. Detta skiljer sig från den ursprungliga [metoden] som kan förlora integritetsspår på grund av JPEG.’

Artikelns viktigaste insikt är att JPEG-konvergens inte bara är en biprodukt av dess design, utan en matematiskt oundviklig följd av dess operationer. Den diskreta kosinustransformen, kvantifiering, avrundning och trunkering tillsammans bildar en transformation som (under rätt förhållanden) leder till en förutsägbar uppsättning fixpunkter.

Schema för JPEG-komprimerings- och dekomprimeringsprocessen formulerad för det nya arbetet.

Schema för JPEG-komprimerings- och dekomprimeringsprocessen formulerad för det nya arbetet.

Till skillnad från vattenmärkning kräver denna metod ingen inbäddad signal. Den enda referensen är bildens egen konsekvens under ytterligare komprimering. Om återkomprimering inte producerar någon förändring, antas bilden vara äkta. Om den gör det, indikeras manipulation genom avvikelsen.

Tester

Författarna validerade detta beteende med hjälp av en miljon slumpmässigt genererade åtta-pixel-stora färglösa bilddata. Genom att tillämpa upprepad JPEG-komprimering och dekomprimering på dessa syntetiska patchar, observerade de att konvergens till en fixpunkt sker inom en ändlig mängd steg. Denna process övervakades genom att mäta pixelvis L2-avstånd mellan på varandra följande iterationer, med skillnaderna som minskar tills patcharna stabiliserades.

L2-differens mellan på varandra följande iterationer för en miljon 8×8-patchar, mätt under varierande JPEG-komprimeringskvaliteter. Varje process börjar med en enskild JPEG-komprimerad patch och spårar minskningen av skillnaden över upprepad komprimering.

L2-differens mellan på varandra följande iterationer för en miljon 8×8-patchar, mätt under varierande JPEG-komprimeringskvaliteter. Varje process börjar med en enskild JPEG-komprimerad patch och spårar minskningen av skillnaden över upprepad komprimering.

För att utvärdera manipulationsskydd, konstruerade författarna tamper-evident JPEG-bilder och tillämpade fyra typer av attacker: salt och peppar-brus; kopia- och flytta-operationer; inlägg från externa källor; och dubbel JPEG-komprimering med en annan kvantifieringstabell.

Exempel på fixpunkts-RGB-bilder med upptäckt och lokaliseringsmanipulation, inklusive de fyra störningsmetoderna som användes av författarna. I den nedre raden kan vi se att varje störningsstil avslöjar sig i förhållande till den genererade fixpunktsbilden.

Exempel på fixpunkts-RGB-bilder med upptäckt och lokaliseringsmanipulation, inklusive de fyra störningsmetoderna som användes av författarna. I den nedre raden kan vi se att varje störningsstil avslöjar sig i förhållande till den genererade fixpunktsbilden.

Efter manipulation, komprimerades bilderna igen med hjälp av den ursprungliga kvantifieringsmatrisen. Avvikelser från fixpunkten upptäcktes genom att identifiera bildblock som visade icke-nollskillnader efter återkomprimering, vilket möjliggjorde både upptäckt och lokaliseringsmanipulation av manipulerade områden.

Eftersom metoden är baserad helt på standard-JPEG-åtgärder, fungerar fixpunktsbilder bra med vanliga JPEG-visare och redigerare; men författarna noterar att om bilden komprimeras i en annan kvalitetsnivå, kan den förlora sin fixpunktsstatus, vilket kan bryta autentiseringen och måste hanteras noggrant i verklig användning.

Medan detta inte bara är ett verktyg för att analysera JPEG-utdata, lägger det inte heller till mycket komplexitet. I princip kunde det integreras i befintliga arbetsflöden med minimal kostnad eller störning.

Artikeln erkänner att en sofistikerad motståndare kan försöka skapa adversariala ändringar som bevarar fixpunktsstatus; men forskarna hävdar att sådana ansträngningar sannolikt skulle introducera synliga artefakter, vilket skulle undergräva attacken.

Medan författarna inte hävdar att fixpunkts-JPEG kan ersätta bredare provenienssystem som C2PA, föreslår de att fixpunktsmetoder kan komplettera externa metadata-ramverk genom att erbjuda ett ytterligare lager av manipulationsskydd som består även när metadata är borttagna eller förlorade.

Slutsats

JPEG-fixpunktsmetoden erbjuder ett enkelt och självinnehållande alternativ till konventionella autentiseringssystem, som kräver ingen inbäddad metadata, vattenmärken eller externa referensfiler, och istället härleder äkthet direkt från den förutsägbara beteendet hos komprimeringsprocessen.

På detta sätt återvinns JPEG-komprimering – en vanlig källa till dataförsämring – som ett medel för integritetsverifiering. I detta avseende är den nya artikeln en av de mest innovativa och uppfinningsrika metoderna för att lösa problemet som jag har kommit över under de senaste åren.

Det nya arbetet pekar på en förändring bort från lager-tillägg för säkerhet och mot metoder som bygger på de inbyggda egenskaperna hos mediet i sig. När manipuleringsmetoder blir mer sofistikerade, kan tekniker som testar bildens egen interna struktur börja bli viktigare.

Ytterligare, många alternativa system som föreslås för att hantera detta problem introducerar betydande friktion genom att kräva förändringar i etablerade bildbehandlingsarbetsflöden – vissa av dessa har fungerat tillförlitligt i år, eller till och med decennier, och som skulle kräva ett mycket starkare motiv för att omkonfigurera.

 

* Min omvandling av författarnas inline-citat till hyperlänkar.

Publicerad första gången fredagen den 25 april 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai