Andersons vinkel

JPEG AI udvisker grænsen mellem rigtige og syntetiske billeder

mm
Føj Unite.AI til dine foretrukne kilder på Google
Created with ChatGPT-4o and Adobe Firefly

I februar i år blev den JPEG AI internationale standard offentliggjort, efter flere års forskning med det formål at bruge maskinelæringsteknikker til at producere en mindre og mere let transmitterbar og lagrbar billedkodek, uden tab af perceptuel kvalitet.

Fra den officielle publikationsstrøm for JPEG AI, en sammenligning mellem Peak Signal-to-Noise Ratio (PSNR) og JPEG AI's ML-forbedrede tilgang. Kilde: https://jpeg.org/jpegai/documentation.html

Fra den officielle publikationsstrøm for JPEG AI, en sammenligning mellem Peak Signal-to-Noise Ratio (PSNR) og JPEG AI’s ML-forbedrede tilgang. Kilde: https://jpeg.org/jpegai/documentation.html

En mulig årsag til, at denne begivenhed fik få overskrifter, er, at de centrale PDF’er for denne meddelelse ikke (ironisk nok) var tilgængelige gennem friadgangsporte som Arxiv. Arxiv havde allerede fremlagt en række studier, der undersøgte betydningen af JPEG AI på flere områder, herunder metodens usædvanlige kompressionsarter og dets betydning for retsmedicin.

En studie sammenlignede kompressionsarter, herunder dem fra en tidligere udgave af JPEG AI, og fandt, at den nye metode havde en tendens til at udslette tekst - ikke en ubetydelig sag i tilfælde, hvor kodeken kan bidrage til en beviskæde. Kilde: https://arxiv.org/pdf/2411.06810

En studie sammenlignede kompressionsarter, herunder dem fra en tidligere udgave af JPEG AI, og fandt, at den nye metode havde en tendens til at udslette tekst – ikke en ubetydelig sag i tilfælde, hvor kodeken kan bidrage til en beviskæde. Kilde: https://arxiv.org/pdf/2411.06810

Fordi JPEG AI ændrer billeder på en måde, der ligner artefakterne fra syntetiske billedgenereringsmodeller, har eksisterende retsmedicinske værktøjer svært ved at skelne mellem rigtige og falske billeder:

Efter JPEG AI-kompression kan avancerede algoritmer ikke længere pålideligt adskille ægte indhold fra manipulerede områder i lokaliseringskort, ifølge en ny artikel (marts 2025). Eksemplerne på venstre side er manipulerede/falske billeder, hvor de manipulerede områder er tydeligt afgrænsede under standard retsmedicinske teknikker (billede i midten). Men JPEG AI-kompression giver de falske billeder et lag af troværdighed (billede længst til højre). Kilde: https://arxiv.org/pdf/2412.03261

Efter JPEG AI-kompression kan avancerede algoritmer ikke længere pålideligt adskille ægte indhold fra manipulerede områder i lokaliseringskort, ifølge en ny artikel (marts 2025). Eksemplerne på venstre side er manipulerede/falske billeder, hvor de manipulerede områder er tydeligt afgrænsede under standard retsmedicinske teknikker (billede i midten). Men JPEG AI-kompression giver de falske billeder et lag af troværdighed (billede længst til højre). Kilde: https://arxiv.org/pdf/2412.03261

En årsag er, at JPEG AI er trænet med en modelarkitektur, der ligner dem, der bruges af generative systemer, som retsmedicinske værktøjer søger at détectere:

Den nye artikel illustrerer ligheden mellem metodernes Ai-drevne billedkompression og faktiske Ai-genererede billeder. Kilde: https://arxiv.org/pdf/2504.03191

Den nye artikel illustrerer ligheden mellem metodernes Ai-drevne billedkompression og faktiske Ai-genererede billeder. Kilde: https://arxiv.org/pdf/2504.03191

Derfor kan begge modeller producere nogle lignende underliggende visuelle karakteristika, set fra et retsmedicinsk synspunkt.

Kvantificering

Dette overlap sker på grund af kvantificering, som er fælles for begge arkitekturer, og som bruges i maskinelæring både som en metode til at konvertere kontinuert data til diskrete datapunkter, og som en optimeringsteknik, der kan reducere filstørrelsen på en trænet model (entusiaster for billedsynthesis vil være bekendt med ventetiden mellem en uholdbar officiel modeludgivelse og en community-ledt kvantificeret version, der kan køre på lokal hardware).

I denne sammenhæng refererer kvantificering til processen med at konvertere de kontinuerte værdier i billedets latent repræsentation til faste, diskrete trin. JPEG AI bruger denne proces til at reducere mængden af data, der er nødvendig for at gemme eller transmittere et billede ved at forenkle den interne numeriske repræsentation.

Selvom kvantificering gør kodning mere effektiv, introducerer den også strukturelle regelmæssigheder, der kan ligne artefakterne fra generative modeller – subtile nok til at undgå perception, men disruptivt for retsmedicinske værktøjer.

Som svar foreslår forfatterne af en ny artikel med titlen Three Forensic Cues for JPEG AI Images fortolkelige, ikke-neurale teknikker, der kan détectere JPEG AI-kompression; bestemme, om et billede er blevet rekompliceret; og skelne mellem komprimerede rigtige billeder og billeder, der er genereret helt af Ai-modeller.

Metode

Farvekorrrelationer

Artiklen foreslår tre ‘retsmedicinske hints’ tilpasset JPEG AI-billeder: farvekanelkorrrelationer, introduceret under JPEG AI’s forarbejdningstrin; målbar forringelse af billedkvalitet over gentagne kompressioner, der afslører rekompliceringsbegivenheder; og latent-rum-kvantificeringsmønstre, der hjælper med at skelne mellem billeder, der er komprimeret af JPEG AI, og billeder, der er genereret af Ai-modeller.

Med hensyn til den farvekorrrelationsbaserede tilgang introducerer JPEG AI’s forarbejdningspipeline statistiske afhængigheder mellem billedets farvekaneler, hvilket skaber en signatur, der kan fungere som en retsmedicinsk hint.

JPEG AI konverterer RGB-billeder til YUV-farverummet og udfører 4:2:0 chroma-undersampling, hvilket indebærer at nedsample chrominance-kanalerne før kompression. Dette proces resulterer i subtile korrrelationer mellem de højfrekvente rester af de røde, grønne og blå kanaler – korrrelationer, der ikke er til stede i ukomprimerede billeder, og som adskiller sig i styrke fra dem, der produceres af traditionel JPEG-kompression eller syntetiske billedgenereringsmodeller.

En sammenligning af, hvordan JPEG AI-kompression ændrer farvekorrrelationer i billeder, ved at bruge den røde kanal som eksempel. Panel (a) sammenligner ukomprimerede billeder med JPEG AI-komprimerede billeder og viser, at kompressionen betydeligt øger inter-kanalkorrrelation. Panel (b) isolerer effekten af JPEG AI's forarbejdnings–kun farveomdannelsen og undersampling–og demonstrerer, at selv dette trin alene øger korrrelationerne mærkbart. Panel (c) viser, at traditionel JPEG-kompression også øger korrrelationerne lidt, men ikke i samme omfang. Panel (d) undersøger syntetiske billeder, hvor Midjourney-V5 og Firefly viser moderate korrelationsøgninger, mens andre forbliver tæt på ukomprimerede niveauer.

En sammenligning af, hvordan JPEG AI-kompression ændrer farvekorrrelationer i billeder..

Ovenfor kan vi se en sammenligning fra artiklen, der viser, hvordan JPEG AI-kompression ændrer farvekorrrelationer i billeder, ved at bruge den røde kanal som eksempel.

Panel A sammenligner ukomprimerede billeder med JPEG AI-komprimerede billeder og viser, at kompressionen betydeligt øger inter-kanalkorrrelation; panel B isolerer effekten af JPEG AI’s forarbejdnings–kun farveomdannelsen og undersampling–og demonstrerer, at selv dette trin alene øger korrrelationerne mærkbart; panel C viser, at traditionel JPEG-kompression også øger korrrelationerne lidt, men ikke i samme omfang; og Panel D undersøger syntetiske billeder, hvor Midjourney-V5 og Adobe Firefly viser moderate korrelationsøgninger, mens andre forbliver tæt på ukomprimerede niveauer.

Rate-Distortion

Rate-Distortion-hinten identificerer JPEG AI-rekompression ved at spore, hvordan billedkvalitet, målt ved Peak Signal-to-Noise Ratio (PSNR), falder i en forudsigelig mønster over flere kompressionsgange.

Forskningen påstår, at gentagne kompressioner af et billede med JPEG AI fører til gradvis mindre, men stadig målbare, tab af billedkvalitet, som kvantificeret ved PSNR, og at denne gradvise forringelse danner grundlag for en retsmedicinsk hint til at détectere, om et billede er blevet rekompliceret.

I modsætning til traditionel JPEG, hvor tidligere metoder sporedde ændringer i bestemte billedblokke, kræver JPEG AI en anden tilgang på grund af dets neurale kompressionsarkitektur; derfor foreslår forfatterne at overvåge, hvordan både bitrate og PSNR udvikler sig over på hinanden følgende kompressioner. Hver kompressionsrunde ændrer billedet mindre end den foregående, og denne aftagende ændring (når den er plotteret mod bitrate) kan afsløre, om et billede er gået gennem flere kompressionsfaser:

En illustration af, hvordan gentagen kompression påvirker billedkvalitet over forskellige kodecer, viser, at JPEG AI og en neural kodec udviklet på https://arxiv.org/pdf/1802.01436 begge viser en konstant nedgang i PSNR med hver yderligere kompression – selv ved lavere bitrates. I modsætning til dette opretholder traditionel JPEG en relativt stabil kvalitet over flere kompressioner, medmindre bitrate er høj. Dette mønster fungerer som et eksempel på, hvordan rekompliceringsbegivenheder efterlader en målbar spor i Ai-baserede kodecer, og tilbyder en potentiel retsmedicinsk signal.

En illustration af, hvordan gentagen kompression påvirker billedkvalitet over forskellige kodecer, viser resultater fra JPEG AI og en neural kodec udviklet på https://arxiv.org/pdf/1802.01436; begge viser en konstant nedgang i PSNR med hver yderligere kompression, selv ved lavere bitrates. I modsætning til dette opretholder traditionel JPEG en relativt stabil kvalitet over flere kompressioner, medmindre bitrate er høj.

I billedet ovenfor ser vi grafiske rate-distortion-kurver for JPEG AI; en anden Ai-baseret kodec; og traditionel JPEG, og finder, at JPEG AI og den neurale kodec viser en konstant PSNR-nedgang over alle bitrates, mens traditionel JPEG kun viser bemærkelsesværdig forringelse ved højere bitrates. Dette adfærd giver en kvantificerbar signal, der kan bruges til at flagre rekompliceret JPEG AI-billeder.

Ved at udtrække, hvordan bitrate og billedkvalitet udvikler sig over flere kompressionsrunde, konstruerede forfatterne på samme måde en signatur, der hjælper med at flagre, om et billede er blevet rekompliceret, og giver en potentiel praktisk retsmedicinsk hint i sammenhængen med JPEG AI.

Kvantificering

Som vi så tidligere, er en af de mere udfordrende retsmedicinske problemer, der er rejst af JPEG AI, dens visuelle lighed med syntetiske billeder genereret af diffusionsmodeller. Begge systemer bruger encoder-dekoder-arkitekturer, der behandler billeder i et komprimeret latent rum og ofte efterlader subtile upsampling-artefakter.

Disse fælles træk kan forvirre detektorer – selv dem, der er gentrænet på JPEG AI-billeder. Men en vigtig strukturel forskel er til stede: JPEG AI anvender kvantificering, et trin, der afrunder latente værdier til diskrete niveauer for effektiv kompression, mens generative modeller typisk ikke gør det.

Den nye artikel bruger denne forskel til at designe en retsmedicinsk hint, der indirekte tester for tilstedeværelsen af kvantificering. Metoden analyserer, hvordan den latente repræsentation af et billede reagerer på afrundning, under antagelse af, at hvis et billede allerede er blevet kvantificeret, vil dets latente struktur udvise en målbar mønster af alignment med afrundede værdier.

Disse mønstre, der er usynlige for øjet, producerer statistiske forskelle, der kan hjælpe med at skelne mellem komprimerede rigtige billeder og fuldstændigt syntetiske billeder.

<img class=" wp-image-215542" src="https://www.unite.ai/wp-content/uploads/2025/04/fig-7.jpg" alt="Et eksempel på gennemsnitlige Fourier-spektra viser, at både JPEG AI-komprimerede billeder og billeder genereret af diffusionsmodeller som Midjourney-V5 og Stable Diffusion XL viser regelmæssige grid-lignende mønstre i frekvensdomænet – artefakter, der ofte er forbundet med upsampling. I modsætning hertil mangler rigtige billeder disse mønstre. Dette overlap i spektral struktur hjælper med at forklare, hvorfor retsmedicinske værktøjer ofte forvirrer komprimerede rigtige billeder med syntetiske billeder.

Det er vigtigt, at forfatterne viser, at denne hint fungerer over forskellige generative modeller og forbliver effektiv, selv når kompressionen er stærk nok til at nulstille hele sektioner af det latente rum. I modsætning hertil viser syntetiske billeder meget svagere reaktioner på denne afrundningstest, og tilbyder en praktisk måde at skelne mellem de to.

Resultatet er tænkt som et letvægts- og fortolkeligt værktøj, der sigter mod den grundlæggende forskel mellem kompression og generation, snarere end at afhænge af ømtålige overfladeartefakter.

Data og tests

Kompression

For at evaluere, om deres farvekorrrelationshint kunne pålideligt détectere JPEG AI-kompression (dvs. en første passage fra ukomprimeret kilde), testede forfatterne det på højkvalitets ukomprimerede billeder fra RAISE-databasen, komprimeret ved forskellige bitrates, ved hjælp af JPEG AI-referencen.

De trænede en simpel random forest på de statistiske mønstre af farvekanelkorrrelationer (især hvordan reststøj i hver kanal alignerede med de andre) og sammenlignede det med en ResNet50 neural netværk, der var trænet direkte på billedpixelene.

Détektionsnøjagtighed af JPEG AI-kompression ved hjælp af farvekorrrelationsfunktioner, sammenlignet over flere bitrates. Metoden er mest effektiv ved lavere bitrates, hvor kompressionsarter er stærkere, og viser bedre generalisering til usete kompressionsniveauer end baseline ResNet50-modellen.

Détektionsnøjagtighed af JPEG AI-kompression ved hjælp af farvekorrrelationsfunktioner, sammenlignet over flere bitrates. Metoden er mest effektiv ved lavere bitrates, hvor kompressionsarter er stærkere, og viser bedre generalisering til usete kompressionsniveauer end baseline ResNet50-modellen.

Mens ResNet50 opnåede højere nøjagtighed, når testdataen lå tæt på dens træningsbetingelser, havde den svært ved at generalisere over forskellige kompressionsniveauer. Den korrelationsbaserede tilgang, selvom den var langt enklere, viste sig at være mere konsekvent over bitrates, især ved lavere kompressionsrater, hvor JPEG AI’s forarbejdningsprocess havde en stærkere effekt.

Disse resultater antyder, at det er muligt at détectere JPEG AI-kompression ved hjælp af statistiske hints, der forbliver fortolkelige og robuste.

Rekompression

For at evaluere, om JPEG AI-rekompression kan détecteres pålideligt, testede forskerne rate-distortion-hinten på en samling af billeder komprimeret ved forskellige bitrates – nogle kun én gang og andre en anden gang ved hjælp af JPEG AI.

Denne metode involverede at udtrække en 17-dimensionel funktionvektor for at spore, hvordan billedets bitrate og PSNR udviklede sig over tre kompressionsgange. Denne funktionssæt fik fat på, hvor meget kvalitet der gik tabt ved hver trin, og hvordan de latente og hyperprior-rater opførte sig—målinger, som traditionelle pixelbaserede metoder ikke let kan få adgang til.

Forskere trænede en random forest på disse funktioner og sammenlignede dens præstation med en ResNet50, der var trænet på billedstykker:

Resultater for klassifikationsnøjagtigheden af en random forest, der er trænet på rate-distortion-funktioner for at détectere, om et JPEG AI-billede er blevet rekompliceret. Metoden fungerer bedst, når den første kompression er stærk (dvs. ved lavere bitrates), og derefter konsekvent overgår en pixelbaseret ResNet50 – især i tilfælde, hvor den anden kompression er mildere end den første.

Resultater for klassifikationsnøjagtigheden af en random forest, der er trænet på rate-distortion-funktioner for at détectere, om et JPEG AI-billede er blevet rekompliceret. Metoden fungerer bedst, når den første kompression er stærk (dvs. ved lavere bitrates), og derefter konsekvent overgår en pixelbaseret ResNet50 – især i tilfælde, hvor den anden kompression er mildere end den første.

Random foresten viste sig at være bemærkelsesværdigt effektiv, når den første kompression var stærk (dvs. ved lavere bitrates), og afslørede tydelige forskelle mellem enkelt- og dobbeltkomprimerede billeder. Som tidligere hint havde ResNet50-iterationen svært ved at generalisere, især når den blev testet på kompressionsniveauer, den ikke havde set under træning.

Rate-distortion-funktionerne, til gengæld, forblev stabile over en bred vifte af scenarier. Det er værd at bemærke, at hinten fungerede, selv når den blev anvendt på en anden Ai-baseret kodec, hvilket antyder, at tilgangen generaliserer ud over JPEG AI.

JPEG AI og syntetiske billeder

Til den sidste testrunde testede forfatterne, om deres kvantificeringsbaserede funktioner kan skelne mellem JPEG AI-komprimerede billeder og fuldstændigt syntetiske billeder genereret af modeller som Midjourney, Stable Diffusion, DALL-E 2, Glide, og Adobe Firefly.

Til dette formål brugte forskerne en undermængde af Synthbuster-databasen, der kombinerer rigtige fotos fra RAISE-databasen med billeder genereret af forskellige diffusions- og GAN-baserede modeller.

Eksempler på syntetiske billeder i Synthbuster, genereret ved hjælp af tekstprompts inspireret af naturlige fotografier fra RAISE-1k-databasen. Billederne blev skabt med forskellige diffusionsmodeller, med prompts designet til at producere fotorealistiske indhold og teksturer snarere end stiliserede eller kunstneriske gengivelser, og reflekterer således databasens fokus på at teste metoder til at skelne mellem rigtige og genererede billeder.

Eksempler på syntetiske billeder i Synthbuster, genereret ved hjælp af tekstprompts inspireret af naturlige fotografier fra RAISE-1k-databasen. Billederne blev skabt med forskellige diffusionsmodeller, med prompts designet til at producere fotorealistiske indhold og teksturer snarere end stiliserede eller kunstneriske gengivelser. Kilde: https://ieeexplore.ieee.org/document/10334046

De rigtige billeder blev komprimeret med JPEG AI ved flere bitrates, og klassifikationen blev opstillet som en tovejsopgave: enten JPEG AI versus en specifik generator eller en specifik bitrate versus Stable Diffusion XL.

Kvantificeringsfunktionerne (korrelationer udtrukket fra latente repræsentationer) blev beregnet fra en fast 256×256-region og ført til en random forest-klassifikator. Som baseline blev en ResNet50 trænet på pixelstykker fra samme data.

Klassifikationsnøjagtighed af en random forest, der bruger kvantificeringsfunktioner til at skelne mellem JPEG AI-komprimerede billeder og syntetiske billeder.

Klassifikationsnøjagtighed af en random forest, der bruger kvantificeringsfunktioner til at skelne mellem JPEG AI-komprimerede billeder og syntetiske billeder.

Over de fleste betingelser overgik den kvantificeringsbaserede tilgang ResNet50-baselinjen, især ved lavere bitrates, hvor kompressionsarter var stærkere.

Forfatterne fastslår:

‘Baseline ResNet50 performer bedst for Glide-billeder med en nøjagtighed på 66,1%, men ellers generaliserer den dårligere end kvantificeringsfunktionerne. Kvantificeringsfunktionerne viser en god generalisering over kompressionsstyrke og generatortyper.

‘Vigtigheden af koefficienterne, der kvantificeres til nul, vises i den respektabelle præstation af de afkortede [funktioner], der i mange tilfælde performer sammenligneligt med ResNet50-klassifikatoren.

‘Men kvantificeringsfunktioner, der bruger den uforkortede, fulde integer [vektor], performer dog bemærkelsesværdigt bedre. Disse resultater bekræfter, at mængden af nul efter kvantificering er en vigtig hint for at skelne mellem Ai-komprimerede og Ai-genererede billeder.

‘Alligevel viser det også, at andre faktorer bidrager. Nøjagtigheden af den fulde vektor for at détectere JPEG AI er for alle bitrates over 91,0%, og stærkere kompression fører til højere nøjagtigheder.’

En projektion af funktionrummet ved hjælp af UMAP viste en tydelig adskillelse mellem JPEG AI og syntetiske billeder, med lavere bitrates, der øgede afstanden mellem klasser. En konsekvent outlier var Glide, hvis billeder klumpede anderledes og havde den laveste détektionsnøjagtighed af alle generatorene, der blev testet.

To-dimensionel UMAP-visualisering af JPEG AI-komprimerede og syntetiske billeder baseret på kvantificeringsfunktioner. Den venstre plot viser, at lavere JPEG AI-bitrates skaber større adskillelse fra syntetiske billeder; den højre plot viser, hvordan billeder fra forskellige generatore klumperer tydeligt inden for funktionrummet.

To-dimensionel UMAP-visualisering af JPEG AI-komprimerede og syntetiske billeder, baseret på kvantificeringsfunktioner. Den venstre plot viser, at lavere JPEG AI-bitrates skaber større adskillelse fra syntetiske billeder; den højre plot viser, hvordan billeder fra forskellige generatore klumperer tydeligt inden for funktionrummet.

Til sidst evaluerede forfatterne, hvor godt funktionerne holdt op under typisk efterbehandling, såsom JPEG-rekompression eller downsampling. Selvom præstationen faldt med tungere behandling, var faldet gradvist, hvilket antyder, at tilgangen bevarede en vis robusthed, selv under degraderede betingelser.

Evaluering af kvantificeringsfunktionens robusthed under efterbehandling, herunder JPEG-rekompression (JPG) og billedgenindlæsning (RS).

Evaluering af kvantificeringsfunktionens robusthed under efterbehandling, herunder JPEG-rekompression (JPG) og billedgenindlæsning (RS).

Konklusion

Det er ikke garanteret, at JPEG AI vil få bred udbredelse. For det første er der nok infrastruktur-gæld til at påføre friktion på enhver ny kodek; og selv en ‘konventionel’ kodek med en fin pedigree og bred enighed om dets værdi, som AV1, har svært ved at fortrænge etablerede metoder.

Med hensyn til systemets potentiale kollision med Ai-genereringsmodeller kan de karakteristiske kvantificeringsarter, der hjælper den nuværende generation af Ai-billed-detektorer, måske blive reduceret eller erstattet af spor af en anden art, i senere systemer (under antagelse af, at Ai-genereringsmodeller altid efterlader retsmedicinske spor, hvilket ikke er sikkert).

Dette ville betyde, at JPEG AI’s egne kvantificeringskarakteristika, måske sammen med andre hints identificeret af den nye artikel, måske ikke ender med at kollidere med den retsmedicinske spor af de mest effektive nye generative Ai-systemer.

Hvis, dog, JPEG AI fortsætter med at fungere som en de facto ‘Ai-vask’, der betydeligt udvisker forskellen mellem rigtige og genererede billeder, ville det være svært at fremme en overbevisende sag for dets optagelse.

 

Først publiceret tirsdag, 8. april 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai