Andersons vinkel

JPEG AI suddar gränsen mellan riktiga och syntetiska bilder

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Created with ChatGPT-4o and Adobe Firefly

I februari i år publicerades den internationella standarden för JPEG AI, efter flera års forskning som syftade till att använda maskinlärningstekniker för att producera en mindre och mer lätt överförbar och lagringsbar bildkod, utan förlust av perceptuell kvalitet.

Från den officiella publiceringsströmmen för JPEG AI, en jämförelse mellan Peak Signal-to-Noise Ratio (PSNR) och JPEG AI:s ML-förbättrade tillvägagångssätt. Källa: https://jpeg.org/jpegai/documentation.html

Från den officiella publiceringsströmmen för JPEG AI, en jämförelse mellan Peak Signal-to-Noise Ratio (PSNR) och JPEG AI:s ML-förbättrade tillvägagångssätt. Källa: https://jpeg.org/jpegai/documentation.html

En möjlig anledning till att denna händelse fick få rubriker är att kärndokumenten för den här tillkännagivandet (ironiskt nog) inte var tillgängliga via fria åtkomstportaler som Arxiv. Trots detta hade Arxiv redan lagt fram ett antal studier som undersökte betydelsen av JPEG AI över flera aspekter, inklusive metodens ovanliga komprimeringsartefakter och dess betydelse för forensik.

En studie jämförde komprimeringsartefakter, inklusive de från en tidigare utkast av JPEG AI, och fann att den nya metoden hade en tendens att sudda ut text – inte en bagatell i fall där codecen kan bidra till en beviskedja. Källa: https://arxiv.org/pdf/2411.06810

En studie jämförde komprimeringsartefakter, inklusive de från en tidigare utkast av JPEG AI, och fann att den nya metoden hade en tendens att sudda ut text – inte en bagatell i fall där codecen kan bidra till en beviskedja. Källa: https://arxiv.org/pdf/2411.06810

Eftersom JPEG AI ändrar bilder på sätt som liknar artefakterna från syntetiska bildgenererare, har befintliga forensiska verktyg svårt att skilja på riktiga och falska bilder:

Efter JPEG AI-komprimering kan toppmoderna algoritmer inte längre tillförlitligt skilja på äkta innehåll och manipulerade områden i lokaliseringskartor, enligt en nyligen publicerad artikel (mars 2025). Exemplen till vänster är manipulerade/falska bilder, där de manipulerade områdena tydligt avgränsas med standardforensiska metoder (mittenbild). Men JPEG AI-komprimering ger de falska bilderna en sken av autenticitet (bild längst till höger). Källa: https://arxiv.org/pdf/2412.03261

Efter JPEG AI-komprimering kan toppmoderna algoritmer inte längre tillförlitligt skilja på äkta innehåll och manipulerade områden i lokaliseringskartor, enligt en nyligen publicerad artikel (mars 2025). Exemplen till vänster är manipulerade/falska bilder, där de manipulerade områdena tydligt avgränsas med standardforensiska metoder (mittenbild). Men JPEG AI-komprimering ger de falska bilderna en sken av autenticitet (bild längst till höger). Källa: https://arxiv.org/pdf/2412.03261

En anledning är att JPEG AI är tränad med en modellarkitektur som liknar de som används av generativa system som forensiska verktyg syftar till att upptäcka:

Den nya artikeln illustrerar likheten mellan metoderna för AI-drivna bildkomprimering och faktiska AI-genererade bilder. Källa: https://arxiv.org/pdf/2504.03191

Den nya artikeln illustrerar likheten mellan metoderna för AI-drivna bildkomprimering och faktiska AI-genererade bilder. Källa: https://arxiv.org/pdf/2504.03191

Därför kan båda modellerna producera vissa liknande underliggande visuella egenskaper, ur ett forensiskt perspektiv.

Kvantisering

Denna överlappning sker på grund av kvantisering, som är gemensam för båda arkitekturerna, och som används i maskinlärning både som en metod för att konvertera kontinuerliga data till diskreta datapunkter, och som en optimeringsteknik som kan betydligt minska filstorleken på en tränad modell (entusiaster för bildsyntes kommer att känna igen väntetiden mellan en otymplig officiell modellrelease och en community-ledd kvantiserad version som kan köras på lokal hårdvara).

I detta sammanhang avser kvantisering processen att konvertera de kontinuerliga värdena i bildens latenta representation till fasta, diskreta steg. JPEG AI använder denna process för att minska mängden data som behövs för att lagra eller överföra en bild genom att förenkla den interna numeriska representationen.

Även om kvantisering gör kodningen mer effektiv, inför den också strukturerade regelbundenheter som kan likna artefakterna från generativa modeller – subtila nog att undgå uppfattning, men störande för forensiska verktyg.

Som svar föreslår författarna till en ny artikel med titeln Three Forensic Cues for JPEG AI Images tolkningsbara, icke-neurona tekniker som upptäcker JPEG AI-komprimering; bestämmer om en bild har rekompilerats; och skiljer på komprimerade riktiga bilder och de som genereras helt av AI.

Metod

Färgkorrelationer

Artikeln föreslår tre ‘forensiska ledtrådar’ anpassade för JPEG AI-bilder: färgkanalkorrelationer, introducerade under JPEG AI:s förbehandlingssteg; mätbara distorsioner i bildkvalitet över upprepade komprimeringar som avslöjar rekompimeringshändelser; och latenta rumskvantiseringsmönster som hjälper till att skilja på bilder komprimerade av JPEG AI och de som genereras av AI-modeller.

Angående den färgkorrelationsbaserade metoden introducerar JPEG AI:s förbehandlingspipeline statistiska beroenden mellan bildens färgkanaler, vilket skapar en signatur som kan fungera som en forensisk ledtråd.

JPEG AI konverterar RGB-bilder till YUV-färgrymden och utför 4:2:0 krominansundersampling, vilket innebär att nedsample krominanskanalerna före komprimering. Denna process leder till subtila korrelationer mellan de högfrekventa resterna av de röda, gröna och blå kanaler – korrelationer som inte finns i okomprimerade bilder och som skiljer sig i styrka från de som produceras av traditionell JPEG-komprimering eller syntetiska bildgenererare.

En jämförelse av hur JPEG AI-komprimering ändrar färgkorrelationer i bilder, med den röda kanalen som exempel. Panel (a) jämför okomprimerade bilder med JPEG AI-komprimerade, och visar att komprimering betydligt ökar interkanalkorrelation. Panel (b) isolerar effekten av JPEG AI:s förbehandling – bara färgomvandling och undersampling – och visar att även detta steg ensamt ökar korrelationerna märkbart. Panel (c) visar att traditionell JPEG-komprimering också ökar korrelationerna något, men inte i samma utsträckning. Panel (d) undersöker syntetiska bilder, med Midjourney-V5 och Firefly som visar måttliga korrelationsökningar, medan andra förblir närmare okomprimerade nivåer.

En jämförelse av hur JPEG AI-komprimering ändrar färgkorrelationer i bilder..

Ovan kan vi se en jämförelse från artikeln som visar hur JPEG AI-komprimering ändrar färgkorrelationer i bilder, med den röda kanalen som exempel.

Panel A jämför okomprimerade bilder med JPEG AI-komprimerade, och visar att komprimering betydligt ökar interkanalkorrelation; panel B isolerar effekten av JPEG AI:s förbehandling – bara färgomvandling och undersampling – och visar att även detta steg ensamt ökar korrelationerna märkbart; panel C visar att traditionell JPEG-komprimering också ökar korrelationerna något, men inte i samma utsträckning; och panel D undersöker syntetiska bilder, med Midjourney-V5 och Adobe Firefly som visar måttliga korrelationsökningar, medan andra förblir närmare okomprimerade nivåer.

Bitrats-distorsion

Bitrats-distorsionsledtråden identifierar JPEG AI-rekompimering genom att spåra hur bildkvalitet, mätt i Peak Signal-to-Noise Ratio (PSNR), försämras i ett förutsägbart mönster över flera komprimeringspass.

Forskningen hävdar att upprepade komprimeringar av en bild med JPEG AI leder till progressivt mindre, men fortfarande mätbara, kvalitetsförluster, som kvantifieras av PSNR, och att denna gradvisa försämring utgör grunden för en forensisk ledtråd för att upptäcka om en bild har rekompilerats.

Till skillnad från traditionell JPEG, där tidigare metoder spårade förändringar i specifika bildblock, kräver JPEG AI en annan tillvägagångssätt på grund av sin neuralkomprimeringsarkitektur; därför föreslår författarna att man övervakar hur både bitrate och PSNR utvecklas över på varandra följande komprimeringar. Varje komprimeringsomgång ändrar bilden mindre än den föregående, och denna avtagande förändring (när den plottas mot bitrate) kan avslöja om en bild har genomgått flera komprimeringssteg:

En illustration av hur upprepad komprimering påverkar bildkvalitet över olika kodekar visar att JPEG AI och en neural codec utvecklad på https://arxiv.org/pdf/1802.01436 båda uppvisar en stadig minskning av PSNR med varje ytterligare komprimering – även vid lägre bitrater. I kontrast till traditionell JPEG-komprimering, som upprätthåller relativt stabil kvalitet över flera komprimeringar, såvida inte bitratet är högt. Detta mönster fungerar som ett exempel på hur rekompimering lämnar ett mätbart spår i AI-baserade kodekar, vilket erbjuder en potentiell forensisk signal.

En illustration av hur upprepad komprimering påverkar bildkvalitet över olika kodekar, med resultat från JPEG AI och en neural codec utvecklad på https://arxiv.org/pdf/1802.01436; båda uppvisar en stadig minskning av PSNR med varje ytterligare komprimering, även vid lägre bitrater. I kontrast till traditionell JPEG-komprimering, som upprätthåller relativt stabil kvalitet över flera komprimeringar, såvida inte bitratet är högt.

I ovanstående bild ser vi kurvor för bitrate-förlust för JPEG AI; en andra AI-baserad codec; och traditionell JPEG, och finner att JPEG AI och den neurala codecen visar en konsekvent PSNR-minskning över alla bitrater, medan traditionell JPEG bara visar märkbar försämring vid mycket högre bitrater. Detta beteende erbjuder en kvantifierbar signal som kan användas för att flagga rekompilerade JPEG AI-bilder.

Genom att extrahera hur bitrate och bildkvalitet utvecklas över flera komprimeringsomgångar konstruerade författarna på liknande sätt en signatur som hjälper till att flagga om en bild har rekompilerats, vilket erbjuder en potentiell praktisk forensisk ledtråd i sammanhanget med JPEG AI.

Kvantisering

Som vi såg tidigare är en av de mer utmanande forensiska problemen som JPEG AI väcker dess visuella likhet med syntetiska bilder genererade av diffusionsmodeller. Båda systemen använder encoder-decoder-arkitekturer som bearbetar bilder i ett komprimerat latentspace och ofta lämnar efter sig subtila upsampling-artefakter.

De delade egenskaperna kan förvirra detektorer – även de som omtränats på JPEG AI-bilder. Men en viktig strukturförändring kvarstår: JPEG AI tillämpar kvantisering, ett steg som avrundar latentavärden till diskreta nivåer för effektiv komprimering, medan generativa modeller vanligtvis inte gör det.

Den nya artikeln använder denna skillnad för att utforma en forensisk ledtråd som indirekt testar för närvaron av kvantisering. Metoden analyserar hur den latenta representationen av en bild svarar på avrundning, med antagandet att om en bild redan har kvantiserats, dess latentstruktur kommer att uppvisa ett mätbart mönster av anpassning till avrundade värden.

De här mönstren, som är osynliga för ögat, producerar statistiska skillnader som kan hjälpa till att skilja på komprimerade riktiga bilder och fullständigt syntetiska.

<img class=" wp-image-215542" src="https://www.unite.ai/wp-content/uploads/2025/04/fig-7.jpg" alt="Ett exempel på genomsnittliga Fourier-spektra visar att både JPEG AI-komprimerade bilder och de som genereras av diffusionsmodeller som Midjourney-V5 och Stable Diffusion XL uppvisar regelbundna grid-liknande mönster i frekvensdomänen – artefakter som vanligtvis är kopplade till upsampling. I kontrast saknar riktiga bilder dessa mönster. Denna överlappning i spektral struktur hjälper till att förklara varför forensiska verktyg ofta förvirrar komprimerade riktiga bilder med syntetiska.

Viktigt är att författarna visar att denna ledtråd fungerar över olika generativa modeller och förblir effektiv även när komprimeringen är tillräckligt stark för att utplåna hela sektioner av latentspace. I kontrast visar syntetiska bilder mycket svagare svar på denna avrundningstest, vilket erbjuder en praktisk metod för att skilja på de båda.

Resultatet är tänkt att vara ett lätt och tolkningsbart verktyg som riktar sig mot den grundläggande skillnaden mellan komprimering och generering, snarare än att förlita sig på bräckliga yttre artefakter.

Data och tester

Komprimering

För att utvärdera om deras färgkorrelationsbaserade ledtråd kunde tillförlitligt upptäcka JPEG AI-komprimering (d.v.s. en första omgång från okomprimerad källa), testade författarna den på högkvalitativa okomprimerade bilder från RAISE-databasen, komprimerade dessa vid en mängd olika bitrater med JPEG AI-referensimplementeringen.

De tränade en enkel random forest på de statistiska mönstren av färgkanalkorrelationer (särskilt hur restbuller i varje kanal stämde överens med de andra) och jämförde detta med en ResNet50 neural nätverk tränad direkt på bildpixlarna.

Upptäcktsaccurans för JPEG AI-komprimering med färgkorrelationsfunktioner, jämförd över flera bitrater. Metoden är mest effektiv vid lägre bitrater, där komprimeringsartefakter är starkare, och visar bättre generalisering till okända komprimeringsnivåer än baseline-ResNet50-modellen.

Upptäcktsaccurans för JPEG AI-komprimering med färgkorrelationsfunktioner, jämförd över flera bitrater. Metoden är mest effektiv vid lägre bitrater, där komprimeringsartefakter är starkare, och visar bättre generalisering till okända komprimeringsnivåer än baseline-ResNet50-modellen.

Medan ResNet50 uppnådde högre accurans när testdatat nära överensstämde med dess träningsförhållanden, hade den svårt att generalisera över olika komprimeringsnivåer. Färgkorrelationsbaserade metoden, som var betydligt enklare, visade sig vara mer konsekvent över bitrater, särskilt vid lägre komprimeringshastigheter där JPEG AI:s förbehandling hade en starkare effekt.

Dessa resultat tyder på att det är möjligt att upptäcka JPEG AI-komprimering med statistiska ledtrådar som förblir tolkningsbara och robusta.

Rekompimering

För att utvärdera om JPEG AI-rekompimering kan upptäckas tillförlitligt, testade forskarna bitrats-distorsionsledtråden på en uppsättning bilder komprimerade vid olika bitrater – några bara en gång och andra en andra gång med JPEG AI.

Denna metod innebar att extrahera en 17-dimensionell funktion för att spåra hur bildens bitrate och PSNR utvecklades över tre komprimeringspass. Denna funktionssamling fångade hur mycket kvalitet som förlorades vid varje steg, och hur de latenta och hyperprior hastigheterna betedde sig – mått som traditionella pixelbaserade metoder inte kan komma åt lätt.

Forskarna tränade en random forest på dessa funktioner och jämförde dess prestanda med en ResNet50 tränad på bildpatchar:

Resultat för klassificeringsaccuransen av en random forest tränad på bitrats-distorsionsfunktioner för att upptäcka om en JPEG AI-bild har rekompilerats. Metoden presterar bäst när den första komprimeringen är stark (d.v.s. vid lägre bitrater), och då konsekvent överträffar en pixelbaserad ResNet50 – särskilt i fall där den andra komprimeringen är mildare än den första.

Resultat för klassificeringsaccuransen av en random forest tränad på bitrats-distorsionsfunktioner för att upptäcka om en JPEG AI-bild har rekompilerats. Metoden presterar bäst när den första komprimeringen är stark (d.v.s. vid lägre bitrater), och då konsekvent överträffar en pixelbaserad ResNet50 – särskilt i fall där den andra komprimeringen är mildare än den första.

Random forest visade sig vara betydligt effektiv när den första komprimeringen var stark (d.v.s. vid lägre bitrater), vilket avslöjade tydliga skillnader mellan enkel- och dubbelt komprimerade bilder. Liksom tidigare ledtråd hade ResNet50 svårt att generalisera, särskilt när den testades på komprimeringsnivåer den inte sett under träningsfasen.

Bitrats-distorsionsfunktionerna, å andra sidan, förblev stabila över ett brett spektrum av scenarier. Noterbart var att metoden fungerade även när den tillämpades på en annan AI-baserad codec, vilket tyder på att tillvägagångssättet generaliserar bortom JPEG AI.

JPEG AI och syntetiska bilder

För den sista testomgången testade författarna om deras kvantiseringbaserade funktioner kan skilja på JPEG AI-komprimerade bilder och fullständigt syntetiska bilder genererade av modeller som Midjourney, Stable Diffusion, DALL-E 2, Glide, och Adobe Firefly.

För detta använde forskarna en undermängd av Synthbuster-databasen, som kombinerade riktiga foton från RAISE-databasen med genererade bilder från en mängd diffusions- och GAN-baserade modeller.

Exempel på syntetiska bilder i Synthbuster, genererade med textprompt inspirerade av naturliga fotografier från RAISE-1k-databasen. Bilderna skapades med olika diffusionsmodeller, med prompt som designats för att producera fotorealistiska innehåll och texturer snarare än stiliserade eller konstnärliga representationer, vilket speglar databasens fokus på att testa metoder för att skilja på riktiga och genererade bilder.

Exempel på syntetiska bilder i Synthbuster, genererade med textprompt inspirerade av naturliga fotografier från RAISE-1k-databasen. Bilderna skapades med olika diffusionsmodeller, med prompt som designats för att producera fotorealistiska innehåll och texturer snarare än stiliserade eller konstnärliga representationer. Källa: https://ieeexplore.ieee.org/document/10334046

De riktiga bilderna komprimerades med JPEG AI vid flera bitratenivåer, och klassificeringen formulerades som en tvåvägsuppgift: antingen JPEG AI kontra en specifik generator, eller en specifik bitrate kontra Stable Diffusion XL.

Kvantiseringsfunktionerna (korrelationer extraherade från latent representation) beräknades från en fast 256×256-region och matades in i en random forest-klassificerare. Som baseline tränades en ResNet50 på pixelpatchar från samma data.

Klassificeringsaccurans av en random forest som använder kvantiseringfunktioner för att skilja på JPEG AI-komprimerade bilder och syntetiska bilder.

Klassificeringsaccurans av en random forest som använder kvantiseringfunktioner för att skilja på JPEG AI-komprimerade bilder och syntetiska bilder.

Över de flesta förhållanden överträffade den kvantiseringbaserade metoden ResNet50-baslinjen, särskilt vid låga bitrater där komprimeringsartefakter var starkare.

Författarna påstår:

‘Baslinjen ResNet50 presterar bäst för Glide-bilder med en accurans på 66,1%, men i övrigt generaliserar den sämre än kvantiseringfunktionerna. Kvantiseringsfunktionerna visar en god generalisering över komprimeringsstyrkor och generatortyper.

‘Vikten av koefficienterna som kvantiseras till noll visas i den respektabla prestationen av de avklippta [funktionerna], som i många fall presterar lika bra som ResNet50-klassificeren.

‘Men kvantiseringfunktioner som använder den ofullständiga, fulla heltalsvektorn presterar fortfarande betydligt bättre. Dessa resultat bekräftar att mängden nollor efter kvantisering är en viktig ledtråd för att skilja på AI-komprimerade och AI-genererade bilder.

‘Likväl visar det också att andra faktorer bidrar. Accuransen för den fulla vektorn för att upptäcka JPEG AI är för alla bitrater över 91,0%, och starkare komprimering leder till högre accuranser.’

En projicering av funktionrummet med UMAP visade en tydlig separation mellan JPEG AI och syntetiska bilder, med lägre bitrater som ökade avståndet mellan klasserna. En konsekvent utbrytare var Glide, vars bilder klustrade annorlunda och hade den lägsta upptäcktsaccuransen av alla generatorer som testades.

Tvärdimensionell UMAP-visualisering av JPEG AI-komprimerade och syntetiska bilder baserade på kvantiseringfunktioner. Den vänstra plotten visar att lägre JPEG AI-bitrater skapar större separation från syntetiska bilder; den högra plotten visar hur bilder från olika generatorer klustrar distinkt inom funktionrummet.

Tvärdimensionell UMAP-visualisering av JPEG AI-komprimerade och syntetiska bilder, baserade på kvantiseringfunktioner. Den vänstra plotten visar att lägre JPEG AI-bitrater skapar större separation från syntetiska bilder; den högra plotten visar hur bilder från olika generatorer klustrar distinkt inom funktionrummet.

Slutligen utvärderade författarna hur väl funktionerna höll i sig under typisk postprocessing, som JPEG-rekompimering eller nedskalning. Medan prestandan försämrades med kraftigare bearbetning, var minskningen gradvis, vilket tyder på att metoden behåller en viss robusthet även under degraderade förhållanden.

Utvärdering av kvantiseringfunktionens robusthet under postbearbetning, inklusive JPEG-rekompimering (JPG) och bildåterstorlek (RS).

Utvärdering av kvantiseringfunktionens robusthet under postbearbetning, inklusive JPEG-rekompimering (JPG) och bildåterstorlek (RS).

Slutsats

Det är inte garanterat att JPEG AI kommer att få en bred tillämpning. En av anledningarna är att det redan finns en infrastrukturell skuld som kan försvåra införandet av vilken ny codec som helst; och även en ‘konventionell’ codec med en fin pedigree och bred konsensus om dess värde, som AV1, har svårt att fördriva etablerade metoder.

När det gäller systemets potentiella konflikt med AI-genererare kan de karakteristiska kvantiseringsartefakter som hjälper den nuvarande generationen av AI-bild-detektorer eventuellt minskas eller ersättas av spår av en annan typ, i senare system (med antagandet att AI-genererare alltid kommer att lämna forensiska spår, vilket inte är säkert).

Detta skulle innebära att JPEG AI:s egna kvantiseringsegenskaper, tillsammans med andra ledtrådar identifierade av den nya artikeln, kanske inte kommer att kollidera med den forensiska spåren av de mest effektiva nya generativa AI-systemen.

Om JPEG AI emellertid fortsätter att fungera som en de facto ‘AI-tvätt’, som betydligt suddar ut gränsen mellan riktiga och genererade bilder, skulle det vara svårt att göra ett övertygande fall för dess antagande.

 

Publicerad första gången tisdagen den 8 april 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai