Andersons vinkel

Den svårfångade definitionen av “Deepfake”

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Based on: https://unsplash.com/photos/man-sitting-on-chair-E9PFbdhZmus

En övertygande ny studie från Tyskland kritiserar EU:s AI-lagstiftnings definition av termen “deepfake” som alltför vag, särskilt i sammanhanget med digital bildmanipulation. Författarna hävdar att lagstiftningens betoning på innehåll som liknar verkliga människor eller händelser – men som potentiellt kan verka falskt – saknar tydlighet.

De lyfter också fram att lagstiftningens undantag för “standardredigering” (dvs. förmodligen mindre AI-stödd modifiering av bilder) inte tar hänsyn till både den omfattande påverkan av AI i konsumenttillämpningar och den subjektiva naturen av konstnärliga konventioner som föregår AI:s uppkomst.

Oexakta lagstiftning på dessa områden ger upphov till två viktiga risker: en “kylnings-effekt”, där lagens breda tolkningsområde hämmar innovation och antagande av nya system; och en “lagbrytareffekt”, där lagen försummas som övergripande eller irrelevant.

I båda fallen överför vag lagstiftning effektivt ansvaret för att etablera praktiska rättsliga definitioner till framtida domstolsavgöranden – en försiktig och riskfyllig tillvägagångssätt för lagstiftning.

AI-baserad bildmanipulationsteknik ligger fortfarande betydligt före lagstiftningens förmåga att hantera dem, verkar det. Till exempel är en av de mest anmärkningsvärda exemplen på den växande elasticiteten i begreppet AI-driven “automatisk” efterbearbetning, enligt artikeln, “Scene Optimizer”-funktionen i senaste Samsung-kameror, som kan ersätta användartagna bilder av månen (ett utmanande ämne) med en AI-driven, “förfinad” bild:

Övre vänster, ett exempel från den nya artikeln på en riktig användartagen bild av månen, till vänster om en Samsung-förbättrad version som skapats automatiskt med Scene Optimizer; Höger, Samsungs officiella illustration av processen bakom detta; nedre vänster, exempel från Reddit-användaren u/ibreakphotos, som visar (vänster) en medvetet suddig bild av månen och (höger), Samsungs omgestaltning av denna bild - även om källbilden var en bild av en skärm, och inte den riktiga månen. Källor (medurs från topp-vänster): https://arxiv.org/pdf/2412.09961; https://www.samsung.com/uk/support/mobile-devices/how-galaxy-cameras-combine-super-resolution-technologies-with-ai-to-produce-high-quality-images-of-the-moon/; https://reddit.com/r/Android/comments/11nzrb0/samsung_space_zoom_moon_shots_are_fake_and_here/

Övre vänster, ett exempel från den nya artikeln på en riktig användartagen bild av månen, till vänster om en Samsung-förbättrad version som skapats automatiskt med Scene Optimizer; Höger, Samsungs officiella illustration av processen bakom detta; nedre vänster, exempel från Reddit-användaren u/ibreakphotos, som visar (vänster) en medvetet suddig bild av månen och (höger), Samsungs omgestaltning av denna bild – även om källbilden var en bild av en skärm, och inte den riktiga månen. Källor (medurs från topp-vänster): https://arxiv.org/pdf/2412.09961; https://www.samsung.com/uk/support/mobile-devices/how-galaxy-cameras-combine-super-resolution-technologies-with-ai-to-produce-high-quality-images-of-the-moon/; https://reddit.com/r/Android/comments/11nzrb0/samsung_space_zoom_moon_shots_are_fake_and_here/

I den nedre vänstra delen av bilden ovan ser vi två bilder av månen. Den till vänster är en bild tagen av en Reddit-användare. Här har bilden medvetet suddats ut och skalats ner av användaren.

Till höger ser vi en bild av samma försämrade bild tagen med en Samsung-kamera med AI-driven efterbearbetning aktiverad. Kameran har automatiskt “förbättrat” den igenkända “månen”-objektet, även om det inte var den riktiga månen.

Artikeln riktar djupare kritik mot Best Take-funktionen i Googles senaste smartphones – en omstridd AI-funktion som redigerar samman de “bästa” delarna av en gruppfoto, scannar flera sekunder av en fotosekvens så att leenden flyttas framåt eller bakåt i tiden som nödvändigt – och ingen visas i mitten av att blinka.

Artikeln hävdar att denna typ av kompositprocess har potentialen att missrepresentera händelser:

‘[I] en typisk gruppfoto-situation skulle en genomsnittlig tittare förmodligen fortfarande anse att den resulterande bilden är äkta. Leendet som infogas existerade inom några sekunder från den återstående bilden som togs.

‘Å andra sidan är den tio sekunders tidsramen för Best Take-funktionen tillräcklig för en humörändring. En person kan ha slutat le som resten av gruppen skrattar om ett skämt på deras bekostnad.

‘Som en följd antar vi att en sådan gruppfoto mycket väl kan utgöra en deep fake.’

Den nya artikeln har titeln Vad utgör en Deep Fake? Den suddiga gränsen mellan legitim bearbetning och manipulation under EU:s AI-lagstiftning, och kommer från två forskare vid Computational Law Lab vid universitetet i Tübingen och Saarland universitet.

Gamla knep

Att manipulera tid i fotografering är långt äldre än konsumentnivå-AI. Artikelförfattarna noterar existensen av mycket äldre tekniker som kan betraktas som “oäkta”, såsom sammanfogandet av flera sekventiella bilder till en High Dynamic Range (HDR)-bild eller en ‘sammanfogad’ panoramabild.

Verkligen, några av de äldsta och mest underhållande fotografiska förfalskningarna skapades traditionellt av skolbarn som sprang från ena änden av en skolgrupp till den andra, före banan för de speciella panoramkameror som en gång användes för sport- och skolfotografering – vilket möjliggjorde för eleven att dyka upp två gånger i samma bild:

Frestelsen att lura panoramkameror under grupp-fotografering var för stor för många studenter, som var villiga att riskera en dålig session i rektorns kontor för att “klona” sig själva i skolfoton. Källa: https://petapixel.com/2012/12/13/double-exposure-a-clever-photo-prank-from-half-a-century-ago/

Om du inte tar en bild i RAW-läge, som i princip dumpar kamerans lins-sensor till en mycket stor fil utan någon form av tolkning, är det troligt att dina digitala foton inte är helt äkta. Kamera-system tillämpar rutinmässigt “förbättrings”-algoritmer som bildskärpa och vitbalans, som standard – och har gjort så sedan ursprunget till konsumentnivå-fotografering.

Artikelförfattarna hävdar att även dessa äldre typer av digital fotoförbättring inte representerar “verklighet”, eftersom sådana metoder är utformade för att göra bilder mer tilltalande, inte mer “äkta”.

Studien föreslår att EU:s AI-lagstiftning, även med senare ändringar som recitals 123–27, placerar all fotografisk utdata inom ett bevis-ramverk som inte är lämpligt för sammanhanget där foton produceras idag, till skillnad från den (nominellt objektiva) naturen av säkerhetskamerabilder eller rättsfotografering. De flesta bilder som omfattas av AI-lagstiftningen är mer benägna att härröra från sammanhang där tillverkare och online-plattformar aktivt främjar kreativ fototolkning, inklusive användning av AI.

Forskarna föreslår att foton “aldrig har varit en objektiv avbildning av verkligheten”. Överväganden som kamerans placering, val av djup och ljus, bidrar alla till att göra en fotografi djupt subjektiv.

Artikeln observerar att rutinmässiga “städning”-uppgifter – som att ta bort sensor-damm eller oönskade elledningar från en annars välkomponerad scen – bara var semiautomatiserade före AI:s uppkomst: användare var tvungna att manuellt välja en region eller initiera en process för att uppnå sitt önskade resultat.

Idag utlöses dessa operationer ofta av en användares textprompt, mest anmärkningsvärt i verktyg som Photoshop. På konsumentnivå är sådana funktioner alltmer automatiserade utan användarindata – ett resultat som uppenbarligen anses vara “uppenbart önskvärt” av tillverkare och plattformar.

Den utspädda betydelsen av “Deepfake”

En central utmaning för lagstiftning kring AI-förändrad och AI-genererad bild är den tvetydighet som termen “deepfake” har, som har haft sin betydelse märkbart utvidgad under de senaste två åren.

Ursprungligen tillämpades termerna endast på video-utdata från autoencoder-baserade system som DeepFaceLab och FaceSwap, båda härledda från anonym kod som publicerades på Reddit i slutet av 2017.

Från 2022, med ankomsten av Latent Diffusion Models (LDMs) som Stable Diffusion och Flux, samt text-till-video-system som Sora, kunde man också skapa identitetsbyten och anpassningar, med förbättrad upplösning, flexibilitet och trohet. Nu var det möjligt att skapa diffusionsbaserade modeller som kunde avbilda kändisar och politiker. Eftersom termen “deepfake” redan var en rubrik-genererande skatt för medieproducenter, utvidgades den till att omfatta dessa system.

Senare, i både media och forskningslitteratur, kom termen också att omfatta textbaserad imitation. Vid den här punkten var den ursprungliga betydelsen av “deepfake” nästan förlorad, medan dess utvidgade betydelse var ständigt utvecklande och alltmer utspädd.

Men eftersom ordet var så kontroversiellt och galvaniserande, och nu var en kraftfull politisk och medial referenspunkt, visade det sig omöjligt att ge upp. Det drog läsare till webbplatser, finansiering till forskare och uppmärksamhet till politiker. Denna lexikala tvetydighet är huvudfokus för den nya forskningen.

Som författarna observerar, artikel 3(60) i EU:s AI-lagstiftning anger fyra villkor som definierar en “deepfake”.

1: Sann Måne

Först måste innehållet skapas eller manipuleras, dvs. antingen skapas från scratch med AI (generering) eller ändras från befintliga data (manipulation). Artikeln betonar svårigheten att skilja mellan “acceptabla” bildredigeringsresultat och manipulativa deepfakes, med tanke på att digitala foton aldrig är sanna representationer av verkligheten.

Artikeln hävdar att en Samsung-genererad måne är förmodligen äkta, eftersom månen är osannolikt att förändras, och eftersom den AI-genererade innehållet, tränad på riktiga månbilder, sannolikt är korrekt.

Men författarna hävdar också att eftersom Samsung-systemet har visat sig generera en “förbättrad” bild av månen i ett fall där källbilden inte var månen själv, skulle detta betraktas som en “deepfake”.

Det skulle vara opraktiskt att ta fram en omfattande lista över skilda användningsfall kring denna typ av ad hoc-funktion. Därför verkar definitionens börda passera till domstolarna.

2: TextFakes

Sedan måste innehållet vara i form av bild, ljud eller video. Textinnehåll, medan det är föremål för andra transparenskrav, anses inte vara en deepfake enligt AI-lagstiftningen. Detta behandlas inte i detalj i den nya studien, men det kan ha en betydande inverkan på effektiviteten av visuella deepfakes (se nedan).

3: Verkliga Världsproblem

Tredje, innehållet måste likna existerande personer, föremål, platser, enheter eller händelser. Detta villkor etablerar en koppling till den verkliga världen, vilket innebär att renodlat fabricerad bild, även om den är fotorealistisk, inte kvalificerar sig som en deepfake. Recital 134 i EU:s AI-lagstiftning betonar “likhet”-aspekten genom att lägga till ordet “i betydande grad” (en uppenbar hänvisning till senare rättsliga avgöranden).

Författarna, som citerar tidigare arbete, överväger om en AI-genererad ansikte måste tillhöra en verklig person, eller om det bara måste vara tillräckligt liknande en verklig person, för att uppfylla denna definition.

Till exempel, hur kan man bestämma om en sekvens av fotorealistiska bilder som avbildar politikern Donald Trump har avsikt att imitera, om bilderna (eller bifogade texter) inte specifikt nämner honom? Ansiktsigenkänning? Användarundersökningar? En domares definition av “sunda förnuft”?

Återgående till “TextFakes”-frågan (se ovan), utgör ord ofta en betydande del av handlingen i en visuell deepfake. Till exempel kan man ta en (oförändrad) bild eller video av ‘person a’ och säga, i en bildtext eller ett socialt meddelande, att bilden är av ‘person b’ (antagande att de två personerna liknar varandra).

I ett sådant fall behövs ingen AI, och resultatet kan vara anmärkningsvärt effektivt – men utgör en sådan lågteknisk approach också en “deepfake”?

4: Retusch, Ombyggnad

Slutligen måste innehållet verka äkta eller sanningsenligt för en person. Detta villkor betonar uppfattningen hos mänskliga åskådare. Innehåll som bara erkänns som representerande en verklig person eller föremål av en algoritm skulle inte anses vara en deepfake.

Av alla villkor i 3(60) är detta det som mest uppenbart hänvisar till senare rättsliga avgöranden, eftersom det inte tillåter någon tolkning via tekniska eller mekaniserade medel.

Det finns tydliga svårigheter att nå enighet om en sådan subjektiv bestämmelse. Författarna observerar till exempel att olika människor, och olika typer av människor (såsom barn och vuxna), kan vara olika benägna att tro på en viss deepfake.

Författarna noterar vidare att de avancerade AI-funktionerna i verktyg som Photoshop utmanar traditionella definitioner av “deepfake”. Medan dessa system kan innehålla grundläggande skydd mot kontroversiellt eller förbjudet innehåll, expanderar de dramatiskt begreppet “retuschering”. Användare kan nu lägga till eller ta bort föremål på ett övertygande och fotorealistiskt sätt, uppnå en professionell nivå av autenticitet som omdefinierar gränserna för bildmanipulation.

Författarna hävdar:

‘Vi hävdar att den nuvarande definitionen av deepfakes i AI-lagstiftningen och de motsvarande skyldigheterna är inte tillräckligt specificerade för att hantera utmaningarna som deepfakes utgör. Genom att analysera livscykeln för en digital bild från kamerans sensor till digitala redigeringsfunktioner, finner vi att:’

‘(1.) Deepfakes är illdefinierade i EU:s AI-lagstiftning. Definitionen lämnar för mycket utrymme för vad en deepfake är.’

‘(2.) Det är oklart hur redigeringsfunktioner som Googles “Best Take”-funktion kan betraktas som undantag från transparenskrav.’

‘(3.) Undantaget för väsentligt redigerat innehåll väcker frågor om vad som utgör väsentlig redigering av innehåll och om denna redigering måste vara uppfattbar för en mänsklig person.’

Undantag

EU:s AI-lagstiftning innehåller undantag som, enligt författarna, kan vara mycket tillåtande. Artikel 50(2), hävdar de, erbjuder ett undantag i fall där majoriteten av en ursprunglig källbild inte ändras. Författarna noterar:

‘Vad kan betraktas som innehåll i meningen med artikel 50(2) i fall av digitalt ljud, bilder och videor? Till exempel, i fallet med bilder, måste vi överväga pixlarnas utrymme eller det synliga utrymmet som uppfattas av människor? Väsentliga manipulationer i pixl-utrymmet kan inte förändra mänsklig uppfattning, och å andra sidan kan små störningar i pixl-utrymmet förändra uppfattningen dramatiskt.’

Forskarna ger exemplet med att lägga till en hand-pistol till en bild av en person som pekar på någon. Genom att lägga till pistolen ändrar man så lite som 5% av bilden; men den semantiska betydelsen av den ändrade delen är betydande. Därför verkar detta undantag inte ta hänsyn till någon “sunda förnuft”-förståelse av den effekt en liten detalj kan ha på en bilds övergripande betydelse.

Avdelning 50(2) tillåter också undantag för en “assistansfunktion för standardredigering”. Eftersom lagstiftningen inte definierar vad “standardredigering” innebär, verkar till och med postbearbetningsfunktioner som Googles Best Take vara skyddade av detta undantag, enligt författarna.

Slutsats

Den uttalade avsikten med det nya arbetet är att uppmuntra tvärvetenskaplig forskning kring regleringen av deepfakes, och att fungera som en utgångspunkt för nya samtal mellan datavetare och jurister.

Men artikeln själv faller offer för tautologi på flera punkter: den använder ofta termen “deepfake” som om dess betydelse vore självklar, samtidigt som den kritiserar EU:s AI-lagstiftning för att inte definiera vad som utgör en deepfake.

 

Publicerad första gången måndagen den 16 december 2024

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai