Andersons vinkel
Deepfalska detektorer följer ny mark: Latent diffusionsmodeller och GANs

Åsikt
För några månader sedan, har den djupfalska detektionsforskningsgemenskapen, som sedan slutet av 2017 har varit upptagen nästan uteslutande med autoencoder-baserad ram som debuterade vid den tiden till så stor allmän förvåning (och besvikelse), börjat ta en forensisk interesse i mindre stagnerande arkitekturer, inklusive latent diffusionsmodeller som DALL-E 2 och Stable Diffusion, samt utdata från Generativa Adversarial Networks (GANs). Till exempel, i juni, publicerade UC Berkeley resultat av sin forskning om utvecklingen av en detektor för utdata från den då dominerande DALL-E 2.
Vad som verkar driva denna växande intresse är den plötsliga evolutionära språng i kapacitet och tillgänglighet av latent diffusionsmodeller 2022, med den slutna källkoden och begränsade tillgången utgåvan av DALL-E 2 på våren, följt av den sensasjonella öppen källkodsutgåvan av Stable Diffusion av stability.ai.
GANs har också länge studerats i detta sammanhang, om än mindre intensivt, eftersom det är mycket svårt att använda dem för övertygande och elaborerade video-baserade rekreations av människor; åtminstone, jämfört med de nu vedertagna autoencoder-paketen som FaceSwap och DeepFaceLab – och den sistnämndas live-streaming kusin, DeepFaceLive.
Rörliga Bilder
I båda fallen verkar den galvaniserande faktorn vara utsikten till en efterföljande utvecklingssprint för video-syntes. Början av oktober – och 2022 års stora konferenssäsong – kännetecknades av en lavin av plötsliga och oväntade lösningar på olika långvariga video-syntesproblem: knappt hade Facebook släppt exempel på sin egen text-till-video-plattform, än Google Research snabbt dränkte ut den initiala berömmelsen genom att tillkännage sin nya Imagen-to-Video T2V-arkitektur, kapabel att producera högupplöst film (om än endast via en 7-lagers nätverk av uppskalare).
Om du tror att den här sortens sak kommer i tre, överväg också stability.ai:s gåtfulla löfte att ‘video är på väg’ till Stable Diffusion, tydligen senare i år, medan Stable Diffusion-samutvecklare Runway har gjort ett liknande löfte, även om det är oklart om de hänvisar till samma system. Det Discord-meddelandet från Stabilitys VD Emad Mostaque lovade också ‘ljud, video [och] 3D’.
Vad med en oväntad erbjudande av flera nya ljudgenereringsramverk (några baserade på latent diffusionsmodell), och en ny diffusionsmodell som kan generera autentisk karaktärsmotion, börjar idén att ‘statiska’ ramverk som GANs och diffusorer slutligen kommer att ta sin plats som stödjande adjunkter till externa animationsramverk få verklig fart.
I korthet verkar det troligt att den hämmade världen av autoencoder-baserade video-djupfalsk, som endast kan effektivt ersätta den centrala delen av ett ansikte, kan vara överskuggad av en ny generation av diffusionsbaserade djupfalsk-kapabla teknologier – populära, öppen källkodsapproach med potentialen att fotorealistiskt förfalska inte bara hela kroppar, utan hela scener.
Blade Runner
De senaste två artiklarna som behandlar, respektive, latent diffusionsmodell och GAN-baserad djupfalsk-detection, är, respektive, DE-FAKE: Detection och attributering av falska bilder genererade av text-till-bild-diffusionsmodeller, ett samarbete mellan CISPA Helmholtz Center for Information Security och Salesforce; och BLADERUNNER: Snabb motåtgärd för syntetisk (AI-genererad) StyleGAN-ansikte, från Adam Dorian Wong vid MIT:s Lincoln Laboratory.
Innan han förklarar den nya metoden, tar den senare artikeln lite tid att undersöka tidigare tillvägagångssätt för att bestämma om en bild genererades av en GAN (artikeln behandlar specifikt NVIDIA:s StyleGAN-familj).
‘Brady Bunch’-metoden – kanske en meningslös referens för någon som inte såg på TV på 1970-talet, eller som missade 1990-talets filmatiseringar – identifierar GAN-förfalskad innehåll baserat på de fasta positioner som vissa delar av en GAN-ansikte är säkra på att ockupera, på grund av den tråkiga och mall-baserade ‘produktionsprocessen’.

The ‘Brady Bunch’ method propounded by a webcast from the SANS institute in 2022: a GAN-based face generator will perform improbably uniform placement of certain facial features, belying the origin of the photo, in certain cases. Source: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf
En annan användbar känd indikation är StyleGAN:s frekventa oförmåga att rendera flera ansikten (första bilden nedan), om nödvändigt, samt dess brist på talang i tillbehörs samordning (mitten bilden nedan), och en tendens att använda en hårlinje som starten på en impromptu hatt (tredje bilden nedan).

Den tredje metoden som forskaren drar uppmärksamhet till är fotoöverlägg (ett exempel på vilket kan ses i vår artikel om AI-aided diagnos av mental hälsa), som använder kompositionella ‘bildblandnings’-programvara som CombineZ-serien för att sammanfoga flera bilder till en enda bild, ofta avslöjar underliggande gemensamheter i struktur – en potentiell indikation på syntes.

Den föreslagna arkitekturen i den nya artikeln är titeln (möjligen mot alla SEO-råd) Blade Runner, som hänvisar till Voight-Kampff-testet som bestämmer om antagonister i sci-fi-franchisen är ‘falska’ eller inte.
Pipelinen består av två faser, den första av vilken är PapersPlease-analytiker, som kan utvärdera data skrapade från kända GAN-ansiktswebbplatser som thispersondoesnotexist.com, eller genererade.foton.

Även om en nedskalad version av koden kan inspekteras på GitHub (se nedan) ges få detaljer om den här modulen, förutom att OpenCV och DLIB används för att omringa och upptäcka ansikten i det insamlade materialet.
Den andra modulen är AmongUs-detektorn. Systemet är utformat för att söka efter samordnad ögonplacering i foton, en bestående funktion av StyleGAN:s ansiktsutdata, typifierad i ‘Brady Bunch’-scenariot som beskrivs ovan. AmongUs drivs av en standard 68-landmärkesdetektor.

Facial point annotations via the Intelligent Behaviour Understanding Group (IBUG), whose facial landmark plotting code is used in the Blade Runner package.
AmongUs beror på förtränade landmärken baserade på de kända ‘Brady-bunch’-koordinaterna från PapersPlease, och är avsett för användning mot live, webbaserade prover av StyleGAN-baserade ansiktsbilder.
Blade Runner, föreslår författaren, är en plug-and-play-lösning avsedd för företag eller organisationer som saknar resurser för att utveckla egna lösningar för den typ av djupfalsk-detection som behandlas här, och en ’tillfällig åtgärd för att köpa tid för mer permanenta motåtgärder’.
I själva verket, i en säkerhetssektor som denna, som är så volatil och snabbt växande, finns det inte många anpassade eller avklädda molntjänstlösningar som ett underresurcerat företag kan vända sig till med tillförsikt.
Även om Blade Runner presterar dåligt mot bespectacled StyleGAN-förfalskade människor, är detta ett relativt vanligt problem över liknande system, som förväntar sig att kunna utvärdera ögonavgränsningar som kärnpunkter, som är skymda i sådana fall.
En reducerad version av Blade Runner har släppts till öppen källkod på GitHub. En mer funktionrik proprietär version finns, som kan bearbeta flera foton, snarare än den enda bilden per operation av den öppna källkodsbutiken. Författaren avser, säger han, att uppgradera GitHub-versionen till samma standard så småningom, när tiden tillåter. Han medger också att StyleGAN sannolikt kommer att utvecklas bortom sina kända eller nuvarande svagheter, och programvaran kommer också att behöva utvecklas i takt.
DE-FAKE
DE-FAKE-arkitekturen syftar inte bara till att uppnå ‘universell detektion’ för bilder producerade av text-till-bild-diffusionsmodeller, utan också till att tillhandahålla en metod för att avgöra vilken latent diffusionsmodell (LD) som producerade bilden.

The universal detection framework in DE-FAKE addresses local images, a hybrid framework (green), and open world images (blue). Source: http://export.arxiv.org/pdf/2210.06998
För att vara ärlig, är detta för närvarande en ganska enkel uppgift, eftersom alla populära LD-modeller – slutna eller öppna källkodsmodeller – har påtagliga särdrag.
Utöver detta delar de flesta några gemensamma svagheter, såsom en benägenhet att skära av huvuden, på grund av den godtyckliga sätt som icke-kvadratiska webbskrapade bilder matas in i de massiva datamängder som driver system som DALL-E 2, Stable Diffusion och MidJourney:

Latent diffusionsmodeller, i likhet med alla datorseende-modeller, kräver kvadratiskt indataformat; men den sammanslagna webbskrapningen som bränslar LAION5B-datasetet erbjuder inga ‘lyxextras’ som att känna igen och fokusera på ansikten (eller något annat), och skär av bilder ganska brutalt i stället för att fylla ut dem (vilket skulle behålla den ursprungliga bilden, men i lägre upplösning). När de väl är tränade, blir dessa ‘skärningar’ normala, och förekommer mycket ofta i utdata från latent diffusionsmodeller som Stable Diffusion.
DE-FAKE är avsett att vara algoritmanpassad, ett länge eftersträvat mål för autoencoder-anti-djupfalsk-forskare, och, just nu, ganska uppnåeligt i förhållande till LD-system.
Arkitekturen använder OpenAI:s Contrastive Language-Image Pretraining (CLIP) multimodala bibliotek – ett väsentligt element i Stable Diffusion, och som snabbt blir hjärtat i den nya vågen av bild/video-syntes-system – som ett sätt att extrahera inbäddningar från ‘förfalskade’ LD-bilder och träna en klassificerare på de observerade mönster och klasser.
I en mer ‘svart låda’-scenario, där PNG-fragment som innehåller information om genereringsprocessen har länge tagits bort av uppladdningsprocesser och av andra skäl, använder forskarna Salesforce BLIP-ramverk (även en komponent i minst en distribution av Stable Diffusion) för att ‘blindt’ fråga bilderna för den troliga semantiska strukturen hos de kommandon som skapade dem.

Forskarna använde Stable Diffusion, Latent Diffusion (själv en diskret produkt), GLIDE och DALL-E 2 för att popula ett tränings- och testdatamängd med hjälp av MSCOCO och Flickr30k.
Vanligtvis skulle vi ta en ganska omfattande titt på resultaten av forskarnas experiment för ett nytt ramverk; men i själva verket verkar DE-FAKE:s resultat troliga att vara mer användbara som en framtida benchmark för senare iterationer och liknande projekt, snarare än som en meningsfull mått på projektets framgång, med tanke på den volatila miljön som det opererar i, och att systemet som det tävlar mot i artikeln är nästan tre år gammalt – från den tid då bildsyntes-scenen verkligen var i sin linda.
Laget bakom DE-FAKE presenterar sina resultat som överväldigande positiva av två skäl: det finns knappast någon tidigare forskning att jämföra med (och ingen alls som erbjuder en rättvis jämförelse, d.v.s. som täcker de senaste tolv veckorna sedan Stable Diffusion släpptes som öppen källkod).
Det andra skälet är att, som nämnts ovan, även om den latent diffusionsbaserade bildsyntesfältet utvecklas i en exponentiell takt, så watermärker utdata från nuvarande erbjudanden i sig själva genom sina egna strukturella (och mycket förutsägbara) brister och egenheter – många av vilka sannolikt kommer att åtgärdas, i fallet med Stable Diffusion, av utgåvan av den bättre presterande 1.5-checkpointen (d.v.s. den 4GB-tränade modellen som driver systemet).
Samtidigt har Stability redan indikerat att de har en tydlig roadmap för V2 och V3 av systemet. Med tanke på de rubrikskapande händelserna under de senaste tre månaderna, är det troligt att eventuell företagslättja från OpenAI och andra konkurrenter i bildsyntesutrymmet har försvunnit, vilket innebär att vi kan förvänta oss en lika snabb takt av framsteg även i det slutna källkods-bildsyntesutrymmet.
Publicerad första gången 14:e oktober 2022.












