Andersons vinkel

Dybdeinlæringsmodeller kan ha vanskeligheter med å gjenkjenne bilder generert av AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Funn fra en ny rapport indikerer at state-of-the-art AI er betydelig mindre i stand til å gjenkjenne og tolke AI-syntetiserte bilder enn mennesker, noe som kan være bekymringsfullt i en fremtid hvor maskinlæringsmodeller blir stadig mer trent på syntetisk data, og hvor det ikke alltid vil være kjent om dataene er “ekte” eller ikke.

Her ser vi resnext101_32x8d_wsl-prediksjonsmodellen som sliter i 'bagel'-kategorien. I testene ble en gjenkjenningsfeil betraktet som å ha skjedd hvis det sentrale målordet (i dette tilfelle 'bagel') ikke var med i de fem øverste prediksjonene. Kilde: https://arxiv.org/pdf/2208.10760.pdf

Her ser vi resnext101_32x8d_wsl-prediksjonsmodellen som sliter i ‘bagel’-kategorien. I testene ble en gjenkjenningsfeil betraktet som å ha skjedd hvis det sentrale målordet (i dette tilfelle ‘bagel’) ikke var med i de fem øverste prediksjonene. Kilde: https://arxiv.org/pdf/2208.10760.pdf

Den nye forskningen testet to kategorier av datamaskinbasert gjenkjenningsrammeverk: objektgjenkjenning og visuell spørsmålbesvaring (VQA).

Til venstre, suksesser og feil fra et objektgjenkjenningssystem; til høyre, VQA-oppdrag designet for å teste AI-forståelse av scener og bilder på en mer utforskende og betydningsfull måte. Kilder: https://arxiv.org/pdf/2105.05312.pdf og https://arxiv.org/pdf/1505.00468.pdf

Til venstre, suksesser og feil fra et objektgjenkjenningssystem; til høyre, VQA-oppdrag designet for å teste AI-forståelse av scener og bilder på en mer utforskende og betydningsfull måte. Kilder: https://arxiv.org/pdf/2105.05312.pdf og https://arxiv.org/pdf/1505.00468.pdf

Av ti state-of-the-art-modeller testet på kurerte datasett generert av bilde-synteserammeverk DALL-E 2 og Midjourney, var den beste modellen i stand til å oppnå bare 60% og 80% topp-5-nøyaktighet over de to testtypene, mens ImageNet, trent på ikke-syntetisk, virkelig data, kan henholdsvis oppnå 91% og 99% i samme kategorier, mens menneskelig ytelse vanligvis er betydelig høyere.

Ved å adresse problemer rundt fordelingsforandring (aka ‘Modell-drift’, hvor prediksjonsmodeller opplever redusert prediksjonskapasitet når de flyttes fra treningsdata til ‘ekte’ data), sier rapporten:

‘Mennesker er i stand til å gjenkjenne de genererte bildene og svare på spørsmål om dem lett. Vi konkluderer med at a) dybde-modeller sliter med å forstå det genererte innholdet, og kan gjøre bedre etter finjustering, og b) det er en stor fordelingsforandring mellom de genererte bildene og de virkelige fotografier. Fordelingsforandringen synes å være avhengig av kategori.’

Gitt volumet av syntetiske bilder som allerede flommer internettet i kjølvannet av forrige ukes sensasjonelle åpne kilde av den kraftfulle Stable Diffusion latent diffusjonssyntesemodell, oppstår muligheten naturlig at når ‘falske’ bilder flommer inn i industristandard datasett som Common Crawl, variasjoner i nøyaktighet over årene kan bli betydelig påvirket av ‘ureelle’ bilder.

Selv om syntetisk data har blitt hyllet som den potensielle redderen av datamaskinsektoren som ofte mangler ressurser og budsjett for hyperskala kurering, er den nye strømmen av Stable Diffusion-bilder (sammen med den generelle økningen i syntetiske bilder siden oppfinnelsen og kommercialiseringen av DALL-E 2) er det usannsynlig at alle kommer med håndykeikker, annotasjoner og hashtagger som skiller dem som ‘falske’ på tidspunktet når maskinvisjonssystemer scraper dem fra internettet.

Hastigheten på utviklingen i åpne kilde-bilde-synteserammeverk har merkbart overgått vår evne til å kategorisere bilder fra disse systemene, noe som har ført til økt interesse for ‘falske bilde’-deteksjonssystemer, lignende deepfake-deteksjonssystemer, men med oppgaven å evaluere hele bilder i stedet for deler av ansikter.

Den nye rapporten heter Hvor gode er dybde-modeller i å forstå de genererte bildene?, og kommer fra Ali Borji fra San Francisco-baserte maskinlæringsstartup Quintic AI.

Data

Studien forutgår Stable Diffusion-utgivelsen, og eksperimentene bruker data generert av DALL-E 2 og Midjourney over 17 kategorier, inkludert elefant, sopp, pizza, pretzel, traktor og kanin.

Eksempler på bildene som de testede gjenkjennings- og VQA-systemene ble utfordret til å identifisere den viktigste nøkkelkonseptet.

Eksempler på bildene som de testede gjenkjennings- og VQA-systemene ble utfordret til å identifisere den viktigste nøkkelkonseptet.

Bildene ble hentet via nett-søk og gjennom Twitter, og, i henhold til DALL-E 2’s politikker (i hvert fall på det tidspunktet), inneholdt ingen bilder med menneskeansikter. Bare bilder av god kvalitet, gjenkjennelige for mennesker, ble valgt.

To sett med bilder ble kurert, ett for hver av objektgjenkjenning og VQA-oppdragene.

Antall bilder i hver testet kategori for objektgjenkjenning.

Antall bilder i hver testet kategori for objektgjenkjenning.

Testing Object Recognition

For objektgjenkjenningstestene ble ti modeller, alle trent på ImageNet, testet: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit, og ResNext_WSL.

Noen av kategoriene i de testede systemene var mer detaljerte enn andre, noe som nødvendiggjorde bruk av gjennomsnittlige tilnærminger. For eksempel inneholder ImageNet tre klasser relatert til ‘klokker’, og det var nødvendig å definere en type arbitrær metode, hvor inklusjon av noen ‘klokke’ av noen type i de fem øverste labelene for noen bilder ble betraktet som en suksess i det tilfelle.

Per-modell-ytelse over 17 kategorier.

Per-modell-ytelse over 17 kategorier.

Den beste modellen i denne runden var resnext101_32x8d_ws, som oppnådde nær 60% for topp-1 (dvs. gangene hvor dens foretrukne prediksjon av fem gjetninger var det korrekte konseptet i bildet), og 80% for topp-5 (dvs. det ønskede konseptet var i alle fall nevnt et sted i modellens fem gjetninger om bildet).

Forfatteren antyder at denne modellens gode ytelse skyldes det faktum at den ble trent for svakt-overvåket prediksjon av hashtagger på sosiale medieplattformer. Imidlertid er disse ledende resultater, ifølge forfatteren, merkbart lavere enn hva ImageNet kan oppnå på virkelig data, dvs. 91% og 99%. Han antyder at dette skyldes en stor forskjell mellom fordelingen av ImageNet-bilder (som også er hentet fra nettet) og genererte bilder.

De fem mest vanskelige kategoriene for systemet, i rekkefølge av vanskelighet, var drage, skilpadde, ekorn, solbriller og hjelm. Rapporten påpeker at drage-klassen ofte blir forvekslet med ballong, fallskjerm og paraply, selv om disse forskjellene er trivielt enkle for menneskelige observatører å skille.

Visse kategorier, inkludert drage og skilpadde, forårsaket universell feil over alle modeller, mens andre (notabelt pretzel og traktor) resulterte i nesten universell suksess over de testede modellene.

Polariserende kategorier: noen av de valgte målkategoriene enten forvirret alle modellene eller var ganske enkle for alle modellene å identifisere.

Polariserende kategorier: noen av de valgte målkategoriene enten forvirret alle modellene eller var ganske enkle for alle modellene å identifisere.

Forfatterne antyder at disse funnene indikerer at alle objektgjenkjenningmodeller kan dele lignende styrker og svakheter.

Testing Visual Question Answering

Neste, testet forfatteren VQA-modeller på åpne og frie VQA, med binære spørsmål (dvs. spørsmål som bare kan ha svaret ‘ja’ eller ‘nei’). Rapporten påpeker at nyere state-of-the-art VQA-modeller kan oppnå 95% nøyaktighet på VQA-v2-datasettet.

For denne testrunden ble 50 bilder kurert og 241 spørsmål formulert rundt dem, 132 av disse hadde positive svar, og 109 negative. Gjennomsnittlig spørsmålslengde var 5,12 ord.

Denne runden brukte OFA-modellen, en oppgave-agnostisk og modalitets-agnostisk ramme for å teste oppgave-komprehensivitet, og var nylig den ledende scoreren i VQA-v2-test-std-settet. OFA oppnådde 77,27% nøyaktighet på de genererte bildene, sammenlignet med sin egen 94,7% score i VQA-v2-test-std-settet.

Eksempler på spørsmål og resultater fra VQA-delen av testene. 'GT' er 'Ground Truth', dvs. det korrekte svaret.

Eksempler på spørsmål og resultater fra VQA-delen av testene. ‘GT” er ‘Ground Truth’, dvs. det korrekte svaret.

Rapportens forfatter antyder at en del av årsaken kan være at de genererte bildene inneholder semantiske konsepter som ikke finnes i VQA-v2-datasettet, og at spørsmålene skrevet for VQA-testene kan være mer utfordrende enn standarden for VQA-v2-spørsmål, selv om han tror at den førstnevnte årsaken er mer sannsynlig.

LSD i Datastrømmen?

Mening

Den nye utbredelsen av AI-syntetiserte bilder, som kan presenterer øyeblikkelige konjunksjoner og abstraksjoner av grunnleggende konsepter som ikke eksisterer i naturen, og som ville være forbudt tidskrevende å produsere via konvensjonelle metoder, kan presenterer et spesielt problem for svakt-overvåket datainnsamlingssystemer, som kanskje ikke kan feile elegant – hovedsakelig fordi de ikke ble designet for å håndtere høyt volum, ulabelt syntetisk data.

I slike tilfeller kan det være en risiko for at disse systemene korraler en prosentdel ‘merkelige’ syntetiske bilder inn i feil kategorier bare fordi bildene viser distinkte objekter som ikke virkelig hører sammen.

'Astronaut riding a horse' har kanskje blitt det mest emblematiske visuelle for den nye generasjonen av bilde-synteseringsystemer – men disse 'ureelle' relasjonene kunne gå inn i virkelige detekteringssystemer hvis ikke forsiktighet tas. Kilde: https://twitter.com/openai/status/1511714545529614338?lang=en

‘Astronaut riding a horse’ har kanskje blitt det mest emblematiske visuelle for den nye generasjonen av bilde-synteseringsystemer – men disse ‘ureelle’ relasjonene kunne gå inn i virkelige detekteringssystemer hvis ikke forsiktighet tas. Kilde: https://twitter.com/openai/status/1511714545529614338?lang=en

Medmindre dette kan forhindres på forhånd, før trening, kan slike automatiserte rørledninger føre til usannsynlige eller endog groteske assosiasjoner som blir trent inn i maskinlæringsmodeller, noe som kan svekke deres effektivitet, og risikere å overføre høynivå-assosiasjoner til nedstrøms-systemer og underkategorier.

Alternativt kan syntetiske bilder ha en ‘kjølende effekt’ på nøyaktigheten av senere systemer, i tilfelle nye eller reviderte arkitekturer skulle oppstå som prøver å ta hensyn til ad hoc syntetisk bilde, og kaster for bredt et nett.

I begge tilfeller kan syntetiske bilder i den post-Stable Diffusion-æraen bli et problem for datamaskinsektoren hvis innsats gjorde disse merkelige skapelsene og mulighetene mulige – ikke minst fordi det truer sektorens håp om at innhenting og kurering av data kan bli mer automatisert enn det er i dag, og mindre kostbart og tidskrevende.

 

Først publisert 1. september 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai