Andersons hoek

Diepere Leermodellen Kunnen Moeite Hebben Om AI- gegenereerde Afbeeldingen Te Erkennen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Resultaten uit een nieuw onderzoek laten zien dat state-of-the-art AI aanzienlijk minder in staat is om AI-gegenereerde afbeeldingen te herkennen en te interpreteren dan mensen, wat een zorg kan zijn in een komende klimaat waarin machine learning-modellen steeds vaker worden getraind op synthetische gegevens, en waarbij het niet noodzakelijkerwijs bekend is of de gegevens ‘echt’ zijn of niet.

Hier zien we de resnext101_32x8d_wsl-predictiemodel worstelen in de 'bagel'-categorie. In de tests werd een herkenningfout geacht te hebben plaatsgevonden als het core-doelwoord (in dit geval 'bagel') niet in de top vijf voorspelde resultaten werd genoemd. Bron: https://arxiv.org/pdf/2208.10760.pdf

Hier zien we de resnext101_32x8d_wsl-predictiemodel worstelen in de ‘bagel’-categorie. In de tests werd een herkenningfout geacht te hebben plaatsgevonden als het core-doelwoord (in dit geval ‘bagel’) niet in de top vijf voorspelde resultaten werd genoemd. Bron: https://arxiv.org/pdf/2208.10760.pdf

Het nieuwe onderzoek testte twee categorieën van computer visie-gebaseerde herkenningssystemen: objectherkenning en visuele vraagbeantwoording (VQA).

Links, inferentiesuccessen en -mislukkingen van een objectherkenningssysteem; rechts, VQA-taken ontworpen om AI-begrip van scènes en afbeeldingen op een meer exploratieve en significante manier te onderzoeken. Bronnen: https://arxiv.org/pdf/2105.05312.pdf en https://arxiv.org/pdf/1505.00468.pdf

Links, inferentiesuccessen en -mislukkingen van een objectherkenningssysteem; rechts, VQA-taken ontworpen om AI-begrip van scènes en afbeeldingen op een meer exploratieve en significante manier te onderzoeken. Bronnen: https://arxiv.org/pdf/2105.05312.pdf en https://arxiv.org/pdf/1505.00468.pdf

Van de tien state-of-the-art-modellen die werden getest op gecuratede datasets gegenereerd door beeldsynthese-frameworks DALL-E 2 en Midjourney, was het beste presterende model in staat om slechts 60% en 80% top-5-nauwkeurigheid te bereiken in de twee soorten tests, terwijl ImageNet, getraind op niet-synthetische, echte gegevens, respectievelijk 91% en 99% kan bereiken in dezelfde categorieën, terwijl de prestaties van mensen over het algemeen aanzienlijk hoger liggen.

Het aanpakken van problemen rond verdelingsverschuiving (ook bekend als ‘Model Drift’, waarbij predictiemodellen een vermindering van hun voorspellende capaciteit ervaren wanneer ze van trainingsgegevens naar ‘echte’ gegevens worden overgezet), stelt het artikel:

‘Mensen zijn in staat om de gegenereerde afbeeldingen te herkennen en vragen te beantwoorden, terwijl diepe modellen worstelen om de gegenereerde inhoud te begrijpen en mogelijk beter presteren na fine-tuning, en b) er is een grote verdelingsverschuiving tussen de gegenereerde afbeeldingen en de echte foto’s. De verdelingsverschuiving lijkt categorie-afhankelijk te zijn.’

Gezien het volume van synthetische afbeeldingen dat al op internet staat na de open-sourcing van de krachtige Stable Diffusion-latent diffusie-synthese-model, rijst de mogelijkheid dat als ‘nep’-afbeeldingen industrie-standaard datasets zoals Common Crawl overspoelen, variaties in nauwkeurigheid over de jaren aanzienlijk kunnen worden beïnvloed door ‘onwerkelijke’ afbeeldingen.

Hoewel synthetische gegevens zijn aangemerkt als de potentiële redder van de computer visie-onderzoekssector, die vaak te maken heeft met een gebrek aan middelen en budgetten voor hyperschaalcuratie, is de nieuwe stroom van Stable Diffusion-afbeeldingen (evenals de algemene toename van synthetische afbeeldingen sinds de ontwikkeling en commercialisering van DALL-E 2) onwaarschijnlijk om allemaal te worden geleverd met handige labels, annotaties en hashtags die ze als ‘nep’ markeren op het moment dat machine visie-systemen ze van internet scrapen.

De snelheid van ontwikkeling in open source-beeldsynthese-frameworks heeft de mogelijkheid om afbeeldingen van deze systemen te categoriseren, aanzienlijk overtroffen, waardoor er een groeiende interesse is in ‘nep-afbeelding’-detectiesystemen, vergelijkbaar met deepfake-detectiesystemen, maar die zijn ontworpen om hele afbeeldingen te evalueren in plaats van delen van gezichten.

Het nieuwe artikel heeft als titel Hoe goed zijn diepe modellen in het begrijpen van gegenereerde afbeeldingen?, en komt van Ali Borji van San Francisco machine learning-startup Quintic AI.

Gegevens

De studie voorafgaat aan de release van Stable Diffusion, en de experimenten gebruiken gegevens gegenereerd door DALL-E 2 en Midjourney over 17 categorieën, waaronder olifant, paddestoel, pizza, pretzel, tractor en konijn.

Voorbeelden van de afbeeldingen waaruit de geteste herkenningssystemen en VQA-systemen de meest belangrijke sleutelconcepten moesten identificeren.

Voorbeelden van de afbeeldingen waaruit de geteste herkenningssystemen en VQA-systemen de meest belangrijke sleutelconcepten moesten identificeren.

Afbeeldingen werden verkregen via webzoekopdrachten en via Twitter, en, in overeenstemming met het beleid van DALL-E 2 (tenminste, op dat moment), bevatten ze geen afbeeldingen met menselijke gezichten. Alleen afbeeldingen van goede kwaliteit, herkenbaar voor mensen, werden geselecteerd.

Twee sets afbeeldingen werden gecureerd, een voor de objectherkenning en een voor de VQA-taken.

Het aantal afbeeldingen per geteste categorie voor objectherkenning.

Het aantal afbeeldingen per geteste categorie voor objectherkenning.

Testen van Objectherkenning

Voor de objectherkenningstests werden tien modellen getest, allemaal getraind op ImageNet: AlexNet, ResNet152, MobileNetV2, DenseNet, ResNext, GoogleNet, ResNet101, Inception_V3, Deit, en ResNext_WSL.

Sommige klassen in de geteste systemen waren fijner dan andere, waardoor het noodzakelijk was om gemiddelde benaderingen toe te passen. Bijvoorbeeld, ImageNet bevat drie klassen die betrekking hebben op ‘klokken’, en het was noodzakelijk om een soort arbitrere metric te definiëren, waarbij de opname van een ‘klok’ van een bepaald type in de top vijf verkregen labels voor een afbeelding werd beschouwd als een succes in dat geval.

Per-model-prestaties over 17 categorieën.

Per-model-prestaties over 17 categorieën.

Het beste presterende model in deze ronde was resnext101_32x8d_ws, dat bijna 60% bereikte voor top-1 (d.w.z. de keren waarin de voorkeursvoorspelling van de model uit vijf gokken de correcte concept was die in de afbeelding werd belichaamd), en 80% voor top-vijf (d.w.z. het gewenste concept werd ten minste ergens in de vijf gokken van de model over de afbeelding genoemd).

De auteur suggereert dat de goede prestaties van dit model te wijten zijn aan het feit dat het was getraind voor de zwak-gesuperviseerde voorspelling van hashtags in sociale media-platforms. Echter, deze leidende resultaten, merkt de auteur op, liggen aanzienlijk onder wat ImageNet kan bereiken op echte gegevens, d.w.z. 91% en 99%. Hij suggereert dat dit te wijten is aan een grote dispariteit tussen de verdeling van ImageNet-afbeeldingen (die ook van het web worden gescraped) en gegenereerde afbeeldingen.

De vijf moeilijkste categorieën voor het systeem, in volgorde van moeilijkheid, waren vlieger, schildpad, eekhoorn, zonnebril en helm. Het artikel merkt op dat de vlieger-klasse vaak wordt verward met ballon, parachute en paraplu, hoewel deze onderscheidingen triviaal eenvoudig zijn voor menselijke waarnemers om te onderscheiden.

Bepaalde categorieën, waaronder vlieger en schildpad, veroorzaakten universele mislukking over alle modellen, terwijl anderen (met name pretzel en tractor) resulteerden in bijna universele succes over de geteste modellen.

Polariserende categorieën: sommige van de doelcategorieën die werden gekozen, hebben ofwel alle modellen voor de gek gehouden, ofwel waren ze redelijk eenvoudig voor alle modellen om te identificeren.

Polariserende categorieën: sommige van de doelcategorieën die werden gekozen, hebben ofwel alle modellen voor de gek gehouden, ofwel waren ze redelijk eenvoudig voor alle modellen om te identificeren.

De auteurs postuleren dat deze bevindingen aangeven dat alle objectherkenningmodellen mogelijk vergelijkbare sterke en zwakke punten delen.

Testen van Visuele Vraagbeantwoording

Vervolgens testte de auteur VQA-modellen op open-ended en free-form VQA, met binaire vragen (d.w.z. vragen waarop het antwoord alleen ‘ja’ of ‘nee’ kan zijn). Het artikel merkt op dat recente state-of-the-art VQA-modellen in staat zijn om 95% nauwkeurigheid te bereiken op de VQA-v2-dataset.

Voor deze testronde werden 50 afbeeldingen gecureerd en 241 vragen geformuleerd rondom hen, 132 met positieve antwoorden en 109 met negatieve antwoorden. De gemiddelde vraaglengte was 5,12 woorden.

Deze ronde gebruikte het OFA-model, een taak-agnostisch en modality-agnostisch framework om taakvolledigheid te testen, en was onlangs de leidende scorer in de VQA-v2-test-std-set.  OFA scoorde 77,27% nauwkeurigheid op de gegenereerde afbeeldingen, vergeleken met zijn eigen 94,7% score in de VQA-v2-test-std-set.

Voorbeeldvragen en resultaten van de VQA-sectie van de tests. 'GT' is 'Ground Truth', d.w.z. het correcte antwoord.

Voorbeeldvragen en resultaten van de VQA-sectie van de tests. ‘GT” is ‘Ground Truth’, d.w.z. het correcte antwoord.

De auteur van het artikel suggereert dat een deel van de reden kan zijn dat de gegenereerde afbeeldingen semantische concepten bevatten die afwezig zijn in de VQA-v2-dataset, en dat de vragen die zijn geschreven voor de VQA-tests mogelijk moeilijker zijn dan de algemene standaard van VQA-v2-vragen, hoewel hij gelooft dat de eerste reden waarschijnlijker is.

LSD in de Gegevensstroom?

Opinie

De nieuwe proliferatie van AI-gegenereerde beelden, die onmiddellijke conjunctionen en abstracties van core-concepten kunnen presenteren die niet in de natuur voorkomen, en die prohibitief tijdrovend zouden zijn om via conventionele methoden te produceren, kan een speciaal probleem vormen voor zwak-gesuperviseerde dataverzamelingsystemen, die mogelijk niet in staat zijn om elegant te falen – voornamelijk omdat ze niet zijn ontworpen om grote hoeveelheden ongelabelde synthetische gegevens te verwerken.

In dergelijke gevallen kan er een risico zijn dat deze systemen een percentage ‘bizarre’ synthetische afbeeldingen in onjuiste categorieën zullen plaatsen, simpelweg omdat de afbeeldingen onderscheidenlijke objecten bevatten die niet echt bij elkaar horen.

'Astronaut die een paard berijdt' is misschien het meest emblematische visuele voor de nieuwe generatie van beeldsynthesemodels - maar deze 'onwerkelijke' relaties kunnen in echte detectiesystemen terechtkomen, tenzij er voorzorgsmaatregelen worden genomen. Bron: https://twitter.com/openai/status/1511714545529614338?lang=en

‘Astronaut die een paard berijdt’ is misschien het meest emblematische visuele voor de nieuwe generatie van beeldsynthesemodels – maar deze ‘onwerkelijke’ relaties kunnen in echte detectiesystemen terechtkomen, tenzij er voorzorgsmaatregelen worden genomen. Bron: https://twitter.com/openai/status/1511714545529614338?lang=en

Tenzij dit kan worden voorkomen in de voorverwerking voorafgaand aan de training, kunnen dergelijke geautomatiseerde pipelines leiden tot onwaarschijnlijke of zelfs groteske associaties die worden getraind in machine learning-systemen, waardoor hun effectiviteit wordt verlaagd en het risico bestaat dat hoge-niveau-associaties worden doorgegeven aan downstream-systemen en subklassen en categorieën.

Alternatief kunnen disjuncte synthetische afbeeldingen een ‘verkoelend effect’ hebben op de nauwkeurigheid van latere systemen, in het geval dat nieuwe of gewijzigde architectuur zou ontstaan die probeert rekening te houden met ad-hoc-synthetische beelden, en te veel een net werpt.

In beide gevallen kan synthetische beeldvorming in de post-Stable Diffusion-tijdperk een hoofdpijn vormen voor de computer visie-onderzoekssector, wiens inspanningen deze vreemde creaties en mogelijkheden hebben mogelijk gemaakt – niet in de laatste plaats omdat het de hoop van de sector in gevaar brengt dat de verzameling en curatie van gegevens uiteindelijk veel meer geautomatiseerd kan worden dan het nu is, en minder tijdrovend en duur.

 

Publicatie voor het eerst op 1 september 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai