Andersons hoek

Synthetische gegevens: het overdekkingsgat dichten met Grand Theft Auto

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers van de Universiteit van Illinois hebben een nieuwe computerzichtdataset gemaakt die synthetische beelden gegenereerd door een Grand Theft Auto-spelmotor gebruikt om een van de lastigste obstakels in semantische segmentatie op te lossen – het herkennen van objecten die slechts gedeeltelijk zichtbaar zijn in bronafbeeldingen en -video’s.

Daartoe hebben de onderzoekers, zoals beschreven in het artikel, de GTA-V-spelmotor gebruikt om een synthetische dataset te genereren die niet alleen een recordaantal occlusie-exemplaren bevat, maar die ook perfecte semantische segmentatie en labeling heeft, en rekening houdt met temporale informatie op een manier die niet wordt aangepakt door soortgelijke open-source-datasets.

Volledig scènebegrip

De onderstaande video, gepubliceerd als ondersteunend materiaal voor het onderzoek, illustreert de voordelen van een volledig 3D-begrip van een scène, waarbij verborgen objecten bekend zijn en in de scène worden blootgelegd in alle omstandigheden, waardoor het evaluatiesysteem kan leren om gedeeltelijk occlusie-weergaven te associëren met het volledige (gelabelde) object.

Bron: http://sailvos.web.illinois.edu/_site/index.html

De resulterende dataset, genaamd SAIL-VOS 3D, wordt door de auteurs beschreven als de eerste synthetische videomesh-dataset met frame-voor-frame-annotatie, instance-niveau-segmentatie, grondwaarheidsdiepte voor scène-weergaven en 2D-annotaties begrensd door begrenzingsvakken.

Bron (Klik om te vergroten)

De annotaties van SAIL-VOS 3D omvatten diepte, instance-niveau modaal en amodale segmentatie, semantische labels en 3D-meshes. De gegevens omvatten 484 video’s met in totaal 237.611 frames bij een resolutie van 1280×800, inclusief shot-overgangen.

Boven, de oorspronkelijke CGI-frames; tweede rij, instance-niveau-segmentatie; derde rij, amodale segmentatie, die de diepte van scène-begrip en transparantie aangeeft die beschikbaar is in de gegevens. Bron

Boven, de oorspronkelijke CGI-frames; tweede rij, instance-niveau-segmentatie; derde rij, amodale segmentatie, die de diepte van scène-begrip en transparantie aangeeft die beschikbaar is in de gegevens. Bron (Klik om te vergroten)

De set bestaat uit 6.807 clips met een gemiddelde van 34,6 frames per clip, en de gegevens zijn geannoteerd met 3.460.213 objectinstanties afkomstig van 3.576 mesh-modellen in de GTA-V-spelmotor. Deze worden toegewezen aan in totaal 178 semantische categorieën.

Mesh-reconstructie en geautomatiseerde labeling

Aangezien later onderzoek naar datasets waarschijnlijk zal plaatsvinden op echte wereldbeelden, worden de meshes in SAIL-VOS 3D gegenereerd door het machine learning-kader, in plaats van afgeleid van de GTA-V-motor.

Met een programmatische en in wezen 'holografische' begrip van de volledige scène-weergave, kan SAIL-VOS 3D-beelden synthetiseren van objecten die normaal gesproken verborgen zijn door occlusies, zoals de verre kant van de arm van het personage dat hier omkeert, op een manier die anders zou afhankelijk zijn van veel representatieve exemplaren in echte wereldbeelden. Bron: https://arxiv.org/pdf/2105.08612.pdf

Met een programmatische en in wezen ‘holografische’ begrip van de volledige scène-weergave, kan SAIL-VOS 3D-beelden synthetiseren van objecten die normaal gesproken verborgen zijn door occlusies, zoals de verre kant van de arm van het personage dat hier omkeert, op een manier die anders zou afhankelijk zijn van veel representatieve exemplaren in echte wereldbeelden. (Klik om te vergroten) Bron: https://arxiv.org/pdf/2105.08612.pdf

Aangezien elk object in de GTA-V-wereld een unieke ID bevat, haalt SAIL-VOS deze op uit de rendering-engine met behulp van de GTA-V-script-hook-bibliotheek. Dit lost het probleem op van het opnieuw verkrijgen van het onderwerp als het tijdelijk het zichtveld verlaat, aangezien de labeling persistent en betrouwbaar is. Er zijn 162 objecten beschikbaar in de omgeving, die de onderzoekers hebben toegewezen aan een overeenkomstig aantal klassen.

Een verscheidenheid aan scènes en objecten

Veel van de objecten in de GTA-V-motor zijn van nature gemeenschappelijk, en daarom bevat de SAIL-VOS-inventaris een gelukkige 60% van de klassen die aanwezig zijn in de door Microsoft vaak gebruikte 2014 MS-COCO-dataset.

De SAIL-VOS-dataset bevat een grote verscheidenheid aan interne en externe scènes onder verschillende weersomstandigheden, met personages die verschillende kleding dragen.

De SAIL-VOS-dataset bevat een grote verscheidenheid aan interne en externe scènes onder verschillende weersomstandigheden, met personages die verschillende kleding dragen. (Klik om te vergroten)

Toepasbaarheid

Om compatibiliteit te garanderen met het algemene onderzoek in dit gebied en om te bevestigen dat deze synthetische benadering niet-synthetische projecten kan bevoordelen, hebben de onderzoekers de dataset geëvalueerd met behulp van de frame-gebaseerde detectiebenadering die wordt gebruikt voor MS-COCO en de 2012 PASCAL Visual Object Classes (VOC) Challenge, met gemiddelde precisie als meting.

De onderzoekers vonden dat voorafgaand trainen op de SAIL-VOS-dataset de prestaties van Intersection over Union (IoU) met 19% verbetert, met een overeenkomstige verbetering in VideoMatch-prestaties, van 55% naar 74% op ongezien data.

Echter, in gevallen van extreme occlusie, waren er momenten waarop alle oude methoden nog steeds niet in staat waren om een object of persoon te identificeren, hoewel de onderzoekers voorspellen dat dit in de toekomst kan worden opgelost door aangrenzende frames te onderzoeken om de reden voor de amodale masker te bepalen.

In de twee rechterafbeeldingen zijn traditionele segmentatie-algoritmes niet in staat om de vrouwelijke figuur te identificeren vanuit het zeer beperkte deel van haar hoofd dat zichtbaar is. Latere innovaties met optische stroomevaluatie kunnen deze resultaten mogelijk verbeteren.

In de twee rechterafbeeldingen zijn traditionele segmentatie-algoritmes niet in staat om de vrouwelijke figuur te identificeren vanuit het zeer beperkte deel van haar hoofd dat zichtbaar is. Latere innovaties met optische stroomevaluatie kunnen deze resultaten mogelijk verbeteren. (Klik om te vergroten)

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai