Andersons hoek

Een browsergebaseerde afbeeldingsannotatietool voor computerzichtdatasets

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers uit Finland hebben een browsergebaseerde afbeeldingslabeltool ontwikkeld om de moeilijke en tijdrovende afbeeldingsannotatieprocessen voor computerzichtdatasets te verbeteren. Geïnstalleerd als een besturingssysteem-onafhankelijke extensie voor de meest populaire browsermotoren, maakt de nieuwe tool het mogelijk voor gebruikers om ‘te annoteren terwijl ze vrij browsen’, in plaats van een labelsessie in de context van een speciale setup te moeten plaatsen of client-side code en andere speciale omstandigheden te moeten uitvoeren.

Genoemd BRIMA (Low-Overhead BRowser-only IMage Annotation tool), is het systeem ontwikkeld aan de Universiteit van Jyväskylä. Het verwijdert de noodzaak om datasets te schrapen en te compileren in lokale of externe directories, en kan worden geconfigureerd om nuttige gegevens te verkrijgen uit de verschillende gegevensparameters die beschikbaar zijn op elke openbare platform.

BRIMA in actie. Bron: https://arxiv.org/pdf/2107.06351.pdf

BRIMA in actie. Bron: https://arxiv.org/pdf/2107.06351.pdf

Op deze manier verhelpt BRIMA (die op ICIP 2021 zal worden gepresenteerd, wanneer de code ook beschikbaar zal worden gesteld) de potentiële obstakels die kunnen ontstaan wanneer geautomatiseerde web-scraping-systemen worden geblokkeerd via IP-bereiken of andere methoden, en belemmerd worden om gegevens te verzamelen – een scenario dat steeds vaker zal voorkomen naarmate IP-bescherming steeds meer aandacht krijgt, zoals onlangs is gebeurd met Microsoft’s AI-gestuurde codegeneratietool, Copilot.

Aangezien BRIMA uitsluitend bedoeld is voor menselijke annotatie, is het gebruik ervan ook minder waarschijnlijk om andere soorten roadblocks te activeren, zoals CAPTCHA-uitdagingen of andere geautomatiseerde systemen die zijn ontworpen om gegevensverzamelingsalgoritmen te blokkeren.

Adaptive Data-Gathering Capabilities

BRIMA is geïmplementeerd via een Firefox-add-on of Chrome-extensie op Windows, OSX of Linux, en kan worden geconfigureerd om relevante gegevens te verzamelen op basis van gegevenspunten die een bepaald platform kan blootstellen. Bijvoorbeeld, wanneer afbeeldingen in Google Street View worden geannoteerd, kan het systeem rekening houden met de oriëntatie en het gezichtspunt van de lens, en registreren de exacte geo-locatie van het object dat onder aandacht van de gebruiker staat.

BRIMA is getest in september 2020 door de ontwikkelaars, tijdens een samenwerking op een crowdsourced initiatief om een objectdetectiedataset voor CCTV-objecten (videosurveillancecamera’s gemonteerd in openbare ruimtes of zichtbaar vanuit openbare ruimtes) te genereren.

Het systeem bestaat uit een lichtgewicht JavaScript-client-side installatie in de vorm van de browserextensie, en een server-side aspect dat de annotatiegegevens ontvangt en compileert. Referentie-implementaties van de server-side installatie zijn geschreven in Python en PHP met Flask en Swagger/OpenAPI, maar de onderzoekers benadrukken dat de centrale verwerkingarchitectuur gemakkelijk kan worden overgezet naar andere talen en configuraties.

De browserextensie en de server communiceren via RESTful API-aanvragen en HTTP/XHR, met de client-side gegevens die naar huis worden gestuurd in een JSON-formaat dat compatibel is met MS COCO. Dit betekent dat de gegevens onmiddellijk bruikbaar zijn met een verscheidenheid aan de meest populaire objectdetectieframeworks, waaronder diverse back-ends voor TensorFlow, zoals Facebook’s Detectron2, en CenterMask2.

Project-Specific Tooling

Ondanks de generieke aard van BRIMA, kan het worden geconfigureerd in zeer specifieke data-verzamelingsconfiguraties, waaronder het opleggen van dropdown-menus en andere soorten contextuele invoer die verband houden met een bepaald domein. In de onderstaande afbeelding zien we dat een dropdown-menu met betrekking tot camerainformatie is geschreven in BRIMA, zodat een groep annotators gedetailleerde en project-relevante informatie kan verstrekken.

Deze extra tooling kan lokaal worden geconfigureerd. De extensie heeft ook een eenvoudige installatie en configureerbare toetsenbordkortegoed, evenals kleurgecodeerde UI-elementen.

Het werk bouwt voort op een aantal pogingen in de afgelopen jaren om de faciliteit van afbeeldingsannotatie voor web-verkregen of openbare gegevens te verbeteren. Het PhotoStuff-tool, ondersteund door DARPA, biedt online annotatie via een speciale webportal, en kan worden uitgevoerd op de semantische web of als een zelfstandige toepassing; in 2004 stelde UC Berkeley voor Photo Annotation on a Camera Phone, die zwaar leunde op metadata vanwege de beperkingen van netwerkdekking en de viewportbeperkingen van die tijd; het project LabelMe van MIT uit 2005 benaderde ook browsergebaseerde annotatie, met een afhankelijkheid van MATLAB-tools;

Sinds de release in 2015 heeft het FOSS Python/QT-framework LabelImg populariteit gewonnen in crowdsourced annotatie-inspanningen, met een lokale installatie. Echter, de BRIMA-onderzoekers merken op dat LabelImg zich richt op PascalVOC- en YOLO-standaarden, geen ondersteuning biedt voor MS COCO JSON-formaat, en polygonale omtrektools verwerpt ten gunste van eenvoudige rechthoekige capture-regio’s (die subsequente segmentatie zullen vereisen).

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai