Andersonův úhel
Prohlížečový nástroj pro anotaci obrazů pro sady počítačového vidění

Výzkumníci z Finska vyvinuli prohlížečový nástroj pro anotaci obrazů, který má za cíl zlepšit snadnost a rychlost zdlouhavých procesů anotace obrazů pro sady počítačového vidění. Nainstalován jako rozšíření pro nejpopulárnější prohlížeče, nový nástroj umožňuje uživatelům “anotovat při procházení”, místo aby museli vytvářet samostatnou anotační relaci nebo spouštět klientský kód a další speciální okolnosti.
Nazvaný BRIMA (Low-Overhead BRowser-only IMage Annotation tool), systém byl vyvinut na Univerzitě v Jyväskylä. Odstraňuje potřebu skrípat a kompilovat sady dat do místních nebo vzdálených adresářů a lze jej nakonfigurovat tak, aby odvodil užitečné údaje z různých datových parametrů dostupných na jakékoli veřejné platformě.

BRIMA v akci. Zdroj: https://arxiv.org/pdf/2107.06351.pdf
Tímto způsobem BRIMA (který bude prezentován na ICIP 2021, kdy bude k dispozici také kód) odstraňuje potenciální překážky, které mohou vzniknout, když jsou automatické webové skripty zablokovány pomocí IP rozsahů nebo jiných metod a brání se v shromažďování dat – scénář, který se má stát častějším, protože ochrana IP se stále více zaměřuje, jako se to nedávno stalo s Microsoftovým nástrojem Copilot pro generování kódu.
Pokudže BRIMA je určen výhradně pro anotaci založenou na člověku, jeho použití je také méně pravděpodobné, že spustí jiné druhy překážek, jako jsou výzvy CAPTCHA nebo jiné automatizované systémy určené k blokování algoritmů shromažďování dat.
Adaptivní schopnosti shromažďování dat
BRIMA je implementován jako rozšíření prohlížeče Firefox nebo Chrome ve Windows, OSX nebo Linux a lze jej nakonfigurovat tak, aby přijímal relevantní data na základě datových bodů, které může platforma zvolit. Například při anotaci obrazů v Google Street View může systém zohlednit orientaci a úhel pohledu objektivu a zaregistrovat přesnou geografickou polohu objektu, na který uživatel upozorňuje.

BRIMA byl testován v září 2020 svými tvůrci během spolupráce na crowdsourcovém projektu pro generování sady dat pro detekci objektů (kamer pro video dohled nad veřejnými prostory nebo viditelnými z veřejných prostor).
Systém se skládá z lehkého klienta JavaScriptu ve formě prohlížečového rozšíření a serverové části, která přijímá a kompiluje anotační data. Referenční implementace serverové části byly napsány v Pythonu a PHP s Flask a Swagger/OpenAPI, ale výzkumníci zdůrazňují, že centrální architektura zpracování může být snadno portována do jiných jazyků a konfigurací.
Prohlížečové rozšíření a server komunikují prostřednictvím RESTful API požadavků a HTTP/XHR, přičemž klientští data jsou odeslána v JSON formátu, který je kompatibilní s MS COCO. To znamená, že data jsou okamžitě použitelná s různými frameworky pro detekci objektů, včetně různých backendů pro TensorFlow, jako je Detectron2 od Facebooku a CenterMask2.
Nástroje specifické pro projekt
Přes obecnou povahu BRIMA lze jej nakonfigurovat do vysoce specifických konfigurací shromažďování dat, včetně zavedení roletových menu a dalších typů kontextové vstupní informace související s konkrétním doménou. Na obrázku níže vidíme, že roletové menu související s informací o kameře bylo zapsáno do BRIMA, aby skupina anotátorů mohla poskytnout podrobné a projektové relevantní informace.

Tato další nástroje lze nakonfigurovat místně. Rozšíření také nabízí snadnou instalaci a nakonfigurovatelné klávesové zkratky, spolu s barevně kódovanými prvky uživatelského rozhraní.
Práce staví na několika pokusech v posledních letech, aby se zlepšila možnost anotace obrazů pro webová nebo veřejně dostupná data. Nástroj PhotoStuff, podporovaný DARPA, nabízí online anotaci prostřednictvím věnovaného webového portálu a lze jej spustit na sémantickém webu nebo jako samostatnou aplikaci; v roce 2004 navrhl UC Berkeley Anotace fotografií na kamerovém telefonu, který silně využíval metadata kvůli omezením pokrytí sítě a omezením zobrazení v dané době; Projekt MIT z roku 2005 LabelMe také přistoupil k anotaci založené na prohlížeči, s důrazem na nástroje MATLAB;
Od jeho vydání v roce 2015 získala open-source python/QT framework LabelImg popularitu v crowdsourcových anotačních úsilích, s věnovanou místní instalací. Nicméně výzkumníci BRIMA pozorují, že LabelImg se zaměřuje na standardy PascalVOC a YOLO, nepodporuje formát MS COCO JSON a zanedbává polygonální nástroje pro obrysování ve prospěch jednoduchých obdélníkových oblastí zachycení (které budou vyžadovat následnou segmentaci).












