Kąt Andersona

Narzędzie do adnotacji obrazów opartych na przeglądarce dla zbiorów danych z widzenia komputerowego

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Finlandii opracowali narzędzie do adnotacji obrazów oparte na przeglądarce, mające na celu ułatwienie i przyspieszenie procesu adnotacji obrazów dla zbiorów danych z widzenia komputerowego. Zainstalowane jako rozszerzenie niezależne od systemu operacyjnego dla najpopularniejszych silników przeglądarek, nowe narzędzie umożliwia użytkownikom “adnotowanie podczas swobodnego przeglądania”, zamiast konieczności umieszczania sesji adnotacji w kontekście dedykowanego ustawienia lub uruchamiania kodu po stronie klienta i innych specjalnych okoliczności.

Zatytułowane BRIMA (niskonakładowe narzędzie do adnotacji obrazów oparte na przeglądarce), system został opracowany na Uniwersytecie w Jyväskylä. Usuwa potrzebę skrobania i kompilowania zbiorów danych do lokalnych lub zdalnych katalogów i może być skonfigurowany do pozyskiwania użytecznych danych z różnych parametrów danych dostępnych na każdej publicznie dostępnej platformie.

BRIMA w akcji. Źródło: https://arxiv.org/pdf/2107.06351.pdf

BRIMA w akcji. Źródło: https://arxiv.org/pdf/2107.06351.pdf

W ten sposób BRIMA (które zostanie przedstawione na ICIP 2021, kiedy kod również będzie dostępny) eliminuje potencjalne przeszkody, które mogą pojawić się, gdy zautomatyzowane systemy skrobania sieciowego są zablokowane za pomocą zakresów IP lub innych metod, i utrudniają zbieranie danych – scenariusz, który ma się stać coraz bardziej powszechny, ponieważ ochrona IP staje się coraz bardziej istotna, jak to się niedawno stało z narzędziem do generowania kodu AI Microsoftu, Copilot.

Ponieważ BRIMA jest przeznaczone wyłącznie do adnotacji opartej na ludziach, jego użycie jest również mniej prawdopodobne do wywołania innych rodzajów przeszkód, takich jak wyzwania CAPTCHA lub inne zautomatyzowane systemy przeznaczone do blokowania algorytmów gromadzenia danych.

Adaptacyjne możliwości gromadzenia danych

BRIMA jest wdrożone za pomocą rozszerzenia Firefox lub rozszerzenia Chrome w systemach Windows, OSX lub Linux i może być skonfigurowane do pobierania istotnych danych na podstawie punktów danych, które dana platforma może wyeksponować. Na przykład, podczas adnotacji obrazów w Google Street View, system może uwzględnić orientację i punkt widzenia obiektywu, oraz zarejestrować dokładną lokalizację geograficzną obiektu określonego przez użytkownika.

BRIMA zostało przetestowane we wrześniu 2020 roku przez swoich twórców, podczas współpracy nad crowdsourcedowym projektem generowania zbioru danych do wykrywania obiektów CCTV (kamer monitoringu wideo zamontowanych w przestrzeni publicznej lub widocznych z przestrzeni publicznej).

System składa się z lekkiego klienta po stronie JavaScript w postaci rozszerzenia przeglądarki i serwerowej strony, która otrzymuje i kompiluje dane adnotacji. Implementacje referencyjne serwerowej strony zostały napisane w językach Python i PHP z Flask i Swagger/OpenAPI, ale badacze podkreślają, że architektura centralnego przetwarzania może być łatwo przeniesiona do innych języków i konfiguracji.

Rozszerzenie przeglądarki i serwer komunikują się za pomocą żądań API RESTful i HTTP/XHR, a dane po stronie klienta są wysyłane w formacie JSON, który jest kompatybilny z MS COCO. Oznacza to, że dane są natychmiast użyteczne z różnymi popularnymi frameworkami wykrywania obiektów, w tym z różnymi backendami TensorFlow, takimi jak Detectron2 Facebooka, i CenterMask2.

Narzędzia specyficzne dla projektu

Pomimo ogólnego charakteru BRIMA, może ono być skonfigurowane do wyspecjalizowanych konfiguracji gromadzenia danych, w tym nałożenia menu rozwijanego i innych rodzajów danych wejściowych kontekstowych związanych z konkretnym obszarem. Na poniższym obrazie widać, że menu rozwijane związane z informacjami o kamerze zostało napisane w BRIMA, aby grupa adnotatorów mogła dostarczyć szczegółowe i istotne informacje dla projektu.

To dodatkowe narzędzie może być skonfigurowane lokalnie. Rozszerzenie posiada również łatwą instalację i konfigurowalne skróty klawiszowe, a także elementy interfejsu użytkownika z kolorowymi kodami.

Praca ta opiera się na licznych próbach z ostatnich lat, aby poprawić wygodę adnotacji obrazów dla danych uzyskanych z sieci lub publicznie dostępnych. Narzędzie PhotoStuff, wspierane przez DARPA, oferuje adnotację online za pośrednictwem dedykowanego portalu internetowego i może być uruchomione na sieci semantycznej lub jako aplikacja autonomiczna; w 2004 roku Uniwersytet Kalifornijski w Berkeley zaproponował Adnotacja zdjęć na telefonie komórkowym, który silnie wykorzystywał metadane ze względu na ograniczenia pokrycia sieciowej i ograniczenia widoku ery; projekt LabelMe MIT z 2005 roku również podejmował adnotację opartą na przeglądarce, z zależnością od narzędzi MATLAB;

Od czasu jego wydania w 2015 roku, framework FOSS Python/QT LabelImg zyskał popularność w crowdsourcedowych wysiłkach adnotacji, z dedykowaną lokalną instalacją. Jednakże, badacze BRIMA zauważają, że LabelImg koncentruje się na standardach PascalVOC i YOLO, nie obsługuje formatu MS COCO JSON i odrzuca narzędzia do obrysowania wielokątów na rzecz prostych regionów capture (które będą wymagać późniejszego podziału).

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai