Unghiul lui Anderson

Un instrument de annotare a imaginilor bazat pe browser pentru seturi de date de vedere computerizată

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetătorii din Finlanda au dezvoltat un instrument de etichetare a imaginilor bazat pe browser, menit să îmbunătățească ușurința și viteza proceselor de annotare a imaginilor pentru seturi de date de vedere computerizată. Instalat ca o extensie OS-agnostică pentru cele mai populare motoare de browser, noul instrument permite utilizatorilor să “anoteze în timp ce navighează liber”, fără a fi nevoie să plaseze o sesiune de etichetare în contextul unei configurări dedicate sau să ruleze codul client și alte circumstanțe speciale.

Denominat BRIMA (Instrument de annotare a imaginilor cu uz de browser, cu suprasarcină redusă), sistemul a fost dezvoltat la Universitatea din Jyväskylä. Acesta elimină nevoia de a extrage și compila seturi de date în directoare locale sau la distanță și poate fi configurat pentru a obține date utile din diversele parametri de date disponibile pe orice platformă cu acces public.

BRIMA în acțiune. Sursă: https://arxiv.org/pdf/2107.06351.pdf

BRIMA în acțiune. Sursă: https://arxiv.org/pdf/2107.06351.pdf

În acest fel, BRIMA (care va fi prezentat la ICIP 2021, când codul va fi, de asemenea, disponibil) evită obstacolele potențiale care pot apărea atunci când sistemele automate de extragere a datelor de pe web sunt blocate prin intervale de IP sau alte metode și împiedicate să colecteze date – o situație care este pe cale să devină mai frecventă, pe măsură ce protecția IP devine din ce în ce mai importantă, așa cum s-a întâmplat recent cu instrumentul de generare de cod bazat pe inteligență artificială al Microsoft, Copilot.

Deoarece BRIMA este destinat exclusiv pentru annotarea bazată pe uman, utilizarea sa este, de asemenea, mai puțin probabilă să declanșeze alte tipuri de bariere, cum ar fi provocările CAPTCHA sau alte sisteme automate destinate să blocheze algoritmii de colectare a datelor.

Capacități de colectare a datelor adaptabile

BRIMA este implementat prin intermediul unei extensii Firefox sau a unei extensii Chrome pe Windows, OSX sau Linux și poate fi configurat pentru a ingera date semnificative pe baza punctelor de date pe care o anumită platformă le poate expune. De exemplu, atunci când se anotează imagini în Google Street View, sistemul poate ține cont de orientarea și punctul de vedere al obiectivului și poate înregistra locația geografică exactă a obiectului specificat sub atenția utilizatorului.

BRIMA a fost testat în septembrie 2020 de creatorii săi, în timpul colaborării la o inițiativă de crowdsourcing pentru a genera un set de date de detectare a obiectelor pentru obiecte de supraveghere video (camere de supraveghere montate în spații publice sau vizibile din spații publice).

Sistemul este alcătuit dintr-o instalare ușoară a clientului JavaScript pe partea de browser, sub formă de extensie a browserului, și o parte server care primește și compilează datele de annotare. Implementările de referință ale instalării serverului au fost scrise în Python și PHP cu Flask și Swagger/OpenAPI, dar cercetătorii subliniază că arhitectura centrală de procesare poate fi ușor portată la alte limbi și configurații.

Extensia de browser și serverul comunică prin solicitări API RESTful și HTTP/XHR, cu datele client trimise acasă într-un format JSON compatibil cu MS COCO. Acest lucru înseamnă că datele sunt imediat utilizabile cu o varietate de cadre de detectare a obiectelor, incluzând diverse back-end-uri pentru TensorFlow, cum ar fi Detectron2 de la Facebook și CenterMask2.

Instrumente specifice proiectului

În ciuda naturii generice a BRIMA, acesta poate fi configurat în configurații de colectare a datelor foarte specifice, incluzând impunerea de meniuri derulante și alte tipuri de intrări contextuale legate de un anumit domeniu. În imaginea de mai jos, putem vedea că a fost scrisă o meniune derulantă legată de informații despre cameră în BRIMA, astfel încât un grup de annotatori poate furniza informații detaliate și relevante pentru proiect.

Acest instrument suplimentar poate fi configurat local. Extensia dispune, de asemenea, de o instalare ușoară și de ateliere de tastatură configurabile, împreună cu elemente de interfață cu utilizatorul colorate.

Lucrarea se bazează pe o serie de încercări din ultimii ani de a îmbunătăți facilitățile de annotare a imaginilor pentru date web-obținute sau publice. Instrumentul PhotoStuff, susținut de DARPA, oferă annotare online prin intermediul unui portal web dedicat și poate fi rulat pe web semantic sau ca aplicație autonomă; în 2004, UC Berkeley a propus Annotarea foto pe un telefon mobil, care a folosit puternic metadatele, din cauza limitărilor acoperirii rețelei și a limitărilor viewport-ului din acea perioadă; proiectul LabelMe de la MIT din 2005 a abordat, de asemenea, annotarea bazată pe browser, cu o dependență de instrumentele MATLAB;

De la lansarea sa în 2015, cadruul FOSS Python/QT LabelImg a câștigat popularitate în eforturile de annotare a crowdsourcing-ului, cu o instalare locală dedicată. Cu toate acestea, cercetătorii BRIMA observă că LabelImg se concentrează pe standardele PascalVOC și YOLO, nu suportă formatul JSON MS COCO și evită instrumentele de conturare poligonală în favoarea regiunilor de captură rectangulare simple (care vor necesita segmentarea ulterioară).

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai