Anderson의 관점
브라우저 기반 이미지 주석 도구를 위한 컴퓨터 비전 데이터셋

핀란드의 연구자들은 컴퓨터 비전 데이터셋을 위한 이미지 주석 과정을 쉽고 빠르게 만들기 위한 브라우저 기반 이미지 주석 도구를 개발했습니다. 이 도구는 가장 인기 있는 브라우저 엔진에 대한 OS-agnostic 확장으로 설치되어 있으며, 사용자는 전용 설정이나 클라이언트 측 코드를 실행하지 않고도 자유롭게 브라우징하면서 주석을 달 수 있습니다.
BRIMA(저오버헤드 브라우저 전용 이미지 주석 도구)로 명명된 이 시스템은 윌라스카일라 대학교에서 개발되었습니다. 로컬 또는 원격 디렉토리에 데이터셋을 스크레이핑하고 컴파일할 필요가 없으며, 공용 플랫폼에서 사용할 수 있는 다양한 데이터 매개변수에서 유용한 데이터를 파생할 수 있도록 구성할 수 있습니다.

BRIMA 동작. 출처: https://arxiv.org/pdf/2107.06351.pdf
이 방식으로 BRIMA(2021년 ICIP에서 발표될 예정이며, 코드도 공개될 예정)는 자동화된 웹 스크레이핑 시스템이 IP 범위 또는 기타 방법으로 차단되어 데이터를 수집할 수 없는 시나리오에서 발생할 수 있는 잠재적인 장애물을 피할 수 있습니다. 이는 IP 보호가 점점 더 중점적으로 다루어짐에 따라 발생할 수 있는 시나리오입니다. 최근에 마이크로소프트의 AI 기반 코드 생성 도구인 Copilot에서 볼 수 있듯이 vậy입니다.
BRIMA는 인간 기반 주석에만 사용되므로 CAPTCHA 챌린지 또는 데이터 수집 알고리즘을 차단하기 위한 다른 자동화된 시스템을 트리거할 가능성이 낮습니다.
적응형 데이터 수집 기능
BRIMA는 Firefox 애드온 또는 Chrome 확장으로 구현되며, Windows, OSX 또는 Linux에서 실행할 수 있습니다. 특정 플랫폼에서 노출하는 데이터 포인트에 따라 관련 데이터를 수집하도록 구성할 수 있습니다. 예를 들어, Google 스트리트 뷰에서 이미지 주석을 달 때, 시스템은 렌즈의 방향과 관점을 고려할 수 있으며, 사용자가 주의를 기울이는 객체의 정확한 지리적 위치를 등록할 수 있습니다.

BRIMA는 2020년 9월에 개발자들이 공공 장소에 설치된 CCTV 카메라를 위한 객체 감지 데이터셋을 생성하기 위한 크라우드소싱 이니셔티브에서 테스트되었습니다.
시스템은 브라우저 확장으로 설치되는 경량 JavaScript 클라이언트 측 설치와 주석 데이터를 수신하고 컴파일하는 서버 측 구성으로 구성됩니다. 서버 측 설치의 참조 구현은 Python과 PHP로 작성되었으며, Flask와 Swagger/OpenAPI를 사용합니다. 그러나 연구자들은 중앙 처리 아키텍처를 쉽게 다른 언어와 구성으로 이전할 수 있다고 강조합니다.
브라우저 확장과 서버는 RESTful API 요청과 HTTP/XHR을 통해 통신하며, 클라이언트 측 데이터는 MS COCO와 호환되는 JSON 형식으로 전송됩니다. 이는 데이터가 TensorFlow를 포함한 다양한 인기 있는 객체 감지 프레임워크와 함께 즉시 사용할 수 있음을 의미합니다. 예를 들어, Facebook의 Detectron2와 CenterMask2가 있습니다.
프로젝트별 도구
BRIMA는 일반적인 특성에도 불구하고, 특정 데이터 수집 구성으로 구성할 수 있습니다. 이는 드롭다운 메뉴 및 특정 도메인과 관련된 기타 종류의 컨텍스트 입력을 부과하는 것을 포함합니다. 아래 이미지를 보면, 카메라 정보와 관련된 드롭다운 메뉴가 BRIMA에 작성되어 있으며, 주석자가 프로젝트와 관련된詳細한 정보를 제공할 수 있습니다.

이 추가 도구는 로컬에서 구성할 수 있습니다. 확장은 또한 쉽게 설치하고 구성 가능한 키보드 단축키, 색상 코드 UI 요소를 제공합니다.
이 연구는 최근 몇 년 동안 웹에서 얻은 데이터 또는 공용 데이터를 위한 이미지 주석의 편의성을 개선하기 위한 여러 시도를 기반으로 합니다. DARPA에서 지원하는 PhotoStuff 도구는 전용 웹 포털을 통해 온라인 주석을 제공하며, 시맨틱 웹 또는 독립형 응용 프로그램으로 실행할 수 있습니다. 2004년 UC 버클리는 Photo Annotation on a Camera Phone을 제안했으며, 이는 메타데이터에 크게 의존했습니다. MIT의 2005년 LabelMe 프로젝트는 브라우저 기반 주석에 접근했으며, MATLAB 도구에 의존했습니다.
2015년부터 FOSS Python/QT 프레임워크인 LabelImg는 크라우드소싱 주석 노력에서 인기를 얻었습니다. LabelImg는 PascalVOC와 YOLO 표준을 중심으로 하며, MS COCO JSON 형식을 지원하지 않으며, 단순한 사각형 캡처 영역을 선호하여 이후 분할이 필요합니다.












