Взгляд Anderson
Облачный инструмент для аннотации изображений для наборов данных компьютерного зрения

Исследователи из Финляндии разработали облачный инструмент для аннотации изображений, предназначенный для улучшения легкости и скорости трудоемких процессов аннотации изображений для наборов данных компьютерного зрения. Установленный как расширение для наиболее популярных браузерных движков, новый инструмент позволяет пользователям “аннотировать во время свободного просмотра”, а не требовать от них создания отдельной сессии аннотации или запуска кода на клиентской стороне и других особых условий.
Инструмент, получивший название BRIMA (Low-Overhead BRowser-only IMage Annotation tool), был разработан в Университете Ювяскюля. Он устраняет необходимость сбора и компиляции наборов данных в локальные или удаленные каталоги и может быть настроен для получения полезных данных из различных параметров данных, доступных на любой публичной платформе.

BRIMA в действии. Источник: https://arxiv.org/pdf/2107.06351.pdf
Таким образом BRIMA (который будет представлен на ICIP 2021, когда код также будет доступен) устраняет потенциальные препятствия, которые могут возникнуть при автоматизированных системах веб-скрапинга, заблокированных по IP-адресам или другими методами, и препятствующих сбору данных – сценарий, который становится все более распространенным по мере того, как защита IP становится все более актуальной, как это недавно произошло с инструментом Microsoft для генерации кода на основе ИИ, Copilot.
Поскольку BRIMA предназначен исключительно для аннотации на основе человека, его использование также менее вероятно вызовет другие виды препятствий, такие как задачи CAPTCHA или другие автоматические системы, предназначенные для блокировки алгоритмов сбора данных.
Адаптивные возможности сбора данных
BRIMA реализован через расширение Firefox или расширение Chrome для Windows, OSX или Linux и может быть настроен для получения релевантных данных на основе данных, которые конкретная платформа может выбрать для раскрытия. Например, при аннотации изображений в Google Street View система может учитывать ориентацию и точку зрения объектива, а также зарегистрировать точное географическое местоположение объекта, указанного пользователем.

BRIMA был протестирован в сентябре 2020 года его создателями в ходе сотрудничества над краудсорсинговой инициативой по созданию набора данных для обнаружения объектов на CCTV (видеокамеры видеонаблюдения, установленные в общественных местах или доступные из общественных мест).
Система состоит из легковесного клиентского расширения JavaScript в виде браузерного расширения и серверной части, которая получает и компилирует данные аннотации. Референсные реализации серверной части были написаны на Python и PHP с использованием Flask и Swagger/OpenAPI, но исследователи подчеркивают, что центральная архитектура обработки может быть легко перенесена на другие языки и конфигурации.
Расширение браузера и сервер общаются через RESTful API-запросы и HTTP/XHR, с клиентскими данными, отправляемыми в формате JSON, совместимом с MS COCO. Это означает, что данные сразу же могут быть использованы с различными популярными фреймворками обнаружения объектов, включая разнообразные бэкэнды TensorFlow, такие как библиотека Detectron2 от Facebook, и CenterMask2.
Инструменты для конкретных проектов
Несмотря на общую природу BRIMA, его можно настроить для получения конкретных конфигураций сбора данных, включая наложение выпадающих меню и других видов контекстного ввода, связанного с конкретной областью. На изображении ниже мы видим, что выпадающее меню, связанное с информацией о камере, было написано в BRIMA, чтобы группа аннотаторов могла предоставить подробную и релевантную для проекта информацию.

Такое дополнительное инструментирование может быть настроено локально. Расширение также имеет простую установку и настраиваемые клавиатурные сокращения, а также цветовые элементы интерфейса.
Работа основана на ряде попыток в последние годы улучшить удобство аннотации изображений для веб-извлеченных или публично доступных данных. Инструмент PhotoStuff, поддерживаемый DARPA, предлагает онлайн-аннотацию через выделенный веб-портал и может быть запущен на семантическом вебе или как самостоятельное приложение; в 2004 году Университет Калифорнии в Беркли предложил Аннотация фотографий на камерофоне, который сильно полагался на метаданные из-за ограничений сетевого покрытия и ограничений viewport того времени; проект MIT 2005 года LabelMe также подходил к аннотации на основе браузера, с использованием инструментов MATLAB;
С момента выпуска в 2015 году FOSS Python/QT-фреймворка LabelImg приобрел популярность в краудсорсинговых усилиях по аннотации, с посвященной локальной установкой. Однако исследователи BRIMA отмечают, что LabelImg сосредоточен на стандартах PascalVOC и YOLO, не поддерживает формат MS COCO JSON и отказывается от инструментов полигональной разметки в пользу простых прямоугольных областей захвата (которые потребуют последующей сегментации).












