Погляд Anderson

Інструмент анотації зображень у браузері для наборів даних комп’ютерного зору

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники з Фінляндії розробили інструмент анотації зображень у браузері, призначений для поліпшення легкості та швидкості трудомістких процесів анотації зображень для наборів даних комп’ютерного зору. Встановлений як розширення для найбільш популярних браузерних двигунів, новий інструмент дозволяє користувачам “анотувати під час вільного перегляду”, а не потребувати розміщення сесії анотації в контексті спеціальної установки або виконання клієнтського коду та інших особливих обставин.

Інструмент називається BRIMA (інструмент анотації зображень у браузері з низькими витратами), система була розроблена в Університеті Ювяскюля. Він усуває необхідність збору та компіляції наборів даних у локальні або віддалені каталоги та може бути налаштований для отримання корисної інформації з різних параметрів даних, доступних на будь-якій публічній платформі.

BRIMA в дії. Джерело: https://arxiv.org/pdf/2107.06351.pdf

BRIMA в дії. Джерело: https://arxiv.org/pdf/2107.06351.pdf

Цим чином BRIMA (який буде представлений на ICIP 2021, коли код також буде доступний) усуває потенційні перешкоди, які можуть виникнути, коли автоматизовані веб-системи скрапінгу блокуються через діапазони IP або інші методи, і перешкоджає збору даних – сценарій, який стане все більш поширеним, оскільки захист IP стає все більш актуальним, як це недавно відбулося з інструментом генерації коду Microsoft на основі штучного інтелекту, Copilot.

Оскільки BRIMA призначений виключно для анотації на основі людської діяльності, його використання також менш ймовірно спровокує інші види перешкод, такі як виклики CAPTCHA чи інші автоматизовані системи, призначені для блокування алгоритмів збору даних.

Адаптивні можливості збору даних

BRIMA реалізований через розширення для Firefox або Chrome на Windows, OSX або Linux, і може бути налаштований для прийому суттєвих даних на основі даних, які певна платформа може вибрати для відкриття. Наприклад, при анотації зображень у Google Street View система може врахувати орієнтацію та точку зору об’єктива, і зареєструвати точне географічне розташування об’єкта, який знаходиться під увагою користувача.

BRIMA був протестований у вересні 2020 року його творцями під час співпраці над краудсорсинговою ініціативою з генерації набору даних для об’єктів відеоспостереження (камер відеоспостереження, встановлених у громадських місцях або доступних з громадських місць).

Система складається з легкого клієнтського встановлення у вигляді розширення для браузера, і серверної частини, яка приймає та компілює дані анотації. Референсні реалізації серверної частини були написані на мовах Python і PHP з використанням Flask і Swagger/OpenAPI, але дослідники підкреслюють, що центральна обробна архітектура може бути легко перенесена на інші мови та конфігурації.

Розширення для браузера та сервер спілкуються через RESTful API-запити та HTTP/XHR, з клієнтськими даними, надісланими у форматі JSON, сумісному з MS COCO. Це означає, що дані одразу ж придатні для використання з різними популярними фреймворками виявлення об’єктів, включаючи різні бек-енди для TensorFlow, такі як бібліотека Detectron2 від Facebook, і CenterMask2.

Інструменти для конкретних проєктів

Незважаючи на загальний характер BRIMA, його можна налаштувати для високоспецифічних конфігурацій збору даних, включаючи впровадження випадаючих меню та інших видів контекстного вводу, пов’язаного з певною областю. На зображенні нижче ми бачимо, як випадаюче меню, пов’язане з інформацією про камеру, було написано в BRIMA, щоб група анотаторів могла надати детальну та проєктно-релевантну інформацію.

Ці додаткові інструменти можна налаштувати локально. Розширення також має легке встановлення та налаштовувані клавішні скорочення, а також кольорові елементи інтерфейсу.

Ця робота будується на ряді спроб останніх років поліпшити зручність анотації зображень для веб-даних або публічних даних. Інструмент PhotoStuff, підтримуваний DARPA, пропонує онлайн-анотацію через спеціальний веб-портал, і може бути запущений на семантичному вебі або як самостійна програма; у 2004 році Університет Каліфорнії у Берклі запропонував Анотацію фотографій на камерофоні, який сильно опирався на метадані через обмеження мережевого охоплення та обмеження огляду епохи; проєкт LabelMe від MIT у 2005 році також підходив до анотації у браузері, з використанням інструментів MATLAB;

Від моменту випуску у 2015 році FOSS-фреймворк LabelImg на основі Python/QT набув популярності у краудсорсингових зусиллях з анотації, з присвяченим локальним встановленням. Однак дослідники BRIMA відзначають, що LabelImg зосереджується на стандартах PascalVOC і YOLO, не підтримує формат JSON MS COCO, і уникає інструментів полігональної обробки на користь простих прямокутних областей захоплення (які будуть вимагати подальшої сегментації).

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai