Моделі та платформи ШІ

Нова технологія автоматичної маркування Voxel51 обіцяє знизити витрати на анотацію в 100 000 разів

mm
Додайте Unite.AI до бажаних джерел у Google

Проривне дослідження компанії Voxel51, що займається комп’ютерним зором, свідчить про те, що традиційна модель анотації даних вже скоро буде змінена. У дослідженні, опублікованому сьогодні, компанія повідомляє, що її нова система автоматичної маркування досягає рівня точності людського рівня до 95%, при цьому вона в 5 000 разів швидша і в 100 000 разів дешевша за ручну маркування.

Дослідження оцінило основні моделі, такі як YOLO-World і Grounding DINO, на відомих наборах даних, включаючи COCO, LVIS, BDD100K і VOC. Вражаюче те, що в багатьох реальних сценаріях моделі, навчені виключно на автоматично згенерованих мітках, показали результати на рівні з моделями, навченими на людських мітках, або навіть краще. Для компаній, що будують системи комп’ютерного зору, наслідки величезні: мільйони доларів на витратах на анотацію можуть бути збережені, а цикли розробки моделей можуть скоротитися з тижнів до годин.

Нова ера анотації: від ручної праці до модельно-орієнтованих потоків

Тривалий час анотація даних була болісною瓶ною в розробці штучного інтелекту. Від ImageNet до наборів даних автономних транспортних засобів команди спиралися на велику армію людських працівників для малювання обмежувальних рамок і сегментації об’єктів – це було як дорого, так і повільно.

Превалююча логіка була простою: більше людських міток = краще штучний інтелект. Але дослідження Voxel51 перевернуло це припущення з ніг на голову.

Їхній підхід використовує попередньо навчені основні моделі – деякі з яких мають нульові можливості – і інтегрує їх у потік, який автоматизує звичайну маркування, а також використовує активне навчання для позначення невизначених або складних випадків для людської перевірки. Цей метод суттєво скорочує час і витрати.

Під час одного з тестів маркування 3,4 мільйона об’єктів за допомогою NVIDIA (NVDA ) L40S GPU зайняло трохи понад годину і коштувало 1,18 доллара. Ручне виконання цього завдання з використанням AWS SageMaker зайняло б майже 7 000 годин і коштувало б понад 124 000 доларів. У особливо складних випадках – таких як ідентифікація рідкісних категорій у наборах даних COCO або LVIS – моделі з автоматично згенерованими мітками іноді показували кращі результати, ніж їхні людські аналоги. Це несподіваний результат, можливо, пояснюється послідовними моделями маркування і їхнім навчанням на великомасштабних інтернет-даних.

Всередині Voxel51: команда, що змінює робочі потоки візуального штучного інтелекту

Компанія Voxel51 була заснована у 2016 році професором Джейсоном Корсо і Браяном Муром університету Мічигану. Спочатку це була консалтингова компанія, що займалася відеоаналітикою. Корсо, ветеран у галузі комп’ютерного зору і робототехніки, опублікував понад 150 наукових робіт і внесли значний внесок у відкритий код для спільноти штучного інтелекту. Мур, колишній аспірант Корсо, обіймає посаду генерального директора.

Переломний момент настало, коли команда усвідомила, що більшість瓶ень штучного інтелекту не були у моделях, а у даних. Це розуміння спонукало їх створити FiftyOne, платформу, призначену для надання інженерам можливості досліджувати, кураторувати та оптимізувати візуальні набори даних більш ефективно.

За роки компанія зібрала понад $45 мільйонів, включаючи $12,5 мільйонів серії А і $30 мільйонів серії Б, яку очолили Bessemer Venture Partners. Надалі відбулося підприємницьке впровадження, коли великі клієнти, такі як LG Electronics, Bosch, Berkshire Grey (BGRY ) , Precision Planting і RIOS, інтегрували інструменти Voxel51 у свої робочі потоки штучного інтелекту.

Від інструменту до платформи: розширення ролі FiftyOne

FiftyOne виросла з простого інструменту візуалізації наборів даних у комплексну, орієнтовану на дані платформу штучного інтелекту. Вона підтримує широкий спектр форматів і схем маркування – COCO, Pascal VOC, LVIS, BDD100K, Open Images – і безшовно інтегрується з фреймворками, такими як TensorFlow і PyTorch.

Більше ніж інструмент візуалізації, FiftyOne дозволяє здійснювати просунуті операції: пошук дублікатів зображень, ідентифікація помилково помічених зразків, виділення аутлієрів і вимірювання режимів відмов моделі. Її екосистема плагінів підтримує настраївані модулі для оптичного розпізнавання символів, відео Q&A і аналізу на основі вкладень.

Підприємницька версія, FiftyOne Teams, вводить колаборативні функції, такі як контроль версій, права доступу та інтеграція з хмарним сховищем (наприклад, S3), а також інструменти маркування, такі як Labelbox і CVAT. Варто відзначити, що Voxel51 також партнером з V7 Labs, щоб оптимізувати потік між кураторством наборів даних і ручним маркуванням.

Переоцінка галузі анотації

Дослідження автоматичної маркування Voxel51 викликає сумніви щодо припущень, що лежать в основі майже мільярдної галузі анотації. У традиційних робочих потоках кожне зображення повинно бути торкнуто людиною – це дорогий і часто надмірний процес. Voxel51 стверджує, що більшість цієї праці тепер може бути ліквідована.

З їхньою системою більшість зображень маркуються штучним інтелектом, а лише випадки, що виходять за межі норми, передаються людям. Ця гібридна стратегія не тільки скорочує витрати, але й забезпечує вищу загальну якість даних, оскільки людська праця зарезервована для найбільш складних або цінних анотацій.

Ця зміна паралельна більш широким тенденціям у сфері штучного інтелекту до орієнтованого на дані штучного інтелекту – методології, що фокусується на оптимізації навчальних даних, а не на нескінченному налаштуванні архітектури моделей.

Конкурентний ландшафт і відгуки галузі

Інвестори, такі як Bessemer, розглядають Voxel51 як “шар оркестрування даних” для штучного інтелекту – подібно до того, як інструменти DevOps змінили розробку програмного забезпечення. Їхній відкритий інструмент зібрав мільйони завантажень, а їхнє співтовариство налічує тисячі розробників і команд штучного інтелекту по всьому світу.

Хоча інші стартапи, такі як Snorkel AI, Roboflow і Activeloop, також зосереджені на робочих потоках даних, Voxel51 виділяється своєю шириною, відкритим етосом і підприємницькою інфраструктурою. Замість конкуренції з постачальниками анотації платформа Voxel51 доповнює їх, роблячи існуючі послуги більш ефективними завдяки вибірковій кураторії.

Майбутні наслідки

Довгострокові наслідки величезні. Якщо широко прийнята, методологія Voxel51 могла б суттєво знизити бар’єр для входу у сфері комп’ютерного зору, демократизуючи цю галузь для стартапів і дослідників, які не мають великих бюджетів на маркування.

Поза економією коштів, цей підхід також закладає основу для систем безперервного навчання, у яких моделі в продуктивному середовищі автоматично позначають відмови, які потім переглядаються, переміткаються та повертаються у навчальні дані – все це відбувається в рамках одного оркестрованого потоку.

Більш широке бачення компанії збігається з тим, як штучний інтелект еволюціонує: не тільки розумніші моделі, а й розумніші робочі потоки. У цьому баченні анотація не мертва, а стала стратегічною, вибірковою та керованою автоматизацією.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.