Погляд Anderson

Відеокодек, розроблений для аналізу штучного інтелекту

mm
Додайте Unite.AI до бажаних джерел у Google

Хоча техно-трилер Коло (2017) більше коментар до етичних наслідків соціальних мереж, ніж практичних аспектів зовнішнього відеоаналізу, малюк ‘SeeChange’ камера в центрі сюжету є тим, що справді 推ує фільм в категорію ‘наукової фантастики’.

Пристрій 'SeeChange' камера/пристрій спостереження з техно-трилера 'Коло' (2017).

Пристрій ‘SeeChange’ камера/пристрій спостереження з техно-трилера ‘Коло’ (2017).

Бездротова і вільно пересувна пристрій розміром з великий марбл, це не відсутність сонячних панелей або неефективність отримання енергії з інших джерел (наприклад, радіохвиль), що робить SeeChange малоймовірним, а те, що він буде стискати відео 24/7, на будь-якій скромній зарядці, яку він зможе підтримувати.

Постачання дешевих сенсорів цього типу є основною сферою досліджень у галузі комп’ютерного бачення (CV) та відеоаналізу, особливо в неурбанізованих середовищах, де сенсор буде мусити витягувати максимальну продуктивність з дуже обмежених джерел енергії (батареї, сонячні панелі тощо).

У випадках, коли такий пристрій типу краю IoT/CV мусить передавати зображення на центральний сервер (часто через традиційні мережі мобільного зв’язку), вибір обмежений: або пристрій мусить запускати якийсь легкий нейронний мережевий локально, щоб передавати тільки оптимізовані сегменти відповідних даних для обробки на сервері; або він мусить передавати ‘глухе’ відео для підключених хмарних ресурсів для оцінки.

Хоча активація руху через подійні Смарт-Вижн-Сенсори (SVS) може знизити цю витрату, така активація також коштує енергії.

Тримання за владу

Крім того, навіть з рідкою активацією (тобто овця час від часу з’являється на виду), пристрій не має достатньої енергії, щоб передавати гігабайти невідкомпресованого відео; він також не має достатньої енергії, щоб постійно запускати популярні відеокодеки, такі як H.264/5, які очікують апаратного забезпечення, яке або підключене до мережі, або не далеко від наступної сесії зарядки.

Пipelines відеоаналізу для трьох типових завдань комп'ютерного бачення. Архітектура відеокодека мусить бути навчена для завдання, яке виконується, і зазвичай для нейронної мережі, яка приймає дані. Джерело: https://arxiv.org/pdf/2204.12534.pdf

Pipelines відеоаналізу для трьох типових завдань комп’ютерного бачення. Архітектура відеокодека мусить бути навчена для завдання, яке виконується, і зазвичай для нейронної мережі, яка приймає дані. Джерело: https://arxiv.org/pdf/2204.12534.pdf

Хоча широко поширений кодек H.264 має нижчу енергоспоживання, ніж його наступник H.265, він має погану ефективність стиснення. Його наступник, H.265, має кращу ефективність стиснення, але вище енергоспоживання. Хоча відкритий кодек Google VP9 перевершує їх обидва в кожній області, він вимагає вищої локальної обчислювальної потужності, що представляє додаткові проблеми в дешевому сенсорі IoT.

Що стосується локального аналізу потоку: до того часу, як ви запустите навіть найлегшу локальну нейронну мережу, щоб визначити, які кадри (або області кадру) варто передавати на сервер, ви часто витрачаєте енергію, яку ви могли б зберегти, просто передавши всі кадри.

Видобування маскових представлень великої рогатої худоби за допомогою сенсора, який малоймовірно буде підключений до мережі. Чи витрачає він свою обмежену потужність на локальну семантичну сегментацію з легкою нейронною мережею; чи передає обмежену інформацію на сервер для подальших інструкцій (запроваджуючи затримку); чи передає 'глухі' дані (марнуючи енергію на смугу пропускання)?

Видобування маскових представлень великої рогатої худоби за допомогою сенсора, який малоймовірно буде підключений до мережі. Чи витрачає він свою обмежену потужність на локальну семантичну сегментацію з легкою нейронною мережею; чи передає обмежену інформацію на сервер для подальших інструкцій (запроваджуючи затримку); чи передає ‘глухі’ дані (марнуючи енергію на смугу пропускання)? Джерело: https://arxiv.org/pdf/1807.01972.pdf

Чище, що ‘в дикій природі’ проєкти комп’ютерного бачення потребують спеціальних відеокодеків, оптимізованих для вимог конкретних нейронних мереж по конкретним і різноманітним завданням, таким як семантична сегментація, виявлення ключових точок (аналіз руху людини) і виявлення об’єктів, серед інших можливих кінцевих застосунків.

Якщо ви можете досягти ідеального балансу між ефективністю стиснення відео і мінімальною передачею даних, ви наближаєтеся до SeeChange і можливості розгортання доступних сенсорних мереж в несприятливих середовищах.

AccMPEG

Нові дослідження Університету Чикаго можуть зробити крок ближче до такого кодека у вигляді AccMPEG – нової архітектури відеокодека і потокового передавання, яка працює з низькою затримкою, високою точністю для серверних Глибоких Нейронних Мереж (DNN) і має надзвичайно низькі локальні обчислювальні вимоги.

Архітектура AccMPEG.

Архітектура AccMPEG. Джерело: https://arxiv.org/pdf/2204.12534.pdf

Система може зробити економію над попередніми методами, оцінюючи ступінь, у якій кожен 16x16px макроблок впливає на точність серверної DNN. Попередні методи зазвичай оцінювали цю точність на основі кожного пікселя в зображенні або виконували електрично дорогі локальні операції, щоб оцінити, які області зображення можуть бути найбільш важливими.

У AccMPEG ця точність оцінюється в спеціальному модулі під назвою AccGrad, який вимірює способи, якими якість кодування макроблоку впливає на кінцеве використання, наприклад серверну DNN, яка намагається порахувати людей, виконати оцінку скелета на рух людини або інші загальні завдання комп’ютерного бачення.

Коли кадр відео надходить у систему, AccMPEG спочатку обробляє його через дешевий селектор моделі, названий AccModel. Будь-які області, які не будуть сприяти корисним розрахункам серверної DNN, по суті є баластом і повинні бути позначені для кодування з найнижчою можливою якістю, на відміну від важливих областей, які повинні бути передані з кращою якістю.

Це представляє три виклики: чи може процес бути виконаний досить швидко, щоб досягти прийнятної затримки без використання енергозатратних локальних обчислювальних ресурсів? Чи може бути встановлено оптимальне співвідношення між частотою кадрів і якістю? І чи може модель бути швидко навчена для окремої серверної DNN?

Логістика навчання

Ідеально, комп’ютерний кодек бачення буде попередньо навчений на підключених системах до точних вимог конкретної нейронної мережі. Модуль AccGrad, однак, може бути безпосередньо отриманий з DNN лише за дві прямих пропагації, що економить десять разів стандартної витрати.

AccMPEG навчає AccGrad лише за 15 епох 3 пропагацій кожна через кінцеву DNN і потенційно може бути перенаукований ‘в реальному часі’ за допомогою свого поточного стану моделі як шаблону,至少 для подібних завдань CV.

AccModel використовує попередньо навчений MobileNet-SSD екстрактор особливостей, загальний в доступних пристроях краю. При обертанні 12 GFLOPS модель використовує лише одну третину підходів ResNet18. Окрім пакетної нормалізації та активації, архітектура складається лише з конволюційних шарів, а її обчислювальна витрата пропорційна розміру кадру.

AccGrad усуває потребу в кінцевій інференції DNN, покращуючи логістику розгортання.

AccGrad усуває потребу в кінцевій інференції DNN, покращуючи логістику розгортання.

Частота кадрів

Архітектура працює оптимально при 10 кадрах в секунду, що робить її придатною для цілей, таких як моніторинг сільського господарства, спостереження за деградацією будівель, аналіз трафіку з висоти і представницька інференція скелета на рух людини; однак дуже швидко рухомі сценарії, такі як низький аналіз трафіку (автомобілів або людей), і інші ситуації, в яких високі частоти кадрів є корисними, не підходять для цього підходу.

Частина методу полягає в тому, що сусідні макроблоки, ймовірно, будуть мати подібну вартість, аж до моменту, коли макроблок падає нижче оціненої точності. Області, отримані цим підходом, більш чітко визначені і можуть бути обчислені з більшою швидкістю.

Покращення продуктивності

Дослідники протестували систему на платі Jetson Nano вартістю 60 доларів з одним 128-ядерним процесором Maxwell GPU і іншими дешевими еквівалентами. OpenVINO було використано для компенсації частини енергетичних вимог дуже розріджених локальних DNN на ЦП.

Сам AccModel спочатку був навчений офлайн на сервері з 8 графічними процесорами GeForce RTX 2080S. Хоча це є потужним масивом обчислювальної потужності для початкового навчання моделі, легке перенауковання, яке система робить можливим, і спосіб, яким модель може бути调整 до певних параметрів толерантності по різних DNN, які виконують подібні завдання, означають, що AccMPEG може бути частиною системи, яка потребує мінімальної уваги в дикій природі.

 

Перша публікація 1 травня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai