Andersonův úhel
Video kodek navržen pro analýzu umělou inteligencí

Přestože techno-thriller The Circle (2017) je více komentářem k etickým implikacím sociálních sítí než praktickým využitím externí video analýzy, je to neuvěřitelně malá kamera ‘SeeChange’ uprostřed děje, která skutečně posouvá film do kategorie ‘sci-fi’.

Kamera/sledovací zařízení ‘SeeChange’ z techno-thrilleru ‘The Circle’ (2017).
Bezdrátová a volně pohyblivá zařízení o velikosti velké korále, není to absence solárních panelů nebo neefektivita čerpání energie z jiných okolních zdrojů (jako jsou rádiové vlny), co činí SeeChange nepravděpodobným, ale fakt, že bude muset komprimovat video 24/7, na základě skromného náboje, který je schopno udržet.
Pohon levných senzorů tohoto typu je jádrem výzkumu v počítačovém vidění (CV) a video analýze, zejména v neurbánních prostředích, kde senzor bude muset získat maximum výkonu z velmi omezených energetických zdrojů (baterie, solární atd.).
V případech, kdy takové hraniční IoT/CV zařízení musí odesílat obrazový obsah na centrální server (často prostřednictvím konvenčních buněčných sítí), jsou možnosti omezené: buď zařízení musí lokálně spustit nějaký lehký neuronový síť, aby odeslalo pouze optimalizované segmenty relevantních dat pro zpracování na serveru; nebo musí odesílat ‘hloupé’ video pro vyhodnocení cloudových zdrojů.
Přestože aktivace prostřednictvím událostí založených na chytrých vizuálních senzorech (SVS) může snížit tuto zátěž, tato aktivace také stojí energii.
Držení se moci
Dále, i když je aktivace méně častá (tj. ovce občas vstoupí do zorného pole), zařízení nemá dostatek energie, aby odeslalo gigabajty nekomprimovaného videa; nemá také dostatek energie, aby neustále běžel populární video kodeky, jako jsou H.264/5, které očekávají hardwarový prostředek, který je buď zapojen, nebo není daleko od dalšího nabíjení.

Video analytické potrubí pro tři typické úkoly počítačového vidění. Architektura video kódování musí být vyškolena pro úkol, a obvykle pro neuronovou síť, která bude přijímat data. Zdroj: https://arxiv.org/pdf/2204.12534.pdf
Přestože široce rozšířený kodek H.264 má nižší spotřebu energie než jeho nástupce H.265, má špatnou kompresní efektivitu. Jeho nástupce, H.265, má lepší kompresní efektivitu, ale vyšší spotřebu energie. Zatímco open-source kodek Google VP9 překonává oba v každé oblasti, vyžaduje vyšší lokální výpočetní zdroje, což představuje další problémy v levném IoT senzoru.
Co se týče lokální analýzy: ve chvíli, kdy spustíte i ten nejjednodušší lokální neuronový síť, abyste určili, které rámečky (nebo oblasti rámečku) jsou hodné odeslání na server, často jste již spotřebovali energii, kterou byste ušetřili, kdyby jste odeslali všechny rámečky.

Extrahování maskovaných reprezentací dobytka se senzorem, který je nepravděpodobně připojen k síti. Má-li senzor utratit omezenou kapacitu energie na lokální semantickou segmentaci s lehkým neuronovým sítě; nebo na odeslání omezených informací na server pro další instrukce (zavádějící latenci); nebo na odeslání ‘hloupých’ dat (plýtvající energií na šířku pásma)? Zdroj: https://arxiv.org/pdf/1807.01972.pdf
Je zřejmé, že ‘v divočině’ počítačové vidění projekty potřebují věnované video kompresní kodeky, které jsou optimalizovány pro požadavky specifických neuronových sítí napříč specifickými a rozmanitými úkoly, jako je semantická segmentace, detekce klíčových bodů (analýza lidského pohybu) a detekce objektů, mezi dalšími možnými koncovými použitími.
Jestliže můžete získat dokonalou rovnováhu mezi video kompresní efektivitou a minimálními datovými přenosy, jste o krok blíže k SeeChange a schopnosti nasadit dostupné senzorové sítě v nepříznivých prostředích.
AccMPEG
Nový výzkum z Chicagské univerzity může mít učinil krok blíže k takovému kodeku, ve formě AccMPEG – novém video kodekovacím a streamovacím rámci, který funguje s nízkou latencí, vysokou přesností pro serverové hluboké neuronové sítě (DNN) a který má pozoruhodně nízké lokální výpočetní nároky.

Architektura AccMPEG. Zdroj: https://arxiv.org/pdf/2204.12534.pdf
Systém je schopen dělat úspory nad předchozími metodami tím, že hodnotí rozsah, v jakém každý 16x16px makroblock pravděpodobně ovlivní přesnost serverové DNN. Předchozí metody měly obecně hodnotit tuto přesnost na základě každého pixelu v obraze nebo provést elektricky drahé lokální operace, aby určily, které oblasti obrazu by mohly být nejzajímavější.
V AccMPEG, tato přesnost je odhadnuta v přizpůsobeném modulu nazvaném AccGrad, který měří způsoby, jakými kvalita kódování makroblocku pravděpodobně bude relevantní pro koncový případ použití, jako je serverová DNN, která se snaží počítat lidi, provádět skeletovou estimaci lidského pohybu nebo jiné běžné úkoly počítačového vidění.
Jako rámec videa přichází do systému, AccMPEG inicializuje jej prostřednictvím levného kvalitního selektoru modelu, nazvaného AccModel. Jakékoli oblasti, které nejsou pravděpodobně přispívat k užitečným výpočtům serverové DNN, jsou vlastně zbytečností a měly by být označeny pro kódování na nejnižší možnou kvalitu, na rozdíl od významných oblastí, které by měly být odeslány na lepší kvalitu.
Tento proces představuje tři výzvy: zda lze proces provést dostatečně rychle, aby se dosáhlo přijatelné latence bez použití energeticky náročných lokálních výpočetních zdrojů; zda lze stanovit optimální vztah mezi frekvencí rámců a kvalitou; a zda lze model rychle vyškolit pro individuální serverovou DNN.
Školení logistiky
Ideálně by počítačový vidění kodek měl být předškolena na zapojených systémech na přesně stanovené požadavky specifické neuronové sítě. Modul AccGrad však může být přímo odvozen z DNN s pouze dvěma vpřed propagacemi, při úspoře desetinásobku standardního režimu.
AccMPEG školuje AccGrad pro pouhých 15 epoch tří propagací každá přes konečnou DNN a může potenciálně být školen ‘naživu’ pomocí současného modelového stavu jako šablony, alespoň pro podobně specifikované úkoly CV.
AccModel používá předškolena MobileNet-SSD extraktor funkcí, běžný v dostupných hraničních zařízeních. Při obratu 12 GFLOPS model používá pouze třetinu typických přístupů ResNet18. Kromě batch normalizace a aktivační funkce, architektura se skládá pouze z konvolučních vrstev a jeho výpočetní režijní náklady jsou proporcionální k velikosti rámečku.

AccGrad odstraňuje potřebu konečné DNN inference, zlepšuje nasazení logistiky.
Frekvence rámců
Architektura běží optimálně na 10fps, což by ji učinilo vhodnou pro účely, jako je monitoring zemědělství, monitoring degradace budov, analýza dopravy z výšky a reprezentativní skeletová inference v lidském pohybu; nicméně, velmi rychle se pohybující scénáře, jako je analýza dopravy z nízké výšky (auta nebo lidi), a další situace, ve kterých jsou vysoké frekvence rámců prospěšné, nejsou vhodné pro tento přístup.
Část metody spoří díky předpokladu, že sousední makroblocky jsou pravděpodobně podobné hodnoty, až do bodu, kdy makroblock klesne pod odhadovanou přesnost. Oblasti získané touto metodou jsou jasněji vymezeny a mohou být vypočteny při vyšší rychlosti.
Zlepšení výkonu
Výzkumníci otestovali systém na $60 Jetson Nano desce s jedním 128-jádrovým Maxwell GPU a různých dalších levných ekvivalentů. OpenVINO byl použit k offsetu některých energetických požadavků velmi řídkých lokálních DNN na CPU.
AccModel sám byl původně školen offline na serveru se 8 GeForce RTX 2080S GPU. Přestože je to formidabilní pole výpočetní síly pro počáteční modelovou build, lehké přeškolování, které systém umožňuje, a způsob, jakým lze model upravit na určitá tolerance parametrů napříč různými DNN, které útočí na podobné úkoly, znamená, že AccMPEG může tvořit část systému, který potřebuje minimální údržbu v divočině.
Poprvé publikováno 1. května 2022.












