Andersonの視点
AI分析用のビデオコーデック

テクノスリラーの『The Circle』(2017年)は、外部ビデオ分析の実用性よりも、ソーシャルネットワークの倫理的意味合いについてコメントしたものですが、物語の中央にある「SeeChange」という不可能に小さなカメラが、映画を本当の意味で「サイエンスフィクション」のカテゴリに入れることになります。

テクノスリラー『The Circle』の「SeeChange」カメラ/監視装置。
この無線で自由に動く装置は大きな丸玉の大きさですが、太陽電池パネルがなく、他の周囲の源(たとえばラジオ波)から電力を得ることができないという点では、実現不可能なものではありません。しかし、24時間ずっとビデオを圧縮する必要があるという点で、実現不可能なものです。
このような安価なセンサーの電力を供給することは、特にコンピュータビジョン(CV)とビデオ分析の分野で、都市環境以外の環境でセンサーが限られた電力資源(バッテリー、太陽電池など)から最大のパフォーマンスを引き出す必要があるため、研究の重要な分野です。
このようなエッジIoT/CVデバイスが画像コンテンツを中央サーバーに送信する必要がある場合(通常、従来のセルコバーネットワークを介して)、選択肢は限られています。デバイスは、サーバーサイドの処理のために最適化されたデータセグメントのみを送信するために、軽量のニューラルネットワークをローカルで実行する必要があります。そうでない場合、クラウドリソースが評価するために「ダム」ビデオを送信する必要があります。
イベントベースのSmart Vision Sensors(SVS)を介したモーションアクティベーションはこのオーバーヘッドを削減できますが、このアクティベーションモニタリングもエネルギーを消費します。
権力を握る
さらに、活発化がまれである場合(たとえば、時々羊が見えます)、デバイスはギガバイトの非圧縮ビデオを送信するのに十分な電力を持ちません。人気のあるビデオ圧縮コーデックであるH.264/5も、プラグインされているハードウェアまたは次の充電セッションから遠くないハードウェアを期待しています。

3つの典型的なコンピュータビジョンタスクのビデオ分析パイプライン。ビデオエンコードアーキテクチャは、タスクと、データを受け取るニューラルネットワークに合わせてトレーニングする必要があります。 ソース:https://arxiv.org/pdf/2204.12534.pdf
広く普及しているH.264コーデックは、後継のH.265よりもエネルギー消費が低いですが、圧縮効率が悪い。後継のH.265は、圧縮効率が高いですが、電力消費が高い。GoogleのオープンソースVP9コーデックは、両方の面で優れていますが、ローカル計算リソースが高いため、安価なIoTセンサーでは追加の問題が生じます。
ローカルでストリームを分析する場合、軽量なローカルニューラルネットワークを実行して、どのフレーム(またはフレームの領域)がサーバーサイドのDNNに送信する価値があるかを判断するために、すでに電力を消費しています。

グリッド接続されていないセンサーで家畜のマスク化された表現を抽出します。限られた電力容量を、ローカルセマンティックセグメンテーションに軽量ニューラルネットワークを使用して、サーバーに制限された情報を送信するために使用しますか?(待ち時間を導入します)。または「ダム」データを送信しますか?(帯域幅を浪費します)。 ソース:https://arxiv.org/pdf/1807.01972.pdf
「野生」のコンピュータビジョンプロジェクトでは、特定のニューラルネットワークの要件に最適化された専用のビデオ圧縮コーデックが必要です。セマンティックセグメンテーション、キーポイント検出(人間の動き分析)、オブジェクト検出など、さまざまなタスクで使用されます。
ビデオ圧縮効率と最小のデータ転送の完璧なトレードオフを実現できれば、SeeChangeに近づき、厳しい環境で安価なセンサーネットワークを展開できるようになります。
AccMPEG
シカゴ大学の新しい研究は、AccMPEGという形で、ローカルコンピューティング要件が非常に低く、サーバーサイドのDNNに対する高精度と低遅延を実現する、革新的なビデオエンコードとストリーミングフレームワークを開発しました。

AccMPEGのアーキテクチャ。 ソース:https://arxiv.org/pdf/2204.12534.pdf
このシステムは、各16x16pxのマクロブロックがサーバーサイドのDNNの精度にどれだけ影響を与えるかを評価することで、以前の方法よりも経済性を実現します。以前の方法では、各ピクセルまたはローカル操作の精度を評価する必要がありました。
AccMPEGでは、この精度は、AccGradというカスタムモジュールで推定されます。これは、マクロブロックのエンコード品質が、サーバーサイドのDNNのエンドユーザーケース(たとえば、人を数える、人間の動きのスケルトン推定など)にどれだけ関連しているかを測定します。
ビデオフレームがシステムに入ると、AccMPEGは、AccModelという安価な品質セレクターモデルでそれを処理します。サーバーサイドのDNNの有用な計算に貢献しそうにない領域は、基本的に不要なものであり、最低の品質でエンコードする必要があります。一方、関連する領域は、より高い品質で送信する必要があります。
トレーニングロジスティクス
理想的には、コンピュータビジョンコーデックは、プラグインされているシステムで、特定のニューラルネットワークの要件に合わせて事前にトレーニングされる必要があります。ただし、AccGradモジュールは、DNNから直接導出でき、標準のオーバーヘッドの10分の1で実現できます。
AccMPEGは、AccGradを最終的なDNNの3つの伝播ごとに15エポックでトレーニングし、同じタスクの類似したCVタスクのために「ライブ」で再トレーニングすることもできます。
AccModelは、普及しているMobileNet-SSDフィーチャー抽出器を使用します。これは、安価なエッジデバイスで一般的です。12 GFLOPSのターンオーバーで、モデルは典型的なResNet18アプローチの3分の1しか使用しません。バッチ正規化と活性化以外に、アーキテクチャは畳み込み層のみで構成され、計算オーバーヘッドはフレームサイズに比例します。

AccGradは、展開ロジスティクスを改善するために、最終的なDNN推論の必要性を排除します。
フレームレート
アーキテクチャは10fpsで最適に実行され、農業モニタリング、建物の劣化監視、高視点交通分析、人間の動きのスケルトン推定などに適しています。ただし、低視点交通(車や人)や、高フレームレートが有益な他のシナリオでは、このアプローチは適していません。
この方法の節約の一部は、隣接するマクロブロックが、推定精度が低くなるまで、同じ価値を持つ可能性が高いという前提に基づいています。得られた領域は、より明確に定義され、より高速に計算できます。
パフォーマンスの向上
研究者は、$60のJetson Nanoボードと単一の128コアMaxwell GPU、およびその他の安価な同等のボードでシステムをテストしました。OpenVINOは、非常に疎なローカルDNNのエネルギー要件の一部をCPUにオフセットするために使用されました。
AccModel自体は、8つのGeForce RTX 2080S GPUを搭載したサーバーでオフラインでトレーニングされました。初期モデルの構築には、強力な計算能力が必要ですが、システムが可能にする軽量な再トレーニングと、さまざまなDNNにわたる特定の許容パラメータにモデルを調整する能力は、AccMPEGが「野生」で最小限の介入を必要とするシステムの一部になることを意味します。
First published 1st 2022年5月.












