Andersonの視点
1970年代のビブにエネルギーを節約するAIモニタリング

新しい研究によると、ほとんどのビデオAIはカラーが必要なく、重要な瞬間のみにカラーをオンにし、データ使用量を90%以上削減しながら精度の低下は少なくすることができる。
リモートストリーミングカメラやその他の無線、バッテリー駆動のビデオデバイスは、最適化されたモニタリング設定を必要とする。これらは不安定な電源、たとえば太陽光や定期的な充電、または人が介在しない状況での他の形式の人為的介在に依存する可能性がある。
この研究と並行して、カメラ付きのウェアラブルデバイスへの関心も高まっている。これらはすでに電力と計算の制限によって厳しく制約されていたが、エッジAIはこれらをより有用にできる。
これらの考慮を超えて、エッジAIとモニタリングのコストを削減する長期的な動機(特に顧客に節約を渡さなくてもよい場合)が、エッジのユースケースのエネルギー節約アプローチにおける革新を主張する。
サウンドオフ
ストリーミングビデオセンシングの分野では、リソースに乏しいエッジモニタリングデバイスは、可能な限り最小のエネルギーを使用しながら、「興味深い」イベントを監視するために十分な電力を使用する必要がある。
実質的には、これは動きによって駆動される照明と同じユースケースである。低電力消費センサーが誰かがそこにいることを検知すると、照明が点灯する。
オーディオモニタリングと圧縮はビデオよりもはるかにリソース消費が少ないため、最近のいくつかのアプローチは、注意を「オン」にするためにサウンド駆動のキューシステムを使用しようとした。Listen to LookやEgotriggerなどのフレームワークは、

Egotriggerシステムでは、オーディオ駆動のトリガーがハンドオブジェクトの相互作用のキューシステムから画像のキャプチャを選択的にアクティベートし、冗長なフレームを削減しながら、リソース制約のあるスマートグラスシステムでのエピソード記憶のパフォーマンスを維持する。 ソース
明らかに、オーディオは視覚的なイベントを検索するための理想的な媒体ではない。多くの重要なイベントはオーディオキューやエッジマイクの範囲外で発生する可能性がある。
ライトスリーパー
新しい論文によると、ビデオストリームがAIと協力してリソースを増やし、監視対象のイベントが発生すると、よりよいアプローチになる可能性がある。以下のシミュレーションは、この概念の概要を示している。最低信号レベルで低解像度のモニタリングが維持され、イベントのトリガーによって解像度が増加する。
望ましい動作のシミュレーション – ストリーミングと分析がデフォルトで最低のリソース消費レベルで実行され、興味深いまたは探しているイベントがグレースケールストリームで検出されると、リソース消費が増加する。この黒と白の監視スタイルは「レトロ」かもしれないが、これから来るものの兆しである。このビデオは、論文のアイデアを読者に示すために作成されたものである。 ソース:
新しい研究は、学術的な協力であり、イギリスのさまざまな機関とHuaweiが参加している。エッジモニタリング用に、トレーニング不要のAIファシリテーション、グレースケール常時、カラーオンデマンドスキーマを提案している。
ストリーミングビデオ理解のベンチマークでは、新しいシステムは、91.6%のフルカラーベースラインパフォーマンスを達成しながら、RGBフレームの使用量を8.1%に抑えることができた。

モデルがグレースケールのビデオのみを見ている場合、重要な詳細を混同し、間違った答えを出しますが、カラーを適切な時点でトリガーすると、画像を明確にし、カラーに依存するタスクで発生するミスを修正します。 ソース
論文のタイトルは「Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing」であり、クイーンメアリー大学ロンドン、ダラム大学、イギリスの帝国大学、Huawei Noah’s Ark Labの8人の研究者によるものである。この論文にはプロジェクトページもある。
方法
新しいシステムでは、ColorTriggerは常に低帯域幅のグレースケール監視を維持することで、時間的構造を保存する。因果的オンライントリガーは、低解像度ストリームのスライディングウィンドウ(特定の時間のフレームの柔軟なプラスマイナス範囲)を分析する。

連続的な高解像度RGBキャプチャは電力を急速に消費するため、早期に録音が停止し、重要な瞬間が見逃される可能性がある。一方、ColorTriggerは常に低電力のグレースケールストリームを実行し、選択された瞬間のみRGBカメラをアクティベートすることで、録音時間を延長しながら、後で質問する必要がある視覚的な詳細をキャプチャする。 ソース
システムが「受動」モード(トリガーイベントがまだ検出されていない)にある場合、ダイナミックトークンルーターは、限られた容量を非対称デコーダーに割り当て、常に冗長性と新規性を探している。イベントが発生すると、トークンフローは容量を圧縮よりも優先する。

ColorTriggerのスキーマ。システムは最近のフレームのスライディングウィンドウ分析を使用して冗長性と変化を検出し、必要な場合にのみ高解像度RGBキャプチャをトリガーする。ダイナミックトークンルーターは、グレースケール入力に少ないトークンを割り当て、選択されたRGBフレームに多くのトークンを割り当て、下流のマルチモーダルラージランゲージモデル(MLLM)処理のために時間的順序を維持する。
フレームごとに、システムは現在のフレームが新しい情報を含み、カラーをキャプチャするコストに見合うかどうかを決定する必要がある。スライディングウィンドウ内の最近のグレースケールフレームの短い履歴により、ColorTriggerは現在のフレームをその即時の過去と比較できる。
この比較プロセスは、各フレームが他のフレームとどれだけ重なり合っているかを要約する構造に組織化され、実質的にシーンが繰り返されるか変化するかを捉える。軽量な最適化ステップは、フレームごとに新規性を優先する重要性スコアを割り当てます。
カラーバランス
カラーの過度な使用を防ぐために、単純な「クレジットシステム」がカラーをトリガーする頻度を制限する。クレジットは徐々に蓄積され、カラーが要求されたときに使用される。フレームは、情報があってクレジットが十分にある場合にのみ、カラーに「アップグレード」される。
ダイナミックトークンルーターは、各フレームにどれだけの詳細を与えるかを制御する。重要なものが検出されない場合、グレースケールフレームは低解像度のままとなり、小さな圧縮されたトークンのセットになる。重要な瞬間が検出されると、システムはカラーに切り替え、フレームを高解像度で処理し、より豊かで詳細な表現を提供する。
両方のタイプのフレームは同じモデルを通過するが、グレースケールフレームはより軽量な方法で処理され、選択されたカラーフレームはより多くの注意を払われる。出力は元の順序で結合され、モデルに連続したストリームとして送信される。
ほとんどのフレームが軽量のままで、わずかなフレームのみがアップグレードされるため、システムは大量の計算を節約しながら、重要な詳細をキャプチャする。

論文からのもう1つの例。システムは一時的にリソースを増やす必要がある色を区別する。
データとテスト
システムをテストするために、研究者はStreamingBenchとOVO-Benchのビデオベンチマークを使用し、将来のコンテンツの処理(オフラインテストにおける潜在的な危険)を避けた。
使用されたマルチモーダルラージランゲージモデル(MLLM)は、InternVL3.5-8B-Instructで、因果的トリガーはCLIP ViT-B/16を介して実装された。
グレースケールストリームは、CIELAB色空間の明度チャンネルに制限され、224x224pxにリサイズされた後、パッチ化(モデルが個別のユニットとして処理できる固定サイズのブロックに画像を分割すること)された。
RGBフレームは、より高いビットレートで処理され、448x448pxで256トークンを生成し、グレースケールフレームの64トークンと比較された。
一般的な最適化ツールが使用された。CVXPY(Pythonの最適化問題設定ライブラリ)とOSQP Solver(トークンを計算する高速なアルゴリズム)である。
ビデオは1fpsで処理され、クリップごとに128フレームの制限が設けられ、計算を低く維持するために使用された。
テストされた独自システムは、Gemini 1.5 Pro、GPT-4o、Claude 3.5 Sonnetであった。テストされたオープンソースビデオMLLMは、LLaVA-OneVision-7B、Video-LLaMA2-7B、Qwen2.5-VL-7Bであった。
テストされたストリーミングMLLMは、Flash-VStream-7B、VideoLLM-online-8B、Dispider-7B、TimeChat-Online-7Bであった。
InternVL-3.5-8BとQwen3-VL-8Bは、StreamingBenchに関する最初の結果テーブルで、さまざまな構成でテストされた。

ストリーミングベンチマークのリアルタイムビジュアル理解タスクのパフォーマンス。独自、オープンソース、ストリーミングMLLMを、さまざまなカラーバジェットで比較する。RGB(%)は、トリガー後にカラーで保持されるフレームの割合を示し、100はフルカラー、0はグレースケールのみ入力を示す。ColorTriggerは、8.1%と34.3%のカラーフレームを保持する2つの運用点で評価され、グレースケールInternVL-3.5-8Bベースラインよりも全体的な精度が向上し、フルカラーセットアップよりもカラー使用量が大幅に削減された。
ここで著者は以下のように述べている。
‘ColorTriggerは、StreamingBenchのリアルタイムビジュアル理解サブタスクで競合するパフォーマンスを達成します。 ‘
‘私たちのモデルは、34.3%のRGBフレームで75.24をスコアし、最近のオンラインモデルDispider-7Bを上回り、TimeChat-Online-7Bに近いパフォーマンスを示し、独自モデルGemini 1.5 Pro(75.69)を超え、GPT-4o(73.28)とClaude 3.5 Sonnet(72.44)を上回ります。 ‘
InternVL-3.5-8Bは、フルカラーで77.20をスコアし、ColorTriggerは65.7%少ないRGBフレームで75.24を達成し、グレースケールベースラインの62.08を8.64%上回り、他のストリーミングモデルと競合するパフォーマンスを示した。
次に、OVO-Benchがテストされた。

OVO-Benchの3つのカテゴリ(リアルタイムビジュアルパーセプション、バックワードトレーシング、フォワードアクティブレスポンス)におけるパフォーマンス。独自、オープンソース、ストリーミングMLLMを、さまざまなカラーバジェットで比較する。RGB(%)は、トリガー後にカラーで保持されるフレームの割合を示し、100はフルカラー、0はグレースケールのみ入力を示す。ColorTriggerは、7.1%と33.1%のカラーフレームを保持する2つの運用点で評価され、グレースケールInternVL-3.5-8Bベースラインよりも全体的な精度が向上し、フルカラーセットアップよりもカラー使用量が大幅に削減された。
著者は以下のように述べている。
‘私たちのモデルは、33.1%のRGBフレームで52.5のスコアを達成し、ほとんどの既存のオープンソースオンラインMLLMを上回ります。 ‘
‘フルRGB入力のInternVL-3.5-8B(57.7)と比較して、ColorTriggerは52.5のスコアを達成し、RGBフレームの使用量を66.9%削減し、わずか5.2ポイントのパフォーマンス低下を示した。 ‘
リアルタイムビジュアルパーセプションは65.2に達し、グレースケールのみのベースライン53.8より11.4ポイント上回った。RGBフレームを7.1%に制限した場合(92.9%の削減)、ColorTriggerは50.4のスコアを維持し、グレースケール設定より2.5ポイント上回った。
最後に、研究者はオフラインビデオタスク(長期ビデオ理解のためのVideo-MMEベンチマーク)に対するテストを実施した。

Video-MMEベンチマークでのパフォーマンスの比較。
このテストでは、モデルは37.6%のRGBフレームを使用し、フルカラーのInternVL-3.5-8Bベースラインスコア65.6を上回り、66.1のスコアを達成した。
著者は以下のように述べている。
‘これは、適応的なトリガーメカニズムが計算コストを削減するだけでなく、重要な瞬間にRGB容量を集中させることで実際にパフォーマンスを向上させることができることを示しています。 ‘
‘特に、ColorTriggerはTimeChat-Online-7B(62.4)やDispider-7B(57.2)を上回り、長期ビデオ理解における連続的なグレースケールコンテキストと選択的なRGB取得の組み合わせの有効性を確認しています。 ‘
結論
私はこのような革新を目にするのがとても楽しい。AIの高い電力需要は長い間悲惨な見出しを生み出してきたが、この問題に対処する研究を見るのはよいことだ。
商業的な考慮がこのような節約を生み出す動機であることを知るのは、皮肉なことに安心できる。なぜなら、これらの節約は短期的な政治的決定よりも、エネルギー節約や地球温暖化に関するより高尚だが脆い懸念よりも影響を受けにくいからだ。幸いなことに、同じ目的が異なる理由で達成される。
* 読者に論文のアイデアを示すために作成されたもの。
2026年3月26日初めて公開。












