Anderson의 관점
1970년대 분위기의 에너지 절약형 AI 모니터링

새로운 연구에 따르면 대부분의 비디오 AI는 색상을 전혀 필요로하지 않으며 중요한 순간에만 색상을 켜고 데이터 사용량을 90% 이상 줄여도 정확도에 큰 손실이 없다는 것이 밝혀졌습니다.
원격 스트리밍 카메라와 기타 무선, 배터리 구동 비디오 장치는 최적화된 모니터링 설정을 요구하며 이는 불안정한 전원源, 예를 들어 태양열이나 주기적인 충전이 필요한 상황에서 이상적으로는 아무도 출席할 필요가 없는 상황에서 발생할 수 있습니다.
이 연구와 함께, 카메라가 장착된 웨어러블 기기의 관심도 증가하고 있습니다. (이러한 장치는 이미 전력과 컴퓨팅 제한으로 엄격하게 제한되었음에도 불구하고) 에지 AI는 이러한 장치를 훨씬 더 유용하게 만들 수 있는 잠재력을 가지고 있습니다.
이러한 고려 사항을 넘어서서, 에지 AI 및 모니터링 비용을 줄이려는 장기적인 동기는(특히 이러한 절약이 고객에게 전달될 필요가 없는 경우) 에너지 절약 접근 방식을 위한 강력한 논리를 제공합니다.
사운드 오프
스트리밍 비디오 감지 분야에서 자원 제한이 있는 에지 모니터링 장치는 가능한 최소의 에너지를 사용해야 하며 동시에 ‘흥미로운’ 이벤트를 모니터링하기 위해 충분한 전력을 소비해야 합니다.
실제로 이것은 운동에 의한 조명과 유사한 사용 사례입니다. 저전력 구동 센서가有人이 있다는 것을 감지할 때만 조명을 제공합니다.
오디오 모니터링 및 압축은 비디오보다 훨씬 더 자원 효율적이므로 최근 몇 년 동안 여러 접근 방식이 제한된 시스템에서 주의를 ‘켜기’ 위한 사운드 기반 큐를 사용하려고 시도했습니다. Listen to Look 및 Egotrigger와 같은 프레임워크:

Egotrigger 시스템에서 오디오 기반 트리거는 손-객체 상호작용 큐에서 이미지 캡처를 선택적으로 활성화하여 중복 프레임을 줄이고 자원 제한 스마트 글래스 시스템에서 에피소드 기억 성능을 유지합니다. 출처
오디오는 시각적 이벤트를 검색하기에 이상적인 매체는 아닙니다. 많은 중요한 이벤트에는 오디오 큐가 없거나 에지 마이크의 범위 밖에 발생할 수 있습니다.
라이트 슬리퍼
새로운 논문에 따르면, 비디오 스트림이 이벤트가 발생할 때 리소스를 증가시키기 위해 AI와 함께 작동할 수 있는 것이 더 좋을 것입니다. 아래 시뮬레이션은 이 개념에 대한 일반적인 아이디어를 제공합니다. 낮은 해상도 모니터링은 객체 감지 프레임워크가 작동하는 데 필요한 최소 신호 수준을 유지하며 시스템이 이벤트가 발생했을 때 해상도를 증가시키도록 지시합니다.
원하는 동작의 시뮬레이션 – 스트리밍 및 분석이 기본적으로 가장 낮은 리소스 소비 수준에서 작동하며 ‘흥미로운’ 또는 검색된 이벤트가 감지되면 더 많은 리소스를 소비합니다. 흑백 감시 스타일은有点 ‘레트로’지만 앞으로 올 수 있습니다. 이 비디오는 논문의 핵심 아이디어를 설명하기 위해 작성되었습니다. 출처:
새로운 연구는 학술 협력을 통해 영국의 여러 기관과 화웨이에서 제안된 에지 모니터링을 위한 훈련이 없는 AI 기반의 그레이스케일-언제나, 색상-요청에-의한 스키마입니다. 이 스키마는 ‘키 이벤트’가 발생하지 않을 때 저전력 토큰 사용을 운영하도록 설계되었으며 이벤트期间에만 소비를 증가시킵니다.
스트리밍 비디오 이해 벤치마크에서 새로운 시스템, 즉 ColorTrigger는 91.6%의 전체 색상 기준 성능을 달성했으며 RGB 프레임의 8.1%만 사용했습니다.

모델이 그레이스케일 비디오만 볼 때 중요한 세부 사항을 혼동하고 잘못된 답변을 제공하지만 색상을 트리거하는 적절한 순간에 색상을 트리거하면 이미지의 오류를 수정하고 색상에 의존하는 작업에서 오류를 수정합니다. 출처
새로운 논문은 Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing라는 제목으로 여덟 명의 연구자들에 의해 작성되었습니다. 이 논문에는 ColorTrigger 프로젝트 페이지도 있습니다.
방법
새로운 시스템에서 시간적 구조를 보존하기 위해 ColorTrigger는 저전력 그레이스케일 감시를 유지합니다. 인과적인 온라인 트리거는 특정 시간(예: 이벤트 트리거 감지) 주변의 프레임(유연한 플러스-마이너스 범위)의 슬라이딩 윈도우를 분석합니다.

연속적인 고해상도 RGB 캡처는 전력을 빠르게 소모하여 녹화가 일찍 중단되고 중요한 순간이 놓칠 수 있습니다. 반면에 ColorTrigger는 항상 저전력 그레이스케일 스트림을 유지하며 선택된 순간에만 RGB 카메라를 활성화하여 녹화 시간을 연장하고 필요한 시각적 세부 사항을 캡처합니다. 출처
시스템이 ‘수동’ 모드(즉, 아직 트리거 이벤트를 식별하지 않은 경우)에서 동적 토큰 라우터는 제한된 용량을 비대칭 디코더에 할당하며 항상冗余와 새로운 이벤트를 찾고 있습니다.

ColorTrigger 스키마. 시스템은 최근 프레임의 슬라이딩 윈도우 분석을 통해冗余와 변경을 감지하며 필요할 때만 고해상도 RGB 캡처를 트리거합니다. 동적 토큰 라우터는 그레이스케일 입력에 더 적은 토큰을 할당하고 선택된 RGB 프레임에 더 많은 토큰을 할당하여 다운스트림 멀티모달 대규모 언어 모델(MLLM) 처리를 위한 시간적 순서를 유지합니다.
프레임별로 시스템은 현재 순간에 새로운 정보가 포함되어 있는지, 색상을 캡처하는 비용을 지불할 가치가 있는지 결정해야 합니다. 슬라이딩 윈도우의 최근 그레이스케일 프레임의 짧은 역사로 ColorTrigger는 현재 프레임을 즉각적인 과거와 비교할 수 있습니다.
이 비교 과정은 각 프레임이 다른 프레임과 얼마나 겹치고 다른지 요약하는 구조로 조직되며, 즉 장면이 반복되는지 변경되는지 캡처합니다. 경량 최적화 단계는 윈도우의 각 프레임에 중요도 점수를 할당하며 새로운 것을 선호합니다.
색상 균형
색상을过度 사용하지 않도록 단순한 ‘신용 시스템’이 시간 경과에 따라 색상을 트리거하는 빈도를 제한합니다. 신용은 점진적으로 축적되며 색상을 요청할 때 사용되므로 활동의 버스트가 허용되지만 전체 사용량은 제어됩니다. 프레임은 정보가 포함되어 있고 충분한 신용이 있는 경우에만 색상으로 ‘업그레이드’됩니다.
동적 토큰 라우터는 각 프레임에 할당된 세부 사항의 양을 제어합니다. 중요하지 않은 경우 그레이스케일 프레임은 저해상도이고 압축된 토큰 세트로 유지되며 중요할 때 시스템은 색상으로 전환하고 더 높은 해상도로 처리하여 보다 풍부한 세부 사항을 제공합니다.
두 유형의 프레임은 동일한 모델을 통해 처리되지만 그레이스케일 프레임은 더 가볍게 처리되며 선택된 색상 프레임에는 더 많은 주의가 집중됩니다. 출력은 원래 순서로 결합되어 모델에 연속적인 스트림으로 전송됩니다.
대부분의 프레임이 경량으로 유지되고 몇 개만 업그레이드되므로 시스템은 많은 계산을節約하면서 중요한 세부 사항을 캡처할 때만 색상을 사용합니다.

논문에서 시스템이 색상을 구별하기 위해 일시적으로 리소스를 증가시켜야 하는 또 다른 예입니다.
데이터 및 테스트
시스템을 테스트하기 위해 연구자들은 StreamingBench 및 OVO-Bench 비디오 벤치마크를 사용하여 오프라인 테스트에서 미래 콘텐츠를 처리하지 않도록 했습니다.
사용된 Multimodal Large Language Model(MLLM)은 InternVL3.5-8B-Instruct이며, 인과적인 트리거는 CLIP ViT-B/16을 통해 구현되었습니다.
그레이스케일 스트림은 CIELAB 색상 공간의 명도 채널로 제한되었으며, 이전 연구에 따라 그레이스케일 프레임은 224x224px로 크기가 조정된 후 패치화되었습니다.
반면에 RGB 프레임은 더 높은 비트레이트를 가졌으며 448x448px로 처리되어 256개의 토큰을 생성했으며, 그레이스케일 프레임은 64개의 토큰을 생성했습니다.
공통 최적화 도구를 사용하여 시스템의 결정이 이루어졌습니다. CVXPY 및 OSQP Solver는 색상을 트리거할 때를 계산하는 빠른 알고리즘입니다.
비디오는 1fps로 처리되었으며 클립당 128프레임으로 제한되어 계산을 낮추었습니다.
테스트된 독점 시스템은 Gemini 1.5 Pro, GPT-4o, Claude 3.5 Sonnet이었습니다. 테스트된 오픈 소스 비디오 MLLM은 LLaVA-OneVision-7B, Video-LLaMA2-7B, Qwen2.5-VL-7B이었습니다.
스트리밍 MLLM은 Flash-VStream-7B, VideoLLM-online-8B, Dispider-7B, TimeChat-Online-7B이었습니다.
InternVL-3.5-8B와 Qwen3-VL-8B는 다양한 구성에서 테스트되었습니다.

StreamingBench의 실시간 비주얼 이해 작업에 대한 성능 비교. RGB(%)는 트리거링 후 색상으로 유지된 프레임의 비율을 나타내며, 100은 전체 색상이고 0은 그레이스케일 전용 입력을 나타냅니다. ColorTrigger는 8.1% 및 34.3%의 색상 프레임을 유지하는 두 가지 운영 점에서 평가되며, 전체 색상 설정에 비해 색상 사용을 크게 줄이면서 기존 그레이스케일 InternVL-3.5-8B 기준선보다 전반적인 정확도를 개선했습니다.
여기서 저자는 다음과 같이 말합니다.
‘ColorTrigger는 StreamingBench의 실시간 비주얼 이해 하위 작업에서 경쟁력 있는 성능을 달성했습니다.
‘우리의 모델은 34.3%의 RGB 프레임으로 75.24를 달성했으며, 최근의 온라인 모델인 Dispider-7B를 능가하고 TimeChat-Online-7B에 근접하며, Gemini 1.5 Pro(75.69)와 유사하고 GPT-4o(73.28) 및 Claude 3.5 Sonnet(72.44)을 능가합니다.’
InternVL-3.5-8B는 전체 색상으로 77.20을 달성했으며, ColorTrigger는 65.7% 더 적은 RGB 프레임으로 75.24를 달성했습니다. 8.1%의 색상 프레임으로도 70.72를 달성했으며, 62.08의 그레이스케일 기준선보다 8.64% 개선되었습니다.
다음으로 OVO-Bench가 테스트되었습니다.

OVO-Bench의 세 가지 범주(실시간 비주얼 인식, 백워드 트레이싱, 포워드 액티브 응답)에 대한 성능 비교. RGB(%)는 트리거링 후 색상으로 유지된 프레임의 비율을 나타내며, 100은 전체 색상이고 0은 그레이스케일 전용 입력을 나타냅니다. ColorTrigger는 7.1% 및 33.1%의 색상 프레임을 유지하는 두 가지 운영 점에서 평가되며, 전체 색상 설정에 비해 색상 사용을 크게 줄이면서 기존 그레이스케일 InternVL-3.5-8B 기준선보다 전반적인 정확도를 개선했습니다.
이 결과에 대해 저자는 다음과 같이 말합니다.
‘우리의 모델은 33.1%의 RGB 프레임으로 52.5를 달성했으며, 대부분의 기존 오픈 소스 온라인 MLLM을 능가합니다. 전체 RGB 입력을 사용하는 InternVL-3.5-8B 기준선(57.7)과 비교하여 ColorTrigger는 52.5를 달성했으며, RGB 프레임 사용을 66.9% 줄였습니다. 이는 전체 성능에서 5.2점의 손실을 나타냅니다.’
‘이 제한된 손실은 효율성의 상당한 이익과 함께 발생하며, 우리의 적응형 라우팅 전략의 효과를 입증합니다.’
실시간 비주얼 인식은 65.2를 달성했으며, 그레이스케일 전용 기준선(53.8)보다 11.4점 개선되었습니다. 7.1%의 RGB 프레임으로 제한되더라도(92.9%의 RGB 프레임 감소) ColorTrigger는 50.4를 유지했으며, 그레이스케일 설정보다 2.5점 개선되었습니다.
마지막으로 연구자들은 오프라인 비디오 작업(분석 작업, 지연이나 라이브 환경 조건 테스트가 아닌)인 Video-MME 장기 비디오 이해 벤치마크에 대한 테스트를 수행했습니다.

Video-MME 벤치마크의 성능 비교.
이 테스트에서 모델은 37.6%의 RGB 프레임을 사용하여 66.1의 점수를 달성했으며, 전체 색상 InternVL-3.5-8B 기준선(65.6)의 점수를 초과했으며, 62.4% 더 적은 색상 프레임을 사용했습니다.
저자는 다음과 같이 말합니다.
‘이것은 우리의 적응형 트리거 메커니즘이 계산 비용을 줄이는 것뿐만 아니라 의미적으로 중요한 순간에 RGB 용량을 집중시킴으로써 실제로 성능을 개선할 수 있음을 보여줍니다. ‘
‘특히, ColorTrigger는 TimeChat-Online-7B(62.4) 및 Dispider-7B(57.2)를 포함한 모든 기존 온라인 MLLM을 능가하며, 연속적인 그레이스케일 컨텍스트와 선택적 RGB 수집의 결합이 장기 비디오 이해에 효과적임을 확인합니다.’
결론
이러한 혁신을 볼 때마다 나는 항상 기뻐합니다. 왜냐하면 AI의 높은 전력需求과不断 증가하는 전력 소비가 오랜 시간 동안 우울한 헤드라인을 생산해 왔으며, 이러한 문제를 간접적으로 해결하는 연구를 보는 것이 좋기 때문입니다.
상업적인 고려가 이러한 에너지 절약을 동시에 달성한다는 것은 기분 좋은 일입니다. 이러한 동기는 에너지 보존 및 지구 온난화에 대한 우려보다 단기 정치적 결정에 의해 영향을받을 가능성이 낮기 때문입니다.幸い, 동일한 목표가 다른 이유로 달성됩니다.
* 이 논문의 아이디어를 독자에게 전달하기 위해 제가 작성했습니다.
2026년 3월 26일 처음 게시되었습니다.












