Anderson의 관점

인공지능 분석을 위한 비디오 코덱 설계

mm
Unite.AI를 Google의 선호 소스에 추가

기술 스릴러 서클(2017)은 사회 네트워크의 윤리적 의미에 대한 논평보다는 외부 비디오 분석의 실제에 더 중점을 둔 작품이지만, 플롯의 중심에 있는極小한 ‘SeeChange’ 카메라는 영화를真正한 ‘과학 픽션’ 범주로 밀어넣는 것이 사실이다.

기술 스릴러 '서클' (2017)의 'SeeChange' 카메라/감시 장치.

기술 스릴러 ‘서클’ (2017)의 ‘SeeChange’ 카메라/감시 장치.

무선 및 자유로운 장치로, 직경이 큰 구슬 크기 정도이며, 태양 전지판이 없거나 다른 주변 소스(예: 라디오 波)로부터 전력을 끌어들이는 비효율이 문제가 아니다. 하지만, 24/7 비디오를 압축해야 하며, 유지할 수 있는 한계된 전기 충전만으로 작동해야 하기 때문에, 이러한 작은 장치가 실제로 작동할 수 있을지에 대한 의문이 있다.

컴퓨터 비전(CV) 및 비디오 분석, 특히 도시 환경이 아닌 지역에서 센서가 제한된 전원 자원을 최대한 활용해야 하는 경우, 이러한 저렴한 센서를 구동하는 것이 주요 연구 분야이다.

이러한 에지 IoT/CV 장치에서 이미지 콘텐츠를 중앙 서버로 전송해야 하는 경우(通常은 기존 셀룰러 네트워크를 통해), 두 가지 어려운 선택이 있다. 장치에서 경량 신경망을 실행하여 서버 측에서 처리하기 위한 최적화된 데이터 세그먼트만 전송하거나, ‘愚かな’ 비디오를 전송하여 클라우드 리소스가 평가할 수 있도록 해야 한다.

스마트 비전 센서(SVS)를 통한 동작 활성화는 이 오버헤드를 줄일 수 있지만, 이러한 활성화 모니터링도 에너지를 소비한다.

권력을 잡고 있는

さらに, 간헐적인 활성화(예: 양이 가끔 보인다)로 인해, 장치에는 충분한 전력이 없기 때문에, 압축되지 않은 비디오를 기گابایت 단위로 전송할 수 없으며, 또한 H.264/5와 같은 인기 있는 비디오 압축 코덱을 계속 실행할 수 있는 전력도 없다. 이러한 코덱은 플러그인 하드웨어 또는 다음 충전 세션이 멀지 않은 하드웨어를 기대한다.

세 가지 일반적인 컴퓨터 비전 작업을 위한 비디오 분석 파이프라인. 비디오 인코딩 아키텍처는 작업에 맞게 훈련되어야 하며, 일반적으로 수신할 신경망에 맞게 훈련되어야 한다. 출처: https://arxiv.org/pdf/2204.12534.pdf

세 가지 일반적인 컴퓨터 비전 작업을 위한 비디오 분석 파이프라인. 비디오 인코딩 아키텍처는 작업에 맞게 훈련되어야 하며, 일반적으로 수신할 신경망에 맞게 훈련되어야 한다. 출처: https://arxiv.org/pdf/2204.12534.pdf

광범위하게 사용되는 H.264 코덱은 H.265보다 에너지 소비가 낮지만, 압축 효율이 낮다. H.265는 압축 효율이 더 좋지만, 전력 소비가 더 높다. 구글의 오픈 소스 VP9 코덱은 두 가지 모두를 각 영역에서 능가하지만, 더 높은 로컬 컴퓨팅 자원이 필요하여, 이러한 저렴한 IoT 센서에서 추가적인 문제를 제기한다.

로컬에서 스트림을 분석하는 경우: 경량 신경망을 실행하여 서버 측에서 어떤 프레임이나 프레임의 영역을 전송할 가치가 있는지 결정하기 위해 이미 소비한 전력이면, 모든 프레임을 전송하는 경우와 같은 전력을 소비하게 된다.

그리드에 연결되지 않은 센서로 소를 분리하여 마스킹된 표현을 추출하는 과정. 제한된 전력 용량을 로컬 세マン틱 분할에 사용할지, 서버에 제한된 정보를 전송하여 지연을 초래할지, 아니면 '愚かな' 데이터를 전송하여 대역폭을浪費할지 결정해야 한다. 출처: https://arxiv.org/pdf/1807.01972.pdf

그리드에 연결되지 않은 센서로 소를 분리하여 마스킹된 표현을 추출하는 과정. 제한된 전력 용량을 로컬 세マン틱 분할에 사용할지, 서버에 제한된 정보를 전송하여 지연을 초래할지, 아니면 ‘愚かな’ 데이터를 전송하여 대역폭을浪費할지 결정해야 한다. 출처: https://arxiv.org/pdf/1807.01972.pdf

와일드 컴퓨터 비전 프로젝트는 특정 신경망의 요구 사항에 최적화된 전용 비디오 압축 코덱이 필요하다. 이러한 코덱은 세マン틱 분할, 키포인트 감지(인간 동작 분석), 오브젝트 감지 등 다양한 작업을 수행해야 한다.

비디오 압축 효율과 최소 데이터 전송 사이의 완벽한 트레이드오프를 달성할 수 있다면, SeeChange와 같은 저렴한 센서 네트워크를 비우호적인 환경에 배포하는 데 한 걸음 더 다가갈 수 있다.

AccMPEG

시카고 대학교의 새로운 연구는 AccMPEG라는 형태로 이러한 코덱에 한 걸음 더 다가갈 수 있는 가능성을 제시했다. AccMPEG는 저 지연, 높은 정확도를 갖는 서버 측 딥 뉴럴 네트워크(DNN) 및 매우 낮은 로컬 컴퓨팅 요구 사항을 가진 새로운 비디오 인코딩 및 스트리밍 프레임워크이다.

AccMPEG 아키텍처. 출처: https://arxiv.org/pdf/2204.12534.pdf

AccMPEG 아키텍처. 출처: https://arxiv.org/pdf/2204.12534.pdf

이 시스템은 이전 방법보다 16x16px 매크로블록이 서버 측 DNN의 정확성에 미치는 영향을 평가함으로써 경제적 이점을 얻을 수 있다. 이전 방법은 일반적으로 이미지의 각 픽셀 또는 지역의 정확성을 평가하거나, 관심 있는 지역을 평가하기 위해 전기적으로 비싼 로컬 작업을 수행해야 했다.

AccMPEG에서, 이 정확도는 AccGrad라는 사용자 지정 모듈에서 평가된다. 이 모듈은 매크로블록의 인코딩 품질이 서버 측 DNN의 최종 사용 사례(예: 사람 수 세기, 인간 동작의 스켈레톤 추정 등)에 미치는 영향을 평가한다.

프레임이 시스템에 도착하면, AccMPEG는まず 저렴한 품질 선택 모델인 AccModel을 통해 처리한다. 서버 측 DNN의 유용한 계산에 기여하지 않는 영역은 본질적으로 쓰레기이며, 가장 낮은 품질로 인코딩되어야 한다. 반면, 관련된 영역은 더 나은 품질로 전송되어야 한다.

이 프로세스는 세 가지 도전을 제기한다: 이 프로세스를 충분한 지연 없이 빠르게 수행할 수 있는가? 프레임 속도와 품질 사이의 최적 관계를 설정할 수 있는가? 그리고 특정 서버 측 DNN에 대한 모델을 빠르게 훈련할 수 있는가?

훈련 로직

理想적으로, 컴퓨터 비전 코덱은 플러그인 시스템에서 특정 신경망의 요구 사항에 맞게事前に 훈련되어야 한다. 그러나 AccGrad 모듈은 DNN에서 두 번의 전방 전파만으로 직접 파생될 수 있으며, 표준 오버헤드의 10배를 절약할 수 있다.

AccMPEG는 AccGrad를 15 에포크의 3번 전파로 훈련하며, 동일한 사양의 CV 작업을 위해 ‘라이브’로 재훈련할 수 있다.

AccModel은事前に 훈련된 MobileNet-SSD 피처 추출기를 사용하며, 저렴한 에지 디바이스에서 일반적으로 사용된다. 12 GFLOPS의 턴오버로, 이 모델은 일반적인 ResNet18 접근법의 3분의 1만을 사용한다. 배치 정규화 및 활성화 외에도, 이 아키텍처는 컨볼루션 레이어로만 구성되며, 컴퓨팅 오버헤드는 프레임 크기에 비례한다.

AccGrad는 최종 DNN 추론의 필요성을 제거하여 배포 로직을 개선한다.

AccGrad는 최종 DNN 추론의 필요성을 제거하여 배포 로직을 개선한다.

프레임 속도

이 아키텍처는 10fps에서 최적으로 작동하며, 농업 모니터링, 건물 열화 감시, 고뷰 트래픽 분석 및 인간 동작의 대표적인 스켈레톤 추정과 같은 목적으로 적합하다. 그러나, 빠르게 움직이는 시나리오(예: 저뷰 트래픽, 사람 또는 차량)는 높은 프레임 속도가 필요한 상황으로, 이 접근 방식에 적합하지 않다.

이 방법의 절약은 인접한 매크로블록이 유사한 가치를 가지며, 매크로블록이 추정된 정확성 아래로 떨어질 때까지 이러한 영역을 더 명확하게 구분하여 계산할 수 있다는 전제에 있다.

성능 개선

연구자들은 $60의 제트슨 나노 보드와 단일 128코어 맥스웰 GPU, 그리고 기타 저렴한 대응 보드를 사용하여 시스템을 테스트했다. OpenVINO를 사용하여 매우 희박한 로컬 DNN의 에너지 요구 사항을 CPU로 오프셋했다.

AccModel 자체는 초기에 8개의 GeForce RTX 2080S GPU를 갖춘 서버에서 오프라인으로 훈련되었다. 이는 초기 모델 빌드에 엄청난 컴퓨팅 파워이지만, 시스템이 가능하게 하는 경량 재훈련과, 모델을 다양한 DNN에서 유사한 작업을 수행하는 용인 매개변수에 맞게 조정할 수 있는 방식은, AccMPEG가 와일드에서 최소한의 주의를 필요로 하는 시스템의 일부가 될 수 있음을 의미한다.

 

최초로 게시된 날짜: 2022년 5월 1일.

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]