Anderson의 관점

1fps 이상의 비디오 자막 생성의 도전

mm
Unite.AI를 Google의 선호 소스에 추가
Trails in a basketball scene - source: https://www.youtube.com/watch?v=ORfjgE6n2Pc

기계 학습 시스템이 비디오 내에서 발생하는 이벤트를 인식하는 능력은 AI 기반 비디오 생성의 미래에 있어 매우 중요합니다. 특히 비디오 데이터셋이 사용자의 요청에 따라 모델을 생성하고 과도한 홀루션을 방지하기 위해 정확한 자막이 필요하기 때문입니다.

구글의 VidReCap 프로젝트에서 자막 스키마의 예시. 출처: https://sites.google.com/view/vidrecap

구글의 VidReCap 프로젝트에서 자막 스키마의 예시. 출처: https://sites.google.com/view/vidrecap

대규모 비디오 데이터셋에 대한 수동 자막 생성은 현실적으로 불가능한 작업입니다. 비디오를 자동 자막 생성하는 AI 시스템을 훈련시키는 것은 가능하지만, 다양한 시나리오와 커버리지에 대한 인간 생성 예제가 여전히 필요합니다.

대부분의 현재 AI 기반 비디오 자막 생성 모델은 1fps로 작동하며, 이는 많은 시나리오에서 변화를 감지하기에 충분한 속도가 아닙니다. 예를 들어, 감정 인식 시스템을 위한 순간적인 마이크로 표현 변경, 농구와 같은高速 스포츠, 폭력적인 동작, 드라마틱한 영화에서의 빠른 컷 등 다양한 상황에서 더 집중적인 주의가 필요합니다.

재생을 클릭하세요.세계에서 가장 느린 스포츠 중 하나인 스누커에서 알렉스 히긴스가 1982년 레이 레이든을 상대로 세계 선수권 대회에서 우승하는 순간의 빠른 행동. 출처: https://www.youtube.com/watch?v=_1PuqKno_Ok

로직을 깨뜨리며 빠르게 이동

이 낮은 속도는 다양한 로지스틱한 이유로 표준이 되었습니다. 비디오 자막 생성은 시스템이 순차적으로 하나의 프레임을 공부하거나 여러 프레임을 의미적으로 일관된 자막 시퀀스로 변환하는 다양한 방법을 사용하는 경우에 모두 자원 집약적인 활동입니다. 어느 경우에나 컨텍스트 윈도우는 하드웨어 제약으로 인해 제한됩니다.

1fps가 현재 표준인 또 다른 이유는 비디오가 일반적으로 빠른 이벤트로 가득 차 있지 않기 때문입니다. 따라서 300개의 정적 스누커 테이블 프레임에 동일한 주의를 기울이는 것은 우승을 결정짓는 블랙 볼을 포켓팅하는 순간과 같은 것입니다(위의 예시 참조).

스포츠 비디오에서 빠른 슬램 덩크와 같은 중요한 순간을 식별하는 데 사용할 수 있는 보조적인 단서는 있습니다. 그러나 이러한 단서가 다른 이유로 발생할 수 있으므로 의존할 수 없습니다. 이것은 잘못 레이블된 비디오 데이터셋이 생성되어 명령이나 지침을 잘못 해석하거나 환각을 일으키는 생성 비디오 모델을 생성할 수 있는 예입니다.

이것은 여러 가지 의미에서 예산 문제이기도 하고 절차적인 문제이기도 합니다. 지금까지의 프레임워크는 주요 프레임이 비디오의 필수 정보를 효과적으로 캡처할 수 있다는 원칙에 기반을 두고 있지만, 이는 비디오의 장르나 주제와 같은 다른 측면을 설정하는 데 더 효과적입니다.

F-16

중국에서 나온 새로운 논문은 16fps로 비디오를 분석할 수 있는 첫 번째 다중 모달 대규모 언어 모델(MLLM 또는 LLM)을 제시하며, 이는 표준 1fps를 사용하는 모델과 비교하여 주요한 발전입니다.

테스트에서 저자는 새로운 시스템인 F-16이 GPT-4o와 Google의 Gemini-1.5 Pro와 같은 사유 상태 모델을 능가한다고 주장합니다. 다른 현재 모델은 테스트에서 F-16의 결과를 일치시키거나 초과할 수 있지만, 경쟁 모델은 훨씬 더 크고 다루기 어렵습니다.

F-16가 훈련된 하드웨어는 상당했지만, 추론은 일반적으로 훈련보다 훨씬 덜 요구 사항이 많습니다. 따라서 코드가 가까운 장래에 출시될 때 중급 또는 고급 소비자용 GPU에서 실행될 수 있을 것으로 기대됩니다.

호비스트 장면을 위한 비디오 자막 생성 모델이 필요합니다. 소비자 시스템에서 작동할 수 있는 이러한 종류의 모델이 필요합니다. 그렇지 않으면 전체 생성 비디오 장면이 API 기반 상업적 시스템으로 이동하거나 소비자가 로컬 프레임워크를 상업용 온라인 GPU 서비스에 연결하도록 강요할 수 있습니다.

확장

저자는 이러한 접근 방식이 데이터셋을 확장하는 대안이라고 관찰합니다. 또한 이 접근 방식이 데이터를 더 많이 투입하는 경우에도 선호할 수 있는 접근 방식임을 알 수 있습니다. 새로운 시스템은 이벤트를 더 세부적으로 구분합니다.

저자들은 다음과 같이 말합니다:

‘낮은 프레임 속도 샘플링은 특히 빠르게 변경되는 장면이나 세부 사항이 많은 비디오에서 중요한 시각 정보 손실을 초래할 수 있습니다. 또한 주요 프레임이 누락되면 모델은 예상된 콘텐츠와 일치하도록 예측을 조정하는 데 어려움을 겪을 수 있으며, 이는 환각과 성능 저하로 이어질 수 있습니다…

‘… F-16은 일반 비디오 QA에서 유사한 크기의 모델 중에서 최적의 성능을 보여주며, 높은 프레임 속도 비디오 이해에서 명백한优势을 демонстри하며, GPT-4o와 같은 상업적 모델을 능가합니다. 이 연구는 다중 모달 대규모 언어 모델 연구에서 높은 프레임 속도 비디오 이해를 향상시키는 새로운 방향을 열어줍니다.’

이 새로운 논문은 LLM 비디오 이해를 16 프레임당으로 개선이라는 제목으로, 쓰ینگ화 대학과 바이트댄스에서 8명의 저자가 참여했습니다.

방법

연속적인 프레임은 종종冗余한 정보를 포함하므로, F-16은 키 모션 세부 정보를 압축하고 시각적 의미를 유지하는 고프레임 속도 정렬기를 적용합니다. 각 프레임은 먼저 사전 훈련된 이미지 인코더에 의해 처리되어 특징 표현이 추출된 다음 GELU(Gaussian Error Linear Units)에 기반한 정렬기에 전달됩니다.

F-16의 아키텍처는 16fps로 비디오를 처리하며, 전통적인 낮은 프레임 속도 모델보다 더 많은 프레임을 캡처합니다. 또한 고프레임 속도 정렬기는 시각적 의미를 유지하면서 동적을 효율적으로 인코딩합니다.

F-16의 아키텍처는 16fps로 비디오를 처리하며, 전통적인 낮은 프레임 속도 모델보다 더 많은 프레임을 캡처합니다. 출처: https://arxiv.org/pdf/2503.13956

프레임 수를 효율적으로 처리하기 위해 F-16은 프레임을 작은 처리 창으로 그룹화하고, 3층 다층 퍼셉트론(MLP)을 사용하여 시각적 특징을 병합하여 가장 관련이 있는 모션 세부 정보만 유지합니다. 공간 최대 풀링 계층은 토큰 수를 추가로 압축하여 계산 비용을 제한 내로 유지합니다.

처리된 비디오 토큰은 Qwen2-7B LLM에 입력되어 사용자提示와 추출된 시각적 특징을 기반으로 텍스트 응답을 생성합니다.

이러한 비디오 입력을 구조화함으로써 F-16은 동적 장면에서 더 정확한 이벤트 인식을 가능하게 하며, 여전히 효율성을 유지합니다.

간단한 버전

F-16은 사전 훈련된 이미지 LLM인 LLaVA-OneVision을 확장하여 비디오를 처리합니다. 표준 이미지 LLM은 분리된 프레임을 처리하지만, F-16의 고프레임 속도 정렬기는 여러 프레임을 모델이 더 효율적으로 처리할 수 있는 형식으로 재구성합니다. 이것은 시스템을冗余한 정보로 압도하지 않으면서도 정확한 비디오 이해를 위한 중요한 모션 단서를 유지합니다.

정렬기를 서브 매트릭스로 재구성함으로써 F-16은 싱글 프레임 모델에서 지식과 시퀀셜 비디오 입력을 모두 통합할 수 있습니다. 정렬기는 프레임 시퀀스를 모델에 최적화된 형식으로 압축하고, 가장 정보가 많은 특징을 유지하면서 불필요한 세부 정보를 버립니다. 이 아키텍처 설계는 시스템이 고프레임 속도 비디오를 처리할 수 있으면서도 계산 비용을 제어할 수 있도록 합니다.

속도 조절

고프레임 속도 처리는 동적을 이해하는 것을 개선하지만, 특히 추론 중에 계산 비용을 증가시킵니다. F-16은 가변 프레임 속도 디코딩 방법을 도입하여 프레임 속도를 동적으로 조정할 수 있습니다.

F-16에서 사용할 수 있는 싱글 프레임과 고프레임 속도 정렬기.

F-16에서 사용할 수 있는 싱글 프레임과 고프레임 속도 정렬기.

이 유연성으로 인해 모델은 높은 정밀도가 필요하지 않은 경우에 더 낮은 프레임 속도로 효율적으로 작동할 수 있으며, 계산 오버헤드를 줄입니다.

테스트 시간에 낮은 프레임 속도가 선택되면 F-16은 기존에 훈련된 정렬기 매개변수를 반복 입력하여 예상된 차원을 일치시킵니다. 이것은 모델이 아키텍처를 수정하지 않고도 비디오를 효과적으로 처리할 수 있도록 합니다.

단순한 다운샘플링(즉, 단순히 프레임을 제거함)과 달리, 이는 정렬기의 학습된 모션 표현을 유지하면서 정확성을 유지합니다. 일반 비디오 이해를 위한 낮은 프레임 속도 설정은 추론을 가속화할 수 있지만, 고속 동작 분석을 위해서는 여전히 16fps의 전체 기능을 활용할 수 있습니다.

데이터 및 테스트

F-16은 Qwen2-7B를 기반으로 하며, SigLIP를 이미지 인코더로 사용합니다. 16fps에서 샘플링된 비디오 프레임은 최대 1,760개의 프레임을 얻을 수 있습니다. 더 긴 비디오 클립의 경우 프레임은 균일하게(즉, 더 희박하게) 샘플링됩니다.

훈련을 위해 F-16은 LLaVA-Video와 같은 일반 비디오 데이터셋을 사용했습니다. 여기에는 LLaVA-Video-178K, NExT-QA, ActivityNet-QA, PerceptionTest가 포함됩니다.

F-16은 또한 FineGym, Diving48, SoccerNet과 같은 고속 스포츠 데이터셋에서 미세 조정되었습니다. 저자들은 또한 2024년 11월 13일부터 11월 25일까지 진행된 276개의 NBA 게임을 수집하여 샷이 성공적인지 여부를 결정하는 데 중점을 두었습니다.

모델은 NSVA 테스트 세트를 사용하여 평가되었으며, 성능은 F1 점수로 측정되었습니다.

체조와 다이빙 모델은 이벤트 인식 정확도에 따라 평가되었으며, 축구와 농구 모델은 패스와 샷 결과를 추적했습니다.

모델은 1 에포크 동안 128개의 NVIDIA H100 GPU를 사용하여 훈련되었습니다. 훈련 중에 2×10⁻⁵의 학습률을 사용했습니다.

또한 LoRA는 64개의 GPU와 5 에포크를 사용하여 스포츠 데이터에서 미세 조정되었습니다. 여기서 LLM만 훈련되고 이미지 인코더는 고정되었습니다.

초기 테스트에서 일반 비디오 이해를 위한 대조 모델로는 GPT-4o, Gemini-1.5-Pro, Qwen2-VL-7B, VideoLLaMA2-7B, VideoChat2-HD-7B, LLaVA-OV-7B, MiniCPM-V2.6-8B, LLaVA-Video-7B, NVILA-7B가 포함되었습니다.

모델은 Video-MME, VideoVista, TemporalBench, MotionBench, Next-QA, MLVU, LongVideoBench에서 평가되었습니다.

다양한 벤치마크에서 모델의 비디오 QA 결과 비교. F-16은 7B 모델 중에서 Video-MME, NQA, TPB, MB에서 최적의 성능을 보여주며, GPT-4o와 Gemini-1.5-Pro와 같은 상업적 모델과 경쟁합니다.

다양한 벤치마크에서 모델의 비디오 QA 결과 비교. F-16은 7B 모델 중에서 Video-MME, NQA, TPB, MB에서 최적의 성능을 보여주며, GPT-4o와 Gemini-1.5-Pro와 같은 상업적 모델과 경쟁합니다.

저자들은 다음과 같이 말합니다:

‘Video-MME Short, Medium, NeXT-QA 데이터셋에서 우리의 모델은 이전 7B SOTA 모델보다 3.2%, 1.0%, 0.9%의 정확도를 높였습니다. 이는 짧은 비디오 이해에서 강한 성능을 보여줍니다.

‘긴 비디오 이해를 평가하는 벤치마크인 Video-MME Long, LongVideoBench, MLVU의 경우, 프레임 샘플링이 더 희박하여 처리 창 내의 프레임이 더 큰 변이를 나타낼 수 있습니다.

‘이로 인해 모달리티 정렬기가 토큰 표현이 제한된 경우에 시간적 변화를 효과적으로 인코딩하는 데 어려움을 겪을 수 있습니다. 결과적으로 F-16은 [LLaVA-Video-7B]와 비교하여 약간의 성능 저하를 경험합니다.’

F-16의 고프레임 속도 처리는 또한 TemporalBench에서 13.5%의 향상과 MotionBench에서 2.5%의 향상을 보여주었으며, 이는 기존 7B 모델과 비교하여 상업적 모델인 GPT-4o와 Gemini-1.5-Pro와 유사한 수준의 성능을 나타냅니다.

고속 스포츠 비디오 이해

F-16은 FineGym, Diving48, SoccerNet, NBA 데이터셋에서 테스트되어 고속 스포츠 동작을 이해하는 능력을 평가했습니다.

10,000개의 수동으로 주석이 달린 NBA 클립을 사용하여 훈련은 공의 이동과 선수 동작, 그리고 샷이 성공적인지 여부에 중점을 두었습니다. NSVA 테스트 세트에서 F1 점수로 평가되었습니다.

고속 스포츠 비디오 분석 결과. F-16은 모든 스포츠 태스크에서 고프레임 속도 정렬기를 사용하여 더 나은 성능을 보여주었습니다. GPT-4o와 Gemini-1.5-Pro도 NBA와 SoccerNet QA에서 평가되었습니다.

고속 스포츠 비디오 분석 결과. F-16은 모든 스포츠 태스크에서 고프레임 속도 정렬기를 사용하여 더 나은 성능을 보여주었습니다.

FineGym에서는 체조 동작 인식에서 F-16이 이전 7B SOTA 모델보다 13.8% 더 나은 성능을 보여주었습니다. 이는 미세한 동작 이해가 향상됨을 나타냅니다.

Diving48에서는 복잡한 동작 시퀀스를 식별하는 데 더 높은 정확도를 보여주었습니다.

SoccerNet에서는 10초 클립을 분석하여 공의 패스를 식별했습니다. 결과는 기존 7B 모델보다 향상되었으며, 이는 더 높은 프레임 속도가 작은 및 빠른 동작을 추적하는 데 기여한다는 것을 시사합니다.

NBA 데이터셋에서 F-16은 샷 결과를 결정하는 데 더 높은 정확도를 보여주었으며, 이는 더 높은 프레임 속도가 동적 동작을 처리하는 데 도움이 된다는 것을 시사합니다.

가변 프레임 속도

F-16은 다양한 프레임 속도에서 테스트되어其 적응성이 평가되었습니다. 대신에 재훈련하는 대신, 낮은 프레임 속도에서 입력 구조를 일치시키기 위해 프레임을 반복했습니다. 이 접근 방식은 단순히 프레임을 제거하는 것보다 더 나은 성능을 유지했습니다.

결과는 프레임 속도를 줄이는 것이 동작 인식에 일부 영향을 미쳤지만, F-16은 여전히 낮은 프레임 속도 모델을 능가하고 16fps 아래에서도 강한 결과를 유지했습니다.

왼쪽: Video-MME Long 세트의 300개 비디오에서 다양한 테스트 프레임 속도와 시퀀스 길이에서 F-16의 모듈별 시간 소요. 오른쪽: 모델이 훈련되고 테스트되는 프레임 속도에 따른 Video-MME 성능 비교. 실선은 모델이 동일한 프레임 속도로 훈련되고 테스트되는 것을 나타내며, 점선은 모델이 16fps에서 훈련되고 낮은 프레임 속도로 테스트되는 것을 나타냅니다.

왼쪽: Video-MME Long 세트의 300개 비디오에서 다양한 테스트 프레임 속도와 시퀀스 길이에서 F-16의 모듈별 시간 소요.

F-16의 고프레임 속도 처리는 계산 요구를 증가시켰지만, 정렬기는 이러한 비용을 관리하는 데 도움이 되었습니다. 모델은 낮은 프레임 속도 모델보다 더 많은 FLOPs를 필요로 하지만, 토큰당 더 나은 정확도를 달성하여 추가 계산을 상쇄합니다.

결론

이 연구 분야의 중요성과 도전은 특히 생성 비디오의 돌파구가 될 것으로 예상되는今年에 더욱 두드러집니다. 비디오 데이터셋의 큐레이션과 자막 품질의 약점이 명확해집니다.

비디오 내부 세부 정보에 대한 정확한 설명을 얻는 데 필요한 도전은 단순히 VRAM, 시간 또는 디스크 공간을 투입하여 해결할 수 없습니다. 이벤트를 비디오에서 분리/추출하는 방식과 현재의 최적의 솔루션에서 지배적인 의미적 접근 방식과 메커니즘을 재고하는 것이 필요합니다.

(우연히, 2025년 기준으로 16fps는 낮은 프레임 속도처럼 보일 수 있지만, 이것은 또한 인기 있는 Wan 2.1 생성 비디오 모델에서 사용되는 비디오 클립의 네이티브 훈련 속도이며, 이는 가장 적은 문제로 작동하는 속도입니다. 연구 장면이 여기서의 ‘표준 엔트로피’를 주시할 수 있기를 바랍니다. 때때로 구식 제약은 미래의 표준을 지속시킬 수 있습니다)

 

최초로 게시된 날: 2025년 3월 19일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: martin@martinanderson.ai