Anderson의 관점
AI는 책을 읽는 것을 영화를 보는 것보다 더 좋아한다

AI 모델이 실제 비디오 콘텐츠를 시청하고 주석을 달기 위해 설계되었음에도 불구하고, 실제로 비디오 콘텐츠를 시청하고 주석을 달기가 놀라울 정도로 어렵다. 그들은 쓰여진文字에 더 관심이 있다.
ChatGPT 또는 유사한 인기 있는 비전/언어 모델에 작은 비디오 클립을 업로드하려고 시도해 본 적이 있다면, 실제로 비디오를 파싱할 수 없다는 사실에 놀랐을 것이다. ChatGPT-4o+와 같은 모델은 개별 프레임을 분석할 수 있지만(예: JPEG 및 PNG와 같은 이미지 형식), 사용자가 프레임을 추출하여 이미지로 업로드하도록 요구한다.
OpenAI GPT 시리즈의 경우, 비디오 클립에서 전체 프레임을 추출하여 ChatGPT에 제공할 수 있다. 예를 들어, AI 생성된 내레이션 트랙을 생성하는 데 사용할 수 있다.

OpenAI 튜토리얼의 이미지 및 코드: 비디오 프레임을 파싱하여 AI 생성된 주석을 생성하는 방법 출처
그러나 사용자가 비디오를 프레임으로 변환하거나 FFMPEG 또는 다양한 무료/유료 비디오 편집 솔루션을 사용하여 프레임을 추출해야 한다.
비디오 분석의 한계는 자원 사용과 관련이 있다. 수백만 명의 사용자가 이러한 기능을 사용하기 시작하면, 비디오 코덱을 지원하고 추출을 위한 컴퓨팅 자원을 할당하는 것이 간단한 문제가 아니다.
또한, 시간적 분석은 단일 프레임보다 더 복잡한 그림을 보여줄 수 있다. 예를 들어, 누군가가 집에 들어가서 행복한 기분으로 들어가지만 시체를 발견하는 경우를 생각해 보라. 따라서 짧은 비디오 클립의 전체 시간적 ‘체크섬’을 고려하는 것은 어려운 작업이다.

옵티컬 플로우 다이어그램: 비디오 시퀀스의 프레임에서 운동을 추적하는 방법 출처
클리프 노트에 만족하기
그러나 Google의 Notebook LM이나 최근의 ChatGPT 엔트리와 같은 모델은 관련 메타데이터(예: 비디오를 설명하는 텍스트 콘텐츠)를 읽을 수 있으므로 비디오 파일 업로드를 금지하지 않는다. 때때로 비디오를 해석하려고 시도한다.
이 경우, NotebookLM에 6초짜리 이탈리아 영화 “The Hand of God”의 랜덤 클립을 업로드했다. 클립에는 유용한 텍스트가 포함되지 않았다.
NotebookLM은 비디오와 관련이 없는 자료를 상상력 있게 생성했다. 5분짜리 대면 팟캐스트와 함께 완전히 무関係한 자료였다.

NotebookLM이 이탈리아 영화의 6초 클립을 와일드하게 잘못 해석한 예 출처: Google NotebookLM
YouTube 비디오를 입력으로 사용하는 경우, NotebookLM은 텍스트 레이어 주석이나 자막이 포함된 경우에만 비디오를 업로드할 수 있다.
이러한 방식으로, 실제로 비디오 콘텐츠를 시청하고 의미를 해석하는 작업은 사용자 업로드 후에 처리할 수 있는 리소스가 할당될 때 수행된다.
실제 비디오 해석은 비용이 많이 들고疲勞하다. 이러한 모델은 텍스트를 읽는 것을 더 좋아한다.
TL;DW
이것은 영국 브리스톨 대학의 새로운 논문에서 나타난다. “A Video Is Not Worth a Thousand Words”라는 제목의 논문에서 두 저자는 현재 상태의 최첨단 비전 언어 모델(VLM)이 비디오를 분석할 때 텍스트 기반 정보를 기본으로 사용한다고 결론지었다.
질문과 선택형答案이 주어졌을 때, 모델은 텍스트 패턴에 기반하여 선택을 했다. 많은 경우에 질문이 완전히 제거된 경우에도 동일한 성능을 보였다.
이것은 모델이 단축이나 치팅을하는 방식으로 보인다. 모델이 텍스트를 사용하여 선택을 하는 것이 더 쉽기 때문이다.
저자들은 6개의 VLM 모델을 4개의 데이터셋에서 테스트했다. 결과는 모델이 비디오보다 텍스트에 더 의존한다는 것을 보여주었다.

모델과 데이터셋에 대한 모달리티 기여도 및 피처 기여도 출처
방법
새로운 연구에서는 게임 이론에서来的 방법을 사용하여 모델의 결정에 각 입력이 얼마나 기여하는지 이해한다. 이 방법을 Shapley 값이라고 한다.
Shapley 값은 각 ‘플레이어’에게 그들의 개인적인 영향에 기반하여 신뢰를 할당한다. 이 경우, 플레이어는 비디오 프레임 또는 텍스트 구성 요소이다.
새로운 프로젝트에서는 Shapley 값을 다중 모달리티를 처리하도록 확장하여 비디오와 텍스트 구성 요소를 별도로 처리하고, 모델의 출력에 대한 영향 度를 측정했다.
메트릭
두 가지 간단한 메트릭을 정의하여 각 모달리티(예: 비디오, 질문, 답변)가 모델의 결정에 얼마나 기여하는지 비교했다.
첫 번째는 모달리티 기여도이다. 이는 총 설명의 얼마나 많은 부분이 각 모달리티에서 왔는지 측정한다.
두 번째는 피처 기여도이다. 이는 모달리티 내의 각 피처의 평균 Shapley 값을 계산하여 어떤 모달리티의 영향이 지배적인지 결정한다.
데이터 및 테스트
저자들은 다양한 특성을 가진 6개의 VLM 모델을 테스트했다. 모델은 서로 다른 컨텍스트 길이, 나이, 아키텍처 구성으로 선택되었다.
테스트에는 FrozenBiLM, InternVideo, VideoLLaMA2, VideoLLaMA3, LLaVa-Video, LongVA가 포함되었다.
테스트는 4개의 데이터셋에서 수행되었다: EgoSchema, HD-EPIC, MVBench, LVBench.
각 데이터셋에서 10개의 질문을 생성하여 총 60개의 질문을 생성했다.
기여도 메트릭은 대부분의 모델이 비디오보다 텍스트에 더 의존한다는 것을 보여주었다.
비디오는 전체적으로 관련이 있지만, 개별 프레임의 Shapley 값은 텍스트 피처의 값보다 작다.
이 결과는 모델이 비디오를 사용하여 결정에 도달하는 경우에도, 비디오의 기여도가 薄いであることを 보여준다.
저자들은 모델이 비디오를 사용하여 결정에 도달하는 경우, 비디오의 기여도가 薄い이라는 것을 보여주었다.
또한, 모델이 비디오를 사용하여 결정에 도달하는 경우, 비디오의 기여도가 薄い이라는 것을 보여주었다.
결론
비디오 편집이나 비디오 분석에 관심이 있는 사람들은 이미 이러한 프로세스가 리소스를 많이 사용하는 것을 알고 있다. 따라서, 수백만 개의 AI 기반 요청을 처리하는 회사는 사용자에게 비디오 편집이나 해석을 허용하지 않는다.
한 가지 중요한 점은 거의 모든 API AI 인터페이스가 사용자의 요청을 최소한의 리소스 사용으로 수행하려고한다는 것이다.
이것은 기존 메타데이터 또는 RAG 검색을 사용하여 사용자의 요구를 충족하는 것을 의미한다.
그러나, 실제로 비디오를 분석하여 이해하는 것은 이러한 인터페이스에서 수행되지 않는다.
이 논문에서 문서된 현상은 비용을 절약하기 위한 접근 방식에서 비롯된 것이 아니다. 저자들은 텍스트가 다중 모달 훈련 패러다임에서 지배적임을 관찰했다.
이것은 비전 언어가 다중 모달 컨텍스트에서 덜 발달되어 있거나 덜 중요하거나 이해되지 않는다는 것을 의미한다.
결과적으로, 모델은 비디오를 사용하여 결정에 도달하는 경우에도, 비디오의 기여도가 薄い이다.
이러한 모델은 텍스트를 읽는 것을 더 좋아한다.
비디오 해석은 비용이 많이 들고疲勞하다. 따라서, 이러한 모델은 텍스트를 사용하여 결정에 도달하는 경우가 많다.
이러한 결과는 비디오 분석을 수행하는 모델의 한계를 보여준다.
이러한 모델은 비디오를 사용하여 결정에 도달하는 경우에도, 비디오의 기여도가 薄い이다.
이러한 결과는 비디오 분석을 수행하는 모델의 한계를 보여준다.
이러한 모델은 텍스트를 읽는 것을 더 좋아한다.
비디오 해석은 비용이 많이 들고疲勞하다.
이러한 결과는 비디오 분석을 수행하는 모델의 한계를 보여준다.












