Anderson의 관점

AI는 책을 읽는 것을 영화를 보는 것보다 더 좋아한다

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image of an industrial robot seated in an armchair and reading a book, while ignoring a movie playing on TV. ChatGPT-o4, Nano-Banana; Firefly.

영상 분석용으로 만들어진 AI 모델조차 실제 영상을 보고 설명하게 하기는 놀랄 만큼 어렵다. 이들은 움직이는 화면보다 글을 더 선호한다.

짧은 동영상을 ChatGPT나 비슷한 비전·언어 모델에 올려 본 사람이라면, 이들이 실제로 영상을 직접 해석하지 못한다는 사실에 놀랐을 수 있다. ChatGPT-4o 이후 모델은 JPEG나 PNG 같은 개별 프레임을 분석할 수 있지만, 사용자가 프레임을 직접 추출해 이미지로 올리기를 기대한다.

OpenAI GPT 계열에서는 영상의 전체 프레임을 번거롭게 추출해 ChatGPT에 제공하고, 이를 바탕으로 영상용 AI 내레이션을 만들 수 있다.

추출한 여러 영상 프레임을 분석하는 OpenAI 예제

영상 해설을 생성하기 위해 추출한 여러 프레임을 분석하는 OpenAI 튜토리얼의 이미지와 코드. 출처

그러나 위 예시처럼 더 큰 프로그램에서 함수를 호출하거나, FFMPEG 또는 무료·유료 영상 편집 도구를 사용해 영상을 프레임으로 변환하는 일은 사용자 몫이다.

ChatGPT 같은 대규모 서비스에서 영상 분석이 제한되는 이유는 상당 부분 자원 사용량에 있다. 하나의 AI 인스턴스에 널리 쓰이는 영상 코덱을 갖추고, 디스크 사용량이 많고 CPU를 강하게 점유하는 프레임 추출에 연산 자원을 투입하는 일은 결코 가볍지 않다. 수억 명이 매일 이 기능을 사용한다면 부담은 훨씬 커진다.

시간 흐름을 분석하면 단일 프레임과 전혀 다른 의미가 드러날 수 있다. 예를 들어 즐겁게 집에 들어온 사람이 시신을 발견하는 장면은 한 프레임만으로 이해할 수 없다. 짧은 영상 전체의 시간적 맥락을 파악하는 일도 계산 비용이 높고 전문적인 연구 영역이다. 광학 흐름 같은 기법은 영상을 펼쳐 정적인 문서처럼 분석하고 처리할 수 있게 한다.

영상 프레임 사이의 움직임을 추적하는 광학 흐름

광학 흐름 도식은 영상 프레임 사이의 움직임을 추적하며, 녹색 벡터는 이동 방향과 강도를 나타낸다. 이런 매핑은 VLM에 필요한 시간적 연속성을 제공하고 VFX 작업의 구조적 가이드로도 활용된다. 출처

요약본에 만족하는 모델

Google NotebookLM과 최신 ChatGPT는 영상과 연관된 메타데이터, 즉 영상을 설명하는 내장 텍스트를 읽을 수 있으므로 영상 파일 업로드 자체를 막지는 않는다. 때로는 이런 정보가 없는 영상도 해석하려고 시도한다.

필자는 이탈리아 영화 The Hand of God(2021)의 무작위 6초 장면을 파일명과 메타데이터 어디에도 유용한 텍스트가 없도록 만든 뒤 NotebookLM에 올렸다. NotebookLM은 영상과 전혀 관계없는 내용을 정교하게 환각했고, 무의미한 5분짜리 토론 팟캐스트까지 만들었다.

NotebookLM이 이탈리아 영화의 6초 장면을 잘못 해석한 사례

NotebookLM은 이탈리아 영화의 평범한 6초 장면을 전혀 엉뚱하게 해석했다. 출처: Google NotebookLM

NotebookLM과 ChatGPT는 YouTube 영상을 입력으로 받을 수 있지만, 해석 가능한 텍스트 주석이나 자막이 있어야 한다. 영상에 픽셀로 박힌 자막만으로는 충분하지 않다. 실제 화면과 소리를 보고 의미를 해석하는 어려운 작업은 업로드 이후 필요한 처리 자원이 배정될 때 수행된다. 이는 저작권 보호와 향후 신원 보호 체계 때문에 YouTube에도 필요한 과정이다.

진짜 영상 해석은 비싸고 힘들다. 새 연구에 따르면 이 작업을 위해 특별히 학습된 모델조차 영상을 보기보다 텍스트를 읽으려 한다.

너무 길어서 보지 않음

영국 브리스톨대학교의 새 논문 A Video Is Not Worth a Thousand Words은 현재 최고 수준의 비전·언어 모델(VLM)을 조사했다. 영상 질문응답(VQA)을 수행하도록 설계된 모델도 가능한 경우 텍스트 정보에 의존한다는 결론이다.

동영상, 서면 질문, 객관식 답을 함께 주면 모델은 화면에서 벌어지는 일보다 텍스트 패턴으로 답을 고르는 경우가 많았다. 질문을 완전히 제거해도 비슷한 성능을 내는 사례도 있었다.

대부분의 모델에 가장 중요한 것은 답 후보에서 패턴을 찾는 일이었다. 답 선택지를 더 많이 추가해 과제를 어렵게 만들었을 때에야 AI가 영상에 더 주의를 기울였다.

저자들은 맥락 길이가 다양한 VLM 6개를 적합한 데이터셋 4개에서 여러 조건으로 시험했고, 결과는 모델이 영상보다 텍스트에 의존한다는 사실을 보여 줬다.

영상 분석 모델이 화면과 텍스트에 부여하는 중요도

대나무를 엮는 사람의 영상에서 모델은 프레임보다 질문과 답 텍스트에 훨씬 큰 중요도를 부여한다. 파란색은 선택한 답을 지지하는 요소, 빨간색은 반대 방향으로 작용하는 요소다. 모델의 추론이 움직이는 화면보다 문구에 집중함을 보여 준다. 출처

논문과 함께 실행 코드와 데이터를 담은 GitHub 저장소도 공개됐다.

방법

각 입력이 모델의 결정에 얼마나 기여하는지 알아보기 위해 연구진은 게임이론의 섀플리 값을 사용했다. 연합에 참여한 사람들에게 보상을 공정하게 나누기 위해 만들어진 이 방법은 각 참여자의 개별 영향에 따라 기여도를 배분한다.

여기서 참여자는 영상 프레임 또는 VQA 과제의 텍스트 요소인 주석, 자막, 캡션이며, 보상은 모델의 최종 답이다. 각 요소를 추가하거나 제거했을 때 결과가 어떻게 달라지는지 반복해서 시험하면 그 요소가 답 선택에 얼마나 중요했는지 알 수 있다.

연구진은 영상과 텍스트를 개별적으로 다루도록 섀플리 값을 혼합 모달리티에 확장했다. 모델 출력에 대한 영향력을 비교해 영상이 실제로 해석됐는지, 아니면 글로 된 단서가 지름길로 쓰였는지 측정했다.

지표

각 모달리티가 결정에 기여한 정도를 비교하기 위해 두 가지 지표를 정의했다. 모달리티 기여도는 모든 섀플리 값을 합산한 뒤 영상, 질문, 답 각각의 몫을 전체의 백분율로 나타낸다.

특징별 기여도는 영상처럼 다른 입력보다 특징 수가 훨씬 많은 모달리티를 보정한다. 각 특징의 평균 섀플리 값을 구해 어느 모달리티의 영향력이 우세한지 비교한다.

데이터와 시험

연구진은 결과가 다양한 환경에 일반화되는지 확인하기 위해 맥락 길이, 출시 시기, 아키텍처가 서로 다른 VLM 6개를 시험했다. 모델은 FrozenBiLM, InternVideo, VideoLLaMA2, VideoLLaMA3, Qwen2 기반 LLaVa-Video, 역시 Qwen2를 쓰는 LongVA였다.

데이터셋도 다양하게 선정했다. EgoSchema는 관련 영상을 끝까지 보지 않으면 풀 수 없도록 설계된 VQA 데이터셋이고, HD-EPIC은 매우 긴 영상도 포함하는 주방 중심 데이터셋이다. MVBench는 여러 데이터셋의 항목을 선별해 모았으며, LVBench는 매우 긴 영상에 관한 질문을 제시한다. 연구진은 각 질문 유형에서 10개씩, 총 60개 질문을 구성했다.

기여도 지표는 대부분의 모델이 텍스트보다 영상을 덜 활용한다는 점을 분명히 보여 줬으며, 프레임별로 평가하면 격차가 더 컸다. 영상 전체의 총기여도가 어느 정도 높아도 개별 특징의 영향은 작은 경우가 많았다. 모델이 영상을 전체적으로 사용하더라도 각 프레임에는 거의 주의를 기울이지 않는다는 뜻이다. VideoLLaMA3는 주요 예외로, 특히 LVBench의 긴 시퀀스에서 시각 정보 의존도가 높았다.

모델과 데이터셋별 모달리티 및 특징별 기여도

모델과 데이터셋별 모달리티 기여도(MC)와 특징별 기여도(PFC). 영상(V), 질문(Q), 답(A)의 상대적 비중을 나타낸다. 대부분의 조건에서 언어가 뚜렷하게 우세하며 특히 프레임별 영향에서는 영상이 밀려난다.

텍스트 중에서는 강한 모델일수록 답보다 질문이 더 중요한 경향이 있었다. 질문이 길고 자연스러우며 답은 짧고 도식적인 EgoSchema에서 특히 두드러졌다. MVBench는 이진 답 구조 때문에 답 토큰의 중요도가 과장돼 반대 경향을 보였다. 그러나 모든 모델과 데이터셋을 통틀어 시각 정보는 일관되게 뒤로 밀리고 언어가 대부분의 역할을 했다.

긴 맥락 모델에서 영상의 기여도는 크게 줄어든다. 프레임별 섀플리 값이 텍스트 특징보다 훨씬 작다는 뜻이다. 영상 전체는 분명 여전히 중요하지만, 개별 프레임의 섀플리 값은 0 주변에 더 집중돼 있고 텍스트보다 주의가 훨씬 덜 유도된다는 증거다.

연구진은 각 입력이 정확도에 미치는 영향을 확인하기 위해 영상이나 텍스트의 일부를 의도적으로 숨기는 마스킹 시험도 실시했다. 특정 입력을 제거했을 때 성능이 급격히 떨어지면 그 입력이 중요하다. 성능이 비슷하다면 모델이 그 정보를 많이 쓰지 않았다는 뜻으로, 반복적인 절제 연구와 비슷하다.

영상, 질문, 답 입력을 마스킹했을 때의 성능 변화

네 VQA 벤치마크에서 영상, 질문, 답을 마스킹했을 때 기준 성능 대비 변화. 빨간색은 정확도 하락, 녹색은 상승이다. 모델은 영상 없이도 높은 점수를 유지하는 경우가 많았지만 텍스트 답을 제거하면 더 크게 하락했다. 질문은 대체로 영향이 작았다.

객관식 텍스트 답을 마스킹하면 대개 정확도가 가장 크게 떨어져 모델이 무작위 선택에 가까워졌다. 반면 질문을 가리는 효과는 훨씬 작았고, 이는 모델이 질문을 과소평가한다는 앞선 결과를 뒷받침한다. 질문을 제거했을 때 정확도가 오르는 사례도 있었다. 모델이 질문을 제대로 평가하지 않고 답을 시각 또는 텍스트 단서와 맞추고 있었음을 시사한다. 일부 모델은 영상 없이도 상당한 정확도를 유지해 현재 구조에서 영상 특징의 기여가 제한적임을 다시 보여 줬다.

이어서 연구진은 객관식 선택지에 오답을 더 추가해 모델이 영상에 의존하도록 만들 수 있는지 시험했다. 다른 질문에서 가져온 쉬운 오답을 넣으면 텍스트 패턴을 맞추기 쉬워져 성능이 올랐다. 그러나 관련 없는 답을 10개 이상 넣자 모델은 영상과 질문에 더 의존하기 시작했다.

오답 수 증가에 따른 특징별 기여도와 정확도

VQA 시험에 오답 선택지를 추가할 때 영상, 질문, 답 입력의 특징별 기여도와 정확도. 방해 선택지가 늘어나면 텍스트 우세가 약해지고 시각 및 질문 특징의 상대적 영향이 커진다.

VideoLLaMA3에서 영상을 가리면 정확도가 EgoSchema에서 40%, LVBench에서 15% 떨어졌다. 답 선택지 수를 늘리는 간단한 조치만으로도 모델이 텍스트 지름길에서 벗어나 진정한 멀티모달 추론으로 이동할 수 있음을 보여 준다.

연구진은 입력 전반에 기여도가 어떻게 분포하는지도 조사했다. 아래 히트맵에서 각 행은 하나의 VQA 항목, 각 열은 하나의 특징이며 왼쪽은 영상 특징, 그 뒤는 텍스트다.

네 데이터셋의 섀플리 값 히트맵

네 데이터셋의 섀플리 값 히트맵. 왼쪽 영상 특징보다 오른쪽 텍스트 영역의 값이 훨씬 강해 모델이 영상보다 언어에 크게 의존함을 확인할 수 있다.

저자들은 각 히트맵 오른쪽의 질문과 답 기여도에서 섀플리 값의 크기가 훨씬 크다고 설명한다. 영상 프레임이 끝나고 텍스트 특징이 시작되는 경계가 뚜렷하며, 영상 모달리티의 기여가 질문과 답보다 훨씬 작다.

모든 데이터셋에서 값은 텍스트 쪽이 훨씬 강했다. 영상이 사용되더라도 그 기여는 많은 프레임에 희박하고 일관성 없이 퍼졌다. 아래 EgoSchema 예시는 섀플리 값으로 가장 중요한 프레임 16개를 골라 파란색은 긍정적 영향, 빨간색은 부정적 영향을 표시한다.

EgoSchema 예시의 프레임과 텍스트별 섀플리 기여도

EgoSchema 사례 하나에서 영향력이 큰 프레임 16개와 모든 텍스트 입력에 대한 섀플리 기여도. 영상의 기여는 모델 추론을 지배하는 텍스트보다 작다. 파란색과 빨간색은 선택한 답에 대한 긍정적·부정적 영향을 뜻한다.

거의 모든 프레임은 질문과 답의 단어보다 영향력이 약했다. 시각 단서는 드물고 일관되지 않은 반면 ‘의자’, ‘울타리’ 같은 명사는 맥락에 따라 모델을 정답 쪽 또는 반대쪽으로 이끌었다.

결론

영상 편집이나 분석을 경험한 사람은 이 과정이 얼마나 많은 자원을 쓰는지 안다. 매일 수백만 건의 AI 요청을 처리하는 기업이 사용자에게 즉석 영상 편집과 해석을 무제한으로 제공하기 어려운 이유도 이해할 수 있다.

거의 모든 AI API 인터페이스는 가능한 최소한의 자원으로 사용자의 요구를 처리하려 한다. 그래서 가능하면 사용자가 제공한 데이터나 RAG 검색 결과에 이미 있는 메타데이터를 활용하고, 꼭 필요한 경우에도 PDF, 문서, 단일 이미지처럼 더 쉽게 분석할 수 있는 형식에서 메타데이터를 추출한다.

반면 업로드된 영상을 CLIP이나 최신 YOLO, 또는 프레임의 내용과 시간 흐름까지 이해할 수 있는 전력 소모가 크고 느린 VLM으로 모두 처리하는 일은 일반적인 선택지가 아니다.

그러나 이번 논문이 관찰한 현상을 자원 절약형 제품 설계만으로 설명할 수는 없다. 저자들은 최신 멀티모달 학습 체계에서도 텍스트가 지배적이라고 지적한다. 이는 ‘시각 언어’가 덜 발전했거나, 멀티모달 맥락에서 덜 중요하거나 유익하거나, 적어도 현재로서는 충분히 이해되지 않았음을 뜻할 수 있다.

* 흥미롭게도 NotebookLM이 만든 내용은 완전히 독창적이거나 Google에 전혀 색인되지 않은 것으로 보인다. 학습 데이터에 들어가 이 출력을 유도했을 만한 웹 검색 결과를 찾을 수 없었다.

2025년 10월 31일 금요일 최초 게시, 14시 20분 서식 수정

머신러닝 분야 작가이자 인간 이미지 합성 도메인 전문가. Metaphysic.ai에서 연구 콘텐츠 책임자를 역임했으며, DNEG의 Brahma.ai로 통합될 때까지 근무했습니다.
웹사이트: martinanderson.ai
연락처: martin@martinanderson.ai