Anderson의 관점

AI 생성 영상 위한 비디오 코덱

mm
Unite.AI를 Google의 선호 소스에 추가
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

AI의 모든 것을 포함하는 시대가 끝나가면서, AI 비디오 생성에 대한 새로운 경제적인 접근 방식이 토큰과 시간에서 đáng chú ý한 절약을 약속합니다.

 

AI 추론의 실제 비용은 현재의 AI 혁신의 빠른 속도에 대한 새로운 심각성을 가져오고 있으며, 기계 학습의 비용을 합리화하는 데 대한 관심이 증가하고 있습니다. AI를 내부에 가져오는 잠재력과 개인용 AI의 일반적인 상승 외에도, VRAM을 많이 사용하고 자원을 많이 사용하는 기계 학습 루틴은 또한 최적화가 필요할 것입니다.

비디오 생성은 이 점에서 가장 큰 범죄자일 수 있습니다. 비디오 편집 소프트웨어에서 영화를 재압축하거나 내보내기한 적이 있다면, 이 작업이 하드웨어에 미치는 영향을 이미 알고 있습니다. 이 작업은 RAM과 CPU 사이클을 소비하며, 호스트 컴퓨터를 다른 용도로 사용할 수 없게 만들며, 압축 알고리즘의 영향을 제한하기 위한 조치가 취해지지 않는 한 말입니다.

따라서 AI 비디오의 부상이 데이터 센터 전 세계에서 이 ‘파워 마다’ 절차를 재현하는 정도를 상상하기만 해도 됩니다. 이러한 규모의 운영에서 가장 작은 이익은 즉시 집계에서 중요한 것으로 됩니다.

프레임 내

이 점을 염두에 두고, 상하이에서 JD.com과 협력하여 새로운 연구가 제안된 비디오 코덱은 렌더링 프로세스(원본 프레임을 더 작은 비디오 파일 크기로 압축하는 과정)에 목표를 두지 않고, 실제 AI 비디오 생성 프로세스 자체에 목표를 두었습니다.

일반적인 비디오 코덱은 모든 프레임을 전체 이미지로 저장하지 않고, 완전한 이미지인 I-프레임을 더 작은 수로 생성하고, 이후 프레임은 이전 프레임과 비교하여 변경된 부분만 저장합니다.

예를 들어, 비디오에서 사람이 조금 이동한다면, 코덱은 전체 장면을 다시 쓰지 않고, 변경된 부분만 기록합니다. 이러한 프레임은 이전 프레임에서 파생된 P-프레임과, 이후 프레임에서 예상되는 정보를 포함할 수 있는 B-프레임입니다.

비디오 코덱의 해부학: 위쪽 행은 시간에 따른 프레임을 표시하며, I-프레임은 전체 색상으로 저장되고, P-프레임과 B-프레임은 재구성된 것을 나타내는 페이드된 색상으로 표시됩니다. 화살표는 프레임이 이전 프레임, 이후 프레임 또는 둘 다를 사용하는지 여부를 나타냅니다. 아래 패널은 완전히 저장된 프레임(I-프레임, 왼쪽), 이전 프레임에서 구축된 프레임(P-프레임, 두 번째 왼쪽), 이전 및 이후 프레임에서 구축된 프레임(B-프레임, 오른쪽)을 표시합니다.

비디오 코덱의 해부학: 위쪽 행은 시간에 따른 프레임을 표시하며, I-프레임은 전체 색상으로 저장되고, P-프레임과 B-프레임은 재구성된 것을 나타내는 페이드된 색상으로 표시됩니다. 화살표는 프레임이 이전 프레임, 이후 프레임 또는 둘 다를 사용하는지 여부를 나타냅니다. 아래 패널은 완전히 저장된 프레임(I-프레임, 왼쪽), 이전 프레임에서 구축된 프레임(P-프레임, 두 번째 왼쪽), 이전 및 이후 프레임에서 구축된 프레임(B-프레임, 오른쪽)을 표시합니다.

이전 정보를 재사용하는 이유는 비디오 파일이 작게 유지되는 이유입니다. 대부분의 프레임은 새로운 이미지로 작동하지 않고, 이전 프레임이 변경된 방식을 설명하는 지침으로 작동합니다. 따라서 I-프레임은 ‘전체’ 이미지로 구성되며, 그 사이의 프레임은 I-프레임과 그 사이의 차이만으로 구성됩니다.

AI가 비디오를 생성할 때마다 모든 단일 프레임은 전체 압축되지 않은 이미지로 저장됩니다. 영화를 이 방식으로 저장하면 2시간짜리 영화에 거의 1테라바이트의 디스크 공간이 필요합니다. 그러나 이것이 AI가 비디오를 생성하는 방식입니다. 각 프레임에 대해 동일한 자원을 할당하고, 비디오를 계산할 때마다 토큰을 사용합니다.

규모의 경제

新的 연구 AdaCodec: 예측형 비주얼 코드를 위한 비디오 MLLM은 전통적인 압축 방식을 사용하여, 참조 프레임(I-프레임)에만 전체 시각 토큰을 사용하고, 중간 프레임은 컴팩트한 P-토큰으로 렌더링합니다.

이 내부 압축이 완료된 후, 생성된 비디오는 일반적으로 압축할 수 있으며, 이론적으로 모든 절약은 서버 측에서 발생합니다.

AdaCodec 개요. 왼쪽: 비디오는 예측이 어려운 순간을 위해 전체 I-프레임을 예약하고, 중간 P-프레임은 컴팩트한 모션 및 잔차 정보를 사용하여 표시됩니다. 오른쪽: 결과 시스템은 Qwen3-VL-8B를 11개의 벤치마크에서凌駕하거나凌駕하며, 토큰 예산 전체에서 더 높은 장기 비디오 정확도를 유지하고, 응답 지연을 줄이며, 훨씬 더 적은 비디오 토큰을 처리합니다. 출처 - https://arxiv.org/pdf/2606.02569

AdaCodec 개요. 왼쪽: 비디오는 예측이 어려운 순간을 위해 전체 I-프레임을 예약하고, 중간 P-프레임은 컴팩트한 모션 및 잔차 정보를 사용하여 표시됩니다. 오른쪽: 결과 시스템은 Qwen3-VL-8B를 11개의 벤치마크에서凌駕하거나凌駕하며, 토큰 예산 전체에서 더 높은 장기 비디오 정확도를 유지하고, 응답 지연을 줄이며, 훨씬 더 적은 비디오 토큰을 처리합니다. 출처

AdaCodec의 절약은 테스트 결과에 따르면 가치가 있습니다. 문서는 시스템이 수정되지 않은 Qwen3-VL-8B 모델을 모든 주요 벤치마크에서凌駕하거나凌駕하며, 동일한 처리량을 사용하고, 비디오 토큰을 약 86% 절감한 후에도 해당 모델의 성능을凌駕하거나凌駕한다고 명시합니다.

저자들은 다음과 같이 말합니다:

‘우리는 예측 코딩에서 영감을 얻었습니다. 여기서 시스템은 원시 신호가 아니라 예측 오류를 전송합니다. 이 원리는 생물학적 근거를 가지고 있습니다. 시각 시스템은 입력 자체가 아니라 예측 오류, 즉 예상된 입력과 관찰된 입력 사이의 불일치를 인코딩하는 것으로 생각됩니다.입력 자체가 아니라입니다.

‘현대 비디오 코덱은 엔지니어링에서 동일한 잔차 코딩 아이디어를 사용합니다. 참조 프레임은 전체 내용을 가지고, 예측 프레임은 참조 프레임에 대한모션 및 잔차 신호를 가지고 있습니다.

‘이 시스템은 다른 목표를 가지고 있지만, 동일한 조건부 구조를 공유합니다. 근처 샘플이冗長할 때, 채널은 예측이 설명하지 못하는 것을 전송해야 합니다.

‘표준 코덱은 비트스트림과 인간이 볼 수 있는 재구성을 최적화하지만, LLM에 의해 소비되는 시각 토큰을 최적화하지 않습니다. 따라서 우리는 이 메커니즘을 비디오 이해를 위한 MLLM 인터페이스로 다시 설계했습니다.’

新的 연구는 상하이 교통 대학, 상하이 혁신 연구소, JD.com의 11명의 연구자에 의해 작성되었으며, 연관 프로젝트 페이지가 있습니다. 소스 코드의 출시가 약속되어 있습니다.

방법

다음과 같이 논의되었습니다. 모든 프레임을 완전히 새로운 이미지로 처리하는 대신, 시스템은 한 프레임과 다음 프레임 사이에 변경된 내용을 찾습니다. 왼쪽에 표시된 이미지에서, 현재 프레임의 작은 영역이 이전 프레임의 가장 유사한 영역과 일치합니다.

AdaCodec 스키마 개요.

AdaCodec 스키마 개요.

두 위치 사이의 거리는 모션 벡터가 되며, 남은 시각적 차이는 잔차가 됩니다. 이러한 컴팩트한 설명은 전체 이미지를 저장할 필요를 대체합니다.

오른쪽에 표시된 정보는 AI 모델에 입력됩니다. 중요한 참조 프레임은 여전히 전체 이미지로 처리되지만, 중간 프레임은 훨씬 더 작은 모션 및 잔차 토큰으로 표시됩니다. 이는 모델이 비디오를 파싱하는 데 필요한 정보를 유지하면서도 훨씬 더 적은 시각적 데이터를 처리할 수 있도록 합니다.

어떤 프레임이 전체로 저장되어야 하는지 결정하는 것은 흥미로운 도전입니다. 전통적인 비디오 코덱은 일반적으로 참조 프레임을 정기적인 간격으로 배치합니다. AdaCodec는 가장 중요한 순간을 식별하려고 시도합니다.

예를 들어, 두 사람이 아파트에서 대화하는 정적인 장면을 고려해 보십시오. 갑자기 SWAT 팀이 창문을 통해 폭격합니다. 즉시 카메라 视角과 편집 컷의 수가 급증하며, 정기적인 참조 프레임 간격으로는 제공할 수 없는 훨씬 더 많은 데이터가 필요합니다.

프레임 시퀀스: 빈 방, 두 사람이 대화하는 사람, 창문을 통해 들어오는 그룹, 두 사람이 에스코트되는 사람, 다시 빈 방. 아래의 중간 프레임 스트립은 동일한 이벤트를 더 긴 타임라인에 표시하며, 선택된 프레임은 파란색으로 강조 표시됩니다. '장면 강도'라는 레이블이 있는 수평 스케일이 시퀀스 아래에 있으며, '부적절한 참조 프레임'이라는 레이블이 있는 아래에 색상 블록이 있습니다.

이것이 가변 압축(가변 비트레이트) 압축 방법의 논리입니다. 이러한 방법은 원본 비디오를 ‘바쁜’ 기간으로 분석하고, 필요한 곳에 더 많은 데이터를 할당합니다. AdaCodec에서 프레임을 예측할 수 있다면, 시스템은 컴팩트한 모션 및 잔차 토큰을 계속 사용합니다. 장면이 크게 변경되면(예를 들어, SWAT 팀의 경우 또는 덜 극적인 경우), 전체 참조 프레임이 삽입됩니다. 이는 더 많은 처리 예산을 중요한 시각적 정보에 할당할 수 있도록 합니다.

데이터 및 테스트

테스트에서 연구자들은 Qwen3-VL-8B를 기준 모델로 사용하고, AdaCodec를 11개의 벤치마크에서 평가했습니다. 이 벤치마크는 비디오 이해의 세 가지 영역을 다룹니다. 장기 비디오 성능MLVU, LongVideoBench, LVBench를 사용하여 평가되었습니다. 시간적 이해TempCompass, MotionBench, TOMATO를 사용하여 평가되었습니다. 일반 비디오 이해Video-MME, MVBench, NExT-QA, PerceptionTest, EgoSchema를 사용하여 평가되었습니다.

테스트된 오픈 소스 모델은 InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; 및 Molmo2-O-7B입니다.

GPT-5, Gemini, Claude 버전은 아래 표에 비교 기준으로만 표시됩니다. CoPE-VideoLM-7BReMoRa-7B는 이전의 비디오 언어 모델로, 코덱 영감의 압축을 통해 시각 토큰 사용을 줄입니다. 이는 AdaCodec의 가장 가까운 직접적인 경쟁자입니다.

장기 비디오 이해, 시간적推論, 일반 비디오 이해를 포함하는 11개의 벤치마크에 대한 주요 결과. 더 높은 점수는 더好的 성능을 나타냅니다. LVB = LongVideoBench; V-MME = Video-MME. 볼드체 및 밑줄이 있는 값은 오픈 소스 모델 중에서最高 및 두 번째로 높은 점수를 나타냅니다. 닫힌 소스 모델의 점수는 공식 보고서에서 사용할 수 있는 경우 가져왔으며, 누락된 결과는 Molmo2 또는 저자에 의해 평가되었습니다.

장기 비디오 이해, 시간적推論, 일반 비디오 이해를 포함하는 11개의 벤치마크에 대한 주요 결과. 더 높은 점수는 더好的 성능을 나타냅니다. LVB = LongVideoBench; V-MME = Video-MME. 볼드체 및 밑줄이 있는 값은 오픈 소스 모델 중에서最高 및 두 번째로 높은 점수를 나타냅니다. 닫힌 소스 모델의 점수는 공식 보고서에서 사용할 수 있는 경우 가져왔으며, 누락된 결과는 Molmo2 또는 저자에 의해 평가되었습니다.

공평한 비교를 위해, AdaCodec와 표준 Qwen3-VL-8B 시스템 모두에 동일한 수의 시각 토큰이 할당되었습니다. 이는 결과가 압축 접근 방식의 효과를 반영하도록 허용합니다.

가장 공격적인 설정에서, AdaCodec는 시각 토큰 사용을 약 86% 줄였으며, 여전히 장기 비디오, 시간적, 및 일반 비디오 이해 작업에서 기준 시스템을凌駕하거나凌駕했습니다.

저장된 토큰을 더 많은 비디오 프레임을 처리하는 데 다시 투자하면, 모든 장기 비디오 벤치마크와 모든 시간적 벤치마크에서 성능이 향상되었습니다. LongVideoBench에서 +5.4점, TOMATO에서 +4.3점의 이익이 있었습니다.

결론

이러한 프로젝트는 일반적으로 대규모 제공업체를 대상으로 하지만, 이 तरह의 노력은 지역적이고 합리적인 AI 배포에 대한 새로운 ‘공개 금욕주의’의 일부로 호비스트와 중소기업에도 관심을 가질 것입니다.

커뮤니티에서, r/stablediffusion과 같은 곳에서는이 뉴스가 매우 오래되었습니다. 모든 주요 오픈 소스 릴리스는 정기적으로 최적화된 버전(GGUF, 양자화된 가중치 등)으로 변환되어, 낮은 그래픽 카드에서 실행할 수 있습니다.

이 ‘수행’ 단계가 실제로 끝나고, 기업이 추론의 실제 비용에 의해 밀려나면, AdaCodec와 같은 이니셔티브는 오는 ‘대규모 최적화’의 일부가 될 수 있습니다.

 

이것은 사용자 친화적인 형식/파일 크기로 비디오를 렌더링하는 것과는 다르며, 추론 시간에 AI 모델 내에서 발생하는 프레임의 내부 생성 및 수집을 다룹니다.

* 저자의 인라인 인용을 링크로 변환한 것입니다.

처음 게시된 날짜: 2026년 6월 4일 목요일

기계 학습 분야 작가이자 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]