Ângulo de Anderson

Um Codec de Vídeo para Footage Gerado por IA

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

À medida que a era do “comer-tudo” da IA chega ao fim, uma nova abordagem econômica para a geração de vídeo de IA promete economias notáveis em tokens e tempo.

 

O verdadeiro custo da inferência de IA está trazendo uma nova nota de sobriedade ao ritmo acelerado da atual revolução de IA, com aumento do interesse em racionalizar o custo do aprendizado de máquina. Além do potencial de trazer a IA para dentro, e o aumento geral da IA privada, as rotinas de aprendizado de máquina famintas de VRAM e devoradoras de recursos precisarão ser otimizadas também.

A geração de vídeo é talvez a maior infratora nesse respeito. Se você já recompensou um filme ou exportou um de um conjunto de edição de vídeo, você já sabe o custo que essa tarefa específica (não IA) impõe ao seu hardware – consumindo RAM e ciclos de CPU, e frequentemente bloqueando a máquina para qualquer outro uso, a menos que medidas sejam tomadas para limitar o impacto do algoritmo de compressão no computador hospedeiro. [1]

Portanto, é necessário apenas imaginar a extensão com que o aumento do vídeo de IA está repetindo esse procedimento “louco por poder” em centros de dados em todo o mundo. Nessa escala de operação, os menores ganhos se tornam imediatamente significativos na contabilidade agregada.

No Quadro

Com isso em mente, uma nova oferta de pesquisa de Xangai, em colaboração com a JD.com (JD ), está propondo um codec de vídeo destinado não ao processo de renderização (o processo de compressão de quadros brutos em um tamanho de arquivo de vídeo menor), mas ao próprio processo de geração de vídeo de IA.

Um codec de vídeo normal funciona não armazenando cada quadro como uma imagem completa, mas criando um número menor de imagens completas, chamadas quadros I, e então armazenando alterações entre quadros.

Por exemplo, se uma pessoa se move ligeiramente em um vídeo, o codec registra apenas as partes do quadro que registram essa alteração, em vez de reescrever toda a cena. Esses são quadros P, que são derivados de quadros anteriores, e quadros B, que também podem antecipar informações em quadros futuros:

Anatomia de um codec de vídeo: linha superior mostra quadros ao longo do tempo rotulados I, P e B, com quadros I armazenados em cores completas e quadros P e B mostrados desvanecidos para indicar reconstrução; setas indicam se os quadros usam quadros anteriores, quadros posteriores ou ambos; painéis inferiores mostram um quadro armazenado completamente (quadro I, esquerda), um quadro construído a partir de um quadro anterior (quadro P, segunda-esquerda), e um quadro construído a partir de quadros anteriores e posteriores (quadro B, direita).

Anatomia de um codec de vídeo: linha superior mostra quadros ao longo do tempo rotulados I, P e B, com quadros I armazenados em cores completas e quadros P e B mostrados desvanecidos para indicar reconstrução; setas indicam se os quadros usam quadros anteriores, quadros posteriores ou ambos; painéis inferiores mostram um quadro armazenado completamente (quadro I, esquerda), um quadro construído a partir de um quadro anterior (quadro P, segunda-esquerda), e um quadro construído a partir de quadros anteriores e posteriores (quadro B, direita).

Essa reutilização de informações próximas é por que os arquivos de vídeo permanecem pequenos, com a maioria dos quadros operando não como novas imagens, mas como instruções que descrevem como o quadro anterior mudou. Portanto, os quadros I constituem imagens “cheias”, que consomem espaço, com os quadros entre eles constituindo apenas a diferença entre os quadros I (e entre si).

Quando cada quadro é uma imagem não comprimida, o filme essencialmente tem nenhuma compressão. Salvar um filme dessa forma, como vídeo não comprimido, resultaria em um filme de 2 horas necessitando de cerca de (ou mais de) um terabyte de espaço em disco. No entanto, é assim que a IA faz filmes† – dedicando recursos e tokens iguais a cada quadro, quando calcula como formular o vídeo.

Economia de Escala

O novo trabalho, intitulado AdaCodec: Um Código de Vídeo Previsível para MLLMs de Vídeo, gasta tokens visuais completos exclusivamente em quadros de referência (quadros I), com todos os quadros intersticiais renderizados como ‘tokens P compactos’ – um paradigma claramente tomado da compressão tradicional empregada por codecs de vídeo históricos.

Depois que a compressão interna ocorreu, o vídeo de IA pode ser comprimido normalmente, e, em teoria, todas as economias são de lado do servidor:

Visão geral do AdaCodec. Esquerda, os vídeos são divididos em grupos adaptáveis de imagens, com quadros I completos reservados para momentos difíceis de prever e quadros P intermediários representados usando informações de movimento e resíduo compactas. Direita, o sistema resultante corresponde ou supera o Qwen3-VL-8B em onze benchmarks, mantém uma precisão de vídeo mais longa em diferentes orçamentos de tokens e reduz a latência de resposta enquanto processa substancialmente menos tokens de vídeo. Fonte - https://arxiv.org/pdf/2606.02569

Visão geral do AdaCodec. Esquerda, os vídeos são divididos em grupos adaptáveis de imagens, com quadros I completos reservados para momentos difíceis de prever e quadros P intermediários representados usando informações de movimento e resíduo compactas. Direita, o sistema resultante corresponde ou supera o Qwen3-VL-8B em onze benchmarks, mantém uma precisão de vídeo mais longa em diferentes orçamentos de tokens e reduz a latência de resposta enquanto processa substancialmente menos tokens de vídeo. Fonte

As economias, de acordo com os resultados relatados dos testes para o AdaCodec, valem a pena; o artigo afirma que o sistema superou o modelo Qwen3-VL-8B não modificado em todos os principais benchmarks, enquanto usava a mesma quantidade de processamento; e ainda correspondeu ou superou o desempenho desse modelo após cortar os tokens de vídeo por aproximadamente 86%.

Os autores afirmam*:

‘Nós nos inspiramos na codificação previsível, onde um sistema transmite erros de uma previsão em vez do sinal bruto. Esse princípio tem base biológica: o sistema visual é pensado para codificar erros de previsão, a discrepância entre a entrada esperada e observada, em vez da entrada em si.

‘Os codecs de vídeo modernos usam a mesma ideia de codificação residual na engenharia: quadros de referência carregam conteúdo completo, enquanto quadros previsíveis carregam sinais de movimento e resíduo relativos ao um referencial.

‘Esses sistemas têm objetivos diferentes, mas compartilham a mesma estrutura condicional: quando as amostras próximas são redundantes, o canal deve carregar o que a previsão não consegue explicar.

‘Os codecs padrão, no entanto, otimizam para bitstreams e reconstrução visível para humanos, não para tokens visuais consumidos por um LLM. Portanto, redesenhamos esse mecanismo como uma interface MLLM para compreensão de vídeo.’ [1]

O novo trabalho, escrito por 11 pesquisadores da Universidade Jiao Tong de Xangai, Instituto de Inovação de Xangai e JD.com, vem com uma página de projeto associada, com a promessa de lançamento do código-fonte.

Método

Como discutido, em vez de tratar cada quadro como uma imagem completamente nova, o sistema procura o que mudou entre um quadro e o próximo. À esquerda, na imagem abaixo, vemos uma pequena região do quadro atual que é  comparada com a região mais semelhante em um quadro anterior:

Visão geral esquemática do AdaCodec.

Visão geral esquemática do AdaCodec.

A distância entre as duas localizações se torna um vetor de movimento, enquanto as diferenças visuais restantes se tornam um resíduo, com essas descrições compactas substituindo a necessidade de armazenar uma imagem completa.

À direita, vemos as informações resultantes alimentadas no modelo de IA: quadros de referência importantes ainda são processados como imagens completas, mas os quadros intervenientes são representados por tokens de movimento e resíduo muito menores – aparentemente permitindo que o modelo retorne informações suficientes para analisar o vídeo, enquanto processa notavelmente menos dados visuais.

Um desafio interessante é decidir quais quadros merecem ser armazenados em seu formato completo: os codecs de vídeo tradicionais geralmente colocam quadros de referência em intervalos regulares, sejam necessários ou não. O AdaCodec, em vez disso, tenta identificar os momentos que mais importam.

Por exemplo, considere uma cena que principalmente retrata uma conversa estática entre duas pessoas em um apartamento – e de repente, uma equipe SWAT irrompe pela janela. Imediatamente as vistas da câmera e o número de cortes de edição aumentarão e exigirão muito mais dados do que um intervalo de quadro de referência regularizado poderia fornecer:

Sequência de quadros mostrando uma sala vazia, duas pessoas conversando, um grupo entrando pela janela, as duas pessoas sendo escoltadas para fora e a sala vazia novamente. A faixa de quadros intermediários abaixo mostra os mesmos eventos ao longo de uma linha do tempo mais longa, com quadros selecionados destacados em azul. Uma escala horizontal rotulada

Essa é a lógica por trás dos métodos de compressão de bitrate variável, que analisam o vídeo de origem para períodos “agitados” e atribuem mais dados onde são necessários – ao custo de tempo e recursos. [1]

No AdaCodec, se um quadro pode ser previsto com precisão a partir de quadros próximos, o sistema continua usando tokens de movimento e resíduo compactos; se a cena muda substancialmente (i.e., o exemplo do SWAT acima, ou algo menos dramático), um quadro de referência completo é inserido. Isso permite que mais do orçamento de processamento disponível seja gasto em informações visuais importantes em vez de ser distribuído uniformemente por todo o vídeo.

Dados e Testes

Em testes, os pesquisadores usaram o mencionado Qwen3-VL-8B como o modelo base e avaliaram o AdaCodec em onze benchmarks que abrangem três áreas de compreensão de vídeo: desempenho de vídeo longo foi avaliado com MLVU, LongVideoBench e LVBench; compreensão temporal com TempCompass, MotionBench e TOMATO; e compreensão de vídeo geral com Video-MME, MVBench, NExT-QA, PerceptionTest e EgoSchema.

Os modelos de código aberto testados foram InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; e Molmo2-O-7B.

O GPT-5, Gemini e as variações Claude aparecem na tabela abaixo apenas como linhas de base de comparação. CoPE-VideoLM-7B e ReMoRa-7B são modelos de linguagem de vídeo anteriores que reduzem o uso de tokens visuais por meio de compressão inspirada em codec, tornando-os os concorrentes diretos mais próximos do AdaCodec:

Principais resultados em onze benchmarks que abrangem compreensão de vídeo longo, raciocínio temporal e compreensão de vídeo geral. Pontuações mais altas indicam melhor desempenho. LVB = LongVideoBench; V-MME = Video-MME. Valores em negrito e sublinhado indicam as pontuações mais altas e as segundas mais altas entre os modelos de código aberto. As pontuações dos modelos de código fechado foram obtidas a partir de relatórios oficiais, quando disponíveis, com resultados ausentes obtidos a partir do Molmo2 ou avaliados pelos autores.

Principais resultados em onze benchmarks que abrangem compreensão de vídeo longo, raciocínio temporal e compreensão de vídeo geral. Pontuações mais altas indicam melhor desempenho. LVB = LongVideoBench; V-MME = Video-MME. Valores em negrito e sublinhado indicam as pontuações mais altas e as segundas mais altas entre os modelos de código aberto. As pontuações dos modelos de código fechado foram obtidas a partir de relatórios oficiais, quando disponíveis, com resultados ausentes obtidos a partir do Molmo2 ou avaliados pelos autores.

Para garantir uma comparação justa, o mesmo número de tokens visuais foi alocado para o AdaCodec e o sistema Qwen3-VL-8B padrão, permitindo que os resultados refletissem a eficácia da abordagem de compressão, em vez de quaisquer diferenças nos recursos computacionais.

Na configuração mais agressiva, o AdaCodec reduziu o uso de tokens visuais em cerca de 86% enquanto ainda correspondia ou ligeiramente superava o sistema de linha de base em tarefas de compreensão de vídeo longo, temporal e geral.

Quando os tokens economizados foram reinvestidos no processamento de mais quadros de vídeo, o desempenho melhorou em todos os benchmarks de vídeo longo e todos os benchmarks temporais, com ganhos alcançando +5,4 pontos no LongVideoBench e +4,3 pontos no TOMATO, enquanto também produziam alguns dos resultados de código aberto mais fortes no estudo.

Conclusão

Embora projetos dessa natureza sejam geralmente direcionados a provedores de hiperscale, esse é o tipo de esforço que será de interesse para hobistas e PMEs, como parte de um novo “ascetismo público” em torno do deploy de IA local e racionalizado.

Em comunidades como r/stablediffusion, isso é velha notícia, pois cada lançamento de código aberto importante que chega lá é regularmente torturado em uma versão hiper-otimizada (GGUF, pesos quantizados, etc.) capaz de executar, com alguma paciência, em placas gráficas de baixo custo.

Se a “etapa performática” dessa terceira onda de IA de fato acabou, e com a suposição de que as corporações serão repelidas pelos custos reais da inferência, então iniciativas como o AdaCodec podem compor parte de uma “grande otimização” vindoura.

 

† Isso não é o mesmo que renderizar o vídeo em um formato amigável ao usuário/tamanho do arquivo; em vez disso, lida com a geração interna e a colação de quadros que ocorre dentro do modelo de IA no momento da inferência.

* Minha conversão, dentro do razoável, das citações em linha dos autores para hiperlinks.

Publicado pela primeira vez na quinta-feira, 4 de junho de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai