Ãngulo de Anderson
Um Codec de VÃdeo para Footage Gerado por IA

à medida que a era do âcomer-tudoâ da IA chega ao fim, uma nova abordagem econÃīmica para a geraçÃĢo de vÃdeo de IA promete economias notÃĄveis em tokens e tempo.
Â
O verdadeiro custo da inferÊncia de IA estÃĄ trazendo uma nova nota de sobriedade ao ritmo acelerado da atual revoluçÃĢo de IA, com aumento do interesse em racionalizar o custo do aprendizado de mÃĄquina. AlÃĐm do potencial de trazer a IA para dentro, e o aumento geral da IA privada, as rotinas de aprendizado de mÃĄquina famintas de VRAM e devoradoras de recursos precisarÃĢo ser otimizadas tambÃĐm.
A geraçÃĢo de vÃdeo ÃĐ talvez a maior infratora nesse respeito. Se vocÊ jÃĄ recompensou um filme ou exportou um de um conjunto de ediçÃĢo de vÃdeo, vocÊ jÃĄ sabe o custo que essa tarefa especÃfica (nÃĢo IA) impÃĩe ao seu hardware â consumindo RAM e ciclos de CPU, e frequentemente bloqueando a mÃĄquina para qualquer outro uso, a menos que medidas sejam tomadas para limitar o impacto do algoritmo de compressÃĢo no computador hospedeiro.
Portanto, ÃĐ necessÃĄrio apenas imaginar a extensÃĢo com que o aumento do vÃdeo de IA estÃĄ repetindo esse procedimento âlouco por poderâ em centros de dados em todo o mundo. Nessa escala de operaçÃĢo, os menores ganhos se tornam imediatamente significativos na contabilidade agregada.
No Quadro
Com isso em mente, uma nova oferta de pesquisa de Xangai, em colaboraçÃĢo com a JD.com, estÃĄ propondo um codec de vÃdeo destinado nÃĢo ao processo de renderizaçÃĢo (o processo de compressÃĢo de quadros brutos em um tamanho de arquivo de vÃdeo menor), mas ao prÃģprio processo de geraçÃĢo de vÃdeo de IA.
Um codec de vÃdeo normal funciona nÃĢo armazenando cada quadro como uma imagem completa, mas criando um nÚmero menor de imagens completas, chamadas quadros I, e entÃĢo armazenando alteraçÃĩes entre quadros.
Por exemplo, se uma pessoa se move ligeiramente em um vÃdeo, o codec registra apenas as partes do quadro que registram essa alteraçÃĢo, em vez de reescrever toda a cena. Esses sÃĢo quadros P, que sÃĢo derivados de quadros anteriores, e quadros B, que tambÃĐm podem antecipar informaçÃĩes em quadros futuros:

Anatomia de um codec de vÃdeo: linha superior mostra quadros ao longo do tempo rotulados I, P e B, com quadros I armazenados em cores completas e quadros P e B mostrados desvanecidos para indicar reconstruçÃĢo; setas indicam se os quadros usam quadros anteriores, quadros posteriores ou ambos; painÃĐis inferiores mostram um quadro armazenado completamente (quadro I, esquerda), um quadro construÃdo a partir de um quadro anterior (quadro P, segunda-esquerda), e um quadro construÃdo a partir de quadros anteriores e posteriores (quadro B, direita).
Essa reutilizaçÃĢo de informaçÃĩes prÃģximas ÃĐ por que os arquivos de vÃdeo permanecem pequenos, com a maioria dos quadros operando nÃĢo como novas imagens, mas como instruçÃĩes que descrevem como o quadro anterior mudou. Portanto, os quadros I constituem imagens âcheiasâ, que consomem espaço, com os quadros entre eles constituindo apenas a diferença entre os quadros I (e entre si).
Quando cada quadro ÃĐ uma imagem nÃĢo comprimida, o filme essencialmente tem nenhuma compressÃĢo. Salvar um filme dessa forma, como vÃdeo nÃĢo comprimido, resultaria em um filme de 2 horas necessitando de cerca de (ou mais de) um terabyte de espaço em disco. No entanto, ÃĐ assim que a IA faz filmesâ â dedicando recursos e tokens iguais a cada quadro, quando calcula como formular o vÃdeo.
Economia de Escala
O novo trabalho, intitulado AdaCodec: Um CÃģdigo de VÃdeo PrevisÃvel para MLLMs de VÃdeo, gasta tokens visuais completos exclusivamente em quadros de referÊncia (quadros I), com todos os quadros intersticiais renderizados como âtokens P compactosâ â um paradigma claramente tomado da compressÃĢo tradicional empregada por codecs de vÃdeo histÃģricos.
Depois que a compressÃĢo interna ocorreu, o vÃdeo de IA pode ser comprimido normalmente, e, em teoria, todas as economias sÃĢo de lado do servidor:

VisÃĢo geral do AdaCodec. Esquerda, os vÃdeos sÃĢo divididos em grupos adaptÃĄveis de imagens, com quadros I completos reservados para momentos difÃceis de prever e quadros P intermediÃĄrios representados usando informaçÃĩes de movimento e resÃduo compactas. Direita, o sistema resultante corresponde ou supera o Qwen3-VL-8B em onze benchmarks, mantÃĐm uma precisÃĢo de vÃdeo mais longa em diferentes orçamentos de tokens e reduz a latÊncia de resposta enquanto processa substancialmente menos tokens de vÃdeo. Fonte
As economias, de acordo com os resultados relatados dos testes para o AdaCodec, valem a pena; o artigo afirma que o sistema superou o modelo Qwen3-VL-8B nÃĢo modificado em todos os principais benchmarks, enquanto usava a mesma quantidade de processamento; e ainda correspondeu ou superou o desempenho desse modelo apÃģs cortar os tokens de vÃdeo por aproximadamente 86%.
Os autores afirmam*:
âNÃģs nos inspiramos na codificaçÃĢo previsÃvel, onde um sistema transmite erros de uma previsÃĢo em vez do sinal bruto. Esse princÃpio tem base biolÃģgica: o sistema visual ÃĐ pensado para codificar erros de previsÃĢo, a discrepÃĒncia entre a entrada esperada e observada, em vez da entrada em si.
âOs codecs de vÃdeo modernos usam a mesma ideia de codificaçÃĢo residual na engenharia: quadros de referÊncia carregam conteÚdo completo, enquanto quadros previsÃveis carregam sinais de movimento e resÃduo relativos ao um referencial.
âEsses sistemas tÊm objetivos diferentes, mas compartilham a mesma estrutura condicional: quando as amostras prÃģximas sÃĢo redundantes, o canal deve carregar o que a previsÃĢo nÃĢo consegue explicar.
âOs codecs padrÃĢo, no entanto, otimizam para bitstreams e reconstruçÃĢo visÃvel para humanos, nÃĢo para tokens visuais consumidos por um LLM. Portanto, redesenhamos esse mecanismo como uma interface MLLM para compreensÃĢo de vÃdeo.â
O novo trabalho, escrito por 11 pesquisadores da Universidade Jiao Tong de Xangai, Instituto de InovaçÃĢo de Xangai e JD.com, vem com uma pÃĄgina de projeto associada, com a promessa de lançamento do cÃģdigo-fonte.
MÃĐtodo
Como discutido, em vez de tratar cada quadro como uma imagem completamente nova, o sistema procura o que mudou entre um quadro e o prÃģximo. Ã esquerda, na imagem abaixo, vemos uma pequena regiÃĢo do quadro atual que ÃĐ Â comparada com a regiÃĢo mais semelhante em um quadro anterior:

VisÃĢo geral esquemÃĄtica do AdaCodec.
A distÃĒncia entre as duas localizaçÃĩes se torna um vetor de movimento, enquanto as diferenças visuais restantes se tornam um resÃduo, com essas descriçÃĩes compactas substituindo a necessidade de armazenar uma imagem completa.
à direita, vemos as informaçÃĩes resultantes alimentadas no modelo de IA: quadros de referÊncia importantes ainda sÃĢo processados como imagens completas, mas os quadros intervenientes sÃĢo representados por tokens de movimento e resÃduo muito menores â aparentemente permitindo que o modelo retorne informaçÃĩes suficientes para analisar o vÃdeo, enquanto processa notavelmente menos dados visuais.
Um desafio interessante ÃĐ decidir quais quadros merecem ser armazenados em seu formato completo: os codecs de vÃdeo tradicionais geralmente colocam quadros de referÊncia em intervalos regulares, sejam necessÃĄrios ou nÃĢo. O AdaCodec, em vez disso, tenta identificar os momentos que mais importam.
Por exemplo, considere uma cena que principalmente retrata uma conversa estÃĄtica entre duas pessoas em um apartamento â e de repente, uma equipe SWAT irrompe pela janela. Imediatamente as vistas da cÃĒmera e o nÚmero de cortes de ediçÃĢo aumentarÃĢo e exigirÃĢo muito mais dados do que um intervalo de quadro de referÊncia regularizado poderia fornecer:

Essa ÃĐ a lÃģgica por trÃĄs dos mÃĐtodos de compressÃĢo de bitrate variÃĄvel, que analisam o vÃdeo de origem para perÃodos âagitadosâ e atribuem mais dados onde sÃĢo necessÃĄrios â ao custo de tempo e recursos.
No AdaCodec, se um quadro pode ser previsto com precisÃĢo a partir de quadros prÃģximos, o sistema continua usando tokens de movimento e resÃduo compactos; se a cena muda substancialmente (i.e., o exemplo do SWAT acima, ou algo menos dramÃĄtico), um quadro de referÊncia completo ÃĐ inserido. Isso permite que mais do orçamento de processamento disponÃvel seja gasto em informaçÃĩes visuais importantes em vez de ser distribuÃdo uniformemente por todo o vÃdeo.
Dados e Testes
Em testes, os pesquisadores usaram o mencionado Qwen3-VL-8B como o modelo base e avaliaram o AdaCodec em onze benchmarks que abrangem trÊs ÃĄreas de compreensÃĢo de vÃdeo: desempenho de vÃdeo longo foi avaliado com MLVU, LongVideoBench e LVBench; compreensÃĢo temporal com TempCompass, MotionBench e TOMATO; e compreensÃĢo de vÃdeo geral com Video-MME, MVBench, NExT-QA, PerceptionTest e EgoSchema.
Os modelos de cÃģdigo aberto testados foram InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; e Molmo2-O-7B.
O GPT-5, Gemini e as variaçÃĩes Claude aparecem na tabela abaixo apenas como linhas de base de comparaçÃĢo. CoPE-VideoLM-7B e ReMoRa-7B sÃĢo modelos de linguagem de vÃdeo anteriores que reduzem o uso de tokens visuais por meio de compressÃĢo inspirada em codec, tornando-os os concorrentes diretos mais prÃģximos do AdaCodec:

Principais resultados em onze benchmarks que abrangem compreensÃĢo de vÃdeo longo, raciocÃnio temporal e compreensÃĢo de vÃdeo geral. PontuaçÃĩes mais altas indicam melhor desempenho. LVB = LongVideoBench; V-MME = Video-MME. Valores em negrito e sublinhado indicam as pontuaçÃĩes mais altas e as segundas mais altas entre os modelos de cÃģdigo aberto. As pontuaçÃĩes dos modelos de cÃģdigo fechado foram obtidas a partir de relatÃģrios oficiais, quando disponÃveis, com resultados ausentes obtidos a partir do Molmo2 ou avaliados pelos autores.
Para garantir uma comparaçÃĢo justa, o mesmo nÚmero de tokens visuais foi alocado para o AdaCodec e o sistema Qwen3-VL-8B padrÃĢo, permitindo que os resultados refletissem a eficÃĄcia da abordagem de compressÃĢo, em vez de quaisquer diferenças nos recursos computacionais.
Na configuraçÃĢo mais agressiva, o AdaCodec reduziu o uso de tokens visuais em cerca de 86% enquanto ainda correspondia ou ligeiramente superava o sistema de linha de base em tarefas de compreensÃĢo de vÃdeo longo, temporal e geral.
Quando os tokens economizados foram reinvestidos no processamento de mais quadros de vÃdeo, o desempenho melhorou em todos os benchmarks de vÃdeo longo e todos os benchmarks temporais, com ganhos alcançando +5,4 pontos no LongVideoBench e +4,3 pontos no TOMATO, enquanto tambÃĐm produziam alguns dos resultados de cÃģdigo aberto mais fortes no estudo.
ConclusÃĢo
Embora projetos dessa natureza sejam geralmente direcionados a provedores de hiperscale, esse ÃĐ o tipo de esforço que serÃĄ de interesse para hobistas e PMEs, como parte de um novo âascetismo pÚblicoâ em torno do deploy de IA local e racionalizado.
Em comunidades como r/stablediffusion, isso ÃĐ velha notÃcia, pois cada lançamento de cÃģdigo aberto importante que chega lÃĄ ÃĐ regularmente torturado em uma versÃĢo hiper-otimizada (GGUF, pesos quantizados, etc.) capaz de executar, com alguma paciÊncia, em placas grÃĄficas de baixo custo.
Se a âetapa performÃĄticaâ dessa terceira onda de IA de fato acabou, e com a suposiçÃĢo de que as corporaçÃĩes serÃĢo repelidas pelos custos reais da inferÊncia, entÃĢo iniciativas como o AdaCodec podem compor parte de uma âgrande otimizaçÃĢoâ vindoura.
Â
â Isso nÃĢo ÃĐ o mesmo que renderizar o vÃdeo em um formato amigÃĄvel ao usuÃĄrio/tamanho do arquivo; em vez disso, lida com a geraçÃĢo interna e a colaçÃĢo de quadros que ocorre dentro do modelo de IA no momento da inferÊncia.
* Minha conversÃĢo, dentro do razoÃĄvel, das citaçÃĩes em linha dos autores para hiperlinks.
Publicado pela primeira vez na quinta-feira, 4 de junho de 2026












