Ángulo de Anderson

Un CÃģdec de Video para Metraje Generado por IA

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

Al acercarse el final de la era de “todo lo que puedas comer” de la IA, un nuevo enfoque econÃģmico para la generaciÃģn de video de IA promete ahorros significativos en tokens y tiempo.

 

El verdadero costo de la inferencia de IA estÃĄ trayendo una nueva nota de sobriedad al ritmo acelerado de la actual revoluciÃģn de la IA, con un mayor interÃĐs en racionalizar el costo del aprendizaje automÃĄtico. AdemÃĄs del potencial de llevar la IA a casa, y el ascenso general de la IA privada, las rutinas de aprendizaje automÃĄtico hambrientas de VRAM y voraces de recursos tambiÃĐn necesitarÃĄn optimizaciÃģn.

La generaciÃģn de video es quizÃĄs el mayor infractor en este sentido. Si alguna vez has recomprimido una película o la has exportado desde una suite de ediciÃģn de video, ya sabes el costo que este proceso en particular (no de IA) tiene en tu hardware – consumiendo RAM y ciclos de CPU, y a menudo bloqueando la mÃĄquina para cualquier otro uso, a menos que se tomen medidas para limitar el impacto del algoritmo de compresiÃģn en la computadora anfitriona.

Por lo tanto, solo hay que imaginar la medida en que el ascenso del video de IA estÃĄ repitiendo este procedimiento “locura de poder” en centros de datos de todo el mundo. A esa escala de operaciÃģn, las ganancias mÃĄs pequeÃąas se vuelven inmediatamente significativas en la contabilidad agregada.

En el Marco

Con esto en mente, una nueva oferta de investigaciÃģn de ShanghÃĄi, en colaboraciÃģn con JD.com, estÃĄ proponiendo un cÃģdec de video dirigido no al proceso de renderizado (el proceso de comprimir grandes marcos raw en un tamaÃąo de archivo de video mÃĄs pequeÃąo), sino al propio proceso de generaciÃģn de video de IA.

Un cÃģdec de video normal funciona almacenando no todas las imÃĄgenes como imÃĄgenes completas, sino creando un nÚmero menor de imÃĄgenes completas, llamadas marcos I, y luego almacenando cambios entre marcos.

Por ejemplo, si una persona se mueve ligeramente en un video, el cÃģdec registra solo las partes del marco que registran ese cambio, en lugar de reescribir toda la escena. Estos son marcos P, que se derivan de marcos anteriores, y marcos B, que tambiÃĐn pueden anticipar informaciÃģn en marcos futuros:

Anatomía de un cÃģdec de video: la fila superior muestra marcos a lo largo del tiempo etiquetados como I, P y B, con marcos I almacenados completamente en color completo y marcos P y B mostrados desvanecidos para indicar reconstrucciÃģn; las flechas indican si los marcos utilizan marcos anteriores, marcos posteriores o ambos; los paneles inferiores muestran un marco almacenado completamente (marco I, izquierda), un marco construido a partir de un marco anterior (marco P, segunda izquierda), y un marco construido a partir de marcos anteriores y posteriores (marco B, derecha).

Anatomía de un cÃģdec de video: la fila superior muestra marcos a lo largo del tiempo etiquetados como I, P y B, con marcos I almacenados completamente en color completo y marcos P y B mostrados desvanecidos para indicar reconstrucciÃģn; las flechas indican si los marcos utilizan marcos anteriores, marcos posteriores o ambos; los paneles inferiores muestran un marco almacenado completamente (marco I, izquierda), un marco construido a partir de un marco anterior (marco P, segunda izquierda), y un marco construido a partir de marcos anteriores y posteriores (marco B, derecha).

Este reuso de informaciÃģn cercana es por quÃĐ los archivos de video permanecen pequeÃąos, con la mayoría de los marcos operando no como nuevas imÃĄgenes, sino como instrucciones que describen cÃģmo ha cambiado el marco anterior. Por lo tanto, los marcos I constituyen imÃĄgenes “completas”, que consumen espacio, con los marcos entre ellos constituyendo solo la diferencia entre los marcos I (y entre sí mismos).

Cuando cada marco individual es una imagen no comprimida, la película esencialmente no tiene compresiÃģn. Guardar una película de esta manera, como video no comprimido, resultaría en una película de 2 horas que necesitaría casi (o mÃĄs de) un terabyte de espacio en disco. Sin embargo, esto es cÃģmo la IA hace películas† – dedicando recursos y tokens iguales a cada marco, cuando estÃĄ calculando cÃģmo formular el video.

Economía de Escala

El nuevo trabajo, titulado AdaCodec: Un CÃģdec de Video Predictivo para MLLMs de Video, en lugar de eso, gasta tokens visuales completos exclusivamente en marcos de referencia (marcos I), con todos los marcos intermedios representados como ‘tokens P compactos’ – un paradigma claramente tomado de la compresiÃģn tradicional empleada por cÃģdecs de video histÃģricos.

DespuÃĐs de que esta compresiÃģn interna ha tenido lugar, el video de IA generado puede ser comprimido normalmente, y, en teoría, todos los ahorros son del lado del servidor:

VisiÃģn general de AdaCodec. Izquierda, los videos se dividen en grupos de imÃĄgenes adaptativas, con marcos I completos reservados para momentos que son difíciles de predecir y marcos P intermedios representados usando informaciÃģn de movimiento y residual compacta. Derecha, el sistema resultante coincide o supera a Qwen3-VL-8B en once benchmarks, mantiene una mayor precisiÃģn de video largo en todos los presupuestos de tokens y reduce la latencia de respuesta mientras procesa sustancialmente menos tokens de video. Fuente - https://arxiv.org/pdf/2606.02569

VisiÃģn general de AdaCodec. Izquierda, los videos se dividen en grupos de imÃĄgenes adaptativas, con marcos I completos reservados para momentos que son difíciles de predecir y marcos P intermedios representados usando informaciÃģn de movimiento y residual compacta. Derecha, el sistema resultante coincide o supera a Qwen3-VL-8B en once benchmarks, mantiene una mayor precisiÃģn de video largo en todos los presupuestos de tokens y reduce la latencia de respuesta mientras procesa sustancialmente menos tokens de video. Fuente

Los ahorros, segÚn los resultados informados de las pruebas para AdaCodec, son dignos de perseguir; el documento establece que el sistema superÃģ al modelo Qwen3-VL-8B no modificado en todos los benchmarks principales, mientras utilizaba la misma cantidad de procesamiento; y aÚn coincidiÃģ o superÃģ el rendimiento de ese modelo despuÃĐs de reducir los tokens de video en un aproximado del 86%.

Los autores establecen*:

‘Nos inspiramos en la codificaciÃģn predictiva, donde un sistema transmite errores de una predicciÃģn en lugar de la seÃąal cruda. Este principio tiene una base biolÃģgica: se cree que el sistema visual codifica errores de predicciÃģn, la discrepancia entre la entrada esperada y observada, en lugar de la entrada misma.

‘Los cÃģdecs de video modernos utilizan la misma idea de codificaciÃģn residual en ingeniería: los marcos de referencia llevan contenido completo, mientras que los marcos predictivos llevan seÃąales de movimiento y residual relativas a un marco de referencia.

‘Estos sistemas tienen objetivos diferentes, pero comparten la misma estructura condicional: cuando las muestras cercanas son redundantes, el canal debe llevar lo que la predicciÃģn no logra explicar.

‘Los cÃģdecs estÃĄndar, sin embargo, se optimizan para flujos de bits y reconstrucciÃģn visible para humanos, no para tokens visuales consumidos por un MLLM. Por lo tanto, redesignamos este mecanismo como una interfaz de MLLM para la comprensiÃģn de video.’

El nuevo trabajo, escrito por 11 investigadores de la Universidad Jiao Tong de ShanghÃĄi, el Instituto de InnovaciÃģn de ShanghÃĄi y JD.com, viene con una pÃĄgina de proyecto asociada, con la promesa de lanzar el cÃģdigo fuente.

MÃĐtodo

Como se discutiÃģ, en lugar de tratar cada marco como una imagen completamente nueva, el sistema busca quÃĐ cambiÃģ entre un marco y el siguiente. A la izquierda, en la imagen de abajo, vemos una pequeÃąa regiÃģn del marco actual que se coincide con la regiÃģn mÃĄs similar en un marco anterior:

VisiÃģn general del esquema para AdaCodec.

VisiÃģn general del esquema para AdaCodec.

La distancia entre las dos ubicaciones se convierte en un vector de movimiento, mientras que las diferencias visuales restantes se convierten en un residual, con estas descripciones compactas reemplazando la necesidad de almacenar una imagen completa.

A la derecha, vemos la informaciÃģn resultante alimentada al modelo de IA: los marcos de referencia importantes todavía se procesan como imÃĄgenes completas, pero los marcos intermedios se representan mediante tokens de movimiento y residual mucho mÃĄs pequeÃąos – aparentemente permitiendo que el modelo retenga suficiente informaciÃģn para analizar el video, mientras procesa notablemente menos datos visuales.

Un desafío interesante es decidir quÃĐ marcos merecen ser almacenados en su totalidad: los cÃģdecs de video tradicionales suelen colocar marcos de referencia a intervalos regulares, ya sea que sean necesarios o no. AdaCodec, en cambio, intenta identificar los momentos que importan mÃĄs.

Por ejemplo, considere una escena que principalmente muestra una conversaciÃģn estÃĄtica entre dos personas en un apartamento – y de repente, un equipo de SWAT irrumpe a travÃĐs de la ventana. Inmediatamente, las vistas de la cÃĄmara y el nÚmero de cortes de ediciÃģn aumentarÃĄn y requerirÃĄn mucha mÃĄs datos de lo que un intervalo de marco de referencia regularizado proporcionaría:

Secuencia de marcos que muestra una habitaciÃģn vacía, dos personas hablando, un grupo entrando a travÃĐs de la ventana, las dos personas siendo escoltadas, y la habitaciÃģn vacía de nuevo. La tira de marcos intermedios debajo muestra los mismos eventos a lo largo de una línea de tiempo mÃĄs larga, con marcos seleccionados resaltados en azul. Una escala horizontal etiquetada como

Esta es la lÃģgica detrÃĄs de los mÃĐtodos de compresiÃģn de bitrate variable, que analizan el video de origen en busca de períodos "ocupados" y asignan mÃĄs datos donde se necesitan – a un costo no pequeÃąo de tiempo y recursos.

En AdaCodec, si un marco se puede predecir con precisiÃģn a partir de marcos cercanos, el sistema continÚa utilizando tokens de movimiento y residual compactos; si la escena cambia sustancialmente (es decir, el ejemplo de SWAT anterior, o algo menos dramÃĄtico), se inserta un marco de referencia completo. Esto permite que mÃĄs del presupuesto de procesamiento disponible se gaste en informaciÃģn visual importante en lugar de distribuirse uniformemente en todo el video.

Datos y Pruebas

En las pruebas, los investigadores utilizaron el mencionado Qwen3-VL-8B como el modelo base y evaluaron a AdaCodec en once benchmarks que abarcan tres ÃĄreas de comprensiÃģn de video: rendimiento de video largo se evaluÃģ con MLVU, LongVideoBench y LVBench; comprensiÃģn temporal con TempCompass, MotionBench y TOMATO; y comprensiÃģn general de video con Video-MME, MVBench, NExT-QA, PerceptionTest y EgoSchema.

Los modelos de cÃģdigo abierto probados fueron InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; y Molmo2-O-7B.

Las variaciones GPT-5, Gemini y Claude aparecen en la tabla a continuaciÃģn solo como líneas de base de comparaciÃģn. CoPE-VideoLM-7B y ReMoRa-7B son modelos de lenguaje de video anteriores que reducen el uso de tokens visuales a travÃĐs de la compresiÃģn inspirada en cÃģdecs, lo que los convierte en los competidores directos mÃĄs cercanos a AdaCodec:

Resultados principales en once benchmarks que cubren comprensiÃģn de video largo, razonamiento temporal y comprensiÃģn general de video. Las puntuaciones mÃĄs altas indican un mejor rendimiento. LVB = LongVideoBench; V-MME = Video-MME. Los valores en negrita y subrayados indican las puntuaciones mÃĄs altas y segundas mÃĄs altas entre los modelos de cÃģdigo abierto. Las puntuaciones de los modelos de cÃģdigo cerrado se tomaron de los informes oficiales cuando estuvieron disponibles, con resultados faltantes obtenidos de Molmo2 o evaluados por los autores.

Resultados principales en once benchmarks que cubren comprensiÃģn de video largo, razonamiento temporal y comprensiÃģn general de video. Las puntuaciones mÃĄs altas indican un mejor rendimiento. LVB = LongVideoBench; V-MME = Video-MME. Los valores en negrita y subrayados indican las puntuaciones mÃĄs altas y segundas mÃĄs altas entre los modelos de cÃģdigo abierto. Las puntuaciones de los modelos de cÃģdigo cerrado se tomaron de los informes oficiales cuando estuvieron disponibles, con resultados faltantes obtenidos de Molmo2, o evaluados por los autores.

Para garantizar una comparaciÃģn justa, se asignÃģ el mismo nÚmero de tokens visuales a AdaCodec y al sistema Qwen3-VL-8B estÃĄndar, lo que permite que los resultados reflejen la efectividad del enfoque de compresiÃģn, en lugar de cualquier diferencia en los recursos computacionales.

En la configuraciÃģn mÃĄs agresiva, AdaCodec redujo el uso de tokens visuales en aproximadamente un 86% mientras aÚn coincidía o ligeramente superaba al sistema base en tareas de comprensiÃģn de video largo, temporal y general.

Cuando los tokens ahorrados se reinvertían en el procesamiento de mÃĄs marcos de video, el rendimiento mejorÃģ en todos los benchmarks de video largo y todos los benchmarks temporales, con ganancias que alcanzaron +5.4 puntos en LongVideoBench y +4.3 puntos en TOMATO, mientras tambiÃĐn producía algunos de los resultados de cÃģdigo abierto mÃĄs fuertes en el estudio.

ConclusiÃģn

Aunque los proyectos de este tipo suelen estar dirigidos a proveedores de hipercala, este es el tipo de esfuerzo que serÃĄ de interÃĐs para los aficionados y las PYME, como parte de una posible nueva “ascÃĐtica pÚblica” en torno a la implementaciÃģn de IA local y racionalizada.

En comunidades como r/stablediffusion, esto es muy vieja noticia, ya que cada lanzamiento importante de cÃģdigo abierto que llega allí se ve regularmente atormentado en una versiÃģn hiperoptimizada (GGUF, pesos cuantificados, etc.) capaz de ejecutarse, con algo de paciencia, en tarjetas grÃĄficas de gama baja.

Si la etapa “performÃĄtica” de esta tercera oleada de IA de hecho estÃĄ terminando, y asumiendo que las corporaciones serÃĄn repelidas por los verdaderos costos de inferencia, entonces iniciativas como AdaCodec pueden formar parte de una prÃģxima “gran optimizaciÃģn”.

 

† Esto no es lo mismo que renderizar el video en un formato amigable para el usuario/tamaÃąo de archivo; mÃĄs bien, se trata de la generaciÃģn y collaciÃģn interna de marcos que tiene lugar dentro del modelo de IA en el momento de la inferencia.

* Mi conversiÃģn, dentro de lo razonable, de las citas en línea de los autores a enlaces.

Publicado por primera vez el jueves 4 de junio de 2026

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]