Ãngulo de Anderson
Un CÃģdec de Video para Metraje Generado por IA

Al acercarse el final de la era de âtodo lo que puedas comerâ de la IA, un nuevo enfoque econÃģmico para la generaciÃģn de video de IA promete ahorros significativos en tokens y tiempo.
Â
El verdadero costo de la inferencia de IA estÃĄ trayendo una nueva nota de sobriedad al ritmo acelerado de la actual revoluciÃģn de la IA, con un mayor interÃĐs en racionalizar el costo del aprendizaje automÃĄtico. AdemÃĄs del potencial de llevar la IA a casa, y el ascenso general de la IA privada, las rutinas de aprendizaje automÃĄtico hambrientas de VRAM y voraces de recursos tambiÃĐn necesitarÃĄn optimizaciÃģn.
La generaciÃģn de video es quizÃĄs el mayor infractor en este sentido. Si alguna vez has recomprimido una pelÃcula o la has exportado desde una suite de ediciÃģn de video, ya sabes el costo que este proceso en particular (no de IA) tiene en tu hardware â consumiendo RAM y ciclos de CPU, y a menudo bloqueando la mÃĄquina para cualquier otro uso, a menos que se tomen medidas para limitar el impacto del algoritmo de compresiÃģn en la computadora anfitriona.
Por lo tanto, solo hay que imaginar la medida en que el ascenso del video de IA estÃĄ repitiendo este procedimiento âlocura de poderâ en centros de datos de todo el mundo. A esa escala de operaciÃģn, las ganancias mÃĄs pequeÃąas se vuelven inmediatamente significativas en la contabilidad agregada.
En el Marco
Con esto en mente, una nueva oferta de investigaciÃģn de ShanghÃĄi, en colaboraciÃģn con JD.com, estÃĄ proponiendo un cÃģdec de video dirigido no al proceso de renderizado (el proceso de comprimir grandes marcos raw en un tamaÃąo de archivo de video mÃĄs pequeÃąo), sino al propio proceso de generaciÃģn de video de IA.
Un cÃģdec de video normal funciona almacenando no todas las imÃĄgenes como imÃĄgenes completas, sino creando un nÚmero menor de imÃĄgenes completas, llamadas marcos I, y luego almacenando cambios entre marcos.
Por ejemplo, si una persona se mueve ligeramente en un video, el cÃģdec registra solo las partes del marco que registran ese cambio, en lugar de reescribir toda la escena. Estos son marcos P, que se derivan de marcos anteriores, y marcos B, que tambiÃĐn pueden anticipar informaciÃģn en marcos futuros:

AnatomÃa de un cÃģdec de video: la fila superior muestra marcos a lo largo del tiempo etiquetados como I, P y B, con marcos I almacenados completamente en color completo y marcos P y B mostrados desvanecidos para indicar reconstrucciÃģn; las flechas indican si los marcos utilizan marcos anteriores, marcos posteriores o ambos; los paneles inferiores muestran un marco almacenado completamente (marco I, izquierda), un marco construido a partir de un marco anterior (marco P, segunda izquierda), y un marco construido a partir de marcos anteriores y posteriores (marco B, derecha).
Este reuso de informaciÃģn cercana es por quÃĐ los archivos de video permanecen pequeÃąos, con la mayorÃa de los marcos operando no como nuevas imÃĄgenes, sino como instrucciones que describen cÃģmo ha cambiado el marco anterior. Por lo tanto, los marcos I constituyen imÃĄgenes âcompletasâ, que consumen espacio, con los marcos entre ellos constituyendo solo la diferencia entre los marcos I (y entre sà mismos).
Cuando cada marco individual es una imagen no comprimida, la pelÃcula esencialmente no tiene compresiÃģn. Guardar una pelÃcula de esta manera, como video no comprimido, resultarÃa en una pelÃcula de 2 horas que necesitarÃa casi (o mÃĄs de) un terabyte de espacio en disco. Sin embargo, esto es cÃģmo la IA hace pelÃculasâ â dedicando recursos y tokens iguales a cada marco, cuando estÃĄ calculando cÃģmo formular el video.
EconomÃa de Escala
El nuevo trabajo, titulado AdaCodec: Un CÃģdec de Video Predictivo para MLLMs de Video, en lugar de eso, gasta tokens visuales completos exclusivamente en marcos de referencia (marcos I), con todos los marcos intermedios representados como âtokens P compactosâ â un paradigma claramente tomado de la compresiÃģn tradicional empleada por cÃģdecs de video histÃģricos.
DespuÃĐs de que esta compresiÃģn interna ha tenido lugar, el video de IA generado puede ser comprimido normalmente, y, en teorÃa, todos los ahorros son del lado del servidor:

VisiÃģn general de AdaCodec. Izquierda, los videos se dividen en grupos de imÃĄgenes adaptativas, con marcos I completos reservados para momentos que son difÃciles de predecir y marcos P intermedios representados usando informaciÃģn de movimiento y residual compacta. Derecha, el sistema resultante coincide o supera a Qwen3-VL-8B en once benchmarks, mantiene una mayor precisiÃģn de video largo en todos los presupuestos de tokens y reduce la latencia de respuesta mientras procesa sustancialmente menos tokens de video. Fuente
Los ahorros, segÚn los resultados informados de las pruebas para AdaCodec, son dignos de perseguir; el documento establece que el sistema superÃģ al modelo Qwen3-VL-8B no modificado en todos los benchmarks principales, mientras utilizaba la misma cantidad de procesamiento; y aÚn coincidiÃģ o superÃģ el rendimiento de ese modelo despuÃĐs de reducir los tokens de video en un aproximado del 86%.
Los autores establecen*:
âNos inspiramos en la codificaciÃģn predictiva, donde un sistema transmite errores de una predicciÃģn en lugar de la seÃąal cruda. Este principio tiene una base biolÃģgica: se cree que el sistema visual codifica errores de predicciÃģn, la discrepancia entre la entrada esperada y observada, en lugar de la entrada misma.
âLos cÃģdecs de video modernos utilizan la misma idea de codificaciÃģn residual en ingenierÃa: los marcos de referencia llevan contenido completo, mientras que los marcos predictivos llevan seÃąales de movimiento y residual relativas a un marco de referencia.
âEstos sistemas tienen objetivos diferentes, pero comparten la misma estructura condicional: cuando las muestras cercanas son redundantes, el canal debe llevar lo que la predicciÃģn no logra explicar.
âLos cÃģdecs estÃĄndar, sin embargo, se optimizan para flujos de bits y reconstrucciÃģn visible para humanos, no para tokens visuales consumidos por un MLLM. Por lo tanto, redesignamos este mecanismo como una interfaz de MLLM para la comprensiÃģn de video.â
El nuevo trabajo, escrito por 11 investigadores de la Universidad Jiao Tong de ShanghÃĄi, el Instituto de InnovaciÃģn de ShanghÃĄi y JD.com, viene con una pÃĄgina de proyecto asociada, con la promesa de lanzar el cÃģdigo fuente.
MÃĐtodo
Como se discutiÃģ, en lugar de tratar cada marco como una imagen completamente nueva, el sistema busca quÃĐ cambiÃģ entre un marco y el siguiente. A la izquierda, en la imagen de abajo, vemos una pequeÃąa regiÃģn del marco actual que se coincide con la regiÃģn mÃĄs similar en un marco anterior:

VisiÃģn general del esquema para AdaCodec.
La distancia entre las dos ubicaciones se convierte en un vector de movimiento, mientras que las diferencias visuales restantes se convierten en un residual, con estas descripciones compactas reemplazando la necesidad de almacenar una imagen completa.
A la derecha, vemos la informaciÃģn resultante alimentada al modelo de IA: los marcos de referencia importantes todavÃa se procesan como imÃĄgenes completas, pero los marcos intermedios se representan mediante tokens de movimiento y residual mucho mÃĄs pequeÃąos â aparentemente permitiendo que el modelo retenga suficiente informaciÃģn para analizar el video, mientras procesa notablemente menos datos visuales.
Un desafÃo interesante es decidir quÃĐ marcos merecen ser almacenados en su totalidad: los cÃģdecs de video tradicionales suelen colocar marcos de referencia a intervalos regulares, ya sea que sean necesarios o no. AdaCodec, en cambio, intenta identificar los momentos que importan mÃĄs.
Por ejemplo, considere una escena que principalmente muestra una conversaciÃģn estÃĄtica entre dos personas en un apartamento â y de repente, un equipo de SWAT irrumpe a travÃĐs de la ventana. Inmediatamente, las vistas de la cÃĄmara y el nÚmero de cortes de ediciÃģn aumentarÃĄn y requerirÃĄn mucha mÃĄs datos de lo que un intervalo de marco de referencia regularizado proporcionarÃa:

Esta es la lÃģgica detrÃĄs de los mÃĐtodos de compresiÃģn de bitrate variable, que analizan el video de origen en busca de perÃodos "ocupados" y asignan mÃĄs datos donde se necesitan â a un costo no pequeÃąo de tiempo y recursos.
En AdaCodec, si un marco se puede predecir con precisiÃģn a partir de marcos cercanos, el sistema continÚa utilizando tokens de movimiento y residual compactos; si la escena cambia sustancialmente (es decir, el ejemplo de SWAT anterior, o algo menos dramÃĄtico), se inserta un marco de referencia completo. Esto permite que mÃĄs del presupuesto de procesamiento disponible se gaste en informaciÃģn visual importante en lugar de distribuirse uniformemente en todo el video.
Datos y Pruebas
En las pruebas, los investigadores utilizaron el mencionado Qwen3-VL-8B como el modelo base y evaluaron a AdaCodec en once benchmarks que abarcan tres ÃĄreas de comprensiÃģn de video: rendimiento de video largo se evaluÃģ con MLVU, LongVideoBench y LVBench; comprensiÃģn temporal con TempCompass, MotionBench y TOMATO; y comprensiÃģn general de video con Video-MME, MVBench, NExT-QA, PerceptionTest y EgoSchema.
Los modelos de cÃģdigo abierto probados fueron InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; y Molmo2-O-7B.
Las variaciones GPT-5, Gemini y Claude aparecen en la tabla a continuaciÃģn solo como lÃneas de base de comparaciÃģn. CoPE-VideoLM-7B y ReMoRa-7B son modelos de lenguaje de video anteriores que reducen el uso de tokens visuales a travÃĐs de la compresiÃģn inspirada en cÃģdecs, lo que los convierte en los competidores directos mÃĄs cercanos a AdaCodec:

Resultados principales en once benchmarks que cubren comprensiÃģn de video largo, razonamiento temporal y comprensiÃģn general de video. Las puntuaciones mÃĄs altas indican un mejor rendimiento. LVB = LongVideoBench; V-MME = Video-MME. Los valores en negrita y subrayados indican las puntuaciones mÃĄs altas y segundas mÃĄs altas entre los modelos de cÃģdigo abierto. Las puntuaciones de los modelos de cÃģdigo cerrado se tomaron de los informes oficiales cuando estuvieron disponibles, con resultados faltantes obtenidos de Molmo2, o evaluados por los autores.
Para garantizar una comparaciÃģn justa, se asignÃģ el mismo nÚmero de tokens visuales a AdaCodec y al sistema Qwen3-VL-8B estÃĄndar, lo que permite que los resultados reflejen la efectividad del enfoque de compresiÃģn, en lugar de cualquier diferencia en los recursos computacionales.
En la configuraciÃģn mÃĄs agresiva, AdaCodec redujo el uso de tokens visuales en aproximadamente un 86% mientras aÚn coincidÃa o ligeramente superaba al sistema base en tareas de comprensiÃģn de video largo, temporal y general.
Cuando los tokens ahorrados se reinvertÃan en el procesamiento de mÃĄs marcos de video, el rendimiento mejorÃģ en todos los benchmarks de video largo y todos los benchmarks temporales, con ganancias que alcanzaron +5.4 puntos en LongVideoBench y +4.3 puntos en TOMATO, mientras tambiÃĐn producÃa algunos de los resultados de cÃģdigo abierto mÃĄs fuertes en el estudio.
ConclusiÃģn
Aunque los proyectos de este tipo suelen estar dirigidos a proveedores de hipercala, este es el tipo de esfuerzo que serÃĄ de interÃĐs para los aficionados y las PYME, como parte de una posible nueva âascÃĐtica pÚblicaâ en torno a la implementaciÃģn de IA local y racionalizada.
En comunidades como r/stablediffusion, esto es muy vieja noticia, ya que cada lanzamiento importante de cÃģdigo abierto que llega allà se ve regularmente atormentado en una versiÃģn hiperoptimizada (GGUF, pesos cuantificados, etc.) capaz de ejecutarse, con algo de paciencia, en tarjetas grÃĄficas de gama baja.
Si la etapa âperformÃĄticaâ de esta tercera oleada de IA de hecho estÃĄ terminando, y asumiendo que las corporaciones serÃĄn repelidas por los verdaderos costos de inferencia, entonces iniciativas como AdaCodec pueden formar parte de una prÃģxima âgran optimizaciÃģnâ.
Â
â Esto no es lo mismo que renderizar el video en un formato amigable para el usuario/tamaÃąo de archivo; mÃĄs bien, se trata de la generaciÃģn y collaciÃģn interna de marcos que tiene lugar dentro del modelo de IA en el momento de la inferencia.
* Mi conversiÃģn, dentro de lo razonable, de las citas en lÃnea de los autores a enlaces.
Publicado por primera vez el jueves 4 de junio de 2026












