Ángulo de Anderson
Un Códec de Video para Metraje Generado por IA

Al acercarse el final de la era de “todo lo que puedas comer” de la IA, un nuevo enfoque económico para la generación de video de IA promete ahorros significativos en tokens y tiempo.
El verdadero costo de la inferencia de IA está trayendo una nueva nota de sobriedad al ritmo acelerado de la actual revolución de la IA, con un mayor interés en racionalizar el costo del aprendizaje automático. Además del potencial de llevar la IA a casa, y el ascenso general de la IA privada, las rutinas de aprendizaje automático hambrientas de VRAM y voraces de recursos también necesitarán optimización.
La generación de video es quizás el mayor infractor en este sentido. Si alguna vez has recomprimido una película o la has exportado desde una suite de edición de video, ya sabes el costo que este proceso en particular (no de IA) tiene en tu hardware – consumiendo RAM y ciclos de CPU, y a menudo bloqueando la máquina para cualquier otro uso, a menos que se tomen medidas para limitar el impacto del algoritmo de compresión en la computadora anfitriona.
Por lo tanto, solo hay que imaginar la medida en que el ascenso del video de IA está repitiendo este procedimiento “locura de poder” en centros de datos de todo el mundo. A esa escala de operación, las ganancias más pequeñas se vuelven inmediatamente significativas en la contabilidad agregada.
En el Marco
Con esto en mente, una nueva oferta de investigación de Shanghái, en colaboración con JD.com (JD ), está proponiendo un códec de video dirigido no al proceso de renderizado (el proceso de comprimir grandes marcos raw en un tamaño de archivo de video más pequeño), sino al propio proceso de generación de video de IA.
Un códec de video normal funciona almacenando no todas las imágenes como imágenes completas, sino creando un número menor de imágenes completas, llamadas marcos I, y luego almacenando cambios entre marcos.
Por ejemplo, si una persona se mueve ligeramente en un video, el códec registra solo las partes del marco que registran ese cambio, en lugar de reescribir toda la escena. Estos son marcos P, que se derivan de marcos anteriores, y marcos B, que también pueden anticipar información en marcos futuros:

Anatomía de un códec de video: la fila superior muestra marcos a lo largo del tiempo etiquetados como I, P y B, con marcos I almacenados completamente en color completo y marcos P y B mostrados desvanecidos para indicar reconstrucción; las flechas indican si los marcos utilizan marcos anteriores, marcos posteriores o ambos; los paneles inferiores muestran un marco almacenado completamente (marco I, izquierda), un marco construido a partir de un marco anterior (marco P, segunda izquierda), y un marco construido a partir de marcos anteriores y posteriores (marco B, derecha).
Este reuso de información cercana es por qué los archivos de video permanecen pequeños, con la mayoría de los marcos operando no como nuevas imágenes, sino como instrucciones que describen cómo ha cambiado el marco anterior. Por lo tanto, los marcos I constituyen imágenes “completas”, que consumen espacio, con los marcos entre ellos constituyendo solo la diferencia entre los marcos I (y entre sí mismos).
Cuando cada marco individual es una imagen no comprimida, la película esencialmente no tiene compresión. Guardar una película de esta manera, como video no comprimido, resultaría en una película de 2 horas que necesitaría casi (o más de) un terabyte de espacio en disco. Sin embargo, esto es cómo la IA hace películas† – dedicando recursos y tokens iguales a cada marco, cuando está calculando cómo formular el video.
Economía de Escala
El nuevo trabajo, titulado AdaCodec: Un Códec de Video Predictivo para MLLMs de Video, en lugar de eso, gasta tokens visuales completos exclusivamente en marcos de referencia (marcos I), con todos los marcos intermedios representados como ‘tokens P compactos’ – un paradigma claramente tomado de la compresión tradicional empleada por códecs de video históricos.
Después de que esta compresión interna ha tenido lugar, el video de IA generado puede ser comprimido normalmente, y, en teoría, todos los ahorros son del lado del servidor:

Visión general de AdaCodec. Izquierda, los videos se dividen en grupos de imágenes adaptativas, con marcos I completos reservados para momentos que son difíciles de predecir y marcos P intermedios representados usando información de movimiento y residual compacta. Derecha, el sistema resultante coincide o supera a Qwen3-VL-8B en once benchmarks, mantiene una mayor precisión de video largo en todos los presupuestos de tokens y reduce la latencia de respuesta mientras procesa sustancialmente menos tokens de video. Fuente
Los ahorros, según los resultados informados de las pruebas para AdaCodec, son dignos de perseguir; el documento establece que el sistema superó al modelo Qwen3-VL-8B no modificado en todos los benchmarks principales, mientras utilizaba la misma cantidad de procesamiento; y aún coincidió o superó el rendimiento de ese modelo después de reducir los tokens de video en un aproximado del 86%.
Los autores establecen*:
‘Nos inspiramos en la codificación predictiva, donde un sistema transmite errores de una predicción en lugar de la señal cruda. Este principio tiene una base biológica: se cree que el sistema visual codifica errores de predicción, la discrepancia entre la entrada esperada y observada, en lugar de la entrada misma.
‘Los códecs de video modernos utilizan la misma idea de codificación residual en ingeniería: los marcos de referencia llevan contenido completo, mientras que los marcos predictivos llevan señales de movimiento y residual relativas a un marco de referencia.
‘Estos sistemas tienen objetivos diferentes, pero comparten la misma estructura condicional: cuando las muestras cercanas son redundantes, el canal debe llevar lo que la predicción no logra explicar.
‘Los códecs estándar, sin embargo, se optimizan para flujos de bits y reconstrucción visible para humanos, no para tokens visuales consumidos por un MLLM. Por lo tanto, redesignamos este mecanismo como una interfaz de MLLM para la comprensión de video.’
El nuevo trabajo, escrito por 11 investigadores de la Universidad Jiao Tong de Shanghái, el Instituto de Innovación de Shanghái y JD.com, viene con una página de proyecto asociada, con la promesa de lanzar el código fuente.
Método
Como se discutió, en lugar de tratar cada marco como una imagen completamente nueva, el sistema busca qué cambió entre un marco y el siguiente. A la izquierda, en la imagen de abajo, vemos una pequeña región del marco actual que se coincide con la región más similar en un marco anterior:

Visión general del esquema para AdaCodec.
La distancia entre las dos ubicaciones se convierte en un vector de movimiento, mientras que las diferencias visuales restantes se convierten en un residual, con estas descripciones compactas reemplazando la necesidad de almacenar una imagen completa.
A la derecha, vemos la información resultante alimentada al modelo de IA: los marcos de referencia importantes todavía se procesan como imágenes completas, pero los marcos intermedios se representan mediante tokens de movimiento y residual mucho más pequeños – aparentemente permitiendo que el modelo retenga suficiente información para analizar el video, mientras procesa notablemente menos datos visuales.
Un desafío interesante es decidir qué marcos merecen ser almacenados en su totalidad: los códecs de video tradicionales suelen colocar marcos de referencia a intervalos regulares, ya sea que sean necesarios o no. AdaCodec, en cambio, intenta identificar los momentos que importan más.
Por ejemplo, considere una escena que principalmente muestra una conversación estática entre dos personas en un apartamento – y de repente, un equipo de SWAT irrumpe a través de la ventana. Inmediatamente, las vistas de la cámara y el número de cortes de edición aumentarán y requerirán mucha más datos de lo que un intervalo de marco de referencia regularizado proporcionaría:

Esta es la lógica detrás de los métodos de compresión de bitrate variable, que analizan el video de origen en busca de períodos "ocupados" y asignan más datos donde se necesitan – a un costo no pequeño de tiempo y recursos.
En AdaCodec, si un marco se puede predecir con precisión a partir de marcos cercanos, el sistema continúa utilizando tokens de movimiento y residual compactos; si la escena cambia sustancialmente (es decir, el ejemplo de SWAT anterior, o algo menos dramático), se inserta un marco de referencia completo. Esto permite que más del presupuesto de procesamiento disponible se gaste en información visual importante en lugar de distribuirse uniformemente en todo el video.
Datos y Pruebas
En las pruebas, los investigadores utilizaron el mencionado Qwen3-VL-8B como el modelo base y evaluaron a AdaCodec en once benchmarks que abarcan tres áreas de comprensión de video: rendimiento de video largo se evaluó con MLVU, LongVideoBench y LVBench; comprensión temporal con TempCompass, MotionBench y TOMATO; y comprensión general de video con Video-MME, MVBench, NExT-QA, PerceptionTest y EgoSchema.
Los modelos de código abierto probados fueron InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; y Molmo2-O-7B.
Las variaciones GPT-5, Gemini y Claude aparecen en la tabla a continuación solo como líneas de base de comparación. CoPE-VideoLM-7B y ReMoRa-7B son modelos de lenguaje de video anteriores que reducen el uso de tokens visuales a través de la compresión inspirada en códecs, lo que los convierte en los competidores directos más cercanos a AdaCodec:

Resultados principales en once benchmarks que cubren comprensión de video largo, razonamiento temporal y comprensión general de video. Las puntuaciones más altas indican un mejor rendimiento. LVB = LongVideoBench; V-MME = Video-MME. Los valores en negrita y subrayados indican las puntuaciones más altas y segundas más altas entre los modelos de código abierto. Las puntuaciones de los modelos de código cerrado se tomaron de los informes oficiales cuando estuvieron disponibles, con resultados faltantes obtenidos de Molmo2, o evaluados por los autores.
Para garantizar una comparación justa, se asignó el mismo número de tokens visuales a AdaCodec y al sistema Qwen3-VL-8B estándar, lo que permite que los resultados reflejen la efectividad del enfoque de compresión, en lugar de cualquier diferencia en los recursos computacionales.
En la configuración más agresiva, AdaCodec redujo el uso de tokens visuales en aproximadamente un 86% mientras aún coincidía o ligeramente superaba al sistema base en tareas de comprensión de video largo, temporal y general.
Cuando los tokens ahorrados se reinvertían en el procesamiento de más marcos de video, el rendimiento mejoró en todos los benchmarks de video largo y todos los benchmarks temporales, con ganancias que alcanzaron +5.4 puntos en LongVideoBench y +4.3 puntos en TOMATO, mientras también producía algunos de los resultados de código abierto más fuertes en el estudio.
Conclusión
Aunque los proyectos de este tipo suelen estar dirigidos a proveedores de hipercala, este es el tipo de esfuerzo que será de interés para los aficionados y las PYME, como parte de una posible nueva “ascética pública” en torno a la implementación de IA local y racionalizada.
En comunidades como r/stablediffusion, esto es muy vieja noticia, ya que cada lanzamiento importante de código abierto que llega allí se ve regularmente atormentado en una versión hiperoptimizada (GGUF, pesos cuantificados, etc.) capaz de ejecutarse, con algo de paciencia, en tarjetas gráficas de gama baja.
Si la etapa “performática” de esta tercera oleada de IA de hecho está terminando, y asumiendo que las corporaciones serán repelidas por los verdaderos costos de inferencia, entonces iniciativas como AdaCodec pueden formar parte de una próxima “gran optimización”.
† Esto no es lo mismo que renderizar el video en un formato amigable para el usuario/tamaño de archivo; más bien, se trata de la generación y collación interna de marcos que tiene lugar dentro del modelo de IA en el momento de la inferencia.
* Mi conversión, dentro de lo razonable, de las citas en línea de los autores a enlaces.
Publicado por primera vez el jueves 4 de junio de 2026












