Anderson 视角

人工智能生成视频的视频编码器

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

随着人工智能的“无限食用”时代即将结束,一个新的经济高效的方法被提出,用于人工智能视频生成,承诺在令牌和时间方面带来显著的节省。

 

人工智能推理的真正成本正在给当前的人工智能革命带来新的清醒认识,人们对机器学习成本的合理化产生了更大的兴趣,除了将人工智能带入内部的潜力和私人人工智能的崛起,VRAM-hungry和资源密集型的机器学习例程也需要优化。

视频生成可能是最大的罪魁祸首,在这方面。如果您曾经重新压缩过一部电影或从视频编辑套件中导出一部电影,您已经知道这项任务(非人工智能任务)对您的硬件造成的影响——消耗RAM和CPU周期,并且经常阻止机器进行其他使用,除非采取措施限制压缩算法对主机计算机的影响。

因此,只需想象一下,人工智能视频的崛起如何在全球数据中心重演这种“权力饥渴”的程序。在这种规模的操作中,微小的收益立即变得重要。

在框架中

考虑到这一点,上海的一个新研究成果,联合JD.com,提出了一种针对人工智能视频生成过程本身的视频编码器,而不是针对渲染过程(将巨大的原始帧压缩成较小的视频文件大小)。

正常的视频编码器通过不将每个帧存储为完整图像,而是创建较少数量的完整图像(称为I帧),然后存储帧之间的变化

例如,如果视频中有人稍微移动,编码器只记录帧中发生变化的部分,而不是重写整个场景。这是P帧,它们是从之前的帧派生而来的,并且可以是B帧,它们也可以预测未来帧中的信息:

视频编码器的解剖结构:顶部行显示随时间变化的帧,标有I、P和B,I帧以全色存储,P帧和B帧显示为褪色以指示重建;箭头指示帧是否使用之前的帧、后续帧或两者;底部面板显示完全存储的帧(I帧,左)、从之前的帧构建的帧(P帧,第二个左)和从之前和后续帧构建的帧(B帧,右)。

视频编码器的解剖结构:顶部行显示随时间变化的帧,标有I、P和B,I帧以全色存储,P帧和B帧显示为褪色以指示重建;箭头指示帧是否使用之前的帧、后续帧或两者;底部面板显示完全存储的帧(I帧,左)、从之前的帧构建的帧(P帧,第二个左)和从之前和后续帧构建的帧(B帧,右)。

帧之间信息的重用是视频文件保持小的原因,大多数帧不作为新图像运行,而是描述前一帧如何变化。因此,I帧构成了“全脂”,占用空间的未压缩(或最小压缩)图像,而I帧之间的帧只包含I帧之间的差异(以及它们之间的差异)。

每个帧都是一个完整的未压缩图像时,电影基本上没有压缩。以这种方式保存电影将导致2小时的电影需要近1TB的磁盘空间。然而,这就是人工智能制作电影的方式——通过为每个帧分配相同的资源和令牌,当它计算如何构建视频时。

规模经济

新工作,题为AdaCodec:一种用于视频MLLM的预测视觉编码,只在参考帧(I帧)上花费完整的视觉令牌,而所有中间帧都以“紧凑的P令牌”形式渲染——这明显是从传统的历史“真实世界”视频编码器中借鉴的范式。

在内部压缩完成后,生成的AI视频可以正常压缩,并且理论上所有节省的成本都在服务器端:

AdaCodec概述。左侧,视频被划分为自适应的图像组,保留I帧用于难以预测的时刻,并且中间P帧使用紧凑的运动和残余信息表示。右侧,所得到的系统在十一项基准测试中匹配或超过Qwen3-VL-8B,并且在令牌预算和长视频准确性方面保持更高的水平,同时减少响应延迟并处理更少的视频令牌。来源 - https://arxiv.org/pdf/2606.02569

AdaCodec概述。左侧,视频被划分为自适应的图像组,保留I帧用于难以预测的时刻,并且中间P帧使用紧凑的运动和残余信息表示。右侧,所得到的系统在十一项基准测试中匹配或超过Qwen3-VL-8B,并且在令牌预算和长视频准确性方面保持更高的水平,同时减少响应延迟并处理更少的视频令牌。 来源

根据AdaCodec测试的结果,节省的成本是值得追求的;论文指出,该系统在每个主要基准测试中都优于未修改的Qwen3-VL-8B模型,同时使用相同的处理量;并且在削减视频令牌约86%后仍然匹配或超过了该模型的性能。

作者们指出*:

‘我们从预测编码中汲取灵感,系统传输预测错误,而不是原始信号。这个原则有生物学基础:视觉系统被认为编码预测错误,即预期输入和观察到的输入之间的差异,而不是输入本身

‘现代视频编码器使用相同的残余编码思想进行工程:参考帧携带完整内容,而预测帧携带相对于参考的运动和残余信号。

‘这些系统有不同的目标,但它们共享相同的条件结构:当附近的样本冗余时,通道应携带预测无法解释的内容。

‘标准编码器,然而,针对比特流和人类可视重建进行优化,而不是针对LLM消耗的视觉令牌。我们因此重新设计了这一机制作为视频理解的MLLM接口。 ‘

该工作由上海交通大学、上海创新研究所和JD.com的11名研究人员撰写,并附有一个相关项目页面,承诺发布源代码。

方法

如前所述,系统不是将每个帧视为一个全新的图像,而是寻找两个帧之间的变化。在下面的图像左侧,我们看到当前帧的一个小区域与之前帧中的最相似区域进行匹配:

AdaCodec概述。

AdaCodec概述。

两个位置之间的距离成为一个运动矢量,而任何剩余的视觉差异成为一个残余,这些紧凑的描述取代了存储完整图像的需要。

在右侧,我们看到结果信息被输入到AI模型中:重要的参考帧仍然被处理为完整图像,但中间帧由更小的运动和残余令牌表示——显然允许模型保留足够的信息来解析视频,同时处理更少的视觉数据。

一个有趣的挑战是决定哪些帧值得以完整存储:传统的视频编码器通常将参考帧放在固定的间隔,无论是否需要。AdaCodec,相反,尝试找出最重要的时刻。

例如,考虑一个场景主要描绘两个人在公寓里进行静态对话——突然,一队特警队突然破门而入。立刻,摄像机视角和编辑剪辑数量将大幅增加,需要比规则化的参考帧间隔提供更多数据:

一系列帧显示一个空房间,两个人交谈,一个团队进入窗口,两个人被护送离开,房间再次空了。下面的中间帧条显示了相同的事件,跨越更长的时间线,选定的帧以蓝色突出显示。一个水平标度标有“场景强度”,底部有一行彩色块,标有“不充分的参考帧”下的两个绿色块,中间有灰色块。

这是可变压缩(可变比特率)压缩方法背后的逻辑,这些方法分析源视频以查找“繁忙”时期,并在需要时分配更多数据——这需要花费大量时间和资源。

在AdaCodec中,如果一个帧可以从附近的帧中准确预测,系统将继续使用紧凑的运动和残余令牌;如果场景发生了显著变化(例如上面的特警队例子,或更不戏剧性的情况),则插入一个完整的参考帧。这允许更多的处理预算被花在重要的视觉信息上,而不是均匀地分配在整个视频上。

数据和测试

在测试中,研究人员使用上述的Qwen3-VL-8B作为基准模型,并在11个基准测试中评估了AdaCodec,这些基准测试涵盖了三个视频理解领域:长视频性能,使用MLVULongVideoBenchLVBench进行评估;时间理解,使用TempCompassMotionBenchTOMATO进行评估;以及一般视频理解,使用Video-MMEMVBenchNExT-QAPerceptionTestEgoSchema进行评估。

测试的开源模型包括InternVL3.5-8BKeye-VL-1.5-8BGLM-4.1V-9BMiniCPM-V-4.5-8BEagle2.5-8BPLM-8BLLaVA-Video-7BVideoChat-Flash-7BMolmo2-8B;以及Molmo2-O-7B

GPT-5、Gemini和Claude变体仅作为比较基准出现在下面的表格中。 CoPE-VideoLM-7BReMoRa-7B 是早期的视频语言模型,通过编码器启发的压缩减少视觉令牌的使用,使它们成为AdaCodec最直接的竞争对手:

长视频理解、时间推理和一般视频理解的11个基准测试的主要结果。更高的分数表示更好的性能。LVB = LongVideoBench;V-MME = Video-MME。粗体和下划线值表示开源模型中的最高和第二高分数。闭源模型的分数来自可用的官方报告,缺失的结果来自Molmo2或由作者评估。

长视频理解、时间推理和一般视频理解的11个基准测试的主要结果。更高的分数表示更好的性能。LVB = LongVideoBench;V-MME = Video-MME。粗体和下划线值表示开源模型中的最高和第二高分数。闭源模型的分数来自可用的官方报告,缺失的结果来自Molmo2或由作者评估。

为了确保公平的比较,AdaCodec和标准Qwen3-VL-8B系统都分配了相同数量的视觉令牌,使结果反映压缩方法的有效性,而不是计算资源的差异。

在最激进的设置中,AdaCodec在仍然匹配或略高于基准系统的长视频、时间和一般视频理解任务的同时,将视觉令牌的使用量减少了约86%。

当节省的令牌被重新投资于处理更多视频帧时,性能在每个长视频基准测试和每个时间基准测试中都有所提高,收益最高可达LongVideoBench的+5.4点和TOMATO的+4.3点,同时也产生了研究中最强的开源结果之一。

结论

虽然这种项目通常针对超大规模提供商,但这类工作将对爱好者和中小企业等各类人士产生兴趣,因为它们是潜在的新“公共节俭”运动的一部分,旨在实现本地化和理性的AI部署。

在诸如r/stablediffusion之类的社区中,这些消息并不新鲜,因为每个到达那里的主要开源版本都会被优化为超高效版本,可以在较低端的显卡上运行,只需稍加耐心即可。

如果人工智能的“表演阶段”确实已经结束,并且公司会因为真实成本而被人工智能推理的成本所排斥,那么像AdaCodec这样的计划可能是即将到来的“大优化”运动的一部分。

 

这与将视频渲染为用户友好格式/文件大小不同;它涉及人工智能模型在推理时间内发生的内部帧生成和收集。

* 我将作者的内联引用转换为超链接,尽量保持原意。

首次发布于2026年6月4日,星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直到其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:[email protected]