Взгляд Anderson

Видеокодек для сгенерированных ИИ видеороликов

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image (GPT-2 + Photoshop): an industrial humanoid robot, heavily blurred, holds a vertical strip of 70mm film close to the camera, with the film frames in sharp focus showing a man and a woman standing and conversing. Every third frame is tinted green and the others appear monochrome.

Когда эпоха всеобщего доступа к ИИ подходит к концу, новый экономически эффективный подход к генерации видео с помощью ИИ обещает значительную экономию токенов и времени.

 

Реальная стоимость вывода ИИ приносит новую ноту трезвости к бешеному темпу текущей революции ИИ, с повышенным интересом к рационализации стоимости машинного обучения. Кроме потенциала приведения ИИ в компанию, и общего роста частного ИИ, алгоритмы машинного обучения, требующие много видеопамяти и ресурсов, также будут нуждаться в оптимизации.

Генерация видео, возможно, самый большой правонарушитель в этом отношении. Если вы когда-либо переупаковывали фильм или экспортировали его из видеоредактора, вы уже знаете стоимость этой конкретной (не ИИ) задачи для вашего оборудования – потребление оперативной памяти и циклов ЦП, и часто блокирование машины для любой другой деятельности, если не принимаются меры для ограничения влияния алгоритма сжатия на компьютер.

Следовательно, можно только представить, в какой степени рост видео ИИ повторяет эту “процедуру, требующую много энергии”, в центрах обработки данных по всему миру. На таком масштабе эксплуатации даже самые небольшие выигрыши сразу становятся значительными в совокупном учете.

В кадре

С учетом этого нового исследовательского предложения из Шанхая, в сотрудничестве с JD.com, предлагается видеокодек, направленный не на процесс рендеринга (процесс сжатия огромных, сырых кадров в меньший размер видеофайла), а на сам процесс генерации видео ИИ.

Обычный видеокодек работает, не храня каждый кадр как полное изображение, а создавая меньшее количество полных картинок, называемых I-кадрами, и затем храня изменения между кадрами.

Например, если человек немного перемещается в видео, кодек записывает только части кадра, которые регистрируют это изменение, а не переписывают всю сцену. Это P-кадры, которые получаются из предыдущих кадров, и B-кадры, которые также могут предвидеть информацию в будущих кадрах:

Анатомия видеокодека: верхний ряд показывает кадры во времени, помеченные I, P и B, с I-кадрами, полностью сохраненными в полном цвете, и P- и B-кадрами, показанными затененными, чтобы указать реконструкцию; стрелки указывают, используют ли кадры предыдущие кадры, будущие кадры или оба; нижние панели изображают полностью сохраненный кадр (I-кадр, слева), кадр, построенный из предыдущего кадра (P-кадр, вторая слева), и кадр, построенный из обоих предыдущих и будущих кадров (B-кадр, справа).

Анатомия видеокодека: верхний ряд показывает кадры во времени, помеченные I, P и B, с I-кадрами, полностью сохраненными в полном цвете, и P- и B-кадрами, показанными затененными, чтобы указать реконструкцию; стрелки указывают, используют ли кадры предыдущие кадры, будущие кадры или оба; нижние панели изображают полностью сохраненный кадр (I-кадр, слева), кадр, построенный из предыдущего кадра (P-кадр, вторая слева), и кадр, построенный из обоих предыдущих и будущих кадров (B-кадр, справа).

Это повторное использование ближайшей информации является причиной того, что видеофайлы остаются небольшими, с большинством кадров, работающих не как новые изображения, а как инструкции, описывающие, как предыдущий кадр изменился. Следовательно, I-кадры составляют “полноценные”, занимающие много места, несжатые (или минимально сжатые) изображения, с кадрами между ними, составляющими только разницу между I-кадрами (и между собой).

Когда каждый отдельный кадр является полным несжатым изображением, фильм по сути не имеет сжатия. Сохранение фильма в этом виде, как несжатое видео, потребует gần (или больше) терабайта дискового пространства для 2-часового фильма. Однако именно так ИИ создает фильмы – посвящая равные ресурсы и токены каждому и каждому кадру, когда он рассчитывает, как сформулировать видео.

Экономия масштаба

Новая работа, озаглавленная AdaCodec: Предсказательный визуальный код для видео MLLM, вместо этого расходует полные визуальные токены исключительно на ссылочные кадры (I-кадры), с всеми промежуточными кадрами, отображаемыми как “компактные P-токены” – парадигма, явно взятая из традиционного сжатия, используемого историческими “реальными” видеокодеками.

После того, как внутреннее сжатие было выполнено, видео ИИ может быть затем сжато нормально, и, в теории, все экономия происходит на стороне сервера:

Обзор AdaCodec. Слева, видео разделены на адаптивные группы картинок, с полными I-кадрами, зарезервированными для моментов, которые трудно предсказать, и промежуточными P-кадрами, представленными с помощью компактной информации о движении и остаточных данных. Справа, полученная система соответствует или превышает Qwen3-VL-8B по одиннадцати тестам, поддерживает более высокую точность долгих видео по токенам, и снижает задержку ответа при обработке существенно меньшего количества видеотокенов. Источник - https://arxiv.org/pdf/2606.02569

Обзор AdaCodec. Слева, видео разделены на адаптивные группы картинок, с полными I-кадрами, зарезервированными для моментов, которые трудно предсказать, и промежуточными P-кадрами, представленными с помощью компактной информации о движении и остаточных данных. Справа, полученная система соответствует или превышает Qwen3-VL-8B по одиннадцати тестам, поддерживает более высокую точность долгих видео по токенам, и снижает задержку ответа при обработке существенно меньшего количества видеотокенов. Источник

Экономия, согласно сообщенным результатам тестов для AdaCodec, стоит того, чтобы ее преследовать; статья гласит, что система превзошла неизменную модель Qwen3-VL-8B по всем основным тестам, используя при этом одинаковое количество обработки; и все еще соответствовала или превзошла производительность этой модели после сокращения видеотокенов примерно на 86%.

Авторы утверждают*:

‘Мы черпаем вдохновение из предсказательного кодирования, где система передает ошибки от предсказания, а не сыгнал. Этот принцип имеет биологическую основу: визуальная система, как считается, кодирует ошибки предсказания, несоответствие между ожидаемым и наблюдаемым входом, а не сам вход.

‘Современные видеокодеки используют ту же идею остаточного кодирования в инженерии: ссылочные кадры несут полный контент, а предсказательные кадры несут информацию о движении и остаточных сигналах относительно ссылки.

‘Эти системы имеют разные цели, но они имеют одинаковую условную структуру: когда ближайшие образцы являются избыточными, канал должен нести то, что предсказание не может объяснить.

‘Стандартные кодеки, однако, оптимизированы для битовых потоков и человеческого восприятия, а не для визуальных токенов, потребляемых LLM. Мы поэтому перерабатываем этот механизм как интерфейс MLLM для понимания видео.’

Новая работа, написанная 11 исследователями из Шанхайского университета Цзяо Тун, Шанхайского инновационного института и JD.com, имеет связанную страницу проекта, с обещанием выпуска исходного кода.

Метод

Как обсуждалось, вместо того, чтобы рассматривать каждый кадр как совершенно новое изображение, система ищет, что изменилось между одним кадром и следующим. Слева, на изображении ниже, мы видим небольшой регион текущего кадра, который сопоставляется с наиболее похожим регионом в предыдущем кадре:

Схематический обзор AdaCodec.

Схематический обзор AdaCodec.

Расстояние между двумя местами становится вектором движения, а любые оставшиеся визуальные различия становятся остаточным, с этими компактными описаниями, заменяющими необходимость хранить полное изображение.

Справа, мы видим результирующую информацию, поданную в модель ИИ: важные ссылочные кадры все еще обрабатываются как полные изображения, но вмешивающиеся кадры представлены гораздо меньшими движением-и-остаточными токенами – по-видимому, позволяя модели сохранить достаточно информации, чтобы проанализировать видео, при этом обрабатывая заметно меньше визуальных данных.

Одной из интересных задач является решение, какие кадры заслуживают быть сохраненными в полном объеме: традиционные видеокодеки обычно помещают ссылочные кадры на регулярные интервалы, будь то они нужны или нет. AdaCodec, вместо этого, пытается определить моменты, которые имеют наибольшее значение.

Например, рассмотрим сцену, в основном изображающую статическую беседу между двумя людьми в квартире – и вдруг команда SWAT врывается через окно. Сразу же виды камеры и количество редакторских срезов будут увеличиваться и требовать гораздо больше данных, чем регулярный интервал ссылочного кадра будет предоставлять:

Последовательность кадров, показывающая пустую комнату, двух людей, разговаривающих, группу, входящую через окно, двух людей, которых выводят, и пустую комнату снова. Полоса промежуточных кадров ниже изображает те же события на более длинном временном интервале, с выделенными кадрами, выделенными синим цветом. Горизонтальная шкала, помеченная

Это логика, лежащая в основе методов сжатия с переменной скоростью передачи (сжатие с переменной скоростью передачи), которые анализируют исходное видео для таких “занятых” периодов и назначают больше данных, где это необходимо – при некоторой стоимости времени и ресурсов.

В AdaCodec, если кадр можно предсказать точно из ближайших кадров, система продолжает использовать компактные токены движения-и-остаточных; если сцена меняется существенно (т.е. пример SWAT выше, или что-то менее драматичное), полный ссылочный кадр вставляется. Это позволяет тратить больше доступного бюджета обработки на важную визуальную информацию, а не распределять ее равномерно по всему видео.

Данные и тесты

В тестировании исследователи использовали вышеупомянутую Qwen3-VL-8B в качестве базовой модели и оценили AdaCodec по одиннадцати тестам, охватывающим три области понимания видео: производительность долгих видео была оценена с помощью MLVU, LongVideoBench и LVBench; понимание во времени с помощью TempCompass, MotionBench и TOMATO; и общее понимание видео с помощью Video-MME, MVBench, NExT-QA, PerceptionTest и EgoSchema.

Открытые модели, протестированные в исследовании, были InternVL3.5-8B; Keye-VL-1.5-8B; GLM-4.1V-9B; MiniCPM-V-4.5-8B; Eagle2.5-8B; PLM-8B; LLaVA-Video-7B; VideoChat-Flash-7B; Molmo2-8B; и Molmo2-O-7B.

GPT-5, Gemini и Claude вариации появляются в таблице ниже только как сравнительные базовые линии. CoPE-VideoLM-7B и ReMoRa-7B являются более ранними видеоязыковыми моделями, которые снижают использование визуальных токенов за счет кодека, вдохновленного сжатия, что делает их ближайшими прямыми конкурентами AdaCodec:

Основные результаты по одиннадцати тестам, охватывающим долгое понимание видео, временное рассуждение и общее понимание видео. Более высокие баллы указывают на лучшую производительность. LVB = LongVideoBench; V-MME = Video-MME. Жирные и подчеркнутые значения указывают на самые высокие и вторые по высоте баллы среди открытых моделей. Баллы для закрытых моделей были взяты из официальных отчетов, где это было возможно, с отсутствующими результатами, полученными из Molmo2 или оцененными авторами.

Основные результаты по одиннадцати тестам, охватывающим долгое понимание видео, временное рассуждение и общее понимание видео. Более высокие баллы указывают на лучшую производительность. LVB = LongVideoBench; V-MME = Video-MME. Жирные и подчеркнутые значения указывают на самые высокие и вторые по высоте баллы среди открытых моделей. Баллы для закрытых моделей были взяты из официальных отчетов, где это было возможно, с отсутствующими результатами, полученными из Molmo2 или оцененными авторами.

Чтобы обеспечить справедливое сравнение, одинаковое количество визуальных токенов было выделено как для AdaCodec, так и для стандартной системы Qwen3-VL-8B, что позволило результатам отражать эффективность подхода сжатия, а не любые различия в вычислительных ресурсах.

На самом агрессивном уровне настройки AdaCodec снизил использование визуальных токенов примерно на 86%, при этом соответствуя или немного превышая базовую систему на задачах долгого видео, временного рассуждения и общего понимания видео.

Когда сэкономленные токены были вложены в обработку большего количества кадров видео, производительность улучшилась по всем тестам долгих видео и всем временным тестам, с выигрышами, достигающими +5,4 балла на LongVideoBench и +4,3 балла на TOMATO, а также производя некоторые из самых сильных результатов открытых моделей в исследовании.

Заключение

Хотя проекты этого типа обычно ориентированы на крупномасштабных поставщиков, это тот вид усилий, который будет интересен как хоббиистам, так и малым и средним предприятиям, как часть потенциальной новой “публичной аскетики” вокруг локального, рационализированного развертывания ИИ.

В сообществах, таких как r/stablediffusion, это очень старые новости, поскольку каждый крупный открытый релиз, который появляется там, регулярно доводится до гипероптимизированной (GGUF, квантованные веса и т. д.) версии, способной работать, с некоторой терпением, на видеокартах более низкого класса.

Если “представительский этап” этой третьей ИИ-волны действительно закончился, и при условии, что корпорации будут отталкиваться настоящими затратами на вывод, то инициативы, такие как AdaCodec, могут составлять часть будущей “большой оптимизации”.

 

Это не то же самое, что рендеринг видео в пользовательский формат/размер файла; скорее, это связано с внутренним созданием и сбором кадров, происходящим внутри модели ИИ во время вывода.

* Мой перевод, в пределах разумного, внутренних цитат авторов в гиперссылки.

Опубликовано в первый раз в четверг, 4 июня 2026 года

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]