Взгляд Anderson
Удаление объектов и людей из видео с помощью ИИ

Нет, ребенок не остается на картинке, если ИИ имеет что-то сказать.
Удаление людей и объектов из изображений и видео – популярная ветвь исследований в литературе, посвященной ИИ, ориентированной на визуальные эффекты, с растущим количеством посвященных наборов данных и фреймворков, решающих эту задачу. Последнее из них, разработанное Институтом больших данных Университета Фудан в Китае, – это EffectErase, система удаления объектов из видео, осведомленная об эффектах, которую, по мнению авторов, заметно улучшает состояние дела в тестах:
Собрано из материалов на сайте проекта, примеры метода EffectErase (пожалуйста, обратите внимание, что, хотя мы предоставляем ссылку, исходный сайт содержит много видео с высоким разрешением и неоптимизированных автоплееров, что может повлиять на стабильность вашего веб-браузера. Прилагаемое видео на YouTube – это более простой и полный справочник, и оно встроено в конце этой статьи). Источник
Новая работа включала создание/кураторство полусовременного набора данных, состоящего из почти 350 оригинальных реальных и синтезированных сцен (с использованием публичных репозиториев*), либо снятых с помощью специального оборудования, либо полученных и перепрофилированных в рабочий процесс, построенный вокруг открытого фреймворка Blender 3D.
Гибридный набор данных Video Object Removal (VOR) является основой для самого приложения EffectErase, которое построено поверх системы генерации видео Wan2.1. Система также определяет два новых связанных эталона: VOR Eval и VOR Wild – соответственно, для образцов с и без правдивых данных.
(Хотя у статьи есть сопровождающий сайт проекта, он довольно перегружен множеством видео с высоким разрешением и трудно загружается; поэтому, пожалуйста, обратитесь к выдержкам, которые я отобрал в встроенном видео выше, если вы найдете сайт проекта трудным для использования)

Сравнение количественных показателей по сравнимым предыдущим наборам данных, с учетом нового предложения. Источник
Исследователи утверждают, что их подход дает лучшие результаты, как в количественных показателях, так и в качественных результатах, определенных через исследование, проведенное с участием человека.
Они отмечают, что предыдущие работы не всегда смогли удалить сопутствующие эффекты объекта, такие как тени и отражения, и что их набор данных был тщательно создан для устранения этого недостатка:

Примеры предыдущих подходов, не учитывающих вторичные указания, такие как отражения и тени.
Новая статья озаглавлена EffectErase: Объединенное удаление и вставка объектов видео для высококачественного стирания эффектов и исходит от четырех исследователей Колледжа компьютерных наук и искусственного интеллекта Университета Фудан.
Метод
Гибридный набор данных VOR был разработан для охвата широкого спектра сценариев, чтобы покрыть все последствия попытки удаления человека или объекта из видео:

Парные кадры из набора данных VOR иллюстрируют, как удаление объекта должно выходить за пределы видимого субъекта к его индуцированным эффектам, с примерами, показывающими оclusion, тень, сдвиги освещения, отражения и физическую деформацию, каждая из которых представлена как вход (объект присутствует) вместе с соответствующим чистым фоном после удаления. Для дальнейших примеров обратитесь к прилагаемому видео на YouTube, встроенному в конце этой статьи.
Пять представительных типов “помех” для решения определены авторами как закрытие, включая различные типы закрытия стекла и дыма; тени; освещение (например, когда объект, который необходимо удалить, создает или изменяет путь света); отражение; и деформация (например, отпечаток пользователя на подушке, который не должен выжить после удаления человека).

Пipeline конструирования набора данных VOR, объединяющий синтетические сцены, сгенерированные с помощью Blender, с реальными захватами, где синтетические данные строятся из отобранных 3D-сред, объектов и траекторий камеры, а реальные кадры записываются в различных сценах, дополненные движением Ken Burns. SAM2-сегментация и ручная доработка затем производят выровненные видеотриплеты с соответствующими масками.
Для реальных исходных данных исследователи использовали фиксированные камеры для записи сцен “с” и “без” объектов, охватывающих широкий спектр сред, времени суток и погодных условий.
Для синтетических данных были отображены несколько точек зрения, созданы многообъектные сценарии, в которых намеренно использовались сложные и сложные типы движения камеры, такие как те, которые могут возникнуть в реальных кадрах; и исследователи отмечают, что этот подход более совершенен и трудоемок, чем тот, который использовался для аналогичного набора данных Remove Objects with Side Effects in Videos (ROSE).
Чтобы увеличить разнообразие движения, к парным кадрам, снятym с помощью камеры, был применен эффект Ken Burns, добавляющий контролируемые панорамирование, масштабирование и небольшое ручное движение под четырнадцатью предварительно определёнными правилами, с пятью закономерностями движения, отобранными для каждой пары, сохраняя кадр внутри исходного кадра.
Масштаб и разнообразие были еще больше расширены путем объединения синтетических объектов с несколькими настройками камеры, маски были сгенерированы путем размещения ручных точечных подсказок на ключевых кадрах, распространения сегментации с помощью Segment Anything 2 (SAM2), очистки и доработки результатов, а также сборки проверенных видеотриплетов для обучения.
Окончательная коллекция включает 145 часов видео по 60 000 парных видео, реальных и синтетических, охватывающих 366 классов объектов в 443 сценах.
Сеть EffectErase сама по себе принимает материал через вариационный автоэнкодер (VAE†), с шумоподавлением, обрабатываемым Wan2.1. Над этой основой EffectErase работает Объединенное обучение удаления и вставки, которое обучает обе задачи вместе на одних и тех же регионах; Руководство по регионам, осведомленным о задаче (TARG), которое использует токены объектов и задач с кросс-аттенцией, чтобы смоделировать пространственно-временные связи между объектами и их эффектами и разрешить переключение задач; и Потеря согласованности эффектов, которая выравнивает регионы эффектов, выровненные в задачах удаления и вставки:

Схема фреймворка EffectErase. Во время обучения парные видео кодируются в общее латентное пространство, объединяются с шумом и обрабатываются диффузионным трансформером, управляемым осведомленной о задаче кросс-аттенцией, в то время как потеря согласованности эффектов выравнивает регионы удаления и вставки, чтобы обе задачи фокусировались на одной и той же области.
Сам процесс удаления и вставки обучается вместе, используя общую диффузионную основу, так что модель учится фокусироваться на одних и тех же затронутых регионах и структурных подсказках.
Видео с объектами, видео только с фоном и маски кодируются в латентное пространство; затем добавляется шум для обучения диффузии, и модель учится восстанавливать чистые представления под руководством, специфичным для задачи. Легковесный адаптер затем объединяет шумные особенности с условиями удаления или вставки, позволяя обеим задачам делиться надзором, оставаясь при этом контролируемыми.
Руководство по регионам, осведомленным о задаче создает сигнал, специфичный для задачи, объединяя токены языка с визуальными особенностями, извлеченными из объекта переднего плана, используя CLIP, заменяя общий токен объекта на вложение, полученное из фактического содержания изображения. Это объединенное представление вводится в основу через кросс-аттенцию, позволяя модели отслеживать, как объект и его визуальные эффекты эволюционируют в пространстве и времени, а также разрешать гибкое переключение между удалением и вставкой.
Потеря согласованности эффектов заставляет процессы удаления и вставки фокусироваться на одних и тех же измененных областях, поскольку обе задачи имеют дело с одним и тем же объектом и его визуальными эффектами. Аттенционные карты из каждой ветви затем объединяются в мягкие карты регионов и выравниваются с картой разницы, вычисленной из видео объекта и фона, так что тонкие изменения, такие как освещение и тени, сохраняются. Этот дополнительный потеря помогает вставке руководить удалением и поддерживать обе задачи согласованными.
Данные и тесты
Исследователи протестировали свой подход против различных методов inpainting, видео inpainting и удаления объектов: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; и MiniMax-Remover.
Wan2.1 был дообучен с помощью LoRA†† с использованием набора данных VOR при разрешении 832x480px. 81 последовательный кадр (эффективный лимит для WAN, после которого начинаются ошибки) был случайным образом отобран для обучения, которое проводилось в течение 129 000 итераций с пакетным размером 8 на восьми GPU H100, каждая из которых имела 80 ГБ видеопамяти. Скорость обучения была установлена на 1×102, а ранг LoRA – на 256.
ROSE-Benchmark – это синтетическая коллекция, являющаяся единственным внешним набором данных, протестированным; два других – это VOR-Eval, тестовый сплит набора данных VOR; и VOR-Wild, тестовый набор, состоящий из 195 реальных видео, собранных из интернета, в которых представлены “динамические объекты”.
Используемые метрики включали Пиковое отношение сигнал/шум (PSNR); Индекс структурированного подобия (SSIM); Учитываемое перцептивное подобие патчей изображений (LPIPS); и Расстояние Фреше для видео (FVD). Также проводилось исследование пользователя с 195 сгенерированными видео из VOR-Wild, в котором учитывались усредненные рейтинги 20 волонтеров.
Кроме того, авторы разработали QScore, метрику, использующую мультимодальную модель Qwen-VL, для оценки качества видео после удаления объектов, в плане остаточных артефактов или пропущенных удалений окружающей среды, таких как тени и эффекты освещения:

Количественное сравнение на наборах данных ROSE и VOR, с лучшими и вторыми результатами, показанными в жирном и подчеркнутом виде соответственно.
Относительно этих результатов авторы отмечают:
‘[Текущие] методы inpainting работают с отдельными кадрами, используя 2D-модели без временного моделирования, и поэтому не могут поддерживать временную согласованность в видео.
Недавние методы видео inpainting не явно моделируют боковые эффекты объекта, что приводит к неестественным результатам удаления. Существующие методы удаления объектов из видео не имеют пространственно-временной корреляционной модели между объектом и его боковыми эффектами, и, следовательно, часто производят артефакты и остаточные следы удаленных объектов.
‘В целом, EffectErase достигает лучших результатов во всех наборах данных и метриках оценки. Он получает лучшие баллы по метрике качества видео FVD, демонстрируя лучшую временную гладкость и согласованность сгенерированных видео.
‘Наш метод также достигает лучшего QScore и рейтингов пользователя, что еще больше демонстрирует его эффективность в производстве визуально убедительных результатов удаления.’
Для качественной оценки статические результаты представлены в статье (показаны прямо ниже), а также движущиеся результаты доступны на сайте проекта и в прилагаемом видео на YouTube:

Качественное сравнение на VOR-Eval по случаям оclusion, тени, освещения, отражения и деформации. Методы inpainting испытывают трудности с удалением эффектов вне маски, в то время как модели удаления часто оставляют видимые артефакты. EffectErase удаляет как целевой объект, так и его связанные эффекты более чисто. Пожалуйста, обратитесь к исходной статье для лучшего разрешения и к сайту проекта для видео-примеров.
Мы также направляем читателя к различным связанным примерам на сайте проекта, предварительно показанным ниже, а также к официальному видео на YouTube, встроенному в конце этой статьи:
Нажмите, чтобы воспроизвести. Пример сравнения с сайта проекта EffectErase. Пожалуйста, обратитесь к сайту для лучшего разрешения (с вышеупомянутыми оговорками) и для дальнейших примеров.
Авторы комментируют:
‘Методы видео inpainting часто производят артефакты в маскированных регионах и не могут полностью удалить боковые эффекты, вызванные удаленными объектами. Предыдущие подходы к удалению объектов, такие как [ROSE] и [MinMax-Remover], работают хорошо для удаления целевых объектов, но все еще испытывают трудности с боковыми эффектами, особенно в случаях оclusion, тени, освещения, отражения и деформации.
‘Напротив, EffectErase эффективно удаляет как целевой объект, так и его связанные эффекты, что приводит к чистым, согласованным и высококачественным результатам.’
В заключение исследователи отмечают, что их метод также может быть адаптирован для вставки объектов вместо удаления, без необходимости дополнительного обучения:

Результаты вставки объектов в видео. EffectErase вставляет объекты, сохраняя фоновый контент и генерируя согласованные эффекты, вызванные объектом, такие как тени и отражения, во всех кадрах.
Видео-результаты для задачи вставки можно увидеть в (временной) видео на YouTube (также встроенном без временных меток в конце статьи).
Заключение
Взгляд на подобные проекты по литературе показывает, что многие все еще надеются, что универсальные модели визуальных эффектов в конечном итоге смогут включить эту функциональность в общую “инструментальную” модель, предназначенную для широкого спектра эффектов, а не только для этой конкретной задачи.
Однако, исходя из принципа “джек-оф-олл-тредс”, кажется разумным предположить, что специализированные системы, такие как EffectErase, будут продолжать поддерживать преимущество над более общими подходами; с оговоркой, что разрыв может в конечном итоге сократиться достаточно, чтобы сделать разницу не стоит дополнительных усилий по обучению отдельной модели.
* Один мог бы надеяться, что с растущими проблемами, связанными с правами интеллектуальной собственности, все такие источники будут процитированы; но если доступные материалы из новой работы перечисляют источник 3D-моделей, я не смог найти эту ссылку.
† Ссылка, предоставленная, кажется, является общим объяснительным текстом из 2013 года, с конкретным VAE не детализированным.
†† Взятый из статьи, это семантически неясное описание, поскольку дообучение и LoRA – это разные процессы с очень разными требованиями.
Опубликовано в первый раз в субботу, 21 марта 2026 года.












