Погляд Anderson

Покращення видалення фону в AI без дорогої анотації людини

mm
Додайте Unite.AI до бажаних джерел у Google
An interpretation of some of the supplementary video material for the project SAM2Matting, featuring real footage of an Asian woman dropped out onto a green background by the new method. Source: https://henghuiding.com/SAM2Matting/

Нові дослідження показують, що AI може чисто видаляти людей з відео без дорогої анотації людини, покращуючи якість і стабільність

 

Більшість з нас мали досвід бути “вилученими” з фону через прості фільтри зміни/приховування фону на платформах відеоконференцій – і ми могли помітити обмеження таких систем, які тренуються на найбільш частих типах випадків, що зустрічаються на відеоконференції, і не є звичайно стійкими до чогось “неочікуваного” – або навіть до передбачуваних об’єктів, таких як пальці:

Типовий приклад системи витягування фону, навченої на AI, яка вирізає занадто багато джерельного об'єкта. Джерело - https://techcommunity.microsoft.com/discussions/microsoftteamspublicpreview/now-in-public-preview-green-screen-feature-in-teams-meetings/3786020

Типовий приклад системи витягування фону, навченої на AI, яка вирізає занадто багато джерельного об’єкта. Джерело

Найлегший спосіб, який став все популярнішим перед обличчям моделей мови та зору (VLM), які не спеціально тренуються для таких завдань, полягає у дообученні існуючої моделі на даних, які, ймовірно, зустрічаються в системі:

Два великих, ретельно анотованих набори даних підтримують рішення, запропоновані в статті 2020 року «Витягування фону в режимі реального часу з високою роздільністю»

Два великих, ретельно анотованих набори даних підтримують рішення, запропоновані в статті 2020 року «Витягування фону в режимі реального часу з високою роздільністю». Джерело

Однак, такі дані потрібно анотувати, що відбувається за певну вартість і витрат часу людиною; і в будь-якому випадку, це призводить до дуже конкретного і незагального інструменту, який коштує багато грошей і зазвичай не може бути використаний для широкого спектра завдань.

Незважаючи на це, розробка “цільових” моделей такого типу зараз є найкоротшим шляхом до ефективного висновку в різних галузях, не тільки у витягуванні фону/матуванні зображень (тобто видаленні фону/створенні матових фонів).

Видаліть!

Останнім часом зросла зацікавленість у використанні сім’ї моделей Segment Anything (SAM) для забезпечення автоматичного та детального витягування:

Натисніть, щоб відтворити, якщо необхідно. Приклад грубих кордонів, створених моделлю Segment Anything – ідеально підходить для анотації, але не достатньо добре для VFX-видалення.Джерело 

Нещодавнє дослідження з Китаю запропонувало більш складний спосіб використання моделей SAM для отримання кращих процесів витягування – поєднавши фундаментальну трекер з регіональним пропонентом-мостом з присвяченими головами матування. Таким чином, система здатна уточнювати деталі країв ітеративно та вирішувати складні краї, такі як волосся в русі:

Натисніть, щоб відтворити, якщо необхідно. З додаткового сайту, що підтримує нову статтю, збірка додаткових відео, що демонструють складність методу авторів для витягування.Джерело 

Вирішальне значення має те, що нова складова система тренується тільки на зображеннях, а не на відео, і не потребує додаткової анотації людини – традиційної перешкоди на шляху прогресу в цій та інших галузях AI.

Приклади витягування зображень і відео з високою роздільністю, отримані за допомогою нового методу, з складними випадками, такими як волосся, прозорість і рух, показаними поряд з послідовностями в дикій природі, де метод, на думку авторів, дає чистіші та більш стабільні результати, ніж попередні підходи.

Приклади витягування зображень і відео з високою роздільністю, отримані за допомогою нового методу, з складними випадками, такими як волосся, прозорість і рух, показані поряд з послідовностями в дикій природі, де метод, на думку авторів, дає чистіші та більш стабільні результати, ніж попередні підходи. Джерело

З трьома експериментальними моделями, створеними для роботи, автори стверджують, що вони досягли нового рівня результатів у цьому завданні, зберігаючи при цьому вищу здатність до узагальнення базової моделі, що означає, що метод дає універсальну модель з додатковими можливостями, а не ізольований інструмент, орієнтований на одне завдання.

Автори заявляють:

‘Комплексні експерименти показують, що SAM2Matting досягає найкращих результатів у витягуванні зображень і відео, з оцінкою матування відео в суворо нульовому режимі.

‘Розширені результати в дикій природі далі демонструють його сильну здатність до узагальнення у відкритих сценаріях з швидким рухом, складними фонами та прикріпленими об’єктами (наприклад, людина, яка їде на велосипеді).

‘Крім того, наші компоненти матування легкі та ефективні, що дозволяє варіанту SAM2.1-Tiny працювати зі швидкістю 40 кадрів в секунду на відео з 200 кадрів у форматі 1080p, використовуючи менше 5 ГБ відеопам’яті.’

Нова стаття називається SAM2Matting: узагальнене витягування зображень і відео і надходить від чотирьох авторів з Університету Фудан і Шанхайського університету фінансів та економіки. Робота має репозиторій на GitHub, який на момент написання цього тексту випустив чекпойнти різних варіантів, код для висновку та інтерактивну демонстрацію, а також обіцяє випустити код для навчання. Крім того, є сайт проекту.

Метод

Метод авторів роз’єднує відстежування та витягування细ких деталей, використовуючи трекер відеооб’єктів (VOS), щоб створити тимчасово узгоджений грубий масок для кожного кадру, тоді як спеціальний потік матування уточнює межі:

<img class=" wp-image-434620" src="https://arxiv.org/pdf/2606.27339" alt="Огляд потоку, де гнучкий проміжок і вхідне відео подаються у трекер відеооб'єктів для отримання грубого маска, який потім уточнюється детектором області інтересів і перетворюється у трип-карту перед тим, як прогресивний багатомашийовий передбачувач генерує кінцевий високодетальний мат.” width=”1015″ height=”411″ /> Огляд потоку, де гнучкий проміжок і вхідне відео подаються у трекер відеооб’єктів для отримання грубого маска, який потім уточнюється детектором області інтересів і перетворюється у трип-карту перед тим, як прогресивний багатомашийовий передбачувач генерує кінцевий високодетальний мат.

Детектор області інтересів потім визначає області з дрібними деталями або напівпрозорістю, перетворюючи їх у трип-карту (маску з трьома регіонами, що розділяє передній план, фон і неясні області), яка спрямовує уточнення, після чого прогресивний альфа-передбачувач генерує кінцевий мат за допомогою грубого до тонкого каскаду через кілька масштабів

Традиційні системи матування зазвичай одержують області інтересів, використовуючи прості морфологічні операції, або шляхом прямого перевикористання маски – підходи, які можуть пропустити дрібні деталі або включити області, які не потребують уточнення:

Порівняння стандартної обробки на основі маски з трип-картами, що показує, як прості морфологічні операції створюють грубі, однорідні межі, які пропускають дрібні структури, такі як волосся і прозорість, що призводить до втрати деталей у кінцевому маті.

Порівняння стандартної обробки на основі маски з трип-картами, що показує, як прості морфологічні операції створюють грубі, однорідні межі, які пропускають дрібні структури, такі як волосся і прозорість, що призводить до втрати деталей у кінцевому маті.

Композитний процент

Натомість запропонований детектор області інтересів розглядає цей крок як завдання класифікації пікселів (тобто розглядає кожен окремий піксель у зображенні як окреме рішення, і призначає йому мітку на основі того, чи належить він до області, критичної для матування, чи ні), яке інтегрує маску VOS, поточний кадр і багатомаширові особливості зображення, щоб більш точно ізолювати області, критичні для матування.

У новому підході передбачувана область інтересів спочатку перетворюється у псевдо-трип-карту, яка розділяє певний передній план і фон від неясних областей, використовуючи маску трекера для призначення відомих областей, а область інтересів позначається як неоднозначна, щоб подальша обробка могла зосередитися явно на межах, де потрібно розв’язати деталі.

Уточнення потім обробляється прогресивним альфа-передбачувачем, який розглядає матування як пошарове процес, передаючи проміжні результати від грубого до тонкого масштабу, причому кожна стадія використовує зображення, трип-карту та попередню оцінку для прогресивного уточнення структури та відновлення дрібних деталей.

На кінцевій стадії最高орізольний вихід інтерполюється для отримання завершеного мату, що дозволяє встановити широкі форми на ранній стадії, тоді як дрібніші елементи, такі як волосся та прозорість, розв’язуються на пізніших етапах.

Під час навчання автори заморозили трекер VOS, тренуючи тільки компоненти матування на високоякісних даних зображень – що дозволило уточнити дрібні деталі без погіршення узгодженості відстежування. Надзір здійснювався на кожному кадрі, області інтересів одержувалися з джерельної альфа-маски, і використовувалися для керування навчанням, тоді як детектор області інтересів тренувався з втратами, розробленими для заохочення точної класифікації меж, і зменшення зубчатих артефактів.

Для альфа-оцінки втрати застосовувалися на кількох масштабах для прогресивного покращення деталей, поряд з додатковальним обмеженням, призначеним для збереження передбачуваного мату узгодженого з оригінальною маскою – що допомагає зберегти структуру, і поблокувати порожні або розбиті області у кінцевому виводі.

Дані та тести

Спочатку для випробувань було використано вісім наборів даних для матування зображень:

Автори стверджують:

‘Як показано [вище], всі три варіанти SAM2Matting послідовно перевершують попередні базові лінії по різних метрикам. Наприклад, варіант SAM2.1-Tiny досягає MAD на 11,48 нижче, ніж MAM на P3M-500-NP.’

Кількісні тести

Автори розпочали кількісне тестування нових систем на матуванні зображень, використовуючи наступні бенчмарки:

Кількісні результати на бенчмарках матування зображень по P3M-500-NP, AM-2K тесту та PPM-100, з нижчими значеннями, що вказують на кращу продуктивність по всіх метриках, і найкращі, другі та треті результати виділені червоним, оранжевим та жовтим кольорами відповідно.

Кількісні результати на бенчмарках матування зображень по P3M-500-NP, AM-2K тесту та PPM-100, з нижчими значеннями, що вказують на кращу продуктивність по всіх метриках, і найкращі, другі та треті результати виділені червоним, оранжевим та жовтим кольорами відповідно.

Для матування відео SAM2Matting оцінювався на V-HIM60 і VideoMatte у нульовому режимі, проти відео-тренованих систем MatAnyone2, MatAnyone, MaGGIe, FTP-VM, і RVM, з послідовними здобутками, зареєстрованими на обох середніх і важких розрізах.

По всім бенчмаркам три варіанти реєструють нижчі помилки на MAD, MSE, Grad, Conn і dtSSD, причому SAM3 досягає найкращих загальних результатів, тоді як найнижчі значення dtSSD, як здається, вказують на більшу стабільність кадр до кадру.

Кількісні результати на бенчмарках матування відео по V-HIM60 і VideoMatte, оцінені у нульовому режимі, з нижчими значеннями, що вказують на кращу продуктивність по всіх метриках, і найкращі, другі та треті результати виділені червоним, оранжевим та жовтим кольорами відповідно.

Кількісні результати на бенчмарках матування відео по V-HIM60 і VideoMatte, оцінені у нульовому режимі, з нижчими значеннями, що вказують на кращу продуктивність по всіх метриках, і найкращі, другі та треті результати виділені червоним, оранжевим та жовтим кольорами відповідно.

Автори стверджують, що ці результати відображають декупований дизайн, де трекер VOS зберігає тимчасову структуру, а модулі матування зосереджуються на деталях меж, що дозволяє моделям, навченим на зображеннях, перевершувати повністю супервізовані відео-підходи.

Яскраві тести

Для матування людини у яскравих тестах автори виявили, що Sam2Matting перевершує конкурентні базові лінії:

Яскравне порівняння на матуванні людини і в дикій природі відео, де SAM2Matting зберігає дрібні волоссяні нитки та напівпрозорі області більш точно, ніж RVM і MatAnyone, генеруючи чистіші межі та менше відсутніх структур у складних областях.

Яскравне порівняння на матуванні людини і в дикій природі відео, де SAM2Matting зберігає дрібні волоссяні нитки та напівпрозорі області більш точно, ніж RVM і MatAnyone, генеруючи чистіші межі та менше відсутніх структур у складних областях.

Як показано нижче, існуючі системи матування відео, такі як MatAnyone2 і MaGGIe, навчені на домен-специфічних і часто людських центричних наборах даних, боролися за узагальнення до послідовностей у дикій природі, особливо при обробці швидко рухомих об’єктів, таких як ростуть коріння, напівпрозорі метелики і швидко капаюча вода:

Яскравне порівняння на послідовностях у дикій природі, де SAM2Matting зберігає дрібні структури та тимчасову узгодженість більш ефективно, ніж MatAnyone2 і MaGGIe, особливо для нелюдських об'єктів, швидкого руху та напівпрозорих елементів, таких як вода, скло та крила комах.

Яскравне порівняння на послідовностях у дикій природі, де SAM2Matting зберігає дрібні структури та тимчасову узгодженість більш ефективно, ніж MatAnyone2 і MaGGIe, особливо для нелюдських об’єктів, швидкого руху та напівпрозорих елементів, таких як вода, скло та крила комах.

Натомість SAM2Matting показав здатність підтримувати стабільне відстежування та витягувати дрібні деталі більш надійно в цих складних сценаріях.

Нарешті, як показано на наступному зображенні, SAM2Matting ефективно обробляє цілі з прикріпленими об’єктами, такими як люди, які їдуть на велосипедах або тримають лижі, придушуючи при цьому фонові відволікання, користуючись обмеженням узгодженості мату-маски, описаним раніше.

Яскравне порівняння на послідовностях з прикріпленими об'єктами і фоновими відволіканнями, де SAM2Matting зберігає структури, такі як велосипеди та лижі, більш точно, ніж MatAnyone2, придушуючи при цьому сусідні клапоть і підтримуючи чистіші силуети по кадрах.

Яскравне порівняння на послідовностях з прикріпленими об’єктами і фоновими відволіканнями, де SAM2Matting зберігає структури, такі як велосипеди та лижі, більш точно, ніж MatAnyone2, придушуючи при цьому сусідні клапоть і підтримуючи чистіші силуети по кадрах.

Висновок

Досягнення, описані в новій статті, демонструють, наскільки витягування, одна з найдавніших завдань у комп’ютерному зорі, залишається нерозв’язаною і стійкою до узагальнених підходів. Як і у випадку з багатьма іншими моделями, заснованими на зорі, проблема полягає в тому, що алгоритми витягування тримаються доменних знань, а не легко адаптуються до невидимих і невідомих об’єктів; це завдання особливо сильно навантажує зовнішні межі узагальнення моделі.

Хоча нова робота є кроком вперед від цієї залежності, все ще є довгий шлях, враховуючи ступінь, у якій це завдання впроваджене в нашу повсякденну життя через відеопортали для спілкування.

 

Перша публікація понеділка, 13 липня 2026

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai