Ángulo de Anderson
Mejorar la eliminación de fondo de IA sin costosa anotación humana

Nueva investigación muestra que la IA puede cortar limpiamente a las personas de los videos sin costosa anotación humana, mejorando la calidad y la estabilidad
La mayoría de nosotros habrá experimentado ser ‘eliminados’ de un fondo a través de filtros simples de alteración o ocultación de fondo en plataformas de videoconferencia – y es posible que hayamos notado las limitaciones de dichos sistemas, que se entrenan en los tipos de casos más frecuentes que es probable que se encuentren en una conferencia de video, y no son generalmente robustos a nada ‘inesperado’ – o incluso a objetos predecibles, como dedos:

Un ejemplo típico de un sistema de extracción de primer plano entrenado con IA que recorta demasiado del sujeto de origen. Fuente
La solución más fácil, y que se está volviendo cada vez más popular frente a los modelos de lenguaje y visión (VLM) que no están específicamente entrenados para dichas tareas, es ajustar un modelo existente en datos que probablemente se encuentren en el sistema:

Dos conjuntos de datos de alta volumen y anotados exhaustivamente subyacen a las soluciones ofrecidas en el papel de 2020 ‘Real-Time High-Resolution Background Matting’. Fuente
Sin embargo, dichos datos deben ser anotados, a algun costo y con algún costo de tiempo, por humanos; y en cualquier caso, esto resulta en una herramienta muy específica y no generalizada que cuesta mucho dinero, y que no puede ser utilizada para una variedad más amplia de tareas.
A pesar de ello, desarrollar modelos ‘dirigidos’ de este tipo es actualmente la ruta más corta hacia la inferencia efectiva en una variedad de dominios, no solo en la matting de video e imagen (es decir, eliminación de fondo y creación de máscaras de primer plano). Hasta la fecha, muchas de las soluciones no supervisadas ofrecidas han movido el problema de un lado a otro.
Incluso ahora, a pesar de la proliferación de filtros de IA en plataformas como Zoom, esta última sigue recomendando una pantalla verde como la solución óptima para la eliminación de fondo – una solución engorrosa y un poco ‘profesional’ que nos haría sentir un poco incómodos a la mayoría de nosotros.
Cortarlo
Recientemente, ha crecido el interés en el uso de la familia Segment Anything (SAM) para proporcionar extracción automatizada y detallada. Dado que SAM se desarrolló para ayudar a la anotación en lugar de proporcionar contornos nítidos aceptables en un flujo de trabajo de efectos visuales, sus límites predeterminados no son adecuados para abordar el desafío sin ayuda:
Haga clic para reproducir, según sea necesario. Un ejemplo de los bordes rugosos creados por un modelo Segment Anything – ideal para anotación, pero no lo suficientemente bueno para VFX drop-out. Fuente
Una oferta reciente de China ha propuesto una forma más sofisticada de utilizar modelos SAM para obtener procesos de extracción superiores – al casar un rastreador fundamental como SAM con un puente de propuesta de región con cabezales de matting dedicados. De esta manera, el sistema puede refinar los detalles de los bordes de manera iterativa y resolver bordes desafiantes, como el cabello en movimiento:
Haga clic para reproducir, según sea necesario. Del sitio web auxiliar que respalda el nuevo papel, un conjunto de videos suplementarios, que demuestran la sofisticación del método de extracción de los autores. Fuente
Crucialmente, el nuevo sistema compuesto se entrena solo en imágenes, no en videos, y no requiere anotación humana adicional – el obstáculo tradicional contra el progreso en este, y diversos otros dominios de IA.

Ejemplos de matting de imagen y video de grano fino logrados con el nuevo método, con casos desafiantes como el cabello, la transparencia y el movimiento mostrados junto con secuencias in-the-wild, donde el método produce – según los autores – resultados más limpios y estables que los enfoques anteriores. Fuente
Con tres modelos experimentales producidos para el trabajo, los autores afirman un nuevo rendimiento de estado del arte en esta tarea, mientras conservan las capacidades de generalización más altas del modelo base, lo que significa que el método produce un modelo de propósito general con capacidades adicionales, en lugar de una herramienta acorralada dirigida a una sola tarea.
Los autores declaran:
‘Experimentos exhaustivos muestran que SAM2Matting logra un rendimiento de estado del arte (SOTA) en matting de imagen y video, con matting de video evaluado en un modo estrictamente zero-shot.
‘Resultados extensos in-the-wild demuestran aún más su fuerte generalización a escenarios de mundo abierto con movimiento rápido, fondos complejos y objetos de destino (por ejemplo, hombre montando una bicicleta).
‘Además, nuestros componentes de matting son ligeros y eficientes, lo que permite que la variante SAM2.1-Tiny se ejecute a 40 FPS en un video de 1080p de 200 cuadros utilizando menos de 5 GB de memoria de GPU.’
El nuevo papel se titula SAM2Matting: Matting de imagen y video generalizado, y proviene de cuatro autores de la Universidad de Fudan y la Universidad de Finanzas y Economía de Shanghái. El trabajo tiene un repositorio de GitHub, que en el momento de la escritura ha lanzado puntos de referencia de diferentes variantes, código de inferencia y una demo interactiva, con una promesa de lanzar código de entrenamiento. Además, hay un sitio web del proyecto.
Método
El método de los autores separa el seguimiento de la extracción de detalles finos utilizando un rastreador de segmentación de objetos de video (VOS) para producir una máscara grosera temporalmente coherente para cada cuadro, mientras que una tubería de matting dedicada refina los bordes:

Visión general de la tubería, donde una llamada flexible y una alimentación de video de entrada se alimentan en un rastreador de segmentación de objetos de video para producir una máscara grosera, que se refina con un detector de ROI y se convierte en un trimap antes de que un predictor de escala múltiple progresivo genere la máscara de alta definición final.
Un detector de región de interés (ROI) identifica entonces regiones con detalles finos o semitransparentes, convirtiéndolos en un trimap (una máscara de tres regiones que divide el primer plano, el fondo y las áreas inciertas) que guía el refino, después de lo cual un predictor alfa progresivo genera la máscara final a través de una cascada de grano fino a grueso a través de múltiples escalas
Los sistemas de matting convencionales derivan normalmente las regiones de interés utilizando operaciones morfológicas simples, o reutilizando directamente la máscara – enfoques que pueden pasar por alto los detalles finos, o incluir áreas que no requieren refino:
Comparación del procesamiento basado en máscara estándar con trimaps de verdad de referencia, que muestra cómo las operaciones morfológicas simples producen bordes uniformes y gruesos que pierden estructuras finas como el cabello y la transparencia, lo que lleva a la pérdida de detalles en la máscara final.
Interés compuesto
Por el contrario, el detector de región de interés propuesto trata este paso como una tarea de clasificación de píxeles (es decir, tratando cada píxel individual en la imagen como una decisión separada, y asignándole una etiqueta según si pertenece a una región crítica de matting o no) que integra la máscara de VOS, el cuadro actual y las características de imagen de múltiples escalas, para aislar más precisamente las regiones críticas de matting.
En el nuevo enfoque, la ROI predicha se convierte primero en un pseudo-trimap que separa el primer plano definido y el fondo de las regiones inciertas, utilizando la máscara del rastreador para asignar áreas conocidas mientras marca la ROI como ambigua, para que el procesamiento posterior se pueda centrar explícitamente en los bordes donde se debe resolver el detalle.
El refino se maneja entonces mediante un predictor alfa progresivo que trata el matting como un proceso paso a paso, pasando resultados intermedios de grano grueso a más fino, con cada etapa utilizando la imagen, el trimap y la estimación anterior para afilar progresivamente la estructura y recuperar los detalles finos.
En la etapa final, la salida de mayor resolución se amplía para producir la máscara final, lo que permite que las formas amplias se establezcan temprano mientras que los elementos más finos, como el cabello y la transparencia, se resuelven en pasos posteriores.
Durante el entrenamiento, los autores congelaron el rastreador de VOS, mientras entrenaban solo los componentes de matting en datos de imagen de alta calidad – lo que permitió que los detalles finos se refinaran sin degradar la consistencia del seguimiento. La supervisión se aplicó por cuadro, con regiones de interés derivadas de la máscara de alfa de verdad, y se utilizó para guiar el aprendizaje, mientras que el detector de ROI se entrenó con pérdidas diseñadas para fomentar la clasificación de bordes precisa y reducir los artefactos dentados.
Para la estimación alfa, se aplicaron pérdidas en múltiples escalas para mejorar progresivamente los detalles, junto con una restricción adicional destinada a mantener la máscara predicha alineada con la máscara original – lo que ayuda a preservar la estructura y a evitar regiones huecas o rotas en la salida final.
Datos y pruebas
Se utilizaron inicialmente ocho conjuntos de datos de matting de imagen para las pruebas: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; y RefMatte; y se desarrollaron tres variantes del enfoque ‘Sam2Matting’ como rastreadores de VOS, utilizando respectivamente SAM2.1-Tiny; SAM2.1-Base+; y el concepto enfocado SAM3.
El componente del rastreador se congeló, con solo los componentes de matting optimizados. Todas las versiones se entrenaron durante cinco épocas en cuatro GPUs NVIDIA A6000, cada una con una asignación de VRAM de 48GB. Se utilizó un tamaño de lote de 32, bajo el optimizador AdamW. Las métricas utilizadas fueron Diferencia absoluta media (MAD); Error cuadrático medio (MSE); Gradiente (Grad); Conectividad (Conn); y dtSSD (solo para matting de video).
Pruebas cuantitativas
Los autores comenzaron con pruebas cuantitativas de los nuevos sistemas en matting de imagen, utilizando los benchmarks P3M-500-NP; AM-2K (‘GFM’ en resultados); MAM (‘Matte Anything’, en resultados); E2E-HIM; Lightweight; y PPM-100 (‘MODNet’, en resultados):
Resultados cuantitativos en benchmarks de matting de imagen a través de P3M-500-NP, AM-2K test, y PPM-100, con valores más bajos que indican un mejor rendimiento en todas las métricas, y los mejores, segundos y terceros resultados resaltados en rojo, naranja y amarillo, respectivamente. Por favor, consulte el papel de origen para una mejor resolución.
De estos resultados, el papel declara:
‘Como se muestra [arriba], las tres variantes de SAM2Matting superan consistentemente las líneas de base anteriores en diferentes métricas. Por ejemplo, la variante SAM2.1-Tiny logra una MAD 11,48 más baja que MAM en P3M-500-NP.’
Los autores mantienen que los resultados en general indican que su enfoque logra resultados superiores a través del diseño conceptual central, y no debido al nivel de curación de los datos.
Para el matting de video, SAM2Matting se evaluó en V-HIM60 y VideoMatte en un entorno zero-shot, contra los sistemas de video entrenados MatAnyone2, MatAnyone, MaGGIe, FTP-VM, y RVM, con ganancias consistentes informadas en ambas particiones medias y difíciles.
En todos los benchmarks, las tres variantes registran errores más bajos en MAD, MSE, Grad, Conn y dtSSD, con SAM3 logrando los resultados generales más fuertes, mientras que los valores de dtSSD más bajos aparentemente indican una consistencia de cuadro a cuadro más estable:
Resultados cuantitativos en benchmarks de matting de video a través de V-HIM60 y VideoMatte, evaluados en un entorno zero-shot, que muestra errores más bajos en todas las métricas, con los mejores, segundos y terceros resultados resaltados en rojo, naranja y amarillo, respectivamente.
Los autores sostienen que estos resultados reflejan el diseño desacoplado, donde el rastreador de VOS conserva la estructura temporal y los módulos de matting se centran en los detalles de los bordes, lo que permite que los modelos entrenados en imágenes superen los enfoques de video completamente supervisados.
Pruebas cualitativas
Para el matting humano en pruebas cualitativas, los autores encontraron que Sam2Matting superó a las líneas de base competitivas:
Comparación cualitativa en matting de video humano y en secuencias in-the-wild, donde SAM2Matting conserva hebras de cabello finas y regiones semitransparentes más precisamente que RVM y MatAnyone, produciendo bordes más limpios y menos estructuras perdidas en áreas desafiantes.
Como se muestra a continuación, los sistemas de matting de video existentes, como MatAnyone2 y MaGGIe, entrenados en conjuntos de datos específicos del dominio y a menudo centrados en humanos, lucharon por generalizar a secuencias in-the-wild, particularmente cuando se trataba de sujetos en movimiento rápido, como raíces en crecimiento, mariposas semitransparentes y agua goteando rápidamente:

Comparación cualitativa en secuencias in-the-wild, donde SAM2Matting conserva estructuras finas y coherencia temporal más efectivamente que MatAnyone2 y MaGGIe, particularmente para sujetos no humanos, movimiento rápido y elementos semitransparentes como agua, vidrio y alas de insectos. Por favor, consulte el papel de origen para una mejor resolución.
Por el contrario, SAM2Matting demostró ser capaz de mantener un seguimiento estable y extraer detalles finos de manera más confiable en estos escenarios desafiantes.
Finalmente, como se muestra en la figura a continuación, SAM2Matting manejó efectivamente los objetos de destino con objetos adjuntos, como personas montando bicicletas o sosteniendo bastones de esquí, mientras suprimía las distracciones del fondo cercano, beneficiándose de la restricción de coherencia de la máscara de matting mencionada anteriormente.

Comparación cualitativa en secuencias con objetos adjuntos y distracciones del fondo, donde SAM2Matting conserva estructuras como bicicletas y bastones de esquí más precisamente que MatAnyone2, mientras suprime el desorden cercano y mantiene siluetas más limpias a lo largo de los cuadros.
Conclusión
Los logros detallados en el nuevo papel demuestran la medida en que la extracción, una de las tareas más antiguas en visión por computadora, sigue sin resolverse y resiste enfoques generalizados. Al igual que con muchos otros modelos de visión, el problema sigue siendo que los algoritmos de extracción se aferran al conocimiento del dominio en lugar de adaptarse fácilmente a objetos no vistos y desconocidos; esta tarea en particular pone a prueba los límites más externos de la generalización de un modelo.
Mientras que el nuevo trabajo es un paso adelante desde esa dependencia, todavía hay un largo camino por recorrer, considerando la medida en que esta tarea está integrada en nuestras vidas diarias, a través de portales de videoconferencia.
Publicado por primera vez el lunes 13 de julio de 2026












