Anderson 视角
提高AI背景移除的質量而不需要昂貴的人工標註

新研究顯示,AI可以在不需要昂貴的人工標註的情況下,清晰地將人從視頻中移除,從而提高質量和穩定性
我們大多數人都經歷過在視頻聊天平臺上使用簡單的背景更改/遮擋過濾器被“移除”的情況,並且我們可能已經注意到這些系統的局限性,它們是基於最常見的案例進行訓練的,並且不太能夠應對“意外”的情況,甚至連可預測的物體,如手指,也無法處理。

一個典型的AI訓練的前景提取系統裁剪掉太多原始主體的例子. 來源
最簡單的解決方案是對現有的模型進行微調,尤其是在視覺語言模型(VLMs)不針對這些任務進行訓練的情況下。這種方法需要在系統可能遇到的數據上進行微調。
2020年論文“實時高分辨率背景遮罩”的兩個高容量、精心標註的數據集. 來源
然而,這種數據需要人工標註,這是一個昂貴且耗時的過程。另外,這種方法通常會產生一個非常特定的工具,不能用於其他任務。
目前,開發這種“目標”模型是實現有效推理的最短途徑,不僅適用於視頻和圖像遮罩(即背景移除/前景遮罩),還適用於其他領域。
即使在Zoom等平臺中,AI增強的過濾器也仍然存在局限性,Zoom仍然建議使用綠幕作為最佳的背景移除解決方案,這是一種繁瑣且“專業”的解決方案,可能會讓大多數人感到尷尬。
移除它!
最近,人們越來越關注使用“Segment Anything”(SAM)家族來實現自動化和細緻的提取。由於SAM最初是為了輔助標註而不是提供視覺效果管道中可接受的清晰輪廓而開發的,其默認邊界不適合單獨解決這個挑戰。
點擊播放,如有需要。一個使用Segment Anything模型創建的粗略邊界的例子 – 適合標註,但不適合視覺效果。來源
最近,中國提出了一種更複雜的方法,使用SAM模型來獲得更好的提取過程,方法是將基礎追蹤器(如SAM)與一個具有專用遮罩頭的區域提議橋接器結合起來。這樣,系統就可以遞歸地細化邊緣細節,並解決挑戰性邊緣,如頭髮的運動。
點擊播放,如有需要。從支持新論文的附加網站上的一些補充視頻,展示作者方法的複雜性。來源
關鍵的是,新的複合系統只在圖像上進行訓練,而不是在視頻上,並且不需要額外的人工標註 – 傳統上是這個領域進步的障礙。
使用新方法實現的細緻圖像和視頻遮罩的例子,展示了具有挑戰性的案例,如頭髮、透明度和運動,以及在野外序列中產生的更清晰、更穩定的結果。 來源
使用三個實驗模型,作者聲稱在這項任務中實現了新的最先進的性能,並保留了基礎模型更高的泛化能力,意味著方法產生了一個多用途模型,具有額外的能力,而不是一個針對單一任務的工具。
作者聲稱:
‘綜合實驗表明,SAM2Matting在圖像和視頻遮罩上實現了最先進的性能,視頻遮罩以嚴格的零次學習方式進行評估。 ‘
‘廣泛的在野外結果進一步證明了其對開放世界場景的強大泛化能力,包括快速運動、複雜背景和目標附件(例如,人騎自行車)。 ‘
‘此外,我們的遮罩組件是輕量級和高效的,SAM2.1-Tiny變體可以在使用不到5GB的GPU內存的情況下,以40幀每秒的速度運行在200幀的1080p視頻上。’
新論文題為《SAM2Matting:通用圖像和視頻遮罩》,由復旦大學和上海財經大學的四位作者完成。該工作有一個GitHub倉庫,目前已經發布了不同變體的檢查點、推理代碼和交互式演示,訓練代碼的發布也已經在計畫中。
方法
作者的方法使用視頻物體分割(VOS)追蹤器來產生每個幀的時間上一致的粗略遮罩,而一個專用的遮罩管道則對邊界進行細化:
管道概覽,柔性提示和輸入視頻輸入到視頻物體分割追蹤器中,以產生粗略遮罩,然後由ROI檢測器進行細化並轉換為三通道遮罩,然後由進步式多尺度預測器生成最終的高細節遮罩。
然後,ROI檢測器識別出具有細節或半透明的區域,並將其轉換為三通道遮罩(一個將前景、背景和不確定區域分成三個區域的遮罩),以指導細化,然後進步式Alpha預測器通過在多個尺度上進行遞歸生成最終的遮罩。
傳統的遮罩系統通常使用簡單的形態學運算或直接重用遮罩來推導出興趣區域 – 這些方法可能會忽略細節或包含不需要細化的區域。
標準的遮罩基於處理與基準三通道遮罩的比較,展示了簡單的形態學運算如何產生粗糙的、均勻的邊界,錯過了細結構,如頭髮和透明度,從而導致最終遮罩中細節的丟失。
複利
相反,提出的ROI檢測器將這一步驟視為一個像素級的分類任務(即,每個圖像中的個別像素都被視為一個單獨的決策,並根據它是否屬於遮罩關鍵區域而分配一個標籤),該任務結合了VOS遮罩、當前幀和多尺度圖像特徵,以更精確地隔離遮罩關鍵區域。
在新方法中,預測的ROI首先被轉換為一個“虛擬”的三通道遮罩,使用追蹤器遮罩來分配已知區域,並將ROI標記為模糊區域,以便後續處理可以專注於邊界的細化。
然後,進步式Alpha預測器將遮罩視為一個遞歸的過程,將中間結果從粗糙的尺度傳遞到更細的尺度,每個階段都使用圖像、遮罩和前一次估計來遞歸地細化結構和恢復細節。
在最終階段,最高解析度的輸出被上採樣以產生完成的遮罩,允許寬泛的形狀在早期階段被建立,而更細的元素,如頭髮和透明度,則在後期階段被解決。
在訓練過程中,作者凍結了VOS追蹤器,並只對遮罩組件進行了訓練,使用高質量的圖像數據,允許細節被細化而不會降低追蹤的一致性。監督是在每個幀上進行的,使用基於真實的Alpha遮罩推導出的興趣區域,並用於指導學習,而ROI檢測器則使用設計用於鼓勵準確的邊界分類和減少鋸齒狀的伪影的損失進行了訓練。
對於Alpha估計,損失被應用於多個尺度上,以遞歸地改進細節,並且還有一個額外的約束被應用,以保持預測的遮罩與原始遮罩的一致性 – 有助於保存結構,並防止最終輸出中的空洞或斷裂區域。
數據和測試
八個圖像遮罩數據集被用於初步的試驗:I-HIM50K;P3M-10k;CelebAHairMask-HQ;AIM-500;Distinctions-646;AM-2K;UHRIM;和RefMatte;以及三個“Sam2Matting”方法的變體被開發為VOS追蹤器,分別使用SAM2.1-Tiny;SAM2.1-Base+;和概念導向的SAM3。
追蹤器組件被凍結,只有遮罩組件被優化。所有版本都在四個NVIDIA A6000 GPU上訓練了五個epoch,每個GPU的VRAM分配為48GB。批次大小為32,使用AdamW優化器。使用的指標包括絕對差值(MAD);均方差(MSE);梯度(Grad);連接性(Conn);和dtSSD(僅用于視頻遮罩)。
定量測試
作者首先對新的系統進行了圖像遮罩的定量測試,使用的基準包括P3M-500-NP;AM-2K(結果中標記為“GFM”);MAM(結果中標記為“Matte Anything”);E2E-HIM;Lightweight;和PPM-100(結果中標記為“MODNet”):
圖像遮罩基準的定量結果,顯示所有指標的較低值,最佳、次佳和第三佳結果分別以紅色、橙色和黃色突出顯示。
對於這些結果,論文指出:
‘如上所示,SAM2Matting的所有三個變體在不同指標上都一致地超越了之前的基準。例如,SAM2.1-Tiny變體在P3M-500-NP上比MAM低11.48個MAD。’
作者認為,結果表明他們的方法通過核心概念設計實現了更好的結果,而不是由於數據的質量。
對於視頻遮罩,SAM2Matting在V-HIM60和VideoMatte上以零次學習的方式進行了評估,與MatAnyone2、MatAnyone、MaGGIe、FTP-VM和RVM等視頻訓練系統進行了比較,結果顯示在中等和困難分割上都有穩定的增益。
在所有基準上,三個變體都記錄了MAD、MSE、Grad、Conn和dtSSD的更低錯誤,SAM3實現了最強的整體結果,而最低的dtSSD值顯示了更穩定的幀與幀的一致性。
視頻遮罩基準的定量結果,顯示所有指標的更低錯誤,最佳、次佳和第三佳結果分別以紅色、橙色和黃色突出顯示。
作者認為,這些結果反映了解耦設計,其中VOS追蹤器保留了時間結構,而遮罩模塊則關注邊界細節,從而使圖像訓練模型超越了完全監督的視頻方法。
質性測試
在人體遮罩的質性測試中,作者發現Sam2Matting超越了競爭對手的基準:
人體和在野外視頻遮罩的質性比較,SAM2Matting更準確地保留了細髮和半透明區域,產生了更干凈的邊界和更少的缺失結構,在具有挑戰性的區域中。
如下所示,現有的視頻遮罩系統,如MatAnyone2和MaGGIe,訓練在特定領域和往往以人為中心的數據集上,難以推廣到在野外序列,特別是在處理快速移動的主體,如生長的根、半透明的蝴蝶和快速滴落的水等情況下。

在野外序列的質性比較,SAM2Matting更有效地保留了細結構和時間一致性,特別是在非人類主體、快速運動和半透明元素(如水、玻璃和昆蟲翅膀)中。
相反,SAM2Matting被證明能夠在這些具有挑戰性的情景中保持穩定的追蹤和更可靠地提取細節。
最後,如下圖所示,SAM2Matting有效地處理了具有附加物體的目標,如人騎自行車或握住滑雪桿,同時抑制了附近的背景干擾,受益於之前描述的遮罩遮罩一致性約束。
具有附加物體和背景干擾的序列的質性比較,SAM2Matting更準確地保留了結構,如自行車和滑雪桿,同時抑制了附近的雜亂和在幀之間保持了更干凈的剪影。
結論
新論文中描述的成就表明,提取作為計算機視覺中最古老的任務之一,仍然未被解決和對於普遍方法具有抵抗力。與許多其他基於視覺的模型一樣,問題在於提取算法過於依賴於特定領域的知識,而不是輕鬆地適應於未知和不可預測的物體;這個特定任務對於模型的泛化能力提出了挑戰。
雖然新的工作是從這種依賴中向前邁出的一步,但仍然有很長的路要走,考慮到這個任務在我們的日常生活中通過視頻聊天門戶的普遍存在。
首次發布於2026年7月13日星期一












