Góc nhìn Anderson
Tách nền ảnh thông minh dựa trên hiểu biết về cảnh

Trong phim tài liệu kèm theo bản phát hành DVD năm 2003 của Alien3 (1992), huyền thoại hiệu ứng hình ảnh Richard Edlund nhớ lại với sự kinh hoàng về “đấu vật sumo” của quá trình trích xuất matte photochemical mà thống trị công việc hiệu ứng hình ảnh giữa cuối những năm 1930 và cuối những năm 1980. Edlund mô tả tính chất may rủi của quá trình này như “đấu vật sumo”, so với các kỹ thuật màn hình xanh / xanh lá cây kỹ thuật số đã tiếp quản vào đầu những năm 1990 (và ông đã trở lại với ẩn dụ này kể từ đó).
Trích xuất một yếu tố tiền cảnh (chẳng hạn như một người hoặc một mô hình tàu vũ trụ) từ một nền, để hình ảnh được cắt có thể được tổng hợp vào một tấm nền, ban đầu được thực hiện bằng cách quay đối tượng tiền cảnh chống lại một nền thống nhất màu xanh hoặc màu xanh lá cây.

Quá trình trích xuất photochemical tốn thời gian cho một cảnh hiệu ứng hình ảnh của ILM cho ‘Return of the Jedi’ (1983). Nguồn: https://www.youtube.com/watch?v=qwMLOjqPmbQ
Trong đoạn phim kết quả, màu nền sẽ được cách ly hóa học và sử dụng làm mẫu để in lại đối tượng tiền cảnh (hoặc người) trong một máy in quang học như một đối tượng “lơ lửng” trong một tế bào phim trong suốt.
Quá trình này được gọi là lớp phủ tách màu (CSO) – mặc dù thuật ngữ này cuối cùng sẽ trở nên gắn liền với các hiệu ứng video “Chromakey” thô hơn trong sản xuất truyền hình có ngân sách thấp hơn của những năm 1970 và 1980, được thực hiện bằng phương tiện tương tự chứ không phải hóa học hoặc kỹ thuật số.

Một bản demo của Color Separation Overlay vào năm 1970 cho chương trình truyền hình dành cho trẻ em của Anh ‘Blue Peter’. Nguồn: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx
Bất kể là đối với các yếu tố phim hay video, sau đó đoạn phim được trích xuất có thể được chèn vào bất kỳ đoạn phim nào khác.
Mặc dù quá trình natri-vapor độc quyền và tốn kém của Disney (được mã hóa trên màu vàng và cũng được sử dụng cho bộ phim kinh dị năm 1963 của Alfred Hitchcock The Birds) mang lại định nghĩa tốt hơn và các matte sắc nét hơn, nhưng quá trình trích xuất photochemical vẫn còn tốn thời gian và không đáng tin cậy.

Quá trình trích xuất natri-vapor độc quyền của Disney yêu cầu nền gần cuối phổ màu vàng. Ở đây, Angela Lansbury được treo trên dây trong quá trình sản xuất một cảnh hiệu ứng hình ảnh cho ‘Bedknobs and Broomsticks’ (1971). Nguồn
Beyond Digital Matting
Trong những năm 1990, cuộc cách mạng kỹ thuật số đã loại bỏ các hóa chất, nhưng không phải là nhu cầu về màn hình xanh. Bây giờ, có thể loại bỏ nền màu xanh (hoặc bất kỳ màu nào) chỉ bằng cách tìm kiếm các pixel trong phạm vi dung sai của màu đó, trong phần mềm chỉnh sửa pixel như Photoshop, và một thế hệ mới của các bộ tổng hợp video có thể tự động loại bỏ nền màu.
Gần như trong một đêm, sáu mươi năm của ngành công nghiệp in quang học đã bị consigned vào lịch sử.
Mười năm cuối cùng của nghiên cứu tầm nhìn máy tính tăng tốc bởi GPU đang đưa việc trích xuất matte vào một thời đại thứ ba, nhiệm vụ cho các nhà nghiên cứu là phát triển các hệ thống có thể trích xuất các matte chất lượng cao mà không cần màn hình xanh. Tại Arxiv alone, các bài báo liên quan đến các đổi mới trong trích xuất tiền cảnh dựa trên học máy là một tính năng hàng tuần.
Putting Us in the Picture
Trục này của sự quan tâm học thuật và công nghiệp trong trích xuất AI đã ảnh hưởng đến không gian tiêu dùng: các thực hiện thô nhưng có thể hoạt động trong hình thức Zoom và Skype các bộ lọc có thể thay thế nền phòng khách của chúng tôi với các hòn đảo nhiệt đới, v.v., trong các cuộc gọi hội nghị video.
Tuy nhiên, các matte tốt nhất vẫn yêu cầu một màn hình xanh, như Zoom lưu ý vào tuần trước.

Trái, một người đàn ông trước một màn hình xanh, với tóc được trích xuất tốt qua tính năng Nền ảo của Zoom. Phải, một người phụ nữ trước một cảnh trong nhà thông thường, với tóc được trích xuất thuật toán, ít chính xác hơn, và với yêu cầu tính toán cao hơn. Nguồn: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image
Một bài đăng khác từ Nền tảng Hỗ trợ Zoom cảnh báo rằng việc trích xuất không có màn hình xanh cũng yêu cầu nhiều năng lực tính toán hơn trong thiết bị thu.
The Need to Cut It Out
Các cải tiến về chất lượng, tính di động và kinh tế tài nguyên cho các hệ thống trích xuất matte “trong tự nhiên” (tức là cách ly người mà không cần màn hình xanh) là liên quan đến nhiều lĩnh vực và theo đuổi hơn là chỉ các bộ lọc hội nghị video.
Đối với việc phát triển tập dữ liệu, việc nhận dạng khuôn mặt, đầu và cơ thể chính xác hơn cung cấp khả năng đảm bảo rằng các yếu tố nền không cần thiết không được đào tạo vào các mô hình tầm nhìn máy tính của các đối tượng người. Sự cách ly chính xác hơn sẽ cải thiện đáng kể phân đoạn ngữ nghĩa các kỹ thuật được thiết kế để phân biệt và đồng bộ hóa các lĩnh vực (tức là ‘mèo’, ‘người’, ‘tàu’), và cải thiện VAE và transformer-dựa trên các hệ thống tổng hợp hình ảnh như OpenAI’s mới DALL-E 2; và các thuật toán trích xuất tốt hơn sẽ cắt giảm nhu cầu về việc rotoscoping thủ công tốn kém trong các đường ống dẫn hiệu ứng hình ảnh.
Trên thực tế, sự thống trị của đa phương thức (thường là văn bản / hình ảnh) phương pháp, nơi một lĩnh vực như ‘mèo’ được mã hóa cả dưới dạng hình ảnh và với các tham chiếu văn bản liên quan, đã bắt đầu xâm nhập vào xử lý hình ảnh. Một ví dụ gần đây là Text2Live kiến trúc, sử dụng đào tạo đa phương thức (văn bản / hình ảnh) để tạo video của, trong số nhiều khả năng khác, các con swan thủy tinh và các con giraffe thủy tinh.
Scene-Aware AI Matting
Một lượng lớn nghiên cứu về trích xuất matte tự động dựa trên AI đã tập trung vào việc nhận dạng biên giới và đánh giá các nhóm pixel trong một hình ảnh hoặc khung hình video. Tuy nhiên, nghiên cứu mới từ Trung Quốc cung cấp một đường ống dẫn trích xuất cải thiện sự phân định và chất lượng matte bằng cách tận dụng mô tả dựa trên văn bản của một cảnh (một phương pháp đa phương thức đã đạt được sự phổ biến trong lĩnh vực nghiên cứu tầm nhìn máy tính trong 3-4 năm qua), tuyên bố đã cải thiện so với các phương pháp trước đó theo nhiều cách.

Một ví dụ về trích xuất SPG-IM, so sánh với các phương pháp trước đó. Nguồn: https://arxiv.org/pdf/2204.09276.pdf
Thách thức đặt ra cho lĩnh vực nghiên cứu trích xuất là sản xuất các công việc có thể yêu cầu tối thiểu việc chú thích và can thiệp của con người – lý tưởng là không. Ngoài ra, các nhà nghiên cứu của bài báo mới lưu ý rằng các chú thích và phân đoạn thủ công được thực hiện bởi các công nhân đông đảo trên các nền văn hóa khác nhau có thể gây ra hình ảnh được dán nhãn hoặc thậm chí phân đoạn theo các cách khác nhau, dẫn đến các thuật toán không nhất quán và không thỏa mãn.
Một ví dụ về điều này là sự giải thích chủ quan về việc định nghĩa một ‘đối tượng tiền cảnh’:

Từ bài báo mới: các phương pháp trước đó LFM và MODNet (‘GT’ biểu thị Ground Truth, một kết quả ‘lý tưởng’ thường đạt được thủ công hoặc bằng phương pháp không thuật toán), có các cách tiếp cận khác nhau và hiệu quả khác nhau đối với định nghĩa của nội dung tiền cảnh, trong khi phương pháp SPG-IM mới phân định ‘nội dung gần’ thông qua ngữ cảnh cảnh một cách hiệu quả hơn.
Để giải quyết vấn đề này, các nhà nghiên cứu đã phát triển một đường ống dẫn hai giai đoạn có tên là Situational Perception Guided Image Matting (SPG-IM). Kiến trúc mã hóa / giải mã hai giai đoạn này bao gồm Sự phân tích cảm nhận tình huống (SPD) và Trích xuất hình ảnh được hướng dẫn bởi cảm nhận tình huống (SPGM).
Trước tiên, SPD tiền huấn luyện các biến đổi tính năng trực quan-văn bản, tạo ra các chú thích phù hợp với hình ảnh của chúng. Sau đó, dự đoán mặt nạ tiền cảnh được kích hoạt bằng cách kết nối đường ống dẫn với một kỹ thuật dự đoán sự chú ý mới.
Sau đó, SPGM xuất ra một matte alpha ước tính dựa trên đầu vào hình ảnh RGB thô và mặt nạ được tạo ra trong mô-đun đầu tiên.
Mục tiêu là hướng dẫn cảm nhận tình huống, trong đó hệ thống có một sự hiểu biết ngữ cảnh về những gì hình ảnh bao gồm, cho phép nó xác định – ví dụ, thách thức của việc trích xuất tóc phức tạp từ nền chống lại các đặc điểm đã biết của một nhiệm vụ cụ thể.

Trong ví dụ dưới đây, SPG-IM hiểu rằng các dây là nội tại của một ‘đàn parachute’, nơi MODNet không giữ lại và định nghĩa các chi tiết này. Tương tự như trên, cấu trúc hoàn chỉnh của thiết bị chơi đu trên sân chơi bị mất một cách tùy ý trong MODNet.
Bài báo mới có tên Situational Perception Guided Image Matting, và đến từ các nhà nghiên cứu tại Viện Nghiên cứu OPPO, PicUp.ai và Xmotors.
Intelligent Automated Mattes
SPG-IM cũng cung cấp một Mạng tinh chỉnh Biến đổi Tập trung Thích ứng (AFT) có thể xử lý các chi tiết cục bộ và ngữ cảnh toàn cầu riêng biệt, tạo điều kiện cho ‘matte thông minh’.

Hiểu ngữ cảnh cảnh, trong trường hợp này ‘cô gái với ngựa’, có thể làm cho việc trích xuất tiền cảnh dễ dàng hơn so với các phương pháp trước đó.
Bài báo tuyên bố:
‘Chúng tôi tin rằng các biểu diễn trực quan từ nhiệm vụ trực quan-văn bản, ví dụ, caption hình ảnh, tập trung vào các tín hiệu ngữ nghĩa toàn diện hơn giữa a) đối tượng với đối tượng và b) đối tượng với môi trường xung quanh để tạo ra các mô tả có thể bao gồm cả thông tin toàn cầu và chi tiết cục bộ. Ngoài ra, so với việc chú thích pixel tốn kém của việc trích xuất matte, các nhãn văn bản có thể được thu thập với chi phí rất thấp.’
Bài báo tiếp tục:
‘Nghiên cứu của chúng tôi cho thấy rằng phương pháp của chúng tôi bảo tồn các chi tiết tinh tế (ví dụ, vị trí đầu tóc, kết cấu trong suốt và biên giới) mà không cần hướng dẫn của trimap. Hơn nữa, so với các mô hình trimap-free cạnh tranh khác, phương pháp SPG-IM của chúng tôi có thể giữ lại sự hoàn chỉnh ngữ nghĩa toàn cầu tốt hơn.’
Đầu tiên được xuất bản vào ngày 24 tháng 4 năm 2022.













