Góc nhìn Anderson
Dữ Liệu Tổng Hợp: Cầu Nối Khoảng Cách Che Khuất Với Grand Theft Auto

Những nhà nghiên cứu tại Đại học Illinois đã tạo ra một bộ dữ liệu thị giác máy tính mới sử dụng hình ảnh tổng hợp được tạo ra bởi động cơ trò chơi Grand Theft Auto để giúp giải quyết một trong những chướng ngại vật khó khăn nhất trong phân đoạn ngữ nghĩa – nhận dạng các đối tượng chỉ có thể nhìn thấy một phần trong hình ảnh và video nguồn.
Để đạt được điều này, như được mô tả trong bài báo, những nhà nghiên cứu đã sử dụng động cơ trò chơi GTA-V để tạo ra một bộ dữ liệu tổng hợp không chỉ có số lượng trường hợp che khuất kỷ lục, mà còn có phân đoạn ngữ nghĩa và nhãn hoàn hảo, và tính đến thông tin thời gian theo cách không được giải quyết bởi các bộ dữ liệu mã nguồn mở tương tự.
Hiểu Biết Cảnh Toàn Diện
Video dưới đây, được xuất bản như tài liệu hỗ trợ cho nghiên cứu, minh họa lợi thế của việc hiểu cảnh toàn diện 3D, trong đó các đối tượng bị che khuất được biết và hiển thị trong cảnh trong mọi trường hợp, cho phép hệ thống đánh giá học cách liên kết các视 giác bị che khuất một phần với đối tượng (được gắn nhãn) toàn bộ.
Nguồn: http://sailvos.web.illinois.edu/_site/index.html
Kết quả là bộ dữ liệu, được gọi là SAIL-VOS 3D, được các tác giả tuyên bố là bộ dữ liệu video lưới tổng hợp đầu tiên với chú thích khung hình, phân đoạn cấp độ instance, độ sâu thực tế cho các khung nhìn cảnh và chú thích 2D được xác định bởi các hộp giới hạn.

Nguồn (Click to enlarge)
Các chú thích của SAIL-VOS 3D bao gồm độ sâu, phân đoạn cấp độ instance và phân đoạn amodal, nhãn ngữ nghĩa và lưới 3D. Dữ liệu bao gồm 484 video với tổng cộng 237.611 khung hình ở độ phân giải 1280×800, bao gồm cả chuyển đổi cảnh.

Trên, các khung hình CGI gốc; hàng thứ hai, phân đoạn cấp độ instance; hàng thứ ba, phân đoạn amodal, minh họa độ sâu của hiểu biết cảnh và tính minh bạch có sẵn trong dữ liệu. Nguồn (Click to enlarge)
Bộ dữ liệu này được chia thành 6.807 đoạn với trung bình 34,6 khung hình mỗi đoạn, và dữ liệu được chú thích với 3.460.213 instance đối tượng bắt nguồn từ 3.576 mô hình lưới trong động cơ trò chơi GTA-V. Những instance này được gán cho tổng cộng 178 danh mục ngữ nghĩa.
Tái Xây Lưới Và Gán Nhãn Tự Động
Vì nghiên cứu bộ dữ liệu sau này có thể xảy ra trên hình ảnh thế giới thực, các lưới trong SAIL-VOS 3D được tạo ra bởi khuôn khổ học máy, chứ không được dẫn xuất từ động cơ GTA-V.

Với sự hiểu biết chương trình và cơ bản là ‘holographic’ về toàn bộ cảnh, hình ảnh SAIL-VOS 3D có thể tổng hợp các biểu diễn của các đối tượng thường bị che khuất, chẳng hạn như cánh tay đối diện của nhân vật quay lại đây, theo cách mà nếu không sẽ phụ thuộc vào nhiều instance đại diện trong footage thế giới thực. (Click to enlarge) Nguồn: https://arxiv.org/pdf/2105.08612.pdf
Vì mỗi đối tượng trong thế giới GTA-V chứa một ID duy nhất, SAIL-VOS thu thập những ID này từ động cơ kết xuất sử dụng thư viện hook kịch bản GTA-V. Điều này giải quyết vấn đề về việc thu lại chủ thể nếu nó rời khỏi trường nhìn tạm thời, vì việc gán nhãn là liên tục và đáng tin cậy. Có 162 đối tượng có sẵn trong môi trường, mà các nhà nghiên cứu đã ánh xạ đến một số lượng tương ứng các lớp.
Đa Dạng Cảnh Và Đối Tượng
Nhiều đối tượng trong động cơ GTA-V là phổ biến trong tự nhiên, và do đó, kho SAIL-VOS chứa khoảng 60% các lớp hiện diện trong bộ dữ liệu MS-COCO thường được sử dụng của Microsoft vào năm 2014.

Bộ dữ liệu SAIL-VOS bao gồm một loạt các cảnh trong nhà và ngoài trời dưới các điều kiện thời tiết khác nhau, với các nhân vật mặc trang phục đa dạng. (Click to enlarge)
Ứng Dụng
Để đảm bảo tính tương thích với nghiên cứu chung trong lĩnh vực này, và để xác nhận rằng phương pháp tổng hợp này có thể mang lại lợi ích cho các dự án không tổng hợp, các nhà nghiên cứu đã đánh giá bộ dữ liệu bằng cách sử dụng phương pháp phát hiện khung hình được sử dụng cho MS-COCO và Thử thách Đối tượng Hình ảnh Visual PASCAL năm 2012, với độ chính xác trung bình làm thước đo.
Các nhà nghiên cứu đã tìm thấy rằng việc huấn luyện trước trên bộ dữ liệu SAIL-VOS cải thiện hiệu suất của Intersection over Union (IoU) lên 19%, với sự cải thiện tương ứng trong hiệu suất VideoMatch, từ 55% lên 74% trên dữ liệu chưa xem.
Tuy nhiên, trong các trường hợp che khuất cực đoan, có những lúc khi tất cả các phương pháp cũ vẫn không thể nhận dạng được một đối tượng hoặc người, mặc dù các nhà nghiên cứu dự đoán rằng điều này có thể được khắc phục trong tương lai bằng cách xem xét các khung hình liền kề để thiết lập lý do cho mặt nạ amodal.













