Góc nhìn Anderson
Công cụ Ghi chú Hình ảnh Dựa trên Trình Duyệt cho Tập dữ liệu Thị giác Máy tính

Những nhà nghiên cứu từ Phần Lan đã phát triển một công cụ ghi chú hình ảnh dựa trên trình duyệt nhằm cải thiện sự dễ dàng và tốc độ của các quá trình ghi chú hình ảnh tốn thời gian cho tập dữ liệu thị giác máy tính. Cài đặt như một tiện ích mở rộng không phụ thuộc vào hệ điều hành cho các trình duyệt phổ biến nhất, công cụ mới này cho phép người dùng ‘ghi chú trong khi duyệt web tự do’, thay vì cần phải đặt một phiên ghi chú vào contexto của một thiết lập chuyên dụng, hoặc chạy mã khách và các tình huống đặc biệt khác.
Được gọi là BRIMA (Công cụ Ghi chú Hình ảnh Dựa trên Trình Duyệt với Chi phí Thấp), hệ thống này được phát triển tại Đại học Jyväskylä. Nó loại bỏ nhu cầu thu thập và biên dịch dữ liệu vào các thư mục cục bộ hoặc từ xa, và có thể được cấu hình để rút ra dữ liệu hữu ích từ các tham số dữ liệu khác nhau có sẵn trên bất kỳ nền tảng công khai nào.

BRIMA hoạt động. Nguồn: https://arxiv.org/pdf/2107.06351.pdf
BRIMA (sẽ được trình bày tại ICIP 2021, khi mã sẽ được cung cấp) loại bỏ các chướng ngại vật tiềm ẩn có thể phát sinh khi các hệ thống thu thập dữ liệu tự động bị chặn thông qua phạm vi IP hoặc các phương pháp khác, và bị cản trở trong việc thu thập dữ liệu – một kịch bản sẽ trở nên phổ biến hơn khi bảo vệ IP ngày càng được chú trọng, như đã được thực hiện với công cụ tạo mã AI của Microsoft, Copilot.
Vì BRIMA chỉ dành cho ghi chú dựa trên con người, việc sử dụng nó cũng ít có khả năng kích hoạt các rào cản khác, chẳng hạn như thách thức CAPTCHA, hoặc các hệ thống tự động khác nhằm chặn các thuật toán thu thập dữ liệu.
Khả năng Thu thập Dữ liệu Thích ứng
BRIMA được thực hiện thông qua tiện ích mở rộng Firefox hoặc tiện ích mở rộng Chrome trên Windows, OSX hoặc Linux, và có thể được cấu hình để tiêu thụ dữ liệu nổi bật dựa trên các điểm dữ liệu mà một nền tảng cụ thể có thể chọn để lộ ra. Ví dụ, khi ghi chú hình ảnh trong Google Street View, hệ thống có thể tính đến hướng và góc nhìn của ống kính, và đăng ký vị trí địa lý chính xác của đối tượng được chỉ định dưới sự chú ý của người dùng.

BRIMA đã được thử nghiệm vào tháng 9 năm 2020 bởi các nhà tạo ra nó, trong quá trình hợp tác trên một sáng kiến được phân phối để tạo ra một tập dữ liệu phát hiện đối tượng cho các đối tượng CCTV (máy quay giám sát video gắn trên không gian công cộng hoặc có thể xem từ không gian công cộng).
Hệ thống bao gồm một cài đặt khách JavaScript nhẹ ở dạng tiện ích mở rộng trình duyệt, và một khía cạnh phía máy chủ nhận và biên dịch dữ liệu ghi chú. Các triển khai tham chiếu của cài đặt phía máy chủ được viết bằng Python và PHP với Flask và Swagger/OpenAPI, nhưng các nhà nghiên cứu nhấn mạnh rằng kiến trúc xử lý trung tâm có thể dễ dàng được chuyển sang các ngôn ngữ và cấu hình khác.
Tiện ích mở rộng trình duyệt và máy chủ giao tiếp thông qua các yêu cầu API RESTful và HTTP/XHR, với dữ liệu khách được gửi về nhà trong định dạng JSON tương thích với MS COCO. Điều này có nghĩa là dữ liệu có thể được sử dụng ngay lập tức với nhiều khuôn khổ phát hiện đối tượng phổ biến nhất, bao gồm các back-end đa dạng cho TensorFlow, chẳng hạn như thư viện Detectron2 của Facebook, và CenterMask2.
Công cụ Dự án Riêng biệt
Mặc dù BRIMA có tính chất chung, nó có thể được cấu hình thành các cấu hình thu thập dữ liệu rất cụ thể, bao gồm cả việc áp dụng các menu thả xuống và các loại đầu vào ngữ cảnh khác liên quan đến một lĩnh vực cụ thể. Trong hình ảnh dưới đây, chúng ta thấy rằng một menu thả xuống liên quan đến thông tin máy ảnh đã được viết vào BRIMA, để một nhóm người ghi chú có thể cung cấp thông tin chi tiết và liên quan đến dự án.

Công cụ bổ sung này có thể được cấu hình cục bộ. Tiện ích mở rộng cũng có cài đặt dễ dàng và phím tắt bàn phím có thể cấu hình, cùng với các yếu tố giao diện người dùng được mã hóa màu.
Công việc này xây dựng trên một số nỗ lực trong những năm gần đây để cải thiện tính tiện lợi của ghi chú hình ảnh cho dữ liệu thu được từ web hoặc dữ liệu công khai. Công cụ PhotoStuff, được hỗ trợ bởi DARPA, cung cấp ghi chú trực tuyến thông qua cổng web chuyên dụng, và có thể chạy trên web ngữ nghĩa hoặc như một ứng dụng độc lập; vào năm 2004, UC Berkeley đã đề xuất Ghi chú Hình ảnh trên Điện thoại Camera, điều này phụ thuộc nặng vào siêu dữ liệu do các hạn chế về phạm vi mạng và giới hạn viewport của thời đại; dự án LabelMe của MIT năm 2005 cũng tiếp cận ghi chú dựa trên trình duyệt, với sự phụ thuộc vào các công cụ MATLAB;
Kể từ khi phát hành vào năm 2015, khuôn khổ Python/QT mã nguồn mở LabelImg đã trở nên phổ biến trong các nỗ lực ghi chú phân phối, với một cài đặt cục bộ chuyên dụng. Tuy nhiên, các nhà nghiên cứu BRIMA quan sát thấy rằng LabelImg tập trung vào các tiêu chuẩn PascalVOC và YOLO, không hỗ trợ định dạng JSON MS COCO, và từ chối các công cụ phác thảo đa giác để ủng hộ các vùng bắt hình chữ nhật đơn giản (sẽ yêu cầu phân đoạn sau).












