Góc nhìn Anderson
Một ‘Thám tử’ AI Có Thể Xác Định Những Người Bí Ẩn Từ Nhiều Nguồn

Những nhà nghiên cứu tại Đại học Oxford đã phát triển một hệ thống được kích hoạt bởi AI có thể xác định toàn diện những người trong các video bằng cách thực hiện các cuộc điều tra đa miền giống như thám tử về ai họ có thể là, từ ngữ cảnh và từ nhiều nguồn thứ cấp công khai có sẵn, bao gồm cả việc kết hợp các nguồn âm thanh với các tài liệu trực quan từ internet.
Mặc dù nghiên cứu tập trung vào việc xác định các nhân vật công chúng, chẳng hạn như những người xuất hiện trong các chương trình truyền hình và phim, nguyên tắc suy luận danh tính từ ngữ cảnh về mặt lý thuyết có thể áp dụng cho bất kỳ ai có khuôn mặt, giọng nói hoặc tên xuất hiện trong các nguồn trực tuyến.
Thực tế, bài báo định nghĩa sự nổi tiếng không giới hạn ở những người làm việc trong ngành giải trí, với những nhà nghiên cứu tuyên bố ‘Chúng tôi gọi những người có nhiều hình ảnh của mình trực tuyến là nổi tiếng‘.
Trực Tiếp Đến Video
Những nhà nghiên cứu, từ Nhóm Hình học Trực quan của Oxford tại Khoa Khoa học Kỹ thuật, phác thảo phương pháp điều tra kiểu con người đã truyền cảm hứng cho công việc:
‘Hãy tưởng tượng bạn đang xem một video và gặp một người mới. Để xác định chắc chắn họ là ai, bạn sẽ đầu tiên tìm kiếm các manh mối về tên của họ trong video, chẳng hạn như văn bản trên màn hình, tên của họ được đề cập trong lời nói, hoặc trong danh sách các thành viên trong lưu trữ internet. Bạn có thể tìm thấy một số bằng chứng để xác minh rằng tên này là chính xác, bằng cách tìm kiếm người đó trực tuyến.’
Phương pháp được đề xuất bởi bài báo này hoàn toàn tự động và loại bỏ tất cả các nhãn thủ công bổ sung (không tính những gì đã được thực hiện bởi các nhà cung cấp nguồn trực tuyến). Hệ thống cũng được chứng minh là hoạt động tốt trên ba tập dữ liệu không liên quan mà không cần điều chỉnh miền.
Khi thảo luận về ứng dụng của công việc, những nhà nghiên cứu lưu ý sự tăng trưởng theo cấp số nhân của dữ liệu video không được gắn nhãn, và nhu cầu về các hệ thống mới có thể suy luận thông tin danh tính từ chúng mà không cần chú thích thủ công của con người:
‘[Sự] quy mô lớn của dữ liệu, kết hợp với sự thiếu hụt của các siêu dữ liệu liên quan, làm cho việc lập chỉ mục, phân tích và điều hướng nội dung này trở thành một nhiệm vụ ngày càng khó khăn. Việc dựa vào chú thích thủ công bổ sung của con người không còn khả thi, và nếu không có cách nào để điều hướng những video này, kho kiến thức này hầu như không thể tiếp cận.’
Một công cụ lập chỉ mục như vậy mở ra khả năng cho các kết quả tìm kiếm siêu liên kết đến trực tiếp một điểm trong video nơi chủ đề tìm kiếm xuất hiện, như được chứng minh trong tìm kiếm web chứng minh khái niệm do dự án cung cấp.

Hệ thống Oxford cho phép tìm kiếm các trường hợp của một người được xác định. Kết quả tìm kiếm đưa người xem trực tiếp đến điểm trong video nơi người được xác định xuất hiện, và video có thể được phát từ điểm đó. Source: https://www.robots.ox.ac.uk/~vgg/research/person_id_in_video/
Một trong những cách hệ thống xác định ‘những người bí ẩn’ là thông qua ngữ cảnh của sự liên kết với những người khác. Do đó, công cụ tìm kiếm được trang bị tốt để tìm kiếm nhiều danh tính xuất hiện trong cùng một video:
Cá Lớn Và Cá Nhỏ
Hệ thống ban đầu giải quyết ‘trái cây thấp’ – những người có khuôn mặt được lập chỉ mục công khai trên các tài nguyên mạng đến mức xác định họ là tương đối đơn giản, bằng cách kết hợp siêu dữ liệu hoặc văn bản OCR trong video với các nguồn dữ liệu công khai như danh sách IMDB. Văn bản được giải thích bởi AI trong các chú thích video, tín dụng và các hình thức văn bản raster khác trong video cũng được tận dụng để thực hiện việc xác định.

Các tên ứng viên cho tìm kiếm có thể được tự động phát hiện bởi hệ thống, dựa trên nhận dạng ký tự quang học của văn bản raster hoặc của văn bản thực trong các nguồn khác, chẳng hạn như danh sách diễn viên. Do đó, người dùng có thể được lập chỉ mục tự động mà không cần phải chạy các truy vấn trước đối với tên của họ bởi người dùng cuối cá nhân, và mà không cần tham gia trước vào các mạng xã hội được kích hoạt bởi AI. Source: https://www.robots.ox.ac.uk/~vgg/publications/2021/Brown21/brown21.pdf
Khi hình ảnh và video hướng tới internet xác nhận danh tính của người đó, cuộc điều tra xác nhận một danh tính. Nhưng khi người đó càng trở nên bí ẩn, các phương pháp khác được sử dụng, bao gồm âm thanh từ các bản âm thanh video, có thể được sử dụng như một xác nhận danh tính. Mặc dù không được đề cập trong công việc, logic cho thấy không có gì cản trở một khuôn khổ như vậy cũng sử dụng các nguồn âm thanh thuần túy cũng như các thành phần âm thanh trong video.
Một Panopticon Danh Tính Tự Phát
Ngoài việc tạo ra các tên ứng viên từ văn bản raster hoặc văn bản thuần túy, công nghệ nhận dạng giọng nói được sử dụng trong dự án Oxford để nhận ra các tên được nói trong nội dung âm thanh. Do đó, một danh tính có thể được khởi tạo bởi một hoặc hai người chỉ đơn giản là đề cập đến một người thứ ba không có mặt.
Biện pháp bảo vệ mà dự án Oxford giới thiệu là ứng viên phải xuất hiện trong cơ sở dữ liệu IMDB, nhưng việc loại bỏ quy định tùy ý này mở rộng đáng kể phạm vi khả năng của hệ thống, vì nó hoàn toàn dựa vào các tài nguyên có thể thu thập từ web.

Do đó, với sự kết hợp của các nguồn bao gồm tên được suy luận từ văn bản raster, văn bản thực, đề cập dựa trên giọng nói và vật liệu trực quan rất hạn chế, nó trở nên có thể xác định các cá nhân có sự hiện diện mạng thấp.
Về mặt kỹ thuật, cũng có thể xây dựng một hồ sơ của một cá nhân mà chưa có hình ảnh hoặc video nào được gắn với họ, nhưng mà một hình ảnh hoặc video có thể được gắn vào khi các yếu tố khác tương quan với một nguồn video mới được đưa vào.
Tập Dữ Liệu Kiểm Tra
Những nhà nghiên cứu đã sử dụng ba tập dữ liệu để đánh giá hiệu quả của hệ thống: MediaEval, có tính năng Creative Commons xã hội và cộng đồng nguồn tài nguyên hình ảnh (bao gồm Wikipedia và Flickr) được chụp giữa 2010-2015; tập dữ liệu Sherlock của nhóm Oxford năm 2017, có tính năng dữ liệu video được chú thích từ phiên bản hiện đại của nhân vật Conan Doyle; và một tập dữ liệu video mới của BBC được tạo riêng cho dự án, sử dụng các đoạn phim tin tức chú thích từ BBC.

Hệ thống thành công trên nhiều môi trường tập dữ liệu, bao gồm cả những lần khuôn mặt bị che khuất bởi phản xạ hoặc bóng tối.
Quá trình cũng sử dụng xếp hạng tìm kiếm hình ảnh trực tiếp.
Kết quả cho hệ thống tạo ra độ chính xác cao trên cả ba mô hình. Trong trường hợp của tập dữ liệu Sherlock, những nhà nghiên cứu đã ngạc nhiên khi thấy rằng hệ thống mới cải thiện 3-6% so với một phương pháp trước đó sử dụng máy vector hỗ trợ (SVM) trong một phân loại nhiều cách, mặc dù phân loại gần nhất được sử dụng trong công việc mới là một công cụ ít mạnh mẽ hơn.
Ý Nghĩa
Hầu hết các hạn chế đạo đức hoặc thực tế trong dự án Oxford là tự áp đặt bởi những nhà nghiên cứu, chẳng hạn như định nghĩa ‘nổi tiếng’ bằng yêu cầu rằng các danh tính được khám phá phải có sự hiện diện trong IMDB, và bằng cách kiểm tra hệ thống chỉ chống lại các tập dữ liệu học thuật đã được thiết lập tôn trọng giấy phép Creative Commons.
Tuy nhiên, kiến trúc cơ bản của dự án mô tả một phương pháp chung để không chỉ xác định ‘những người bí ẩn’ có sự hiện diện trực tuyến thấp hoặc không có (vì một đề cập đơn giản đến tên có thể tạo ra một thẻ danh tính có thể được phát triển theo thời gian khi cần), mà còn tạo ra một ma trận các cá nhân được thúc đẩy bởi sự tò mò và cơ học, chứ không phải bởi nhu cầu hoặc sự hiện diện rõ ràng của dữ liệu được gắn nhãn (chẳng hạn như tải lên ảnh có chứa siêu dữ liệu PII).
Dự án không sử dụng dữ liệu vị trí địa lý hoặc các hình thức siêu dữ liệu khác có sẵn rộng rãi có thể được tìm thấy trong các tài liệu góp phần, chẳng hạn như thông tin vị trí địa lý được nhúng vào các tải lên trên mạng xã hội (nơi những thông tin này không bị xóa như một tùy chọn người dùng). Tuy nhiên, không có chướng ngại vật rõ ràng nào để sử dụng các chiều dữ liệu bổ sung này để tăng cường quá trình xác nhận.
Khi dự án Oxford cắt tỉa các ngoại lệ (các danh tính có sự hiện diện gần như không có, ngoài việc không được liệt kê trong IMDB) theo cách phổ biến trong các dự án học máy, những thông tin tối thiểu như vậy có thể hiệu quả hơn trong việc xác định một người không xác định so với khi có nhiều thông tin đại diện về họ.
Sự Có Mặt
Những nhà nghiên cứu Oxford đã đóng gói chức năng của dự án vào một công cụ tìm kiếm giống như Google có thể được tải xuống và cài đặt trên một máy cục bộ thông qua Docker (mặc dù hướng dẫn cài đặt cho bài báo tháng 5 năm 2021 hiện chứa thông tin lỗi thời về yêu cầu Công cụ Docker, điều này có thể cản trở quá trình).
Không có vẻ như có một phiên bản trực tuyến trực tiếp nào bao gồm việc thực hiện dự án trên cả ba tập dữ liệu, mặc dù kết quả cho tập dữ liệu tin tức BBC có thể được truy vấn miễn phí tại http://zeus.robots.ox.ac.uk/bbc_search/.














