Góc nhìn Anderson

Nén JPEG Tăng Tỷ Lệ Lỗi Nhận Dạng Khuôn Mặt Đối Với Khuôn Mặt Phi Da Trắng, Nghiên Cứu Phát Hiện

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google
Main image: DALL-E 2.

Một nghiên cứu mới từ Anh đã kết luận rằng các kỹ thuật nén mất dữ liệu trong hình ảnh JPEG có thể có ảnh hưởng bất lợi đến hiệu quả của các hệ thống nhận dạng khuôn mặt, khiến các hệ thống này dễ dàng nhận dạng sai một người phi da trắng.

Bài báo cho biết:

‘Thông qua một thiết lập thực nghiệm rộng lớn, chúng tôi chứng minh rằng các phương pháp nén hình ảnh mất dữ liệu phổ biến có tác động tiêu cực rõ rệt hơn đến hiệu suất nhận dạng khuôn mặt đối với các loại hình chủng tộc cụ thể như tông màu da sẫm (lên đến 34,55%).’

Kết quả cũng chỉ ra rằng chroma subsampling, nó giảm thông tin màu sắc (thay vì thông tin độ sáng) trên các phần của hình ảnh khuôn mặt làm tăng Tỷ Lệ Trùng Lặp Sai (FMR) trên một loạt các tập dữ liệu được thử nghiệm, nhiều trong số đó là các kho lưu trữ tiêu chuẩn cho thị giác máy tính.

Các hoạt động subsampling màu trên một hình ảnh nguồn, ở các tốc độ khác nhau, có ảnh hưởng rõ ràng đến mức độ chi tiết được bảo tồn và mức độ các tông màu phụ chỉ đơn giản 'trộn' vào nhau, hy sinh chi tiết và xác định đặc điểm. Xin lưu ý rằng hình ảnh này có thể bị nén và tham khảo bài báo nguồn để có độ phân giải chính xác. Nguồn: https://arxiv.org/pdf/2208.07613.pdf

Các hoạt động subsampling màu trên một hình ảnh nguồn, ở các tốc độ khác nhau, có ảnh hưởng rõ ràng đến mức độ chi tiết được bảo tồn và mức độ các tông màu phụ chỉ đơn giản ‘trộn’ vào nhau, hy sinh chi tiết và xác định đặc điểm. Xin lưu ý rằng hình ảnh này có thể bị nén và tham khảo bài báo nguồn để có độ phân giải chính xác. Nguồn: https://arxiv.org/pdf/2208.07613.pdf

Chroma subsampling được áp dụng như một biện pháp kinh tế bổ sung trong nén JPEG vì con người ít có khả năng nhận thức được sự giảm độ phức tạp và phạm vi của các dải màu so với các hệ thống thị giác máy tính, những hệ thống này lấy những ‘tổng hợp’ này một cách nghiêm ngặt hơn chúng ta.

Các nhà nghiên cứu của nghiên cứu mới đã phát hiện ra rằng việc loại bỏ subsampling màu khỏi quá trình nén làm giảm hiệu ứng tiêu cực này xuống 15,95%, mặc dù nó không loại bỏ hoàn toàn vấn đề.

Nghiên cứu cũng khẳng định rằng việc đào tạo trên dữ liệu không bị nén (hoặc ít bị nén) sẽ không giải quyết vấn đề nếu hình ảnh tại thời điểm suy luận bị nén. Về cơ bản, điều này có nghĩa là đào tạo một mô hình nhận dạng khuôn mặt trên hình ảnh ít bị nén sẽ không giải quyết sự thiên vị nếu mô hình sản xuất cuối cùng được cung cấp hình ảnh có vấn đề nén đã nêu.

Các tác giả báo cáo*:

‘[Sử dụng] nén hình ảnh mất dữ liệu trong quá trình suy luận ảnh hưởng tiêu cực đến hiệu suất của các phương pháp nhận dạng khuôn mặt hiện đại trên một tập con của các nhóm chủng tộc và rằng hiệu ứng của nó tồn tại bất kể liệu hình ảnh nén được sử dụng cho đào tạo mô hình hay không.’

Bài báo nhấn mạnh hậu quả của nén hình ảnh đối với lĩnh vực nghiên cứu thị giác máy tính, những hậu quả này đã được nêu chi tiết trong một nghiên cứu năm 2021 từ Đại học Maryland và Facebook AI.

Đây là một vấn đề khó giải quyết; ngay cả khi các vấn đề lưu trữ và băng thông khiến nén trở nên cần thiết được loại bỏ ngay lập tức, và ngay cả khi tất cả các hình ảnh chất lượng thấp trong hai mươi năm hoặc nhiều hơn của các tập dữ liệu trong lĩnh vực này đột nhiên được nén lại ở tốc độ tốt hơn từ nguồn chất lượng cao, nó sẽ đại diện cho một ‘đặt lại’ của các công cụ chuẩn mực học thuật trong vài thập kỷ qua. Cộng đồng CV đã thực sự làm quen với vấn đề, đến mức nó đại diện cho một khoản nợ kỹ thuật đáng kể.

Thiên vị chủng tộc trong nhận dạng khuôn mặt (FR) đã trở thành một chủ đề nóng trong những năm gần đây,促使 một nỗ lực chung trong cộng đồng nghiên cứu để loại bỏ nó khỏi các hệ thống bị ảnh hưởng. Tuy nhiên, sự phụ thuộc vào cơ thể nghiên cứu toàn cầu vào một số lượng hạn chế ‘tiêu chuẩn vàng’ của các tập dữ liệu, nhiều trong số đó không được cân bằng về chủng tộc hoặc nhãn mác kém trong khía cạnh này, làm tăng thêm thách thức.

Các nhà nghiên cứu của bài báo mới cũng lưu ý một sự không đồng nhất giữa các tiêu chuẩn thu thập hình ảnh và các tiêu chuẩn được đặt ra bởi các chuẩn mực nhận dạng khuôn mặt chung, tuyên bố*:

‘[Các] tiêu chuẩn thu thập hình ảnh cho các hệ thống nhận dạng khuôn mặt như ISO/IEC 19794-5ICAO 9303 đề xuất cả các tiêu chuẩn chất lượng dựa trên hình ảnh (ví dụ: độ sáng, che khuất) và dựa trên đối tượng (ví dụ: tư thế, biểu cảm, phụ kiện) để đảm bảo chất lượng hình ảnh khuôn mặt. ‘

‘Theo đó, hình ảnh khuôn mặt cũng nên được lưu trữ bằng các tiêu chuẩn nén hình ảnh mất dữ liệu như JPEG hoặc JPEG2000; và có thể xác định được giới tính, màu mắt, màu tóc, biểu cảm, thuộc tính (ví dụ: kính), góc tư thế (yaw, pitch, và roll), và vị trí mốc. ‘

‘Tuy nhiên, các chuẩn mực nhận dạng khuôn mặt chung không tuân thủ các tiêu chuẩn ISO/IEC 19794-5 và ICAO 9303. Hơn nữa, các mẫu trong tự nhiên thường được thu thập trong các điều kiện máy ảnh và môi trường khác nhau để thách thức các giải pháp được đề xuất. ‘

‘Tuy nhiên, hầu hết các mẫu hình ảnh khuôn mặt trong các tập dữ liệu như vậy bị nén qua nén JPEG mất dữ liệu.’

Các tác giả của công việc mới tuyên bố rằng những nỗ lực trong tương lai của họ sẽ kiểm tra ảnh hưởng của lượng tử hóa hình ảnh mất dữ liệu đối với các khuôn khổ nhận dạng khuôn mặt đa dạng và đề xuất các phương pháp có thể để cải thiện sự công bằng của các hệ thống này.

Bài báo mới có tiêu đề Liệu nén hình ảnh mất dữ liệu có ảnh hưởng đến thiên vị chủng tộc trong nhận dạng khuôn mặt?, và đến từ ba nhà nghiên cứu tại Imperial College London, cùng với một nhà nghiên cứu từ thư viện phân tích khuôn mặt sâu InsightFace library.

Dữ Liệu và Phương Pháp

Để thực hiện các thí nghiệm, các nhà nghiên cứu đã sử dụng các thư viện mã nguồn mở ImageMagicklibjpeg để tạo ra các phiên bản của hình ảnh dữ liệu nguồn ở các mức nén khác nhau.

Để có một cái nhìn tổng quan ban đầu về ảnh hưởng của nén, các tác giả đã nghiên cứu ảnh hưởng của Tỷ Lệ Tín Hiệu Đỉnh so với Nhiễu (PSNR) trên bốn mức nén JPEG khác nhau trên tập dữ liệu Racial Faces in-the-Wild (RFW).

Điểm PSNR cho tập dữ liệu Racial Faces-in-the-Wild, thể hiện mức độ nén ảnh hưởng đến khả năng nhận dạng cho hình ảnh nén.

Điểm PSNR cho tập dữ liệu Racial Faces-in-the-Wild, thể hiện mức độ nén ảnh hưởng đến khả năng nhận dạng cho hình ảnh nén.

Trong số các thử nghiệm khác, họ đã tiến hành nghiên cứu trên một tập dữ liệu mất cân bằng về chủng tộc và một tập dữ liệu cân bằng về chủng tộc. Đối với tập dữ liệu cân bằng về chủng tộc, họ đã sử dụng hàm Additive Angular Margin Loss (ArcFace) với ResNet101v2, trên tập dữ liệu chuẩn VGGFace2 ban đầu, chứa 3,3 triệu hình ảnh với 8631 đối tượng mất cân bằng về chủng tộc.

Để thử nghiệm, các nhà nghiên cứu đã sử dụng tập dữ liệu RFW. Hệ thống đã được đào tạo bốn lần, ở bốn mức nén khác nhau, kết quả là bốn mô hình ArcFace.

Đối với tập dữ liệu cân bằng về chủng tộc, các khuôn khổ tương tự đã được sử dụng ban đầu trên tập dữ liệu chuẩn BUPT-Balanced đã căn chỉnh, chứa 28.000 khuôn mặt cân bằng trên bốn nhóm African, Asian, Indian, và Caucasian, mỗi chủng tộc được đại diện bởi 7000 hình ảnh. Giống như tập dữ liệu mất cân bằng về chủng tộc, bốn mô hình ArcFace đã được thu được theo cách này.

Ngoài ra, các nhà nghiên cứu đã tái tạo lại hiệu ứng của việc đào tạo nén và không nén bằng cách loại bỏ subsampling màu, để đo lường hiệu ứng của nó đối với hiệu suất.

Kết Quả

Tỷ Lệ Trùng Lặp Sai (FMR) trên các tập dữ liệu được tạo ra đã được nghiên cứu. Các tiêu chí mà các nhà nghiên cứu đang tìm kiếm là các phẩm chất được xác định trước liên quan đến các đặc điểm chủng tộc Loại Da (1, 2, 3, 4, 5 hoặc 6), Loại Mí Mắt (Monolid/Khác), Hình Dạng Mũi (Rộng/Hẹp), Hình Dạng Môi (Đầy/Nhỏ), Loại Tóc (Thẳng/Lượn sóng/Lòng xoáy/Trọc), và Màu Tóc – các chỉ số được rút ra từ bài báo năm 2019 Đo lường Thiên Vị Ẩn trong Nhận Dạng Khuôn Mặt qua Các Phẩm Chất Chủng Tộc.

Bài báo cho biết:

‘Chúng tôi quan sát thấy rằng đối với tất cả các mức nén đã chọn q = {5, 10, 15, 95}, FMR tăng khi áp dụng nén mất dữ liệu bổ sung, chứng tỏ rằng mức nén 5 (tốc độ nén cao nhất) dẫn đến sự suy giảm đáng kể nhất trong hiệu suất FMR, trong khi mức nén 95 (tốc độ nén thấp nhất) không dẫn đến sự khác biệt đáng kể về hiệu suất FMR.’

Một mẫu từ các biểu đồ kết quả rộng lớn của bài báo, quá lớn và quá nhiều để tái tạo ở đây – vui lòng xem bài báo nguồn để có độ phân giải tốt hơn và kết quả đầy đủ. Ở đây, chúng ta thấy sự thay đổi của hiệu suất FMR trên các hình ảnh khuôn mặt bị suy giảm/hình ảnh nén ngày càng tăng cho VGGFace2, trong một phạm vi bao gồm cả chất lượng không bị nén hoặc ít bị nén.

Một mẫu từ các biểu đồ kết quả rộng lớn của bài báo, quá lớn và quá nhiều để tái tạo ở đây – vui lòng xem bài báo nguồn để có độ phân giải tốt hơn và kết quả đầy đủ. Ở đây, chúng ta thấy sự thay đổi của hiệu suất FMR trên các hình ảnh khuôn mặt bị suy giảm/hình ảnh nén ngày càng tăng cho VGGFace2, trong một phạm vi bao gồm cả chất lượng không bị nén hoặc ít bị nén.

Bài báo kết luận:

‘Tổng quan, đánh giá của chúng tôi cho thấy rằng việc sử dụng mẫu hình ảnh khuôn mặt nén mất dữ liệu tại thời điểm suy luận làm giảm hiệu suất đáng kể hơn trên các đặc điểm cụ thể, bao gồm tông màu da sẫm, mũi rộng, tóc xoăn và mắt monolid trên tất cả các đặc điểm khác. ‘

‘Tuy nhiên, việc sử dụng hình ảnh nén trong quá trình đào tạo làm cho các mô hình kết quả trở nên mạnh mẽ hơn và hạn chế sự suy giảm hiệu suất: hiệu suất thấp hơn trong các nhóm phụ cụ thể vẫn còn. Ngoài ra, việc loại bỏ subsampling màu cải thiện FMR cho các loại đặc điểm cụ thể bị ảnh hưởng nhiều hơn bởi nén mất dữ liệu.’

 

* Tôi đã chuyển đổi các trích dẫn nội tuyến của tác giả thành liên kết.

Được xuất bản lần đầu vào ngày 22 tháng 8 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai