Góc nhìn Anderson

Thay đổi Giới tính và Chủng tộc trong Kết quả Tìm kiếm Hình ảnh với Học máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một nghiên cứu hợp tác giữa UC San Diego và Adobe (ADBE ) Research đã đề xuất một giải pháp sáng tạo và chủ động để giải quyết sự thiếu đa dạng về chủng tộc và giới tính trong kết quả tìm kiếm hình ảnh cho các nghề nghiệp truyền thống bị chi phối bởi người da trắng: sử dụng Mạng đối lập Generative (GANs) để tạo ra hình ảnh không thực của các ‘nghề nghiệp bị thiên vị’, nơi giới tính và / hoặc chủng tộc của đối tượng được thay đổi.

Trong ví dụ này từ bài báo mới, các nhà nghiên cứu đã nhập các đặc điểm cho một bức ảnh mong muốn mà không được đại diện trong một tập hợp hình ảnh có sẵn điển hình, hoặc được đại diện theo cách không phù hợp (ví dụ: được giới tính hóa hoặc trong một cách trình bày không phù hợp khác). Nguồn

Trong ví dụ này từ bài báo mới, các nhà nghiên cứu đã nhập các đặc điểm cho một bức ảnh mong muốn mà không được đại diện trong một tập hợp hình ảnh có sẵn điển hình, hoặc được đại diện theo cách không phù hợp (ví dụ: được giới tính hóa hoặc trong một cách trình bày không phù hợp khác). Nguồn

Trong một bài báo mới có tiêu đề Tạo và Kiểm soát Sự Đa dạng trong Tìm kiếm Hình ảnh, các tác giả đề xuất rằng có một giới hạn cho mức độ mà xếp hạng lại có thể sửa chữa sự mất cân bằng của các lớp hình ảnh / tính năng bị thiên vị như thợ ống nước, nhân viên vận hành máy, kỹ sư phần mềm, và nhiều người khác – và rằng tăng sự đa dạng về chủng tộc và giới tính với dữ liệu tổng hợp có thể là cách đi tiếp cho thách thức này.

‘Sự theo đuổi một thế giới lý tưởng đòi hỏi phải cung cấp cho người dùng nội dung cơ hội để trình bày bất kỳ nghề nghiệp nào với các đặc điểm chủng tộc và giới tính đa dạng. Sự lựa chọn hạn chế của nội dung hiện có cho một số kết hợp của nghề nghiệp, chủng tộc và giới tính tạo ra một thách thức cho các nhà cung cấp nội dung. Nghiên cứu hiện tại về thiên vị trong tìm kiếm chủ yếu tập trung vào các thuật toán xếp hạng lại.

‘Tuy nhiên, những phương pháp này không thể tạo ra nội dung mới hoặc thay đổi sự phân bố tổng thể của các thuộc tính được bảo vệ trong ảnh. Để giải quyết những vấn đề này, chúng tôi đề xuất một nhiệm vụ mới về tạo hình ảnh có độ trung thực cao có điều kiện trên nhiều thuộc tính từ các tập dữ liệu không cân bằng. ‘

Để đạt được điều này, các tác giả đã thử nghiệm với nhiều hệ thống tổng hợp hình ảnh dựa trên GAN, cuối cùng đã chọn một kiến trúc dựa trên StyleGan2.

Từ các tài liệu phụ cho bài báo, hai ví dụ về việc 'bình đẳng hóa' các đại diện dựa trên hình ảnh của các nghề nghiệp bị thiên vị, trong trường hợp này, 'thợ mộc' và 'nhân viên vận hành máy'. Nguồn

Từ các tài liệu phụ cho bài báo, hai ví dụ về việc ‘bình đẳng hóa’ các đại diện dựa trên hình ảnh của các nghề nghiệp bị thiên vị, trong trường hợp này, ‘thợ mộc’ và ‘nhân viên vận hành máy’. Nguồn

Đại diện Không Đầy đủ hoặc Không Phù hợp

Các nhà nghiên cứu đặt ra thách thức này trong bối cảnh một kết quả tìm kiếm thực tế cho ‘thợ ống nước’* trên Tìm kiếm Hình ảnh Google, quan sát thấy rằng kết quả hình ảnh bị chi phối bởi những người đàn ông da trắng trẻ.

Từ bài báo, các kết quả được chọn cho 'thợ ống nước' trong Tìm kiếm Hình ảnh Google, tháng 1 năm 2021.

Từ bài báo, các kết quả được chọn cho ‘thợ ống nước’ trong Tìm kiếm Hình ảnh Google, tháng 1 năm 2021.

Các tác giả lưu ý rằng những dấu hiệu của thiên vị tương tự xảy ra với một loạt các nghề nghiệp, chẳng hạn như ‘trợ lý hành chính’, ‘người dọn dẹp’, và ‘nhân viên vận hành máy’, với những thiên vị tương ứng về tuổi tác, giới tính và chủng tộc.

‘Không ngạc nhiên, do thiên vị xã hội như vậy, một số kết hợp của chủng tộc và giới tính có thể có rất ít hoặc không có hình ảnh trong một kho nội dung. Ví dụ, khi chúng tôi tìm kiếm ‘nhân viên vận hành máy nữ da đen (hoặc người Mỹ gốc Phi)’ hoặc ‘trợ lý hành chính nam da Á Đông’, chúng tôi không tìm thấy hình ảnh liên quan trên [Tìm kiếm Hình ảnh Google].

‘Ngoài ra, trong những trường hợp hiếm hoi, các kết hợp cụ thể của giới tính và chủng tộc có thể dẫn đến việc cá nhân được miêu tả không phù hợp. Chúng tôi đã quan sát thấy hành vi này đối với các truy vấn tìm kiếm như ‘thợ ống nước nữ da Á Đông’ hoặc ‘vệ sĩ nữ da đen (hoặc người Mỹ gốc Phi)’.

Bài báo trích dẫn một sự hợp tác học thuật khác từ năm 2014, nơi các nhà nghiên cứu đã thu thập 400 kết quả hình ảnh tìm kiếm hàng đầu cho 96 nghề nghiệp. Công việc đó cho thấy rằng phụ nữ chỉ chiếm 37% kết quả, và hình ảnh chống lại khuôn mẫu chỉ chiếm 22%. Một nghiên cứu năm 2019 từ Yale cho thấy rằng năm năm đã đưa những tỷ lệ này lên 45% và 30% tương ứng.

Ngoài ra, nghiên cứu năm 2014 đã phân loại sự giới tính hóa của các cá nhân trong một số nghề nghiệp trong kết quả tìm kiếm hình ảnh như Vấn đề Thợ mộc Sexy, với những phân loại không phù hợp như vậy có thể làm sai lệch kết quả cho việc nhận dạng nghề nghiệp.

Tổng Quan

Thách thức chính cho các tác giả là sản xuất một hệ thống tổng hợp hình ảnh dựa trên GAN có khả năng tạo ra hình ảnh với độ phân giải 1024×1024, vì hiện tại, trạng thái của nghệ thuật trong các hệ thống tổng hợp hình ảnh dựa trên GAN và mã hóa / giải mã có thể tạo ra hình ảnh với độ phân giải 512×512, và bất cứ điều gì cao hơn sẽ có xu hướng được thu được bằng cách tăng tỷ lệ đầu ra cuối cùng, với một số chi phí về thời gian và tài nguyên xử lý, và với một số rủi ro đối với tính xác thực của hình ảnh được tạo ra.

Tuy nhiên, các tác giả cho biết rằng độ phân giải thấp hơn không thể hy vọng sẽ đạt được sự quan tâm trong tìm kiếm hình ảnh, và họ đã thử nghiệm với nhiều khuôn khổ GAN khác nhau có thể tạo ra hình ảnh độ phân giải cao theo yêu cầu, ở mức độ xác thực chấp nhận được.

Khi quyết định được đưa ra để áp dụng StyleGan2, nó trở nên rõ ràng rằng dự án sẽ cần kiểm soát nhiều hơn các thuộc tính con của đầu ra được tạo (chẳng hạn như chủng tộc, nghề nghiệp và giới tính), hơn là một triển khai mặc định cho phép. Do đó, các tác giả đã sử dụng điều kiện đa lớp để tăng cường quá trình tạo.

Kiến trúc của bộ tạo hình ảnh chỉ định, mà các tác giả cho biết không cụ thể cho StyleGAN2, nhưng có thể được áp dụng trên nhiều khuôn khổ tạo khác.

Kiến trúc của bộ tạo hình ảnh chỉ định, mà các tác giả cho biết không cụ thể cho StyleGAN2, nhưng có thể được áp dụng trên nhiều khuôn khổ tạo khác.

Để kiểm soát các yếu tố chủng tộc, giới tính và nghề nghiệp, kiến trúc tiêm một mã hóa một lần của các đặc điểm này vào vector y. Sau đó, một mạng lưới feedforward được sử dụng để nhúng các tính năng này, để chúng sẽ không bị bỏ qua tại thời điểm tạo.

Các tác giả quan sát thấy rằng có những giới hạn cứng đối với mức độ mà StyleGAN2 có thể được điều khiển theo cách này, và rằng những nỗ lực tinh chỉnh hơn để thay đổi kết quả đã dẫn đến chất lượng hình ảnh kém hơn, và thậm chí sụp đổ chế độ.

Các giải pháp này, tuy nhiên, không giải quyết các vấn đề thiên vị ngầm trong kiến trúc, mà các nhà nghiên cứu phải giải quyết bằng cách lấy mẫu quá mức các thực thể dưới đại diện từ tập dữ liệu, nhưng không冒 rủi ro quá拟, điều này sẽ ảnh hưởng đến tính linh hoạt của các dòng hình ảnh được tạo.

Do đó, các tác giả đã điều chỉnh StyleGAN2-ADA, sử dụng Tăng cường Phân biệt Điscriminator (ADA), để ngăn chặn phân biệt từ bỏ quá trình.

Tạo và Đánh giá Dữ liệu

Vì mục tiêu của dự án là tạo ra dữ liệu mới, tổng hợp, các nhà nghiên cứu đã áp dụng phương pháp của dự án năm 2014, chọn một số nghề nghiệp mục tiêu thể hiện sự thiên vị về chủng tộc và giới tính cao. Các nghề nghiệp được chọn là ‘quản lý điều hành’, ‘trợ lý hành chính’, ‘y tá’, ‘nông dân’, ‘người lính’, ‘vệ sĩ’, ‘tài xế xe tải’, ‘người dọn dẹp’, ‘thợ mộc’, ‘thợ ống nước’, ‘nhân viên vận hành máy’, ‘người hỗ trợ kỹ thuật’, ‘kỹ sư phần mềm’, và ‘nhà văn.’

Các tác giả đã chọn các nghề nghiệp này không chỉ dựa trên mức độ thiên vị được nhận thức trong kết quả tìm kiếm hình ảnh, mà còn vì hầu hết chúng chứa một số thành phần trực quan được mã hóa cho nghề nghiệp, chẳng hạn như đồng phục, hoặc sự hiện diện của thiết bị hoặc môi trường cụ thể.

Tập dữ liệu được cung cấp bởi 10.000 hình ảnh từ thư viện Adobe Stock, thường đạt được điểm số 95% hoặc tốt hơn khi cố gắng phân loại một nghề nghiệp.

Vì nhiều hình ảnh không hữu ích cho nhiệm vụ mục tiêu (tức là chúng không chứa người), việc lọc thủ công là cần thiết. Sau đó, một phân loại dựa trên ResNet32 được tiền huấn luyện trên FairFace được sử dụng để gắn nhãn hình ảnh cho giới tính và chủng tộc, đạt được độ chính xác trung bình là 95,7% cho giới tính và 81,5% cho chủng tộc. Do đó, các nhà nghiên cứu đã nhận được nhãn hình ảnh cho các thuộc tính Giới tính: Nam, Nữ, Chủng tộc: Trắng, Đen, Á Đông, và Các Chủng tộc Khác.

Mô hình được xây dựng trong TensorFlow bằng cách sử dụng StyleGAN2 và StyleGAN2-ADA làm mạng lõi. Việc huấn luyện trước được thực hiện với trọng số được huấn luyện trước của StyleGAN2 trên tập dữ liệu Flickr-Faces-HQ của NVIDIA, được tăng cường với 34.000 hình ảnh cụ thể về nghề nghiệp mà các tác giả đã thu thập thành một tập dữ liệu riêng biệt mà họ gọi là Uncurated Stock-Occupation HQ (U-SOHQ).

Một mẫu HIT từ đánh giá của Amazon Mechanical Turk.

Một mẫu HIT từ đánh giá của Amazon Mechanical Turk.

Hình ảnh được tạo ra dưới bốn cấu hình kiến trúc, với Uniform+ cuối cùng đạt được điểm số tốt nhất cả trong FID (đánh giá tự động) và trong đánh giá tiếp theo của công nhân Amazon Mechanical Turk. Kết hợp với Độ chính xác Phân loại, các tác giả đã sử dụng điều này làm một chỉ số cốt lõi cho chỉ số của riêng họ, có tên là Điểm khớp thuộc tính.

Đánh giá của con người về hình ảnh được tạo ra bởi các phương pháp khác nhau, với phương pháp Uniform+ chứng minh là thuyết phục nhất, và sau đó là cơ sở cho một tập dữ liệu mới.

Đánh giá của con người về hình ảnh được tạo ra bởi các phương pháp khác nhau, với phương pháp Uniform+ chứng minh là thuyết phục nhất, và sau đó là cơ sở cho một tập dữ liệu mới.

Bài báo không nêu rõ liệu Stock-Occupation-HQ, tập dữ liệu đầy đủ được suy dẫn từ Uniform+, sẽ được công bố công khai hay không, nhưng cho biết nó chứa 8.113 hình ảnh HQ (1024×1024).

Sự Phổ biến

Bài báo mới này không giải quyết rõ ràng cách các hình ảnh được tổng hợp, ‘cân bằng lại’ có thể được giới thiệu vào lưu thông. Có thể giả định rằng việc cung cấp các cơ sở dữ liệu thị giác máy tính tổng hợp với hình ảnh được chỉnh sửa lại theo loại mà các tác giả đã tạo ra sẽ giải quyết được vấn đề thiên vị, nhưng cũng có thể tạo ra những trở ngại cho các loại nghiên cứu khác nhằm đánh giá sự bao gồm giới tính và chủng tộc trong các kịch bản ‘thế giới thực’, trong một hoàn cảnh mà hình ảnh tổng hợp được trộn với hình ảnh thế giới thực.

Các cơ sở dữ liệu tổng hợp như cơ sở dữ liệu được tạo ra bởi các nhà nghiên cứu có thể được cung cấp miễn phí với độ phân giải hợp lý như hình ảnh chứng khoán, sử dụng động cơ tiết kiệm chi phí này như một động cơ khuếch tán.

Dự án không giải quyết thiên vị dựa trên tuổi, có thể là một chủ đề quan tâm trong nghiên cứu tương lai.

 

* Đánh giá tìm kiếm được thực hiện vào ngày 5 tháng 1 năm 2022, tìm kiếm của tác giả được trích dẫn trong bài báo đã được thực hiện vào tháng 1 năm 2021.

 

Được xuất bản lần đầu vào ngày 5 tháng 1 năm 2022.

Nhà viết về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng bộ phận nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó sáp nhập vào Brahma.ai của DNEG.
Website: martinanderson.ai
Contact: martin@martinanderson.ai