Góc nhìn Anderson
Thử thách ‘Phân loại chủng tộc’ đối với Hệ thống Tổng hợp Hình ảnh Dựa trên CLIP

Nghiên cứu mới từ Mỹ cho thấy một trong những mô hình tầm nhìn máy tính phổ biến đằng sau loạt DALL-E, cũng như nhiều mô hình tạo và phân loại hình ảnh khác, thể hiện một khuynh hướng có thể chứng minh được towards hypodescent – quy tắc phân loại chủng tộc (còn được gọi là ‘quy tắc một giọt’) mà phân loại một người có thậm chí một lượng nhỏ ‘trộn’ (tức là không phải dòng dõi da trắng) hoàn toàn vào một phân loại chủng tộc ‘thiểu số’.
Kể từ khi hypodescent đã đặc trưng một số chương xấu xí nhất trong lịch sử loài người, các tác giả của bài báo mới cho rằng những khuynh hướng như vậy trong nghiên cứu tầm nhìn máy tính và triển khai nên nhận được sự chú ý nhiều hơn, không chỉ vì khuôn khổ được hỗ trợ đang được tải xuống gần một triệu lần một tháng, mà còn có thể lan truyền và phổ biến thiên vị chủng tộc trong các khuôn khổ hạ nguồn.
Kiến trúc được nghiên cứu trong công việc mới là Contrastive Language Image Pretraining (CLIP), một mô hình học đa phương thức học các liên kết ngữ nghĩa bằng cách đào tạo trên các cặp hình ảnh / chú thích được rút ra từ internet – một cách tiếp cận bán giám sát giảm đáng kể chi phí gắn nhãn, nhưng có khả năng phản ánh thiên vị của những người tạo ra chú thích.
Từ bài báo:
‘Kết quả của chúng tôi cung cấp bằng chứng cho hypodescent trong không gian nhúng CLIP, một thiên vị được áp dụng mạnh hơn cho hình ảnh của phụ nữ. Kết quả进一步 chỉ ra rằng CLIP liên kết hình ảnh với nhãn chủng tộc hoặc dân tộc dựa trên độ lệch khỏi Trắng, với Trắng là mặc định.
Bài báo cũng tìm thấy rằng sự liên kết valence của một hình ảnh (khả năng liên kết với ‘tốt’ hoặc ‘xấu’) đáng chú ý hơn đối với các nhãn chủng tộc ‘thiểu số’ hơn là đối với các nhãn da trắng, và đề xuất rằng thiên vị của CLIP phản ánh tập hợp văn học tập trung vào Mỹ (Wikipedia tiếng Anh) mà khuôn khổ được đào tạo.
Khi bình luận về các ý nghĩa của sự hỗ trợ rõ ràng của CLIP cho hypodescent, các tác giả cho biết*:
‘[Trong] số các ứng dụng đầu tiên của CLIP là đào tạo mô hình tạo hình ảnh không chụp DALL-E. Một phiên bản lớn hơn, không công khai của kiến trúc CLIP được sử dụng trong đào tạo DALL-E 2. Phù hợp với các phát hiện của nghiên cứu hiện tại, phần Risks and Limitations trong thẻ mô hình DALL-E 2 note rằng nó “tạo ra hình ảnh có xu hướng đại diện quá mức cho những người da trắng”.
‘Sự sử dụng như vậy chứng tỏ khả năng thiên vị được học bởi CLIP có thể lan truyền vượt ra ngoài không gian nhúng của mô hình, vì các tính năng của nó được sử dụng để hướng dẫn sự hình thành của ngữ nghĩa trong các mô hình AI khác.
‘Hơn nữa, nhờ một phần vào những tiến bộ được thực hiện bởi CLIP và các mô hình tương tự cho việc liên kết hình ảnh và văn bản trong môi trường không chụp, các kiến trúc đa phương thức đã được mô tả là nền tảng cho tương lai của các ứng dụng internet được sử dụng rộng rãi, bao gồm cả công cụ tìm kiếm.
‘Kết quả của chúng tôi cho thấy sự chú ý nhiều hơn đến những gì các mô hình như vậy học được từ việc giám sát ngôn ngữ tự nhiên là đáng kể.’
Bài báo bài báo có tựa đề Bằng chứng về Hypodescent trong Trí tuệ Nhân tạo Ngữ nghĩa Hình ảnh, và đến từ ba nhà nghiên cứu tại Đại học Washington và Đại học Harvard.
CLIP và Ảnh hưởng xấu
Mặc dù các nhà nghiên cứu khẳng định rằng công việc của họ là phân tích đầu tiên về hypodescent trong CLIP, các công việc trước đây đã chứng minh rằng quy trình làm việc của CLIP, phụ thuộc vào dữ liệu web có nguồn gốc không được giám sát, dưới đại diện phụ nữ, có thể tạo ra nội dung phản cảm, và có thể thể hiện thiên vị ngữ nghĩa (như tình cảm chống Hồi giáo) trong bộ mã hóa hình ảnh của nó.
Các tác giả của bài báo ban đầu trình bày CLIP thừa nhận rằng trong một môi trường không chụp, CLIP chỉ liên kết 58,3% người với nhãn chủng tộc da trắng trong FairFace dataset. Nhận thấy rằng FairFace được gắn nhãn với sự thiên vị có thể xảy ra bởi công nhân Amazon Mechanical Turk, các tác giả của bài báo mới cho biết rằng ‘một thiểu số đáng kể những người được con người khác nhận thức là da trắng được liên kết với một chủng tộc khác ngoài da trắng bởi CLIP.’
Họ tiếp tục:
‘Ngược lại dường như không đúng, vì những cá nhân được nhận thức thuộc về các nhãn chủng tộc hoặc dân tộc khác trong tập dữ liệu FairFace được liên kết với những nhãn đó bởi CLIP. Kết quả này gợi ý khả năng CLIP đã học được quy tắc “hypodescent”, như được mô tả bởi các nhà khoa học xã hội: những người có tổ tiên đa chủng tộc có nhiều khả năng được nhận thức và phân loại là thuộc về nhóm phụ huynh thiểu số hoặc không được ưu tiên hơn là nhóm phụ huynh đa số hoặc được ưu tiên.
‘Nói cách khác, đứa con của một phụ huynh da đen và một phụ huynh da trắng được nhận thức là nhiều hơn da đen hơn da trắng; và đứa con của một phụ huynh châu Á và một phụ huynh da trắng được nhận thức là nhiều hơn châu Á hơn da trắng.’
Bài báo có ba phát hiện trung tâm: CLIP thể hiện hypodescent, bằng cách ‘đàn’ những người có bản sắc đa chủng tộc vào thể loại chủng tộc thiểu số đóng góp cho họ; ‘Trắng là chủng tộc mặc định trong CLIP’, và các chủng tộc cạnh tranh được định nghĩa bởi sự ‘độ lệch’ của chúng khỏi một thể loại da trắng; và thiên vị valence (liên kết với ‘xấu’) tương quan với mức độ mà cá nhân được phân loại vào một chủng tộc thiểu số.
Phương pháp và Dữ liệu
Để xác định cách CLIP đối xử với các đối tượng đa chủng tộc, các nhà nghiên cứu sử dụng một kỹ thuật biến dạng trước đó để thay đổi chủng tộc của hình ảnh của các cá nhân. Các bức ảnh được lấy từ Chicago Face Database, một tập hợp được phát triển cho các nghiên cứu tâm lý liên quan đến chủng tộc.

Ví dụ từ các hình ảnh CFD biến dạng chủng tộc được trình bày trong tài liệu phụ của bài báo mới. Nguồn: https://arxiv.org/pdf/2205.10764.pdf
Các nhà nghiên cứu chỉ chọn hình ảnh ‘biểu cảm trung lập’ từ tập dữ liệu, để duy trì tính nhất quán với công việc trước đó. Họ sử dụng Mạng đối lập tạo sinh StyleGAN2-ADA (được đào tạo trên FFHQ) để thực hiện việc thay đổi chủng tộc của hình ảnh khuôn mặt, và tạo ra hình ảnh trung gian thể hiện sự tiến triển từ một chủng tộc này sang chủng tộc khác (xem hình ảnh ví dụ ở trên).
Consistent với công việc trước đó, các nhà nghiên cứu biến dạng khuôn mặt của những người tự xác định là da đen, châu Á và Latino trong tập dữ liệu thành khuôn mặt của những người tự xác định là da trắng. Mười chín giai đoạn trung gian được tạo ra trong quá trình này. Tổng cộng, 21.000 hình ảnh 1024x1024px được tạo ra cho dự án bằng phương pháp này.
Các nhà nghiên cứu sau đó thu được một bản nhúng hình ảnh được dự đoán cho CLIP cho mỗi trong tổng số 21 hình ảnh trong mỗi tập biến dạng chủng tộc. Sau đó, họ yêu cầu một nhãn cho mỗi hình ảnh từ CLIP: ‘đa chủng tộc’, ‘lai’, ‘hỗn hợp chủng tộc’, và ‘người’ (nhãn cuối cùng bỏ qua chủng tộc).
Phiên bản CLIP được sử dụng là CLIP-ViT-Base-Patch32 triển khai. Các tác giả lưu ý rằng mô hình này đã được tải xuống hơn một triệu lần trong tháng trước khi viết nghiên cứu của họ, và chiếm 98% số lượng tải xuống của bất kỳ mô hình CLIP nào từ Thư viện Transformers.
Thử nghiệm
Để kiểm tra khuynh hướng tiềm năng của CLIP đối với hypodescent, các nhà nghiên cứu lưu ý nhãn chủng tộc được CLIP chỉ định cho mỗi hình ảnh trong gradient của hình ảnh biến dạng cho mỗi cá nhân.
Theo các phát hiện, CLIP có xu hướng nhóm những người vào các thể loại ‘thiểu số’ ở khoảng điểm chuyển tiếp 50%.

Ở tỷ lệ trộn 50%, nơi đối tượng bằng nhau về chủng tộc gốc / đích, CLIP liên kết một số lượng lớn hơn 1000 hình ảnh biến dạng nữ với các nhãn châu Á (89,1%), Latina (75,8%) và da đen (69,7%) hơn là với một nhãn da trắng tương đương.
Kết quả cho thấy các đối tượng nữ dễ bị hypodescent dưới CLIP hơn nam giới, mặc dù các tác giả suy đoán rằng điều này có thể là do các nhãn web có nguồn gốc và không được giám sát, đặc trưng cho hình ảnh nữ, có xu hướng nhấn mạnh ngoại hình của đối tượng hơn so với trường hợp của nam giới, và điều này có thể có một hiệu ứng lệch.
Hypodescent ở điểm chuyển tiếp chủng tộc 50% không được quan sát thấy đối với loạt biến dạng nam giới châu Á – da trắng hoặc Latino – da trắng, trong khi CLIP gán một sự tương đồng cosine cao hơn cho nhãn da đen ở 67,5% số trường hợp ở tỷ lệ trộn 55%.

Tương đồng cosine trung bình của các nhãn Đa chủng tộc, Lai và Hỗn hợp chủng tộc. Kết quả chỉ ra rằng CLIP hoạt động một loại ‘phân loại đường ranh giới’ ở các tỷ lệ trộn khác nhau, ít khi gán một sự pha trộn chủng tộc cho Trắng (‘người’, trong lý do của các thí nghiệm) hơn là cho dân tộc được nhận thức trong hình ảnh.
Mục tiêu lý tưởng, theo bài báo, là CLIP sẽ phân loại các hỗn hợp chủng tộc trung gian một cách chính xác là ‘hỗn hợp chủng tộc’, thay vì xác định một ‘điểm chuyển tiếp’ tại đó đối tượng thường được gán hoàn toàn vào nhãn không phải da trắng.
Đến một mức độ nhất định, CLIP thực sự gán các bước biến dạng trung gian với Hỗn hợp chủng tộc (xem đồ thị ở trên), nhưng cuối cùng lại thể hiện một sự ưu tiên trung bình để phân loại đối tượng là chủng tộc thiểu số đóng góp cho họ.
Về valence, các tác giả lưu ý sự phán xét lệch của CLIP:
‘[Sự liên kết valence trung bình (liên kết với ‘xấu’ hoặc ‘không dễ chịu’ so với ‘tốt’ hoặc ‘dễ chịu’) thay đổi với tỷ lệ trộn trên loạt biến dạng nam giới da đen – da trắng, sao cho CLIP mã hóa các liên kết với sự không dễ chịu cho những khuôn mặt giống nhất với những người tự xác định là da đen trong CFD.’

Kết quả valence – các thử nghiệm cho thấy rằng các nhóm thiểu số được liên kết nhiều hơn với các khái niệm tiêu cực trong kiến trúc hình ảnh / cặp hơn là đối với các đối tượng được gắn nhãn da trắng. Các tác giả khẳng định rằng sự liên kết không dễ chịu của một hình ảnh tăng lên với khả năng mô hình liên kết hình ảnh với nhãn da đen.
Bài báo cho biết:
‘Bằng chứng cho thấy rằng valence của một hình ảnh tương quan với sự liên kết chủng tộc. Cụ thể hơn, kết quả của chúng tôi cho thấy rằng sự liên kết không dễ chịu của một hình ảnh tăng lên với khả năng mô hình liên kết hình ảnh với một cá nhân da đen.’
Tuy nhiên, kết quả cũng chỉ ra một sự tương quan tiêu cực trong trường hợp của khuôn mặt châu Á. Các tác giả đề xuất rằng điều này có thể là do sự truyền qua (qua dữ liệu web có nguồn gốc) của nhận thức văn hóa tích cực của người Mỹ về người châu Á và cộng đồng, và các tác giả cho biết*:
‘Quan sát sự tương quan giữa dễ chịu và xác suất của nhãn văn bản châu Á có thể tương ứng với khuôn mẫu ‘thiểu số mẫu mực’, trong đó người châu Á được khen ngợi vì sự di chuyển lên và hòa nhập vào văn hóa Mỹ, và thậm chí liên kết với “hành vi tốt”.’
Về mục tiêu cuối cùng, để kiểm tra xem Trắng có phải là ‘danh tính mặc định’ từ quan điểm của CLIP hay không, kết quả cho thấy một cực tính nhúng, gợi ý rằng dưới kiến trúc này, khá khó để ‘một chút trắng’.

Tương đồng cosine trên 21.000 hình ảnh được tạo ra cho các thử nghiệm.
Các tác giả bình luận:
‘Bằng chứng cho thấy rằng CLIP mã hóa Trắng là một chủng tộc mặc định. Điều này được hỗ trợ bởi sự tương quan mạnh hơn giữa sự tương đồng cosine Trắng và sự tương đồng cosine người hơn là đối với bất kỳ nhóm chủng tộc hoặc dân tộc nào khác.’
* Tôi đã chuyển đổi các trích dẫn nội tuyến của tác giả thành liên kết.
Được xuất bản lần đầu vào ngày 24 tháng 5 năm 2022.












