Đạo đức

Các nhà nghiên cứu phát triển công cụ mới để chống lại sự thiên vị trong tầm nhìn máy tính

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một trong những vấn đề gần đây xuất hiện trong lĩnh vực trí tuệ nhân tạo (AI) là sự thiên vị trong tầm nhìn máy tính. Nhiều chuyên gia hiện đang phát hiện ra sự thiên vị trong các hệ thống AI, dẫn đến kết quả bị sai lệch trong các ứng dụng khác nhau, chẳng hạn như chương trình xét xử tại tòa án.

Có một nỗ lực lớn đang được tiến hành để sửa chữa một số vấn đề này, với sự phát triển mới nhất đến từ Đại học Princeton. Các nhà nghiên cứu tại cơ sở này đã tạo ra một công cụ mới có thể đánh dấu các sự thiên vị tiềm năng trong hình ảnh được sử dụng để đào tạo các hệ thống AI.

Công việc được trình bày vào ngày 24 tháng 8 tại Hội nghị ảo về Tầm nhìn Máy tính châu Âu.

Sự thiên vị trong các hệ thống AI

Một trong những lý do chính cho sự thiên vị hiện tại trong các hệ thống AI là chúng thường được đào tạo trên các tập hợp lớn hình ảnh từ các nguồn trực tuyến. Những hình ảnh này có thể là định kiến và khi chúng được sử dụng để phát triển tầm nhìn máy tính, kết quả có thể bị ảnh hưởng không chủ ý.

Công cụ được phát triển bởi các nhà nghiên cứu là mã nguồn mở và có khả năng tự động tiết lộ các sự thiên vị tiềm năng trong các tập dữ liệu trực quan. Nó hoạt động bằng cách thực hiện hành động trước khi các tập hợp hình ảnh được sử dụng để đào tạo các mô hình tầm nhìn máy tính và các vấn đề liên quan đến sự đại diện và định kiến có thể được khắc phục trước khi chúng gây ra ảnh hưởng.

REVISE

Công cụ mới này được gọi là REVISE và nó dựa trên các phương pháp thống kê để xác định các sự thiên vị tiềm năng trong một tập dữ liệu. Nó tập trung vào ba lĩnh vực: dựa trên đối tượng, dựa trên giới tính và dựa trên địa lý.

REVISE hoàn toàn tự động và được xây dựng dựa trên các phương pháp trước đó bao gồm lọc và cân bằng hình ảnh trong tập dữ liệu để người dùng có thể kiểm soát nhiều hơn.

Công cụ mới dựa trên các chú thích và đo lường hình ảnh hiện có để phân tích nội dung trong một tập dữ liệu. Một số chú thích hiện có bao gồm số lượng đối tượng và quốc gia xuất xứ của hình ảnh.

Trong một ví dụ về công cụ hoạt động, REVISE đã chỉ ra cách hình ảnh của cả người và hoa khác nhau tùy thuộc vào giới tính. Nam giới có nhiều khả năng xuất hiện với hoa trong các lễ hội hoặc cuộc họp, và nữ giới có nhiều khả năng xuất hiện với hoa trong các bức tranh hoặc kịch bản được dàn dựng.

Olga Russaskovsky là giáo sư trợ lý về khoa học máy tính và là nhà điều tra chính của Phòng thí nghiệm Trí tuệ nhân tạo trực quan. Bài báo được đồng tác giả với sinh viên sau đại học Angelina Wang và giáo sư trợ lý về khoa học máy tính, Arvind Narayanan.

Sau khi công cụ xác định các sự không nhất quán, “thì có câu hỏi về việc liệu đây là một sự kiện hoàn toàn vô hại hay có điều gì sâu sắc hơn đang xảy ra, và điều đó rất khó để tự động hóa,” Russaskovsky nói.

Các khu vực bị đại diện dưới mức hoặc bị đại diện sai

Các khu vực khác nhau trên thế giới bị đại diện dưới mức trong các tập dữ liệu tầm nhìn máy tính và điều này có thể dẫn đến sự thiên vị trong các hệ thống AI. Một trong những phát hiện là một lượng lớn hình ảnh đến từ Hoa Kỳ và các nước châu Âu. REVISE cũng tiết lộ rằng hình ảnh từ các phần khác của thế giới thường không có chú thích hình ảnh bằng ngôn ngữ địa phương, có nghĩa là nhiều hình ảnh có thể đến từ góc nhìn của một du khách.

“… phân tích địa lý này cho thấy rằng việc nhận dạng đối tượng vẫn có thể bị thiên vị và loại trừ, và có thể ảnh hưởng đến các khu vực và người dân khác nhau một cách không công bằng,” Russaskovsky tiếp tục.

“Các phương pháp thu thập dữ liệu trong khoa học máy tính chưa được kiểm tra kỹ lưỡng cho đến gần đây,” Wang nói. Khi nói đến việc thu thập hình ảnh, chúng “được thu thập từ internet và mọi người không luôn nhận ra rằng hình ảnh của họ đang được sử dụng [trong các tập dữ liệu]. Chúng ta nên thu thập hình ảnh từ nhiều nhóm người đa dạng hơn, nhưng khi chúng ta làm như vậy, chúng ta nên cẩn thận để có được hình ảnh theo cách tôn trọng.”

Vicente Ordonez-Roman là giáo sư trợ lý về khoa học máy tính tại Đại học Virginia.

“Các công cụ và điểm chuẩn là một bước quan trọng… chúng cho phép chúng ta nắm bắt các sự thiên vị này sớm hơn trong quá trình và suy nghĩ lại về cách đặt vấn đề và giả định cũng như các phương pháp thu thập dữ liệu,” Ordonez-Roman nói. “Trong tầm nhìn máy tính, có một số thách thức cụ thể liên quan đến đại diện và sự lan truyền của định kiến. Các công việc như những công việc của Phòng thí nghiệm Trí tuệ nhân tạo trực quan Princeton giúp làm rõ và đưa đến sự chú ý của cộng đồng tầm nhìn máy tính một số vấn đề này và đề xuất các chiến lược để giảm thiểu chúng.”

Công cụ mới được phát triển bởi các nhà nghiên cứu là một bước quan trọng để giúp sửa chữa sự thiên vị hiện tại trong các hệ thống AI. Bây giờ là thời điểm để sửa chữa những vấn đề này, vì nó sẽ trở nên khó khăn hơn khi các hệ thống tiến bộ và trở nên phức tạp hơn.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.