Mô hình và nền tảng AI
Sự thiên vị phương Tây trong Trí tuệ nhân tạo: Tại sao các quan điểm toàn cầu đang bị thiếu sót
Một trợ lý AI đưa ra một phản hồi không liên quan hoặc gây nhầm lẫn cho một câu hỏi đơn giản, tiết lộ một vấn đề đáng kể khi nó cố gắng hiểu các sắc thái văn hóa hoặc mẫu ngôn ngữ bên ngoài đào tạo của nó. Cảnh này là điển hình cho hàng tỷ người phụ thuộc vào AI cho các dịch vụ thiết yếu như chăm sóc sức khỏe, giáo dục hoặc hỗ trợ việc làm. Đối với nhiều người, những công cụ này không đáp ứng được nhu cầu của họ, thường xuyên đại diện hoặc loại trừ hoàn toàn nhu cầu của họ.
Các hệ thống AI chủ yếu được thúc đẩy bởi ngôn ngữ, văn hóa và quan điểm phương Tây, tạo ra một thế giới đại diện hẹp và không đầy đủ. Những hệ thống này, được xây dựng trên các tập dữ liệu và thuật toán bị thiên vị, không phản ánh sự đa dạng của dân số toàn cầu. Tác động vượt ra ngoài các hạn chế kỹ thuật, củng cố sự bất bình đẳng xã hội và làm sâu sắc thêm sự chia rẽ. Việc giải quyết sự mất cân bằng này là điều cần thiết để nhận ra và tận dụng tiềm năng của AI trong việc phục vụ toàn nhân loại, chứ không chỉ một số người được đặc quyền.
Hiểu về nguồn gốc của thiên vị AI
Thiên vị AI không chỉ là một lỗi hoặc sự bỏ qua. Nó xuất phát từ cách các hệ thống AI được thiết kế và phát triển. Lịch sử, nghiên cứu và đổi mới AI chủ yếu tập trung ở các nước phương Tây. Sự tập trung này đã dẫn đến sự thống trị của tiếng Anh như ngôn ngữ chính cho các ấn phẩm học thuật, tập dữ liệu và khuôn khổ công nghệ. Do đó, thiết kế cơ bản của các hệ thống AI thường không bao gồm sự đa dạng của các văn hóa và ngôn ngữ toàn cầu, để lại nhiều vùng bị đại diện không đầy đủ.
Thiên vị trong AI thường được phân loại thành thiên vị thuật toán và thiên vị dữ liệu. Thiên vị thuật toán xảy ra khi logic và quy tắc trong mô hình AI ưu tiên cho các kết quả hoặc dân số cụ thể. Ví dụ, các thuật toán tuyển dụng được đào tạo trên dữ liệu việc làm lịch sử có thể vô tình ưu tiên cho một số dân tộc, củng cố sự phân biệt hệ thống.
Thiên vị dữ liệu, mặt khác, bắt nguồn từ việc sử dụng các tập dữ liệu phản ánh sự bất bình đẳng xã hội hiện có. Công nghệ nhận dạng khuôn mặt, ví dụ, thường hoạt động tốt hơn trên các cá nhân có làn da sáng hơn vì các tập dữ liệu đào tạo chủ yếu bao gồm hình ảnh từ các khu vực phương Tây.
Báo cáo năm 2023 của Viện AI Now đã nhấn mạnh sự tập trung của phát triển và quyền lực AI ở các quốc gia phương Tây, đặc biệt là Hoa Kỳ và Châu Âu, nơi các công ty công nghệ lớn thống trị lĩnh vực này. Tương tự, Báo cáo Chỉ số AI năm 2023 của Đại học Stanford cũng nhấn mạnh sự đóng góp đáng kể của các khu vực này vào nghiên cứu và phát triển AI toàn cầu, phản ánh sự thống trị rõ ràng của phương Tây trong các tập dữ liệu và đổi mới.
Sự mất cân bằng cấu trúc này đòi hỏi sự cần thiết phải có các phương pháp tiếp cận bao quát hơn trong các hệ thống AI, đại diện cho các quan điểm và thực tế đa dạng của dân số toàn cầu.
Tác động toàn cầu của sự chênh lệch văn hóa và địa lý trong AI
Sự thống trị của các tập dữ liệu phương Tây đã tạo ra các thiên vị văn hóa và địa lý đáng kể trong các hệ thống AI, hạn chế hiệu quả của chúng đối với các dân số đa dạng. Trợ lý ảo, ví dụ, có thể dễ dàng nhận ra các biểu thức thành ngữ hoặc tham chiếu phổ biến trong các xã hội phương Tây nhưng thường không phản hồi chính xác với người dùng từ các nền văn hóa khác. Một câu hỏi về một truyền thống địa phương có thể nhận được một phản hồi mơ hồ hoặc không chính xác, phản ánh sự thiếu nhận thức văn hóa của hệ thống.
Các thiên vị này vượt ra ngoài sự đại diện văn hóa và được khuếch đại thêm bởi sự chênh lệch địa lý. Hầu hết dữ liệu đào tạo AI đến từ các khu vực đô thị, kết nối tốt ở Bắc Mỹ và Châu Âu và không đủ bao gồm các khu vực nông thôn và các quốc gia đang phát triển. Điều này có hậu quả nghiêm trọng trong các lĩnh vực quan trọng.
Các công cụ AI nông nghiệp được thiết kế để dự đoán sản lượng cây trồng hoặc phát hiện sâu bệnh thường không hoạt động trong các khu vực như Châu Phi hạ Sahara hoặc Đông Nam Á vì các hệ thống này không được thích nghi với các điều kiện môi trường và phương pháp nông nghiệp độc đáo của các khu vực này. Tương tự, các hệ thống AI y tế, thường được đào tạo trên dữ liệu từ các bệnh viện phương Tây, khó đưa ra chẩn đoán chính xác cho các dân số ở các phần khác của thế giới. Nghiên cứu đã chỉ ra rằng các mô hình AI về bệnh da liễu được đào tạo chủ yếu trên các tông màu da sáng hơn sẽ hoạt động kém hơn đáng kể khi được thử nghiệm trên các tập dữ liệu bao gồm các tông màu da tối hơn. Ví dụ, một nghiên cứu năm 2021 đã tìm thấy rằng các mô hình AI về phát hiện bệnh da liễu đã trải qua sự giảm 29-40% về độ chính xác khi được áp dụng cho các tập dữ liệu bao gồm các tông màu da tối hơn. Những vấn đề này vượt ra ngoài các hạn chế kỹ thuật, phản ánh sự cần thiết cấp thiết để có dữ liệu bao quát hơn nhằm cứu sống và cải thiện kết quả sức khỏe toàn cầu.
Các tác động xã hội của thiên vị này rất sâu rộng. Các hệ thống AI được thiết kế để trao quyền cho các cá nhân thường tạo ra rào cản thay vào đó. Các nền tảng giáo dục được hỗ trợ bởi AI có xu hướng ưu tiên chương trình giảng dạy phương Tây, để lại cho các sinh viên ở các khu vực khác không có quyền truy cập vào các tài nguyên liên quan hoặc được địa phương hóa. Các công cụ ngôn ngữ thường không thể nắm bắt được sự phức tạp của các phương ngữ và biểu thức văn hóa địa phương, khiến chúng không hiệu quả cho các phân khúc lớn của dân số toàn cầu.
Thiên vị trong AI có thể củng cố các giả định có hại và làm sâu sắc thêm sự bất bình đẳng hệ thống. Công nghệ nhận dạng khuôn mặt, ví dụ, đã phải đối mặt với sự chỉ trích vì tỷ lệ lỗi cao hơn trong số các dân tộc thiểu số, dẫn đến hậu quả nghiêm trọng trong thế giới thực. Vào năm 2020, Robert Williams, một người đàn ông da đen, đã bị bắt oan tại Detroit do một kết quả nhận dạng khuôn mặt sai, điều này nhấn mạnh tác động xã hội của các thiên vị công nghệ như vậy.
Về mặt kinh tế, việc bỏ qua sự đa dạng toàn cầu trong phát triển AI có thể hạn chế đổi mới và giảm cơ hội thị trường. Các công ty không tính đến các quan điểm đa dạng rủi ro sẽ xa lánh các phân khúc lớn của người dùng tiềm năng. Một báo cáo của McKinsey năm 2023 ước tính rằng AI tạo sinh có thể đóng góp giữa 2,6 nghìn tỷ và 4,4 nghìn tỷ đô la mỗi năm cho nền kinh tế toàn cầu. Tuy nhiên, việc thực hiện tiềm năng này phụ thuộc vào việc tạo ra các hệ thống AI bao quát, đáp ứng các dân số đa dạng trên toàn thế giới.
Bằng cách giải quyết các thiên vị và mở rộng đại diện trong phát triển AI, các công ty có thể khám phá các thị trường mới, thúc đẩy đổi mới và đảm bảo rằng lợi ích của AI được chia sẻ công bằng trên tất cả các khu vực. Điều này nhấn mạnh yêu cầu kinh tế của việc xây dựng các hệ thống AI phản ánh và phục vụ hiệu quả dân số toàn cầu.
Ngôn ngữ như một rào cản đối với sự bao quát
Ngôn ngữ gắn chặt với văn hóa, bản sắc và cộng đồng, nhưng các hệ thống AI thường không phản ánh sự đa dạng này. Hầu hết các công cụ AI, bao gồm trợ lý ảo và rô-bốt trò chuyện, hoạt động tốt trong một số ngôn ngữ được nói rộng rãi và bỏ qua những ngôn ngữ ít được đại diện hơn. Sự mất cân bằng này có nghĩa là các ngôn ngữ bản địa, phương ngữ khu vực và ngôn ngữ thiểu số thường không được hỗ trợ, làm cho các cộng đồng nói những ngôn ngữ này bị đẩy ra ngoài lề hơn.
Các công cụ như Google Translate đã biến đổi giao tiếp, nhưng chúng vẫn gặp khó khăn với nhiều ngôn ngữ, đặc biệt là những ngôn ngữ có ngữ pháp phức tạp hoặc sự hiện diện kỹ thuật số hạn chế. Sự loại trừ này có nghĩa là hàng triệu công cụ được hỗ trợ bởi AI vẫn không thể tiếp cận hoặc không hiệu quả, làm rộng thêm khoảng cách kỹ thuật số. Một báo cáo của UNESCO năm 2023 đã tiết lộ rằng hơn 40% ngôn ngữ trên thế giới đang có nguy cơ biến mất, và sự vắng mặt của chúng trong các hệ thống AI làm tăng thêm sự mất mát này.
Các hệ thống AI củng cố sự thống trị của phương Tây trong công nghệ bằng cách ưu tiên chỉ một phần nhỏ của sự đa dạng ngôn ngữ trên thế giới. Việc giải quyết khoảng trống này là điều cần thiết để đảm bảo rằng AI trở nên bao quát và phục vụ các cộng đồng trên toàn cầu, bất kể ngôn ngữ họ nói.
Giải quyết thiên vị phương Tây trong AI
Sửa chữa thiên vị phương Tây trong AI đòi hỏi phải thay đổi đáng kể cách các hệ thống AI được thiết kế và đào tạo. Bước đầu tiên là tạo ra các tập dữ liệu đa dạng hơn. AI cần dữ liệu đa ngôn ngữ, đa văn hóa và đại diện khu vực để phục vụ người dân trên toàn thế giới. Các dự án như Masakhane, hỗ trợ các ngôn ngữ châu Phi, và AI4Bharat, tập trung vào các ngôn ngữ Ấn Độ, là những ví dụ tuyệt vời về cách phát triển AI bao quát có thể thành công.
Công nghệ cũng có thể giúp giải quyết vấn đề. Học liên bang cho phép thu thập và đào tạo dữ liệu từ các khu vực dưới đại diện mà không冒 rủi ro về quyền riêng tư. Công cụ AI giải thích được làm cho việc phát hiện và sửa chữa các thiên vị trong thời gian thực trở nên dễ dàng hơn. Tuy nhiên, công nghệ alone không đủ. Các chính phủ, tổ chức tư nhân và nhà nghiên cứu phải làm việc cùng nhau để lấp đầy các khoảng trống.
Các luật và chính sách cũng đóng vai trò quan trọng. Các chính phủ phải thực thi các quy tắc yêu cầu dữ liệu đa dạng trong đào tạo AI. Họ nên giữ các công ty chịu trách nhiệm về các kết quả thiên vị. Đồng thời, các nhóm vận động có thể nâng cao nhận thức và thúc đẩy thay đổi. Những hành động này đảm bảo rằng các hệ thống AI đại diện cho sự đa dạng của thế giới và phục vụ mọi người một cách công bằng.
Hơn nữa, sự hợp tác cũng quan trọng không kém như công nghệ và quy định. Các nhà phát triển và nhà nghiên cứu từ các khu vực bị phục vụ không đầy đủ phải là một phần của quá trình tạo ra AI. Sự hiểu biết của họ đảm bảo rằng các công cụ AI là phù hợp về mặt văn hóa và thực tế cho các cộng đồng khác nhau. Các công ty công nghệ cũng có trách nhiệm đầu tư vào các khu vực này. Điều này có nghĩa là tài trợ cho nghiên cứu địa phương, tuyển dụng các đội đa dạng và tạo ra các quan hệ đối tác tập trung vào sự bao quát.
Kết luận
AI có tiềm năng biến đổi cuộc sống, bắc cầu và tạo ra cơ hội, nhưng chỉ khi nó hoạt động cho mọi người. Khi các hệ thống AI bỏ qua sự đa dạng phong phú của các văn hóa, ngôn ngữ, và quan điểm trên toàn thế giới, chúng không thực hiện được lời hứa của mình. Vấn đề thiên vị phương Tây trong AI không chỉ là một khiếm khuyết kỹ thuật mà là một vấn đề đòi hỏi sự chú ý cấp thiết. Bằng cách ưu tiên sự bao quát trong thiết kế, dữ liệu và phát triển, AI có thể trở thành một công cụ nâng đỡ tất cả các cộng đồng, không chỉ một số ít được đặc quyền.












