Mô hình và nền tảng AI

Appen Limited Ra Mắt Bộ Dữ Liệu Đào Tạo Đa Dạng Cho NLP

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Appen Limited, một nhà cung cấp hàng đầu về dữ liệu đào tạo chất lượng cao cho các công ty muốn xây dựng hệ thống AI quy mô lớn, đang ra mắt các bộ dữ liệu đào tạo đa dạng mới cho các sáng kiến xử lý ngôn ngữ tự nhiên (NLP). Các bộ dữ liệu này sẽ cho phép người dùng cuối nhận được trải nghiệm giống nhau bất kể ngôn ngữ, phương ngữ, sắc tộc, giọng nói hoặc giới tính.

Theo một báo cáo của PNAS vào tháng 3 năm 2020, các hệ thống nhận dạng giọng nói tự động (ASR) phổ biến, đặc biệt là những hệ thống được sử dụng cho các trợ lý ảo, phụ đề đóng và tính toán không cần tay, thường thể hiện sự chênh lệch về chủng tộc trong hiệu suất. Phần lớn điều này liên quan đến việc các hệ thống này dựa trên dữ liệu bị thiên vị hoặc không đầy đủ, và đó là lý do tại sao việc phát triển các bộ đào tạo đa dạng là rất quan trọng.

Với việc ra mắt mới, Appen nhằm giảm thiểu sự khác biệt về hiệu suất và tạo ra một môi trường bao gồm hơn cho công nghệ nhận dạng giọng nói. Các thách thức tương tự cũng tồn tại trong các hệ thống giải thích ngôn ngữ và NLP.

Mark Brayan là CEO của Appen.

“Chất lượng và đa dạng của dữ liệu đào tạo trực tiếp ảnh hưởng đến hiệu suất và thiên vị trong các mô hình AI,” Brayan cho biết. “Là một đối tác dữ liệu, chúng tôi có thể cung cấp dữ liệu đào tạo hoàn chỉnh cho nhiều trường hợp sử dụng để đảm bảo các mô hình AI hoạt động cho mọi người. Điều quan trọng là chúng tôi phải thu hút một nhóm đa dạng các cá nhân để sản xuất, gắn nhãn và xác thực dữ liệu để đảm bảo mô hình được đào tạo không chỉ công bằng mà còn được xây dựng một cách có trách nhiệm.”

Dự Án Ngôn Ngữ Appen

Appen cố gắng tạo ra một môi trường AI đa dạng thông qua các dự án và quan hệ đối tác khác nhau, bao gồm:

  • Quan hệ đối tác Translators without Borders (TWB): Appen đã hợp tác với TWB, Amazon (AMZN ), Đại học Carnegie Mellon, Facebook (META ), Google (GOOGL ), Đại học Johns Hopkins, Microsoft (MSFT ) và Translated. Quan hệ đối tác này đã tham gia vào Sáng kiến Dịch thuật cho COVID-19 (TICO-19), nhằm mở rộng khả năng tiếp cận thông tin về COVID-19 bằng cách hỗ trợ phát triển công nghệ ngôn ngữ trong nhiều ngôn ngữ. Điều này bao gồm các nước đang phát triển như Swahili Congo, Tigrinya và Fulfulde Nigeria.
  • Dự án dịch tiếng Pháp Canada: Appen đã giúp Microsoft thêm “tiếng Pháp Canada” làm một tùy chọn ngôn ngữ trong Microsoft Translator sau khi phối hợp với các tư vấn ngôn ngữ bản địa.
  • Dự án dịch Inuktitut: Appen đã hợp tác với Chính phủ Nunavut, điều này đã giúp Microsoft thêm Inuktitut vào Microsoft Translator. Ngôn ngữ bản địa này được nói ở vùng Bắc Cực Canada.
  • Bộ dữ liệu sẵn sàng cho tiếng Anh Phi Á (AAVE): Bằng cách làm việc với những người nói tiếng AAVE và thu thập dữ liệu cho một bộ dữ liệu sẵn sàng, Appen cố gắng tạo ra các bộ dữ liệu đào tạo mới đại diện cho AAVE.

Tiến sĩ Judith Bishop là Giám đốc cấp cao của các chuyên gia AI tại Appen.

“Dữ liệu AI bị thiên vị dẫn đến các dự án có thể không mang lại kết quả kinh doanh như mong đợi và gây hại cho những người mà chúng được thiết kế để phục vụ,” Tiến sĩ Bishop cho biết. “Quy mô và độ phức tạp của các dự án AI khiến cho hầu hết các công ty không thể có được đủ dữ liệu không thiên vị và chất lượng cao mà không phải hợp tác với một chuyên gia dữ liệu AI. Cam kết của Appen trong việc phát triển đội ngũ người ghi chú dữ liệu đa dạng và chuyên môn nhất cung cấp cho ngành công nghiệp một nguồn lực rõ ràng khác biệt để xây dựng các dự án AI công bằng và có trách nhiệm.”

Appen được hỗ trợ bởi các người ghi chú dữ liệu đào tạo từ hơn 170 quốc gia, và các đại diện ngôn ngữ bao gồm 235 ngôn ngữ độc đáo và 395 phương ngữ. Nó cũng cung cấp các bộ dữ liệu sẵn sàng (OTS), cho phép các doanh nghiệp có được dữ liệu đào tạo chất lượng cao nhanh hơn cho các dự án AI của họ.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.