Modele i platformy AI
Appen Limited Uruchamia Różnorodne Zestawy Danych Szkoleniowych dla NLP
Appen Limited, wiodący dostawca wysokiej jakości danych szkoleniowych dla firm, które chcą budować systemy sztucznej inteligencji na dużą skalę, uruchamia nowe różnorodne zestawy danych szkoleniowych dla inicjatyw związanych z przetwarzaniem języka naturalnego (NLP). Zestawy te umożliwią użytkownikom końcowym uzyskanie tego samego doświadczenia niezależnie od odmiany języka, dialektu, etnolektu, akcentu, rasy czy płci.
Według raportu opublikowanego przez PNAS w marcu 2020 roku, popularne systemy automatycznego rozpoznawania mowy (ASR), szczególnie te używane w asystentach wirtualnych, napisach i komputerach bez rąk, często wykazują dysproporcje rasowe w wydajności. Większość z tego wynika z faktu, że systemy te opierają się na danych tendencyjnych lub niepełnych, i dlatego tak ważne jest rozwijanie różnorodnych zestawów danych szkoleniowych.
Wraz z nowym uruchomieniem, Appen ma na celu zredukowanie różnic w wydajności i stworzenie bardziej inkluzywnego środowiska dla technologii rozpoznawania mowy. Te same rodzaje wyzwań występują w systemach interpretacji języka i NLP.
Mark Brayan jest dyrektorem generalnym Appen.
„Jakość i różnorodność danych szkoleniowych mają bezpośredni wpływ na wydajność i tendencyjność modeli sztucznej inteligencji”, powiedział Brayan. „Jako partner danych, możemy dostarczyć pełne dane szkoleniowe dla wielu przypadków użycia, aby zapewnić, że modele sztucznej inteligencji działają dla wszystkich. Jest to kluczowe, aby zaangażować różnorodną grupę osób w produkcję, oznaczanie i walidację danych, aby upewnić się, że model szkoleniowy nie jest tylko sprawiedliwy, ale także zbudowany w sposób odpowiedzialny.”
Projekty Językowe Appen
Appen próbuje stworzyć różnorodne środowisko sztucznej inteligencji poprzez swoje różne projekty i partnerstwa, w tym:
- Partnerstwo z Translators without Borders (TWB): Appen nawiązało partnerstwo z TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) i Translated. Partnerstwo dołączyło do Inicjatywy Tłumaczeniowej dla COVID-19 (TICO-19), która próbowała rozszerzyć dostęp do informacji o COVID-19, wspierając rozwój technologii językowej w wielu językach. Należą do nich języki krajów rozwijających się, takie jak suahili kongijskie, tigrinia i fulfulde nigeryjskie.
- Projekt tłumaczenia na język francuski kanadyjski: Appen pomogło Microsoft dodać „francuski kanadyjski” jako opcję językową w Microsoft Translator po koordynacji z konsultantami językowymi.
- Projekt tłumaczenia na język inuktitucki: Appen współpracowało z rządem Nunavut, co doprowadziło do dodania języka inuktituckiego do Microsoft Translator. Język ten jest używany w arktycznej Kanadzie.
- Zestawy danych gotowych do użycia dla Afroamerykańskiej Odmiany Języka Angielskiego (AAVE): Przez pracę z użytkownikami AAVE i gromadzeniem danych dla zestawu danych gotowych do użycia, Appen próbuje stworzyć nowe zestawy danych szkoleniowych, które reprezentują AAVE.
Dr Judith Bishop jest starszym dyrektorem specjalistów sztucznej inteligencji w Appen.
„Sztuczna inteligencja oparta na tendencyjnych danych prowadzi do projektów, które mogą nie spełniać oczekiwań biznesowych i szkodzić osobom, którym mają pomóc”, powiedziała Dr Bishop. „Skala i złożoność projektów sztucznej inteligencji sprawia, że większość firm nie jest w stanie uzyskać niezakłóconych, wysokiej jakości danych bez partnerstwa z ekspertem od danych sztucznej inteligencji. Zobowiązanie Appen do tworzenia najbardziej różnorodnej i ekspertnej grupy anotatorów danych dostarcza branży wyraźnie różnicującego się zasobu do budowy sprawiedliwych i etycznych projektów sztucznej inteligencji.”
Appen jest wspomagany przez anotatorów danych szkoleniowych z ponad 170 krajów, a reprezentacje językowe obejmują 235 unikalnych języków i 395 dialektów. Oferuje również zestawy danych gotowych do użycia, które umożliwiają firmom szybsze uzyskanie wysokiej jakości danych szkoleniowych dla ich projektów sztucznej inteligencji.












