Modely a platformy AI

Appen Limited Spouští Rozmanité Sady Trénovacích Dat Pro NLP

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Appen Limited, přední poskytovatel vysoce kvalitních trénovacích dat pro společnosti, které chtějí budovat systémy umělé inteligence ve velkém měřítku, spouští nové rozmanité sady trénovacích dat pro iniciativy zpracování přirozeného jazyka (NLP). Tyto sady dat umožní koncovým uživatelům získat stejnou zkušenost bez ohledu na jazykovou variaci, dialekt, etnolekt, přízvuk, rasu nebo pohlaví.

Podle zprávy PNAS z března 2020 často vykazují populární automatizované systémy rozpoznávání řeči (ASR), zejména ty, které se používají pro virtuální asistenty, uzavřené titulky a bezdotykové počítačové systémy, rasové rozdíly ve výkonu. Velká část tohoto je způsobena tím, že tyto systémy jsou založeny na předpojatých nebo neúplných datech, a proto je tak důležité vyvinout rozmanité sady trénovacích dat.

Se spuštěním nových sad dat se Appen snaží snížit rozdíly ve výkonu a vytvořit více inkluzivní prostředí pro technologii rozpoznávání řeči. Stejné typy výzev jsou přítomny v systémech interpretace jazyka a NLP.

Mark Brayan je generální ředitel Appen.

“Kvalita a rozmanitost trénovacích dat přímo ovlivňují výkon a předpojatost modelů umělé inteligence,” řekl Brayan. “Jako partner pro data můžeme poskytnout úplná trénovací data pro mnoho případů použití, aby zajistili, že modely umělé inteligence fungují pro každého. Je kritické, aby jsme zapojili rozmanitou skupinu jednotlivců, aby produkovali, označovali a ověřovali data, aby zajistili, že model, který je trénován, není pouze spravedlivý, ale také postavený zodpovědně.”

Projekty Jazyka Appen

Appen se snaží vytvořit rozmanité prostředí umělé inteligence prostřednictvím svých různých projektů a partnerství, včetně:

  • Partnerství s Translators without Borders (TWB): Appen se spojil s TWB, Amazonem, Carnegie Mellon University, Facebookem, Googlem, Johns Hopkins University, Microsoftem a Translated. Partnerství se připojilo k Translation Initiative for COVID-19 (TICO-19), která se snažila rozšířit přístup k informacím o COVID-19 podporou vývoje jazykových technologií v mnoha jazycích. Tyto zahrnují rozvojové země, jako je konžský swahilština, tigrinština a nigerijský fulfulde.
  • Projekt překladu kanadské francouzštiny: Appen pomohl Microsoftu přidat “kanadskou francouzštinu” jako jazykovou možnost do Microsoft (MSFT ) Translator po koordinaci s rodilými jazykovými konzultanty.
  • Projekt překladu inuktitutštiny: Appen spolupracoval s vládou Nunavut, což vedlo k tomu, že Microsoft přidala inuktitutštinu do Microsoft Translator. Tento domorodý jazyk se mluví v kanadské Arktidě.
  • Sady dat African American Vernacular English (AAVE): Pracováním s mluvčími AAVE a shromažďováním dat pro sadu OTS založenou na konverzacích o různých tématech se Appen snaží vytvořit nové sady trénovacích dat, které reprezentují AAVE.

Dr. Judith Bishop je Senior Director of AI Specialists v Appen.

“Předpojatá data umělé inteligence vedou k projektům, které mohou selhat ve svých očekávaných obchodních výsledcích a poškodit osoby, kterým mají pomoci,” řekla Dr. Bishop. “Rozsah a složitost projektů umělé inteligence činí nemožným pro většinu společností získat dostatečná nezávislá vysokokvalitní data bez partnerství s odborníkem na data umělé inteligence. Závazek Appen k vývoji nejrozmanitějších a nejobsáhlejších sad dat poskytne průmyslu jasně odlišený zdroj pro budování spravedlivých a etických projektů umělé inteligence.”

Appen je podporován trénovacími daty annotátory z více než 170 zemí, a jazykové zastoupení zahrnuje 235 jedinečných jazyků a 395 dialektů. Nabízí také sady OTS, které umožňují podnikům získat vysokokvalitní trénovací data rychleji pro své projekty umělé inteligence.

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.