AI-modeller og platforme

Appen Limited Lancerer Diverse Træningsdata-Sæt Til NLP

mm
Føj Unite.AI til dine foretrukne kilder på Google

Appen Limited, en førende leverandør af højkvalitets træningsdata til virksomheder, der søger at bygge AI-systemer i stor skala, lancerer nye diverse træningsdata-sæt til naturligsproglige behandlingsinitiativer (NLP). Disse data-sæt vil ermögille slutbrugerne at få den samme oplevelse uanset sprogvariation, dialekt, etnolect, accent, race eller køn. 

Ifølge en rapport fra PNAS i marts 2020, viser populære automatiserede talegenkendelsessystemer, især dem, der bruges til virtuelle assistenter, lukket undertekstning og håndfri computing, ofte racemæssige uligheder i præstationen. Meget af dette skyldes, at systemerne er baseret på fordomsfulde eller ufuldstændige data, og det er derfor så vigtigt at udvikle diverse træningsdata-sæt. 

Med den nye lancering søger Appen at reducere præstationsforskellene og skabe en mere inklusiv miljø for talegenkendelsesteknologi. De samme udfordringer er til stede i sprogfortolkning og NLP-systemer. 

Mark Brayan er Appens administrerende direktør. 

“Kvaliteten og diversiteten af træningsdata påvirker direkte præstationen og fordomsfuldheden i AI-modeller,” sagde Brayan. “Som en data-partner kan vi levere komplet træningsdata til mange brugsområder for at sikre, at AI-modellerne fungerer for alle. Det er kritisk, at vi inddrager en divers gruppe af personer til at producere, mærke og validere data for at sikre, at modellen, der trænes, ikke kun er retfærdig, men også bygget ansvarligt.”

Appen Sprogprojekter

Appen forsøger at skabe en divers AI-miljø gennem sine forskellige projekter og partnerskaber, herunder: 

  • Translators without Borders (TWB) partnerskab: Appen har indgået et partnerskab med TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) og Translated. Partnerskabet har slutted sig til Translation Initiative for COVID-19 (TICO-19), som forsøgte at udvide adgangen til COVID-19-oplysninger ved at støtte udviklingen af sprogteknologi på flere sprog. Disse omfatter udviklingslande som Congolese Swahili, Tigrinya og Nigerian Fulfulde.

  • Canadisk fransk oversættelsesprojekt: Appen hjalp Microsoft med at tilføje “canadisk fransk” som et sprogvalg i Microsoft Translator efter at have koordineret med native sprogkonsulenter.
  • Inuktitut oversættelsesprojekt: Appen samarbejdede med Nunavut-regeringen, hvilket hjalp til at føre til, at Microsoft tilføjede Inuktitut til Microsoft Translator. Det indfødte sprog tales i den canadiske Arktis.

  • Afrikansk-amerikansk dialekt (AAVE) off-the-shelf data-sæt: Ved at arbejde med AAVE-talere og indsamle data til et off-the-shelf data-sæt baseret på samtaler om forskellige emner, forsøger Appen at skabe nye træningsdata-sæt, der repræsenterer AAVE. 

Dr. Judith Bishop er senior direktør for AI-specialister hos Appen.

“Forudindtaget AI-data fører til projekter, der kan fejle i at levere de forventede forretningsresultater og skade de personer, de er ment til at gavne,” sagde Dr. Bishop. “Skaleringen og kompleksiteten af AI-projekter gør det umuligt for de fleste virksomheder at erhverve tilstrækkeligt upartisk højkvalitetsdata uden at samarbejde med en AI-data-ekspert. Appens engagement i at udvikle den mest diverse og eksperimenterede crowd af data-annotatorer giver branchen en tydeligt differentieret ressource til at bygge retfærdige og etiske AI-projekter.”

Appen støttes af træningsdata-annotatorer fra over 170 lande, og sprogrepræsentationerne omfatter 235 unikke sprog og 395 dialekter. Det tilbyder også off-the-shelf (OTS) data-sæt, der giver virksomheder mulighed for at erhverve højkvalitets træningsdata hurtigere til deres AI-projekter.

Alex McFarland er en AI-journalist og forfatter, der udforsker de seneste udviklinger inden for kunstig intelligens. Han har samarbejdet med talrige AI-startups og publikationer verden over.