AI-modeller og plattformer
Appen Limited lanserer diverse treningsdatasett for NLP
Appen Limited, en ledende leverandør av høykvalitets treningsdata for bedrifter som ønsker å bygge AI-systemer i stor skala, lanserer nye diverse treningsdatasett for naturligspråklig prosessering (NLP)-initiativer. Disse datasettene vil enable slutbrukerne å motta samme erfaring uansett språkvarietet, dialekt, etnolect, aksent, rase eller kjønn.
Ifølge en rapport fra PNAS i mars 2020, viser populære automatiserte talegjenkjenningssystemer (ASR), spesielt de som brukes for virtuelle assistenter, lukket underteksting og håndfrie datamaskiner, ofte rasemessige forskjeller i ytelse. Mye av dette har å gjøre med at systemene er basert på forvrengte eller ufullstendige data, og dette er hvorfor det er så viktig å utvikle diverse treningssett.
Med den nye lanseringen, har Appen som mål å redusere ytelsesforskjellene og skape en mer inkluderende miljø for talegjenkjenningsteknologi. De samme typene utfordringer er til stede i språktolkning og NLP-systemer.
Mark Brayan er Appen-sjef.
“Kvaliteten og mangfoldet av treningsdata har direkte innvirkning på ytelsen og forvrengningen i AI-modellene,” sa Brayan. “Som en data-partner kan vi levere fullstendige treningsdata for mange bruksscenarier for å sikre at AI-modellene fungerer for alle. Det er kritisk at vi engasjerer et mangfoldig gruppe av individer for å produsere, merke og validerer dataene for å sikre at modellen som trenes ikke bare er rettferdig, men også bygget ansvarlig.”
Appen Språkprosjekter
Appen forsøker å skape et mangfoldig AI-miljø gjennom sine forskjellige prosjekter og samarbeid, inkludert:
- Translators without Borders (TWB)-samarbeid: Appen har samarbeidet med TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) og Translated. Samarbeidet har sluttet seg til Translation Initiative for COVID-19 (TICO-19), som forsøkte å utvide tilgangen til COVID-19-informasjon ved å støtte utviklingen av språkteknologi på flere språk. Disse inkluderer utviklingsland som Congolese Swahili, Tigrinya og Nigerian Fulfulde.
- Canadisk fransk oversettelsesprosjekt: Appen hjalp Microsoft med å legge til “canadisk fransk” som et språkvalg i Microsoft Translator etter å ha koordinert med native språkkonsulenter.
- Inuktitut-oversettelsesprosjekt: Appen samarbeidet med Nunavut-regjeringen, som hjalp til å få Microsoft til å legge til Inuktitut i Microsoft Translator. Det urbefolkede språket tales i den canadiske Arktis.
- Afrikansk-amerikansk vernakulær engelsk (AAVE) ferdig dataplasser: Ved å samarbeide med AAVE-talere og samle inn data for en ferdig dataplass basert på samtaler om ulike emner, forsøker Appen å lage nye treningsdatasett som representerer AAVE.
Dr. Judith Bishop er senior direktør for AI-eksperter i Appen.
“Forvrengt AI-data fører til prosjekter som kan mislykkes i å levere de forventede forretningsresultatene og skade individer de er ment å hjelpe,” sa Dr. Bishop. “Skalene og kompleksiteten av AI-prosjekter gjør det umulig for de fleste bedrifter å skaffe tilstrekkelig upartisk høykvalitetsdata uten å samarbeide med en AI-data-ekspert. Appens forpliktelse til å utvikle det mest mangfoldige og eksperterte crowd av data-annotatorer gir industrien en tydelig differensiert ressurs for å bygge rettferdige og etiske AI-prosjekter.”
Appen blir assistert av treningsdata-annotatorer fra over 170 land, og språkrepresentasjonene inkluderer 235 unike språk og 395 dialekter. Det tilbyr også ferdige dataplasser, som gjør det mulig for bedrifter å skaffe høykvalitets treningsdata raskere for sine AI-prosjekter.












