AI-modeller og plattformer

Appen Limited lanserer diverse treningsdatasett for NLP

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Appen Limited, en ledende leverandør av høykvalitets treningsdata for bedrifter som ønsker å bygge AI-systemer i stor skala, lanserer nye diverse treningsdatasett for naturligspråklig prosessering (NLP)-initiativer. Disse datasettene vil enable slutbrukerne å motta samme erfaring uansett språkvarietet, dialekt, etnolect, aksent, rase eller kjønn. 

Ifølge en rapport fra PNAS i mars 2020, viser populære automatiserte talegjenkjenningssystemer (ASR), spesielt de som brukes for virtuelle assistenter, lukket underteksting og håndfrie datamaskiner, ofte rasemessige forskjeller i ytelse. Mye av dette har å gjøre med at systemene er basert på forvrengte eller ufullstendige data, og dette er hvorfor det er så viktig å utvikle diverse treningssett. 

Med den nye lanseringen, har Appen som mål å redusere ytelsesforskjellene og skape en mer inkluderende miljø for talegjenkjenningsteknologi. De samme typene utfordringer er til stede i språktolkning og NLP-systemer. 

Mark Brayan er Appen-sjef. 

“Kvaliteten og mangfoldet av treningsdata har direkte innvirkning på ytelsen og forvrengningen i AI-modellene,” sa Brayan. “Som en data-partner kan vi levere fullstendige treningsdata for mange bruksscenarier for å sikre at AI-modellene fungerer for alle. Det er kritisk at vi engasjerer et mangfoldig gruppe av individer for å produsere, merke og validerer dataene for å sikre at modellen som trenes ikke bare er rettferdig, men også bygget ansvarlig.”

Appen Språkprosjekter

Appen forsøker å skape et mangfoldig AI-miljø gjennom sine forskjellige prosjekter og samarbeid, inkludert: 

  • Translators without Borders (TWB)-samarbeid: Appen har samarbeidet med TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) og Translated. Samarbeidet har sluttet seg til Translation Initiative for COVID-19 (TICO-19), som forsøkte å utvide tilgangen til COVID-19-informasjon ved å støtte utviklingen av språkteknologi på flere språk. Disse inkluderer utviklingsland som Congolese Swahili, Tigrinya og Nigerian Fulfulde.

  • Canadisk fransk oversettelsesprosjekt: Appen hjalp Microsoft med å legge til “canadisk fransk” som et språkvalg i Microsoft Translator etter å ha koordinert med native språkkonsulenter.
  • Inuktitut-oversettelsesprosjekt: Appen samarbeidet med Nunavut-regjeringen, som hjalp til å få Microsoft til å legge til Inuktitut i Microsoft Translator. Det urbefolkede språket tales i den canadiske Arktis.

  • Afrikansk-amerikansk vernakulær engelsk (AAVE) ferdig dataplasser: Ved å samarbeide med AAVE-talere og samle inn data for en ferdig dataplass basert på samtaler om ulike emner, forsøker Appen å lage nye treningsdatasett som representerer AAVE. 

Dr. Judith Bishop er senior direktør for AI-eksperter i Appen.

“Forvrengt AI-data fører til prosjekter som kan mislykkes i å levere de forventede forretningsresultatene og skade individer de er ment å hjelpe,” sa Dr. Bishop. “Skalene og kompleksiteten av AI-prosjekter gjør det umulig for de fleste bedrifter å skaffe tilstrekkelig upartisk høykvalitetsdata uten å samarbeide med en AI-data-ekspert. Appens forpliktelse til å utvikle det mest mangfoldige og eksperterte crowd av data-annotatorer gir industrien en tydelig differensiert ressurs for å bygge rettferdige og etiske AI-prosjekter.”

Appen blir assistert av treningsdata-annotatorer fra over 170 land, og språkrepresentasjonene inkluderer 235 unike språk og 395 dialekter. Det tilbyr også ferdige dataplasser, som gjør det mulig for bedrifter å skaffe høykvalitets treningsdata raskere for sine AI-prosjekter.

Alex McFarland er en AI-journalist og forfatter som utforsker de nyeste utviklingene innen kunstig intelligens. Han har samarbeidet med tallrike AI-startups og publikasjoner verden over.