Modele și platforme AI

Appen Limited Lansează Seturi Diverse de Date de Antrenament pentru NLP

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Appen Limited, un furnizor de top de date de antrenament de înaltă calitate pentru companiile care doresc să construiască sisteme AI la scară largă, lansează noi seturi de date de antrenament diverse pentru inițiativele de procesare a limbajului natural (NLP). Aceste seturi de date vor permite utilizatorilor finali să primească aceeași experiență, indiferent de varietatea de limbă, dialect, etnolect, accent, rasă sau gen.

Conform unui raport al PNAS din martie 2020, sistemele automate de recunoaștere a vorbirii (ASR) populare, în special cele utilizate pentru asistenți virtuali, subtitrări și calcul fără mâini, prezintă adesea disparități rasiale în ceea ce privește performanța. Multe dintre acestea se datorează faptului că sistemele sunt bazate pe date biasate sau incomplete, și acesta este motivul pentru care este atât de important să se dezvolte seturi de date de antrenament diverse.

Prin lansarea aceasta, Appen își propune să reducă diferențele de performanță și să creeze un mediu mai incluziv pentru tehnologia de recunoaștere a vorbirii. Aceleași tipuri de provocări sunt prezente și în sistemele de interpretare a limbajului și NLP.

Mark Brayan este CEO-ul Appen.

“Calitatea și diversitatea datelor de antrenament au un impact direct asupra performanței și a prejudecăților prezente în modelele AI”, a declarat Brayan. “Ca partener de date, putem furniza date de antrenament complete pentru multe cazuri de utilizare, pentru a asigura că modelele AI funcționează pentru toată lumea. Este esențial să implicăm un grup divers de persoane pentru a produce, eticheta și valida datele, pentru a asigura că modelul care este antrenat nu numai că este echitabil, dar și construit în mod responsabil.”

Proiecte Lingvistice Appen

Appen încearcă să creeze un mediu AI divers prin proiectele și parteneriatele sale, inclusiv:

  • Parteneriatul cu Translators without Borders (TWB): Appen a încheiat un parteneriat cu TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) și Translated. Parteneriatul a aderat la Inițiativa de Traducere pentru COVID-19 (TICO-19), care a încercat să extindă accesul la informații despre COVID-19 prin sprijinirea dezvoltării tehnologiei lingvistice în multiple limbi. Printre acestea se numără țări în curs de dezvoltare, cum ar fi Swahili congolez, Tigrinya și Fulfulde nigerian.

  • Proiectul de traducere în franceză canadiană: Appen a ajutat Microsoft să adauge “franceză canadiană” ca opțiune de limbă în Microsoft Translator, după ce a coordonat cu consultanți de limbă nativi.
  • Proiectul de traducere în inuktitut: Appen a colaborat cu Guvernul Nunavut, ceea ce a condus la adăugarea de către Microsoft a limbii inuktitut în Microsoft Translator. Limba inuită este vorbită în Arcticul canadian.

  • Seturi de date off-the-shelf pentru engleza vernaculară africană americană (AAVE): Prin lucrul cu vorbitorii de AAVE și colectarea de date pentru un set de date off-the-shelf bazat pe conversații despre diverse subiecte, Appen încearcă să creeze noi seturi de date de antrenament care reprezintă AAVE.

Dr. Judith Bishop este Director Senior al Specialiștilor AI la Appen.

“Datele AI biasate duc la proiecte care pot să nu furnizeze rezultatele comerciale așteptate și pot să dăuneze indivizilor pe care ar trebui să îi ajute”, a declarat Dr. Bishop. “Scalabilitatea și complexitatea proiectelor AI fac ca este imposibil pentru majoritatea companiilor să obțină date de înaltă calitate și nebiasate fără a colabora cu un expert în date AI. Angajamentul Appen de a dezvolta cel mai divers și expert grup de annotatori de date oferă industriei o resursă clar diferențiată pentru construirea de proiecte AI corecte și etice.”

Appen este asistat de annotatori de date de antrenament din peste 170 de țări, iar reprezentările lingvistice includ 235 de limbi unice și 395 de dialecte. De asemenea, oferă seturi de date off-the-shelf (OTS), care permit companiilor să obțină date de antrenament de înaltă calitate mai rapid pentru proiectele lor AI.

Alex McFarland este un jurnalist și scriitor de inteligență artificială, care explorează cele mai recente dezvoltări în domeniul inteligenței artificiale. El a colaborat cu numeroase startup-uri de inteligență artificială și publicații din întreaga lume.