Modelli e piattaforme di IA

Appen Limited Lancia Set di Dati di Formazione Diversificati per NLP

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Appen Limited, principale fornitore di dati di formazione di alta qualità per aziende che intendono costruire sistemi di intelligenza artificiale su larga scala, lancia nuovi set di dati di formazione diversificati per iniziative di elaborazione del linguaggio naturale (NLP). Questi set di dati consentiranno agli utenti finali di ricevere la stessa esperienza indipendentemente dalla varietà di lingua, dialetto, etnoletto, accento, razza o genere.

Secondo un rapporto di PNAS del marzo 2020, i sistemi di riconoscimento vocale automatizzato (ASR) più diffusi, in particolare quelli utilizzati per assistenti virtuali, sottotitoli e calcolatori senza mani, spesso presentano disparità razziali nelle prestazioni. Gran parte di ciò è dovuta al fatto che i sistemi si basano su dati distorti o incompleti, ed è per questo che è fondamentale sviluppare set di dati di formazione diversificati.

Con il nuovo lancio, Appen mira a ridurre le differenze di prestazioni e creare un ambiente più inclusivo per la tecnologia di riconoscimento vocale. Gli stessi tipi di sfide sono presenti nell’interpretazione linguistica e nei sistemi NLP.

Mark Brayan è l’amministratore delegato di Appen.

“La qualità e la diversità dei dati di formazione hanno un impatto diretto sulle prestazioni e sulla presenza di pregiudizi nei modelli di intelligenza artificiale”, ha dichiarato Brayan. “In quanto partner dei dati, possiamo fornire dati di formazione completi per molti casi d’uso, garantendo che i modelli di intelligenza artificiale funzionino per tutti. È fondamentale che coinvolgiamo un gruppo diversificato di individui per produrre, etichettare e convalidare i dati, in modo da garantire che il modello in formazione non sia solo equo, ma anche costruito in modo responsabile.”

Progetti Linguistici Appen

Appen tenta di creare un ambiente di intelligenza artificiale diversificato attraverso i suoi progetti e partnership, tra cui:

  • Partnership con Translators without Borders (TWB): Appen ha collaborato con TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) e Translated. La partnership ha aderito all’Iniziativa di Traduzione per COVID-19 (TICO-19), che ha tentato di ampliare l’accesso alle informazioni su COVID-19 supportando lo sviluppo della tecnologia linguistica in molte lingue. Tra queste ci sono paesi in via di sviluppo come il Congo, la Nigeria e l’Eritrea.
  • Progetto di traduzione in francese canadese: Appen ha aiutato Microsoft ad aggiungere il “francese canadese” come opzione linguistica in Microsoft Translator dopo aver coordinato con consulenti linguistici nativi.
  • Progetto di traduzione in inuktitut: Appen ha collaborato con il governo del Nunavut, il che ha portato Microsoft ad aggiungere l’inuktitut a Microsoft Translator. La lingua indigena è parlata nel Canada artico.
  • Set di dati pronti all’uso per l’inglese vernacolare afroamericano (AAVE): Lavorando con speaker di AAVE e raccogliendo dati per un set di dati pronti all’uso basato su conversazioni su vari argomenti, Appen tenta di creare nuovi set di dati di formazione che rappresentino l’AAVE.

La dottoressa Judith Bishop è Senior Director of AI Specialists presso Appen.

“I dati di intelligenza artificiale distorti portano a progetti che possono non raggiungere i risultati aziendali previsti e danneggiare gli individui che dovrebbero aiutare”, ha dichiarato la dottoressa Bishop. “La scala e la complessità dei progetti di intelligenza artificiale rendono impossibile per la maggior parte delle aziende acquisire dati di alta qualità e imparziali senza collaborare con un esperto di dati di intelligenza artificiale. L’impegno di Appen nello sviluppo del gruppo di annotatori di dati più diversificato e competente fornisce all’industria una risorsa chiaramente differenziata per la costruzione di progetti di intelligenza artificiale equi e responsabili.”

Appen è supportata da annotatori di dati di formazione di oltre 170 paesi, e le rappresentazioni linguistiche includono 235 lingue uniche e 395 dialetti. Offre inoltre set di dati pronti all’uso (OTS), che consentono alle aziende di acquisire dati di formazione di alta qualità più rapidamente per i loro progetti di intelligenza artificiale.

Alex McFarland è un giornalista e scrittore di intelligenza artificiale che esplora gli ultimi sviluppi nel campo dell'intelligenza artificiale. Ha collaborato con numerose startup di intelligenza artificiale e pubblicazioni in tutto il mondo.