AI-modeller och plattformar

Appen Limited Lanserar Mångfaldiga Träningsdatauppsättningar för NLP

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Appen Limited, en ledande leverantör av högkvalitativa träningsdata för företag som vill bygga AI-system i stor skala, lanserar nya mångfaldiga träningsdataset för naturalspråksbehandling (NLP)-initiativ. Dessa dataset kommer att möjliggöra för slutanvändare att få samma upplevelse oavsett språkvariation, dialekt, etnolekt, accent, ras eller kön. 

Enligt en rapport från PNAS i mars 2020, visar populära automatiserade taligenkänningssystem, särskilt de som används för virtuella assistenter, undertextning och handsfree-datorer, ofta rasrelaterade skillnader i prestanda. Mycket av detta beror på att systemen bygger på fördomsfulla eller ofullständiga data, och därför är det så viktigt att utveckla mångfaldiga träningsuppsättningar. 

Med den nya lanseringen syftar Appen till att minska prestandaskillnaderna och skapa en mer inkluderande miljö för taligenkänningsteknik. Samma typer av utmaningar finns närvarande i språktolkning och NLP-system. 

Mark Brayan är Appens VD. 

“Kvaliteten och mångfalden på träningsdata påverkar direkt prestandan och fördomar i AI-modeller”, sa Brayan. “Som en datapartner kan vi tillhandahålla komplett träningsdata för många användningsfall för att säkerställa att AI-modellerna fungerar för alla. Det är avgörande att vi engagerar en mångfaldig grupp av individer för att producera, märka och validera data för att säkerställa att modellen som tränas inte bara är rättvis, utan också byggd på ett ansvarsfullt sätt.”

Appen Language Projects

Appen försöker skapa en mångfaldig AI-miljö genom sina olika projekt och partnerskap, inklusive: 

  • Translators without Borders (TWB) partnerskap: Appen har samarbetat med TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) och Translated. Partnerskapet har anslutit sig till Translation Initiative for COVID-19 (TICO-19), som försökte utöka tillgången till COVID-19-information genom att stödja utvecklingen av språkteknologi på flera språk. Dessa inkluderar utvecklingsländer som Congolese Swahili, Tigrinya och Nigerian Fulfulde.

  • Kanadensisk franska översättningsprojekt: Appen hjälpte Microsoft att lägga till “Kanadensisk franska” som ett språkalternativ i Microsoft Translator efter att ha samarbetat med infödda språkkonsulter.
  • Inuktitut översättningsprojekt: Appen samarbetade med Nunavut-regeringen, vilket ledde till att Microsoft lade till Inuktitut i Microsoft Translator. Det inhemska språket talas i den kanadensiska arktis.

  • Afroamerikansk variativ engelska (AAVE) färdiga dataset: Genom att arbeta med AAVE-talare och samla in data för ett färdigt dataset baserat på samtal om olika ämnen, försöker Appen skapa nya träningsdataset som representerar AAVE. 

Dr. Judith Bishop är Senior Director of AI Specialists på Appen.

“Fördomsfull AI-data leder till projekt som kan misslyckas med att leverera de förväntade affärsresultaten och skada de individer de är tänkta att gynna”, sa Dr. Bishop. “Skalan och komplexiteten i AI-projekt gör det omöjligt för de flesta företag att skaffa tillräckligt mycket obiaserad högkvalitativ data utan att samarbeta med en AI-dataexpert. Appens åtagande att utveckla den mest mångfaldiga och experterna på dataannotatorer ger branschen en tydligt differentierad resurs för att bygga rättvisa och etiska AI-projekt.”

Appen assisteras av träningsdataannotatorer från över 170 länder, och språkrepresentationerna inkluderar 235 unika språk och 395 dialektala variationer. Det erbjuder också färdiga dataset, som möjliggör för företag att skaffa högkvalitativ träningsdata snabbare för sina AI-projekt.

Alex McFarland är en AI-journalist och författare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med många AI-startups och publikationer över hela världen.