KI-Modelle und Plattformen

Appen Limited startet vielfältige Trainingsdatensätze für NLP

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Appen Limited, ein führender Anbieter von hochwertigen Trainingsdaten für Unternehmen, die auf skalierbare AI-Systeme setzen, startet neue vielfältige Trainingsdatensätze für Natural Language Processing (NLP)-Initiativen. Diese Datensätze ermöglichen es Endnutzern, unabhängig von Sprachvariante, Dialekt, Ethnolekt, Akzent, Rasse oder Geschlecht, die gleiche Erfahrung zu erhalten.

Laut einem Bericht von PNAS aus März 2020 zeigen populäre automatisierte Spracherkennungssysteme (ASR), insbesondere solche, die für virtuelle Assistenten, Untertitelung und handsfree-Computing verwendet werden, oft rassische Ungleichheiten in der Leistung. Viel davon hat mit den Systemen zu tun, die auf voreingenommenen oder unvollständigen Daten basieren, und deshalb ist es so wichtig, vielfältige Trainingsdatensätze zu entwickeln.

Mit dem neuen Start zielt Appen darauf ab, die Leistungsunterschiede zu reduzieren und eine inklusivere Umgebung für Spracherkennungstechnologie zu schaffen. Ähnliche Herausforderungen sind in Sprachinterpretation und NLP-Systemen vorhanden.

Mark Brayan ist CEO von Appen.

“Die Qualität und Vielfalt der Trainingsdaten haben direkt Auswirkungen auf die Leistung und Voreingenommenheit in AI-Modellen”, sagte Brayan. “Als Datenpartner können wir vollständige Trainingsdaten für viele Anwendungsfälle liefern, um sicherzustellen, dass AI-Modelle für jeden funktionieren. Es ist entscheidend, dass wir eine vielfältige Gruppe von Personen engagieren, um die Daten zu produzieren, zu beschriften und zu validieren, um sicherzustellen, dass das trainierte Modell nicht nur gerecht, sondern auch verantwortungsvoll aufgebaut ist.”

Appen-Sprachprojekte

Appen versucht, durch verschiedene Projekte und Partnerschaften eine vielfältige AI-Umgebung zu schaffen, darunter:

  • Partnerschaft mit Translators without Borders (TWB): Appen hat eine Partnerschaft mit TWB, Amazon (AMZN ), Carnegie Mellon University, Facebook (META ), Google (GOOGL ), Johns Hopkins University, Microsoft (MSFT ) und Translated geschlossen. Die Partnerschaft hat sich der Translation Initiative for COVID-19 (TICO-19) angeschlossen, die darauf abzielt, den Zugang zu COVID-19-Informationen durch die Unterstützung der Entwicklung von Sprachtechnologie in mehreren Sprachen zu erweitern. Dazu gehören die Entwicklung von Sprachen in Entwicklungsländern wie Congolese Swahili, Tigrinya und Nigerian Fulfulde.
  • Kanadisches Französisch-Übersetzungsprojekt: Appen half Microsoft, “Kanadisches Französisch” als Sprachoption in Microsoft Translator hinzuzufügen, nachdem es mit muttersprachlichen Sprachberatern koordiniert hatte.
  • Inuktitut-Übersetzungsprojekt: Appen arbeitete mit der Regierung von Nunavut zusammen, was dazu führte, dass Microsoft Inuktitut in Microsoft Translator hinzufügte. Die indigene Sprache wird in der kanadischen Arktis gesprochen.
  • Afroamerikanisches Vernakuläres Englisch (AAVE) -Datensätze: Durch die Zusammenarbeit mit AAVE-Sprechern und die Sammlung von Daten für einen OTS-Datensatz auf der Grundlage von Gesprächen über verschiedene Themen, versucht Appen, neue Trainingsdatensätze zu erstellen, die AAVE repräsentieren.

Dr. Judith Bishop ist Senior Director of AI Specialists bei Appen.

“Voreingenommene AI-Daten führen zu Projekten, die die erwarteten Geschäftsergebnisse nicht liefern und den Personen schaden, denen sie helfen sollen”, sagte Dr. Bishop. “Die Größe und Komplexität von AI-Projekten machen es für die meisten Unternehmen unmöglich, ohne die Partnerschaft mit einem AI-Daten-Experten ausreichend unvoreingenommene, hochwertige Daten zu beschaffen. Appens Engagement für die Entwicklung der vielfältigsten und erfahrensten Crowd von Daten-Annotatoren bietet der Branche eine klar differenzierte Ressource für die Erstellung von fairen und ethischen AI-Projekten.”

Appen wird von Trainingsdaten-Annotatoren aus über 170 Ländern unterstützt, und die Sprachrepräsentationen umfassen 235 einzigartige Sprachen und 395 Dialekte. Es bietet auch OTS-Datensätze an, die es Unternehmen ermöglichen, hochwertige Trainingsdaten für ihre AI-Projekte schneller zu erwerben.

Alex McFarland ist ein KI-Journalist und Schriftsteller, der die neuesten Entwicklungen im Bereich der künstlichen Intelligenz erforscht. Er hat mit zahlreichen KI-Startups und Veröffentlichungen weltweit zusammengearbeitet.