KI-Modelle und Plattformen
Speechmatics Launcht Autonome Spracherkennungs-Software
Das führende Startup für Spracherkennungstechnologie Speechmatics hat seine Software für „Autonome Spracherkennung“ veröffentlicht, die die neuesten Deep-Learning-Techniken und bahnbrechende Selbstüberwachungsmodelle verwendet. Das System hat gezeigt, dass es Amazon (AMZN ), Google (GOOGL ) und Microsoft übertrifft.
Stanfords Datensätze
Speechmatics basiert auf Datensätzen, die in Stanfords Studie „Rassische Ungleichheiten in der Spracherkennung“ gefunden wurden und erreichte eine Gesamtgenauigkeit von 82,8 % für afroamerikanische Stimmen. Zum Vergleich erreichte Google eine Genauigkeitsrate von 68,7 %, während Amazon 68,6 % erreichte.
Das Ausmaß der Genauigkeit entspricht einer Reduzierung der Spracherkennungsfehler um 45 %, was dem Äquivalent von drei Wörtern in einem durchschnittlichen Satz entspricht. Das neue Speechmatics-System ist nicht nur in dieser Hinsicht genau, sondern hat auch Verbesserungen in der Genauigkeit bei Akzenten, Alter, Dialekten und verschiedenen anderen soziodemografischen Merkmalen gezeigt.
Es gibt oft Missverständnisse in der Spracherkennung aufgrund der begrenzten Menge an beschrifteten Daten, die Algorithmen verwenden können, um sich selbst zu trainieren. Beschriftete Daten müssen von Menschen manuell klassifiziert werden, was zu einer geringeren Menge an Daten für diese Systeme führt. Dies begrenzt auch die Repräsentation aller Stimmen, was ein neues Set von Problemen schafft.
Training mit unbeschrifteten Daten
Speechmatics macht in dieser Hinsicht große Fortschritte, da seine Technologie auf großen Mengen an unbeschrifteten Daten trainiert wird, die direkt aus dem Internet stammen. Die Daten stammen aus Dingen wie Social-Media-Inhalten und Podcasts.
Selbstüberwachendes Lernen hat es dem System ermöglicht, auf 1,1 Millionen Stunden Audio trainiert zu werden, was eine Steigerung gegenüber den vorherigen 30.000 Stunden darstellt. Dies ermöglicht es, eine viel breitere Repräsentation von Stimmen zu haben und hilft, AI-Vorrechte und Fehler in der Spracherkennung zu reduzieren.
Wenn es um Kinderstimmen geht, hat Speechmatics auch gezeigt, dass es seine Konkurrenten übertrifft. Kinderstimmen sind für herkömmliche Spracherkennungstechnologie schwierig zu erkennen, aber Speechmatics erreichte eine Genauigkeitsrate von 91,8 %. Google erreichte nur 83,4 % und Deepgram 82,3 %.
Katy Wigdahl ist CEO von Speechmatics.
„Wir sind auf einer Mission, die nächste Generation von Machine-Learning-Fähigkeiten zu liefern und durch diese mehr inklusive und zugängliche Sprachtechnologie anzubieten. Diese Ankündigung ist ein großer Schritt auf dem Weg zur Erreichung dieser Mission.“
„Unser Fokus auf die Bekämpfung von AI-Vorrechten hat zu diesem monumentalen Fortschritt in der Spracherkennungsindustrie geführt und die Wellenwirkung wird zu Veränderungen in einer Vielzahl von verschiedenen Szenarien führen“, fuhr Wigdahl fort. „Denken Sie an die falschen Untertitel, die wir in sozialen Medien sehen, an Gerichtsverhandlungen, bei denen Wörter falsch transkribiert werden, und an eLearning-Plattformen, die während der Pandemie mit Kinderstimmen gekämpft haben. Fehler, die Menschen bisher akzeptieren mussten, können einen greifbaren Einfluss auf ihr tägliches Leben haben.”
Allison Zhu Koenecke ist Lead-Autorin der Stanford-Studie zur Spracherkennung.
„Es ist kritisch, die Fairness in Sprache-zu-Text-Systemen zu untersuchen und zu verbessern, angesichts des Potenzials für unterschiedlichen Schaden für Einzelpersonen durch nachgelagerte Sektoren, die von der Gesundheitsversorgung bis zur Strafjustiz reichen.”












