Modele i platformy AI

Speechmatics uruchamia oprogramowanie do rozpoznawania mowy w trybie autonomicznym

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wiodący startup technologiczny zajmujący się rozpoznawaniem mowy Speechmatics uruchomił oprogramowanie „Autonomiczne Rozpoznawanie Mowy”, które wykorzystuje najnowsze techniki głębokiego uczenia się i przełomowe modele samouczące. System wykazał zdolność do przewyższenia Amazon (AMZN ), Google (GOOGL ) i Microsoft.

Zestawy danych Stanford

Speechmatics opiera się na zestawach danych znalezionych w badaniu Stanford „Rasowe dysproporcje w rozpoznawaniu mowy” i osiągnął ogólną dokładność 82,8% dla głosów Afroamerykanów. Dla porównania Google osiągnęło wskaźnik dokładności 68,7%, a Amazon 68,6%.

Poziom dokładności odpowiada 45% redukcji błędów rozpoznawania mowy, co jest równoznaczne z trzema słowami w przeciętnym zdaniu. Nowy system Speechmatics nie tylko jest dokładny w tym zakresie, ale również wykazał poprawę dokładności w przypadku akcentów, wieku, dialektów i innych cech socjodemograficznych.

Często występuje niezrozumienie w rozpoznawaniu mowy ze względu na ograniczoną ilość oznaczonych danych, których algorytmy mogą użyć do samouczenia. Oznaczone dane wymagają ręcznej klasyfikacji przez ludzi, co skutkuje mniejszą ilością dostępnych danych dla tych systemów. To również ogranicza reprezentację wszystkich głosów, co tworzy nowy zestaw problemów.

Szkolenie na nieoznaczonych danych

Speechmatics robi duże postępy w tym zakresie, ponieważ jego technologia jest szkolona na ogromnych ilościach nieoznaczonych danych pochodzących bezpośrednio z Internetu. Dane pochodzą z rzeczy takich jak treści w mediach społecznościowych i podcasty.

Samouczące się umożliwiło systemowi szkolenie na 1,1 miliona godzin audio, co stanowi wzrost w porównaniu z poprzednimi 30 000 godzinami. To pozwala mu mieć znacznie szerszy zakres reprezentacji głosów i pomaga zmniejszyć błędy i uprzedzenia w rozpoznawaniu mowy.

W przypadku głosów dziecięcych Speechmatics również wykazał zdolność do przewyższenia konkurentów. Głosy dziecięce są trudne do rozpoznania za pomocą tradycyjnej technologii rozpoznawania mowy, ale Speechmatics zdołał osiągnąć wskaźnik dokładności 91,8%. Google osiągnęło 83,4%, a Deepgram 82,3%.

Katy Wigdahl jest dyrektorem generalnym Speechmatics.

„Jesteśmy na misji, aby dostarczyć następną generację możliwości uczenia maszynowego, a dzięki temu zaoferować bardziej inkluzywną i dostępną technologię mowy. To ogłoszenie jest ogromnym krokiem w kierunku realizacji tej misji.”

„Nasza koncentracja na zwalczaniu uprzedzeń w sztucznej inteligencji doprowadziła do tego przełomowego postępu w branży rozpoznawania mowy, a efekt domina doprowadzi do zmian w wielu różnych sytuacjach”, kontynuował Wigdahl. „Pomyśl o błędnych napisach, które widzimy w mediach społecznościowych, przesłuchaniach sądowych, gdzie słowa są błędnie transkrybowane, i platformach e-learningowych, które miały problemy z głosami dzieci w czasie pandemii. Błędy, które ludzie musieli zaakceptować do tej pory, mogą mieć namacalny wpływ na ich codzienne życie.”

Allison Zhu Koenecke jest głównym autorem badania Stanford na temat rozpoznawania mowy.

„Jest to krytyczne, aby badać i poprawiać sprawiedliwość w systemach rozpoznawania mowy, biorąc pod uwagę potencjalną szkodę dla jednostek w różnych sektorach, od opieki zdrowotnej po wymiar sprawiedliwości.”

Alex kieruje operacjami informacyjnymi Unite.AI opartymi na sztucznej inteligencji, łącząc dziennikarstwo, badania i automatyzację, aby wspierać terminowe i skalowalne relacjonowanie sztucznej inteligencji. Jego praca pomaga zapewnić, że nowe osiągnięcia w dziedzinie AI są prezentowane efektywnie, przy jednoczesnym zachowaniu standardów redakcyjnych publikacji.